图像抠像参考
图像抠像(image matting)的目标是从自然图像中提取精确的 alpha 蒙版——一张 [0,1] 连续的软透明度图,标注每个像素属于前景的程度 #Li et al. 2023。它和「轮廓提取」是同一件事的两种精度:二值边缘图给出轮廓的「在哪」,而 α 蒙版给出轮廓的「多软」——发丝、毛发、透明物边缘这些 transition area 才是抠像真正要解的地方。
本综述的定位很明确:在深度学习兴起之后,第一篇系统总结 image matting 的综述 #Li et al. 2023。之前的 survey(如 Li2019ASO、Boda2018ASO、Yao2017ACS、Wang2007ImageAV)几乎只覆盖传统方法——color sampling、affinity propagation、及其混合 #Li et al. 2023。这些方法依赖低层颜色/结构特征,在复杂背景下难以区分前景细节,且对 trimap 中未知区域的大小极其敏感。深度学习的引入不仅提升了精度,还催生了全新的任务设定:interactive matting、click-based matting、referring/text matting,以及完全不需要辅助输入的 automatic matting #Li et al. 2023。
综述的四条贡献
- 首次系统综述深度学习时代的 image matting 方法;
- 从输入/输出形式、网络结构、benchmark 数据集三个视角梳理进展;
- 对代表方法做公平定量评测,并分析模型复杂度(参数量 / 计算量 / 速度);
- 讨论应用场景,指出挑战与未来方向(含扩散模型对 matting 的开放问题)。
综述维护了一个持续更新的公开仓库 JizhiziLi/matting-survey,追踪该领域的快速迭代 #Li et al. 2023。下面我们按它的章节顺序,把可查的骨架信息提取出来。
图像抠像的数学形式由 Porter & Duff 在 1984 年正式化(合成代数 compositing algebra),其历史可追溯到 1960s 电影工业的 travelling-matte problem #Li et al. 2023。核心方程是「前景-背景的凸组合」:
Matting 方程 (Eq.1)
其中 \(I_i\) 是第 \(i\) 个像素的观测 RGB 颜色,\(F_i\) 是前景颜色,\(B_i\) 是背景颜色,\(\alpha_i\) 是该像素属于前景的不透明度(opacity)。#Li et al. 2023
这个方程的麻烦在于:已知 \(I\)(3 通道),未知 \(F\)、\(B\)、\(\alpha\)(3+3+1=7 个未知量),3 个方程解 7 个未知数——严重欠定 #Li et al. 2023。因此:
- \(\alpha_i = 1\) → 纯前景 / definite foreground(definite FG);
- \(\alpha_i = 0\) → 纯背景 / definite background(definite BG);
- \(0 < \alpha_i < 1\) → 未知区域 / transition area,即发丝、毛发、透明物边缘等真正需要解的像素。
综述用一个三维 taxonomy 组织所有方法:输入模态(用什么辅助信息)、抠像目标(抠什么)、方法范式(网络怎么搭)。前两维决定「问题设定」,第三维决定「解决方案结构」 #Li et al. 2023。
维度一 · 输入模态
对需要辅助输入的方法,模态包括:RGB + trimap(三态图,标 definite FG / BG / unknown,最常用)、RGB + 背景图(用户预先拍一张背景)、RGB + coarse map(粗分割图)、RGB + user click、RGB + flexible 输入(scribble 等)、RGB + 文本描述(language/referring)。自动方法则只有单张 RGB 图像 #Li et al. 2023。
维度二 · 抠像目标
理论上没有限制,但受训练数据约束。主流目标:人像 / portrait(DAPM、SHM、MODNet、P3M、BM)、动物(GFM)、透明物体(TOM-Net、TransMatting)、通用物体(HATT、LF、AIM)。AIM 进一步把目标分为三类——salient opaque / salient transparent / non-salient——是一种典型目标 taxonomy #Li et al. 2023。
维度三 · 方法范式(两轨 × 三型)
这是综述最有结构感的部分。方法分两大轨——辅助输入轨与自动轨——每轨各分三型网络结构:
辅助输入轨 · 三型架构
- (a) One-stage:把图像与辅助输入拼接,过一个 CNN 直接出 alpha。代表:DIM(VGG-16 U-net)#DIM 2017、AlphaGAN(+GAN)、MatteFormer(Swin Transformer)#MatteFormer 2022、FBA(ResNet-50,输出 7 通道=α+FG+BG)#FBA 2020。
- (b) One-stage + outsider module:单主干 + 专门处理辅助信息的旁支模块。代表:IndexNet(动态预测下采样 indices 保细节)#IndexNet 2019、GCA(全局传播 opacity)#GCA 2020、SIM(patch 语义分类)、Matting-GP(高斯过程)。
- (c) Multi-stream:多编码器分别处理不同层级信息,再融合。代表:AdaMatting(adapted trimap+alpha,并行两流+refine)#AdaMatting 2019、Context-Aware(FG+alpha)#Context-Aware 2019、HDMatt、TIMI-Net(三分支)、LFPNet、RMat(transformer 上下文+conv 细节)。
自动轨 · 三型架构
- (a) One-stage + optional global guidance:单网络直接出 alpha,可选全局指导模块。代表:HATT(ResNeXt+通道/空间注意力)、MODNet(MobileNetV2 主干+轻量指导,实时)#MODNet 2020、CasDGR(GNN 优化)。
- (b) Sequential two-step:先出中间表示(trimap / coarse map / FG-BG / depth / albedo-shading-specular),再第二阶段抠像。代表:DAPM(FCN-8s 出 trimap)#DAPM 2016、SHM(PSPNet-50 出 trimap)、FDM、SHMC、HIM(MGMatting 二阶段)、TOM-Net(透明物 albedo/shading/specular)#TOM-Net 2018。
- (c) Encoder-sharing multi-decoder:共享编码器 + 多 decoder 分解子任务(语义+抠像),最后硬融合。代表:GFM(DenseNet/ResNet 共享编码,PPM 全局+bridge 局部)#GFM 2022、AIM-Net(spatial attention 指导 matting decoder)、P3M-Net、P3M-ViTAE(ViTAE transformer 共享编码)#P3M-ViTAE 2023。
这条「减人工、增自动化」的演进线对视频轮廓提取尤其重要:视频不能逐帧标 trimap,自动架构(尤其 encoder-sharing 多 decoder)是视频 matting / 视频轮廓模型的主流骨架来源。
综述 Table I 按年代列出全部 69 篇方法(年/方法/会议/模态/自动性/目标/架构/train/test)。下表摘出最具结构意义的里程碑——它们定义了某条新路线的起点 #Li et al. 2023。
| 年份 | 方法 | 会议 | 模态 | 自动 | 架构型 | 意义 |
|---|---|---|---|---|---|---|
| 2016 | DAPM | ECCV'16 | RGB | ✓ | Sequential two-step | 首个深度人像自动抠像(先 FCN-8s 出 trimap)#DAPM 2016 |
| 2016 | DCNN | ECCV'16 | RGB-Coarse | ✗ | One-stage CNN | 首个合成数据集 + coarse 输入 |
| 2017 | DIM | CVPR'17 | RGB-Trimap | ✗ | One-stage+Refine | 首个 deep trimap-based,VGG-16 U-net,DIM-481 数据集 #DIM 2017 |
| 2018 | TOM-Net | CVPR'18 | RGB | ✓ | Sequential+Refine | 透明物体抠像(albedo/shading/specular)#TOM-Net 2018 |
| 2018 | AlphaGAN | BMVC'18 | RGB-Trimap | ✗ | One-stage GAN | 引入对抗损失 |
| 2019 | IndexNet | ICCV'19 | RGB-Trimap | ✗ | One-stage | 动态 indices 保细节 #IndexNet 2019 |
| 2019 | AdaMatting | ICCV'19 | RGB-Trimap | ✗ | Parallel two-stream+Refine | 多任务损失,disentangle trimap/alpha #AdaMatting 2019 |
| 2019 | Context-Aware | ICCV'19 | RGB-Trimap | ✗ | Two-stream | 首引 Laplacian loss + 数据增广抗合成伪影 #Context-Aware 2019 |
| 2020 | GCA | AAAI'20 | RGB-Trimap | ✗ | One-stage | 全局 affinity 传播 opacity #GCA 2020 |
| 2020 | BM / BMV2 | CVPR'20 | RGB-Background | ✗ | Parallel four-stream / One-stage+Refiner | 背景辅助人像,PhotoMatte13k 数据集 #BMV2 2020 |
| 2020 | MODNet | AAAI'22 | RGB | ✓ | Parallel two-stream | MobileNetV2 实时人像,无 trimap #MODNet 2020 |
| 2020 | GFM | IJCV'22 | RGB | ✓ | Parallel two-stream | 动物抠像,AM-2k 数据集,RSSN 抗合成伪影,MAD/SAD-T 指标 #GFM 2022 |
| 2020 | FBA | arXiv'20 | RGB-Trimap | ✗ | One-stage | ResNet-50 出 7 通道(α+FG+BG)#FBA 2020 |
| 2021 | AIM-Net | IJCAI'21 | RGB | ✓ | Parallel two-stream | 三类目标分类(salient opaque/transparent/non-salient)+ AIM-500 自然测试集 #AIM 2021 |
| 2022 | MatteFormer | CVPR'22 | RGB-Trimap | ✗ | One-stage Transformer | Swin Transformer 首入 matting,细节最强 #MatteFormer 2022 |
| 2022 | RIM | CVPR'22 | RGB-Language | ✗ | Parallel Transformer | Referring matting(文本驱动)+ RefMatte 数据集 #RIM 2022 |
| 2022 | TransMatting | ECCV'22 | RGB-Trimap | ✗ | One-stage Transformer | 透明物 transformer,trimap-guided block |
| 2023 | P3M-ViTAE | IJCV'23 | RGB | ✓ | Parallel Transformer | ViTAE transformer 自动人像,长程依赖最强 #P3M-ViTAE 2023 |
从里程碑可读出三条演进脉络:① 骨干换代——VGG → ResNet → MobileNet → Swin/ViTAE Transformer,transformer 在 2022 后逐步主导;② 辅助输入减负——trimap → click/scribble → background → 完全自动(单 RGB);③ 目标泛化——人像 → 透明物 → 动物 → 通用三分类 → 多模态(文本)。这三条线都直接映射到「视频轮廓提取」的关注点:骨干决定能否实时、自动化程度决定能否上视频、目标泛化决定模型迁移能力。
深度方法依赖高质量标注。但精确的 α 蒙版标注极其昂贵,所以数据集分两条路:合成(从简单背景抠前景 + alpha blending 合成到复杂背景)与自然(真实图像 + 手工标注 α)#Li et al. 2023。
合成数据集
合成路线的优势是量大——每个前景可拼 20–100 张背景。但合成图像与真实图像之间存在 composition artifacts(前景背景分辨率/噪声/光照不匹配),导致训练模型在自然图上泛化差 #GFM 2022。缓解策略包括:Context-Aware 的 re-JPEG+Gaussian blur #Context-Aware 2019、GFM 的 RSSN 合成路线(统一分辨率/锐度/噪声/光照)#GFM 2022、BM 的自监督从无标签真实数据学习 #BMV2 2020、MODNet 的子目标一致性 fine-tune #MODNet 2020、RMat 的强增广(线/非线像素增广+区域增广)。
自然数据集
自然数据集避免合成伪影,但受限于标注成本,规模小且多聚焦单类。下表汇总两类代表(survey Table II 摘录)#Li et al. 2023:
| 数据集 | 会议 | 自然 | 目标 | 分辨率 | 训练 | 测试 | 意义 |
|---|---|---|---|---|---|---|---|
| AlphaMatting | CVPR'09 | 合成基准 | object | 3k×2k | 27 | 8 | 首个 matting benchmark,提供在线评测 #AlphaMatting 2009 |
| DIM-481 | CVPR'17 | 合成 | object | 1.3k×1.1k | 431 | 50 | 最广泛使用的 trimap 训练集 #DIM 2017 |
| SHM-35k | MM'18 | 自然 | human | - | 52,511 | 1,400 | 大规模自然人像(不公开) |
| P3M-10k | MM'21 | 自然 | human | 1.3k×1.3k | 9,421 | 1,000 | 首个隐私保护人像数据集 #P3M-ViTAE 2023 |
| AM-2k | IJCV'22 | 自然 | animal | 1.5k×1.2k | 1,800 | 200 | 首个动物 matting 数据集(20 类)#GFM 2022 |
| AIM-500 | IJCAI'21 | 自然 | object | 1.4k×1.3k | - | 500 | 首个自然图通用测试集 #AIM 2021 |
| RWP-636 | CVPR'21 | 自然 | human | 1k×1.3k | - | 636 | 含 detail map 标注挑战区 |
| PhotoMatte85 | CVPR'20 | 自然 | human | 2.3k×3.5k | - | 85 | 高分真实人像测试集 #BMV2 2020 |
| RefMatte | CVPR'23 | 合成 | object | 1.5k×1.2k | 45,000 | 2,500 | 文本描述标注,referring matting benchmark #RIM 2022 |
综述 Table III 系统列出 matting 用的九类损失,并在 §5.2 定义四个评测指标。这是做视频轮廓提取评估时可直接复用的工具箱。
训练损失(九类)
最核心的是 α-loss,对每个像素的预测 α 与 GT α 求 L1(带 ε 防不可导):
Alpha Loss (Eq.2)
权重 \(W_\alpha^i\) 在 transition area 设 1、definite FG/BG 设 0(辅助方法);自动方法全图设 1。#DIM 2017
其余八类:Composition loss(对合成 RGB \(C_g\) 求 L1)、MSE loss、Cross-entropy(中间表示分类)、Laplacian loss(5 级拉普拉斯金字塔,Context-Aware 首引 #Context-Aware 2019)、Gradient loss(L1 梯度幅度差,治模糊边界)、Adversarial loss、Multi-task loss(AdaMatting 用 Kendall 不确定性加权 #AdaMatting 2019)、SSIM loss(HATT 用)#Li et al. 2023。
评测指标(四个核心)
| 指标 | 全称 | 含义 | 提出者/用途 |
|---|---|---|---|
| SAD | Sum of Absolute Difference | 预测 α 与 GT α 的绝对差之和 | 最通用,越小越好 #Li et al. 2023 |
| SAD-T | SAD in Transition areas | 仅 transition area 内的 SAD | GFM 提出,专测细节 #GFM 2022 |
| MSE / MAD | Mean Squared Error / Mean Absolute Difference | 均方差 / 归一化绝对差 | MAD 归一化图像尺寸,利跨数据集 #GFM 2022 |
| GRAD | Gradient error | 一阶高斯导数滤波后梯度差异 | alphamatting.com 提出,测边界锐度 #AlphaMatting 2009 |
| CONN | Connectivity error | 二值阈值图的 FG-BG 连通性差异 | alphamatting.com,受 Rosenfeld1983/Vincent1991 启发 #AlphaMatting 2009 |
综述 Table IV 在四个数据集(DIM-481、alphamatting.com、AM-2K、P3M-10K)上统一评测传统/辅助/自动方法,同时报告模型复杂度(参数量 / GMac / 512² 推理速度)#Li et al. 2023。
辅助方法:传统→深度的精度跃迁
| 方法 | 类型 | Backbone | 参数(M) | GMac | DIM-481 SAD↓ | alphamatting SAD↓ | 说明 |
|---|---|---|---|---|---|---|---|
| ClosedForm | 传统 | - | - | 1.82 | 168.1 | 17.73 | 经典 affinity 方法 #AlphaMatting 2009 |
| KNN | 传统 | - | - | 6.67 | 175.4 | 12.69 | 采样式基线 |
| IFM | 传统 | - | - | 15.83 | 75.4 | 9.51 | 传统里最强 |
| DIM | 辅助 | VGG-16 | 130.55 | 25.58 | 50.4 | 9.64 | 首个 deep trimap 方法 #DIM 2017 |
| GCA | 辅助 | ResNet-34 | 25.16 | 0.52 | 35.3 | 9.59 | 全局 affinity 传播 #GCA 2020 |
| FBA | 辅助 | ResNet-50 | 34.69 | 7.15 | 25.8 | - | 7 通道输出 #FBA 2020 |
| TIMI-Net | 辅助 | ResNet-18 | 34.89 | 3.37 | 29.1 | 7.34 | 三分支,alphamatting 最佳 |
| LFPNet | 辅助 | ResNet-50 | 117.61 | 24.44 | 22.4 | 7.67 | DIM-481 最佳 |
| MatteFormer | 辅助 | Swin | 44.75 | 29.14 | 23.8 | - | transformer 细节最强 #MatteFormer 2022 |
深度学习带来的精度跃迁极其明显:DIM-481 上 SAD 从传统 KNN 的 175.4 跌到 LFPNet 的 22.4;alphamatting.com 上从 25.61(Bayesian)跌到 7.34(TIMI-Net)#Li et al. 2023。survey 还点出三个发现:① transformer 类(MatteFormer)在细节预测上潜力最大,靠全局上下文建模能力 #MatteFormer 2022;
自动方法:encoder-sharing 与 transformer 的优势
| 方法 | Backbone | 参数(M) | GMac | 速度(s) | AM-2K SAD↓ | P3M-10K SAD↓ | P3M SAD-T↓ |
|---|---|---|---|---|---|---|---|
| SHM | ResNet-50 | 79.27 | 870.16 | 0.099 | 17.81 | 20.77 | 9.14 |
| HATT | ResNeXt-101 | 106.96 | 1502.46 | 0.086 | 28.01 | 30.53 | 13.48 |
| AIM | ResNet-34 | 55.30 | 99.56 | 0.017 | 13.97 | 13.01 | 9.24 |
| P3M | ResNet-34 | 39.48 | 80.10 | 0.013 | 13.59 | 11.23 | 7.65 |
| GFM | ResNet-34 | 55.29 | 75.39 | 0.014 | 10.89 | 15.50 | 10.16 |
| MODNet | MobileNetV2 | 6.49 | 20.00 | 0.013 | 19.88 | 15.56 | 9.40 |
| P3M-ViTAE | ViTAE | 27.46 | 112.01 | 0.040 | 9.75 | 7.59 | 6.60 |
自动方法的结论有三:① encoder-sharing 架构(GFM/AIM/P3M)整体最优,因分解子任务联合优化 #GFM 2022;② transformer(P3M-ViTAE)长程依赖建模最强,两数据集 SAD 均最低 #P3M-ViTAE 2023;③ SAD-T 仍占 SAD 的大头——细节是瓶颈,未来工作应聚焦 transition area #Li et al. 2023。复杂度方面,参数 3.18M–184.95M、计算 0.52–2821 GMac、速度 0.0017–0.2454 s,多数辅助与自动方法已达实时 #Li et al. 2023。
matting 作为底层低层视觉技术,支撑大量下游应用。综述 §6 列四类 #Li et al. 2023:
- 视觉感知:检测/分割 mask 细化(guo2012paired)、cloud matting(zou2019generative)、medical matting(wang2021medical)、light-field matting(cho2016automatic)。
- 图像编辑:composition、inpainting/outpainting、enhancement、relighting(用 α+FG 做)、style transfer。
- 视频处理:video effects(Omnimatte)、shallow DoF 合成、video style transfer、multi-view stereo、RGB-D matting、video matting(survey 引 sun2021deep、zhang2021attention)#Li et al. 2023。
- 多模态 / 3D:remote sensing 云检测、3D rendering 前景提取、3D matting(CT 影像 α 标定到 radiodensity)。
视频延伸的关键缺口
survey 在应用节只把 video matting 当作下游应用一笔带过,未深入讨论。但图像→视频引入的核心新问题——时序一致性(逐帧抠像会闪烁)、循环记忆机制(如 RVM 的 recurrent architecture)、光流引导——survey 没有展开。这是图像 matting survey 的天然边界,也是我们「视频轮廓提取」调研需要单独补足的部分:video matting 模型(survey 引用的 sun2021deep/zhang2021attention)如何把图像架构(encoder-sharing / one-stage)扩展到时序,是图像→视频的关键桥梁。
四个挑战
- 综合数据集:现有集偏单类、有合成伪影、多个不公开,需大规模高分自然图 + 多类前景 + 精确 α 标注 #Li et al. 2023。
- 评测指标:SAD/MSE 与人眼感知有 gap——小 SAD 仍可能丢失发丝/耳环/眼镜框细节,需类 SSIM 的结构相似指标 #Li et al. 2023。
- 泛化能力:合成训练→自然图掉点(HATT/LF),单类训练→跨类失效(TOM-Net/MGMatting/P3M)#Li et al. 2023。
- 轻量模型:实时工业场景需要轻量高效,可借鉴 dimension reduction、feature reuse、token pruning、hybrid-resolution 结构 #Li et al. 2023。
四个未来方向
- 弱监督/无监督:用分割/saliency 的弱标签做预训练迁移,或用现成检测/分割模型给无标签数据生成弱标签 #Li et al. 2023。
- 弥合合成-真实:先进渲染/生成 + 有效增广 + domain adaptation/generalization #Li et al. 2023。
- 多模态 matting:language(RIM #RIM 2022)/speech/eye gaze/NeRF 3D 建模协作 #Li et al. 2023。
- 扩散模型:开放问题——扩散模型对 matting 是「毁灭性挫折」还是「新机遇」?作者谨慎乐观,认为 matting 的灵活性、可组合性、可解释性仍有价值 #Li et al. 2023。
与「视频轮廓提取」的五重关系
survey 对视频轮廓提取的可用价值
- α 蒙版 = 精细软轮廓:matting 输出 [0,1] 连续透明度,transition area 即发丝/毛发级精细轮廓——比分割 mask、边缘图都细,是「轮廓提取」最精细形态。
- GRAD / CONN = 边界质量指标:可直接搬入视频轮廓提取评估体系;SAD-T 进一步聚焦 transition area。
- video matting 是图像→视频的直接延伸:survey §6 引用 sun2021deep/zhang2021attention;自动人像 matting(MODNet/P3M)已用于视频会议背景替换 #MODNet 2020。
- 自动架构是视频模型的骨架来源:视频不能逐帧标 trimap,自动轨三型(one-stage/sequential/encoder-sharing)是视频 matting 主流结构来源;演进线「减人工、增自动化」直接服务视频。
- 时序一致性是关键空白:图像 survey 未展开时序一致性/循环记忆/光流——这是图像→视频的核心增量,也是我们调研需补的重点。
参考页速查
- 问题:\(I_i = \alpha_i F_i + (1-\alpha_i)B_i\),3 方程 7 未知,ill-posed。
- 分类:输入模态 × 目标 × 方法范式(辅助三型 / 自动三型)。
- 数据集:合成(DIM-481/RefMatte)vs 自然(AlphaMatting/P3M-10k/AM-2k/AIM-500)。
- 指标:SAD / SAD-T / MSE-MAD / GRAD / CONN。
- 趋势:VGG→ResNet→MobileNet→Swin/ViTAE;trimap→自动;人像→动物→透明→通用→多模态。
- 视频缺口:时序一致性 / 循环记忆 / 光流——本 survey 未展开。
参考来源
- Li, J., Zhang, J., & Tao, D. (2023). Deep Image Matting: A Comprehensive Survey. arXiv:2304.04672. arXiv:2304.04672 · github.com/JizhiziLi/matting-survey
- Xu, N. et al. (2017). Deep Image Matting. CVPR 2017. arXiv:1703.03872
- Liu, J. et al. (2016). DAPM: Deep Anchor-free Portrait Matting. ECCV 2016.
- Chen, Q. et al. (2018). TOM-Net: Learning Transparent Object Matting. CVPR 2018.
- Lu, S. et al. (2019). IndexNet Matting. ICCV 2019.
- Cai, Y. et al. (2019). AdaMatting: Disentangled Adversarial Matting. ICCV 2019.
- Hou, J. et al. (2019). Context-Aware Synthesis for Image Matting. ICCV 2019.
- Li, J. et al. (2020). GCA: Global Context-Aware Matting. AAAI 2020.
- Forte, S. & Pritch, Y. (2020). FBA Matting. arXiv 2020.
- Lin, S. et al. (2020). Background Matting V2. CVPR 2021. arXiv:2012.07910
- Zhang, S. et al. (2020). MODNet: Matting by Overfitting Detection. AAAI 2022. arXiv:2011.11961
- Li, J. et al. (2022). GFMatting: Decoupling Natural Image Matting. IJCV 2022.
- Li, J. et al. (2021). AIM-Net: Automatic Image Matting and Inpainting. IJCAI 2021.
- Park, M. et al. (2022). MatteFormer: Transformer-Based Image Matting. CVPR 2022.
- Li, J. et al. (2022). Referring Image Matting. CVPR 2022.
- Liu, M. et al. (2023). P3M-ViTAE: Vision Transformer for Portrait Matting. IJCV 2023.
- Rhemann, C. et al. (2009). A Perceptual Benchmark for Image Matting. CVPR 2009(alphamatting.com benchmark).