ESC
输入关键词搜索文章
目录

图像抠像参考

Deep Image Matting · 2023 · IEEE 综述
α 蒙版即最精细的软轮廓——从 trimap 到全自动,69 篇方法 + 数据集 + 指标的全景地图
69综述论文
2技术大轨
6输入模态
4评测指标
本文角色:这是「视频轮廓提取」调研的 core-survey 参考页,对应论文 Deep Image Matting: A Comprehensive Survey(Li, Zhang, Tao, arXiv 2304.04672)#Li et al. 2023。该综述是首篇系统总结深度学习时代图像抠像的 survey,覆盖 69 篇顶会顶刊方法。本页做两件事:
  • 把综述的 taxonomy / 数据集 / 指标 / 方法对比榨取成可查的参考骨架;
  • 标注它与「视频轮廓提取」的关系——α 蒙版就是最精细的软轮廓,GRAD/CONN 即边界质量指标,video matting 是图像→视频的直接延伸。
  • Part 0 · 综述定位
    为什么要读这篇 matting survey

    图像抠像(image matting)的目标是从自然图像中提取精确的 alpha 蒙版——一张 [0,1] 连续的软透明度图,标注每个像素属于前景的程度 #Li et al. 2023。它和「轮廓提取」是同一件事的两种精度:二值边缘图给出轮廓的「在哪」,而 α 蒙版给出轮廓的「多软」——发丝、毛发、透明物边缘这些 transition area 才是抠像真正要解的地方。

    本综述的定位很明确:在深度学习兴起之后,第一篇系统总结 image matting 的综述 #Li et al. 2023。之前的 survey(如 Li2019ASO、Boda2018ASO、Yao2017ACS、Wang2007ImageAV)几乎只覆盖传统方法——color sampling、affinity propagation、及其混合 #Li et al. 2023。这些方法依赖低层颜色/结构特征,在复杂背景下难以区分前景细节,且对 trimap 中未知区域的大小极其敏感。深度学习的引入不仅提升了精度,还催生了全新的任务设定:interactive matting、click-based matting、referring/text matting,以及完全不需要辅助输入的 automatic matting #Li et al. 2023

    综述的四条贡献

    • 首次系统综述深度学习时代的 image matting 方法;
    • 输入/输出形式、网络结构、benchmark 数据集三个视角梳理进展;
    • 对代表方法做公平定量评测,并分析模型复杂度(参数量 / 计算量 / 速度);
    • 讨论应用场景,指出挑战与未来方向(含扩散模型对 matting 的开放问题)。

    综述维护了一个持续更新的公开仓库 JizhiziLi/matting-survey,追踪该领域的快速迭代 #Li et al. 2023。下面我们按它的章节顺序,把可查的骨架信息提取出来。

    深度图像抠像方法时间线
    图 1 · 深度学习抠像方法时间线(survey Fig.1)。蓝线为辅助输入方法,黄线为自动方法——两条线并行发展,自动方法在 2020 年后明显加速。
    Part 1 · 问题定义
    三个方程七个未知数:为什么 matting 是 ill-posed

    图像抠像的数学形式由 Porter & Duff 在 1984 年正式化(合成代数 compositing algebra),其历史可追溯到 1960s 电影工业的 travelling-matte problem #Li et al. 2023。核心方程是「前景-背景的凸组合」:

    Matting 方程 (Eq.1)

    $$I_i = \alpha_i F_i + (1-\alpha_i) B_i, \qquad \alpha_i \in [0,1].$$

    其中 \(I_i\) 是第 \(i\) 个像素的观测 RGB 颜色,\(F_i\) 是前景颜色,\(B_i\) 是背景颜色,\(\alpha_i\) 是该像素属于前景的不透明度(opacity)。#Li et al. 2023

    这个方程的麻烦在于:已知 \(I\)(3 通道),未知 \(F\)\(B\)\(\alpha\)(3+3+1=7 个未知量),3 个方程解 7 个未知数——严重欠定 #Li et al. 2023。因此:

    • \(\alpha_i = 1\)纯前景 / definite foreground(definite FG);
    • \(\alpha_i = 0\)纯背景 / definite background(definite BG);
    • \(0 < \alpha_i < 1\)未知区域 / transition area,即发丝、毛发、透明物边缘等真正需要解的像素。
    对视频轮廓提取的启示:matting 的 transition area 正是「软轮廓」所在。它比二值分割 mask、边缘图都细——分割告诉你「属不属于前景」,matting 还告诉你「过渡有多软」。如果我们关心视频中毛发级精细轮廓,matting 的输出就是最贴近 ground truth 的形态。
    Part 2 · Taxonomy
    三维分类:输入模态 × 抠像目标 × 方法范式

    综述用一个三维 taxonomy 组织所有方法:输入模态(用什么辅助信息)、抠像目标(抠什么)、方法范式(网络怎么搭)。前两维决定「问题设定」,第三维决定「解决方案结构」 #Li et al. 2023

    维度一 · 输入模态

    对需要辅助输入的方法,模态包括:RGB + trimap(三态图,标 definite FG / BG / unknown,最常用)、RGB + 背景图(用户预先拍一张背景)、RGB + coarse map(粗分割图)、RGB + user click、RGB + flexible 输入(scribble 等)、RGB + 文本描述(language/referring)。自动方法则只有单张 RGB 图像 #Li et al. 2023

    抠像的各种辅助输入示意
    图 2 · 输入图像、其 alpha 蒙版与各类辅助输入(survey Fig.2)。从左到右:原图、alpha matte、trimap、background、coarse map、user click、scribble、text description。红线/点=纯前景,绿线/点=纯背景。

    维度二 · 抠像目标

    理论上没有限制,但受训练数据约束。主流目标:人像 / portrait(DAPM、SHM、MODNet、P3M、BM)、动物(GFM)、透明物体(TOM-Net、TransMatting)、通用物体(HATT、LF、AIM)。AIM 进一步把目标分为三类——salient opaque / salient transparent / non-salient——是一种典型目标 taxonomy #Li et al. 2023

    维度三 · 方法范式(两轨 × 三型)

    这是综述最有结构感的部分。方法分两大轨——辅助输入轨自动轨——每轨各分三型网络结构:

    辅助输入轨 · 三型架构

    • (a) One-stage:把图像与辅助输入拼接,过一个 CNN 直接出 alpha。代表:DIM(VGG-16 U-net)#DIM 2017、AlphaGAN(+GAN)、MatteFormer(Swin Transformer)#MatteFormer 2022、FBA(ResNet-50,输出 7 通道=α+FG+BG)#FBA 2020
    • (b) One-stage + outsider module:单主干 + 专门处理辅助信息的旁支模块。代表:IndexNet(动态预测下采样 indices 保细节)#IndexNet 2019、GCA(全局传播 opacity)#GCA 2020、SIM(patch 语义分类)、Matting-GP(高斯过程)。
    • (c) Multi-stream:多编码器分别处理不同层级信息,再融合。代表:AdaMatting(adapted trimap+alpha,并行两流+refine)#AdaMatting 2019、Context-Aware(FG+alpha)#Context-Aware 2019、HDMatt、TIMI-Net(三分支)、LFPNet、RMat(transformer 上下文+conv 细节)。

    自动轨 · 三型架构

    • (a) One-stage + optional global guidance:单网络直接出 alpha,可选全局指导模块。代表:HATT(ResNeXt+通道/空间注意力)、MODNet(MobileNetV2 主干+轻量指导,实时)#MODNet 2020、CasDGR(GNN 优化)。
    • (b) Sequential two-step:先出中间表示(trimap / coarse map / FG-BG / depth / albedo-shading-specular),再第二阶段抠像。代表:DAPM(FCN-8s 出 trimap)#DAPM 2016、SHM(PSPNet-50 出 trimap)、FDM、SHMC、HIM(MGMatting 二阶段)、TOM-Net(透明物 albedo/shading/specular)#TOM-Net 2018
    • (c) Encoder-sharing multi-decoder:共享编码器 + 多 decoder 分解子任务(语义+抠像),最后硬融合。代表:GFM(DenseNet/ResNet 共享编码,PPM 全局+bridge 局部)#GFM 2022、AIM-Net(spatial attention 指导 matting decoder)、P3M-Net、P3M-ViTAE(ViTAE transformer 共享编码)#P3M-ViTAE 2023
    辅助输入方法三型架构
    图 3 · 辅助输入方法三型架构(survey Fig.3):(a) one-stage 拼接;(b) one-stage + outsider module;(c) two/multi-stream 融合。演进方向是越来越充分地利用辅助输入的多层信息。
    自动方法三型架构
    图 4 · 自动方法三型架构(survey Fig.4):(a) one-stage + 可选全局指导;(b) sequential 两步(先生成中间表示);(c) encoder-sharing + 多 decoder。

    这条「减人工、增自动化」的演进线对视频轮廓提取尤其重要:视频不能逐帧标 trimap,自动架构(尤其 encoder-sharing 多 decoder)是视频 matting / 视频轮廓模型的主流骨架来源。

    Part 3 · 方法演进
    69 篇方法的关键里程碑

    综述 Table I 按年代列出全部 69 篇方法(年/方法/会议/模态/自动性/目标/架构/train/test)。下表摘出最具结构意义的里程碑——它们定义了某条新路线的起点 #Li et al. 2023

    年份方法会议模态自动架构型意义
    2016DAPMECCV'16RGBSequential two-step首个深度人像自动抠像(先 FCN-8s 出 trimap)#DAPM 2016
    2016DCNNECCV'16RGB-CoarseOne-stage CNN首个合成数据集 + coarse 输入
    2017DIMCVPR'17RGB-TrimapOne-stage+Refine首个 deep trimap-based,VGG-16 U-net,DIM-481 数据集 #DIM 2017
    2018TOM-NetCVPR'18RGBSequential+Refine透明物体抠像(albedo/shading/specular)#TOM-Net 2018
    2018AlphaGANBMVC'18RGB-TrimapOne-stage GAN引入对抗损失
    2019IndexNetICCV'19RGB-TrimapOne-stage动态 indices 保细节 #IndexNet 2019
    2019AdaMattingICCV'19RGB-TrimapParallel two-stream+Refine多任务损失,disentangle trimap/alpha #AdaMatting 2019
    2019Context-AwareICCV'19RGB-TrimapTwo-stream首引 Laplacian loss + 数据增广抗合成伪影 #Context-Aware 2019
    2020GCAAAAI'20RGB-TrimapOne-stage全局 affinity 传播 opacity #GCA 2020
    2020BM / BMV2CVPR'20RGB-BackgroundParallel four-stream / One-stage+Refiner背景辅助人像,PhotoMatte13k 数据集 #BMV2 2020
    2020MODNetAAAI'22RGBParallel two-streamMobileNetV2 实时人像,无 trimap #MODNet 2020
    2020GFMIJCV'22RGBParallel two-stream动物抠像,AM-2k 数据集,RSSN 抗合成伪影,MAD/SAD-T 指标 #GFM 2022
    2020FBAarXiv'20RGB-TrimapOne-stageResNet-50 出 7 通道(α+FG+BG)#FBA 2020
    2021AIM-NetIJCAI'21RGBParallel two-stream三类目标分类(salient opaque/transparent/non-salient)+ AIM-500 自然测试集 #AIM 2021
    2022MatteFormerCVPR'22RGB-TrimapOne-stage TransformerSwin Transformer 首入 matting,细节最强 #MatteFormer 2022
    2022RIMCVPR'22RGB-LanguageParallel TransformerReferring matting(文本驱动)+ RefMatte 数据集 #RIM 2022
    2022TransMattingECCV'22RGB-TrimapOne-stage Transformer透明物 transformer,trimap-guided block
    2023P3M-ViTAEIJCV'23RGBParallel TransformerViTAE transformer 自动人像,长程依赖最强 #P3M-ViTAE 2023

    从里程碑可读出三条演进脉络:① 骨干换代——VGG → ResNet → MobileNet → Swin/ViTAE Transformer,transformer 在 2022 后逐步主导;② 辅助输入减负——trimap → click/scribble → background → 完全自动(单 RGB);③ 目标泛化——人像 → 透明物 → 动物 → 通用三分类 → 多模态(文本)。这三条线都直接映射到「视频轮廓提取」的关注点:骨干决定能否实时、自动化程度决定能否上视频、目标泛化决定模型迁移能力。

    Part 4 · 数据集
    合成 vs 自然:composition artifacts 之痛

    深度方法依赖高质量标注。但精确的 α 蒙版标注极其昂贵,所以数据集分两条路:合成(从简单背景抠前景 + alpha blending 合成到复杂背景)与自然(真实图像 + 手工标注 α)#Li et al. 2023

    合成数据集

    合成路线的优势是量大——每个前景可拼 20–100 张背景。但合成图像与真实图像之间存在 composition artifacts(前景背景分辨率/噪声/光照不匹配),导致训练模型在自然图上泛化差 #GFM 2022。缓解策略包括:Context-Aware 的 re-JPEG+Gaussian blur #Context-Aware 2019、GFM 的 RSSN 合成路线(统一分辨率/锐度/噪声/光照)#GFM 2022、BM 的自监督从无标签真实数据学习 #BMV2 2020、MODNet 的子目标一致性 fine-tune #MODNet 2020、RMat 的强增广(线/非线像素增广+区域增广)。

    自然数据集

    自然数据集避免合成伪影,但受限于标注成本,规模小且多聚焦单类。下表汇总两类代表(survey Table II 摘录)#Li et al. 2023

    数据集会议自然目标分辨率训练测试意义
    AlphaMattingCVPR'09合成基准object3k×2k278首个 matting benchmark,提供在线评测 #AlphaMatting 2009
    DIM-481CVPR'17合成object1.3k×1.1k43150最广泛使用的 trimap 训练集 #DIM 2017
    SHM-35kMM'18自然human-52,5111,400大规模自然人像(不公开)
    P3M-10kMM'21自然human1.3k×1.3k9,4211,000首个隐私保护人像数据集 #P3M-ViTAE 2023
    AM-2kIJCV'22自然animal1.5k×1.2k1,800200首个动物 matting 数据集(20 类)#GFM 2022
    AIM-500IJCAI'21自然object1.4k×1.3k-500首个自然图通用测试集 #AIM 2021
    RWP-636CVPR'21自然human1k×1.3k-636含 detail map 标注挑战区
    PhotoMatte85CVPR'20自然human2.3k×3.5k-85高分真实人像测试集 #BMV2 2020
    RefMatteCVPR'23合成object1.5k×1.2k45,0002,500文本描述标注,referring matting benchmark #RIM 2022
    数据集缺口:survey 在挑战节明确指出——现有数据集偏单类(人/动物/透明物)、合成集有伪影、多个关键集不公开(SHM/SHMC/Multi-Object-1K)#Li et al. 2023。对视频轮廓提取而言,视频 α 蒙版数据集几乎空白——这是图像 survey 未覆盖、而我们调研需补的重要缺口。
    Part 5 · 训练目标与评测指标
    九种损失 + 四个指标:怎么训、怎么评

    综述 Table III 系统列出 matting 用的九类损失,并在 §5.2 定义四个评测指标。这是做视频轮廓提取评估时可直接复用的工具箱。

    训练损失(九类)

    最核心的是 α-loss,对每个像素的预测 α 与 GT α 求 L1(带 ε 防不可导):

    Alpha Loss (Eq.2)

    $$L_\alpha = \frac{\sum_i \sqrt{(\alpha_p^i - \alpha_g^i)^2 W_\alpha^i + \epsilon^2}}{\sum_i W_\alpha^i}, \qquad \epsilon = 10^{-6}.$$

    权重 \(W_\alpha^i\) 在 transition area 设 1、definite FG/BG 设 0(辅助方法);自动方法全图设 1。#DIM 2017

    其余八类:Composition loss(对合成 RGB \(C_g\) 求 L1)、MSE loss、Cross-entropy(中间表示分类)、Laplacian loss(5 级拉普拉斯金字塔,Context-Aware 首引 #Context-Aware 2019)、Gradient loss(L1 梯度幅度差,治模糊边界)、Adversarial loss、Multi-task loss(AdaMatting 用 Kendall 不确定性加权 #AdaMatting 2019)、SSIM loss(HATT 用)#Li et al. 2023

    设计要点:α-loss 只在 transition area 加权,是因为 definite FG/BG 区域 α 已被 trimap 确定、无需学;自动方法无 trimap,故全图加权。Gradient/Laplacian loss 专门解决「边界模糊」——这正是轮廓质量问题。

    评测指标(四个核心)

    指标全称含义提出者/用途
    SADSum of Absolute Difference预测 α 与 GT α 的绝对差之和最通用,越小越好 #Li et al. 2023
    SAD-TSAD in Transition areas仅 transition area 内的 SADGFM 提出,专测细节 #GFM 2022
    MSE / MADMean Squared Error / Mean Absolute Difference均方差 / 归一化绝对差MAD 归一化图像尺寸,利跨数据集 #GFM 2022
    GRADGradient error一阶高斯导数滤波后梯度差异alphamatting.com 提出,测边界锐度 #AlphaMatting 2009
    CONNConnectivity error二值阈值图的 FG-BG 连通性差异alphamatting.com,受 Rosenfeld1983/Vincent1991 启发 #AlphaMatting 2009
    对视频轮廓提取的直接价值:GRAD 测边界梯度误差、CONN 测连通性——两者本质就是「轮廓质量」指标,可直接搬入视频轮廓提取的评估体系。SAD-T 进一步把误差聚焦到 transition area(发丝/毛发),是比通用分割 IoU 更细的轮廓度量。
    Part 6 · 性能基准
    传统→深度的精度跃迁与 transformer 的崛起

    综述 Table IV 在四个数据集(DIM-481、alphamatting.com、AM-2K、P3M-10K)上统一评测传统/辅助/自动方法,同时报告模型复杂度(参数量 / GMac / 512² 推理速度)#Li et al. 2023

    辅助方法:传统→深度的精度跃迁

    方法类型Backbone参数(M)GMacDIM-481
    SAD↓
    alphamatting
    SAD↓
    说明
    ClosedForm传统--1.82168.117.73经典 affinity 方法 #AlphaMatting 2009
    KNN传统--6.67175.412.69采样式基线
    IFM传统--15.8375.49.51传统里最强
    DIM辅助VGG-16130.5525.5850.49.64首个 deep trimap 方法 #DIM 2017
    GCA辅助ResNet-3425.160.5235.39.59全局 affinity 传播 #GCA 2020
    FBA辅助ResNet-5034.697.1525.8-7 通道输出 #FBA 2020
    TIMI-Net辅助ResNet-1834.893.3729.17.34三分支,alphamatting 最佳
    LFPNet辅助ResNet-50117.6124.4422.47.67DIM-481 最佳
    MatteFormer辅助Swin44.7529.1423.8-transformer 细节最强 #MatteFormer 2022

    深度学习带来的精度跃迁极其明显:DIM-481 上 SAD 从传统 KNN 的 175.4 跌到 LFPNet 的 22.4;alphamatting.com 上从 25.61(Bayesian)跌到 7.34(TIMI-Net)#Li et al. 2023。survey 还点出三个发现:① transformer 类(MatteFormer)在细节预测上潜力最大,靠全局上下文建模能力 #MatteFormer 2022

  • multi-stream 长程上下文+patch 细节架构(TIMI-Net、LFPNet)效果稳健;
  • 单一 benchmark 易过拟合,建议多 benchmark 评测
  • #Li et al. 2023

    自动方法:encoder-sharing 与 transformer 的优势

    方法Backbone参数(M)GMac速度(s)AM-2K SAD↓P3M-10K SAD↓P3M SAD-T↓
    SHMResNet-5079.27870.160.09917.8120.779.14
    HATTResNeXt-101106.961502.460.08628.0130.5313.48
    AIMResNet-3455.3099.560.01713.9713.019.24
    P3MResNet-3439.4880.100.01313.5911.237.65
    GFMResNet-3455.2975.390.01410.8915.5010.16
    MODNetMobileNetV26.4920.000.01319.8815.569.40
    P3M-ViTAEViTAE27.46112.010.0409.757.596.60

    自动方法的结论有三:① encoder-sharing 架构(GFM/AIM/P3M)整体最优,因分解子任务联合优化 #GFM 2022;② transformer(P3M-ViTAE)长程依赖建模最强,两数据集 SAD 均最低 #P3M-ViTAE 2023;③ SAD-T 仍占 SAD 的大头——细节是瓶颈,未来工作应聚焦 transition area #Li et al. 2023。复杂度方面,参数 3.18M–184.95M、计算 0.52–2821 GMac、速度 0.0017–0.2454 s,多数辅助与自动方法已达实时 #Li et al. 2023

    辅助方法主观结果
    图 5 · 辅助方法在 alphamatting.com 上的主观结果(survey Fig.5)。建议放大查看发丝/毛发细节。
    自动方法主观结果
    图 6 · 自动方法在 P3M-500-NP 上的主观结果(survey Fig.6)。
    Part 7 · 应用与视频延伸
    从图像编辑到 video matting

    matting 作为底层低层视觉技术,支撑大量下游应用。综述 §6 列四类 #Li et al. 2023

    • 视觉感知:检测/分割 mask 细化(guo2012paired)、cloud matting(zou2019generative)、medical matting(wang2021medical)、light-field matting(cho2016automatic)。
    • 图像编辑:composition、inpainting/outpainting、enhancement、relighting(用 α+FG 做)、style transfer。
    • 视频处理:video effects(Omnimatte)、shallow DoF 合成、video style transfer、multi-view stereo、RGB-D matting、video matting(survey 引 sun2021deep、zhang2021attention)#Li et al. 2023
    • 多模态 / 3D:remote sensing 云检测、3D rendering 前景提取、3D matting(CT 影像 α 标定到 radiodensity)。

    视频延伸的关键缺口

    survey 在应用节只把 video matting 当作下游应用一笔带过,未深入讨论。但图像→视频引入的核心新问题——时序一致性(逐帧抠像会闪烁)、循环记忆机制(如 RVM 的 recurrent architecture)、光流引导——survey 没有展开。这是图像 matting survey 的天然边界,也是我们「视频轮廓提取」调研需要单独补足的部分:video matting 模型(survey 引用的 sun2021deep/zhang2021attention)如何把图像架构(encoder-sharing / one-stage)扩展到时序,是图像→视频的关键桥梁。

    Part 8 · 挑战、未来与对视频轮廓的启示
    四个挑战、四个方向与一个开放问题

    四个挑战

    • 综合数据集:现有集偏单类、有合成伪影、多个不公开,需大规模高分自然图 + 多类前景 + 精确 α 标注 #Li et al. 2023
    • 评测指标:SAD/MSE 与人眼感知有 gap——小 SAD 仍可能丢失发丝/耳环/眼镜框细节,需类 SSIM 的结构相似指标 #Li et al. 2023
    • 泛化能力:合成训练→自然图掉点(HATT/LF),单类训练→跨类失效(TOM-Net/MGMatting/P3M)#Li et al. 2023
    • 轻量模型:实时工业场景需要轻量高效,可借鉴 dimension reduction、feature reuse、token pruning、hybrid-resolution 结构 #Li et al. 2023

    四个未来方向

    • 弱监督/无监督:用分割/saliency 的弱标签做预训练迁移,或用现成检测/分割模型给无标签数据生成弱标签 #Li et al. 2023
    • 弥合合成-真实:先进渲染/生成 + 有效增广 + domain adaptation/generalization #Li et al. 2023
    • 多模态 matting:language(RIM #RIM 2022)/speech/eye gaze/NeRF 3D 建模协作 #Li et al. 2023
    • 扩散模型:开放问题——扩散模型对 matting 是「毁灭性挫折」还是「新机遇」?作者谨慎乐观,认为 matting 的灵活性、可组合性、可解释性仍有价值 #Li et al. 2023

    与「视频轮廓提取」的五重关系

    survey 对视频轮廓提取的可用价值

    1. α 蒙版 = 精细软轮廓:matting 输出 [0,1] 连续透明度,transition area 即发丝/毛发级精细轮廓——比分割 mask、边缘图都细,是「轮廓提取」最精细形态。
    2. GRAD / CONN = 边界质量指标:可直接搬入视频轮廓提取评估体系;SAD-T 进一步聚焦 transition area。
    3. video matting 是图像→视频的直接延伸:survey §6 引用 sun2021deep/zhang2021attention;自动人像 matting(MODNet/P3M)已用于视频会议背景替换 #MODNet 2020
    4. 自动架构是视频模型的骨架来源:视频不能逐帧标 trimap,自动轨三型(one-stage/sequential/encoder-sharing)是视频 matting 主流结构来源;演进线「减人工、增自动化」直接服务视频。
    5. 时序一致性是关键空白:图像 survey 未展开时序一致性/循环记忆/光流——这是图像→视频的核心增量,也是我们调研需补的重点。
    核心结论:这篇 survey 为「视频轮廓提取」提供了三件可直接复用的资产:
  • 精细轮廓的数学定义(α matte);
  • 边界质量评测工具箱(GRAD/CONN/SAD-T);
  • 图像自动 matting 架构谱系(视频模型的骨架来源)。其未覆盖的时序一致性/循环记忆,正是我们 survey 要补的图像→视频增量。
  • 参考页速查

    • 问题\(I_i = \alpha_i F_i + (1-\alpha_i)B_i\),3 方程 7 未知,ill-posed。
    • 分类:输入模态 × 目标 × 方法范式(辅助三型 / 自动三型)。
    • 数据集:合成(DIM-481/RefMatte)vs 自然(AlphaMatting/P3M-10k/AM-2k/AIM-500)。
    • 指标:SAD / SAD-T / MSE-MAD / GRAD / CONN。
    • 趋势:VGG→ResNet→MobileNet→Swin/ViTAE;trimap→自动;人像→动物→透明→通用→多模态。
    • 视频缺口:时序一致性 / 循环记忆 / 光流——本 survey 未展开。

    参考来源

    • Li, J., Zhang, J., & Tao, D. (2023). Deep Image Matting: A Comprehensive Survey. arXiv:2304.04672. arXiv:2304.04672 · github.com/JizhiziLi/matting-survey
    • Xu, N. et al. (2017). Deep Image Matting. CVPR 2017. arXiv:1703.03872
    • Liu, J. et al. (2016). DAPM: Deep Anchor-free Portrait Matting. ECCV 2016.
    • Chen, Q. et al. (2018). TOM-Net: Learning Transparent Object Matting. CVPR 2018.
    • Lu, S. et al. (2019). IndexNet Matting. ICCV 2019.
    • Cai, Y. et al. (2019). AdaMatting: Disentangled Adversarial Matting. ICCV 2019.
    • Hou, J. et al. (2019). Context-Aware Synthesis for Image Matting. ICCV 2019.
    • Li, J. et al. (2020). GCA: Global Context-Aware Matting. AAAI 2020.
    • Forte, S. & Pritch, Y. (2020). FBA Matting. arXiv 2020.
    • Lin, S. et al. (2020). Background Matting V2. CVPR 2021. arXiv:2012.07910
    • Zhang, S. et al. (2020). MODNet: Matting by Overfitting Detection. AAAI 2022. arXiv:2011.11961
    • Li, J. et al. (2022). GFMatting: Decoupling Natural Image Matting. IJCV 2022.
    • Li, J. et al. (2021). AIM-Net: Automatic Image Matting and Inpainting. IJCAI 2021.
    • Park, M. et al. (2022). MatteFormer: Transformer-Based Image Matting. CVPR 2022.
    • Li, J. et al. (2022). Referring Image Matting. CVPR 2022.
    • Liu, M. et al. (2023). P3M-ViTAE: Vision Transformer for Portrait Matting. IJCV 2023.
    • Rhemann, C. et al. (2009). A Perceptual Benchmark for Image Matting. CVPR 2009(alphamatting.com benchmark).