ESC
输入关键词搜索文章
目录

视频轮廓提取模型全景

边缘检测 · 视频分割 · 抠像基础模型
三线交汇于轮廓:ODS / J&F / GRAD-CONN 都在量同一个量
本文范围:本文是视频轮廓提取系列的总览(Hub),系统调研"从视频中提取目标轮廓/边界"的模型。我们把一个常被混为一谈的问题拆成三条技术线——视频边缘/轮廓检测(含视频显著目标检测 VSOD)、视频目标分割(VOS)、视频抠像(matting)——并指出一个常被忽视的事实:纯"视频边缘检测"并未形成独立的模型线,真正满足"视频中稳定细轮廓"需求的,是 VOS 的 mask 边界和 matting 的 alpha 蒙版。三线最终在 SAM 2 基础模型上交汇。本系列另有三篇核心 survey 参考页(VOS 全景综述图像抠像综述SAM 综述)和三篇论文精读(SAM 2、Robust Video MattingTrack Anything)。
Part 0 · 引言与问题定义
视频轮廓提取:一个被三条技术线共同回答的问题

"视频轮廓提取"听起来像一个单一任务,但它实际上被三条几乎互不引用的技术线分别回答。第一条是边缘检测——从 Canny 的梯度极值非极大值抑制 #Canny, 1986 到 HED #Xie et al., 2015、RCF #Liu et al., 2017、PiDiNet #Su et al., 2021、EDTER #Pu et al., 2022 的深度全卷积与 Transformer 路线,产出的是逐帧二值边缘图。第二条是视频目标分割(VOS)——从 OSVOS、STM #Oh et al., 2019 到 XMem #Cheng et al., 2022、SAM 2 #Ravi et al., 2024,产出的是逐帧对象 mask,其边界即轮廓。第三条是视频抠像(matting)——从 Deep Image Matting #Xu et al., 2017 到 MODNet、Robust Video Matting #Lin et al., 2021、MatAnyone、SAM2Matting #Shen et al., 2026,产出的是 alpha 蒙版,即发丝级软轮廓。

这三条线为什么值得放在一起讲?因为它们其实都在回答同一个问题——"怎样从视频中拿到一条时序一致、精度足够的轮廓"——只是给出的"轮廓表示"不同:二值边缘、mask 边界、alpha 蒙版。更关键的是,三条线的评测指标都在量"轮廓质量":边缘检测用 ODS/OIS/AP,VOS 用 J&F(其中的 F 是 Boundary F1,直接量边界精度),matting 用 SAD/GRAD/CONN(GRAD 量梯度误差、CONN 量连通性,本质都是边界指标)。这是一个重要的观察:三套指标看似不相关,实际上共享同一个被测量对象。

本文要回答的核心问题是:这三条线各自的模型在做什么、它们用什么机制保证视频里的时序一致性、又为什么最终会在 SAM 2 这个基础模型上收敛?我们用一个统一的双 taxonomy 来组织答案:按"产出什么形式的轮廓"分任务(任务 taxonomy),按"如何保证时序一致"分技术路线(技术路线 taxonomy)。后者尤其重要——它是视频区别于静态图像的核心维度,且跨三线通用:recurrent 隐状态(RVM)、memory-bank 检索(XMem/MatAnyone/SAM 2)、无状态局部注意力(TAM #Zhang et al., 2021)三种时序机制,恰好覆盖了三条线的主流方法。

还有一个必须诚实说明的结论:纯"视频边缘检测"并没有形成一条独立、成规模的模型线。逐帧边缘检测器(HED→RCF→PiDiNet→EDTER)的演进几乎完全发生在静态 BSDS500 #Arbeláez et al., 2011 上,视频时序一致化更多是"事后补丁"(光流 warp、3D Conv、自监督时序损失)。业界真正需要"视频中稳定细线轮廓"的场景(影视抠像边缘、AR 描边、卡通化 line drawing 视频),实际由视频抠像和视频分割两条线满足。所以本文的"子方向一"实质是边缘检测 + 视频显著目标检测(VSOD,其显著图边界即轮廓)的拼合图景,并明确标注其不成线的事实——这本身就是一个值得记录的领域发现。

Part 1 · 读者导读与术语
先建立心智模型:四种轮廓表示与三套指标

在进入具体模型之前,先建立两个心智模型。第一个是轮廓表示的四态——同一个物理对象边界,在不同任务里被表示成四种不同的数学量:

  • 二值边缘图(edge detection):每像素 0/1,所有梯度极值,不绑定特定对象。指标 ODS/OIS/AP。
  • 显著图(VSOD):每像素 [0,1] 显著性,边界是显著区域的副产品,隐式对象。指标 S-measure/F-measure。
  • mask 边界(VOS):逐帧二值/软对象掩码,边界是阶跃。指标 J(区域 IoU)& F(边界 F1)。
  • alpha 蒙版(matting):每像素 [0,1] 前景不透明度,0<α<1 为 transition area(发丝级软轮廓)。指标 SAD/GRAD/CONN。

第二个心智模型是时序一致性的三种机制——视频区别于图像的核心。一条轮廓要在帧间不闪烁、不漂移,主流方法落到三种机制上:recurrent 隐状态(逐帧因果传播,如 RVM 的 ConvGRU)、memory-bank 检索(跨帧 query-key 全图检索,如 XMem/SAM 2)、无状态局部注意力(仅 t±1 局部 patch,如 TAM)。这三种机制不是互斥的——MatAnyone 把 memory-bank 延伸到 alpha,SAM 2 把 memory-bank 原生化进基础模型——但它们构成了理解所有视频轮廓模型的主轴。

核心术语速查

masklet:SAM 2 术语,指一个对象在多帧上的 mask 序列(对应 image 的 masklet)。trimap:matting 的传统辅助输入,把图分前景/背景/未知区三类。streaming memory:SAM 2 的核心机制,keyframe memory bank + object pointer 跨帧精修。transition area:alpha 在 0 与 1 之间的过渡区,即发丝/毛发等软轮廓所在。dtSSD/MESSDdt:视频 matting 的时序稳定性指标,但基于光流 warp 的 MESSDdt 在半透明处有噪声(TAM 实证弃用)。

带着这两个模型,本文的阅读路径是:先看任务 taxonomy(Part 2)和技术路线 taxonomy(Part 3)建立全局坐标,再按三条线分别深入(Part 4-6),最后用方法矩阵(Part 7)、时间线(Part 8)、数据集与指标(Part 9)做横向收束,开放问题(Part 10)指出三线共同的未解之处。

Part 2 · 任务 Taxonomy
要提取什么形式的轮廓?

任务 taxonomy 按"产出什么形式的轮廓表示"分类,而非按模型分。同一模型可能产多种表示(例如 SAM 2 产 mask 边界,SAM2Matting 在其上加 alpha)。分类原则是输出空间,因为这决定了下游能用这条轮廓做什么、以及用哪套指标评测。

任务类型典型输入典型输出代表工作评测重点不适用场景
二值边缘检测(视频化)视频帧逐帧二值边缘图HED / RCF / PiDiNet / EDTER + 时序补丁ODS / OIS / AP需对象级语义、半透明软轮廓
视频显著目标检测(VSOD)视频逐帧显著图(边界即轮廓)MGA #Li et al., 2019 / VSOD 系S-measure / F-measure / E-measure非显著目标、多等显著性场景
视频目标分割(VOS)视频 + prompt(点/框/mask/首帧)逐帧 mask(masklet 边界即轮廓)OSVOS→STM→XMem→SAM 2J & F(F=边界精度)无 prompt 全自动、发丝级软轮廓
视频抠像(matting)视频(+trimap/背景/无)逐帧 alpha 蒙版(软轮廓)MODNet→RVM→MatAnyone→SAM2MattingSAD / GRAD / CONN / dtSSD非前景主体(动物/任意物)、长视频漂移

这里有几条容易混淆的边界需要澄清。第一,"边缘检测"与"分割边界"的差别:前者不绑定对象语义,把所有梯度极值都标出来(一棵树的纹理也会产生边缘);后者绑定特定对象,只在对象轮廓处出边界。VSOD 介于两者之间——"显著"隐式选了对象,但仍是"哪些区域显眼"而非"这是哪个对象"。第二,"mask 边界"与"alpha"的差别:mask 是二值阶跃,对发丝会出锯齿;alpha 是连续软透明,能表达发丝。SAM 2→SAM2Matting 的精度升级,本质就是 mask 边界→alpha 软轮廓。第三,"有 prompt"与"无 prompt":VOS 需要用户给一个 prompt 指定对象(点/框/首帧 mask),而 SAM 的 automatic prompting 实证不佳 #Zhang et al., 2024——"完全无显式 prompt 的全自动视频轮廓提取"是一个核心开放问题(见 Part 10)。

这个 taxonomy 还揭示了一个评测层面的缺口:四类任务各有自己的指标,但没有一套统一的"时序轮廓质量"评测。VOS 的 F 量边界但无紧致度/时序一致性 TCB;matting 的 GRAD/CONN 是静态的;dtSSD 是全图级、不分离对象。这条缺口我们在 Part 10 作为开放问题展开。

Part 3 · 技术路线 Taxonomy
如何保证视频里的时序一致性:三种机制

技术路线 taxonomy 按"时序一致性机制"分——这是视频区别于静态图像的核心维度,且跨三线通用。这条分类轴是本文最重要的新增视角:三条线的模型几乎都能归入下列之一。

技术路线核心表示适配任务代表工作优势限制工程可得性
逐帧 + 事后时序补丁独立帧边缘/分割边缘检测视频化HED + 光流 warp / 3D Conv简单、可插拔无端到端时序、闪烁
无状态局部注意力t±1 局部 patch attention视频 mattingTAM #Zhang et al., 2021轻量、可插入、显式监督对应非流式(需 t+1)、短程无回溯
recurrent 隐状态ConvGRU 逐帧因果传播视频 matting / 分割RVM #Lin et al., 2021流式长程、端到端、隐式场景模型容量有限长视频 drift、单向无未来高(3.749M 参数)
memory-bank 检索跨帧 query-key 全图检索VOS / 视频抠像STM / XMem / MatAnyone / SAM 2长程回溯、分层、可重识别算力高(self/cross-attn)、FIFO 冗余/错误累积中-高
基础模型 streaming memorykeyframe memory bank + object pointer统一图像/视频 VOSSAM 2 #Ravi et al., 2024统一、实时、大规模数据、遮挡头二值硬边界、prompt 依赖、长视频漂移高(开源 + 生态)
解耦 tracker-to-matting冻结 VOS tracker + 图像训 matting视频 matting zero-shotSAM2Matting #Shen et al., 2026zero-shot 视频、不依赖视频 matting 数据依赖 tracker 质量、两阶段中(代码开源)

这六条路线不是互斥的,它们之间有明确的组合与演化关系。memory-bank 与解耦 tracker-to-matting 可以组合——SAM2Matting 就是"冻结 SAM 2 的 memory-bank tracker + 图像训 matting head"。recurrent 与 memory-bank 互补——RVM 的 ConvGRU 是逐帧因果压缩,XMem 的 memory-bank 是全图检索回溯,MatAnyone 把 memory-bank 从 mask 延伸到 alpha。无状态局部注意力(TAM)是一个过渡形态,介于传统 affinity-based 视频抠像(Choi 2012、Eisemann 2009)与现代 recurrent/memory 机制之间,它甚至可以作为模块插入 recurrent/memory 架构。基础模型 streaming memory 则是 memory-bank 的原生化——把"外挂记忆"融合进基座(fusion-level 原生紧耦合 #Xu et al., 2025)。

一个反直觉的发现值得专门指出:matting 的时序机制分化最彻底。RVM 选 recurrent、TAM 选局部注意力、MatAnyone 选 memory-bank、SAM2Matting 选解耦——四篇几乎覆盖了全部时序路线。这意味着在视频抠像这条线内部,就能完整观察"时序机制三分"的全部形态。这是本文把技术路线 taxonomy 作为主轴的实证理由。

graph LR
    A["逐帧+事后补丁
(HED+光流)"] --> B["三种时序机制"] B --> C["recurrent 隐状态
RVM ConvGRU"] B --> D["memory-bank 检索
XMem/MatAnyone/SAM2"] B --> E["无状态局部注意力
TAM t±1"] C --> F["基础模型 streaming memory
SAM 2 (memory 原生化)"] D --> F F --> G["解耦 tracker-to-matting
SAM2Matting (zero-shot)"] G --> H["mask 边界 → alpha 软轮廓
(精度升级)"]
Part 4 · 子方向 A
视频边缘/轮廓检测:一条没有独立模型线的拼合图景

我们先看最薄弱、也最需要诚实交代的一条线。视频边缘检测的"模型"主要由两类工作拼合而成:一类是把静态边缘检测器逐帧跑、再加时序补丁;另一类是视频显著目标检测(VSOD),它输出显著图、边界是副产品。

静态边缘检测器的演进:HED → RCF → PiDiNet → EDTER

深度学习边缘检测的范式起点是 HED #Xie et al., 2015(ICCV 2015)——全卷积多尺度深度边缘检测,把边缘检测重新表述为像素级二分类。它的贡献是确立了"深度全卷积 + 多尺度融合 + BSDS500 评测"的范式,此后工作几乎都在这个框架内改进。RCF #Liu et al., 2017(CVPR 2017)利用所有卷积层的富特征做更充分融合;BDCN(CVPR 2019)用双向级联强调层次化特征。

这条线近年两个最有代表性的工作是 PiDiNet 和 EDTER,它们代表了两极——轻量高效重型 SOTA。PiDiNet #Su et al., 2021(ICCV 2021)把 Sobel/LBP 的像素差分算子显式注入 CNN(像素差分卷积 PDC),核心公式是 $y=\sum_i w_i(x_i-x_i')$,让梯度算子成为可学习核的先验。它的惊人之处在于:仅用 710K 参数、3.43G MACs、92 FPS(Tiny-L 版仅 73K 参数、215 FPS),from-scratch 不用 ImageNet 预训练,在 BSDS500 上 ODS 达到 0.807——超过人类标注一致性 0.803。这打破了"高性能边缘检测必依赖大预训练骨干"的惯例。

PiDiNet 架构
图 1:PiDiNet 架构。像素差分卷积 PDC 把 Sobel/LBP 梯度算子显式注入 CNN,训练后可等价转为普通卷积,推理零额外开销(来源:PiDiNet, Fig.2)。

另一极是 EDTER #Pu et al., 2022(CVPR 2022)——首个用于通用边缘检测的 Transformer。它用两阶段 ViT:Stage I 全局 16×16 patch + 24 block 捕获全局上下文,Stage II 不重叠滑窗 8×8 细粒度 patch + 12 block 精化,BiMLA 解码器做双向多尺度融合。EDTER 把 BSDS500 MS+VOC ODS 推到 0.848,是近年静态边缘最大跃升,但代价是 Stage II 470G FLOPs、仅 2.2 FPS,且没有任何时序机制——video object segmentation 在 EDTER 里只是作为下游被提及。

EDTER 两阶段 Transformer 框架
图 2:EDTER 两阶段 Transformer 框架。Stage I 全局 patch + Stage II 细粒度 patch,BiMLA 双向解码。BSDS500 ODS 0.848,但 470G FLOPs、2.2 FPS、无时序(来源:EDTER, Fig.2)。

为什么边缘检测没有独立的"视频线"

把 HED/RCF/PiDiNet/EDTER 跑到视频上会发生什么?逐帧边缘会出现闪烁——相邻帧的微小像素扰动会让边缘位置抖动。学术界的应对是事后补丁:用光流 warp 做时序一致性损失、用 3D Conv 或 ConvLSTM 加时序头。但这些方案没有形成像 VOS 那样的独立模型线,原因有二:其一,没有公认的"视频边缘检测 benchmark"——BSDS500-Video、UCF50 受众小、更新停滞;其二,业界几乎不关心"纯边缘图",关心的是抠像 alpha 和分割 mask 边界——即把轮廓需求外包给了 VOS/matting 两条线。

VSOD:把"轮廓"转写成"显著对象分割"

真正把"视频轮廓"做成独立任务的是视频显著目标检测(VSOD)。它的策略是:不直接出边缘图,而出显著图(显著区域的边界即轮廓),用"显著性"隐式选定对象。代表工作 MGA #Li et al., 2019(ICCV 2019)是首个以 attention 机制建模"显著运动如何影响对象显著性"的视频 SOD 方法。它的双分支架构是:外观分支 ResNet-101 + 运动分支 ResNet-34(更轻,因为光流图无高层语义),用 FlowNet 2.0 前向光流,6 个 MGA 模块桥接编码器与解码器。

MGA 的核心模块是"乘法注意 + 残差 $+f_a$"——这个残差设计很重要,它避免运动为 0 时静止显著区域被抑制。最佳变体 MGA-tmc = 空间注意(Sigmoid)+ 通道注意(Softmax×C)+ 残差。MGA 在 DAVIS 上达到 S-m 0.913、maxF 0.902,较次优 PDB +3.4%/+4.0%;在 FBMS 上 +6.1%/+8.1%。值得注意的是 MGA 仅用上一帧短程光流,不需 ConvLSTM 长程历史——这是一个强基线、易部署的设计,但也意味着它的时序一致性是"短程"的,长视频无回溯能力。

MGA 模块
图 3:MGA(Motion Guided Attention)模块。乘法注意 + 残差 $+f_a$,避免运动为 0 时静止显著区被抑制。DAVIS S-m 0.913(来源:MGA, Fig.2)。

近 1-2 年 VSOD 的趋势是用基础模型(SAM/SAM 2)替换专用 VSOD 主干,把 VSOD 重新表述为 prompt-free video segmentation。这恰好印证了本文的主线:边缘/VSOD 这条线的终点,不是更精细的边缘检测器,而是汇入 VOS/matting 的基础模型。

Part 5 · 子方向 B
视频目标分割:从 STM memory 到 SAM 2 基础模型

VOS 是三条线里最活跃、最成体系的一条。它的输出是逐帧对象 mask,masklet 边界即轮廓——给定一段视频、在第 1 帧点一下,整段视频的对象掩码边界就出来了。这条线的核心叙事是"memory 范式的演化与原生化"。

memory 范式的起点:STM

VOS 的深度学习起点是 OSVOS(CVPR 2017)的 one-shot 在线微调,但真正奠定后续路线的是 STM #Oh et al., 2019(ICCV 2019)——Space-Time Memory Networks。STM 第一次把"跨帧 memory 检索"作为 VOS 的核心机制:当前帧的特征作为 query,去检索历史关键帧的 memory,用 attention 把历史信息融合回当前帧。这个范式如此成功,以至于此后 XMem、Cutie、DEVA、甚至 SAM 2 的 memory 都可以看作它的变体。STM 是 XMem/MatAnyone 的 memory 机制直系祖先,也作为 matting 那条线的 trimap 生成器被复用(见 Part 6 的 TAM)。

多级 memory:XMem

XMem #Cheng et al., 2022(ECCV 2022)把 memory 范式推向长视频。它借鉴 Atkinson-Shiffrin 人类记忆模型,建立三级 memory——sensory(瞬时)、working(工作)、long-term(长期)——把"显存爆炸"与"精度"解耦:通过 consolidation 把 working memory 压缩进 long-term,实现压缩比 >6000%,在 ≤1.4GB 显存下处理 34000 帧。XMem 的一个关键技术贡献是 anisotropic L2 相似度——用 shrinkage 编码置信度、selection 编码 channel 判别性,是对 STCN 普通 L2 的关键改进。这个 anisotropic L2 affinity 后被 MatAnyone 的 alpha memory query 直接沿用,是 XMem→MatAnyone 的实证技术传承点。

但 XMem 输出的是 mask 边界(二值/soft 分割 logit),不是 alpha 蒙版。它的局限正是后续 alpha 路线的起点:快速运动失败 + mask 边界精度不足。后续 Cutie(CVPR 2024)引入 object-level query memory 解决多同类目标混淆;DEVA #Cheng et al., 2023(ICCV 2023)把图像分割与跟踪解耦、支持开放词表。这些 pre-SAM2 的工作都遵循"外挂 memory 模块"的范式。

基础模型转折点:SAM 2 的 streaming memory

2024 年 SAM 2 #Ravi et al., 2024(Meta FAIR)把 VOS 从"专用模型"拉到"通用基础模型",统一图像与视频的可提示分割。它的核心创新是 streaming memory architecture——把 memory 机制从"外挂模块"原生化进基座(fusion-level 原生紧耦合 #Xu et al., 2025)。SAM 2 的数据流是:Hiera 分层 image encoder → memory attention(L=4 层:self-attn → cross-attn 到 memory bank + object pointer → MLP)→ mask decoder → memory encoder(轻量 conv)回写 memory bank。图像模式下记忆为空,即退化为 SAM。

SAM 2 streaming memory 架构
图 4:SAM 2 streaming memory 架构。image encoder → memory attention(self+cross-attn 到 memory bank+object pointer)→ mask decoder → memory encoder 回写。图像模式记忆空即退化为 SAM(来源:SAM 2, Fig.模型图)。

SAM 2 的 memory bank 是双 FIFO + object pointer:最多 N 帧近期空间记忆 + M 帧提示帧空间记忆(始终保留第 1 帧),外加 256 维 object pointer 拆成 4×64 token;memory feature 投影到 64 维;GRU 被砍掉(消融显示无平均收益)。一个关键设计是 occlusion head——新增"对象是否可见"预测头(CE 损失,恒定监督),被遮挡帧的记忆加 learned occlusion embedding。这是 SAM 2 区别于 SAM 的关键:对象可以消失再出现(PVS, Promptable Video Segmentation)。

SAM 2 的数据规模是转折性的。SA-V 数据集含 50.9K 视频、190.9K 手工 masklet、10.0M 手工掩码,加自动标注共 642.6K masklet、35.5M 掩码——比此前最大的 VOS 数据集大一个数量级;196 小时、47 国、42.5% 消失率、>88% 掩码归一化面积 <0.1(小目标居多)。在如此规模的数据上,SAM 2.1(Hiera-L)取得:MOSE val 77.9、DAVIS17 val 90.7 / test 88.9、YouTube-VOS19 val 89.3、SA-V val/test 78.6/79.5、LVOSv2 val 80.6——在 SA-V 上比 Cutie-base+ 高 17 个点。速度上 Hiera-B+ 43.8 FPS、Hiera-L 30.2 FPS(单 A100),比 SAM 快 6× 且更准。训练用了 ~150k 步、batch 256、8 帧序列(16 帧微调 50k 冻结编码器),损失是 focal(20)+dice(1)+IoU-L1(1)+occ-CE(1),启用 2d-RoPE 与 FlashAttention-2。

post-SAM2:修补 streaming memory 的三大缺陷

SAM 2 的 streaming memory 留下三大未解缺陷 #Xu et al., 2025memory redundancy(FIFO 固定数量冗余)、error accumulation(错误特征跨帧传播)、prompt inefficiency(自动 prompt + 外挂 tracker 低效)。post-SAM2 的工作分别修补:SurgSAM2 用 cosine 剪帧、SAMURAI 用 motion-aware 三分数 + Kalman、SAM2Long 用 training-free memory tree、MoSAM 用时空双级选择。这些本质上都是在保边界时序稳定性——FIFO 冗余会让边界抖动、错误累积会让边界漂移。

组合派代表:Track Anything

在 SAM 2 端到端训练路线之外,还有一个"组合派"代表——Track Anything #Yang et al., 2023(详见精读三)。它不训练新模型,而是 training-free 编排 SAM 逐帧精化 + XMem 记忆传播 + 人在环纠错,四步 Pipeline:Step1 SAM click 初始化 → Step2 XMem 跟踪(保存 probes/affinities)→ Step3 SAM 用 probes/affinities 作点 prompt + XMem mask 作 mask prompt 精化,精化结果回灌 XMem 时序对应(双向耦合)→ Step4 人在环纠错。它用 click 初始化 + one-pass 在 DAVIS-16 达到 J&F 88.4、DAVIS-17 73.1,逼近 mask-init 的 STM(89.3),显著优于 box-init 的 SiamMask(69.8),但低于 mask-init 上界 XMem(92.0/81.2)。

Track Anything 四步 Pipeline
图 8:Track Anything 四步 Pipeline。SAM click 初始化 → XMem 跟踪 → SAM+XMem 双向耦合精化 → 人在环纠错。training-free 把 SAM 静态 mask 边界变成视频时序一致轮廓(来源:Track Anything, Pipeline 图)。

Track Anything 的价值在于交互成本/性能权衡:click 比 scribble/mask 廉价得多,一轮推理 vs MiVOS 8 轮。它的失败案例——长视频 mask shrinkage、复杂孔洞结构——正好预示了 SAM 2 端到端记忆路线。XMem 是 TAM 的记忆引擎,TAM 是 XMem 的交互外壳;TAM 的 Step4 人在环 vs SAM 2 内建点击重置——同源不同实现。

Part 6 · 子方向 C
视频抠像:从 recurrent 到解耦 zero-shot 的时序机制全谱

视频抠像(matting)输出 alpha 蒙版,是发丝级软轮廓的来源。它的数学基础是颜色合成方程:

$$I_i = \alpha_i F_i + (1-\alpha_i) B_i$$

其中 $I$ 是观测像素,$F$ 前景、$B$ 背景、$\alpha\in[0,1]$ 是前景不透明度。3 个方程、7 个未知量($\alpha$$F$$B$ 各 3 通道),严重 ill-posed。$\alpha\in\{0,1\}$ 是纯前/背景,$0<\alpha<1$ 是 transition area——发丝、毛发、半透明物体所在的软轮廓区。这条线的核心叙事是时序机制的完整分化——四篇代表恰好覆盖 recurrent、局部注意力、memory-bank、解耦全部四种。

recurrent 路线:Robust Video Matting

RVM #Lin et al., 2021(详见精读二)是视频抠像的工业落地起点——首次做到 trimap-free、实时、高分辨率视频抠像。它的核心是 ConvGRU 单向 recurrent decoder:隐状态 $h_{t-1}\to h_t$ 因果传播,支持直播流。这与 XMem 的多级 memory+attention 互补,构成视频轮廓提取的两大时序机制分支——recurrent vs memory-bank。

RVM recurrent 架构
图 5:RVM 架构。ConvGRU 单向 recurrent decoder,$h_{t-1}\to h_t$ 因果传播,半通道 split-and-concatenation。3.749M 参数、HD 104 FPS(来源:RVM, Fig.架构)。

RVM 有几个精妙设计。其一,半通道 split-and-concatenation——ConvGRU 仅作用于半数通道,recurrent 半支聚时序、另一半直连当前帧空间特征,省算且信息流并行。其二,隐状态自动重建背景——网络自发学会重建被遮挡背景、跟踪运动、镜头切换时遗忘,recurrent state 实际是一个轻量可学习的场景模型。其三,联合 matting+segmentation 训练——同架构同时输出 α/F/S(5 通道),COCO 人像 mIOU 61.50,去掉分割目标降至 38.24,说明分割监督能防合成过拟合。

RVM 的数字很有说服力:3.749M 参数(MODNet 的 58%)、HD 104 FPS / 4K 76 FPS(1080Ti);VideoMatte240K 低分 MAD 6.08 / MSE 1.47 / Grad 0.88 / dtSSD 1.36 全面 SOTA;高分辨率 1920×1080 SAD 6.57 vs MODNet 11.13。它的损失 $L^M = L^\alpha_{l1}+L^\alpha_{lap}+5L^\alpha_{tc}+L^F_{l1}+5L^F_{tc}$——时序一致性损失 ×5 权重 + recurrent 架构是时序稳定的双重保障。局限也明确:单向无未来帧、recurrent 容量有限(长视频 drift 风险)、多主体/背景人群歧义、发丝精度受限于 backbone 感受野 + DGF。

局部注意力路线:TAM(Attention-guided Temporally Coherent)

与 RVM 几乎同期的 TAM #Zhang et al., 2021(ACM MM 2021)走了完全不同的时序路线——无状态局部注意力。帧 t 仅取 t±1 在 7×7 局部 patch 上做 scaled dot-product attention,双向、仅限未知区、步长 8。它不维护任何跨帧隐状态或记忆库——这是与 RVM(ConvGRU 隐状态压缩)和 XMem/MatAnyone(memory bank 检索)的根本分野。一个反直觉设计是:TAM 用 $L_{af}$ 直接 BCE 监督 attention 权重(来自 GT alpha)——少见的"教网络学正确时间对应"的设计。它是一个可插入 GCA/Index/DIM 的模块,而非全新端到端架构。

TAM 提供了一个重要的度量经验:它实证放弃了 MESSDdt(带光流 warp 的时间一致性损失)——因为即使 SOTA RAFT 光流,半透明像素处仍有严重运动噪声损害性能。主结果在 VideoMatting108 Medium trimap 上 dtSSD 31.64→27.28(-13.8%)、MESSDdt 2.15→1.48(-31.2%),时间相关指标提升最显著。TAM 还揭示了一条隐藏的演化链:它用 STM(VOS)逐帧产 trimap——STM 既是 matting 的 trimap 生成器,也是 VOS memory 机制的直系祖先,两条线在这里交汇。

memory-bank 延伸到 alpha:MatAnyone

MatAnyone 把 XMem 的 memory-bank 范式从 mask 延伸到 alpha——alpha memory bank 直接存 alpha 蒙版(非 mask/trimap),把 VOS memory 的稳定性延伸到 boundary 精度。它的核心是 CMP(Consistency-Modulated Propagation)region-adaptive memory fusion,用 change probability $U_t$ 把帧分 core/boundary 二分处理:

$$P_t = V_t^m \cdot U_t + V_{t-1}\cdot(1-U_t)$$

core 区用记忆传播保稳定、boundary 区用当前帧细节保精度,并用 scaled DDC loss(修正 DDC 的 $|F-B|=1$ 假设)补 VOS 在 boundary 精度的 gap。效果显著:Real benchmark MAD 0.14 vs RVM-Large 0.95(降 85%+),dtSSD 全场最佳。MatAnyone 还贡献了 VM800 数据集(826 视频,2× VideoMatte240K)+ YouTubeMatte(32 视频,加 harmonization)。

MatAnyone pipeline
图 6:MatAnyone pipeline。alpha memory bank + CMP region-adaptive fusion,core 区记忆传播、boundary 区当前帧细节。Real MAD 0.14(来源:MatAnyone, Fig.pipeline)。

解耦 zero-shot:SAM2Matting

SAM2Matting #Shen et al., 2026 提出了最新范式——decoupled tracker-to-matting (t2m):保留既有 VOS tracker(SAM 2/SAM 3)的高层鲁棒性,仅在丰富多样的图像抠像数据上训练专用低层 matting 组件,video matting 做 zero-shot 评估,不依赖任何视频抠像数据训练。这挑战了"必须用视频抠像数据"的共识。它的关键发现来自一个反直觉的 ablation:video fine-tune 会削弱跟踪鲁棒性——即便无遮挡简单场景,video-FT 变体也削弱跟踪——反证 zero-shot decoupled 优于 fine-tune。

SAM2Matting overview
图 7:SAM2Matting decoupled tracker-to-matting。冻结 VOS tracker 提供时间一致 mask → ROI Detector 识别 matting-critical 区 → Progressive Alpha Predictor 多尺度 cascade 生成 alpha(来源:SAM2Matting, Fig.2)。

SAM2Matting 的两个关键设计:ROI Detector 被重新表述为 pixel-wise 二分类(学习式替代 morphological/mask-only),能纠正 tracker 误差(补滑雪杖、删桌子);构造 pseudo-trimap 桥接 mask→alpha。Progressive Alpha Predictor 用 coarse-to-fine cascade + 全尺度 deep supervision,配 matte-mask consistency loss + smoothness loss。SAM2.1-T 变体做到 1080p 40 FPS / <5GB VRAM,VRAM 不随分辨率爆炸。dtSSD 全场最低,实证时序一致性源自冻结 tracker。

至此视频抠像的演化链完整浮现:XMem(mask 边界 + 多级 memory)→ MatAnyone(alpha + memory 传播改造)→ SAM2Matting(解耦 zero-shot),而 RVM(recurrent)、TAM(局部注意力)分别代表了另两种时序机制。三种时序机制 + 解耦,在 matting 这一条线内部全部呈现——这是本文把"时序机制三分"作为技术路线 taxonomy 主轴的实证依据。

Part 7 · 方法矩阵
跨线对比:轮廓表示 × 时序机制 × 数据 × 实时性

把三线代表方法放进同一张矩阵横向对比。这张表是本文的核心证据账本——所有数字都回溯到前述各篇 paper packet。

方法轮廓表示时序机制驱动信号训练数据实时性评测指标(关键数值)代码
EDTER (2022)二值边缘无(下游提及VOS)图像BSDS500+VOC2.2 FPS(470G FLOPs)ODS 0.848开源
PiDiNet (2021)二值边缘图像BSDS500+VOC92 FPS(710K 参数)ODS 0.807(超人类)开源
MGA (2019)显著图边界短程光流+注意力视频DAVIS/FBMS-S-m 0.913 / maxF 0.902开源
XMem (2022)mask 边界memory-bank 三级视频+promptDAVIS/YTVOS-(≤1.4GB/34000帧)J&F(长视频 SOTA)开源
Track Anything (2023)mask 边界SAM+XMem 外挂视频+click无(training-free)one-passDAVIS-16 J&F 88.4开源
SAM 2 (2024)mask 边界streaming memory(原生)视频+promptSA-V 35.5M mask30.2 FPS(Hiera-L)DAVIS17 90.7 / MOSE 77.9 / SA-V +17 vs Cutie开源
TAM (2021)alpha无状态局部注意力视频+trimapVideoMatting108-dtSSD 27.28(-13.8%)开源
RVM (2021)alphaConvGRU recurrent视频(trimap-free)VideoMatte240K/D646/AIMHD 104 / 4K 76 FPSMAD 6.08 / 高分 SAD 6.57开源
MatAnyone (2025)alphamemory-bank(alpha)视频+referenceVM800/YouTubeMatte-Real MAD 0.14(vs RVM 0.95)开源
SAM2Matting (2026)alpha解耦(冻结 tracker)图像 matting(zero-shot 视频)图像 matting 数据1080p 40 FPS(<5GB)dtSSD 全场最低开源

从这张表可以提炼几个跨方法交叉发现。第一,"轮廓表示"与"时序机制"存在协同:二值边缘几乎不带时序(EDTER/PiDiNet 无);mask 边界倾向于 memory-bank(XMem/SAM 2);alpha 蒙版则时序机制最分化(recurrent/局部注意力/memory/解耦都有)。这背后的逻辑是——越软、越细的轮廓(alpha > mask > 边缘),对时序一致性的要求越高、可选机制越多。第二,基础模型同时拉高了数据规模与实时性门槛:SAM 2 的 SA-V 35.5M mask 比此前最大 VOS 数据集大一个数量级,但 Hiera-L 仍做到 30.2 FPS——大规模数据 + 高效架构让它同时赢了精度和速度。第三,解耦范式重新定义了"需要什么数据":SAM2Matting 不依赖视频抠像数据(贵且窄),只用图像 matting 数据训 matting head,却靠冻结 tracker 拿到全场最低 dtSSD——这是数据策略上的反共识突破。

Part 8 · 发展脉络
三阶段演进:手工 → 深度时序化 → 基础模型

2015-2019:经典-深度过渡,per-frame 为主

这一阶段的核心共识是:从手工梯度极值/水平集转向深度全卷积;视频侧仍以光流 + 手工特征为主。边缘:HED #Xie et al., 2015(ICCV 2015)确立深度边缘范式,RCF #Liu et al., 2017(CVPR 2017)富特征融合,BDCN(CVPR 2019)双向级联。VOS:OSVOS(CVPR 2017)one-shot 在线微调是深度学习起点,STM #Oh et al., 2019(ICCV 2019)奠定 memory 范式——这是整条 VOS 线的范式起点。matting:Deep Image Matting #Xu et al., 2017(CVPR 2017)首次深度学习抠像 + Composition-1k 数据集。VSOD:FCNS、DeepVS、MGA #Li et al., 2019(ICCV 2019)把显著检测视频化。这一阶段尚未解决的核心问题是视频时序一致性无原生建模——边缘检测完全没有视频专用线,VOS/matting 还在 per-frame + 后处理阶段。

2020-2022:深度时序化,三种机制成型

这一阶段的核心共识是:时序机制三分成型——recurrent(RVM)、memory-bank(XMem)、局部注意力(TAM);实时化落地。边缘:PiDiNet #Su et al., 2021(ICCV 2021)像素差分轻量超人类,EDTER #Pu et al., 2022(CVPR 2022)Transformer 重型 SOTA。VOS:MiVOS(CVPR 2021)模块化交互+传播,XMem #Cheng et al., 2022(ECCV 2022)多级 memory 长视频,DEVA #Cheng et al., 2023(ICCV 2023)图像-跟踪解耦。matting:MODNet(2020)实时 trimap-free 人像,RVM #Lin et al., 2021 recurrent 实时高分辨率(4K 76 FPS),BGMv2 背景辅助,TAM #Zhang et al., 2021 局部注意力,VideoMatte240K 大规模合成数据,MatteFormer Transformer 抠像。这一阶段的关键能力是三种时序机制全部成型,但长视频 drift、细薄结构、合成→真实 gap 仍未解。

2023-2026:基础模型时代,mask 边界→alpha 软轮廓

这一阶段的核心共识是:SAM/SAM 2 统一图像+视频可提示分割;mask 边界向 alpha 软轮廓精度升级;解耦 zero-shot 兴起。VOS:SAM #Kirillov et al., 2023(ICCV 2023)图像分割基础模型,Track Anything #Yang et al., 2023 SAM+XMem 交互式视频跟踪,SAM 2 #Ravi et al., 2024 streaming memory 原生化 + SA-V 35.5M mask,post-SAM2(SAMURAI/SAM2Long/MoSAM)修补三大缺陷。matting:MatAnyone(CVPR 2025)alpha memory bank + CMP,SAM2Matting #Shen et al., 2026 解耦 tracker-to-matting zero-shot。这一阶段新增能力是基础模型级 VOS、streaming memory 原生时序、alpha memory bank、zero-shot 视频 matting;但无 prompt 全自动、轮廓级评估、长视频身份漂移、非人像通用 matting 仍是开放问题。

转变点之前之后推动力
手工 → 深度Canny / 水平集HED/RCF 全卷积BSDS500 + ImageNet 预训练
per-frame → 时序原生独立帧 + 光流补丁recurrent / memory / 局部注意力三机制视频数据 + 时序损失
专用模型 → 基础模型XMem/Cutie 专用 VOSSAM 2 统一 streaming memorySA-V 35.5M mask + 大规模训练
mask 边界 → alpha 软轮廓二值 maskletSAM2Matting alpha zero-shot图像 matting 数据 + 冻结 tracker
端到端训练 → 解耦 zero-shotfine-tune 视频 matting 数据冻结 tracker + 图像训 matting视频 matting 数据窄且贵

这五个跨阶段转变里,最值得关注的是后两个——它们都发生在 2024-2026:mask 边界→alpha 软轮廓是精度升级(SAM 2 的二值硬边界对发丝无能为力,催生 SAM2Matting 的 alpha 精修);端到端训练→解耦 zero-shot是数据策略转变(视频 matting 数据窄且贵,SAM2Matting 用图像数据 + 冻结 tracker 绕开)。这两个转变共同指向一个判断:未来的视频轮廓提取,很可能不是"更大的端到端模型",而是"基础模型 tracker + 专用精修 head"的解耦组合

Part 9 · 数据集与指标
三套评测体系与一个缺口

三条线各有自己的数据集与指标,但它们都在量"轮廓质量"。

数据集覆盖对象规模常用任务局限
BSDS500边缘500 图多人标边缘检测静态、无视频时序基准
DAVIS16/17VOS30/60 短视频VOS规模小
YouTube-VOSVOS4000+ 视频 85 类VOS-
MOSEVOS2023复杂场景 VOS-
LVOS/LVOSv2VOS长视频,目标消失重现长 VOS-
SA-VVOS50.9K 视频 / 35.5M mask / 196h大规模 VOS自动标注占比高
VideoMatte240Kmatting240K 合成人像视频视频抠像合成伪影
VM800matting826 视频(2× VideoMatte240K)视频抠像-
VideoMatting108matting108 视频时序一致性评测规模小
Composition-1k/AIMmatting1000 合成图像图像抠像标准合成伪影
指标衡量对象适用任务局限 / 常见误用
ODS / OIS / AP边缘 F-measure边缘检测静态、无时序
J(Region)mask IoU 区域相似VOS对边界不敏感
F(Boundary)mask 边界精度 FVOS直接量轮廓,但无紧致度/TCB
SAD / SAD-Talpha 绝对差和matting对边界不敏感(SAD-T 限 transition 区)
GRADalpha 梯度误差matting量边界(轮廓质量)
CONNalpha 连通性误差matting量区域一致性
dtSSD时序稳定性视频 matting全图级,无对象/边界分离
MESSDdt光流 warp 时序视频 matting半透明处光流噪声大(TAM 实证弃用)

这里的关键洞察是三套指标共享同一个被测量对象:ODS(边缘 F)、F(VOS 边界 F1)、GRAD/CONN(alpha 边界)本质都在量"轮廓质量",只是表示不同(二值边缘/mask 边界/alpha 梯度),数字不可直接比较。一个被忽视的度量经验来自 TAM:基于 RAFT 光流的 MESSDdt 在半透明像素处有严重运动噪声,TAM 实证弃用——这提醒我们,时序评测里"光流对齐"类指标要谨慎使用

但三套指标有一个共同的缺口:没有一套统一的"时序轮廓质量"评测。VOS 的 F 量边界但无紧致度/TCB;matting 的 GRAD/CONN 是静态的;dtSSD 全图级、不分离对象。这意味着当我们说"SAM 2 的边界比 XMem好"或"MatAnyone 的 alpha 比 RVM 稳",其实没有一个统一、可跨线比较的时序轮廓指标——这是 Part 10 的核心开放问题之一。

Part 10 · 开放问题
三线共同的未解之处
  1. 细薄/半透明结构(发丝/毛发/网状)的时序无闪烁。这是"轮廓"质量的核心感知,影视/直播刚需。当前三线各有短板:VOS mask 边界粗糙(二值),matting alpha 受 backbone 感受野 + DGF 限,VSOD 无细结构。仍缺统一的时序轮廓 benchmark 来量化"闪烁"。
  2. 长视频身份漂移。长视频是真实场景刚需。SAM 2 的 object pointer / 16 帧微调在极长视频(数百帧以上)仍会身份漂移,post-SAM2(SAM2Long memory tree)在修补但仍未解决;RVM 的 recurrent 容量有限也有 drift 风险。LVOS 之外缺更极端基准。
  3. 轮廓级评估缺失。现有指标不直接量"时序轮廓质量"。VOS F 量边界但无紧致度/TCB;matting GRAD/CONN 静态;dtSSD 全图级无对象分离;光流 warp 类(MESSDdt)半透明处噪声大。亟需公认时序轮廓 benchmark + 指标。
  4. 无显式 prompt 的全自动视频轮廓提取。真实场景不愿逐对象标注,但 SAM 的 automatic prompting 实证不佳 #Zhang et al., 2024——这是视频轮廓"无 prompt"场景的核心短板。Track Anything 用 click 降低成本但仍需人;强 zero-shot 对象发现 + 轮廓是开放方向。
  5. 合成 → 真实 domain gap。视频 matting 数据窄贵,合成集(Composition-1k/VideoMatte240K)有分辨率/噪声/光照不匹配的伪影。缓解策略(RSSN、re-JPEG、RMat、MODNet 子目标一致性)部分有效,但 in-the-wild 大规模真实标注仍缺。
  6. 三种时序机制未统一。recurrent(RVM)、memory-bank(XMem/SAM 2)、局部注意力(TAM)各有局限,统一或自适应路由是潜在突破。当前三机制并列,无统一模型;MatAnyone 把 memory 延伸到 alpha、SAM 2 把 memory 原生化,但机制选择缺理论指导。
  7. 任意主体(非人像)通用 matting。人像之外(动物/透明物/通用)刚需。MODNet/RVM 人像为主,GFM 动物,SAM2Matting 任意(解耦)但受 tracker 质量限制。通用主体大规模评测仍缺。

这七个问题里,最值得强调的是第 3 和第 4——它们是三线的共同瓶颈:评测层面缺统一时序轮廓指标(第 3),应用层面缺无 prompt 全自动(第 4)。前者让"进步难以量化",后者让"落地难以去掉人"。两者合起来,恰恰是"视频轮廓提取"作为独立问题(区别于单纯 VOS 或单纯 matting)的存在理由——如果只看 VOS 或只看 matting,这两个问题都不够尖锐;只有把三线并置,评测缺口和无 prompt 短板才凸显为共性瓶颈。

Part 11 · 小结与系列导航
三线交汇于 SAM 2,精度升级于 alpha

回到本文开头的问题:视频中目标轮廓怎么提、有哪些模型、为什么从边缘检测走到了基础模型 + alpha。答案是:三条技术线(边缘/VSOD、VOS、matting)各自演进,但都在量同一个量——轮廓质量,只是表示不同(二值边缘/mask 边界/alpha)。它们的时序一致性机制收敛到三种(recurrent / memory-bank / 局部注意力),其中 memory-bank 在 SAM 2 被原生化为基础模型的 streaming memory,成为 VOS 的地基。而 mask 边界→alpha 软轮廓的精度升级(SAM 2→SAM2Matting)与端到端→解耦 zero-shot 的数据策略转变(SAM2Matting),共同指向一个判断:未来的视频轮廓提取,很可能不是"更大的端到端模型",而是"基础模型 tracker + 专用 alpha 精修 head"的解耦组合。

一个必须诚实重申的结论:纯"视频边缘检测"没有形成独立模型线。这不是边缘检测社区的失败,而是因为"视频中稳定细轮廓"的真实需求,被 VOS 的 mask 边界和 matting 的 alpha 蒙版更好地满足了——边缘检测的逐帧范式天然不适合时序一致。VSOD 作为桥梁把"轮廓"转写成"显著对象分割",但它的终点也是汇入基础模型。三线最终在 SAM 2 交汇,这不是巧合——基础模型用 streaming memory 把时序一致性原生化,恰好同时满足了 VOS(mask 边界)和 matting(借 tracker 做 alpha 精修)的需要。

本系列的六篇子文为本综述提供完整证据层:三篇核心 survey 参考页建立了各线的 taxonomy 与指标体系,三篇论文精读深入了 must-read 的方法细节。建议阅读路径:先读本文建立全局坐标,再按兴趣选读子文——关心 VOS 全景读 VOS 综述参考,关心基础模型读 SAM 综述参考,关心抠像 taxonomy 读 图像抠像综述参考;方法细节则读三篇精读(SAM 2、RVM、Track Anything)。

系列目录

排序:

文章关系图

9 篇文章 · 23 条连接

参考来源

  • Canny, J. (1986). A Computational Approach to Edge Detection. IEEE TPAMI.
  • Arbeláez, P. et al. (2011). Contour Detection and Hierarchical Image Segmentation (BSDS500). IJCV.
  • Xie, S. & Tu, Z. (2015). Holistically-Nested Edge Detection (HED). ICCV 2015. arXiv:1504.06375
  • Liu, Y. et al. (2017). Richer Convolutional Features (RCF). CVPR 2017. arXiv:1612.02103
  • Xu, N. et al. (2017). Deep Image Matting. CVPR 2017. arXiv:1703.03872
  • Oh, S. W. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
  • Li, Y. et al. (2019). Motion Guided Attention for Video Salient Object Detection (MGA). ICCV 2019. arXiv:1909.07061
  • Su, Z. et al. (2021). Pixel Difference Networks for Efficient Edge Detection (PiDiNet). ICCV 2021. arXiv:2108.07009
  • Pu, M. et al. (2022). EDTER: Edge Detection with Transformer. CVPR 2022. arXiv:2203.08566
  • Cheng, H. K. & Schwing, A. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
  • Cheng, H. K. et al. (2023). Tracking Anything with Decoupled Video Segmentation (DEVA). ICCV 2023. arXiv:2309.03903
  • Lin, S. et al. (2021). Robust High-Resolution Video Matting with Temporal Guidance (RVM). arXiv:2108.11515 · 精读 →
  • Zhang, Y. et al. (2021). Attention-guided Temporally Coherent Video Object Matting (TAM). ACM MM 2021. arXiv:2105.11427 · 精读 →
  • Yang, J. et al. (2023). Track Anything: Segment Anything Meets Videos. arXiv:2304.11968 · 精读 →
  • Kirillov, A. et al. (2023). Segment Anything (SAM). ICCV 2023. arXiv:2304.02643
  • Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. Meta AI. arXiv:2408.00714 · 精读 →
  • Zhang, C. et al. (2024). A Survey on Segment Anything Model (SAM). IEEE. arXiv:2306.06211
  • Xu, G. et al. (2025). Segment Anything for Video: A Comprehensive Review of VOS and Tracking. arXiv:2507.22792
  • Shen, R. et al. (2026). SAM2Matting: Generalized Image and Video Matting. arXiv:2606.27339 · 项目页
  • Zhang, Y. et al. (2023). Deep Image Matting: A Comprehensive Survey. arXiv:2304.04672
  • Xi, R. et al. (2025). MatAnyone: Stable Video Matting with Consistent Memory Propagation. CVPR 2025. arXiv:2501.14677