ESC
输入关键词搜索文章
目录

Track Anything

arXiv 2023 · 视频对象跟踪与分割
SAM 逐帧精化 ⊕ XMem 时序记忆 ⊕ 人在环纠错——training-free 让 SAM 学会跟踪视频
4步交互 Pipeline
88.4DAVIS-16 J&F
0额外训练
1轮推理
引子
SAM 能分割图像,但它不会跟踪视频

2023 年 4 月,Meta 发布 Segment Anything Model (SAM) #Kirillov et al., 2023——在 1100 万张图、11 亿 mask 上训练出的图像分割基础模型,支持点/框/语言多模态 prompt,零样本分割能力惊人,实时可交互。一时间"分割一切"成了视觉圈的热词。

但只要把它逐帧跑在一段视频上,问题立刻暴露:第 1 帧分割得很准,第 30 帧的 mask 已经漂到别的物体上去了。SAM 没有"时序对应"(temporal correspondence)这个概念——它每一帧都是孤立决策,不知道上一帧的 target 在这一帧的哪里。

南方科技大学 VIP Lab 的 Track Anything #Yang et al., 2023 提出了一个干脆利落的工程回答:

核心思想:既然 SAM 强在逐帧边界、弱在时序,那就找一个强时序的模型(XMem)搭档,再用人在环纠错兜底——三个现成模块 training-free 编排,把 SAM 的静态 mask 边界,变成跨帧一致的视频轮廓序列。

这一篇是「视频轮廓提取」survey 里"组合派"的代表作:它不训练新模型,而是把 SAM 当成"逐帧精化器"接进 XMem 的记忆回路。读懂它,才能理解后面 SAM2 #Ravi et al., 2024 为什么要把这件事端到端训练一遍。

第一章 · 问题
把 SAM 从图像推广到视频,到底卡在哪

视频对象跟踪(VOT)与视频对象分割(VOS)是同一类问题的两个粒度:VOT 给 bounding box,VOS 给逐像素 mask——后者可以看作"更细粒度的跟踪"。这两类任务有几个长期痛点 #Yang et al., 2023

  • 标注昂贵:SOTA 跟踪/分割器都在大规模人工标注数据上训练,海量人力藏在数据里。
  • 初始化苛刻:半监督 VOS 要求第一帧给出逐像素精确 mask 作初始化,研究者被绑死在画 mask 上。
  • 视频本身难:尺度变化、目标形变、运动模糊、相机运动、相似物干扰——即便 SOTA 在公开数据集上也会失败。

SAM 看似能解前两条(强分割 + click 交互),但第三条"时序一致性"它完全不会。论文作者由此提出一个关键问题:

「Can we achieve high-performance tracking/segmentation in videos through the way of interaction?」

Track Anything, 论文核心设问

也就是说——能不能用极少量人机交互(几次点击)+ 现成模型组合,在视频里拿到高质量、时序一致的跟踪/分割?

第二章 · 方法
TAM 四步 Pipeline:SAM ⊕ XMem ⊕ 人在环

TAM 不训练任何新参数。它把 SAM 和 XMem #Cheng et al., 2022 两个现成模型编排进一个"一轮推理"(one-pass)的交互流程。先看三个前置模型各自的长短板,就能看懂 TAM 的"补位"逻辑。

三个模块的互补关系

模型长处短板(TAM 要补的)
SAM #Kirillov et al., 2023零样本强分割、多 prompt 交互、实时无时序对应,视频跨帧不一致
XMem #Cheng et al., 2022记忆式半监督 VOS,多层次特征记忆库,长视频
  • 需精确 mask 初始化;
  • 长视频失败后难自恢复
  • MiVOS #Cheng et al., 2021scribble 交互精化需多轮 refinement,效率低

    TAM 的设计恰好三角互补:SAM 提供 click→mask 的廉价初始化(解 XMem ①);人在环纠错 + SAM 精化解 XMem ②;一轮推理解 MiVOS 的多轮问题。

    四步交互流程

    下图是 TAM 的核心 pipeline,后面四步都对应这张图的箭头。

    Track Anything Model pipeline: SAM init → XMem track → SAM refine → 人在环纠错
    图 1 · TAM Pipeline(Step 1–4)。用户 click → SAM 出初始 mask → XMem 跨帧传播 → SAM 用 probes/affinities 精化 → 失败时人暂停纠错。来源:#Yang et al., 2023 Fig.1。

    Step 1 — 用 SAM 初始化

    用户在目标上 click(点/框)→ SAM 用 prompt 生成初始 mask。可多次点击修正初始化,直到拿到满意的 mask。这一步把"画逐像素 mask"压缩成"点几下",从根上解决半监督 VOS 的初始化痛点。

    Step 2 — 用 XMem 跟踪

    初始 mask 交给 XMem,半监督 VOS 在后续帧传播(时序 + 空间对应)。简单场景直接输出 XMem 预测。当 mask 质量评估不佳时,保存 XMem 预测 + 中间参数(probes 与 affinities),转入 Step 3——这两个中间量是 SAM 精化的关键 prompt 来源。

    Step 3 — 用 SAM 精化(核心创新)

    VOS 模型推理时,mask 会随时间越来越粗糙("coarsening over time")。TAM 把 XMem 的 probes / affinities 投影为点 prompt,把 Step 2 的预测 mask 作为 mask prompt,一起喂给 SAM,输出精化 mask。

    关键洞察:精化后的 mask 不是用完就丢——它回灌进 XMem 的时序对应,提升后续所有帧的判别。这是 SAM 与 XMem 的"双向耦合",不是简单串联。这正是 TAM 超越"SAM 逐帧独立分割"的地方。

    Step 4 — 人在环纠错

    极端场景(尤其长视频)下仍会失败。用户可强制暂停 TAM,用正/负 click 修正当前帧 mask——"极小人力换质的飞跃"。这是 TAM 对长视频漂移的工程兜底。

    为什么叫"一轮推理"(one-pass)

    传统交互 VOS(如 MiVOS)要 8 轮 scribble refinement 才能收敛。TAM 靠 SAM 初始化 + Step 3 回灌精化,把交互压到"初始化点击 + 偶尔纠错",主体流程一次跑完——这就是论文强调的 one-pass inference

    第三章 · 实验
    DAVIS 上的数字:click 初始化能追到什么水平

    TAM 在 DAVIS-2016-val 与 DAVIS-2017-test-dev 上评测,click 初始化 + 一轮评估,结果如下表。

    MethodVenueInitEvalD16 J&FD16 JD16 FD17 J&FD17 JD17 F
    STM #Oh et al., 2019ICCV19MaskOne Pass89.388.789.972.269.375.2
    AOT #Yang et al., 2021NeurIPS21MaskOne Pass91.190.192.179.675.983.3
    XMem #Cheng et al., 2022ECCV22MaskOne Pass92.090.793.281.277.684.7
    SiamMask #Wang et al., 2019CVPR19BoxOne Pass69.871.767.8
    MiVOS #Cheng et al., 2021CVPR21Scribble8 Rounds91.089.692.478.674.982.2
    TAM (本文) #Yang et al., 2023ClickOne Pass88.487.589.473.169.876.4

    怎么读这张表

    • D16 上 TAM 拿 88.4 J&F,逼近 mask-init 的 STM(89.3),略低于 8 轮 scribble 的 MiVOS(91.0)和 mask-init 的 XMem(92.0)。但要注意——TAM 用的是最廉价的 click 初始化,且只一轮。
    • D17 上 73.1,低于 mask-init 的 AOT/XMem(79.6/81.2),但显著优于 box-init 的 SiamMask(69.8)
    • 真正的卖点不是绝对值,而是交互成本/性能的权衡:click 比 scribble/mask 廉价得多,人只点几下就能逼近需要画 mask 的方法。

    定性结果

    下图是 DAVIS-16/17 的定性序列,TAM 在仅 click 初始化 + 一轮推理下,能处理多目标分离、目标形变、尺度变化、相机运动。

    DAVIS-16/17 定性分割结果:多目标、形变、尺度变化、相机运动
    图 2 · DAVIS-16/17 定性结果。TAM 在多目标分离、形变、尺度变化、相机运动下保持时序一致。来源:#Yang et al., 2023 Fig.2。
    第四章 · 失败案例
    长视频漂移与复杂结构:TAM 自己承认的两类翻车

    论文罕见地主动分析失败案例,这恰恰是 survey 最关心的——因为它直接指向"为什么需要 SAM2"。

    失败案例:(a) 长视频 mask 收缩;(b) 自行车轮复杂孔洞结构初始化失败
    图 3 · 失败案例。seq (a) 长视频 mask 收缩;seq (b) 自行车轮复杂孔洞结构初始化失败。来源:#Yang et al., 2023 Fig.3。

    失败 1:长视频漂移 / mask 收缩

    现有 VOS 模型多为短视频设计,偏短期记忆——长视频中会出现 mask shrinkage(mask 越缩越小)或精化不足。Step 3 的 SAM 精化本应缓解,但论文坦诚实际效果低于预期——SAM 的多 prompt 精化能力仍待提升。人在环可解,但过多交互损效率。

    作者结论:长期记忆保持 + 瞬时记忆更新机制仍关键。这句话基本预告了后续 XMem 改进与 SAM2 流式记忆的方向。

    失败 2:复杂结构初始化难

    自行车轮这种 GT mask 本身含大量孔洞(辐条),click 难以传播出精细初始化 mask → 粗糙 init 污染后续帧 → 全序列预测变差。这说明SAM 对复杂精细结构仍吃力,从 click 到精细 mask 的传播不是万能的。

    第五章 · 应用
    从标注到电影:TAM 的下游场景

    TAM 不只是一个学术 demo,论文展示了四类应用:

    • 高效视频标注:click 交互做 VOS/VOT 标注,低人力高效率。
    • 长目标跟踪:能处理镜头切换(shot changes),比限于裁剪视频的传统长期跟踪更贴近实用。
    • 友好视频编辑:TAM mask + E²FGVI #Li et al., 2022 做视频 inpainting(移除/替换对象)。
    • 可视化开发工具包:提供 VOS/VOT/video inpainting 可视化界面,Hugging Face 在线 demo(watchtowerss/Track-Anything)。

    最有说服力的是在电影《Captain America: Civil War (2016)》上的综合测试——大量镜头切换下,TAM 能稳定多目标跟踪并支持 inpainting。

    电影《美队3》应用:原始帧、对象 mask、inpainting 结果
    图 4 · 电影《Captain America: Civil War》应用:raw frames / object masks / inpainted results。来源:#Yang et al., 2023 Fig.4。
    第六章 · survey 视角
    TAM 在「视频轮廓提取」谱系里的位置

    视频轮廓 = 跨帧时序一致的物体边界序列。TAM 每帧输出的 object mask,其边界就是该帧的轮廓——它的全部工作就是把 SAM 的静态 per-frame 边界,升级成时序一致的视频轮廓序列

    组合派 vs 端到端派

    范式代表怎么做时序训练成本
    组合派(training-free)TAM #Yang et al., 2023SAM 逐帧精化 + XMem 记忆传播 + 人在环0(即插即用)
    端到端派SAM 2 #Ravi et al., 2024流式记忆模型,image+video 统一训练大规模联合训练
    • TAM 是 SAM2 之前"让 SAM 进视频"的轻量解法,代表"先组合后训练"的过渡范式。它证明了 SAM 的 per-frame 精化能力可以注入记忆 VOS 的时序回路(Step 3 回灌)。
    • 与 XMem 的关系:TAM 直接复用 XMem 作时序骨干,补其"需精确 mask 初始化"与"长视频失败难恢复"两大短板——XMem 是记忆引擎,TAM 是它的交互外壳。本系列精读 XMem 的文章会展开记忆机制本身。
    • 交互纠错范式:Step 4 人在环是"长视频漂移"的工程兜底,与 SAM2 的"可点击重置记忆"思路同源但实现不同——TAM 全靠人工暂停,SAM2 内建点击重置。
    局限即下一条线索:TAM 的失败案例(长视频漂移、复杂结构)恰好指向 SAM2 的端到端记忆 + 长期记忆保持机制——是 survey 叙事从"组合"到"端到端"的自然过渡节点。
    第七章 · 局限
    TAM 的天花板在哪
    • 依赖 SAM 逐帧:无学习到的时序模块,长视频仍漂移(mask shrinkage),SAM 精化实际效果低于预期。
    • click 初始化精度上限:复杂精细结构(孔洞/辐条)难以从 click 传播出精细 mask,粗糙 init 污染后续帧。
    • 性能低于 mask-init 上界:D16 88.4 < XMem-mask 92.0;D17 73.1 < AOT/XMem 79.6/81.2——click-init 的代价。
    • 人在环非自动化:Step 4 依赖人眼发现失败并暂停,难规模化全自动。
    • 无端到端联合优化:SAM 与 XMem 各自冻结,Step 3 回灌是启发式耦合,非联合训练。
    收尾
    小结:为什么这篇值得 must-read

    一句话回顾

    • 定位:SAM 进视频的"组合派"应用系统代表,training-free。
    • 机制:SAM 初始化 → XMem 跟踪 → SAM 精化(回灌 XMem)→ 人在环纠错。
    • 数字:DAVIS-16 J&F 88.4,D17 73.1,click-init + one-pass。
    • 价值:把 SAM 静态 mask 边界 → 时序一致视频轮廓;证明 SAM+记忆VOS 可组合。
    • 局限:长视频漂移、复杂结构、低于 mask-init 上界——指向 SAM2 端到端路线。

    参考来源

    • Yang, J. et al. (2023). Track Anything: High-performance Interactive Tracking and Segmentation (Segment Anything Meets Videos). arXiv technical report, SUSTech VIP Lab. arXiv:2304.11968 · 代码 gaomingqi/Track-Anything
    • Kirillov, A. et al. (2023). Segment Anything. ICCV 2023, Meta AI Research. arXiv:2304.02643
    • Cheng, H. K. and Schwing, A. G. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
    • Cheng, H. K. et al. (2021). Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference (MiVOS). CVPR 2021. arXiv:2103.11418
    • Oh, S. W. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
    • Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). NeurIPS 2021.
    • Wang, Q. et al. (2019). Fast Online Object Tracking and Segmentation with a Kernelized Correlation Filter (SiamMask). CVPR 2019.
    • Li, Z. et al. (2022). Towards an Efficient Video Inpainting (E²FGVI). CVPR 2022.
    • Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. Meta AI. arXiv:2408.00714 · 精读 →