Track Anything
2023 年 4 月,Meta 发布 Segment Anything Model (SAM) #Kirillov et al., 2023——在 1100 万张图、11 亿 mask 上训练出的图像分割基础模型,支持点/框/语言多模态 prompt,零样本分割能力惊人,实时可交互。一时间"分割一切"成了视觉圈的热词。
但只要把它逐帧跑在一段视频上,问题立刻暴露:第 1 帧分割得很准,第 30 帧的 mask 已经漂到别的物体上去了。SAM 没有"时序对应"(temporal correspondence)这个概念——它每一帧都是孤立决策,不知道上一帧的 target 在这一帧的哪里。
南方科技大学 VIP Lab 的 Track Anything #Yang et al., 2023 提出了一个干脆利落的工程回答:
这一篇是「视频轮廓提取」survey 里"组合派"的代表作:它不训练新模型,而是把 SAM 当成"逐帧精化器"接进 XMem 的记忆回路。读懂它,才能理解后面 SAM2 #Ravi et al., 2024 为什么要把这件事端到端训练一遍。
视频对象跟踪(VOT)与视频对象分割(VOS)是同一类问题的两个粒度:VOT 给 bounding box,VOS 给逐像素 mask——后者可以看作"更细粒度的跟踪"。这两类任务有几个长期痛点 #Yang et al., 2023:
- 标注昂贵:SOTA 跟踪/分割器都在大规模人工标注数据上训练,海量人力藏在数据里。
- 初始化苛刻:半监督 VOS 要求第一帧给出逐像素精确 mask 作初始化,研究者被绑死在画 mask 上。
- 视频本身难:尺度变化、目标形变、运动模糊、相机运动、相似物干扰——即便 SOTA 在公开数据集上也会失败。
SAM 看似能解前两条(强分割 + click 交互),但第三条"时序一致性"它完全不会。论文作者由此提出一个关键问题:
「Can we achieve high-performance tracking/segmentation in videos through the way of interaction?」
也就是说——能不能用极少量人机交互(几次点击)+ 现成模型组合,在视频里拿到高质量、时序一致的跟踪/分割?
TAM 不训练任何新参数。它把 SAM 和 XMem #Cheng et al., 2022 两个现成模型编排进一个"一轮推理"(one-pass)的交互流程。先看三个前置模型各自的长短板,就能看懂 TAM 的"补位"逻辑。
三个模块的互补关系
| 模型 | 长处 | 短板(TAM 要补的) |
|---|---|---|
| SAM #Kirillov et al., 2023 | 零样本强分割、多 prompt 交互、实时 | 无时序对应,视频跨帧不一致 |
| XMem #Cheng et al., 2022 | 记忆式半监督 VOS,多层次特征记忆库,长视频 | |
| MiVOS #Cheng et al., 2021 | scribble 交互精化 | 需多轮 refinement,效率低 |
TAM 的设计恰好三角互补:SAM 提供 click→mask 的廉价初始化(解 XMem ①);人在环纠错 + SAM 精化解 XMem ②;一轮推理解 MiVOS 的多轮问题。
四步交互流程
下图是 TAM 的核心 pipeline,后面四步都对应这张图的箭头。
Step 1 — 用 SAM 初始化
用户在目标上 click(点/框)→ SAM 用 prompt 生成初始 mask。可多次点击修正初始化,直到拿到满意的 mask。这一步把"画逐像素 mask"压缩成"点几下",从根上解决半监督 VOS 的初始化痛点。
Step 2 — 用 XMem 跟踪
初始 mask 交给 XMem,半监督 VOS 在后续帧传播(时序 + 空间对应)。简单场景直接输出 XMem 预测。当 mask 质量评估不佳时,保存 XMem 预测 + 中间参数(probes 与 affinities),转入 Step 3——这两个中间量是 SAM 精化的关键 prompt 来源。
Step 3 — 用 SAM 精化(核心创新)
VOS 模型推理时,mask 会随时间越来越粗糙("coarsening over time")。TAM 把 XMem 的 probes / affinities 投影为点 prompt,把 Step 2 的预测 mask 作为 mask prompt,一起喂给 SAM,输出精化 mask。
Step 4 — 人在环纠错
极端场景(尤其长视频)下仍会失败。用户可强制暂停 TAM,用正/负 click 修正当前帧 mask——"极小人力换质的飞跃"。这是 TAM 对长视频漂移的工程兜底。
为什么叫"一轮推理"(one-pass)
传统交互 VOS(如 MiVOS)要 8 轮 scribble refinement 才能收敛。TAM 靠 SAM 初始化 + Step 3 回灌精化,把交互压到"初始化点击 + 偶尔纠错",主体流程一次跑完——这就是论文强调的 one-pass inference。
TAM 在 DAVIS-2016-val 与 DAVIS-2017-test-dev 上评测,click 初始化 + 一轮评估,结果如下表。
| Method | Venue | Init | Eval | D16 J&F | D16 J | D16 F | D17 J&F | D17 J | D17 F |
|---|---|---|---|---|---|---|---|---|---|
| STM #Oh et al., 2019 | ICCV19 | Mask | One Pass | 89.3 | 88.7 | 89.9 | 72.2 | 69.3 | 75.2 |
| AOT #Yang et al., 2021 | NeurIPS21 | Mask | One Pass | 91.1 | 90.1 | 92.1 | 79.6 | 75.9 | 83.3 |
| XMem #Cheng et al., 2022 | ECCV22 | Mask | One Pass | 92.0 | 90.7 | 93.2 | 81.2 | 77.6 | 84.7 |
| SiamMask #Wang et al., 2019 | CVPR19 | Box | One Pass | 69.8 | 71.7 | 67.8 | – | – | – |
| MiVOS #Cheng et al., 2021 | CVPR21 | Scribble | 8 Rounds | 91.0 | 89.6 | 92.4 | 78.6 | 74.9 | 82.2 |
| TAM (本文) #Yang et al., 2023 | – | Click | One Pass | 88.4 | 87.5 | 89.4 | 73.1 | 69.8 | 76.4 |
怎么读这张表
- D16 上 TAM 拿 88.4 J&F,逼近 mask-init 的 STM(89.3),略低于 8 轮 scribble 的 MiVOS(91.0)和 mask-init 的 XMem(92.0)。但要注意——TAM 用的是最廉价的 click 初始化,且只一轮。
- D17 上 73.1,低于 mask-init 的 AOT/XMem(79.6/81.2),但显著优于 box-init 的 SiamMask(69.8)。
- 真正的卖点不是绝对值,而是交互成本/性能的权衡:click 比 scribble/mask 廉价得多,人只点几下就能逼近需要画 mask 的方法。
定性结果
下图是 DAVIS-16/17 的定性序列,TAM 在仅 click 初始化 + 一轮推理下,能处理多目标分离、目标形变、尺度变化、相机运动。
论文罕见地主动分析失败案例,这恰恰是 survey 最关心的——因为它直接指向"为什么需要 SAM2"。
失败 1:长视频漂移 / mask 收缩
现有 VOS 模型多为短视频设计,偏短期记忆——长视频中会出现 mask shrinkage(mask 越缩越小)或精化不足。Step 3 的 SAM 精化本应缓解,但论文坦诚实际效果低于预期——SAM 的多 prompt 精化能力仍待提升。人在环可解,但过多交互损效率。
失败 2:复杂结构初始化难
自行车轮这种 GT mask 本身含大量孔洞(辐条),click 难以传播出精细初始化 mask → 粗糙 init 污染后续帧 → 全序列预测变差。这说明SAM 对复杂精细结构仍吃力,从 click 到精细 mask 的传播不是万能的。
TAM 不只是一个学术 demo,论文展示了四类应用:
- 高效视频标注:click 交互做 VOS/VOT 标注,低人力高效率。
- 长目标跟踪:能处理镜头切换(shot changes),比限于裁剪视频的传统长期跟踪更贴近实用。
- 友好视频编辑:TAM mask + E²FGVI #Li et al., 2022 做视频 inpainting(移除/替换对象)。
- 可视化开发工具包:提供 VOS/VOT/video inpainting 可视化界面,Hugging Face 在线 demo(watchtowerss/Track-Anything)。
最有说服力的是在电影《Captain America: Civil War (2016)》上的综合测试——大量镜头切换下,TAM 能稳定多目标跟踪并支持 inpainting。
视频轮廓 = 跨帧时序一致的物体边界序列。TAM 每帧输出的 object mask,其边界就是该帧的轮廓——它的全部工作就是把 SAM 的静态 per-frame 边界,升级成时序一致的视频轮廓序列。
组合派 vs 端到端派
| 范式 | 代表 | 怎么做时序 | 训练成本 |
|---|---|---|---|
| 组合派(training-free) | TAM #Yang et al., 2023 | SAM 逐帧精化 + XMem 记忆传播 + 人在环 | 0(即插即用) |
| 端到端派 | SAM 2 #Ravi et al., 2024 | 流式记忆模型,image+video 统一训练 | 大规模联合训练 |
- TAM 是 SAM2 之前"让 SAM 进视频"的轻量解法,代表"先组合后训练"的过渡范式。它证明了 SAM 的 per-frame 精化能力可以注入记忆 VOS 的时序回路(Step 3 回灌)。
- 与 XMem 的关系:TAM 直接复用 XMem 作时序骨干,补其"需精确 mask 初始化"与"长视频失败难恢复"两大短板——XMem 是记忆引擎,TAM 是它的交互外壳。本系列精读 XMem 的文章会展开记忆机制本身。
- 交互纠错范式:Step 4 人在环是"长视频漂移"的工程兜底,与 SAM2 的"可点击重置记忆"思路同源但实现不同——TAM 全靠人工暂停,SAM2 内建点击重置。
- 依赖 SAM 逐帧:无学习到的时序模块,长视频仍漂移(mask shrinkage),SAM 精化实际效果低于预期。
- click 初始化精度上限:复杂精细结构(孔洞/辐条)难以从 click 传播出精细 mask,粗糙 init 污染后续帧。
- 性能低于 mask-init 上界:D16 88.4 < XMem-mask 92.0;D17 73.1 < AOT/XMem 79.6/81.2——click-init 的代价。
- 人在环非自动化:Step 4 依赖人眼发现失败并暂停,难规模化全自动。
- 无端到端联合优化:SAM 与 XMem 各自冻结,Step 3 回灌是启发式耦合,非联合训练。
一句话回顾
- 定位:SAM 进视频的"组合派"应用系统代表,training-free。
- 机制:SAM 初始化 → XMem 跟踪 → SAM 精化(回灌 XMem)→ 人在环纠错。
- 数字:DAVIS-16 J&F 88.4,D17 73.1,click-init + one-pass。
- 价值:把 SAM 静态 mask 边界 → 时序一致视频轮廓;证明 SAM+记忆VOS 可组合。
- 局限:长视频漂移、复杂结构、低于 mask-init 上界——指向 SAM2 端到端路线。
参考来源
- Yang, J. et al. (2023). Track Anything: High-performance Interactive Tracking and Segmentation (Segment Anything Meets Videos). arXiv technical report, SUSTech VIP Lab. arXiv:2304.11968 · 代码 gaomingqi/Track-Anything
- Kirillov, A. et al. (2023). Segment Anything. ICCV 2023, Meta AI Research. arXiv:2304.02643
- Cheng, H. K. and Schwing, A. G. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
- Cheng, H. K. et al. (2021). Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference (MiVOS). CVPR 2021. arXiv:2103.11418
- Oh, S. W. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
- Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). NeurIPS 2021.
- Wang, Q. et al. (2019). Fast Online Object Tracking and Segmentation with a Kernelized Correlation Filter (SiamMask). CVPR 2019.
- Li, Z. et al. (2022). Towards an Efficient Video Inpainting (E²FGVI). CVPR 2022.
- Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. Meta AI. arXiv:2408.00714 · 精读 →