视频目标分割参考
视频目标分割与跟踪(Video Object Segmentation and Tracking, VOST)是分割与跟踪的交集——分割给精确边界帮助跟踪锁定目标,跟踪给时序一致性帮助分割抗遮挡漂移 #Xu et al., 2025。综述聚焦 promptable VOST:首帧给 prompt(mask / point / box / text),模型在后续帧传播并保持 ID。它把半监督、弱监督、交互式三类设定的方法要素吸收进「prompt 驱动」统一框架,不单独展开 UVOS、IVOS、RVOS、LVOS 作为独立任务线。
该综述的作者团队来自 UT Southwestern Medical Center / University of Pennsylvania / Mayo Clinic,明显偏医学影像背景,因此综述带医学 VOST 倾斜——专设一节医学数据集(Table 2,9 个数据集覆盖内镜/超声/cine-MRI/结肠镜/显微镜),并在未来方向单列「医学导向基准与数据集」一节。这点与 [30,32,46] 等偏自然场景的老 survey 形成互补定位 #Xu et al., 2025。
综述的四条贡献
- 三时间维度 taxonomy:past(记忆存储/更新)/ present(当前帧判别特征)/ future(运动轨迹估计)——区别于按任务子类型切分的既有 survey,这是本综述最有价值的组织骨架 #Xu et al., 2025;
- 记忆表示三级分类:prompt-level / feature-level / fusion-level + SAM2 记忆更新(pruning / time-scale),把 SAM2 的 streaming memory 定位为 fusion-level 的原生紧耦合形态;
- pre-SAM2 → SAM → SAM2 → post-SAM2 时间线:把「外挂 memory 模块 → SAM+外挂 tracker → streaming memory 原生化 → 修补 SAM2 三大缺陷」串成一条主线;
- 双轨数据集与七开放方向:自然场景 9 个 + 医学场景 9 个,并指出医学 VOST 缺 language-vision 工作(缺数据集)这一明确回流机会。
综述最有价值的贡献是用三时间维度组织所有 SAM/SAM2 方法,而非按任务子类型切分 #Xu et al., 2025。每个维度对应一个核心问题:
三维度定义
- Past(记忆):如何存储/更新历史帧特征?——prompt-level / feature-level / fusion-level + SAM2 记忆更新(pruning / time-scale)。代表:STM, XMem, AOT, MemSAM, SAM-I2V, SAM2 streaming memory, SurgSAM2, SAMURAI, SAM2Long, MoSAM。
- Present(当前帧特征):如何为当前帧学习判别特征?——Adapter-based PETL / LoRA-based PETL。代表:Med-SA, SAM-Med2D, MA-SAM, BLO-SAM, MLE-SAM, VesselSAM。
- Future(运动/轨迹):如何估计下一帧轨迹?——外挂 point tracker / Kalman 运动模型 / motion-aware memory。代表:SAM-PT, Segment Any Motion, SAMURAI。
为什么不按任务子类型切分
既有 survey 多按 SVOS(半监督)/ UVOS(无监督)/ IVOS(交互式)/ RVOS(引用)/ LVOS(长视频)切分任务线 #Gao et al., 2023; Yao et al., 2020。但 SAM2 后这些任务线的方法要素高度融合——SAM2 的 streaming memory 既服务半监督也服务交互式,memory pruning 既解长视频也解遮挡。综述改用三时间维度,把跨任务线的方法统一进同一骨架,凸显 SAM2 前后方法论的真正差异点:pre-SAM2 在 past 维度做外挂记忆,SAM2 把 past 维度原生进基座,post-SAM2 集中修补 past 维度的三大缺陷 #Xu et al., 2025。
past 维度是综述最厚重的部分,给出记忆表示的三层 + 更新两层,共五类分类 #Xu et al., 2025:
记忆表示五类
- Prompt-level:用 prompt token / 历史帧派生 prompt 编码时序记忆。MaskTrack ConvNet(前帧 mask 当输入通道)、AOT/AOST(ID embedding + LSTT)、SAM-Track(SAM+Grounding-DINO+DeAOT)、FlowP-SAM(光流辅助 prompt)、SAM-PD(bbox 传播+多 prompt+point 精修)、HQTrack、DEVA #Xu et al., 2025。
- Feature-level:跨帧维护中间特征。XMem(Atkinson-Shiffrin 三级记忆:sensory/working/long-term + prototype selection + memory potential);MemSAM(空间-时间记忆 + Memory Reinforcement 抑噪 + GRU sensory)#Cheng & Schwing, 2022。
- Fusion-level:融合 prompt + feature。STM/STCN(直接并入 mask)、DeAOT/RMem/XMem++(后处理融合)、SAM-I2V(temporal feature integrator + memory selective associator + memory prompt generator)、MaskTrack(Pixel Context Transformer + Instance Identity Transformer)、SAM2 streaming memory(memory encoder + memory bank + memory attention,紧耦合原生设计)、MedSAM2、BioSAM2 #Xu et al., 2025。
- SAM2 记忆更新 - Pruning-based:Medical SAM2(self-sorting memory bank,按 confidence+dissimilarity 选)、SurgSAM2(cosine similarity 剪帧)、SAMURAI(motion-aware memory selection,三分数:mask affinity + object occurrence + motion score)、SAM2Long(training-free constrained memory tree,多分支+累积质量分)、MoSAM(时空双级选择,时间级 IoU+遮挡分,空间级概率图丢弃不可靠区域)#Xu et al., 2025。
- SAM2 记忆更新 - Time-scale-based:hierarchical sensory/short/long-term——综述指为未来方向,尚无成熟实现 #Xu et al., 2025。
SAM2 的 streaming memory:把外挂记忆原生化
SAM2 的架构由六件套构成:image encoder(Hiera,MAE 预训练的多尺度 hierarchical vision transformer)+ prompt encoder + mask decoder + memory attention(L 个 transformer blocks,self-attention 精修当前帧特征 + cross-attention 整合历史记忆)+ memory encoder(轻量卷积融合 image encoder 特征与预测 mask)+ memory bank(FIFO 队列存固定数量最近帧)#Ravi et al., 2024。关键转折在于:pre-SAM2 把记忆当外挂模块(STM 的全过去帧密集记忆、XMem 的三级手工管理),SAM2 把 memory encoder+bank+attention 原生进基座,紧耦合提效——推理速度 6× 于 SAM,且首次在统一框架下服务图像与视频 #Ravi et al., 2024。
综述明确点名 SAM2 暴露的三大未解缺陷 #Xu et al., 2025:
SAM2 三大缺陷
- Memory redundancy(FIFO 冗余):memory bank 存固定数量最近帧,冗余帧占开销且不一定是关键帧;
- Error accumulation(错误累积):错误/不完整特征进记忆库后跨帧传播,mask 边界漂移越来越严重;
- Prompt inefficiency(prompt 低效):自动 prompt 生成低效 + 依赖外挂 tracker,限制了无显式 prompt 场景(如自动视频轮廓提取)的可用性。
post-SAM2 工作沿四条路线分别修补这三缺陷 #Xu et al., 2025:
路线一:Pruning-based 记忆选择
核心思路是在 FIFO 之上加选择策略——只把可靠/关键帧进 memory bank,从源头切断错误累积与冗余。五个代表方法各有选择信号:
- Medical SAM2 / MedSAM2 #Zhu et al., 2024:self-sorting memory bank,按 confidence + dissimilarity 双指标选帧;2D 切片当视频训练,455K 3D pair + 76K 视频帧。
- SurgSAM2 #Liu et al., 2025:cosine similarity 剪冗余帧,实时手术场景丢弃相似帧省算力。
- SAMURAI #Yang et al., 2025:motion-aware memory selection,三分数——mask affinity + object occurrence + motion score;额外用 Kalman filter 预测 bbox,零样本跟踪强,抗多相似对象/快运动。
- SAM2Long #Ding et al., 2025:training-free constrained memory tree,多分支并行 + 累积 IoU 质量分选,直接解 FIFO 的错误累积。
- MoSAM #Yang et al., 2025b:时空双级选择——时间级 IoU + 遮挡分,空间级概率图丢弃不可靠区域,做到区域级可靠筛选。
路线二:域微调(医学 / LoRA)
MedSAM2、BioSAM2、SurgSAM2 直接在医学域微调 SAM2;MLE-SAM(MoE-LoRA 多模态专家)、VesselSAM(AtrousLoRA + ASPP 多尺度,主动脉血管)走 LoRA 路线 #Xu et al., 2025。这条路线不解决 FIFO 结构问题,而是让 SAM2 在特定域的边界精度达标。
路线三:运动集成
SAMURAI 把 Kalman filter 进 SAM2 的 memory selection;Segment Any Motion 用 depth + 轨迹分组进 SAM2;SAM-PT 用 point tracker(PIPs++/CoTracker)的轨迹当 prompt #Xu et al., 2025。本质是给 future 维度补运动先验,缓解 prompt inefficiency。
路线四:高效化
MobileSAM、EfficientSAM、SAM-Lightening、RepViT-SAM、SqueezeSAM 主要面向 2D 静态场景;SAM2 重 encoder 限制资源受限部署,VOST 的高效化仍是开放问题 #Xu et al., 2025。
综述的数据集章分两张表,反映作者医学背景 #Xu et al., 2025。
Table 1 · 自然场景 VOST 数据集
| Dataset | Objects | Videos | Frames | 特征 |
|---|---|---|---|---|
| SegTrack / v2 | 6/24 | 6/14 | —/976 | 早期短片段基准 |
| DAVIS16 | 50 | 50 | 3,455 | 高质量 VOS,遮挡/快运动/模糊/外观变化 |
| DAVIS17 | 376 | 150 | 10,459 | 多对象扩展,复杂交互 |
| LVOS-V1 | 282 | 220 | 126,280 | 长视频时序一致性 |
| LVOS-V2 | 1,132 | 720 | 296,401 | 更大规模长视频 |
| YouTube-VOS | 7,755 | 4,453 | 120,532 | 大规模多样化 |
| MOSE | 5,200 | 2,149 | — | 拥挤场景、严重遮挡、密集交互 |
| SA-V | — | 50.9K | 4.2M | 大规模细粒度(SAM2 训练集) |
Table 2 · 医学视频数据集
| Dataset | Modality | Target | Videos | Frames | mFPS |
|---|---|---|---|---|---|
| Endovis17 | Endoscopy | 手术器械 | 8 | 2,040 | 2 |
| Endovis18 | Endoscopy | 器械+解剖+非机器人器械 | 90 | 10,700 | 2 |
| CAMUS | Ultrasound | 左室/心肌/心房 | 500 | — | — |
| EchoNet-Dynamic | Ultrasound | 左室 | 10,030 | — | 51 |
| TrackRAD2025 | Cine-MRI | 肿瘤(放疗追踪) | 108 | — | 1~8 |
| Endoscapes | Laparoscopy | 手术工具/解剖/CVS | 201 | 11,090 | 1 |
| SUN-SEG | Colonoscopy | 息肉 | 1,013 | 158,690 | 30 |
| Polyp-Gen | Colonoscopy | 息肉 | 2,225 | 8,037 | — |
| Cell Tracking Challenge | Microscopy | 单细胞 | 52 | — | 25 |
综述采用一组标准指标度量分割与跟踪性能,覆盖区域级精度、边界精度、时空对象级一致性、bbox 跟踪与速度五类 #Xu et al., 2025。
区域级与边界精度(eq.1–4)
IoU / Jaccard J 度量区域重叠 #Xu et al., 2025,其中 $P$ 为预测正像素集,$G$ 为 ground-truth 正像素集:
Boundary F1 Score $F$ 度量边界精度——这正是与轮廓直接对接的指标,其中 precision 与 recall 在边界像素上计算:
$F$ 越高表示预测边界与 ground-truth 边界越吻合——对视频轮廓提取而言,$F$ 是轮廓质量的核心代理指标。J&F 为二者算术平均,是 DAVIS 主指标:
Dice 系数对小结构更敏感:
时空对象级与 bbox 跟踪(eq.5–7)
Challenge IoU(CIoU)遵循 EndoVis2018 协议,在对象级全视频上计算时空全局 IoU,而非逐帧平均 #Xu et al., 2025,其中 $N$ 为总帧数,$P_i, G_i$ 为第 $i$ 帧预测与 ground-truth mask:
CIoU 累积所有帧区域后做全局 IoU,保证时序一致的对象级评估。bbox 跟踪两指标,Success Rate 为 IoU 超阈值帧占比(阈值如 0.5):
Precision 为 bbox 中心距离小于阈值帧占比(阈值如 20 像素):
最后 FPS 度量推理速度,对手术等实时场景关键 #Xu et al., 2025。
综述把 VOST 方法史串成四阶段 #Xu et al., 2025:
四阶段时间线
- pre-SAM2(2019–2023)memory-based encoder-decoder 主线:2019 STM 引入「全过去帧+mask」密集记忆奠基;2021 STCN 改进 STM 共享 encoder;2022 XMem 提出 Atkinson-Shiffrin 三级记忆,长视频 SOTA;AOT/DeAOT 引入 ID 机制 + LSTT。局限:域泛化差、时序一致性、效率、标注成本 #Oh et al., 2019; Cheng & Schwing, 2022。
- SAM 时代(2023)SAM + 外挂 tracker/memory:SAM 在 SA-1B(11M 图/1B mask)上训练,prompt 驱动范式转移。VOST 三策略:
- SAM+tracker(TAM=XMem, SAM-Track=DeAOT);
- point-centric(SAM-PT);
- reverse(HQTrack:VMOS→SAM 精修)。局限:兼容性(SAM 为静态图设计)、错误纠正缺失、Transformer 重 #Kirillov et al., 2023。
- SAM2 转折点(2024)streaming memory 原生统一:SA-V(50.9K 视频/35.5M mask),6× 速于 SAM。架构六件套(见 Part 2)。关键转折:把「外挂记忆」变成「原生 streaming memory」,紧耦合提效 #Ravi et al., 2024。
- post-SAM2(2024–2025)修补 SAM2 三大缺陷:Pruning-based(Medical SAM2/SurgSAM2/SAMURAI/SAM2Long/MoSAM);域微调(MedSAM2/BioSAM2/SurgSAM2/MLE-SAM/VesselSAM);运动集成(SAMURAI/Segment Any Motion/SAM-PT);高效化(MobileSAM 等,VOST 待补)。
四阶段的核心演进逻辑:pre-SAM2 在 past 维度做外挂记忆(STM/XMem 手工管理策略),SAM 时代把 SAM 当 prompt 生成器或 refiner 外挂 tracker,SAM2 把 past 维度原生进基座(streaming memory),post-SAM2 集中修补 past 维度的 FIFO 三大缺陷。present 维度(PETL/LoRA)和 future 维度(运动估计)贯穿始终但权重渐增——post-SAM2 的 SAMURAI 把 future(Kalman)与 past(memory selection)首次原生耦合。
综述 Discussion 列出七个开放方向 #Xu et al., 2025:
- 记忆抽取与更新:现有方法累积冗余/无关信息;pruning 忽略时序一致性、固定时间窗。未来:hierarchical(sensory/short/long)memory in SAM2;residual learning 增量纠错。医学场景需任务先验(心脏周期 vs 呼吸 vs 关节运动模式各异)。
- Language-Vision 多模态融合:RefSAM(T5)、SAM-Track(Grounding-DINO)、SAMWISE、SAM2-LOVE 已探索自然场景;医学 VOST 无 language-vision 工作——缺大规模医学视频-语言数据集。这是明确回流机会点。
- 先验知识改运动估计:SAM-PD/PA-SAM/DAM4SAM 用运动连续性自动生成 prompt;SAM2 级在更深层编码平滑轨迹假设。混合智能(眼动 tracking 当 prompt + 认知先验)。
- 高效跟踪分割:MobileSAM/EfficientSAM/SAM-Lightening/RepViT-SAM/SqueezeSAM 主要面向 2D 静态;SAM2 重 encoder 限制资源受限部署。未来:pruning + quantization + model refactorization。
- 医学导向基准与数据集:通用基准不覆盖临床复杂性(器官形变、低对比、稀疏标注)。需覆盖 2D 视频(荧光/超声/内镜)、3D(CT/MRI 体数据)、2D-on-3D 配准(荧光配 3D 扫描,面外运动)。提到 CyberKnife Xsight Lung Tracking 无标记投影驱动肿瘤跟踪。
- 端到端分割+跟踪联合学习:从解耦管线到统一训练,利用跨任务线索(appearance consistency / motion priors / shape constraints)。BioMedParse、VisTR、Cell-TRACTR 示例。
- 检测辅助筛查与管线自动化:Grounding-DINO 自动 prompt 替代手工标注,detection-first cascade 实现 population-scale 筛查。
与视频轮廓提取的七个对接点
survey 对视频轮廓提取的可用价值
- VOS mask 边界即轮廓:VOST 输出逐帧 mask,mask 边界 = 物体轮廓。综述用 $F$ 直接度量轮廓精度。$J\&F$ 中的 $F$ 项 = 轮廓质量的代理指标 #Xu et al., 2025。
- SAM2 前后边界质量演化:pre-SAM2 边界粗糙(域专一训练 + propagated mask 子优);SAM 时代边界质量跃升但帧间抖动(逐帧独立无时序);SAM2 边界跨帧更稳但 FIFO + 错误累积致长视频/遮挡后漂移;post-SAM2 修补(SAMURAI/SAM2Long/MoSAM)本质保边界时序稳定性。
- SAM2 streaming memory 是视频轮廓时序一致性的现成机制:memory bank 存 keyframe,后续帧复用,handle 遮挡/运动模糊——正是视频轮廓时序一致性的解法。
- $F$ 指标 = 边界轮廓对接点:综述明确把 Boundary F1 作为 VOST 核心指标——这是视频轮廓提取任务与 VOST 评测体系的天然接口。
- 轮廓级方法被综述边缘提及:综述提到「contour evolution strategies」作为 mask propagation 增强技术之一、「convolutional boundary refinement」(COB)——但未系统讨论 active contour / snake / level-set 在视频场景的现代应用,是视频轮廓提取 survey 的补强空间。
- 缺口:综述未讨论轮廓级评估:未涉及 Boundary F1 阈值敏感性、轮廓紧致度、轮廓时序一致性 TCB——这正是视频轮廓提取 survey 可以显化「轮廓」视角的切入点。
- 医学倾斜 = 临床视频轮廓场景:手术器械/息肉/左室/肿瘤的边界跟踪都是临床视频轮廓提取的真实需求,综述医学数据集 + TrackRAD2025 直接可用。
参考页速查
- 综述定位:SAM2 后首篇 past/present/future 三时间维度 VOST 综述,作者偏医学背景,2025-08 创建。
- 核心 taxonomy:past(记忆存储/更新)/ present(当前帧判别特征)/ future(运动轨迹估计)三维度,不按任务子类型切分。
- 记忆表示五类:prompt-level / feature-level / fusion-level + pruning-based / time-scale-based;SAM2 streaming memory = fusion-level 原生紧耦合。
- SAM2 六件套:image encoder(Hiera/MAE) + prompt encoder + mask decoder + memory attention(L transformer, self+cross) + memory encoder(轻量 conv) + memory bank(FIFO)。
- SAM2 三大缺陷:FIFO 冗余 / 错误累积 / prompt 低效——post-SAM2 四路线分别修补(pruning / 域微调 / 运动集成 / 高效化)。
- post-SAM2 五代表:Medical SAM2(self-sorting)/ SurgSAM2(cosine)/ SAMURAI(三分数+Kalman)/ SAM2Long(memory tree)/ MoSAM(时空双级)。
- 数据集双轨:自然 9 个(DAVIS16/17, YouTube-VOS, MOSE, LVOS-V1/V2, SA-V, SegTrack-v2)+ 医学 9 个(Endovis17/18, SUN-SEG, EchoNet-Dynamic, TrackRAD2025, Endoscapes, Polyp-Gen, Cell Tracking, CAMUS)。
- 指标:$J$(区域)/ $F$(边界,轮廓代理)/ $J\&F$(综合)/ Dice(小结构)/ CIoU(时空对象级)/ Success Rate + Precision(bbox)/ FPS。
- 七开放方向:记忆层级化 / language-vision(医学缺数据集)/ 运动先验 / 高效化 / 医学基准 / 端到端联合 / 检测辅助筛查。
- 视频轮廓对接:$F$ 指标 = 边界接口;SAM2 streaming memory = 时序一致机制;post-SAM2 pruning = 边界漂修补;轮廓级评估 = survey 补强空间。
参考来源
- Xu, G. et al. (2025). Segment Anything for Video: A Comprehensive Review of Video Object Segmentation and Tracking from Past to Future. arXiv:2507.22792. arXiv:2507.22792
- Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. arXiv:2408.00714. arXiv:2408.00714 · 精读 →
- Kirillov, A. et al. (2023). Segment Anything. ICCV 2023. arXiv:2304.02643
- Oh, S. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
- Cheng, H. K. & Schwing, A. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
- Cheng, H. K. et al. (2021). Revisiting Video Object Segmentation with a Simplified Framework (STCN). NeurIPS 2021.
- Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). ICCV 2021. arXiv:2106.02638
- Cheng, H. K. et al. (2023). Tracking Anything with Decoupled Video Segmentation (DEVA). ICCV 2023. arXiv:2309.03903
- Yang, M. et al. (2023). Track Anything: Tracking with SAM (TAM). arXiv:2304.11968. arXiv:2304.11968 · 精读 →
- Cheng, J. et al. (2023). SAM-Track: Segment and Track Anything. arXiv:2305.06558. arXiv:2305.06558
- Rajić, L. et al. (2025). SAM-PT: SAM Meets Point Tracking for Video Object Segmentation. IEEE 2025.
- Zhu, J. et al. (2023). HQTrack: Tracking Anything with High-Quality Masks. arXiv:2307.13974. arXiv:2307.13974
- Zhou, T. et al. (2023). SAM-PD: Segment Any Model with Promptable Deblending. arXiv 2023.
- Mei, J. et al. (2024). SAM-I2V: Segment Anything in Images with Promptable Video. arXiv 2024.
- Chen, L. et al. (2024). MaskTrack: Mask Tracking with Pixel Context and Instance Identity Transformers. arXiv 2024. · 精读 →
- Zhu, J. et al. (2024). Medical SAM 2 / MedSAM2: Segment Anything in Medical Videos. arXiv:2408.00874. arXiv:2408.00874
- Yan, Y. et al. (2024). BioSAM2: Biomedical Domain-Adapted SAM2. arXiv 2024.
- Liu, X. et al. (2025). SurgSAM2: Real-Time Surgical Video Segmentation with Frame Pruning. arXiv 2025.
- Yang, C. et al. (2025). SAMURAI: Adapting SAM 2 for Zero-Shot Tracking with Motion-Aware Memory. arXiv 2025.
- Ding, S. et al. (2025). SAM2Long: Enhancing SAM 2 with Constrained Memory Tree for Video Segmentation. arXiv 2025.
- Yang, L. et al. (2025). MoSAM: Motion-Guided SAM with Spatial-Temporal Memory Selection. arXiv 2025.
- Huang, Y. et al. (2025). Segment Any Motion in Videos. IEEE 2025. · 精读 →
- Gao, S. et al. (2023). Deep Learning for Video Object Segmentation: A Review. Artificial Intelligence Review 2023.
- Yao, L. et al. (2020). Video Object Segmentation and Tracking: A Survey. ACM TIST 2020.
- Zhang, C. et al. (2024). A Survey on Segment Anything Model (SAM). arXiv:2306.06211. arXiv:2306.06211