ESC
输入关键词搜索文章
目录

视频目标分割参考

Segment Anything for Video · 2025 · VOST 全景综述
past 记忆 / present 判别 / future 轨迹——三维度重组 SAM 前后的视频分割与跟踪方法地图
3时间维度 taxonomy
5记忆表示类
9+9自然+医学数据集
7开放方向
本文角色:这是「视频轮廓提取」调研的 core-survey 参考页,对应论文 Segment Anything for Video: A Comprehensive Review of Video Object Segmentation and Tracking from Past to Future(Guoping Xu 等,arXiv 2507.22792,2025)#Xu et al., 2025。该综述是 SAM2 发布后首篇以 past/present/future 三时间维度组织全部 VOST 方法的综合 survey——不按 SVOS/UVOS/IVOS/RVOS/LVOS 等任务子类型切分,而用「记忆存储与更新(past)/当前帧判别特征(present)/运动轨迹估计(future)」三维度把 pre-SAM2 的 STM/XMem/AOT、SAM 时代的 SAM-Track/SAM-PT、SAM2 的 streaming memory、post-SAM2 的 SurgSAM2/SAMURAI/SAM2Long/MoSAM 统一进同一骨架。本页做两件事:
  • 把综述的 taxonomy / 记忆表示三级 / SAM2 转折点 / 三大缺陷 / 数据集双轨 / 指标 / 七大开放问题榨取成可查参考骨架;
  • 标注它与「视频轮廓提取」的关系——VOST 的逐帧 mask 边界即物体轮廓,综述用 Boundary F1 Score (F) 直接度量轮廓精度,是视频轮廓提取任务的天然对接点。
  • Part 0 · 综述定位
    为什么要读这篇 VOST survey

    视频目标分割与跟踪(Video Object Segmentation and Tracking, VOST)是分割与跟踪的交集——分割给精确边界帮助跟踪锁定目标,跟踪给时序一致性帮助分割抗遮挡漂移 #Xu et al., 2025。综述聚焦 promptable VOST:首帧给 prompt(mask / point / box / text),模型在后续帧传播并保持 ID。它把半监督、弱监督、交互式三类设定的方法要素吸收进「prompt 驱动」统一框架,不单独展开 UVOS、IVOS、RVOS、LVOS 作为独立任务线。

    该综述的作者团队来自 UT Southwestern Medical Center / University of Pennsylvania / Mayo Clinic,明显偏医学影像背景,因此综述带医学 VOST 倾斜——专设一节医学数据集(Table 2,9 个数据集覆盖内镜/超声/cine-MRI/结肠镜/显微镜),并在未来方向单列「医学导向基准与数据集」一节。这点与 [30,32,46] 等偏自然场景的老 survey 形成互补定位 #Xu et al., 2025

    综述的四条贡献

    • 三时间维度 taxonomy:past(记忆存储/更新)/ present(当前帧判别特征)/ future(运动轨迹估计)——区别于按任务子类型切分的既有 survey,这是本综述最有价值的组织骨架 #Xu et al., 2025
    • 记忆表示三级分类:prompt-level / feature-level / fusion-level + SAM2 记忆更新(pruning / time-scale),把 SAM2 的 streaming memory 定位为 fusion-level 的原生紧耦合形态;
    • pre-SAM2 → SAM → SAM2 → post-SAM2 时间线:把「外挂 memory 模块 → SAM+外挂 tracker → streaming memory 原生化 → 修补 SAM2 三大缺陷」串成一条主线;
    • 双轨数据集与七开放方向:自然场景 9 个 + 医学场景 9 个,并指出医学 VOST 缺 language-vision 工作(缺数据集)这一明确回流机会。
    对视频轮廓提取的启示:VOST 的输出是逐帧 mask,mask 的边界即物体轮廓。综述明确把 Boundary F1 Score (F) 作为核心指标——F 直接度量边界精度,与「视频轮廓提取」的边界质量诉求天然对接。SAM2 的 streaming memory 把静态 mask 边界推广为时序一致边界,是视频轮廓提取的核心现成机制。
    Part 1 · Taxonomy
    past / present / future 三时间维度重组所有方法

    综述最有价值的贡献是用三时间维度组织所有 SAM/SAM2 方法,而非按任务子类型切分 #Xu et al., 2025。每个维度对应一个核心问题:

    三维度定义

    • Past(记忆):如何存储/更新历史帧特征?——prompt-level / feature-level / fusion-level + SAM2 记忆更新(pruning / time-scale)。代表:STM, XMem, AOT, MemSAM, SAM-I2V, SAM2 streaming memory, SurgSAM2, SAMURAI, SAM2Long, MoSAM。
    • Present(当前帧特征):如何为当前帧学习判别特征?——Adapter-based PETL / LoRA-based PETL。代表:Med-SA, SAM-Med2D, MA-SAM, BLO-SAM, MLE-SAM, VesselSAM。
    • Future(运动/轨迹):如何估计下一帧轨迹?——外挂 point tracker / Kalman 运动模型 / motion-aware memory。代表:SAM-PT, Segment Any Motion, SAMURAI。
    promptable VOST 方法总览(past/present/future 三组 + 未来方向)
    图 1 · 综述 Figure 3:promptable VOST 方法总览。三组对应 past(记忆)/ present(当前帧判别)/ future(运动轨迹),下方列出各维度代表方法与未来研究方向 #Xu et al., 2025

    为什么不按任务子类型切分

    既有 survey 多按 SVOS(半监督)/ UVOS(无监督)/ IVOS(交互式)/ RVOS(引用)/ LVOS(长视频)切分任务线 #Gao et al., 2023; Yao et al., 2020。但 SAM2 后这些任务线的方法要素高度融合——SAM2 的 streaming memory 既服务半监督也服务交互式,memory pruning 既解长视频也解遮挡。综述改用三时间维度,把跨任务线的方法统一进同一骨架,凸显 SAM2 前后方法论的真正差异点:pre-SAM2 在 past 维度做外挂记忆,SAM2 把 past 维度原生进基座,post-SAM2 集中修补 past 维度的三大缺陷 #Xu et al., 2025

    核心结论:三时间维度 taxonomy 是本综述区别于既有 VOS survey 的独特视角。对视频轮廓提取而言,past 维度直接决定跨帧边界一致性,future 维度决定运动目标轮廓跟踪精度,present 维度决定单帧边界锐利度——三维度恰好覆盖视频轮廓的时序一致、运动跟踪、单帧精度三大诉求。
    Part 2 · Past 维度
    记忆表示三级 taxonomy 与 SAM2 streaming memory 转折

    past 维度是综述最厚重的部分,给出记忆表示的三层 + 更新两层,共五类分类 #Xu et al., 2025

    记忆表示五类

    1. Prompt-level:用 prompt token / 历史帧派生 prompt 编码时序记忆。MaskTrack ConvNet(前帧 mask 当输入通道)、AOT/AOST(ID embedding + LSTT)、SAM-Track(SAM+Grounding-DINO+DeAOT)、FlowP-SAM(光流辅助 prompt)、SAM-PD(bbox 传播+多 prompt+point 精修)、HQTrack、DEVA #Xu et al., 2025
    2. Feature-level:跨帧维护中间特征。XMem(Atkinson-Shiffrin 三级记忆:sensory/working/long-term + prototype selection + memory potential);MemSAM(空间-时间记忆 + Memory Reinforcement 抑噪 + GRU sensory)#Cheng & Schwing, 2022
    3. Fusion-level:融合 prompt + feature。STM/STCN(直接并入 mask)、DeAOT/RMem/XMem++(后处理融合)、SAM-I2V(temporal feature integrator + memory selective associator + memory prompt generator)、MaskTrack(Pixel Context Transformer + Instance Identity Transformer)、SAM2 streaming memory(memory encoder + memory bank + memory attention,紧耦合原生设计)、MedSAM2、BioSAM2 #Xu et al., 2025
    4. SAM2 记忆更新 - Pruning-based:Medical SAM2(self-sorting memory bank,按 confidence+dissimilarity 选)、SurgSAM2(cosine similarity 剪帧)、SAMURAI(motion-aware memory selection,三分数:mask affinity + object occurrence + motion score)、SAM2Long(training-free constrained memory tree,多分支+累积质量分)、MoSAM(时空双级选择,时间级 IoU+遮挡分,空间级概率图丢弃不可靠区域)#Xu et al., 2025
    5. SAM2 记忆更新 - Time-scale-based:hierarchical sensory/short/long-term——综述指为未来方向,尚无成熟实现 #Xu et al., 2025

    SAM2 的 streaming memory:把外挂记忆原生化

    SAM2 的架构由六件套构成:image encoder(Hiera,MAE 预训练的多尺度 hierarchical vision transformer)+ prompt encoder + mask decoder + memory attention(L 个 transformer blocks,self-attention 精修当前帧特征 + cross-attention 整合历史记忆)+ memory encoder(轻量卷积融合 image encoder 特征与预测 mask)+ memory bank(FIFO 队列存固定数量最近帧)#Ravi et al., 2024。关键转折在于:pre-SAM2 把记忆当外挂模块(STM 的全过去帧密集记忆、XMem 的三级手工管理),SAM2 把 memory encoder+bank+attention 原生进基座,紧耦合提效——推理速度 6× 于 SAM,且首次在统一框架下服务图像与视频 #Ravi et al., 2024

    SAM2 架构:streaming memory 六件套
    图 2 · 综述 Figure 5:SAM2 架构。memory bank 存储历史帧特征,memory attention 模块基于存储的记忆更新当前帧特征,memory encoder 融合图像与预测 mask 特征供后续复用。FIFO 队列保留固定数量最近帧 #Ravi et al., 2024
    基础 VOST encoder-decoder + 记忆管线
    图 3 · 综述 Figure 1:基础 VOST 管线。encoder-decoder 架构 + 记忆模块读写历史帧特征,是 pre-SAM2 与 SAM2 共享的骨架,区别仅在记忆是否原生 #Xu et al., 2025
    对视频轮廓提取的启示:SAM2 streaming memory 的 FIFO 队列决定跨帧边界一致性——记忆库里的 keyframe mask 边界质量会传播到后续帧。一旦错误 mask 进 memory bank,其边界会跨帧累积漂移。这正是 post-SAM2 修补路线要解决的核心问题(见 Part 3)。
    Part 3 · post-SAM2 修补
    SAM2 三大缺陷与四条修补路线

    综述明确点名 SAM2 暴露的三大未解缺陷 #Xu et al., 2025

    SAM2 三大缺陷

    • Memory redundancy(FIFO 冗余):memory bank 存固定数量最近帧,冗余帧占开销且不一定是关键帧;
    • Error accumulation(错误累积):错误/不完整特征进记忆库后跨帧传播,mask 边界漂移越来越严重;
    • Prompt inefficiency(prompt 低效):自动 prompt 生成低效 + 依赖外挂 tracker,限制了无显式 prompt 场景(如自动视频轮廓提取)的可用性。

    post-SAM2 工作沿四条路线分别修补这三缺陷 #Xu et al., 2025

    路线一:Pruning-based 记忆选择

    核心思路是在 FIFO 之上加选择策略——只把可靠/关键帧进 memory bank,从源头切断错误累积与冗余。五个代表方法各有选择信号:

    • Medical SAM2 / MedSAM2 #Zhu et al., 2024:self-sorting memory bank,按 confidence + dissimilarity 双指标选帧;2D 切片当视频训练,455K 3D pair + 76K 视频帧。
    • SurgSAM2 #Liu et al., 2025:cosine similarity 剪冗余帧,实时手术场景丢弃相似帧省算力。
    • SAMURAI #Yang et al., 2025:motion-aware memory selection,三分数——mask affinity + object occurrence + motion score;额外用 Kalman filter 预测 bbox,零样本跟踪强,抗多相似对象/快运动。
    • SAM2Long #Ding et al., 2025:training-free constrained memory tree,多分支并行 + 累积 IoU 质量分选,直接解 FIFO 的错误累积。
    • MoSAM #Yang et al., 2025b:时空双级选择——时间级 IoU + 遮挡分,空间级概率图丢弃不可靠区域,做到区域级可靠筛选。
    SAMURAI motion-aware memory selection
    图 4 · 综述 Figure 14:SAMURAI motion-aware memory selection。三分数(mask affinity + object occurrence + motion score)+ Kalman filter bbox 预测,是 post-SAM2 pruning + future 双维代表 #Xu et al., 2025
    SAM2Long constrained memory tree
    图 5 · 综述 Figure 15:SAM2Long constrained memory tree。多分支并行 + 累积 IoU 质量分,training-free 解决 FIFO 错误累积——本质是给 memory bank 加分支竞争 #Xu et al., 2025

    路线二:域微调(医学 / LoRA)

    MedSAM2、BioSAM2、SurgSAM2 直接在医学域微调 SAM2;MLE-SAM(MoE-LoRA 多模态专家)、VesselSAM(AtrousLoRA + ASPP 多尺度,主动脉血管)走 LoRA 路线 #Xu et al., 2025。这条路线不解决 FIFO 结构问题,而是让 SAM2 在特定域的边界精度达标。

    路线三:运动集成

    SAMURAI 把 Kalman filter 进 SAM2 的 memory selection;Segment Any Motion 用 depth + 轨迹分组进 SAM2;SAM-PT 用 point tracker(PIPs++/CoTracker)的轨迹当 prompt #Xu et al., 2025。本质是给 future 维度补运动先验,缓解 prompt inefficiency。

    路线四:高效化

    MobileSAM、EfficientSAM、SAM-Lightening、RepViT-SAM、SqueezeSAM 主要面向 2D 静态场景;SAM2 重 encoder 限制资源受限部署,VOST 的高效化仍是开放问题 #Xu et al., 2025

    对视频轮廓提取的启示:post-SAM2 的 pruning 路线本质是在保边界时序稳定性——memory selection 减少错误 mask 进记忆库→边界不漂移。SAMURAI 的 motion score + Kalman 对运动目标轮廓跟踪、SAM2Long 的多分支对长视频轮廓一致性、MoSAM 的空间概率图对遮挡区域边界,都是视频轮廓提取可直接复用的机制。
    Part 4 · 数据集
    9 自然场景 + 9 医学场景数据集双轨

    综述的数据集章分两张表,反映作者医学背景 #Xu et al., 2025

    Table 1 · 自然场景 VOST 数据集

    DatasetObjectsVideosFrames特征
    SegTrack / v26/246/14—/976早期短片段基准
    DAVIS1650503,455高质量 VOS,遮挡/快运动/模糊/外观变化
    DAVIS1737615010,459多对象扩展,复杂交互
    LVOS-V1282220126,280长视频时序一致性
    LVOS-V21,132720296,401更大规模长视频
    YouTube-VOS7,7554,453120,532大规模多样化
    MOSE5,2002,149拥挤场景、严重遮挡、密集交互
    SA-V50.9K4.2M大规模细粒度(SAM2 训练集)

    Table 2 · 医学视频数据集

    DatasetModalityTargetVideosFramesmFPS
    Endovis17Endoscopy手术器械82,0402
    Endovis18Endoscopy器械+解剖+非机器人器械9010,7002
    CAMUSUltrasound左室/心肌/心房500
    EchoNet-DynamicUltrasound左室10,03051
    TrackRAD2025Cine-MRI肿瘤(放疗追踪)1081~8
    EndoscapesLaparoscopy手术工具/解剖/CVS20111,0901
    SUN-SEGColonoscopy息肉1,013158,69030
    Polyp-GenColonoscopy息肉2,2258,037
    Cell Tracking ChallengeMicroscopy单细胞5225
    覆盖盲区(回流缺口):综述列入 MeViS(Motion-guided VOS,CVPR 2023)、BURST(open-world long video)、Ref-YouTube-VOS(RVOS 专用集)等较新基准——这是综述覆盖盲区,视频轮廓提取 survey 应补这些以覆盖运动引导与开放世界场景。
    Part 5 · 评价指标
    J & F 与 CIoU:区域 + 边界 + 时空对象级

    综述采用一组标准指标度量分割与跟踪性能,覆盖区域级精度、边界精度、时空对象级一致性、bbox 跟踪与速度五类 #Xu et al., 2025

    区域级与边界精度(eq.1–4)

    IoU / Jaccard J 度量区域重叠 #Xu et al., 2025,其中 $P$ 为预测正像素集,$G$ 为 ground-truth 正像素集:

    $$J = \frac{|P \cap G|}{|P \cup G|}$$

    Boundary F1 Score $F$ 度量边界精度——这正是与轮廓直接对接的指标,其中 precision 与 recall 在边界像素上计算:

    $$F = \frac{2 \cdot \mathrm{Precision} \cdot \mathrm{Recall}}{\mathrm{Precision} + \mathrm{Recall}}$$

    $F$ 越高表示预测边界与 ground-truth 边界越吻合——对视频轮廓提取而言,$F$ 是轮廓质量的核心代理指标。J&F 为二者算术平均,是 DAVIS 主指标:

    $$J\&F = \frac{J + F}{2}$$

    Dice 系数对小结构更敏感:

    $$\mathrm{Dice} = \frac{2|P \cap G|}{|P| + |G|}$$

    时空对象级与 bbox 跟踪(eq.5–7)

    Challenge IoU(CIoU)遵循 EndoVis2018 协议,在对象级全视频上计算时空全局 IoU,而非逐帧平均 #Xu et al., 2025,其中 $N$ 为总帧数,$P_i, G_i$ 为第 $i$ 帧预测与 ground-truth mask:

    $$\mathrm{CIoU} = \frac{\left|\bigcup_{i=1}^{N} P_i \cap \bigcup_{i=1}^{N} G_i\right|}{\left|\bigcup_{i=1}^{N} P_i \cup \bigcup_{i=1}^{N} G_i\right|}$$

    CIoU 累积所有帧区域后做全局 IoU,保证时序一致的对象级评估。bbox 跟踪两指标,Success Rate 为 IoU 超阈值帧占比(阈值如 0.5):

    $$\mathrm{Success\ Rate} = \frac{\text{Number of successful frames}}{\text{Total number of frames}}$$

    Precision 为 bbox 中心距离小于阈值帧占比(阈值如 20 像素):

    $$\mathrm{Precision} = \frac{\text{Number of frames with center error} < \mathrm{threshold}}{\text{Total number of frames}}$$

    最后 FPS 度量推理速度,对手术等实时场景关键 #Xu et al., 2025

    对视频轮廓提取的启示:综述明确把 $F$ 作为 VOST 核心指标之一——$F$ 直接度量边界精度,与「视频轮廓提取」任务的边界质量诉求天然对接。但综述讨论轮廓级评估(如 Boundary F1 的阈值敏感性、轮廓紧致度、轮廓时序一致性 TCB),这正是视频轮廓提取 survey 可以补强的视角——把「轮廓」从 mask 任务里显化出来。
    Part 6 · 时间线
    pre-SAM2 → SAM → SAM2 → post-SAM2 四阶段

    综述把 VOST 方法史串成四阶段 #Xu et al., 2025

    四阶段时间线

    • pre-SAM2(2019–2023)memory-based encoder-decoder 主线:2019 STM 引入「全过去帧+mask」密集记忆奠基;2021 STCN 改进 STM 共享 encoder;2022 XMem 提出 Atkinson-Shiffrin 三级记忆,长视频 SOTA;AOT/DeAOT 引入 ID 机制 + LSTT。局限:域泛化差、时序一致性、效率、标注成本 #Oh et al., 2019; Cheng & Schwing, 2022
    • SAM 时代(2023)SAM + 外挂 tracker/memory:SAM 在 SA-1B(11M 图/1B mask)上训练,prompt 驱动范式转移。VOST 三策略:
    • SAM+tracker(TAM=XMem, SAM-Track=DeAOT);
    • point-centric(SAM-PT);
    • reverse(HQTrack:VMOS→SAM 精修)。局限:兼容性(SAM 为静态图设计)、错误纠正缺失、Transformer 重
    • #Kirillov et al., 2023
    • SAM2 转折点(2024)streaming memory 原生统一:SA-V(50.9K 视频/35.5M mask),6× 速于 SAM。架构六件套(见 Part 2)。关键转折:把「外挂记忆」变成「原生 streaming memory」,紧耦合提效 #Ravi et al., 2024
    • post-SAM2(2024–2025)修补 SAM2 三大缺陷:Pruning-based(Medical SAM2/SurgSAM2/SAMURAI/SAM2Long/MoSAM);域微调(MedSAM2/BioSAM2/SurgSAM2/MLE-SAM/VesselSAM);运动集成(SAMURAI/Segment Any Motion/SAM-PT);高效化(MobileSAM 等,VOST 待补)。

    四阶段的核心演进逻辑:pre-SAM2 在 past 维度做外挂记忆(STM/XMem 手工管理策略),SAM 时代把 SAM 当 prompt 生成器或 refiner 外挂 tracker,SAM2 把 past 维度原生进基座(streaming memory),post-SAM2 集中修补 past 维度的 FIFO 三大缺陷。present 维度(PETL/LoRA)和 future 维度(运动估计)贯穿始终但权重渐增——post-SAM2 的 SAMURAI 把 future(Kalman)与 past(memory selection)首次原生耦合。

    核心结论:视频轮廓提取的演进与 VOST 同步——pre-SAM2 的边界粗糙(域专一训练 + propagated mask 子优),SAM 时代边界质量跃升但帧间抖动(逐帧独立无时序),SAM2 边界跨帧更稳但长视频/遮挡后漂移(FIFO + 错误累积),post-SAM2 修补本质是保边界时序稳定性。
    Part 7 · 开放问题与关系
    七大开放方向与视频轮廓提取的对接点

    综述 Discussion 列出七个开放方向 #Xu et al., 2025

    1. 记忆抽取与更新:现有方法累积冗余/无关信息;pruning 忽略时序一致性、固定时间窗。未来:hierarchical(sensory/short/long)memory in SAM2;residual learning 增量纠错。医学场景需任务先验(心脏周期 vs 呼吸 vs 关节运动模式各异)。
    2. Language-Vision 多模态融合:RefSAM(T5)、SAM-Track(Grounding-DINO)、SAMWISE、SAM2-LOVE 已探索自然场景;医学 VOST 无 language-vision 工作——缺大规模医学视频-语言数据集。这是明确回流机会点。
    3. 先验知识改运动估计:SAM-PD/PA-SAM/DAM4SAM 用运动连续性自动生成 prompt;SAM2 级在更深层编码平滑轨迹假设。混合智能(眼动 tracking 当 prompt + 认知先验)。
    4. 高效跟踪分割:MobileSAM/EfficientSAM/SAM-Lightening/RepViT-SAM/SqueezeSAM 主要面向 2D 静态;SAM2 重 encoder 限制资源受限部署。未来:pruning + quantization + model refactorization。
    5. 医学导向基准与数据集:通用基准不覆盖临床复杂性(器官形变、低对比、稀疏标注)。需覆盖 2D 视频(荧光/超声/内镜)、3D(CT/MRI 体数据)、2D-on-3D 配准(荧光配 3D 扫描,面外运动)。提到 CyberKnife Xsight Lung Tracking 无标记投影驱动肿瘤跟踪。
    6. 端到端分割+跟踪联合学习:从解耦管线到统一训练,利用跨任务线索(appearance consistency / motion priors / shape constraints)。BioMedParse、VisTR、Cell-TRACTR 示例。
    7. 检测辅助筛查与管线自动化:Grounding-DINO 自动 prompt 替代手工标注,detection-first cascade 实现 population-scale 筛查。

    与视频轮廓提取的七个对接点

    survey 对视频轮廓提取的可用价值

    1. VOS mask 边界即轮廓:VOST 输出逐帧 mask,mask 边界 = 物体轮廓。综述用 $F$ 直接度量轮廓精度。$J\&F$ 中的 $F$ 项 = 轮廓质量的代理指标 #Xu et al., 2025
    2. SAM2 前后边界质量演化:pre-SAM2 边界粗糙(域专一训练 + propagated mask 子优);SAM 时代边界质量跃升但帧间抖动(逐帧独立无时序);SAM2 边界跨帧更稳但 FIFO + 错误累积致长视频/遮挡后漂移;post-SAM2 修补(SAMURAI/SAM2Long/MoSAM)本质保边界时序稳定性。
    3. SAM2 streaming memory 是视频轮廓时序一致性的现成机制:memory bank 存 keyframe,后续帧复用,handle 遮挡/运动模糊——正是视频轮廓时序一致性的解法。
    4. $F$ 指标 = 边界轮廓对接点:综述明确把 Boundary F1 作为 VOST 核心指标——这是视频轮廓提取任务与 VOST 评测体系的天然接口。
    5. 轮廓级方法被综述边缘提及:综述提到「contour evolution strategies」作为 mask propagation 增强技术之一、「convolutional boundary refinement」(COB)——但系统讨论 active contour / snake / level-set 在视频场景的现代应用,是视频轮廓提取 survey 的补强空间。
    6. 缺口:综述未讨论轮廓级评估:未涉及 Boundary F1 阈值敏感性、轮廓紧致度、轮廓时序一致性 TCB——这正是视频轮廓提取 survey 可以显化「轮廓」视角的切入点。
    7. 医学倾斜 = 临床视频轮廓场景:手术器械/息肉/左室/肿瘤的边界跟踪都是临床视频轮廓提取的真实需求,综述医学数据集 + TrackRAD2025 直接可用。
    核心结论:这篇综述为「视频轮廓提取」提供四件可直接复用的资产:
  • past/present/future 三时间维度 taxonomy(重组 SAM 前后所有方法的骨架);
  • SAM2 streaming memory(视频轮廓时序一致性的现成机制);
  • $F$ 指标(边界轮廓质量的天然接口);
  • SAM2 三大缺陷 + post-SAM2 修补路线(视频轮廓在长视频/遮挡后漂移的解法地图)。其点名 hierarchical memory / language-vision / 轮廓级评估三个缺口,正是视频轮廓提取 survey 的补强空间。
  • 参考页速查

    • 综述定位:SAM2 后首篇 past/present/future 三时间维度 VOST 综述,作者偏医学背景,2025-08 创建。
    • 核心 taxonomy:past(记忆存储/更新)/ present(当前帧判别特征)/ future(运动轨迹估计)三维度,不按任务子类型切分。
    • 记忆表示五类:prompt-level / feature-level / fusion-level + pruning-based / time-scale-based;SAM2 streaming memory = fusion-level 原生紧耦合。
    • SAM2 六件套:image encoder(Hiera/MAE) + prompt encoder + mask decoder + memory attention(L transformer, self+cross) + memory encoder(轻量 conv) + memory bank(FIFO)。
    • SAM2 三大缺陷:FIFO 冗余 / 错误累积 / prompt 低效——post-SAM2 四路线分别修补(pruning / 域微调 / 运动集成 / 高效化)。
    • post-SAM2 五代表:Medical SAM2(self-sorting)/ SurgSAM2(cosine)/ SAMURAI(三分数+Kalman)/ SAM2Long(memory tree)/ MoSAM(时空双级)。
    • 数据集双轨:自然 9 个(DAVIS16/17, YouTube-VOS, MOSE, LVOS-V1/V2, SA-V, SegTrack-v2)+ 医学 9 个(Endovis17/18, SUN-SEG, EchoNet-Dynamic, TrackRAD2025, Endoscapes, Polyp-Gen, Cell Tracking, CAMUS)。
    • 指标$J$(区域)/ $F$(边界,轮廓代理)/ $J\&F$(综合)/ Dice(小结构)/ CIoU(时空对象级)/ Success Rate + Precision(bbox)/ FPS。
    • 七开放方向:记忆层级化 / language-vision(医学缺数据集)/ 运动先验 / 高效化 / 医学基准 / 端到端联合 / 检测辅助筛查。
    • 视频轮廓对接$F$ 指标 = 边界接口;SAM2 streaming memory = 时序一致机制;post-SAM2 pruning = 边界漂修补;轮廓级评估 = survey 补强空间。

    参考来源

    • Xu, G. et al. (2025). Segment Anything for Video: A Comprehensive Review of Video Object Segmentation and Tracking from Past to Future. arXiv:2507.22792. arXiv:2507.22792
    • Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. arXiv:2408.00714. arXiv:2408.00714 · 精读 →
    • Kirillov, A. et al. (2023). Segment Anything. ICCV 2023. arXiv:2304.02643
    • Oh, S. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
    • Cheng, H. K. & Schwing, A. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
    • Cheng, H. K. et al. (2021). Revisiting Video Object Segmentation with a Simplified Framework (STCN). NeurIPS 2021.
    • Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). ICCV 2021. arXiv:2106.02638
    • Cheng, H. K. et al. (2023). Tracking Anything with Decoupled Video Segmentation (DEVA). ICCV 2023. arXiv:2309.03903
    • Yang, M. et al. (2023). Track Anything: Tracking with SAM (TAM). arXiv:2304.11968. arXiv:2304.11968 · 精读 →
    • Cheng, J. et al. (2023). SAM-Track: Segment and Track Anything. arXiv:2305.06558. arXiv:2305.06558
    • Rajić, L. et al. (2025). SAM-PT: SAM Meets Point Tracking for Video Object Segmentation. IEEE 2025.
    • Zhu, J. et al. (2023). HQTrack: Tracking Anything with High-Quality Masks. arXiv:2307.13974. arXiv:2307.13974
    • Zhou, T. et al. (2023). SAM-PD: Segment Any Model with Promptable Deblending. arXiv 2023.
    • Mei, J. et al. (2024). SAM-I2V: Segment Anything in Images with Promptable Video. arXiv 2024.
    • Chen, L. et al. (2024). MaskTrack: Mask Tracking with Pixel Context and Instance Identity Transformers. arXiv 2024. · 精读 →
    • Zhu, J. et al. (2024). Medical SAM 2 / MedSAM2: Segment Anything in Medical Videos. arXiv:2408.00874. arXiv:2408.00874
    • Yan, Y. et al. (2024). BioSAM2: Biomedical Domain-Adapted SAM2. arXiv 2024.
    • Liu, X. et al. (2025). SurgSAM2: Real-Time Surgical Video Segmentation with Frame Pruning. arXiv 2025.
    • Yang, C. et al. (2025). SAMURAI: Adapting SAM 2 for Zero-Shot Tracking with Motion-Aware Memory. arXiv 2025.
    • Ding, S. et al. (2025). SAM2Long: Enhancing SAM 2 with Constrained Memory Tree for Video Segmentation. arXiv 2025.
    • Yang, L. et al. (2025). MoSAM: Motion-Guided SAM with Spatial-Temporal Memory Selection. arXiv 2025.
    • Huang, Y. et al. (2025). Segment Any Motion in Videos. IEEE 2025. · 精读 →
    • Gao, S. et al. (2023). Deep Learning for Video Object Segmentation: A Review. Artificial Intelligence Review 2023.
    • Yao, L. et al. (2020). Video Object Segmentation and Tracking: A Survey. ACM TIST 2020.
    • Zhang, C. et al. (2024). A Survey on Segment Anything Model (SAM). arXiv:2306.06211. arXiv:2306.06211