分割基础模型参考
Segment Anything Model(SAM)由 Meta AI Research 于 2023-04 发布,是首个可提示的分割基础模型(promptable segmentation foundation model),在 10 亿级 SA-1B mask 上训练,实现零样本分割 #Kirillov et al., 2023。2024-07-29 Meta 发布 SAM 2,把可提示分割从图像推广到视频,引入 streaming memory 架构处理时序一致性 #Ravi et al., 2024。
本综述的定位明确:在 SAM 发布后、SAM 2 发布后,第一篇同时覆盖 SAM 与 SAM 2 的综合 survey #Zhang et al., 2024。作者用 PRISMA(Preferred Reporting Items for Systematic Reviews and Meta-Analyses)#Page et al., 2021 框架系统检索,时间窗 2023-04 至 2024-09,关键词 "segment anything model" / "SAM",初筛 428 篇 → 排除(仅作 trivial 分割工具 / survey & review / arXiv 发表超 6 个月零引用)→ 终筛 192 篇主文章 #Zhang et al., 2024。作者明示纳入 arXiv,因 CV 迭代快于同行评审周期。
综述的四条贡献
- 首次统一综述 SAM 与 SAM 2 家族(Table 1 对比 5 篇既有 survey,本 survey 是唯一在 Architecture / Datasets / Applications 三列全打 ✓ 的);
- 以 segmentation granularity(whole / part / sub-part / additional 四 query)为线索组织全文;
- 梳理 6 大应用域 taxonomy(图像 / 视频 / 3D / 多模态 / 人机交互 / 专用域);
- 讨论局限与未来方向,点名 SAM2 memory bank 的算力瓶颈与 memory-efficient attention 方向。
与既有 survey 的差异化(survey Table 1):zhang2023comprehensive 偏 SAM 架构+图像;zhang2024segment 偏 SAM2+视频;zhou2024image 偏基础模型泛论;zhang2023towards 偏医疗;zhang2024unleashing 偏 SAM2 生物医学。本综述是唯一全覆盖者 #Zhang et al., 2024。
本综述对 SAM1 架构的描述偏高层,核心在「granularity 创新」。结合原 SAM 论文 #Kirillov et al., 2023 与本综述 sections/importance.tex 的论述,SAM 由三组件构成:
SAM 三组件架构
- Image Encoder:ViT backbone(MAE 预训练),单张图像编码一次,多 prompt 复用同一 image embedding——设计上把昂贵编码摊到多 prompt,是可提示交互的效率基础 #Kirillov et al., 2023。
- Prompt Encoder:接受 point / box / mask / text 四类 prompt。point/box 经位置编码 + type embedding;mask 经 conv 下采样与 image embedding 对齐;text 经 CLIP 文本编码器 #Kirillov et al., 2023。
- Mask Decoder:轻量 transformer,ambiguity-aware parallel decoding——并行解码 4 个 object query:whole / part / sub-part / additional(additional 仅多 prompt 时返回)。借鉴 DETR #Carion et al., 2020 与 MaskFormer #Cheng et al., 2021 的并行 query 思想(非自回归),每个 query 独立计算 loss 而非平均为单一 class #Zhang et al., 2024。
歧义感知解码:为什么 SAM 能分出茶壶盖
survey §Innovations in Segmentation Granularity 强调:SAM 的真正能力在于粒度识别——给一张茶壶图,SAM 不仅能分出整壶,还能同时分出壶盖、壶身、壶把 #Zhang et al., 2024。这源于歧义感知解码与语义无约束 mask 标注的交互。
并行 4 query:transformer 同时处理多个 object query(类似 ViT 的 [class] embedding),而非自回归。4 个 query 分别对应 whole / part / sub-part / additional,解码时对每个 query 独立计算 ground-truth 与预测 mask 的 loss,而非平均为单一固定类 #Zhang et al., 2024。
语义无约束标注:SA-1B 的 4.3M 手工精标 mask 允许图中所有物体被单独分割,不限定语义类——偶尔存在无法用清晰语义类描述的物体(或语义分类本身不明确)。这种语义松弛使 SAM 能积累海量 mask,区别于此前依赖预定义语义类训练的分割模型 #Zhang et al., 2024。整批 mask 经半自动/全自动阶段扩展,以 data engine 方式支持全监督训练。
历史脉络:granular segmentation 的演进
survey §Historical Techniques and Developments 梳理了 SAM 之前的粒度分割脉络 #Zhang et al., 2024:
- 人像 parsing(JPPNet):pose+双网络,依赖 keypoint,限自然铰接体(人/动物);
- 多尺度(DeepLab):resize 多尺度→独立特征提取→scale attention 聚合,物体无关粒度但缺结构关系;
- 图结构(GMNet):图匹配模块对齐 part 间关系,引入结构信息;
- DETR 式集合预测(Panoptic-PartFormer):把 MaskFormer 的语义类 query 改为 thing/stuff/part 三 query——最接近 SAM 的 whole/part/sub-part 设计 #Zhang et al., 2024。
SAM 的优势在于训练数据覆盖广(非仅人/动物/车),4 query 的粒度意识是 Panoptic-PartFormer 思想的规模化落地。
SAM 接受四类 prompt:point / box / mask / text。survey §Prompt Dependence 给出了 prompt 对分割精度的实测规律 #Zhang et al., 2024:
Prompt 精度规律
- box prompt 精度 > point prompt #Zhang et al., 2024;
- point prompt 可通过在目标上加更多点提精度 #Zhang et al., 2024;
- box + point 组合更好,但不能同时施加——box 应在初始 prompting 阶段,point 应在 mask refinement 阶段 #Zhang et al., 2024;
- automatic prompting(无人工)效果不佳 #Zhang et al., 2024——这是 SAM 在「无显式 prompt」场景(如自动视频轮廓提取)的核心短板;
- text prompt 经 CLIP,但普遍认为其精度与鲁棒性弱于几何 prompt #Zhang et al., 2024。
这条 prompt dependence 规律对视频轮廓提取有直接含义:视频中逐帧标 box/point 不现实,automatic prompting 又不佳——视频轮廓提取必须靠 memory + propagation 而非逐帧人工 prompt,这正是 SAM2 的设计动机。
survey sections/application.tex 是其最大资产——192 篇主文章按 6 大域 × 子任务组织,每域 SAM 的角色均为「提供分割 mask / 边界 prior」 #Zhang et al., 2024。
域一 · Image-based Applications
分四子类 #Zhang et al., 2024:
- Generation:Concept Weaver(多概念 mask 隔离融合)/ TheaterGen(角色 mask)/ HiFi Tuner(主客体 mask 引导 loss)/ LOOSECONTROL(分割+深度)/ Ranni(object boundaries 作控制信号);
- Inpainting/Stylizing/Restoration:前景背景分离(matting 的 pseudo-trimap 用法)/ 防色溢 / SAMDiffSR(mask 引导降噪采样)/ SegmentationGS(instance map 引导稀疏自注意力);
- Annotations:弱监督伪标签精修(CAM 集成)/ 医疗众包标注 / 多光谱加速 / 人脸活体 mask / box→mask 降标注成本;
- Matching:MESA(区域匹配)/ MATCHER(匹配点→mask)/ SAM 作 teacher 引导局部特征学习。
域二 · Video-based Applications(与视频轮廓最相关)
- Generation:MagicMe / CustomVideo / VideoGW / DragAnything / FastVS / StoryGPT-VL / DancingAP——SAM 提供逐帧/初始帧 mask 引导注意力、身份保持、运动控制、动态区域精修;
- Annotation:EVA-VOS(多源标注→mask)/ SAMText(视频文本 spotting,百万级标注);
- Tracking:原 SAM 时序一致性弱 → 早期 TAM/XMem 补足;SAM2 引入后 underwater / VOS / 竞赛,memory-based attention 显著改善遮挡/快速运动/伪装 #Zhang et al., 2024。
域三 · 3D Applications
3D Detection(SAM mask + Depth Anything → 伪 LiDAR,KITTI SOTA;Grounded-SAM;PointSAM;SAM-AD 自动驾驶定制版;SGV3D 背景抑制)+ 3D (De)composition(Gaga 关联 3D Gaussian;TotalDecom;OpenNeRF 多视角 mask proposal;GARField 3D affinity field) #Zhang et al., 2024。
域四 · Multimodal Applications
Audio-Visual(audio prompt 零样本分割;SAMA-AVS 早期融合;AV-SAM pixel-wise 音视频融合,Flickr-SoundNet/AVSBench SOTA)+ Vision-Language(SAM 作 prompt encoder 生成 open-world query;hand-object mask 强化 egocentric captioning;region-text 对齐 RegionBLIP/LumenUV;文档 OCR + VQA;减幻觉)+ Region-Based Recognition(AlphaCLIP/Monkey/uLLaVA/LLaVA-Plus/ToolDE)+ Pixel-Level Instruction(Osprey class-agnostic mask;Florence-2;InternGPT pointing)+ Visual Vocabulary/Grounding(PixelLM/GLaMM/Vary/BuboGPT)#Zhang et al., 2024。
域五 · Human-Robot Interaction
机器人抓取/腿式机器人/可变形物体/衣物折叠/铰接体管理/实验室监控;自主驾驶 DSEC(事件相机分割数据集)/ Calib-Anything(LiDAR-相机标定);导航 VoroNav/OpenFMNav/零样本语义地图 #Zhang et al., 2024。
域六 · Specialized Domain Applications
Remote Sensing(细小目标可/细长目标如道路农田边界不可;海冰分类 SAM+CLIP;MeSAM/RSAM-Seg 域适配;AnyChange 零样本变化检测)+ Anomaly Detection(ClipSAM CLIP 粗→SAM 精;SAA+ box→像素 mask;DefectSAM 红外热像缺陷)+ Farming(精准畜牧;叶片分类后处理)+ Others(陨石坑;语义通信;土建裂缝,优于 UNet 检测纵向裂缝)#Zhang et al., 2024。
survey sections/sam2_advancements.tex 是与「视频轮廓提取」最相关的章节。SAM 2(2024-07-29 发布)把可提示分割从图像推广到视频,引入三大技术创新 #Zhang et al., 2024:
创新一 · Unified Segmentation Framework(PVS)
SAM 基于 ViT backbone 处理图像。SAM 2 引入 Promptable Visual Segmentation(PVS),统一处理图像与视频,高效整合空间+时序数据,静态图像与动态视频无缝切换 #Zhang et al., 2024。这是「图像→视频」的范式统一,而非简单叠加时序模块。
创新二 · Enhanced Prompting + Memory Attention
SAM2 保留 point/box/mask prompt,新增 memory attention system:物体消失或被遮挡时,用先前帧存储的信息维持分割精度。允许后续帧追加 prompt 精修 → 跨帧鲁棒、上下文准确 #Zhang et al., 2024。
创新三 · Streaming Memory Architecture(核心)
Streaming Memory 工作机制
- 与 SAM 的关键差异:SAM 逐帧独立处理(无时序);SAM2 用初始帧 prompt 分割结果引导后续帧分割 #Zhang et al., 2024;
- keyframe memory bank:存关键帧信息,跨帧精修,先前分割贡献后续帧精度(即便有遮挡/物体变换);
- 计算效率:不必每帧从零处理 → 可扩展到更长视频、更大规模数据,适合自动驾驶/监控/医疗视频分析(实时 + 长时一致性);
- 长序列跟踪:memory attention 维持分割质量,handle occlusion + motion blur #Zhang et al., 2024。
survey 明确指出 SAM2 在外科手术视频等挑战环境零样本性能提升,超越现有模型 #Shen et al., 2024;在 underwater / VOS 任务中通过 memory-based attention 改善遮挡/快速运动/伪装物体的分割跟踪 #Zhang et al., 2024。
SAM 与 SAM 2 的能力差异根植于训练数据。survey §Dataset Expansion 对比两者 #Zhang et al., 2024:
SAM · SA-1B 数据集
- 规模:超 10 亿 masks(1B+),覆盖广谱物体类别与场景类型 → 零样本泛化基础;
- 高分辨率:学到 fine-grained 细节;
- 自动 mask 生成:data engine(manual → semi-auto → fully-auto 三阶段),最小化人工标注同时保质量;
- 地理多样性:多地点数据,降位置偏差;
- 4.3M 手工精标经半自动/全自动阶段扩展——语义不约束(所有物体单独分割,不限定语义类)是 SAM 区别于前模型的关键 #Zhang et al., 2024。
SAM 2 · SA-V 数据集
- 视频聚焦:区别于 SA-1B 的图像,SA-V 围绕视频,解运动+时序一致性;
- 规模:比 YouTube-VOS / DAVIS 等既有视频分割数据集多 53 倍标注 mask #Zhang et al., 2024;
- 场景多样:室内/室外/复杂动态;
- 标注协议:多阶段——先逐帧人工标注,再用 SAM2 自动跨帧传播 mask(迭代,提速度+精度);含 manual masklet + automatic masklet 混合。
survey sections/challenges_and_limitations.tex 系统列出 SAM/SAM2 的挑战与未来方向 #Zhang et al., 2024。
挑战
四大挑战
- Medical Imaging:原始 SAM 医疗 Dice 不及全监督 U-Net #He et al., 2023;器官差异大(胰腺/肝脏差 70%,息肉/肺结节差 30%)#Zhang et al., 2024;边界不清者(恶性肿瘤)差。SAM2 在 3D 改善 #Yu et al., 2024,但低对比模态(CT/超声)可能反不如 SAM;MRI 相当或更优 #Zhang et al., 2024。
- Challenging Objects/Scenes:微小/细长物体 #Ji et al., 2023 #Ren et al., 2023、边界模糊 #Zhang et al., 2024、密集遮挡 #Yang et al., 2023、伪装 #Tang et al., 2023、透明 #Han et al., 2023——SAM 输出不精确,不能直接用于 object counting #Ma 2023 counting。雨景需熵滤波预处理 #Zhang et al., 2024。
- Prompt Dependence:见 Part 2——automatic prompting 不佳。
- Robustness:对抗攻击脆弱(白盒 PGD 可移除 mask)#Zhang et al., 2024;15 种图像腐蚀除模糊外像素精度下降 <5% #Zhang et al., 2024;FGSM 中等鲁棒,PGD 不鲁棒 #Qiao et al., 2023。
未来方向
- Fine-Tuning:MedSAM(20 万+ mask,11 模态,Dice +22.5%/3D、+17.6%/2D)#Ma et al., 2023;PolypSAM/SkinSAM 域适配;
- Adapter Fixing:image encoder 层间插 adapter #Zhang et al., 2024;mask decoder 插 adapter;decouple decoder(DeSAM,IoU 回归与 mask 学习解耦)#Gao et al., 2023;SAM2 + 专用 adapter #Chen et al., 2024 sam2;
- Integration with AI:LLM(GPT-4/BERT)生成/精修 prompt;多模态(audio+spatial);AR/VR;自动驾驶融合 LiDAR/radar;
- New Domains:伪装/透明物体;非欧几里得(图结构,社交网络/分子);卫星;医疗多模态;
- Memory & Propagation:survey 明确点名 SAM2 memory bank 的算力瓶颈——self-attention(frame embedding)+ cross-attention(past memory)开销大 #Rafaeli et al., 2024。未来需 memory-efficient attention、adaptive propagation(3D 医疗/视频)、无监督/强化学习降标注依赖。
本综述在「视频轮廓提取」调研中处于三子方向交汇点的位置 #Zhang et al., 2024:
survey 对视频轮廓提取的可用价值
- SAM = 静态 mask 边界:SAM 在单帧上输出分割 mask,其边界即「轮廓」的粗粒度二值形态。ambiguity-aware 4 query(whole/part/sub-part)天然支持多粒度轮廓。但 SAM 逐帧独立、无时序,直接逐帧跑会丢运动一致性——与 EDTER 等「图像边缘检测器」共有局限。
- SAM2 = 视频边界(streaming memory):SAM2 的 PVS + memory bank + memory attention 把分割从图像推广到视频,跨帧维持 mask 边界一致性——这是「视频轮廓提取」的核心机制。memory bank 存 keyframe,后续帧复用,handle 遮挡/运动模糊,正是视频轮廓时序一致性的解法。survey §Future Directions 点名的 memory-efficient attention 与 adaptive propagation,直接对应视频轮廓提取的算力与精度矛盾。
- SAM2Matting = alpha 细化:survey
§Inpainting明确指出——matting 比 segmentation 更精细(输出 [0,1] alpha,需 trimap),研究者用 SAM 分割 mask 作 pseudo-trimap #Yao et al., 2023 降标注成本。SAM2Matting 把这一思路推到视频:SAM2 视频边界 → alpha matte 软轮廓细化(毛发/透明物)。即 SAM(mask 边界) → SAM2(视频 mask 边界) → SAM2Matting(alpha 软轮廓) 的精度递进链。 - 应用 taxonomy 证明 mask 是视觉基础信号:视频轮廓提取是 SAM 下游之一;域二 Video-based 的 Tracking 子类直接覆盖 VOS。
- Prompt dependence 短板 = 视频轮廓提取的核心挑战:automatic prompting 不佳 = 视频轮廓提取「无显式 prompt」场景的核心痛点,需 memory + propagation 补足。
- SA-V 是规模化评测基础:53× 既有视频分割标注,是视频轮廓评测的现成数据来源。
- 细薄边界精度瓶颈:anomaly detection / remote sensing 中 SAM 对细长/微小物体失败 → 视频轮廓提取对细薄边界(发丝、道路)同样面临精度瓶颈。
参考页速查
- 综述方法:PRISMA,428 初筛 → 192 终筛,时间窗 2023-04 至 2024-09。
- SAM 架构:image encoder(ViT/MAE)+ prompt encoder(point/box/mask/text)+ mask decoder(4 query 歧义感知并行解码:whole/part/sub-part/additional)。
- Prompt 规律:box > point;多点提精度;box+point 分阶段;automatic 不佳。
- 应用 taxonomy:6 大域(图像/视频/3D/多模态/HRI/专用域)× 子任务,192 篇。
- SAM2 三创新:PVS 统一框架 + memory attention + streaming memory architecture(keyframe memory bank,跨帧引导)。
- 数据集:SA-1B(图像,1B+ mask,4.3M 手工精标,语义无约束)vs SA-V(视频,53× 既有 VOS 标注)。
- 局限:医疗 Dice 弱于 U-Net;细小/细长/伪装/透明失败;对抗脆弱;SAM2 memory 算力瓶颈。
- 交汇点:SAM(mask 边界) → SAM2(视频边界) → SAM2Matting(alpha 软轮廓)。
参考来源
- Zhang, C. et al. (2024). A Survey on Segment Anything Model (SAM): Vision Foundation Model Meets Prompt Engineering. arXiv:2306.06211 (v3, 2024-11 修订). arXiv:2306.06211
- Kirillov, A. et al. (2023). Segment Anything. ICCV 2023. arXiv:2304.02643
- Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. arXiv:2408.00714. arXiv:2408.00714 · github.com/facebookresearch/sam2 · 精读 →
- Carion, N. et al. (2020). End-to-End Object Detection with Transformers (DETR). ECCV 2020. arXiv:2005.12872
- Cheng, B. et al. (2021). Per-Pixel Classification is Not All You Need for Semantic Segmentation (MaskFormer). NeurIPS 2021. arXiv:2107.06278
- Ma, J. et al. (2023). Segment Anything in Medical Images (MedSAM). Nature Communications 2024. arXiv:2304.12306
- Gao, H. et al. (2023). DeSAM: Decoupled Segment Anything Model for Generalizable Medical Image Segmentation. arXiv:2306.00499. arXiv:2306.00499
- Yao, Y. et al. (2023). Matte Anything: Interactive Matte Extraction with Segment Anything. arXiv:2305.13432. arXiv:2305.13432
- Shen, B. et al. (2024). Performance of SAM 2 in Surgical Video Segmentation. arXiv 2024.
- Page, M. J. et al. (2021). The PRISMA 2020 statement: an updated guideline for reporting systematic reviews (PRISMA). BMJ 2021.
- Cheng, J. et al. (2023). Segment Anything Model (SAM) for Medical Image Analysis. arXiv:2304.07599.
- Wang, S. et al. (2023). Evaluation of SAM on Medical Image Segmentation. arXiv 2023.
- Wald, Y. et al. (2023). SAM-MD: SAM for Medical Domain. arXiv 2023.
- Mattjie, I. et al. (2023). An Evaluation of SAM in Medical Segmentation. arXiv 2023.
- Huang, X. et al. (2023). Robustness of SAM. arXiv 2023.
- He, P. et al. (2023). Accuracy of SAM in Medical Image Segmentation vs U-Net. arXiv 2023.
- Hu, J. et al. (2023). SAM for Liver / Breast Tumor Segmentation. arXiv 2023.
- Ji, Y. et al. (2023). SAM on Challenging Objects (Camouflaged/Slender). arXiv 2023.
- Ren, X. et al. (2023). SAM for Remote Sensing / Minuscule Objects. arXiv 2023.
- Tang, J. et al. (2023). Can SAM Segment Camouflaged Objects? arXiv 2023.
- Han, X. et al. (2023). SAM for Transparent Object Segmentation. arXiv 2023.
- Yang, M. et al. (2023). Track Anything Model (TAM) / SAM in Dense Environments. arXiv 2023. · 精读 →
- Qiao, S. et al. (2023). Robustness of SAM to Corruption and Adversarial Attack. arXiv 2023.
- Rafaeli, N. et al. (2024). Prompting SAM 2 for Video Segmentation. arXiv 2024.
- Yu, S. et al. (2024). SAM 2 for 3D Medical Image Segmentation. arXiv 2024.
- Chen, J. et al. (2024). SAM 2 with Specialized Adapter. arXiv 2024.
- Ma, J. et al. (2023). SAM for Object Counting. arXiv 2023.