ESC
输入关键词搜索文章
目录

OASIS

NUS IMVR Lab · 2025 · ICCV
用 Canny 粗边缘先验 + 轻量结构精修,把 memory-based VOS 的边界质量再顶一档,48 FPS 实时
48FPS (DAVIS)
91.6DAV-17 Val F
86.6YT-VOS 2019 G
+2M参数 vs baseline

论文信息

Part 1 · 引言
当 memory 不够用:VOS 还差一个"结构维度"

半监督视频目标分割(Semi-supervised Video Object Segmentation, SVOS)的任务很直接:给第一帧的对象 mask,模型要把这个对象在后续每一帧里抠出来 #Cheng-et-al.-2024。它驱动着自动驾驶、视频编辑、机器人抓取、医学干预等一长串下游应用——这些场景不只要求"切得准",还要求"切得快",否则实时性就成了落地门槛。

过去几年,这条赛道的解法收敛到了 memory-based 这一条主线:把过去若干帧的特征存进一个记忆库(memory bank),当前帧当 query 去匹配这些记忆,从而把 mask 传播下去。从 STM #Oh-et-al.-2019 到 STCN、AOT、XMem #Cheng-et-al.-2022、DEVA #Cheng-et-al.-2023,再到把记忆从"像素级匹配"升级为"对象级推理"的 Cutie #Cheng-et-al.-2024,整条脉络的每一步都在解决"如何更稳地记住并复现对象"。最新一代基础模型 SAM 2 #Ravi-et-al.-2024 同样受益于 memory 机制。

但 memory 这条路遇到了一个结构性盲区:Cutie 虽已登顶 SOTA,却依然会在两类场景翻车——对象之间相互遮挡时被切碎,或者对象与背景高度相似时黏在一起。原因不在记忆不够多,而在模型只顾着维持"跨帧一致性",忽略了对象本身的几何结构

这正是本文 OASIS(bOundary Amendment video object Segmentation with Inherent Structure refinement)切入的位置。通讯作者 Yueming Jin 来自新加坡国立大学的 IMVR Lab(Interactive Medical Vision @ NUS)——一个长期与医学视频分割、外科场景解析打交道、对"边界"和"不确定性"天然敏感的团队。这种背景让 OASIS 的主张显得顺理成章:与其继续在记忆上做加法,不如给模型补一个被遗忘的维度——对象的内在结构。具体做法是嫁接两项成熟技术:用 1986 年的 Canny #Canny-1986 抓一把粗边缘当先验,再配一个轻量结构解码器挑出"属于目标"的那部分边缘,把边界特征"点亮"回主干特征;同时首次把分类领域的不确定性利器 Evidential Deep Learning #Sensoy-et-al.-2018 搬进 SVOS,专治遮挡区的高不确定性。

结果是一套只增加约 2M 参数、仍能跑 48 FPS 的轻量改进,却在 DAVIS-17 / YouTube-VOS 2019 / MOSE / DAVIS-17 test 四个基准上全面刷新 SOTA——DAVIS-17 验证集 $\mathcal{F}$(边界精度)从 89.7 提到 91.6,YouTube-VOS 2019 的 $\mathcal{G}$ 从 86.2 提到 86.6,MOSE $\mathcal{J}\&\mathcal{F}$ 达到 62.1。本文要回答的核心问题是:一个被 VOS 冷落多年的"结构/边缘"信号,凭什么用最便宜的姿势重新变得有用?

(论文与代码:arXiv:2507.18944 · jinlab-imvr/OASIS。本篇是视频轮廓提取系列精读第五篇,承接 SAM 2、Robust Video MattingTrack AnythingContourFormer。)

Part 2 · 问题剖析
一个鱼缸实验,暴露 memory-based VOS 的两条病因

论文用一张鱼缸的图把问题讲透了:三条鱼游在一起,其中一条红鱼在颜色上与背景几乎融为一体,又被另外两条鱼挡在身后。Cutie #Cheng-et-al.-2024 在这个场景里直接丢了这条红鱼——它生成的 mask 把红鱼漏掉了。而 OASIS 借助自己生成的"结构图"(structure map),把这条鱼准确抠了出来。

OASIS 鱼缸 demo:Cutie 漏掉红鱼,OASIS 结构图引导下成功分割
图 1:(a) 输入帧;(b) SOTA 方法 Cutie 生成的 mask;(c) OASIS 输出的结构图;(d) OASIS 生成的 mask。红鱼与背景极相似且被遮挡,导致前作失败;在结构图引导下本文模型成功分割(来源:Qin et al., 2025, Fig.1)。

这个失败不是偶然,作者把它拆成两条相互独立的"病因":

病因一:只盯一致性,丢了几何结构

memory-based 方法预测 mask 时,过度依赖跨帧的像素级与对象级特征一致性,而对象本身的几何特征(边界、形状、层级遮挡关系)被忽略。后果是:当对象与背景长得像(图 1 红框),仅靠"前后帧一致"无法把它从背景里分辨出来。

病因二:遮挡 + 相似 = 高不确定性,却没有不确定性度量

对象被遮挡时会碎成几块;若再叠加语义相似,重叠区的不确定性极高。模型没有"我不确定"的表达能力,只能硬给一个过度自信的预测,于是边界糊成一团(图 1 蓝框)。

一个自然的想法是:既然病根在"结构没被建模",那就把边缘——对象结构最直接的载体——请回来。可问题来了:边缘在静态图像分割里是常客(显著性检测、语义分割都靠它区分区域),为什么 VOS 里偏偏没人这么用?

答案是时序漂移。视频里目标是动的,对象边缘逐帧大幅移动,要从零给每帧预测精确边缘,需要相当大的边缘检测网络,推理效率会被拖垮。于是既有视频工作只用边缘做"运动幅度分析"或"阴影检测"这类只需粗边的任务,并不真正生成用于跟踪的细粒度边缘 #Cheng-et-al.-2024

Insight:从"生成边缘"降维成"选择边缘"。边缘难预测,是因为要从无到有生成它;但如果先有一张"全图所有边缘"的粗图(Canny 几乎免费就能给),再让模型从中挑出属于目标的那些边,任务就轻得多——一个轻量解码器就够。这正是 OASIS 把边缘重新变得"便宜又好用"的关键转换。

这条 Insight 同时回应了两条病因:结构图把对象边界显式点亮(治病因一),而把"挑哪些边"交给一个可学的不确定性框架(Evidential Learning)来处理遮挡重叠(治病因二)。两条药方,对应两条病因。

Part 3 · 模型结构
OASIS 架构:给 Cutie 装一个"结构侧信道"

先看一眼全景。OASIS 并不另起炉灶,它直接以 Cutie #Cheng-et-al.-2024 为骨架(memory encoder、decoder 都沿用 Cutie 设计),在主干特征流上并联了一条"结构侧信道":抓粗边→生成对象结构图→乘回特征点亮边界。同时一个 evidential learning 模块在损失端处理不确定性。

OASIS 整体架构:左侧 overall framework,右侧 structure refinement 细节,浅灰框为 evidential learning
图 2:OASIS 总览。左侧为整体框架,右侧详展结构精修过程;左侧浅灰框为 evidential learning,"Dist." 是 Distribution 的缩写(来源:Qin et al., 2025, Fig.2)。

3.1 问题形式化:多出来的第三维 $s_t$

把既有 memory-based SVOS 写成公式,它从"帧内容"的视角定义任务:

既有 SVOS 流水线(Eq.1)

$$q_t = h(\varphi(i_{t}),\,y_{t}),\qquad y_t = \varrho(i_{t-1},\dots,i_{t-n}\,|\,q_{t-1},\dots,q_{t-n})$$

其中 $i_t$ 是输入帧,$y_t$ 是由前 $n$ 帧图像与预测构造的、作为时刻 $t$ 参考的记忆;$\varphi$ 是特征抽取器,$\varrho$ 是记忆构造器,$h$ 是利用帧特征 $\varphi(i_t)$ 与记忆 $y$ 产出分割 $q_t$ 的分割网络。该流水线只建模"帧内容",对结构/层级关系建模不足。

OASIS 的改动就是在 $h$塞进第三维输入——结构图 $s_t$

OASIS 流水线(Eq.2)

$$q_t = h(\varphi(i_{t}),\,y_{t},\,s_{t}),\qquad s_{t} = \vartheta(\varphi(i_{t}),\,c(i_{t}),\,y_{t})$$

其中 $c$ 是 Canny 滤波器,$\vartheta$ 是融合帧特征、边缘表示与记忆特征、产出内在结构图 $s_t$ 的函数。关键差别:分割不再只看"帧内容 + 记忆",而是"帧内容 + 记忆 + 结构"。这一维正是 Cutie 对象查询未建模的开放挑战 #Cheng-et-al.-2024

3.2 五段流水线:从粗边到点亮边界

结构侧信道由五个模块接力完成,每段都遵循"为什么需要→直觉→机制"的节奏。下面这张 mermaid 图是主干数据流,读者可对照公式阅读:

flowchart TD
    A["输入帧 i_t"] --> B["Canny 滤波器 c"]
    A --> C["图像编码器 ResNet-18
多尺度特征 î_i"] B --> D["粗边图 I_c(下采样到各尺度)"] C --> E["边缘高亮 Eq.3
Ĩ_i = î_i + (î_i ⊙ ε·I_c)"] D --> E F["前 n 帧 + mask"] --> G["记忆编码器 Cutie 式
全局记忆 N + 对象记忆 M"] G --> H["结构解码器 Eq.4
S' = SD(Ĩ_i, M)·M 仅在最粗尺度 add"] E --> H H --> I["精修 Eq.5
Î'_i = î_i + (î_i ⊙ β·S')·logits 软门控"] I --> J["Cutie 式 Decoder
融合 SE 特征 + N + M"] J --> K["对象 mask q_t"] K --> L["Evidential Learning
Dirichlet 不确定性损失"]
总损失(Eq.7):
  L_mask = L_CE + L_Dice + λ·L_EDL

EDL 损失(Eq.6):
  L_EDL = Σ_k q_t^k · ( ψ(Σα) − ψ(α) ) + KL_div
  α = 1 + η(q̇_t)          # Dirichlet 参数
  λ = 0.01 + annealing    # EDL 权重带退火

超参:
  ε = 0.5   # 粗边融合强度
  β = 1.0   # 结构图融合强度(β > ε)
  Canny 阈值 50/200 + L2 正则

  • Edge Highlighting:用 Canny 给特征图"勾边"
  • 输入 $I\in\mathbb{R}^{3\times H\times W}$ 先经 Canny 得到边缘表示 $I_c\in\mathbb{R}^{1\times H\times W}$;同时图像编码器(ImageNet 预训练的 ResNet-18)抽出多尺度特征 $\hat I_i$$i=1,\dots,N$$\hat I_i\in\mathbb{R}^{C_i\times h_i\times w_i}$$h_i=H/2^{i+1}$)。

    直觉:ImageNet 预训练特征偏"抽象内容语义",对边界不敏感,遮挡时容易混淆碎片对象。给特征乘上粗边图,等于"只在该有边的地方放大信号"——把结构敏感性塞回特征。

    融合用 Hadamard 积加残差:

    边缘高亮(Eq.3)

    $$\tilde{I}_{i} = \hat{I}_{i} + \bigl(\hat{I}_{i} \odot \epsilon\, I_{c}^{\downarrow h_{i}, w_{i}}\bigr),\quad i=1,\dots,N$$

    $\tilde I_i$ 是全局边缘增强特征,$\odot$ 为 Hadamard 积,$\epsilon$ 是调节 Canny 边影响的重要性因子(设为 $0.5$),$I_c^{\downarrow h_i,w_i}$ 表示把 $I_c$ 插值到 $\hat I_i$ 的空间尺寸。

  • Memory Feature Extraction:照搬 Cutie 的记忆
  • 取前 $n$ 帧及其预测 mask 送入记忆编码器(设计采用 Cutie #Cheng-et-al.-2024),得到全局记忆特征 $N$,再投影到对象 mask 上得到对象记忆特征 $M\in\mathbb{R}^{C\times H\times W}$(此处 $H=W=30$),为目标对象提供时序信息。

  • Structure Map Prediction:轻量解码器 + 对象记忆融合
  • 这一步是把"全图粗边"过滤成"只属于目标的结构图"。注意 $\tilde I_i$ 强调了所有边,仍含非目标对象的边界,不足以直接指导分割。于是设计一个轻量结构解码器,从 $\tilde I_i$ 预测只含目标边与结构细节的 $S'$

    关键设计:必须把对象记忆 $M$ 融进来。若只用全局图像特征 $\tilde I_i$,网络无从知道"哪些边属于我们要跟的对象",预测会发散成噪声。图 3 的对比实验直接验证了这一点。

    结构图预测(Eq.4)

    $$S^{\prime} = \text{Structure Decoder}(\tilde{I}_{i},\, M),\quad \text{for } S^{\prime} \to S$$

    $M$ 只在最粗尺度 $\tilde I_3$ 上做 element-wise 加法融合;解码器用转置卷积(kernel 2、stride 2)逐步上采样,并通过通道拼接引入更高分辨率特征(跳跃连接),LeakyReLU 激活 + 残差连接。为降开销,二值交叉熵损失只在最终输出处施加。

    监督信号(GT 结构图)由 GT 彩色 mask 转灰度、再过一道"predefined filter"得到——这张图专门凸显目标对象间的遮挡关系,作为结构提取网络的训练目标。

    有无对象记忆融合的结构图对比:无融合预测发散,有融合聚焦目标
    图 3:不同对象的结构图输出。(a) 输入帧;(b) 上一帧输入与预测 mask;(c) 不融合对象记忆的结构图;(d) 融合对象记忆的结构图。"Feat."=Feature,"Mem."=Memory(来源:Qin et al., 2025, Fig.3)。

  • Refinement:用 logits 把边界"点亮"回特征
  • 拿到对象级结构图后,再次用 Hadamard 积把它乘回图像特征,强调对象边界:

    精修(Eq.5)

    $$\hat{I}_{i}^{\prime} = \hat{I}_{i} + \bigl(\hat{I}_{i} \odot \beta\, S^{\prime\,\downarrow h_{i}, w_{i}}\bigr),\quad i=1,\dots,N$$

    $\hat I'_i$ 是最终用于分割的 SE(structure-enhanced)特征,$\beta$ 调节结构图影响(设为 $1.0$)。

    反直觉细节:这里用的是 logits 而非二值 mask。当结构解码器对某区域是边界更有信心时,logits 形式能让该区被更强地强调——这是连续的软门控,而不是一刀切的 0/1。消融会显示 $\beta$ 太大反而掉点,正是因为过度强调会引入特征分布漂移。

  • Decoding:Cutie 式解码 + SE 特征当"连接桥"
  • 最后用一个受 Cutie 启发的解码器,把 SE 特征、全局记忆 $N$、对象记忆 $M$ 对齐输出对象 mask。解码器自上而下对象特征与自下而上全局特征动态交互;SE 特征作为额外通路连接高低层表示——因为结构图编码了对象信息,潜在地强调了原特征图相应区域。

    3.3 Evidential Learning:给遮挡区一个"不确定"的口子

    交叉熵里的 LogSoftmax 把预测压成点估计,把多种不确定性揉进"过度自信"的预测里 #Sensoy-et-al.-2018。OASIS 借 Evidential Deep Learning(EDL)在损失端补一个不确定性项,叠加在既有的 $\mathcal{L}_{\text{CE}}$$\mathcal{L}_{\text{Dice}}$ 之上,专为遮挡与高相似度区域服务——这是 SVOS 任务里首次引入 EDL。

    直觉:EDL 用 Dirichlet 取代点估计。训练前初始化一个裸 Dirichlet $D(\mathbf p\,|\,\boldsymbol\alpha)$,令所有 $\boldsymbol\alpha=1$——由 Gibbs 不等式,这是"没见过任何数据前最大不确定"的分布。训练时用模型输出 prob-logits 更新 $\boldsymbol\alpha$,代表"更新后的内在偏好",并为后续 $\text{KL}_{\text{div}}$ 正则提供参考。

    对帧 $t$ 的每个像素,记 $q_t^k$ 为第 $k$ 类的布尔 GT,$\dot q_t$ 为模型输出的 $k$ 类 prob-logit 向量,EDL 损失与总损失为:

    EDL 损失(Eq.6)与总损失(Eq.7)

    $$\mathcal{L}_{\text{EDL}} = \sum_{k=1}^{K} q_t^{k}\,\bigl(\psi(\textstyle\sum\boldsymbol\alpha) - \psi(\boldsymbol\alpha)\bigr) + \text{KL}_{\text{div}},\qquad \boldsymbol\alpha = 1 + \eta(\dot{q_t})$$
    $$\mathcal{L}_{\text{mask}} = \mathcal{L}_{\text{CE}} + \mathcal{L}_{\text{Dice}} + \lambda\,\mathcal{L}_{\text{EDL}}$$

    $\boldsymbol\alpha$ 为 Dirichlet 参数,$\eta$ 是置信函数,$\psi$ 是 digamma 函数,$\text{KL}_{\text{div}}$ 据 EDL 原文推导 #Sensoy-et-al.-2018$\lambda$ 平衡不确定性损失(设为 $0.01$ 且带 annealing)。

    为什么 EDL 适合实时 SVOS:单次前向就能给出不确定性(无需 ensemble 或 MC-dropout 的多次采样),契合 VOS 的实时约束;$\text{KL}_{\text{div}}$ 正则阻止模型对错误类过度自信,正好压住遮挡重叠区那种"硬给一个答案"的毛病。
    Part 4 · Training Pipeline
    两阶段训练:先在静态图打基础,再上视频开"结构侧"

    OASIS 的训练分成两阶段,分阶段的核心动机是防噪声污染——这一点本身就是一个值得记住的工程判断。

    4.1 为什么预训练要"关掉"结构侧与 EDL

    第一阶段在静态图像数据集上做预训练,用 3 帧合成(follow Cutie #Cheng-et-al.-2024)造伪视频序列。作者故意不启用 structure decoder 与 EDL 损失——因为伪视频序列带来的噪声会污染这两个模块,影响鲁棒性。等主训练上了真视频,再把这些"对噪声敏感"的组件打开。这等价于:先让主干(特征 + 记忆)在干净信号上收敛,再让结构侧信道在真视频上精调。

    4.2 网络配置

    两路 ImageNet 预训练 ResNet-18 分别抽图像特征与编码 mask;对象特征维度 256;结构解码器每步用 kernel 2 / stride 2 的转置卷积做 $2\times$ 上采样,LeakyReLU + 残差;预测层用 $1\times1$ 卷积输出二值分割。更细的网络细节作者说明在 supplementary(arXiv 提交包未含,本解读如实标注)。

    4.3 训练配置披露表

    按下表 10 项逐项核对论文披露状态——OASIS 的训练超参披露相当充分,但训练时长、精度格式、checkpoint 策略三项未明确给出。

    配置项披露状态值 / 说明
    训练数据已披露预训练:静态图数据集(3 帧合成伪视频);主训练:DAVIS-2017 + YouTube-VOS 2019 训练集
    训练硬件已披露4× A5000 GPU
    优化器未披露原文给出学习率与梯度裁剪但未点名优化器类型
    学习率已披露预训练 1e-4 固定;主训练 base 1e-4(backbone ×0.1),step schedule 在 100K、115K 各 ×0.1
    Batch size已披露16(两阶段均 16)
    训练步数 / 轮数已披露预训练 80K iter(384²);主训练 125K iter(480²,序列长 8)
    训练时长未披露原文未给出
    模型参数量已披露baseline 29M;OASIS 31M(结构解码器约 +2M)
    精度格式未披露原文未明确
    Checkpoint 策略未披露原文未明确
    数据增强已披露mirroring + 随机仿射 + cut-and-paste,组合不同图造伪视频
    正则化 / 采样已披露梯度裁剪 max-norm 3;Canny 加 L2 正则;预训练 8192 采样点,主训练 12544 采样点(point supervision)
    方法特定:EDL / 边缘超参已披露$\lambda=0.01$ + annealing;Canny 阈值 50/200;$\epsilon=0.5$$\beta=1.0$
    关键超参小结:$\epsilon=0.5$(粗边融合)、$\beta=1.0$(结构图融合,且 $\beta \gt \epsilon$)、$\lambda=0.01$(EDL 权重带退火)、Canny 阈值 50/200、对象记忆 $H{=}W{=}30$、4× A5000、PyTorch。
    Part 5 · Inference Pipeline
    在线逐帧传播:每一帧都做一次"结构侧精修"

    推理时 OASIS 走的是 memory-based SVOS 的标准在线流程,但每帧都额外跑一遍结构侧信道。给定第一帧的对象 mask 作为初始记忆,模型对后续每一帧执行:当前帧 → Canny 抓粗边 + 图像编码器抽特征 → 边缘高亮 → 结构解码器(结合记忆 $M$)出结构图 → 精修特征 → Cutie 式解码出 mask → 把当前帧特征与预测写回记忆库供下一帧用。

    5.1 为什么这套在线流程仍能跑 48 FPS

    结构侧信道看起来加了一整条解码器,但作者强调它"轻量"。原因回到 Part 2 的 Insight:结构解码器只需"选择"已有粗边、而非"生成"边缘,所以一个小解码器就够了。同时 Canny 本身几乎零开销,EDL 仅作为训练损失项(推理时不参与),原文未述推理时是否输出不确定性估计。最终 OASIS 在 DAVIS 上跑 48 FPS,仅比 baseline 的 52 FPS 略慢——而对比组加一个 2M 参数的投影网络后直接掉到 37 FPS,反衬出 OASIS 的结构解码器在"参数开销 vs 增益"上的性价比。

    实时性定位:OASIS 不是 SAM 2 #Ravi-et-al.-2024 那种流式基础模型,没有 chunk / causal mask / 首帧延迟等显式 streaming 机制;它的"实时"体现在逐帧在线传播 + memory bank 增量更新 + 48 FPS 单卡吞吐。记忆库随帧增长,匹配开销随记忆规模上升——这是 memory-based VOS 共有的代价,本文未单独讨论长视频记忆膨胀。

    5.2 推理 / 评测配置

    评测跑在 DAVIS-2017、YouTube-VOS 2019、MOSE 三个 SVOS 基准上(MOSE、YouTube-VOS、DAVIS test-dev 的结果打包上传官方评测服务器取最终分)。指标用 $\mathcal{J}$(Jaccard,区域精度)、$\mathcal{F}$(contour accuracy,边界精度)、$\mathcal{J}\&\mathcal{F}$$\mathcal{G}$(YouTube-VOS 的 seen/unseen 全平均,衡量泛化)。数值按既有 VOS 惯例缩放到 0–100,越大越好;FPS 仅在消融里用于量效率。原文未单独披露推理硬件型号与推理环境框架版本。

    配置项披露状态值 / 说明
    评测数据集已披露DAVIS-2017(60 训 / 30 val / 30 test-dev)、YouTube-VOS 2019(3471 训 / 507 val)、MOSE(1507 训 / 311 val)
    评测指标已披露$\mathcal{J}$↑ / $\mathcal{F}$↑ / $\mathcal{J}\&\mathcal{F}$↑ / $\mathcal{G}$↑ / FPS↑
    Baseline 方法已披露STCN、AOT-R50、RDE、XMem、LLB、ISVOS、DeAOT-R50、DEVA、Cutie 共 9 个
    推理硬件未披露原文未明确(仅 FPS 相对比较,未给 GPU 型号/显存)
    推理分辨率未披露训练裁剪 480²,推理分辨率原文未明确
    推理环境未披露仅知 PyTorch,版本/CUDA 未给
    Part 6 · 实验验证
    四基准全 SOTA:边界精度的提升最能说明问题

    OASIS 与 9 个代表性 / SOTA memory-based SVOS 方法对比,覆盖三类定位:精匹配(STCN、LLB)、提效减存(RDE、XMem、DEVA)、增强对象建模(AOT、DeAOT、ISVOS、Cutie)。主结果见下表。

    6.1 主结果:四个基准全面领先

    MethodPub.MOSE $\mathcal{J}\&\mathcal{F}$MOSE $\mathcal{J}$MOSE $\mathcal{F}$DAV-17 Val $\mathcal{J}\&\mathcal{F}$DAV-17 Val $\mathcal{J}$DAV-17 Val $\mathcal{F}$YT-VOS19 $\mathcal{G}$
    STCNNeurIPS'2152.548.556.685.482.288.682.7
    AOT-R50NeurIPS'2158.454.362.684.982.387.585.3
    RDECVPR'2246.842.451.384.280.887.581.9
    XMemECCV'2256.352.160.686.282.989.585.5
    LLBAAAI'2384.681.587.783.6
    ISVOSCVPR'2387.183.790.586.1
    DeAOT-R50NeurIPS'2259.054.663.485.282.288.285.6
    DEVAICCV'2360.055.864.386.883.690.085.5
    CutieCVPR'2461.257.265.386.883.889.786.2
    OASIS62.157.866.388.385.091.686.6
    这个数字说明什么:在标注粒度更细的 DAVIS-17 val 上,OASIS 在 $\mathcal{J}\&\mathcal{F}/\mathcal{J}/\mathcal{F}$ 上分别以 +1.2 / +1.2 / +1.1 超过次优(ISVOS 87.1 等)。注意 $\mathcal{F}$边界精度——它涨得最稳,正对应"结构精修"声称要解决的东西:边界质量。MOSE 这种拥挤、遮挡、对象消失多的场景,$\mathcal{F}$ 也涨 1.0,说明结构理解在未见过的复杂场景仍生效。

    6.2 Trained-with-MOSE 设置:训得更杂,结构理解更强

    把 MOSE 纳入训练集后,OASIS 在 DAVIS-17 test 上以 $\mathcal{J}\&\mathcal{F}/\mathcal{J}/\mathcal{F}$ = +1.7 / +1.7 / +1.9 拉开 Cutie #Cheng-et-al.-2024。作者的解读是:训练集场景更复杂 → 结构理解更扎实 → 分割更准。

    Method(Trained-with-MOSE)MOSE $\mathcal{J}\&\mathcal{F}$MOSE $\mathcal{J}$MOSE $\mathcal{F}$DAV-17 Test $\mathcal{J}\&\mathcal{F}$DAV-17 Test $\mathcal{J}$DAV-17 Test $\mathcal{F}$
    XMem59.655.463.779.676.183.0
    DeAOT-R5064.159.568.782.879.186.5
    DEVA66.061.870.382.678.986.4
    Cutie67.062.871.383.780.087.4
    OASIS67.563.271.985.481.789.3

    6.3 消融:每个组件各赚多少

    三个新设计(Canny 粗边融合 +CaE、结构解码器 +SD、evidential learning)外加一项结构解码器内部的对象记忆融合实验(+SD*,即 $\star$)——逐级叠加。受资源限制,消融只在 DAVIS-17 训练集上训有限 iter,但相对趋势清晰。

    SettingDAV-17 Val $\mathcal{J}\&\mathcal{F}$$\mathcal{J}$$\mathcal{F}$DAV-17 Test $\mathcal{J}\&\mathcal{F}$$\mathcal{J}$$\mathcal{F}$
    Baseline84.881.688.079.976.083.7
    +CaE84.981.888.180.076.084.0
    +CaE+SD85.182.088.180.376.384.5
    +CaE+SD*85.482.288.680.876.884.9
    OASIS(+EDL)85.682.488.781.076.985.1
    消融发现:(1) 粗边 + 结构解码器都对"刻画对象"有效;(2) 对象记忆融合提升最显著——尤其在 test-dev,+CaE+SD* 比无融合各项约 +0.5,印证 Part 3.2"必须把 $M$ 融进来"的论断;(3) EDL 再往上加 +0.2 $\mathcal{J}\&\mathcal{F}$,增益小但"几乎零额外开销",是性价比之选。

    因子 $\epsilon$ / $\beta$ 的敏感性

    两因子从 0 增大时精度先升——印证"强调边界特征有益";但过大后会引入特征分布漂移而掉点($\beta=5.0\to85.0$$\epsilon=2.0\to85.0$)。$\epsilon$ 最优为 $0.5$$\beta$ 消融峰值在 $2.0$$\mathcal{J}\&\mathcal{F}=85.7$),但作者最终部署取 $\beta=1.0$(与 $2.0$ 差距极小,$85.6$ vs $85.7$),且最佳 $\beta \gt \epsilon$——说明更精细的结构信息比粗边更该被看重。

    $\beta$$\mathcal{J}\&\mathcal{F}$$\mathcal{J}$$\mathcal{F}$$\epsilon$$\mathcal{J}\&\mathcal{F}$$\mathcal{J}$$\mathcal{F}$
    0.585.382.188.50.085.382.288.5
    1.085.682.488.70.585.682.488.7
    2.085.782.588.91.085.181.888.3
    5.085.082.087.92.085.082.087.9

    增益不是靠堆参数

    为排除"涨点来自参数变多"的质疑,作者给 baseline 加一个约 2M 参数的卷积投影网络做对照:参数同样到 31M,但 $\mathcal{J}\&\mathcal{F}$ 只到 85.1 且 FPS 掉到 37;OASIS 同样 31M 却到 85.6 且 48 FPS。配合消融里"有/无结构解码器"的对比,可下结论:增益来自结构精修设计本身,而非参数量。

    Method#ParamsDAV-17 Val $\mathcal{J}\&\mathcal{F}$$\mathcal{J}$$\mathcal{F}$FPS
    Baseline29M84.881.688.052
    +2M Proj Net31M85.182.088.137
    OASIS31M85.682.488.748

    6.4 定性结果

    两个 YouTube-VOS 2019 验证集片段上对比:既有 SOTA 在鱼相互遮挡(1–3 行)与蜗牛触角(4–6 行)上要么分不开对象、要么靠记忆机制累积误差。OASIS 凭 evidential learning 更好地建模重叠鱼的结构、凭结构精修修正触角的累积偏差。

    OASIS 与 SOTA 在鱼遮挡 / 蜗牛触角两个片段的定性对比
    图 4:两个视频片段的分割结果对比,右上角为细节放大。OASIS 在遮挡区与目标与背景高相似时展现更强分辨力(来源:Qin et al., 2025, Fig.4)。
    消融各设置在代表帧上的视觉对比
    图 5:消融关键组件时四个代表帧的定性对比。+CaE 已不错,但结构精修(structure decoder)在遮挡处(狗身、盒子拐角,白箭头)显著改善结构细节(来源:Qin et al., 2025, Fig.5)。
    注意一个易混点:图 4 展示的是 baseline(Cutie 等)的失败,不是 OASIS 的失败案例。论文未设独立 Limitations 章节,故 OASIS 自身在哪些场景失败、失败成什么样,本文未给——这是诚实的披露缺口(见 Part 7)。
    Part 7 · 讨论与启发
    在 memory-based VOS 地图上的位置,以及它没说的

    把 OASIS 放回 memory-based SVOS 的技术谱系,它的位置很清晰:建立在 STM→STCN→AOT→DeAOT→XMem→DEVA→Cutie 主线之上,从 Cutie #Cheng-et-al.-2024 起再往前走半步——不换骨架,只在主干旁挂一条结构侧信道 + 一个不确定性损失。两条跨界引入(Canny 粗边 #Canny-1986、EDL #Sensoy-et-al.-2018)都是成熟技术,OASIS 的贡献是"把它们以正确的方式接进 VOS"。这也呼应了团队背景:IMVR Lab 长期在医学视频分割里跟边界、不确定性打交道,把那套方法论迁移到通用 VOS 是自然的跨界。

    7.1 与同行的横向对比

    维度OASISCutieXMemDEVASAM 2
    核心表示帧特征 + 记忆 + 结构图 $s_t$帧特征 + 记忆 + 对象查询帧特征 + 多级记忆解耦分割与跟踪基础模型 + streaming memory
    训练目标CE + Dice + EDLCE + DiceCE + DiceCE + Dice + 一致性多任务 + 可提示
    推理特点逐帧 + 结构侧精修,48 FPS逐帧对象级读取长视频多存储tracking-by-detection流式可提示,零样本
    差异化显式结构维度 + 不确定性对象级推理记忆巩固解耦通用性规模与泛化
    适用条件有第一帧 mask 的 SVOSSVOS长视频 SVOS通用分割模型接入图像 + 视频统一

    可以看到,OASIS 差异化的两条线(结构 + EDL)都是正交于"如何记记忆"这个既有主线的增量维度——它没去抢"记忆设计"的话语权,而是补"结构理解"与"不确定性表达"两个空缺。

    7.2 局限性(含论文未明说之处)

    论文未设独立 Limitations 章节

    OASIS 正文没有专门的局限分析段,以下几点是结合全文与可复现性评估梳理出的缺口,供读者判断:

    • 结构图 GT 的"predefined filter"未给具体核——结构图监督信号如何由 mask 生成,缺可复现细节。
    • EDL 的 $\eta$$\text{KL}_{\text{div}}$ 闭式未在本文重述,均指向 EDL 原文 #Sensoy-et-al.-2018;想完整复现需回该原文。
    • 推理硬件 / 分辨率 / 框架版本未披露,48 FPS 是相对比较,绝对部署画像不清。
    • 消融受资源限制,只在 DAVIS-17 训练集 + 有限 iter 上做,全量设置下的消融趋势未给。
    • 长视频记忆膨胀未讨论——memory-based 共性代价,OASIS 未单独应对(也未在 LVOS 等长视频基准上评估)。

    7.3 可带走的启发

    • "生成"降维成"选择"是一个普适的省力姿势。把难预测的边缘,靠 Canny 先给粗版,再让小解码器挑目标边——这一招可迁移到任何"需要细结构、但端到端生成太贵"的分割/检测任务。
    • 显式"第三维输入"往往比堆参数更划算。OASIS 用 +2M 参数换 +0.8 $\mathcal{J}\&\mathcal{F}$(参数对照表语境,$85.6$ vs baseline $84.8$),对照的 +2M 投影网络只换 +0.3 且掉速度。判断一个改进值不值,看的是"信息正交性"而非参数量。
    • logits 形式软门控优于二值硬门控。结构图以 logits 乘回特征,让"模型更有信心的边界"被更强强调——这是连续控制,比 0/1 mask 更平滑、更抗过拟合(消融里过大 $\beta$ 掉点反证了分布漂移风险)。
    • EDL 适合实时任务的不确定性量化。单次前向给出不确定性,无需 ensemble / MC-dropout,凡是"遮挡 / 重叠 / 高相似"导致过度自信的实时分割,都可考虑挂一个 EDL 损失项。
    • 分阶段训练防噪声污染。对噪声敏感的模块(结构解码器、EDL)在伪数据预训练阶段先关掉、上真数据再开——这是低成本但有效的鲁棒性工程判断。
    一句话定位:OASIS 不是颠覆 memory-based VOS 的新范式,而是一次精准的"补维"——用最便宜的 Canny + 轻量解码器,把被冷落的"结构维度"和"不确定性维度"接回主干,证明在性能-效率权衡已趋紧的当下,正交维度的精修仍有 +1.5 个点可榨

    参考来源

    • Qin, G. et al. (2025). Structure Matters: Revisiting Boundary Refinement in Video Object Segmentation (OASIS). arXiv:2507.18944 · jinlab-imvr/OASIS
    • Canny, J. (1986). A Computational Approach to Edge Detection. IEEE TPAMI.
    • Oh, S. W. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
    • Cheng, H. K. et al. (2021). STCN: Rethinking Space-Time Networks for Long-Term Video Object Segmentation. NeurIPS 2021.
    • Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). NeurIPS 2021.
    • Cheng, H. K. & Schwing, A. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
    • Yang, Z. et al. (2022). Decoupling Features in Hierarchical Propagation for Video Object Segmentation (DeAOT). NeurIPS 2022.
    • Cheng, H. K. et al. (2023). Tracking Anything with Decoupled Video Segmentation (DEVA). ICCV 2023. arXiv:2309.03903
    • Sensoy, M., Kaplan, L. & Kandemir, M. (2018). Evidential Deep Learning to Quantify Classification Uncertainty. NeurIPS 2018. arXiv:1806.01772
    • Cheng, H. K. et al. (2024). Putting the Object Back into Video Object Segmentation (Cutie). CVPR 2024. arXiv:2310.18982
    • Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. Meta AI / ICLR 2025. arXiv:2408.00714 · 精读 →
    • Pont-Tuset, J. et al. (2017). The 2017 DAVIS Challenge on Video Object Segmentation. arXiv:1704.00675
    • Xu, N. et al. (2018). YouTube-VOS: Sequence-to-Sequence Video Object Segmentation. ECCV 2018. arXiv:1809.03327
    • Liao, Y. et al. (2023). MOSE: A New Object Segmentation Benchmark for Complex Videos. CVPR 2023.