OASIS
论文信息
- 标题:Structure Matters: Revisiting Boundary Refinement in Video Object Segmentation
- 作者:Guanyi Qin, Ziyue Wang, Daiyun Shen, Haofeng Liu, Hantao Zhou, Junde Wu, Runze Hu, Yueming Jin
- 单位:National University of Singapore(一作+通讯,IMVR Lab);Tsinghua University;University of Oxford;Beijing Institute of Technology
- 发表:arXiv:2507.18944, 2025(ICCV 投稿格式)
- 开源:https://github.com/jinlab-imvr/OASIS(承诺开源 checkpoints / logs / code)
半监督视频目标分割(Semi-supervised Video Object Segmentation, SVOS)的任务很直接:给第一帧的对象 mask,模型要把这个对象在后续每一帧里抠出来 #Cheng-et-al.-2024。它驱动着自动驾驶、视频编辑、机器人抓取、医学干预等一长串下游应用——这些场景不只要求"切得准",还要求"切得快",否则实时性就成了落地门槛。
过去几年,这条赛道的解法收敛到了 memory-based 这一条主线:把过去若干帧的特征存进一个记忆库(memory bank),当前帧当 query 去匹配这些记忆,从而把 mask 传播下去。从 STM #Oh-et-al.-2019 到 STCN、AOT、XMem #Cheng-et-al.-2022、DEVA #Cheng-et-al.-2023,再到把记忆从"像素级匹配"升级为"对象级推理"的 Cutie #Cheng-et-al.-2024,整条脉络的每一步都在解决"如何更稳地记住并复现对象"。最新一代基础模型 SAM 2 #Ravi-et-al.-2024 同样受益于 memory 机制。
这正是本文 OASIS(bOundary Amendment video object Segmentation with Inherent Structure refinement)切入的位置。通讯作者 Yueming Jin 来自新加坡国立大学的 IMVR Lab(Interactive Medical Vision @ NUS)——一个长期与医学视频分割、外科场景解析打交道、对"边界"和"不确定性"天然敏感的团队。这种背景让 OASIS 的主张显得顺理成章:与其继续在记忆上做加法,不如给模型补一个被遗忘的维度——对象的内在结构。具体做法是嫁接两项成熟技术:用 1986 年的 Canny #Canny-1986 抓一把粗边缘当先验,再配一个轻量结构解码器挑出"属于目标"的那部分边缘,把边界特征"点亮"回主干特征;同时首次把分类领域的不确定性利器 Evidential Deep Learning #Sensoy-et-al.-2018 搬进 SVOS,专治遮挡区的高不确定性。
结果是一套只增加约 2M 参数、仍能跑 48 FPS 的轻量改进,却在 DAVIS-17 / YouTube-VOS 2019 / MOSE / DAVIS-17 test 四个基准上全面刷新 SOTA——DAVIS-17 验证集 $\mathcal{F}$(边界精度)从 89.7 提到 91.6,YouTube-VOS 2019 的 $\mathcal{G}$ 从 86.2 提到 86.6,MOSE $\mathcal{J}\&\mathcal{F}$ 达到 62.1。本文要回答的核心问题是:一个被 VOS 冷落多年的"结构/边缘"信号,凭什么用最便宜的姿势重新变得有用?
(论文与代码:arXiv:2507.18944 · jinlab-imvr/OASIS。本篇是视频轮廓提取系列精读第五篇,承接 SAM 2、Robust Video Matting、Track Anything、ContourFormer。)
论文用一张鱼缸的图把问题讲透了:三条鱼游在一起,其中一条红鱼在颜色上与背景几乎融为一体,又被另外两条鱼挡在身后。Cutie #Cheng-et-al.-2024 在这个场景里直接丢了这条红鱼——它生成的 mask 把红鱼漏掉了。而 OASIS 借助自己生成的"结构图"(structure map),把这条鱼准确抠了出来。
这个失败不是偶然,作者把它拆成两条相互独立的"病因":
病因一:只盯一致性,丢了几何结构
memory-based 方法预测 mask 时,过度依赖跨帧的像素级与对象级特征一致性,而对象本身的几何特征(边界、形状、层级遮挡关系)被忽略。后果是:当对象与背景长得像(图 1 红框),仅靠"前后帧一致"无法把它从背景里分辨出来。
病因二:遮挡 + 相似 = 高不确定性,却没有不确定性度量
对象被遮挡时会碎成几块;若再叠加语义相似,重叠区的不确定性极高。模型没有"我不确定"的表达能力,只能硬给一个过度自信的预测,于是边界糊成一团(图 1 蓝框)。
一个自然的想法是:既然病根在"结构没被建模",那就把边缘——对象结构最直接的载体——请回来。可问题来了:边缘在静态图像分割里是常客(显著性检测、语义分割都靠它区分区域),为什么 VOS 里偏偏没人这么用?
答案是时序漂移。视频里目标是动的,对象边缘逐帧大幅移动,要从零给每帧预测精确边缘,需要相当大的边缘检测网络,推理效率会被拖垮。于是既有视频工作只用边缘做"运动幅度分析"或"阴影检测"这类只需粗边的任务,并不真正生成用于跟踪的细粒度边缘 #Cheng-et-al.-2024。
这条 Insight 同时回应了两条病因:结构图把对象边界显式点亮(治病因一),而把"挑哪些边"交给一个可学的不确定性框架(Evidential Learning)来处理遮挡重叠(治病因二)。两条药方,对应两条病因。
先看一眼全景。OASIS 并不另起炉灶,它直接以 Cutie #Cheng-et-al.-2024 为骨架(memory encoder、decoder 都沿用 Cutie 设计),在主干特征流上并联了一条"结构侧信道":抓粗边→生成对象结构图→乘回特征点亮边界。同时一个 evidential learning 模块在损失端处理不确定性。
3.1 问题形式化:多出来的第三维 $s_t$
把既有 memory-based SVOS 写成公式,它从"帧内容"的视角定义任务:
既有 SVOS 流水线(Eq.1)
其中 $i_t$ 是输入帧,$y_t$ 是由前 $n$ 帧图像与预测构造的、作为时刻 $t$ 参考的记忆;$\varphi$ 是特征抽取器,$\varrho$ 是记忆构造器,$h$ 是利用帧特征 $\varphi(i_t)$ 与记忆 $y$ 产出分割 $q_t$ 的分割网络。该流水线只建模"帧内容",对结构/层级关系建模不足。
OASIS 的改动就是在 $h$ 里塞进第三维输入——结构图 $s_t$:
OASIS 流水线(Eq.2)
其中 $c$ 是 Canny 滤波器,$\vartheta$ 是融合帧特征、边缘表示与记忆特征、产出内在结构图 $s_t$ 的函数。关键差别:分割不再只看"帧内容 + 记忆",而是"帧内容 + 记忆 + 结构"。这一维正是 Cutie 对象查询未建模的开放挑战 #Cheng-et-al.-2024。
3.2 五段流水线:从粗边到点亮边界
结构侧信道由五个模块接力完成,每段都遵循"为什么需要→直觉→机制"的节奏。下面这张 mermaid 图是主干数据流,读者可对照公式阅读:
flowchart TD
A["输入帧 i_t"] --> B["Canny 滤波器 c"]
A --> C["图像编码器 ResNet-18
多尺度特征 î_i"]
B --> D["粗边图 I_c(下采样到各尺度)"]
C --> E["边缘高亮 Eq.3
Ĩ_i = î_i + (î_i ⊙ ε·I_c)"]
D --> E
F["前 n 帧 + mask"] --> G["记忆编码器 Cutie 式
全局记忆 N + 对象记忆 M"]
G --> H["结构解码器 Eq.4
S' = SD(Ĩ_i, M)·M 仅在最粗尺度 add"]
E --> H
H --> I["精修 Eq.5
Î'_i = î_i + (î_i ⊙ β·S')·logits 软门控"]
I --> J["Cutie 式 Decoder
融合 SE 特征 + N + M"]
J --> K["对象 mask q_t"]
K --> L["Evidential Learning
Dirichlet 不确定性损失"]
总损失(Eq.7):
L_mask = L_CE + L_Dice + λ·L_EDL
EDL 损失(Eq.6):
L_EDL = Σ_k q_t^k · ( ψ(Σα) − ψ(α) ) + KL_div
α = 1 + η(q̇_t) # Dirichlet 参数
λ = 0.01 + annealing # EDL 权重带退火
超参:
ε = 0.5 # 粗边融合强度
β = 1.0 # 结构图融合强度(β > ε)
Canny 阈值 50/200 + L2 正则
输入 $I\in\mathbb{R}^{3\times H\times W}$ 先经 Canny 得到边缘表示 $I_c\in\mathbb{R}^{1\times H\times W}$;同时图像编码器(ImageNet 预训练的 ResNet-18)抽出多尺度特征 $\hat I_i$($i=1,\dots,N$,$\hat I_i\in\mathbb{R}^{C_i\times h_i\times w_i}$,$h_i=H/2^{i+1}$)。
融合用 Hadamard 积加残差:
边缘高亮(Eq.3)
$\tilde I_i$ 是全局边缘增强特征,$\odot$ 为 Hadamard 积,$\epsilon$ 是调节 Canny 边影响的重要性因子(设为 $0.5$),$I_c^{\downarrow h_i,w_i}$ 表示把 $I_c$ 插值到 $\hat I_i$ 的空间尺寸。
取前 $n$ 帧及其预测 mask 送入记忆编码器(设计采用 Cutie #Cheng-et-al.-2024),得到全局记忆特征 $N$,再投影到对象 mask 上得到对象记忆特征 $M\in\mathbb{R}^{C\times H\times W}$(此处 $H=W=30$),为目标对象提供时序信息。
这一步是把"全图粗边"过滤成"只属于目标的结构图"。注意 $\tilde I_i$ 强调了所有边,仍含非目标对象的边界,不足以直接指导分割。于是设计一个轻量结构解码器,从 $\tilde I_i$ 预测只含目标边与结构细节的 $S'$。
结构图预测(Eq.4)
$M$ 只在最粗尺度 $\tilde I_3$ 上做 element-wise 加法融合;解码器用转置卷积(kernel 2、stride 2)逐步上采样,并通过通道拼接引入更高分辨率特征(跳跃连接),LeakyReLU 激活 + 残差连接。为降开销,二值交叉熵损失只在最终输出处施加。
监督信号(GT 结构图)由 GT 彩色 mask 转灰度、再过一道"predefined filter"得到——这张图专门凸显目标对象间的遮挡关系,作为结构提取网络的训练目标。
拿到对象级结构图后,再次用 Hadamard 积把它乘回图像特征,强调对象边界:
精修(Eq.5)
$\hat I'_i$ 是最终用于分割的 SE(structure-enhanced)特征,$\beta$ 调节结构图影响(设为 $1.0$)。
最后用一个受 Cutie 启发的解码器,把 SE 特征、全局记忆 $N$、对象记忆 $M$ 对齐输出对象 mask。解码器自上而下对象特征与自下而上全局特征动态交互;SE 特征作为额外通路连接高低层表示——因为结构图编码了对象信息,潜在地强调了原特征图相应区域。
3.3 Evidential Learning:给遮挡区一个"不确定"的口子
交叉熵里的 LogSoftmax 把预测压成点估计,把多种不确定性揉进"过度自信"的预测里 #Sensoy-et-al.-2018。OASIS 借 Evidential Deep Learning(EDL)在损失端补一个不确定性项,叠加在既有的 $\mathcal{L}_{\text{CE}}$、$\mathcal{L}_{\text{Dice}}$ 之上,专为遮挡与高相似度区域服务——这是 SVOS 任务里首次引入 EDL。
对帧 $t$ 的每个像素,记 $q_t^k$ 为第 $k$ 类的布尔 GT,$\dot q_t$ 为模型输出的 $k$ 类 prob-logit 向量,EDL 损失与总损失为:
EDL 损失(Eq.6)与总损失(Eq.7)
$\boldsymbol\alpha$ 为 Dirichlet 参数,$\eta$ 是置信函数,$\psi$ 是 digamma 函数,$\text{KL}_{\text{div}}$ 据 EDL 原文推导 #Sensoy-et-al.-2018,$\lambda$ 平衡不确定性损失(设为 $0.01$ 且带 annealing)。
OASIS 的训练分成两阶段,分阶段的核心动机是防噪声污染——这一点本身就是一个值得记住的工程判断。
4.1 为什么预训练要"关掉"结构侧与 EDL
第一阶段在静态图像数据集上做预训练,用 3 帧合成(follow Cutie #Cheng-et-al.-2024)造伪视频序列。作者故意不启用 structure decoder 与 EDL 损失——因为伪视频序列带来的噪声会污染这两个模块,影响鲁棒性。等主训练上了真视频,再把这些"对噪声敏感"的组件打开。这等价于:先让主干(特征 + 记忆)在干净信号上收敛,再让结构侧信道在真视频上精调。
4.2 网络配置
两路 ImageNet 预训练 ResNet-18 分别抽图像特征与编码 mask;对象特征维度 256;结构解码器每步用 kernel 2 / stride 2 的转置卷积做 $2\times$ 上采样,LeakyReLU + 残差;预测层用 $1\times1$ 卷积输出二值分割。更细的网络细节作者说明在 supplementary(arXiv 提交包未含,本解读如实标注)。
4.3 训练配置披露表
按下表 10 项逐项核对论文披露状态——OASIS 的训练超参披露相当充分,但训练时长、精度格式、checkpoint 策略三项未明确给出。
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | 预训练:静态图数据集(3 帧合成伪视频);主训练:DAVIS-2017 + YouTube-VOS 2019 训练集 |
| 训练硬件 | 已披露 | 4× A5000 GPU |
| 优化器 | 未披露 | 原文给出学习率与梯度裁剪但未点名优化器类型 |
| 学习率 | 已披露 | 预训练 1e-4 固定;主训练 base 1e-4(backbone ×0.1),step schedule 在 100K、115K 各 ×0.1 |
| Batch size | 已披露 | 16(两阶段均 16) |
| 训练步数 / 轮数 | 已披露 | 预训练 80K iter(384²);主训练 125K iter(480²,序列长 8) |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 已披露 | baseline 29M;OASIS 31M(结构解码器约 +2M) |
| 精度格式 | 未披露 | 原文未明确 |
| Checkpoint 策略 | 未披露 | 原文未明确 |
| 数据增强 | 已披露 | mirroring + 随机仿射 + cut-and-paste,组合不同图造伪视频 |
| 正则化 / 采样 | 已披露 | 梯度裁剪 max-norm 3;Canny 加 L2 正则;预训练 8192 采样点,主训练 12544 采样点(point supervision) |
| 方法特定:EDL / 边缘超参 | 已披露 | $\lambda=0.01$ + annealing;Canny 阈值 50/200;$\epsilon=0.5$、$\beta=1.0$ |
推理时 OASIS 走的是 memory-based SVOS 的标准在线流程,但每帧都额外跑一遍结构侧信道。给定第一帧的对象 mask 作为初始记忆,模型对后续每一帧执行:当前帧 → Canny 抓粗边 + 图像编码器抽特征 → 边缘高亮 → 结构解码器(结合记忆 $M$)出结构图 → 精修特征 → Cutie 式解码出 mask → 把当前帧特征与预测写回记忆库供下一帧用。
5.1 为什么这套在线流程仍能跑 48 FPS
结构侧信道看起来加了一整条解码器,但作者强调它"轻量"。原因回到 Part 2 的 Insight:结构解码器只需"选择"已有粗边、而非"生成"边缘,所以一个小解码器就够了。同时 Canny 本身几乎零开销,EDL 仅作为训练损失项(推理时不参与),原文未述推理时是否输出不确定性估计。最终 OASIS 在 DAVIS 上跑 48 FPS,仅比 baseline 的 52 FPS 略慢——而对比组加一个 2M 参数的投影网络后直接掉到 37 FPS,反衬出 OASIS 的结构解码器在"参数开销 vs 增益"上的性价比。
5.2 推理 / 评测配置
评测跑在 DAVIS-2017、YouTube-VOS 2019、MOSE 三个 SVOS 基准上(MOSE、YouTube-VOS、DAVIS test-dev 的结果打包上传官方评测服务器取最终分)。指标用 $\mathcal{J}$(Jaccard,区域精度)、$\mathcal{F}$(contour accuracy,边界精度)、$\mathcal{J}\&\mathcal{F}$ 与 $\mathcal{G}$(YouTube-VOS 的 seen/unseen 全平均,衡量泛化)。数值按既有 VOS 惯例缩放到 0–100,越大越好;FPS 仅在消融里用于量效率。原文未单独披露推理硬件型号与推理环境框架版本。
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | DAVIS-2017(60 训 / 30 val / 30 test-dev)、YouTube-VOS 2019(3471 训 / 507 val)、MOSE(1507 训 / 311 val) |
| 评测指标 | 已披露 | $\mathcal{J}$↑ / $\mathcal{F}$↑ / $\mathcal{J}\&\mathcal{F}$↑ / $\mathcal{G}$↑ / FPS↑ |
| Baseline 方法 | 已披露 | STCN、AOT-R50、RDE、XMem、LLB、ISVOS、DeAOT-R50、DEVA、Cutie 共 9 个 |
| 推理硬件 | 未披露 | 原文未明确(仅 FPS 相对比较,未给 GPU 型号/显存) |
| 推理分辨率 | 未披露 | 训练裁剪 480²,推理分辨率原文未明确 |
| 推理环境 | 未披露 | 仅知 PyTorch,版本/CUDA 未给 |
OASIS 与 9 个代表性 / SOTA memory-based SVOS 方法对比,覆盖三类定位:精匹配(STCN、LLB)、提效减存(RDE、XMem、DEVA)、增强对象建模(AOT、DeAOT、ISVOS、Cutie)。主结果见下表。
6.1 主结果:四个基准全面领先
| Method | Pub. | MOSE $\mathcal{J}\&\mathcal{F}$ | MOSE $\mathcal{J}$ | MOSE $\mathcal{F}$ | DAV-17 Val $\mathcal{J}\&\mathcal{F}$ | DAV-17 Val $\mathcal{J}$ | DAV-17 Val $\mathcal{F}$ | YT-VOS19 $\mathcal{G}$ |
|---|---|---|---|---|---|---|---|---|
| STCN | NeurIPS'21 | 52.5 | 48.5 | 56.6 | 85.4 | 82.2 | 88.6 | 82.7 |
| AOT-R50 | NeurIPS'21 | 58.4 | 54.3 | 62.6 | 84.9 | 82.3 | 87.5 | 85.3 |
| RDE | CVPR'22 | 46.8 | 42.4 | 51.3 | 84.2 | 80.8 | 87.5 | 81.9 |
| XMem | ECCV'22 | 56.3 | 52.1 | 60.6 | 86.2 | 82.9 | 89.5 | 85.5 |
| LLB | AAAI'23 | — | — | — | 84.6 | 81.5 | 87.7 | 83.6 |
| ISVOS | CVPR'23 | — | — | — | 87.1 | 83.7 | 90.5 | 86.1 |
| DeAOT-R50 | NeurIPS'22 | 59.0 | 54.6 | 63.4 | 85.2 | 82.2 | 88.2 | 85.6 |
| DEVA | ICCV'23 | 60.0 | 55.8 | 64.3 | 86.8 | 83.6 | 90.0 | 85.5 |
| Cutie | CVPR'24 | 61.2 | 57.2 | 65.3 | 86.8 | 83.8 | 89.7 | 86.2 |
| OASIS | — | 62.1 | 57.8 | 66.3 | 88.3 | 85.0 | 91.6 | 86.6 |
6.2 Trained-with-MOSE 设置:训得更杂,结构理解更强
把 MOSE 纳入训练集后,OASIS 在 DAVIS-17 test 上以 $\mathcal{J}\&\mathcal{F}/\mathcal{J}/\mathcal{F}$ = +1.7 / +1.7 / +1.9 拉开 Cutie #Cheng-et-al.-2024。作者的解读是:训练集场景更复杂 → 结构理解更扎实 → 分割更准。
| Method(Trained-with-MOSE) | MOSE $\mathcal{J}\&\mathcal{F}$ | MOSE $\mathcal{J}$ | MOSE $\mathcal{F}$ | DAV-17 Test $\mathcal{J}\&\mathcal{F}$ | DAV-17 Test $\mathcal{J}$ | DAV-17 Test $\mathcal{F}$ |
|---|---|---|---|---|---|---|
| XMem | 59.6 | 55.4 | 63.7 | 79.6 | 76.1 | 83.0 |
| DeAOT-R50 | 64.1 | 59.5 | 68.7 | 82.8 | 79.1 | 86.5 |
| DEVA | 66.0 | 61.8 | 70.3 | 82.6 | 78.9 | 86.4 |
| Cutie | 67.0 | 62.8 | 71.3 | 83.7 | 80.0 | 87.4 |
| OASIS | 67.5 | 63.2 | 71.9 | 85.4 | 81.7 | 89.3 |
6.3 消融:每个组件各赚多少
三个新设计(Canny 粗边融合 +CaE、结构解码器 +SD、evidential learning)外加一项结构解码器内部的对象记忆融合实验(+SD*,即 $\star$)——逐级叠加。受资源限制,消融只在 DAVIS-17 训练集上训有限 iter,但相对趋势清晰。
| Setting | DAV-17 Val $\mathcal{J}\&\mathcal{F}$ | $\mathcal{J}$ | $\mathcal{F}$ | DAV-17 Test $\mathcal{J}\&\mathcal{F}$ | $\mathcal{J}$ | $\mathcal{F}$ |
|---|---|---|---|---|---|---|
| Baseline | 84.8 | 81.6 | 88.0 | 79.9 | 76.0 | 83.7 |
| +CaE | 84.9 | 81.8 | 88.1 | 80.0 | 76.0 | 84.0 |
| +CaE+SD | 85.1 | 82.0 | 88.1 | 80.3 | 76.3 | 84.5 |
| +CaE+SD* | 85.4 | 82.2 | 88.6 | 80.8 | 76.8 | 84.9 |
| OASIS(+EDL) | 85.6 | 82.4 | 88.7 | 81.0 | 76.9 | 85.1 |
因子 $\epsilon$ / $\beta$ 的敏感性
两因子从 0 增大时精度先升——印证"强调边界特征有益";但过大后会引入特征分布漂移而掉点($\beta=5.0\to85.0$,$\epsilon=2.0\to85.0$)。$\epsilon$ 最优为 $0.5$;$\beta$ 消融峰值在 $2.0$($\mathcal{J}\&\mathcal{F}=85.7$),但作者最终部署取 $\beta=1.0$(与 $2.0$ 差距极小,$85.6$ vs $85.7$),且最佳 $\beta \gt \epsilon$——说明更精细的结构信息比粗边更该被看重。
| $\beta$ | $\mathcal{J}\&\mathcal{F}$ | $\mathcal{J}$ | $\mathcal{F}$ | $\epsilon$ | $\mathcal{J}\&\mathcal{F}$ | $\mathcal{J}$ | $\mathcal{F}$ |
|---|---|---|---|---|---|---|---|
| 0.5 | 85.3 | 82.1 | 88.5 | 0.0 | 85.3 | 82.2 | 88.5 |
| 1.0 | 85.6 | 82.4 | 88.7 | 0.5 | 85.6 | 82.4 | 88.7 |
| 2.0 | 85.7 | 82.5 | 88.9 | 1.0 | 85.1 | 81.8 | 88.3 |
| 5.0 | 85.0 | 82.0 | 87.9 | 2.0 | 85.0 | 82.0 | 87.9 |
增益不是靠堆参数
为排除"涨点来自参数变多"的质疑,作者给 baseline 加一个约 2M 参数的卷积投影网络做对照:参数同样到 31M,但 $\mathcal{J}\&\mathcal{F}$ 只到 85.1 且 FPS 掉到 37;OASIS 同样 31M 却到 85.6 且 48 FPS。配合消融里"有/无结构解码器"的对比,可下结论:增益来自结构精修设计本身,而非参数量。
| Method | #Params | DAV-17 Val $\mathcal{J}\&\mathcal{F}$ | $\mathcal{J}$ | $\mathcal{F}$ | FPS |
|---|---|---|---|---|---|
| Baseline | 29M | 84.8 | 81.6 | 88.0 | 52 |
| +2M Proj Net | 31M | 85.1 | 82.0 | 88.1 | 37 |
| OASIS | 31M | 85.6 | 82.4 | 88.7 | 48 |
6.4 定性结果
两个 YouTube-VOS 2019 验证集片段上对比:既有 SOTA 在鱼相互遮挡(1–3 行)与蜗牛触角(4–6 行)上要么分不开对象、要么靠记忆机制累积误差。OASIS 凭 evidential learning 更好地建模重叠鱼的结构、凭结构精修修正触角的累积偏差。
把 OASIS 放回 memory-based SVOS 的技术谱系,它的位置很清晰:建立在 STM→STCN→AOT→DeAOT→XMem→DEVA→Cutie 主线之上,从 Cutie #Cheng-et-al.-2024 起再往前走半步——不换骨架,只在主干旁挂一条结构侧信道 + 一个不确定性损失。两条跨界引入(Canny 粗边 #Canny-1986、EDL #Sensoy-et-al.-2018)都是成熟技术,OASIS 的贡献是"把它们以正确的方式接进 VOS"。这也呼应了团队背景:IMVR Lab 长期在医学视频分割里跟边界、不确定性打交道,把那套方法论迁移到通用 VOS 是自然的跨界。
7.1 与同行的横向对比
| 维度 | OASIS | Cutie | XMem | DEVA | SAM 2 |
|---|---|---|---|---|---|
| 核心表示 | 帧特征 + 记忆 + 结构图 $s_t$ | 帧特征 + 记忆 + 对象查询 | 帧特征 + 多级记忆 | 解耦分割与跟踪 | 基础模型 + streaming memory |
| 训练目标 | CE + Dice + EDL | CE + Dice | CE + Dice | CE + Dice + 一致性 | 多任务 + 可提示 |
| 推理特点 | 逐帧 + 结构侧精修,48 FPS | 逐帧对象级读取 | 长视频多存储 | tracking-by-detection | 流式可提示,零样本 |
| 差异化 | 显式结构维度 + 不确定性 | 对象级推理 | 记忆巩固 | 解耦通用性 | 规模与泛化 |
| 适用条件 | 有第一帧 mask 的 SVOS | SVOS | 长视频 SVOS | 通用分割模型接入 | 图像 + 视频统一 |
可以看到,OASIS 差异化的两条线(结构 + EDL)都是正交于"如何记记忆"这个既有主线的增量维度——它没去抢"记忆设计"的话语权,而是补"结构理解"与"不确定性表达"两个空缺。
7.2 局限性(含论文未明说之处)
OASIS 正文没有专门的局限分析段,以下几点是结合全文与可复现性评估梳理出的缺口,供读者判断:
- 结构图 GT 的"predefined filter"未给具体核——结构图监督信号如何由 mask 生成,缺可复现细节。
- EDL 的 $\eta$ 与 $\text{KL}_{\text{div}}$ 闭式未在本文重述,均指向 EDL 原文 #Sensoy-et-al.-2018;想完整复现需回该原文。
- 推理硬件 / 分辨率 / 框架版本未披露,48 FPS 是相对比较,绝对部署画像不清。
- 消融受资源限制,只在 DAVIS-17 训练集 + 有限 iter 上做,全量设置下的消融趋势未给。
- 长视频记忆膨胀未讨论——memory-based 共性代价,OASIS 未单独应对(也未在 LVOS 等长视频基准上评估)。
7.3 可带走的启发
- "生成"降维成"选择"是一个普适的省力姿势。把难预测的边缘,靠 Canny 先给粗版,再让小解码器挑目标边——这一招可迁移到任何"需要细结构、但端到端生成太贵"的分割/检测任务。
- 显式"第三维输入"往往比堆参数更划算。OASIS 用 +2M 参数换 +0.8 $\mathcal{J}\&\mathcal{F}$(参数对照表语境,$85.6$ vs baseline $84.8$),对照的 +2M 投影网络只换 +0.3 且掉速度。判断一个改进值不值,看的是"信息正交性"而非参数量。
- logits 形式软门控优于二值硬门控。结构图以 logits 乘回特征,让"模型更有信心的边界"被更强强调——这是连续控制,比 0/1 mask 更平滑、更抗过拟合(消融里过大 $\beta$ 掉点反证了分布漂移风险)。
- EDL 适合实时任务的不确定性量化。单次前向给出不确定性,无需 ensemble / MC-dropout,凡是"遮挡 / 重叠 / 高相似"导致过度自信的实时分割,都可考虑挂一个 EDL 损失项。
- 分阶段训练防噪声污染。对噪声敏感的模块(结构解码器、EDL)在伪数据预训练阶段先关掉、上真数据再开——这是低成本但有效的鲁棒性工程判断。
参考来源
- Qin, G. et al. (2025). Structure Matters: Revisiting Boundary Refinement in Video Object Segmentation (OASIS). arXiv:2507.18944 · jinlab-imvr/OASIS
- Canny, J. (1986). A Computational Approach to Edge Detection. IEEE TPAMI.
- Oh, S. W. et al. (2019). Video Object Segmentation Using Space-Time Memory Networks (STM). ICCV 2019. arXiv:1904.08629
- Cheng, H. K. et al. (2021). STCN: Rethinking Space-Time Networks for Long-Term Video Object Segmentation. NeurIPS 2021.
- Yang, Z. et al. (2021). Associating Objects with Transformers for Video Object Segmentation (AOT). NeurIPS 2021.
- Cheng, H. K. & Schwing, A. (2022). XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. ECCV 2022. arXiv:2207.07115
- Yang, Z. et al. (2022). Decoupling Features in Hierarchical Propagation for Video Object Segmentation (DeAOT). NeurIPS 2022.
- Cheng, H. K. et al. (2023). Tracking Anything with Decoupled Video Segmentation (DEVA). ICCV 2023. arXiv:2309.03903
- Sensoy, M., Kaplan, L. & Kandemir, M. (2018). Evidential Deep Learning to Quantify Classification Uncertainty. NeurIPS 2018. arXiv:1806.01772
- Cheng, H. K. et al. (2024). Putting the Object Back into Video Object Segmentation (Cutie). CVPR 2024. arXiv:2310.18982
- Ravi, N. et al. (2024). SAM 2: Segment Anything in Images and Videos. Meta AI / ICLR 2025. arXiv:2408.00714 · 精读 →
- Pont-Tuset, J. et al. (2017). The 2017 DAVIS Challenge on Video Object Segmentation. arXiv:1704.00675
- Xu, N. et al. (2018). YouTube-VOS: Sequence-to-Sequence Video Object Segmentation. ECCV 2018. arXiv:1809.03327
- Liao, Y. et al. (2023). MOSE: A New Object Segmentation Benchmark for Complex Videos. CVPR 2023.