ESC
输入关键词搜索文章
目录

MoRIC

NeurIPS 2025 · Imperial College London
区域化 INR + C* 自适应链码:用任意形状边界把过拟合编解码推向新 SOTA
-10.73%单物体 BD-rate vs VTM
-2.79%全图 BD-rate vs VTM (Kodak)
<800单物体解码 MACs/px
>100×解码复杂度低于 MLIC++

论文信息

Part 1 · 引言
为什么 overfitted codec 需要一次"分而治之"的重构

传统图像压缩靠手工设计的变换(JPEG 的 DCT、HEVC/VVC 的块划分)捕捉像素间的统计冗余 #VTM-2021。近年的学习式编解码器用神经网络替换这些手工变换,率失真(RD)性能突飞猛进,但代价是模型体量和解码算力远超商业编解码器,落地困难 #MLIC-2024。为了在"低解码复杂度"和"高压缩性能"之间找到平衡点,过拟合编解码器(overfitted codec)应运而生:它用轻量 MLP 构成的隐式神经表示(INR)为每一张图单独拟合一个连续函数,把量化后的网络权重当作码流 #COIN-2021。COIN 之后的 COOL-CHIC、C3、LotteryCodec 一路把 RD 性能推到了超越 BPG/HEVC 的地步 #COOL-CHIC-2023 #C3-2024

但这条路撞到了一堵墙:一张图用一个网络拟合。图像不同区域的统计特性差异很大——天空平缓、纹理复杂、边缘锐利——用一个固定架构的网络硬塞所有区域,要么网络太大(码率高),要么太小(拟合不了局部细节)。更要命的是,当你想进一步做"只压缩画面里那个行人"这种语义级控制时,矩形像素网格的变换根本不认识"任意形状的物体"。

关键张力:shape-based coding(按形状编码)在视频编码界研究了几十年却从未真正落地,根因是变换编码(transform coding)很难为任意形状设计专用变换 #Li-MoRIC-2025。而 INR 恰恰能在任意形状上训练——这给了 MoRIC 一个绕开历史难题的机会。

MoRIC(Modular Region-based Implicit Codec)抓住了这个机会,它的核心重构就一句话:把"一张图一个网络"拆成"多个区域多个网络",区域边界用链码单独编码,区域内信号用 INR 在任意形状上拟合 #Li-MoRIC-2025。这条拆分把"形状"和"区域内信号"解耦成两条独立链路,恰好绕开了 transform-based shape coding 几十年没解决的变换设计困难。其中轮廓编码用的是论文新设计的 C\* 自适应链码——这正是本系列读者最关心的"链码处理轮廓图像"的现代版答案,也是本文相对库内 ECC 链码精读 的差异化价值所在。

结果相当耀眼:单物体压缩上 BD-rate 比 VTM-19.1 低 10.43%(Davis)/10.73%(Kodak),解码只需 <800 MACs/像素;全图压缩在 Kodak(−2.79%)和 CLIC2020(−10.58%)上以 <2000 MACs/像素的复杂度超越 VTM-19.1,号称"首个在 Kodak 上(以 <2000 MACs/像素低复杂度约束)超越 VTM 的神经编解码器" #Li-MoRIC-2025。本文就带你看透它是怎么做到的——尤其是那个把链码从 1961 年的 Freeman 推到 2025 年的自适应版本的 C\* coding。

MoRIC 框架总览
图 1:MoRIC 框架总览。三大特征:精确的单物体压缩、区域自适应编码、可扩展的分层压缩。(来源:Li et al., NeurIPS 2025, Fig.1)
Part 2 · 问题剖析
从"一个网络拟合全图"到"多个网络拟合各区域"的形式化分治

要看懂 MoRIC 的改法,得先看清它要改的"标准过拟合编解码器"长什么样。论文 §3.1 给了一个非常干净的形式化对照 #Li-MoRIC-2025

标准过拟合编解码器:一个网络 + 一个 latent

标准方案(Fig. 2a)把整个数据点 \(S\) 用一个函数 \(g_W\) 和一个 latent 向量 \(z\) 拟合:编码端做拟合 \(F\)、量化 \(Q\)、熵编码 \(A\);解码端用量化后的 \(\hat W, \hat z\) 重建 \(\hat S = g_{\hat W}(\hat z)\)。它的率失真分别为:

$$D = \mathbb{E}_{S\sim p_s}\bigl[d(S, g_{\hat W}(\hat z))\bigr]$$
$$R = \mathbb{E}_{S\sim p_s}\bigl[-\log_2 p_{\hat\psi}(\hat z) - \log_2 p(\hat W) + R_{\hat\psi}\bigr]$$

这里 \(p_{\hat\psi}(\cdot)\) 是用一个轻量自回归熵模型(ARM)估计的 \(\hat z\) 分布,\(R_{\hat\psi}\) 是传 ARM 参数的额外开销 #COOL-CHIC-2023。问题很清楚:一个 \(g_W\) 要同时搞定全图所有区域,复杂度被强制拉高,码率随之膨胀;而且你想单独压"画面里那个人"根本做不到——网络是按矩形像素网格训练的。

模块化分层编解码器:区域 + 轮廓 + 选择函数

MoRIC(Fig. 2b)把图像切成 \(N\) 个互斥区域 \(\{S^1,\dots,S^N\}\),每个区域 \(S^i\)独立的 \(g_{W^i}\) 和 latent \(z^i\) 拟合。关键创新在于:区域位置信息不再靠矩形坐标,而是靠轮廓 \(\tau^i\),用链码方案 \(C(\cdot)\) 单独压缩。解码时 \(\tau^i\) 通过一个选择函数 \(S(\cdot)\) 指导该用哪套 \(\{W^i, z^i\}\),逐区域重建:

$$\hat S = \bigcup_{i=1}^{N} g_{\hat W^i}(\hat z^i, x^i)$$

新的率变成各区域 latent 之和 + 轮廓 + 共享 ARM:

$$R = \mathbb{E}_{S\sim p_s}\Bigl[\sum_{i=0}^{N}\bigl(-\log_2 p_{\hat\psi}(\hat z^i) - \log_2 p(\hat W^i) - \log_2 p(\tau^i)\bigr) + R_{\hat\psi}\Bigr]$$
这条形式化重构的精髓:每个区域用不同 \(W^i\),但共享一个 ARM。区域化带来局部专业化(每个 LSN 更小更专),共享带来参数复用(ARM 不膨胀)。而 \(\tau^i\) 这一项把"形状"从变换编码的几何难题里彻底剥离出来,交给链码处理——这是 MoRIC 能落到实处的根因。

一个自然的疑问是:把图切成区域、再为每个区域单独编码轮廓,这些额外的"分区信令"和"轮廓比特"会不会反而吃掉收益?答案是:在低 bpp 区间,轮廓和网络开销确实会主导码率(Fig. 7 显示低 bpp 下轮廓占近 80%);但在中高 bpp 区间,区域化的拟合增益远超这些开销。这正是后面 C\* coding 要"有损/无损自适应"的动机——低 bpp 时允许轮廓有损以省比特,高 bpp 时切换无损保精度。

Part 3 · 模型结构
MoRIC 架构详解:LSN + GMN + PCM + C* 链码

MoRIC 由四个组件构成:局部合成网络 LSN(每个区域一个)、全局调制网络 GMN(全区域共享)、latent 调制 \(z^i\)(每区域可学向量)、共享 ARM(熵模型)。再加上把它们串起来的 PCM 机制 和负责轮廓的 C\* 链码。我们逐个拆开看 #Li-MoRIC-2025

MoRIC 架构
MoRIC 架构:从标准过拟合 codec 到模块化区域 codec 的演进。(来源:Li et al., NeurIPS 2025, Fig.2/3)

局部合成网络 LSN 与全局调制 GMN

每个区域的 LSN \(g_{W^i}\) 接收轮廓内的坐标 \(x^i\),重建该区域的像素强度。它由 \(L_s = 4\) 层卷积组成,每层后跟一个共享调制器 \(M(\cdot)\)\(M(\cdot)\) 把上一层输出与 GMN 提供的调制向量拼接,过一个权重共享的 MLP 生成下一层输入。

GMN \(f_\theta\) 全局优化、跨区域共享。它由上采样模块(转置卷积)+ \(L_m = 4\) 层卷积构成,把量化后的 \(\hat z^i\) 上采样成多尺度调制向量喂给 LSN 各层。这里有个精妙的设计:\(M(\cdot)\) 的参数在区域间共享。好处有三:(a) 参数共享直接降码率;(b) 跨层 coarse-to-fine 多尺度调制;(c) 局部与全局特征隐式融合。一个区域的小 LSN 借这套共享调制器,就能"借到"全局上下文,不必自己重新学。

PCM:把全局上下文"累积拼接"地注入局部

光有共享调制器还不够,论文进一步提出 Progressive Concatenated Modulation(PCM),把全局上下文以 coarse-to-fine 的方式持续注入局部合成。latent \(z^i\) 被设计成 \(L\) 个多分辨率向量 \(\{z^i_1,\dots,z^i_L\}\),每个 \(z^i_j\) 对应 \(2\times2\) 逐级下采样(最粗层缩减 \(4^{L-1}\) 倍)。GMN 把它们上采样成 \(U^i_k\),PCM 的关键一步是累积拼接而非单尺度替换

PCM 调制向量

$$M^i_k = \text{Concatenate}(U^i_1, U^i_2, \dots, U^i_k)$$

\(k\) 层的调制向量是前 \(k\) 个尺度特征的拼接。每层 \(M(\cdot)\)\(M^i_k\) 与当前层输出拼接后过共享 MLP。直观上,这让每个区域在每一层都能"看到"从粗到细的全部全局上下文,动态精修自己的表示。

这种设计让 MoRIC 意外获得了一个跨区域泛化能力:即使只传背景 LSN,共享的 GMN/PCM 也能让局部 LSN 推断出其他区域的颜色和结构——这正是后面"分层压缩"能成立的基础。论文也指出 MoRIC + PCM 是一个通用框架,可替换为其他调制策略(如 Mehta 的 modulator 或 FiLM)#Li-MoRIC-2025

MoRIC 工作流
图 4:MoRIC 工作流。图像被划分为 N 个区域,每个区域用独立的 LSN \(g_{\hat W^i}\) 配合共享 GMN \(f_{\hat\theta}\) 调制。(来源:Li et al., NeurIPS 2025, Fig.4)

C\* 自适应链码:本篇的链码核心

前面所有架构都建立在"已知区域轮廓 \(\tau^i\)"之上。那 \(\tau^i\) 怎么压缩?这才是本系列读者最该看懂的部分。MoRIC 没有用现成的链码,而是设计了 C\* coding,灵感来自 Chang、Kulkarni、Koplowitz 1992 年的 Adaptive chain coding for arbitrary curves #Chang-1992。它要同时满足三个目标:(a) 对目标对象的语义覆盖(不漏边界像素);(b) 对高曲率的鲁棒性(自适应膨胀);(c) 平衡的 RD 折中。

C\* coding 由四个模块组成:角度匹配(angle matching)、全局重置(global resetting)、偏移自适应(offset adaptation)、轮廓膨胀(contour dilation)。我们从 Freeman 链码的基础讲起,逐步看每个模块为什么必要 #Freeman-1961

起点:带步长的方向量化。从初始点出发,给定步长 \(T\)(像素)和初始角 \(\varphi_0\),把方向空间均分为 \(M_0\) 个角度候选。每走一步,计算"下一个 \(T\) 距离处轮廓点"相对最近角度候选的偏移角 \(\theta_t\) 和距离偏移 \(d\)每步比特成本是:

$$\text{bit/step} = \lceil \log_2(M_t) \rceil + 1$$

第一位用于角度选择,+1 用于重置信令。注意 \(M_t\) 是带下标的——它会自适应变化,这正是 C\* 与固定 8 方向 Freeman 链码的根本区别。

模块一:角度匹配。每一步在当前角度划分 \(M_t\) 里选最接近真实轮廓走向的候选。划分越细(\(M_t\) 越大),角度越准,但每步比特成本越高。所以 C\* 不固定 \(M_t\),而是让它在曲率变化时动态伸缩。

模块二:全局重置(失步重同步)。当某步的偏移距离过大,说明当前角度划分已经"跟丢"了轮廓,需要临时切到最细粒度重新对齐。触发条件是:

全局重置触发条件

$$d > 2T \sin\Bigl(\frac{\varphi_{t-1}}{4M_{t-1}}\Bigr)$$

右边是"四分之一方向格的弧弦长"——当真实点偏离最近候选超过这个阈值,就触发重置:临时令 \(\varphi_t = 2\pi, M_t = 16\)(最细),完成一步精确对齐后恢复初值 \(\varphi_{t+1}=\varphi_0, M_{t+1}=M_0\)。这相当于链码版的"丢同步后重新握手"。

模块三:偏移自适应(曲率伸缩)。重置之外,C\* 还根据累积平均偏移 \(\bar\theta_t\) 做更平缓的角度伸缩,三分支决策:

偏移自适应三分支

  • \(\bar\theta_t \lt \frac{2\varphi_t}{M_t-1}\):偏移很小,说明当前方向够准,把角度减半 \(\varphi_{t+1} = \frac{1}{2}\varphi_t\)(精益求精,省比特)。
  • \(\bar\theta_t \gt \frac{M_t}{\varphi_t}-1\):偏移太大,角度倍增 \(\varphi_{t+1} = 2\varphi_t\),并清零统计 \(\bar\theta_t = 0\)(重新捕获曲率)。
  • 否则保持 \(\varphi_{t+1} = \varphi_t\)

这套"小则减半、大则倍增"的逻辑让链码在平滑段用粗划分省比特、在拐角用细划分保精度——和差分链码"方向连续时熵低"的统计规律一脉相承,但更进一步做到了曲率自适应

模块四:选择性膨胀(语义覆盖兜底)。链码只描述一条曲线,但区域编码要保证轮廓"包住"目标。每轮编码后检查误差 \(\epsilon\),若 \(\epsilon \gt \epsilon_0\)(轮廓没盖住目标),用 \(3\times3\) 核对轮廓做膨胀再重编码,直到覆盖达标或达迭代上限 \(K\)。这步直接防止"漏掉边界像素导致语义损失和 RD 急剧退化"。

四模块跑完,最后过一遍 MTF(move-to-front)变换 #Bentley-1986 去掉方向序列的局部冗余,为后续熵编码铺路。完整伪代码见 Algorithm 1(论文 Appendix D.2)。

flowchart TD
  A["初始点 + 步长 T + 初值 φ0, M0"] --> B["角度匹配: 选最近候选"]
  B --> C{"偏移 d > 2T sin(φ/4M)?"}
  C -->|"是"| D["全局重置: φ=2π, M=16"]
  D --> E["偏移自适应: θ̄ 小→减半 / 大→倍增"]
  C -->|"否"| E
  E --> F{"一轮编码完成?"}
  F -->|"否"| B
  F -->|"是"| G{"误差 ε > ε0?"}
  G -->|"是"| H["3×3 膨胀 → 重编码"]
  H --> F
  G -->|"否"| I["MTF 变换 → 输出码流"]

有损 vs 无损:两套模式自适应切换

C\* coding 提供两种模式。有损模式就是上面完整的四模块自适应链码,步长 \(T\) 可调(Table 1 消融里测了 \(T=1/4/6/10\))。无损模式则固定 \(\varphi = 2\pi, M = 8\),再过 MTF,并额外提供三种可选策略压缩方向序列:(1) VCC 顶点链码共享顶点描述 #Bribiesca-1999;(2) 3OT 三正交链码按先验方向差分 #3OT-2005;(3) NAD 归一化角差链码。这三种都是经典链码方案,MoRIC 把它们作为无损模式的可选项内置,承诺开源。

与库内 ECC 的对照:ECC 用"36 符号扩展 + 共享边界跳过"做语义地图无损压缩,目标是多值标签图;而 MoRIC 的 C\* 走的是"步长 + 角度双自适应"路线,目标是单物体/全图的有损-无损可切换轮廓压缩,且与 RD 优化耦合(比特代价进码流但不进训练 loss)。两者代表了链码现代化的两条不同思路。
Part 4 · 训练
RD 分治优化:可微训练 + 不可微编码的分离

MoRIC 训练时把数据点拟合成参数集 \(\Omega = \{\psi, \theta, \{z^i, \tau^i, W^i\}_{i=1}^N\}\),最小化:

$$\mathcal{L}(\Omega) = \sum_{i=0}^{N}\bigl[d(S^i, \hat S^i) + \lambda R(\hat z^i)\bigr], \quad \hat S^i = g_{W^i}(f_\theta(\hat z^i), x^i)$$

这里有个非常关键的设计选择:rate 项只对 latent \(\hat z^i\) 计算,轮廓 \(\tau^i\) 和网络参数 \(\{\theta, W^i, \psi\}\) 被排除在训练 loss 之外 #Li-MoRIC-2025。原因有二:一是它们的贡献相对小,二是它们不可微(链码是离散过程、参数量化用非学习分布)。于是 MoRIC 走了一条典型的"分治":训练时只让可微的 latent 进 RD loss,离散的轮廓和网络参数用各自的编码器处理,最后全部计入最终码流。这样既保住了端到端可微训练,又不丢任何码率成分。

两阶段量化感知优化

latent \(z^i\) 的量化继承自 C3 的两阶段策略 #C3-2024。训练 Stage I 用带温度的 soft-rounding 加 Kumaraswamy 噪声近似量化(可微),温度和噪声退火让分布从尖峰过渡到均匀;Stage II 与推理用硬量化:

$$\hat z^i = \begin{cases} \text{ST}(z^i) + \text{Kumaraswamy noise} & \text{Training Stage I} \\ Q(z^i) & \text{Stage II \& Inference} \end{cases}$$

网络参数(\(W^i, \theta, \psi\))走标量量化 + 非学习 Laplace 熵模型,量化步长 \(\Delta\) 用贪心搜索确定。latent 的熵模型则是学习的 Laplace 分布,按空间邻域条件化:

$$p_\psi(\hat z^i) = \prod_{k,j} p_\psi(\hat z^i_{k,j} \mid c^i_{k,j})$$

最后用 range coder 把 \(\hat z^i\) 压进码流。

训练配置披露表

配置项披露状态值 / 说明
训练数据已披露DAVIS / Kodak / CLIC2020(逐图过拟合,非大规模训练集)
训练硬件已披露RTX 3090 + i9-10980XE @3.00GHz
优化器未披露原文未明确给出优化器类型
学习率部分披露Stage II: 1e-4 → 1e-8,40 步无改善 decay ×0.8
Batch size未披露原文未给出(逐图过拟合场景)
训练步数已披露Stage I: 1e5 步;Stage II: 1e4 步
训练时长部分披露单区域 17.54 sec/1k steps;三区域 32.06 sec/1k steps
模型参数量未披露原文未给出总参数量
精度格式未披露原文未明确训练精度
Checkpoint 策略未披露原文未给出
RD 权衡 λ(7 档)已披露{2e-2, 8e-3, 4e-3, 2e-3, 1e-3, 5e-4, 2e-4}
架构层数已披露LSN Ls=4,GMN Lm=4,latent L=7
量化退火已披露温度 T: 0.3→0.1(Stage I);Kumaraswamy: 2.0→1.0
区域 mask 来源已披露DAVIS 原生 mask;Kodak 用 SAM2 生成 #SAM2-2024
Part 5 · 推理
解码链路与分层压缩:coarse-to-fine 的可扩展解码

MoRIC 的推理流程和训练有明确差异:训练时 latent 走 soft-rounding + 噪声,推理时直接硬量化;网络参数也直接量化。解码端拿到码流后,先用链码重建各区域轮廓 \(\tau^i\),再用选择函数 \(S(\cdot)\) 把每段轮廓映射到对应的 \(\{W^i, z^i\}\),逐区域用 \(g_{\hat W^i}(f_{\hat\theta}(\hat z^i), x^i)\) 重建,最后区域合并成完整图像。

低解码复杂度的来源

MoRIC 解码便宜,根因是区域化让每个 LSN 只需拟合自己那块区域,网络小、算力低。单物体压缩只需 <800 MACs/像素,全图压缩 <2000 MACs/像素,比 MLIC++ 低 >100× #Li-MoRIC-2025。更激进的是,由于各区域独立解码,MoRIC 还支持部分解码:只重建感兴趣区域。论文报告相对 VTM 省 2× 计算 + 73.56% 码率,相对 MLIC++ 省 1235× 计算 + 37.31% 码率——这对固定摄像头场景(只关心画面里的运动物体)极有价值。

MoRIC 重建示例
MoRIC 单物体重建可视化:区域 LSN 精确拟合目标,背景由固定端已知。(来源:Li et al., NeurIPS 2025, 项目页)

分层压缩:先粗后细的可扩展码流

MoRIC 还揭示了一个 overfitted codec 的新能力:语义可泛化。得益于共享的 GMN/PCM,即使解码端只收到背景 LSN,也能产生语义可辨的粗重建——对象结构和语义仍清晰可认,只是颜色不准。随后再逐层传区域专属 LSN,颜色和纹理逐步精修(Fig. 11)。这种 coarse-to-fine 的码流对高分辨率多区域图像特别友好,支持渐进式精修和可控的区域级重建。

这个能力的深层意义:它把 overfitted codec 从"一张图一个死网络"升级成了"可分层的语义码流"。背后是 PCM 把全局上下文注入每个局部 LSN,让局部网络能跨区域推断——这其实是 Gündüz 课题组在语义通信/JSCC 长线研究 #DeepJSCC-2019 向 INR 压缩的自然迁移。
Part 6 · 实验验证
单物体 SOTA、全图超 VTM 与 C* 消融

MoRIC 在 DAVIS、Kodak、CLIC2020 上对比 VTM、EVC、MLIC++、C3、COOL-CHIC v4、LotteryCodec,用 PSNR(RGB)、BD-rate、MACs/像素、编码延迟评测 #Li-MoRIC-2025

实验配置表

配置项披露状态值 / 说明
评测数据集已披露DAVIS / Kodak / CLIC2020
评测指标已披露PSNR↑ (RGB) / BD-rate↓ / MACs/px / 编码延迟
Baseline 方法已披露VTM-19.1, EVC-S/M/L, MLIC++, C3, COOL-CHIC v4, LotteryCodec
推理硬件已披露RTX 3090 + i9-10980XE @3.00GHz
推理分辨率部分披露Kodak 512×512 量级;DAVIS 视频帧分辨率,未逐一标注
推理环境未披露原文未明确框架/版本(代码仓用 PyTorch + CompressAI)

单物体压缩:SOTA 且解码极轻

单物体任务是 MoRIC 的主战场(只压目标区域,背景假设已知)。在 DAVIS 和 Kodak 上,MoRIC 以 -10.43% / -10.73% 的 BD-rate(相对 VTM-19.1)在单物体压缩上超越当前最强神经编解码器 MLIC++,解码只需 <800 MACs/像素——远低于所有 AE-based 编解码器。

单物体压缩 RD 曲线
图 6:单物体压缩 RD 性能。(a-b) DAVIS/Kodak 的 RD 曲线与 BD-rate;(c) BD-rate vs 解码复杂度,MoRIC 占据左下(低复杂度高性能)。(来源:Li et al., NeurIPS 2025, Fig.6)

全图压缩:在 Kodak/CLIC2020 上超越 VTM

全图任务下,MoRIC 在 overfitted codec 里 SOTA:比 C3 低 5.0%(Kodak)/5.48%(CLIC2020),比 COOL-CHIC v4 低 5.51%(DAVIS)。更重要的是,它在 Kodak(−2.79%)和 CLIC2020(−10.58%)上超越 VTM-19.1,号称"首个在 Kodak 上超越 VTM 的神经编解码器"。对比同组前作 LotteryCodec(−0.66%/−9.79%),MoRIC 进一步拉大优势。不过它仍落后于 MLIC++,但解码复杂度低 100× 以上。

别漏掉这个限定语:论文的"超越 VTM"始终带着 <2000 MACs/像素 的低复杂度姿态。这不是单纯的 RD 数字胜利,而是"在远低于 VTM 算力的约束下反超"——对固定背景/多用户流媒体场景更有实际意义。
全图压缩 RD 曲线
图 8:全图压缩 RD 性能与 BD-rate(Davis/Kodak/CLIC2020)。MoRIC 在 Kodak/CLIC2020 超越 VTM-19.1。(来源:Li et al., NeurIPS 2025, Fig.8)
RD 与解码复杂度折中
图 9:RD 性能与解码复杂度的折中(Davis/Kodak/CLIC2020)。MoRIC 在同等复杂度下 RD 最优。(来源:Li et al., NeurIPS 2025, Fig.9)

baseline 对比汇总

把散落在各处的 BD-rate 数值汇成一张表,更易看清 MoRIC 相对各 baseline 的改进幅度(负值=MoRIC 更优):

对比 baseline任务数据集MoRIC BD-rate 改进说明
vs VTM-19.1单物体DAVIS / Kodak-10.43% / -10.73%解码 <800 MACs/px,超越 MLIC++
vs VTM-19.1全图Kodak / CLIC2020-2.79% / -10.58%解码 <2000 MACs/px,号称"首个在 Kodak 超 VTM 的神经 codec"
vs C3全图Kodak / CLIC2020-5.0% / -5.48%overfitted codec 间对比
vs COOL-CHIC v4全图DAVIS-5.51%overfitted codec 间对比
vs LotteryCodec全图Kodak / CLIC2020更优(LotteryCodec 自身 vs VTM 为 -0.66% / -9.79%)同组前作,MoRIC 进一步拉大优势
解码复杂度 vs MLIC++全图>100× 更低RD 仍落后 MLIC++,但算力代价极小
读表要点:MoRIC 的卖点不是绝对 RD 最强(全图仍落后 MLIC++),而是在远低于 VTM/MLIC++ 的算力约束下反超——这对固定背景、多用户流媒体等"一次编码多次解码"场景极有价值。

C\* 步长消融:低 bpp 增大步长略好,高 bpp 急剧退化

Table 1 给了 C\* coding 的核心消融——步长 \(T\) 从 1 增到 10,轮廓 IoU 从 100% 降到 87.31%,轮廓 bpp 从 0.0637 降到 0.0140(省了 78%),但高 bpp 下 PSNR 从 32.16 急退到 31.80:

步长 TIoU (%) ↓τ 的 bpp ↓总 bpp ↓PSNR (dB) ↑
1100%0.06370.21324.76
493.66%0.04090.20424.56
691.07%0.02440.19224.46
1087.31%0.01400.18624.43
关键发现:低 bpp 区间轮廓比特主导码率(Fig. 7 显示低 bpp 下轮廓占近 80%),此时增大 \(T\) 有损压缩轮廓能省可观比特而 RD 影响不大;但高 bpp 下轮廓精度变得关键,有损轮廓会急剧退化。这正是 C\* "有损/无损自适应切换"的设计依据——也是它与库内 ECC(纯无损)的根本场景差异。

其他消融与失败案例

组件消融显示:去掉 LSN 掉点最大(+5.35%),去掉 GMN 掉 +7.03%(产生 ringing artifact),去掉 PCM-GMN 掉 +3.56%,去掉 C\ 只掉 +0.47%(说明链码本身在整体 RD 里占比小,但提供了任意形状能力),矩形轮廓替代 C\ 掉 +2.53%(stitching artifact)。区域数消融:1→2 区域增益最大,最多用 3 区域(−1.72% vs single),再多收益递减而复杂度上升。

失败与局限同样清晰:高编码复杂度(单区域 17.54 sec/1k steps,三区域 32.06 sec)是最大短板,适合一次编码多次解码的多用户流媒体;低 bpp 下 contour+network overhead 主导高 bpp 下 lossy contour 退化全图仍落后 MLIC++分割误差敏感——IoU<20% 时鲁棒,30–40% 起显著退化,严重误差甚至导致编码不稳定。

Part 7 · 讨论与启发
在地图上的位置:链码与 INR 的历史性握手

把 MoRIC 放回它该在的位置,需要看三组对照。

维度Transform-based shape codingCOOL-CHIC/C3 系列MoRIC
编码对象矩形块像素 + 专用形状变换全图单网络任意形状区域 + 独立 LSN
形状处理设计任意形状专用变换(极难)不处理(矩形网格)链码 C* 独立编码
全局上下文块间预测单网络全局GMN + PCM 共享调制
低复杂度解码极低(<800–2000 MACs/px)
分层/语义控制天然支持

第一组对照揭示了 MoRIC 的历史意义:shape-based coding 研究了几十年没落地,根因是变换编码难为任意形状设计专用变换 #Li-MoRIC-2025。MoRIC 用"形状用链码 + 区域内信号用 INR"的解耦,第一次让 shape-based coding 在 INR 框架里实际跑通——这是链码与 INR 的一次历史性握手。

第二组对照定位了它在 overfitted codec 谱系里的位置:COIN 开山 #COIN-2021 → COOL-CHIC 引入 latent/熵模型 #COOL-CHIC-2023 → C3 引入 Wasserstein 失真 #C3-2024 → LotteryCodec 引入彩票掩码 #LotteryCodec-2025 → MoRIC 引入区域化 + 链码 + 全局调制。值得注意的是,通讯作者 Haotian Wu 同时是 LotteryCodec 的共同作者,Gündüz 是同一 PI——MoRIC 是其课题组在 2025 年"区域化+链码+全局调制"的升级路线,与 LotteryCodec 的"二值掩码"路线互补,两条都越过 VTM。

第三组对照落到本系列:与 ECC 的纯无损语义地图链码、MPEG-4 CAE 形状编码 的块级二值算术编码相比,MoRIC 的 C\* 把链码推进到了"步长 + 角度双自适应 + 有损/无损可切换 + 与 RD 耦合"的现代形态,是目前链码处理轮廓图像最新的代表作之一。

可操作启发:(1) 任何需要在任意形状区域上做信号拟合的任务,都可借鉴 MoRIC 的"形状链码 + 区域 INR"解耦,绕开专用变换设计;(2) C\* 的"小则减半、大则倍增"自适应角度伸缩思路,可独立用于其他需要曲率自适应的方向量化场景;(3) 共享调制器 + PCM 的"局部小网络借全局上下文"模式,对多目标场景的参数复用极有参考价值。

局限与未来方向也很明确:高编码复杂度是最大瓶颈,作者建议用 meta-learning 和区域级混合精度训练加速;视频编码扩展可利用相邻帧轮廓相关性 + 跨 GoF 共享调制;目前用 SAM2 离线生成 mask,未来可把分割集成进编码过程探索粒度-性能折中 #Li-MoRIC-2025。这些方向尚未有公开实现,是后续可跟进的开放问题。

References · 参考来源
文献与资源索引

参考来源

  • Li, G., Wu, H., & Gündüz, D. (2025). MoRIC: A Modular Region-based Implicit Codec for Image Compression. NeurIPS 2025. NeurIPS PDF · 项目页 · GitHub
  • Chang, N. L., Kulkarni, S. R., & Koplowitz, J. (1992). Adaptive chain coding for arbitrary curves. Curves and Surfaces in Computer Vision and Graphics III, SPIE, vol. 1830, 296–307.
  • Freeman, H. (1961). Techniques for the computer description of arbitrary planar curves. AFIPS SJCC.
  • Bribiesca, E. (1999). A new chain code. Pattern Recognition, 32(2), 235–251.
  • Sanchez-Cruz, N., & Rodriguez-Dagnino, R. (2005). Three-bit chain code. 相关 3OT 工作。
  • Bentley, J. L., Sleator, D. D., Tarjan, R. E., & Wei, V. K. (1986). A locally adaptive data compression scheme. Communications of the ACM, 29(4), 320–330.
  • Dupont, E., et al. (2021). COIN: Compression with Implicit Neural Representations. ICLR 2021 Workshop.
  • Ladune, T., et al. (2023). COOL-CHIC: Coordinate-based Low-complexity Hierarchical Image Codec. ICCV 2023.
  • Kim, et al. (2024). C3: High-performance and low-complexity neural compression from a single image or video. CVPR 2024.
  • Wu, H., et al. (2025). LotteryCodec. ICML 2025 / arXiv:2507.01204.
  • Bross, B., et al. (2021). Overview of the Versatile Video Coding (VVC) standard and its applications. IEEE TCSVT, 31(10), 3736–3764.
  • He, J., et al. MLIC++. 学习式图像压缩,多阶段上下文模型。
  • Ravi, S., et al. (2024). SAM 2: Segment Anything in Images and Videos.
  • Bourtsoulatze, E., Kurka, D., & Gündüz, D. (2019). Deep Joint Source-Channel Coding for Wireless Image Transmission. IEEE TCSVT.