ESC
输入关键词搜索文章
目录

AEIC 深度解读

CVPR 2026 · USTC & PolyU
0.94M 浅编码器 + 单步扩散解码 + 双面蒸馏:35.8 FPS 实时超低码率编码
0.94M编码器参数
35.8FPS @ 1080P 编码
18.2×编码加速 vs DLF
0.005–0.035bpp 码率范围
Part 1 · 引言
超低码率压缩:边缘设备的最后一公里

当码率降到 0.05 bpp 以下——一张 1080P 图像只能传输不到 50 KB 的数据——传统压缩算法(H.266/VVC)的输出几乎无法辨认,而感知导向的生成式方法(PerCo #Careil et al., 2023、DiffEIC #Li et al., 2024、StableCodec #Zhang et al., 2025、DLF #Xue et al., 2025)能合成视觉上逼真的重建。然而这些方法有一个共同的代价:编码端极其昂贵

以 StableCodec 为例,编码端需要串联 SD VAE 编码器 + ELIC 编码器 + 潜空间变换编码器,总参数量达到 47.16M,在 GTX 1080Ti 上编码一张 768×512 图像需要 328ms #Zhang et al., 2025。DLF 更慢,同样分辨率下需要 494ms #Xue et al., 2025。这意味着在 IoT 终端、无人机、卫星通信等编码端资源受限的场景中,这些方法根本不可部署。

Tianyu Zhang (USTC, 一作) Dong Liu (USTC, 通讯) Chang Wen Chen (PolyU) CVPR 2026 GitHub: LuizScarlet/AEIC

AEIC(Asymmetric Extreme Image Compression)的核心洞察非常直接:超低码率意味着 latent 的信息量天然受限,因此不需要深层编码器#Zhang et al., 2026。基于这个洞察,作者用 StarNet 架构 #Ma et al., 2024 构建了两个轻量编码器——AEIC-ME(3.09M 参数)和 AEIC-SE(0.94M 参数),配合基于 SD-Turbo 的单步扩散解码器 #Sauer et al., 2024,在超低码率下实现了感知质量 SOTA,同时 AEIC-SE 在 1080P 分辨率下达到 35.8 FPS 实时编码,比 DLF 快 18.2 倍,比 StableCodec 快 19.3 倍 #Zhang et al., 2026

一句话概括:超低码率压缩的编码端可以很轻——0.94M 参数的浅编码器配合单步扩散解码和双面蒸馏,在 ≤0.05 bpp 下同时拿到感知 SOTA 和实时编码。
Part 2 · 问题剖析
浅编码器为什么可行?——从码率到复杂度的理论分析

AEIC 最反直觉的贡献在于:它证明了超低码率压缩不需要复杂的编码器。现有方法几乎全部遵循"先过一遍预训练生成模型编码器(如 SD VAE encoder),再用一个额外的潜空间变换编码器做压缩"的两阶段范式 #Zhang et al., 2025 #Xue et al., 2025 #Li et al., 2024。编码端堆叠了大量参数,仅仅是为了产出一个极低维度的 latent。

离散码本分析

作者从离散和连续两个角度给出了理论论证。对于离散码本 $C = \{c_1, c_2, \dots, c_M\}$,最大可表示码率为 $\log_2 M$。编码时如果采用穷举搜索,计算复杂度为 $\mathcal{O}(M) = \mathcal{O}(2^{\mathcal{R}})$。这意味着当码率 $\mathcal{R}$ 降低时,所需的搜索空间随码率指数级缩小——超低码率天然允许低复杂度的编码过程 #Zhang et al., 2026

连续高斯分析

对于连续情况,高斯隐变量 $z \sim \mathcal{N}(\mu, \sigma^2)$ 的微分熵为:

$$h(z) = \frac{1}{2} \log(2\pi e\sigma^2)$$

码率(熵)完全由方差 $\sigma^2$ 决定。超低码率意味着 $\sigma^2$ 必须很小,即 latent 的取值范围非常窄。一个取值范围极窄的连续变量,不需要深层网络来表达——这就像只需要很少的离散码本元素一样 #Zhang et al., 2026

浅编码器动机分析
图 1:浅编码器的理论动机。(a) 编码器复杂度对比;(b) 正常码率编码 ELIC 的 latent 方差;(c) 超低码率方法的 latent 方差急剧缩小。(来源:Zhang et al., 2026, Fig. 2)

Fig. 1 的实证数据完美印证了这个分析:当码率从正常范围降到超低范围(0.01–0.035 bpp)时,无论是 ELIC #He et al., 2022、StableCodec 还是 DLF,latent 方差都急剧缩小。AEIC 的浅编码器可以产出与复杂编码器相同方差范围的 latent,说明超低码率下编码器的表达力根本不是瓶颈 #Zhang et al., 2026

核心 Insight

超低码率压缩的信息瓶颈在解码端——如何从极少的比特中重建视觉上可信的图像——而不在编码端。编码器只需要把输入映射到一个方差很小的 latent 空间,这是一个"简单"的任务。

Part 3 · 模型结构与创新
AEIC 非对称架构:轻编码 + 重解码 + 双面蒸馏

AEIC 的整体架构遵循非对称设计哲学:编码端尽量轻量(适合边缘设备),解码端承担重建的复杂性(可以在云端或高性能设备上运行)。这与传统压缩中"编码慢、解码快"的范式恰好相反,但在超低码率的 IoT/边缘场景中更为合理 #Zhang et al., 2026

AEIC 整体管线
图 2:AEIC-SE 整体管线。编码端用 StarNet 浅编码器直接在像素空间做分析变换,解码端通过合成变换、单步去噪和 lite VAE 解码器重建。(来源:Zhang et al., 2026, Fig. 1)

3.1 浅层分析变换编码器

给定输入图像 $x$,编码器直接应用浅层变换 $g_a$(基于 StarNet #Ma et al., 2024 的高效卷积网络)将其压缩为紧凑的 latent $y$,空间压缩比为 32×。量化后得到 $\hat{y}$,通过 hyperprior + 四叉树分区自回归上下文模型 #Minnen et al., 2018 #Li et al., 2023 估计高斯参数 $(\mu, \sigma)$ 进行算术编码。两个变体的配置如下:

模型$g_a$ 每层深度$g_a$ 维度熵模型深度熵模型维度编码器参数
AEIC-ME2(64, 128, 192, 256, 320)49603.09M
AEIC-SE1(32, 64, 128, 192, 256)35120.94M

AEIC-ME 和 AEIC-SE 仅在编码器 $g_a$ 和熵模型配置上不同,解码端完全相同

3.2 单步扩散解码器

解码端的核心创新是将 SD-Turbo #Sauer et al., 2024 裁剪为无条件单步去噪器。标准 SD-Turbo 的条件去噪过程为:

$$l_0 = [l_T - \sqrt{1-\bar{\alpha}_T} \cdot \epsilon_{\mathrm{SD}}(l_T, c, T)] / \sqrt{\bar{\alpha}_T}$$

其中 $c$ 是文本条件,$T$ 是时间步。但在图像压缩场景中,传输文本提示会增加额外码率开销,而已有研究 #Vonderfecht et al., 2025 表明文本提示对压缩重建质量的贡献微乎其微。因此 AEIC 直接移除文本编码器、时间步嵌入和所有交叉注意力层,将去噪器简化为无条件格式 #Chen et al., 2025

$$l_0 = \epsilon_{\mathrm{SD}}(l_T)$$

这一裁剪移除了超过 75M 参数,同时略微提升了性能(BD-rate -1.29% PSNR, -0.23% LPIPS)#Zhang et al., 2026

解码器还采用了双分支结构 #Zhang et al., 2025:合成变换 $g_s$ 的输出被拆分为纹理分支 $l_T$ 和结构残差分支 $l_{res}$,纹理经单步去噪后与残差相加,再送入 VAE 解码器:

$$\hat{x} = \mathcal{D}_{\mathrm{SD}}(l_0 + l_{res})$$

与 StableCodec 使用独立的辅助解码器不同,AEIC 将两个分支直接集成在 $g_s$ 中,增强了跨分支交互效率。此外,原始 SD-Turbo 的 VAE 解码器被替换为 50% 通道裁剪的轻量版本(49.5M → 12.4M 参数),性能退化不到 1% #Zhang et al., 2026

3.3 双面特征蒸馏

浅编码器 AEIC-SE 从头训练会导致严重性能下降(LPIPS BD-rate +8.47%)。作者提出双面特征蒸馏策略,将 AEIC-ME(教师)的知识迁移到 AEIC-SE(学生)。

双面特征蒸馏
图 3:双面特征蒸馏。编码器侧对齐 $y, z, \phi, \hat{y}$ 四个中间表征,解码器侧对齐 $l_T, l_{res}, l_0$ 及 UNet 内部特征。(来源:Zhang et al., 2026, Fig. 5)

编码器侧蒸馏 $\mathcal{L}_{enc}$ 对齐四个中间表征——$g_a$ 的输出 $y$、hyperprior 分析 $z$、hyperprior 合成 $\phi$、量化后 $\hat{y}$。由于师生维度不匹配,引入可学习投影 $f(\cdot)$(单层卷积):

$$\mathcal{L}_{enc} = \|y^{tea} - f(y^{stu})\|_2^2 + \|z^{tea} - f(z^{stu})\|_2^2 + \|\phi^{tea} - f(\phi^{stu})\|_2^2 + \|\hat{y}^{tea} - f(\hat{y}^{stu})\|_2^2$$

解码器侧蒸馏 $\mathcal{L}_{dec}$ 对齐双分支 latent $l_T, l_{res}$、去噪结果 $l_0$,以及 UNet 各 block 的内部特征 $h_n$

$$\mathcal{L}_{dec} = \|l_T^{tea} - f(l_T^{stu})\|_2^2 + \|l_{res}^{tea} - f(l_{res}^{stu})\|_2^2 + \|l_0^{tea} - f(l_0^{stu})\|_2^2 + \sum_n \|h_n^{tea} - f(h_n^{stu})\|_2^2$$

双面蒸馏将 AEIC-SE 与 AEIC-ME 的性能差距缩小到 LPIPS BD-rate 仅 +0.60%——几乎可以忽略 #Zhang et al., 2026

Part 4 · Training Pipeline
三阶段渐进训练:宽松码率 → 极端码率 → 高分辨率微调

AEIC 的训练采用两阶段隐式码率剪枝策略 #Zhang et al., 2025——先在宽松码率约束下让模型充分探索,再突然收紧到极端码率目标。这个策略是理解 AEIC 训练设计的关键。

两阶段隐式码率剪枝
图 4:AEIC-ME 的两阶段隐式码率剪枝。Stage 1 宽松码率(λ=1)下码率逐渐上升到 0.05 bpp,重建质量稳步提升;Stage 2 突然收紧(λ=16),码率骤降到目标范围。(来源:Zhang et al., 2026, Fig. 4)

教师(AEIC-ME)训练

Stage 1(300K 迭代):使用 512×512 patch,batch=8(实际每卡 batch=1 + 4 步梯度累积),学习率从 $1\times10^{-4}$ 在 280K 迭代后降到 $5\times10^{-5}$。码率约束 $\lambda_{S1}=1$,失真项包含重建损失、LPIPS 感知损失 #Zhang et al., 2018 和语义损失 #Lee et al., 2024,权重分别为 $\gamma_1=2, \gamma_2=1, \gamma_3=0.1$ #Zhang et al., 2026

Stage 2(30K 迭代):batch 增大到 32,码率约束 $\lambda_{S2} \in \{2, 4, 8, 16, 32\}$ 对应不同目标码率。关键变化:(1) 感知损失从 LPIPS 切换到 OC-EA-DISTS #Wu et al., 2025 #Li & Wang, 2024(overlap-chunked edge-aware DISTS),对超低码率下的纹理约束更有效;(2) 加入基于 DINOv3 #Simeoni et al., 2025 的 GAN 判别器损失,权重 $\alpha=0.1$ #Zhang et al., 2026

学生(AEIC-SE)蒸馏训练

Student Stage 1(200K 迭代):与教师 Stage 1 类似,但额外加入编码器蒸馏项 $\beta_1 \mathcal{L}_{enc}$$\beta_1=0.5$)。关键 trick:180K 迭代后 drop $\mathcal{L}_{enc}$ 并 reset $\{\lambda, \gamma_1\} = \{1.1, 0.5\}$ 以加速收敛 #Zhang et al., 2026

Student Stage 2(30K 迭代):加入 GAN 损失 + 解码器蒸馏 $\beta_2 \mathcal{L}_{dec}$$\beta_2=0.001$)。20K 迭代后 drop $\mathcal{L}_{dec}$ 以加速收敛 #Zhang et al., 2026

Stage 3 · 高分辨率微调(HRF)(5K 迭代):仅 AEIC-SE 需要。使用 1024×1024 patch,学习率 $2\times10^{-5}$ 阶梯衰减。浅编码器对高分辨率图像泛化能力较弱,这 5K 步微调可以显著提升 2K 分辨率下的性能,尤其是 DISTS 指标 #Zhang et al., 2026

训练配置披露

配置项状态
训练数据论文披露:DF2K + CLIC 2020 Pro + LSDIR 前 10K
硬件论文披露:2× RTX 3090 (24GB)
优化器论文披露:Adam, LoRA 蒸馏权重 $\{\beta_1,\beta_2\}=\{0.5, 0.001\}$
总训练时长论文披露:约 9 天
Checkpoint 选择未披露
Part 5 · Inference Pipeline
推理链路:从像素到重建的完整数据流

AEIC 的推理链路清晰地分为编码和解码两个阶段,体现了非对称设计的工程实用性。

编码端(边缘设备友好)

  1. 分析变换$y = g_a(x)$,StarNet 浅层卷积网络将输入图像映射到 latent 空间,空间下采样 32×
  2. 熵编码:hyperprior 模块估计高斯参数 $(\mu, \sigma)$,四叉树分区自回归上下文模型进行算术编码:$\hat{y} = \mathrm{quantize}[y - \mu] + \mu$

AEIC-SE 的编码复杂度极低:编码器仅 16.10M 参数(含熵模型),MACs 仅 46.02K/pixel,在 RTX 4090D 上编码 1080P 图像仅需 27.9ms(35.8 FPS),在 GTX 1080Ti 上也只需 110.4ms #Zhang et al., 2026

解码端(高性能设备)

  1. 算术解码:从 bitstream 恢复量化 latent $\hat{y}$
  2. 合成变换$l_T, l_{res} = \mathrm{split}[g_s(\hat{y})]$,产出纹理和结构残差两个分支
  3. 单步去噪$l_0 = \epsilon_{\mathrm{SD}}(l_T)$,无条件 UNet(LoRA rank=32)一步去噪
  4. 融合 + VAE 解码$\hat{x} = \mathcal{D}_{\mathrm{SD}}(l_0 + l_{res})$,lite VAE 解码器(12.4M 参数)产出最终重建

对于高分辨率图像,推理时使用 tiling 策略:AEIC-ME 的 UNet tile size=96(overlap=32),AEIC-SE 为 192(overlap=64),配合 16-bit color fix 消除拼接伪影 #Zhang et al., 2026。解码端整体参数量约 913M(主要来自 UNet),1080P 解码延迟约 836ms(RTX 4090D)#Zhang et al., 2026

非对称性的体现:编码端 27.9ms vs 解码端 836ms(RTX 4090D),相差约 30 倍。这在边缘→云端场景中完全合理:IoT 设备快速编码并传输极少量比特,云端服务器有充足算力做生成式解码。
Part 6 · 实验配置与验证
R-D-P 曲线、延迟对比与消融实验

实验配置

配置项详情
测试集CLIC 2020 Test (428张, 2K) + DIV2K Val (100张, 2K) + Kodak (24张, 768×512)
码率范围0.005–0.035 bpp
感知指标FID, KID, DISTS, LPIPS (AlexNet)
失真指标PSNR, MS-SSIM
传统基线H.266/VVC (VTM-23.13 intra)
失真基线ELIC #He et al., 2022, EVC-Small #Wang et al., 2023
感知基线MS-ILLM, GLC, PerCo #Careil et al., 2023, DiffEIC #Li et al., 2024, ResULIC, OSCAR, DLF #Xue et al., 2025, StableCodec #Zhang et al., 2025

Rate-Distortion-Performance 曲线

RDP 曲线对比
图 5:CLIC 2020 和 DIV2K 上的 Rate-Perception(红框)和 Rate-Distortion(蓝框)曲线。AEIC-ME 和 AEIC-SE 在所有感知指标上全面领先。(来源:Zhang et al., 2026, Fig. 6)

在 0.005–0.035 bpp 的完整超低码率范围内,AEIC-ME 在所有感知指标(FID、KID、DISTS、LPIPS)上一致优于 StableCodec、DLF 等最新方法。AEIC-SE 虽然在失真指标上略逊于 AEIC-ME,但在感知指标上持平甚至更好——这说明浅编码器并没有牺牲感知重建质量 #Zhang et al., 2026

计算复杂度对比

方法步骤编码参数编码 MACs/pixel编码延迟 (1080P, 4090D)
ELIC-33.38M346.03K300.5ms
EVC-Small-11.64M71.12K35.3ms
DLF-437.35M1915.35K508.1ms
StableCodec1102.23M2537.51K538.4ms
AEIC-ME155.91M204.26K58.7ms
AEIC-SE116.10M46.02K27.9ms (35.8 FPS)

AEIC-SE 的编码复杂度与 EVC-Small(一个面向正常码率的实时编码器)接近,远低于所有超低码率方法。更重要的是,AEIC-SE 在 GTX 1080Ti(11GB 显存)上支持完整 1080P 编解码,无需 tiling——这对于消费级 GPU 部署意义重大 #Zhang et al., 2026

消融实验

消融项关键发现
空间压缩比32× 最优:16× 过度优化失真(PSNR -5.53%),64× 丢失过多空间信息(PSNR +14.30%)
蒸馏无蒸馏 LPIPS +8.47%;仅 $\mathcal{L}_{enc}$ +3.92%;双面蒸馏 +0.60%(接近教师)
HRF对 768×512 patch 影响可忽略,但对 2K 全分辨率显著改善 DISTS
感知损失选择OC-EA-DISTS 比 LPIPS 在超低码率下更有效:LPIPS -5.19%, DISTS -20.35%
解码器裁剪Variant 1(无条件化)略优于 Base(PSNR -1.29%, LPIPS -0.23%);Variant 2(lite VAE)退化 <1%

用户研究

15 名用户、每人 24 组对比的偏好研究显示:AEIC-SE 相比 H.266/VVC 获得 96.2% 偏好,相比 DLF 获得 82.7%,相比 StableCodec 获得 72.1% #Zhang et al., 2026。这进一步证明在超低码率下,失真指标(PSNR/MS-SSIM)已经不能反映视觉质量——H.266/VVC 的 PSNR 最高,但用户几乎一边倒地偏好 AEIC 的生成式重建。

定性对比
图 6:Kodak 数据集上的定性对比(512×512 patches)。AEIC-SE 用最少的比特产出最逼真的重建,而 H.266/VVC 虽然 MS-SSIM 最高,但输出明显模糊且有块效应。(来源:Zhang et al., 2026, Suppl. Fig. 4)
Part 7 · 讨论与启发
在地图上的位置:非对称压缩的范式意义

竞品定位对比

维度StableCodecDLFPerCoAEIC-SE
编码端复杂度47.16M (多阶段)437.35M>1B0.94M
编码速度 (1080P)538ms508msOOM27.9ms
解码步骤1 步扩散直接20 步扩散1 步扩散
码率范围0.005–0.0350.005–0.035~0.010.005–0.035
边缘编码可行性不可行不可行

局限性

AEIC 的非对称设计解决了编码端的效率问题,但也留下了明确的局限:

  • 解码端仍然很重:约 913M 参数(主要来自 UNet),1080P 解码约 836ms(RTX 4090D)。实现真正的实时解码仍然困难
  • 失真指标劣势:在 PSNR/MS-SSIM 上不如 H.266/VVC 和 ELIC,这是生成式压缩的固有代价
  • 浅编码器泛化:AEIC-SE 对高分辨率图像泛化能力弱,需要额外的 HRF 阶段补救
  • 训练代码:GitHub 仓库的训练代码尚未完全开放

可操作启发

AEIC 对后续研究有几个直接的启发方向:

  1. 码率-复杂度关系的理论深化:论文的离散码本和连续高斯分析虽然简洁,但只给出了启发式论证。更严格的理论框架(如信息瓶颈理论)可能给出更强的设计指导
  2. 解码端的效率化:作者指出未来可以探索更紧凑的生成先验、硬件友好的解码器设计和新的解码器剪枝机制
  3. 蒸馏方法的泛化:双面特征蒸馏的思路——编码器侧对齐中间表征 + 解码器侧对齐生成特征——可能适用于其他需要轻量编码器的生成式任务
核心收获:超低码率压缩的信息瓶颈不在编码端。当码率足够低时,latent 空间的信息量天然受限,一个 0.94M 参数的浅编码器就足够了。这个洞察不仅适用于图像压缩,也适用于任何"编码端受限、解码端不受限"的非对称通信场景。

参考来源