AEIC 深度解读
当码率降到 0.05 bpp 以下——一张 1080P 图像只能传输不到 50 KB 的数据——传统压缩算法(H.266/VVC)的输出几乎无法辨认,而感知导向的生成式方法(PerCo #Careil et al., 2023、DiffEIC #Li et al., 2024、StableCodec #Zhang et al., 2025、DLF #Xue et al., 2025)能合成视觉上逼真的重建。然而这些方法有一个共同的代价:编码端极其昂贵。
以 StableCodec 为例,编码端需要串联 SD VAE 编码器 + ELIC 编码器 + 潜空间变换编码器,总参数量达到 47.16M,在 GTX 1080Ti 上编码一张 768×512 图像需要 328ms #Zhang et al., 2025。DLF 更慢,同样分辨率下需要 494ms #Xue et al., 2025。这意味着在 IoT 终端、无人机、卫星通信等编码端资源受限的场景中,这些方法根本不可部署。
AEIC(Asymmetric Extreme Image Compression)的核心洞察非常直接:超低码率意味着 latent 的信息量天然受限,因此不需要深层编码器#Zhang et al., 2026。基于这个洞察,作者用 StarNet 架构 #Ma et al., 2024 构建了两个轻量编码器——AEIC-ME(3.09M 参数)和 AEIC-SE(0.94M 参数),配合基于 SD-Turbo 的单步扩散解码器 #Sauer et al., 2024,在超低码率下实现了感知质量 SOTA,同时 AEIC-SE 在 1080P 分辨率下达到 35.8 FPS 实时编码,比 DLF 快 18.2 倍,比 StableCodec 快 19.3 倍 #Zhang et al., 2026。
AEIC 最反直觉的贡献在于:它证明了超低码率压缩不需要复杂的编码器。现有方法几乎全部遵循"先过一遍预训练生成模型编码器(如 SD VAE encoder),再用一个额外的潜空间变换编码器做压缩"的两阶段范式 #Zhang et al., 2025 #Xue et al., 2025 #Li et al., 2024。编码端堆叠了大量参数,仅仅是为了产出一个极低维度的 latent。
离散码本分析
作者从离散和连续两个角度给出了理论论证。对于离散码本 $C = \{c_1, c_2, \dots, c_M\}$,最大可表示码率为 $\log_2 M$。编码时如果采用穷举搜索,计算复杂度为 $\mathcal{O}(M) = \mathcal{O}(2^{\mathcal{R}})$。这意味着当码率 $\mathcal{R}$ 降低时,所需的搜索空间随码率指数级缩小——超低码率天然允许低复杂度的编码过程 #Zhang et al., 2026。
连续高斯分析
对于连续情况,高斯隐变量 $z \sim \mathcal{N}(\mu, \sigma^2)$ 的微分熵为:
码率(熵)完全由方差 $\sigma^2$ 决定。超低码率意味着 $\sigma^2$ 必须很小,即 latent 的取值范围非常窄。一个取值范围极窄的连续变量,不需要深层网络来表达——这就像只需要很少的离散码本元素一样 #Zhang et al., 2026。
Fig. 1 的实证数据完美印证了这个分析:当码率从正常范围降到超低范围(0.01–0.035 bpp)时,无论是 ELIC #He et al., 2022、StableCodec 还是 DLF,latent 方差都急剧缩小。AEIC 的浅编码器可以产出与复杂编码器相同方差范围的 latent,说明超低码率下编码器的表达力根本不是瓶颈 #Zhang et al., 2026。
核心 Insight
超低码率压缩的信息瓶颈在解码端——如何从极少的比特中重建视觉上可信的图像——而不在编码端。编码器只需要把输入映射到一个方差很小的 latent 空间,这是一个"简单"的任务。
AEIC 的整体架构遵循非对称设计哲学:编码端尽量轻量(适合边缘设备),解码端承担重建的复杂性(可以在云端或高性能设备上运行)。这与传统压缩中"编码慢、解码快"的范式恰好相反,但在超低码率的 IoT/边缘场景中更为合理 #Zhang et al., 2026。
3.1 浅层分析变换编码器
给定输入图像 $x$,编码器直接应用浅层变换 $g_a$(基于 StarNet #Ma et al., 2024 的高效卷积网络)将其压缩为紧凑的 latent $y$,空间压缩比为 32×。量化后得到 $\hat{y}$,通过 hyperprior + 四叉树分区自回归上下文模型 #Minnen et al., 2018 #Li et al., 2023 估计高斯参数 $(\mu, \sigma)$ 进行算术编码。两个变体的配置如下:
| 模型 | $g_a$ 每层深度 | $g_a$ 维度 | 熵模型深度 | 熵模型维度 | 编码器参数 |
|---|---|---|---|---|---|
| AEIC-ME | 2 | (64, 128, 192, 256, 320) | 4 | 960 | 3.09M |
| AEIC-SE | 1 | (32, 64, 128, 192, 256) | 3 | 512 | 0.94M |
AEIC-ME 和 AEIC-SE 仅在编码器 $g_a$ 和熵模型配置上不同,解码端完全相同。
3.2 单步扩散解码器
解码端的核心创新是将 SD-Turbo #Sauer et al., 2024 裁剪为无条件单步去噪器。标准 SD-Turbo 的条件去噪过程为:
其中 $c$ 是文本条件,$T$ 是时间步。但在图像压缩场景中,传输文本提示会增加额外码率开销,而已有研究 #Vonderfecht et al., 2025 表明文本提示对压缩重建质量的贡献微乎其微。因此 AEIC 直接移除文本编码器、时间步嵌入和所有交叉注意力层,将去噪器简化为无条件格式 #Chen et al., 2025:
这一裁剪移除了超过 75M 参数,同时略微提升了性能(BD-rate -1.29% PSNR, -0.23% LPIPS)#Zhang et al., 2026。
解码器还采用了双分支结构 #Zhang et al., 2025:合成变换 $g_s$ 的输出被拆分为纹理分支 $l_T$ 和结构残差分支 $l_{res}$,纹理经单步去噪后与残差相加,再送入 VAE 解码器:
与 StableCodec 使用独立的辅助解码器不同,AEIC 将两个分支直接集成在 $g_s$ 中,增强了跨分支交互效率。此外,原始 SD-Turbo 的 VAE 解码器被替换为 50% 通道裁剪的轻量版本(49.5M → 12.4M 参数),性能退化不到 1% #Zhang et al., 2026。
3.3 双面特征蒸馏
浅编码器 AEIC-SE 从头训练会导致严重性能下降(LPIPS BD-rate +8.47%)。作者提出双面特征蒸馏策略,将 AEIC-ME(教师)的知识迁移到 AEIC-SE(学生)。
编码器侧蒸馏 $\mathcal{L}_{enc}$ 对齐四个中间表征——$g_a$ 的输出 $y$、hyperprior 分析 $z$、hyperprior 合成 $\phi$、量化后 $\hat{y}$。由于师生维度不匹配,引入可学习投影 $f(\cdot)$(单层卷积):
解码器侧蒸馏 $\mathcal{L}_{dec}$ 对齐双分支 latent $l_T, l_{res}$、去噪结果 $l_0$,以及 UNet 各 block 的内部特征 $h_n$:
双面蒸馏将 AEIC-SE 与 AEIC-ME 的性能差距缩小到 LPIPS BD-rate 仅 +0.60%——几乎可以忽略 #Zhang et al., 2026。
AEIC 的训练采用两阶段隐式码率剪枝策略 #Zhang et al., 2025——先在宽松码率约束下让模型充分探索,再突然收紧到极端码率目标。这个策略是理解 AEIC 训练设计的关键。
教师(AEIC-ME)训练
Stage 1(300K 迭代):使用 512×512 patch,batch=8(实际每卡 batch=1 + 4 步梯度累积),学习率从 $1\times10^{-4}$ 在 280K 迭代后降到 $5\times10^{-5}$。码率约束 $\lambda_{S1}=1$,失真项包含重建损失、LPIPS 感知损失 #Zhang et al., 2018 和语义损失 #Lee et al., 2024,权重分别为 $\gamma_1=2, \gamma_2=1, \gamma_3=0.1$ #Zhang et al., 2026。
Stage 2(30K 迭代):batch 增大到 32,码率约束 $\lambda_{S2} \in \{2, 4, 8, 16, 32\}$ 对应不同目标码率。关键变化:(1) 感知损失从 LPIPS 切换到 OC-EA-DISTS #Wu et al., 2025 #Li & Wang, 2024(overlap-chunked edge-aware DISTS),对超低码率下的纹理约束更有效;(2) 加入基于 DINOv3 #Simeoni et al., 2025 的 GAN 判别器损失,权重 $\alpha=0.1$ #Zhang et al., 2026。
学生(AEIC-SE)蒸馏训练
Student Stage 1(200K 迭代):与教师 Stage 1 类似,但额外加入编码器蒸馏项 $\beta_1 \mathcal{L}_{enc}$($\beta_1=0.5$)。关键 trick:180K 迭代后 drop $\mathcal{L}_{enc}$ 并 reset $\{\lambda, \gamma_1\} = \{1.1, 0.5\}$ 以加速收敛 #Zhang et al., 2026。
Student Stage 2(30K 迭代):加入 GAN 损失 + 解码器蒸馏 $\beta_2 \mathcal{L}_{dec}$($\beta_2=0.001$)。20K 迭代后 drop $\mathcal{L}_{dec}$ 以加速收敛 #Zhang et al., 2026。
Stage 3 · 高分辨率微调(HRF)(5K 迭代):仅 AEIC-SE 需要。使用 1024×1024 patch,学习率 $2\times10^{-5}$ 阶梯衰减。浅编码器对高分辨率图像泛化能力较弱,这 5K 步微调可以显著提升 2K 分辨率下的性能,尤其是 DISTS 指标 #Zhang et al., 2026。
训练配置披露
| 配置项 | 状态 |
|---|---|
| 训练数据 | 论文披露:DF2K + CLIC 2020 Pro + LSDIR 前 10K |
| 硬件 | 论文披露:2× RTX 3090 (24GB) |
| 优化器 | 论文披露:Adam, LoRA 蒸馏权重 $\{\beta_1,\beta_2\}=\{0.5, 0.001\}$ |
| 总训练时长 | 论文披露:约 9 天 |
| Checkpoint 选择 | 未披露 |
AEIC 的推理链路清晰地分为编码和解码两个阶段,体现了非对称设计的工程实用性。
编码端(边缘设备友好)
- 分析变换:$y = g_a(x)$,StarNet 浅层卷积网络将输入图像映射到 latent 空间,空间下采样 32×
- 熵编码:hyperprior 模块估计高斯参数 $(\mu, \sigma)$,四叉树分区自回归上下文模型进行算术编码:$\hat{y} = \mathrm{quantize}[y - \mu] + \mu$
AEIC-SE 的编码复杂度极低:编码器仅 16.10M 参数(含熵模型),MACs 仅 46.02K/pixel,在 RTX 4090D 上编码 1080P 图像仅需 27.9ms(35.8 FPS),在 GTX 1080Ti 上也只需 110.4ms #Zhang et al., 2026。
解码端(高性能设备)
- 算术解码:从 bitstream 恢复量化 latent $\hat{y}$
- 合成变换:$l_T, l_{res} = \mathrm{split}[g_s(\hat{y})]$,产出纹理和结构残差两个分支
- 单步去噪:$l_0 = \epsilon_{\mathrm{SD}}(l_T)$,无条件 UNet(LoRA rank=32)一步去噪
- 融合 + VAE 解码:$\hat{x} = \mathcal{D}_{\mathrm{SD}}(l_0 + l_{res})$,lite VAE 解码器(12.4M 参数)产出最终重建
对于高分辨率图像,推理时使用 tiling 策略:AEIC-ME 的 UNet tile size=96(overlap=32),AEIC-SE 为 192(overlap=64),配合 16-bit color fix 消除拼接伪影 #Zhang et al., 2026。解码端整体参数量约 913M(主要来自 UNet),1080P 解码延迟约 836ms(RTX 4090D)#Zhang et al., 2026。
实验配置
| 配置项 | 详情 |
|---|---|
| 测试集 | CLIC 2020 Test (428张, 2K) + DIV2K Val (100张, 2K) + Kodak (24张, 768×512) |
| 码率范围 | 0.005–0.035 bpp |
| 感知指标 | FID, KID, DISTS, LPIPS (AlexNet) |
| 失真指标 | PSNR, MS-SSIM |
| 传统基线 | H.266/VVC (VTM-23.13 intra) |
| 失真基线 | ELIC #He et al., 2022, EVC-Small #Wang et al., 2023 |
| 感知基线 | MS-ILLM, GLC, PerCo #Careil et al., 2023, DiffEIC #Li et al., 2024, ResULIC, OSCAR, DLF #Xue et al., 2025, StableCodec #Zhang et al., 2025 |
Rate-Distortion-Performance 曲线
在 0.005–0.035 bpp 的完整超低码率范围内,AEIC-ME 在所有感知指标(FID、KID、DISTS、LPIPS)上一致优于 StableCodec、DLF 等最新方法。AEIC-SE 虽然在失真指标上略逊于 AEIC-ME,但在感知指标上持平甚至更好——这说明浅编码器并没有牺牲感知重建质量 #Zhang et al., 2026。
计算复杂度对比
| 方法 | 步骤 | 编码参数 | 编码 MACs/pixel | 编码延迟 (1080P, 4090D) |
|---|---|---|---|---|
| ELIC | - | 33.38M | 346.03K | 300.5ms |
| EVC-Small | - | 11.64M | 71.12K | 35.3ms |
| DLF | - | 437.35M | 1915.35K | 508.1ms |
| StableCodec | 1 | 102.23M | 2537.51K | 538.4ms |
| AEIC-ME | 1 | 55.91M | 204.26K | 58.7ms |
| AEIC-SE | 1 | 16.10M | 46.02K | 27.9ms (35.8 FPS) |
AEIC-SE 的编码复杂度与 EVC-Small(一个面向正常码率的实时编码器)接近,远低于所有超低码率方法。更重要的是,AEIC-SE 在 GTX 1080Ti(11GB 显存)上支持完整 1080P 编解码,无需 tiling——这对于消费级 GPU 部署意义重大 #Zhang et al., 2026。
消融实验
| 消融项 | 关键发现 |
|---|---|
| 空间压缩比 | 32× 最优:16× 过度优化失真(PSNR -5.53%),64× 丢失过多空间信息(PSNR +14.30%) |
| 蒸馏 | 无蒸馏 LPIPS +8.47%;仅 $\mathcal{L}_{enc}$ +3.92%;双面蒸馏 +0.60%(接近教师) |
| HRF | 对 768×512 patch 影响可忽略,但对 2K 全分辨率显著改善 DISTS |
| 感知损失选择 | OC-EA-DISTS 比 LPIPS 在超低码率下更有效:LPIPS -5.19%, DISTS -20.35% |
| 解码器裁剪 | Variant 1(无条件化)略优于 Base(PSNR -1.29%, LPIPS -0.23%);Variant 2(lite VAE)退化 <1% |
用户研究
15 名用户、每人 24 组对比的偏好研究显示:AEIC-SE 相比 H.266/VVC 获得 96.2% 偏好,相比 DLF 获得 82.7%,相比 StableCodec 获得 72.1% #Zhang et al., 2026。这进一步证明在超低码率下,失真指标(PSNR/MS-SSIM)已经不能反映视觉质量——H.266/VVC 的 PSNR 最高,但用户几乎一边倒地偏好 AEIC 的生成式重建。
竞品定位对比
| 维度 | StableCodec | DLF | PerCo | AEIC-SE |
|---|---|---|---|---|
| 编码端复杂度 | 47.16M (多阶段) | 437.35M | >1B | 0.94M |
| 编码速度 (1080P) | 538ms | 508ms | OOM | 27.9ms |
| 解码步骤 | 1 步扩散 | 直接 | 20 步扩散 | 1 步扩散 |
| 码率范围 | 0.005–0.035 | 0.005–0.035 | ~0.01 | 0.005–0.035 |
| 边缘编码可行性 | 低 | 不可行 | 不可行 | 高 |
局限性
AEIC 的非对称设计解决了编码端的效率问题,但也留下了明确的局限:
- 解码端仍然很重:约 913M 参数(主要来自 UNet),1080P 解码约 836ms(RTX 4090D)。实现真正的实时解码仍然困难
- 失真指标劣势:在 PSNR/MS-SSIM 上不如 H.266/VVC 和 ELIC,这是生成式压缩的固有代价
- 浅编码器泛化:AEIC-SE 对高分辨率图像泛化能力弱,需要额外的 HRF 阶段补救
- 训练代码:GitHub 仓库的训练代码尚未完全开放
可操作启发
AEIC 对后续研究有几个直接的启发方向:
- 码率-复杂度关系的理论深化:论文的离散码本和连续高斯分析虽然简洁,但只给出了启发式论证。更严格的理论框架(如信息瓶颈理论)可能给出更强的设计指导
- 解码端的效率化:作者指出未来可以探索更紧凑的生成先验、硬件友好的解码器设计和新的解码器剪枝机制
- 蒸馏方法的泛化:双面特征蒸馏的思路——编码器侧对齐中间表征 + 解码器侧对齐生成特征——可能适用于其他需要轻量编码器的生成式任务
参考来源
- Zhang et al., 2026 — Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder (AEIC), CVPR 2026
- Zhang et al., 2025 — StableCodec: Taming Diffusion Models for Ultra-Low Bitrate Image Compression, ICCV 2025
- Xue et al., 2025 — DLF: Dual-Branch Latent Fusion for Ultra-Low Bitrate Image Compression, ICCV 2025
- Careil et al., 2023 — Towards Image Compression with Perfect Realism at Ultra-Low Bitrates (PerCo), ICLR 2024
- Li et al., 2024 — DiffEIC: Diffusion-based Extreme Image Compression
- Ma et al., 2024 — Rewrite the Stars (StarNet), CVPR 2024
- Sauer et al., 2024 — Adversarial Diffusion Distillation (SD-Turbo), ECCV 2024
- He et al., 2022 — ELIC: Efficient Learned Image Compression with Uneven Grouping, CVPR 2022
- Minnen et al., 2018 — Joint Autoregressive and Hierarchical Priors for Learned Image Compression, NeurIPS 2018
- Wang et al., 2023 — EVC: Real-time Neural Image Compression, ICLR 2023
- Chen et al., 2025 — AdcSR: Adversarial Compressed Super-Resolution
- Li et al., 2023 — Neural Image Compression with Quadtree Partition, CVPR 2023
- Vonderfecht et al., 2025 — Lossy Image Compression with Text-Conditioned Diffusion
- Wu et al., 2025 — OC-EA-DISTS for Perceptual Image Quality
- Li & Wang, 2024 — Unleashing the Potential of DISTS for Perceptual Compression
- Simeoni et al., 2025 — DINOv3
- Lee et al., 2024 — Neural Semantic Loss
- Zhang et al., 2018 — The Unreasonable Effectiveness of Deep Features as a Perceptual Metric (LPIPS)
- Blau & Michaeli, 2019 — Rethinking Lossy Compression: The Rate-Distortion-Perception Tradeoff, ICML 2019