轮廓视频压缩调研
我们在 《红外轮廓图像压缩系列(三):边缘与轮廓压缩》 中已经深入讨论了单帧轮廓图像的压缩:从 CCITT G4、JBIG 等经典二值编码,到链码、线段几何编码,再到面向机器的 SA-ICM 等学习式方案。然而,真实的红外观瞄、安防监控、自动驾驶等应用处理的都是视频流——轮廓不再是一张静态图,而是随时间演化的序列。
视频压缩的核心挑战是时域冗余的利用:相邻帧的轮廓高度相关,但目标运动、遮挡、形变使得简单帧间差分不够用。传统视频编码(H.264/H.265/VVC)用运动补偿预测来处理像素级的时域冗余,但轮廓图的稀疏性和拓扑变化给运动估计带来了额外困难。
轮廓在视频中的两种角色
调研发现,轮廓/边缘在视频压缩中扮演两种截然不同的角色:
角色 ①:传输信号本身 — 发送端只传轮廓(或轮廓+少量辅助信息),接收端用轮廓重建或直接用于下游任务。这是最极致的压缩:码率可以降到 0.001 bpp 以下。
角色 ②:辅助/条件信号 — 轮廓不单独传输,而是作为传统或学习式编码器的辅助输入,改进运动预测或条件生成。码率节省来自更高效的预测。
graph TB
subgraph "轮廓在视频压缩中的五种角色"
A[轮廓/边缘视频信号] --> B{角色类型}
B -->|传输信号本身| C1[经典二值形状编码
MPEG-4 / MC-TLCC / V-PCC]
B -->|传输信号本身| C2[学习式轮廓编码
SA-NeRV / MoRIC]
B -->|传输信号本身| C3[语义条件传输
DiSCo / MMSD / SketchVision]
B -->|辅助信号| D1[分割 mask 辅助帧间预测
Seg-VVC / SAIP]
B -->|辅助信号| D2[边缘作为生成条件
MISC / Edge-Denoising]
end
二值轮廓 vs 非二值轮廓
如我们之前讨论的,轮廓图是否二值取决于提取方法而非图像类型。在视频场景中,这个区分尤为重要:
| 类型 | 提取方法 | 视频中的典型应用 | 时域特性 |
|---|---|---|---|
| 二值轮廓 | Canny / SAM mask / Occupancy | MPEG-4 形状编码, V-PCC, SketchVision, Seg-VVC | 帧间轮廓可用链码运动补偿 |
| 非二值轮廓 | HED 概率图 / Sobel 梯度 / sketch 线描 | DiSCo sketch, SA-NeRV 边缘, MoRIC 链码残差 | 需要额外编码梯度/概率值 |
本文调研的论文池
| 论文 | 年份 | 路线 | 轮廓类型 | 角色 |
|---|---|---|---|---|
| MPEG-4 Shape #MPEG4-Shape | 2000s | 经典 | 二值 mask | 传输信号 |
| MC-TLCC #MC-TLCC-2002 | 2002 | 经典 | 二值轮廓 | 传输信号 |
| V-PCC Occupancy #Yang-V-PCC-2020 | 2020 | 经典 | 二值 occupancy | 传输信号 |
| CC-SMC / ECC #Yang-CCSMC-2024 #Yang-ECC-2026 | 2024/26 | 经典 | 语义边界 | 传输信号 |
| Seg-VVC #SegVVC-2024 | 2024 | 辅助 | 分割 mask | 辅助信号 |
| SA-NeRV #Shindo-SANeRV-2024 | 2024 | 学习式 | SAM 边缘 | 传输信号 |
| MoRIC #Li-MoRIC-2025 | 2025 | 学习式 | 自适应链码 | 传输信号 |
| DiSCo #Wang-DiSCo-2026 | 2026 | 语义 | sketch/pose | 条件信号 |
| MMSD #Assylbek-MMSD-2026 | 2026 | 语义 | edge map | 传输信号 |
| SketchVision #Wang-SketchVision-2026 | 2026 | 边缘-云 | 二值草图 | 传输信号 |
| MISC #Liu-MISC-2024 | 2024 | 语义 | CLIP map | 辅助信号 |
轮廓视频压缩的最早系统化尝试可以追溯到 1990 年代末的 MPEG-4 Part 2 标准 #MPEG4-Shape。与 MPEG-1/2 的矩形帧编码不同,MPEG-4 引入了基于对象的编码:视频被分解为若干 Video Object (VO),每个 VO 在每一帧形成一个 Video Object Plane (VOP),包含三类信息——纹理、运动和形状。
Binary Alpha Plane 与五种编码方法
VOP 的形状信息被表示为二值 alpha 平面 (Binary Alpha Plane, BAB):每个像素用 1 bit 标记——1 表示对象内,0 表示对象外。MPEG-4 标准化过程中评估了五种 BAB 编码方法:
Vertex-Based:用多边形逼近轮廓,迭代插入顶点控制最大误差。Intra 模式主观质量最优,无损 intra 编码效率比 CAE 低 7.8% 码率。
Baseline:将轮廓投影到基线(最长轴),编码 y 坐标偏移和转折点地址。Intra 模式主观质量最优,但 inter 效率不如 Vertex。
MMR (Modified Modified READ):来自传真 G3 标准的二维游程编码,直接编码二值位图。
CAE (Context-based Arithmetic Encoding):将形状视为 10 状态马尔可夫信源,用 10-pel 上下文模板 + 算术编码。这是 MPEG-4 最终采纳的核心方法——选择它的决定性因素是硬件实现:块基方法允许规则访问形状信息,片上解码无需随机访问外部内存。Inter 无损场景比 Vertex 低 20.5% 码率。
Chroma-Keying:蓝幕技术,形状隐含在色度纹理中。复杂度最低但拓扑不稳定,不支持无损。
CAE 的帧间模式还引入了运动补偿:对当前帧的 BAB 做块级运动估计,用参考帧的 BAB 预测当前帧,只对残差做 CAE 编码。这使得 MPEG-4 形状编码天然利用了时域冗余。
运动补偿链码:MC-TLCC (SPIE 2002)
Lu 与 Pearlman 在 2002 年提出了Motion-Compensated Two-Link Chain Coding (MC-TLCC) #MC-TLCC-2002,将链码编码从单帧扩展到视频序列。其核心思想是:相邻帧的对象轮廓高度相似,可以用帧间运动矢量估计轮廓位移,然后只对预测残差做链码编码。
"Two-Link" 指的是将链码符号按两两配对进行联合编码——每对符号描述一个拐角或直线段,利用符号间的统计依赖性进一步降低熵。
V-PCC Occupancy Map 链码 (VCIP 2020)
MPEG 的 Video-Based Point Cloud Compression (V-PCC) 标准将 3D 点云投影为 2D 视频帧进行编码。其中 occupancy map 是一张二值辅助图:每个像素标记该位置是否有对应的 3D 点 #Yang-V-PCC-2020。
Yang 等人发现,occupancy map 具有大片均匀区域 + 锐利边界的典型特征,非常适合链码编码。他们设计了四叉树分块 + 链码轮廓编码 + 自适应算术编码的方案,替代 HEVC 对 occupancy map 的编码。实验结果:链码 vs HEVC-SCM 平均节省 ~22% 码率(原始分辨率),下采样后可达 ~34%。且为无损压缩,不影响点云重建质量。
链码的语义图演进:CC-SMC → ECC
链码技术在语义图压缩中持续发展。Yang 等人 2024 年的 CC-SMC #Yang-CCSMC-2024 将四叉树分块与链码结合,用于语义分割图的无损压缩:均匀块直接编码标签,含边界的块用链码编码轮廓。2026 年的 ECC (Extended Chain Code) #Yang-ECC-2026 进一步扩展符号集,允许长距离轮廓跳转,并引入共享边界跳过机制,在语义图数据集上比 CC-SMC 再节省 ~18% 码率。ECC 还在 occupancy map 上做了扩展评估,确认链码路线在二值图压缩中具有持续生命力。
MPEG-4 形状编码为何未被广泛采用?主要原因有三:(1) 自动视频对象分割在当时极为困难;(2) 实际应用中 ROI (Region of Interest) 编码可以用更简单的方式近似;(3) H.264/AVC 放弃了对象编码路线,回归块级编码。但这并不意味着形状编码已死——它在 V-PCC、语义图压缩和当前轮廓视频压缩中持续以新形态复活。
如果说 Part 1 讨论的是"把轮廓当作传输内容",那么本节讨论的是"把轮廓当作编码器的辅助工具"。轮廓信息不直接传输给解码端,而是在编码端帮助做出更好的编码决策。
SAIP:分割辅助帧间预测 (arXiv 2403.11694)
Object Segmentation-Assisted Inter Prediction (SAIP) #SegVVC-2024 针对 VVC 标准提出了一种巧妙的思路:用分割 mask 指导运动补偿。传统块级运动补偿在对象边界处会产生"鬼影"——一个 CU 跨越两个不同运动对象时,整块用同一个运动矢量预测会导致边界模糊。
SAIP 的解决方案:在编解码端同步运行一个轻量分割网络,获得参考帧的分割 mask。关键设计是分割在参考帧而非当前帧上进行——参考帧已重建,两端都能获得。分割 mask 随参考帧存储在 buffer 中,用于后续帧的帧间预测。
分割管线采用两阶段策略以适配 GOP 结构:
- IIS 阶段:GOP 第一帧(关键帧)用 SCNet(Sample Consistency Network)做图像实例分割, AP 达 48.3/42.7(box/mask),比 Cascade Mask R-CNN 快 38%
- VOS 阶段:GOP 内其余帧用 STCN(Space-Time Correspondence Network)做视频目标分割,以第一帧的 IIS 结果为初始 label 进行时序传播
一个重要发现:IIS 的分割精度受 QP 影响(高质量参考帧分割更准),但 VOS 对画质退化不敏感——即使参考帧被量化压缩,时序传播仍能保持稳定的 mask 质量。这使得 SAIP 在整个 GOP 内都能获得可靠的分割信息。
分割 mask 定义为二值图:\(M_i(x,y) = 1\) 若像素 \((x,y)\) 属于前景实例集 \(\Phi_I\),否则为 0。mask 被翻译到当前编码块作为任意形状分区,将 CU 分为前景/背景两个运动不一致区域。
ORMC:重叠区域运动补偿
SAIP 的核心创新是 Overlapped Region-based Motion Compensation (ORMC)。直接将两个区域的预测拼接会产生严重边界伪影。ORMC 借鉴重叠块运动补偿 (OBMC) 的思想,在分割线两侧定义 2 像素宽的边缘区域,用距离自适应权重融合两个区域的预测。
具体实现:引入 Prewitt 算子对分割 mask 做边缘检测,将边缘区域像素分为三类:
- 类别 1:紧邻分割线(1 像素内),权重 \(w_0 = \frac{1}{2}, w_1 = \frac{1}{2}\)(均等融合)
- 类别 2:分割线旁 2 像素,权重 \(w_0 = \frac{3}{4}, w_1 = \frac{1}{4}\)(主区域占优)
- 类别 0:距分割线 >2 像素,权重 \(w_0 = 1, w_1 = 0\)(纯主区域预测)
最终预测为:\(P_{\text{final}} = w_0 \cdot P_{\text{primary}} + w_1 \cdot P_{\text{secondary}}\),其中权重由像素到分割线的距离决定。这种距离加权融合消除了区域级边界伪影,同时保留了对象边界处的运动不连续性。
在分数像素运动补偿阶段,ORMC 策略同样适用:先用 DCTIF(离散余弦变换插值滤波器)对每个子区域分别做分数像素插值,再用相同的距离加权策略融合两个子区域的分数像素预测。这保证了亚像素精度下边界区域的一致性。
双候选列表运动矢量编码
SAIP 将运动信息分为主运动 (primary)和辅运动 (secondary),对应两个 MV:
- 主候选列表(71 个候选):包含 VVC 标准 Merge + MMVD 候选,覆盖常规运动矢量预测
- 辅候选列表(7 个候选):由分割 mask 辅助构建,包含空间邻居中属于同一区域的 MV、pattern 匹配候选和零矢量
运动信息存储也做了适配:每个 \(4 \times 4\) 块根据 mask 值决定存储主运动还是辅运动信息,供后续 CU 的 MV 预测使用。
SA-RDO:联合分割与运动估计的率失真优化
传统 VVC 中,块级分区和运动估计是独立的两步。SAIP 的 SA-RDO 将二者联合:在两阶段搜索中,Stage 1 用 SATD 快速筛选主/辅候选组合,Stage 2 用完整 RD-cost 精确搜索最优分割模式和运动参数。这种联合优化避免了"先分区再估计运动"的次优解。
关键设计:由于分割网络在编解码端同步运行,mask 本身不需要传输——零码率开销。实验结果:LDP 配置下 BD-rate 平均 -0.82%(最大 -1.98%),且与 VVC 的 GEO(几何分割)模式互补。代价是编码时间增加 ~72%,解码时间增加 ~11%。
学习式图像/视频压缩(Learned Image/Video Compression, LIC/LVC)近年来取得了显著进展 #LearnedVCSurvey-2025。其中一个新兴方向是:能否只编码轮廓/边缘信息,而丢弃纹理细节?这对面向机器的视频编码 (Video Coding for Machines, VCM) 尤为重要——检测模型需要的是结构信息而非像素级保真。
SA-NeRV:用 SAM 边缘训练视频神经表示
Shindo 等人 2024 年提出的 SA-NeRV #Shindo-SANeRV-2024 是 SA-ICM(见《边缘与轮廓压缩》Part 5)的视频扩展:将边缘信息压缩从图像推广到视频。其核心思想是:用 Segment Anything (SAM) 生成边缘图,然后训练 NeRV (Neural Representations for Videos) 只编码这些边缘信息。
具体流程:(1) SAM 以置信度 \(\alpha\) 生成语义分割 mask → (2) Canny 边缘检测将 mask 转化为二值边缘图 \(\text{sam}_x(\alpha)\) → (3) 用边缘图训练 NeRV。损失函数为:
其中 \(\mathcal{L}_n\) 是原始 NeRV 损失,\(\beta\) 平衡 L1 与 SSIM,\(\alpha = 0.78\) 是 SAM 置信度阈值(控制边缘密度),\(T\) 是总帧数。SA-ICM 图像压缩部分使用 COCO-train (118,287 张) 训练,LIC-TCM 架构,\(N=5\) slices,\(\lambda=0.05\)。
SA-NeRV 实验在 SFU-HW-Objects-v1 数据集(8 个视频序列)上进行,下游任务为 YOLOv7 目标检测。SA-NeRV 在 7/8 序列上优于基线 NeRV,最高提升 BlowingBubbles 序列 +7.01 mAP;仅 RaceHorsesD 序列略降 0.14 mAP(可忽略)。
MoRIC:自适应链码 + 隐式神经表示 (NeurIPS 2025)
Li 等人的 MoRIC #Li-MoRIC-2025 是本文调研中最接近"轮廓视频压缩"概念的工作——它直接以轮廓链码作为编码核心,结合隐式神经表示 (INR) 做区域级图像压缩。
传统 INR codec(如 COIN、COOL-CHIC)用单个小型 MLP 对整幅图像 overfitting:输入坐标 \((x,y)\),输出 \((R,G,B)\)。但一幅图像包含差异极大的统计分布——平滑天空、高频纹理、锐利边缘——要求单一 MLP 同时高效拟合所有分布,要么增大网络(码率爆炸),要么牺牲质量。
MoRIC 的解决方案是区域级编码:将图像分割为任意形状区域,每个区域分配一个 Local Synthesis Network (LSN),所有区域共享一个 Global Modulation Network (GMN)。
C* Coding:自适应链码的革命
MoRIC 的核心创新之一是 C* coding——一种自适应步长的链码方法。与 Freeman 8-方向链码(固定 1 像素步长)不同,C* 允许步长 \(T\) 自适应调整:
- 长直边界:大步长,一个符号覆盖多个像素
- 弯曲边界:小步长,精确跟踪
- 支持角度匹配、全局重置、偏移适应和轮廓膨胀
C* 同时支持有损与无损轮廓压缩。
实验结果令人印象深刻:Kodak 数据集上 BD-rate vs VTM-19.1 (VVC 参考实现) 达到 -2.79%——这是首个 overfitted codec 在标准指标上超越 VVC。CLIC2020 上达到 -10.58%,DAVIS 单对象视频上达到 -16.31%。解码复杂度仅 < 800 MACs/pixel,远低于传统 autoencoder codec 的数十万~百万级。
轮廓码率占比分析(Figure 7)揭示了一个关键洞察:低码率时轮廓占总码率的 ~83%,高码率时降至 ~18-25%。这意味着在极低码率场景下,轮廓编码的效率直接决定了整体压缩性能。
当码率降到极低(< 0.01 bpp)时,传统编码器彻底失效——像素级保真已无意义。2024-2026 年涌现的语义视频压缩路线提供了一种范式转换:只传输语义描述(文字、分割图、边缘图),接收端用生成模型重建。轮廓/边缘在这里的角色从"传输内容"变成了条件信号——引导扩散模型生成与原始视频语义一致的重建。
DiSCo:语义条件扩散视频压缩 (CVPR 2026)
Wang 等人的 DiSCo #Wang-DiSCo-2026 是目前最完整的语义视频压缩框架。它将源视频分解为三种互补模态:
| 模态 | 功能 | 提取方式 | 编码方式 |
|---|---|---|---|
| 文字描述 | 全局语义(物体、场景、动作) | LLaVA 视觉-语言模型 | Zlib 无损压缩 |
| 退化视频 | 粗粒度外观与结构引导 | 联合时空下采样 | 预训练 DCVC-RT |
| Sketch(可选) | 运动与几何线索(物体轮廓) | InformativeDrawings | 微调 DCVC-RT |
| 2D 姿态(可选) | 以人为中心的运动线索 | DWPose | LZMA 无损 (16-bit) |
解码端将语义压缩建模为 video-to-video 转换:以预训练的 LTX-Video (13B 参数) 为基座,采用 In-Context LoRA(rank 256,新增 ~625M 参数)适配多模态条件输入。一个关键设计是 Token Interleaving——将不同模态的 token 交错排列为统一序列,让扩散模型在一个注意力窗口内同时看到文字、退化帧和 sketch。
时域一致性通过 Forward Filling 保证:对缺失帧用前向帧的信息填充条件序列,比零值填充提升 17.52% BD-rate(零值填充则退化 60.56%)。
实验在 HEVC-B、MCL-JCV、UVG 三个基准上测试。码率范围 0.0002 ~ 0.0196 BPP,在感知指标(FID、LPIPS、FVD)上 vs H.266 提升 5-10×,BD-rate 达 -83% ~ -91%。但像素保真度指标(PSNR/SSIM)显著低于传统编码器——这是语义压缩的固有代价。
局限:推理延迟 390ms/帧(LTX-Video 13B),极低码率下存在语义偏差(生成的物体细节可能与原始不符)。
MMSD:交通监控语义通信 (arXiv 2604.12622)
Assylbek 等人的 MMSD #Assylbek-MMSD-2026 面向交通监控场景,将图像替换为三种紧凑语义表示传输:
- 分割图:3.96 KB,约束物体的空间布局
- Edge map:18.41 KB,Canny 提取,提供物体边界结构引导
- 文字描述:57-260 B,描述场景内容
总载荷仅 22.42 KB,vs 原图 2.28 MB → 码率节省 ~99%(压缩比 111×)。接收端用扩散模型从语义表示重建场景。一个令人印象深刻的发现:edge map 仅占总载荷的 ~82%,但去掉 edge map 后 VLM 联合任务成功率从 86.9% 暴跌至 24.2%——edge map 虽然体积小,却是扩散模型重建物体边界的关键条件。
MISC:LMM 驱动超低码率压缩 (IEEE TIP 2024)
Liu 等人的 MISC #Liu-MISC-2024 是首个在编解码两端均集成大语言多模态模型 (GPT-4 Vision) 的压缩框架。编码端用 LMM 提取:整体语义描述(~50 词)+ 最多 3 组 Neural Descriptive Maps(物体名 + 细节描述 + 空间定位 map)。
与 DiSCo 和 MMSD 不同,MISC 不传 edge map,改用 CLIP Surgery 生成的 8×8 ~ 16×16 二值语义定位 map(< 0.001 bpp)替代。MISC-3 在 0.047 bpp 下综合评分 3.90,大幅超越 HiFiC (2.51) 和 PICS (0.97)。这暗示:在极低码率下,语义级空间定位可能比像素级边缘图更高效。
在边缘计算视频分析场景中,一个根本性的问题是:从摄像头到云端,真的需要传 RGB 视频吗?如果云端只需要做目标检测,那么二值草图可能就够了。
SketchVision (IEEE TBC 2026)
Wang 等人的 SketchVision #Wang-SketchVision-2026 提出了一个极简方案:边缘端从 RGB 帧中提取二值语义线段图 (binary sketch),压缩后传输到云端,云端用上下文感知模型做目标检测。
系统架构包含四个核心模块:
- Sketch Extractor:从 RGB 图像中提取语义关键线段,生成 0/1 二值图。与传统边缘检测器(Canny/Sobel)不同,Sketch Extractor 学习的是对检测任务有贡献的线段,而非通用边缘——它会抑制背景纹理边缘,保留物体轮廓和关键结构线
- Detail Patcher:含 Object Logger 和 Presence Detector 两个子模块。Object Logger 跨帧维护已检测物体的位置日志;Presence Detector 检查当前草图是否丢失了日志中记录的物体——如果某个物体在草图中消失(可能被 Sketch Extractor 遗漏),Detail Patcher 会在该区域补充更精细的线段细节
- Sketch Codec:专为二值草图设计的专用编解码器。由于草图是 0/1 二值图且前景稀疏,天然具有高可压缩性。论文为草图和锚帧分别设计了独立的编码路径——草图帧使用专用二值编码器,锚帧使用传统视频编码
- 锚帧机制:定期传输完整 RGB 帧(锚帧)辅助检测校准,防止草图检测器在长时间运行后产生累积偏差
带宽与性能分析
实验结果:在 COCO 数据集上,草图目标检测准确率 82% vs JPG 传输 68%(640×360 分辨率)。这一反直觉的结果——二值图比全彩 JPG 检测率更高——的核心原因是:二值草图消除了纹理干扰,迫使检测模型聚焦于结构特征。RGB 图像中的颜色、纹理和光照变化可能误导检测器,而草图只保留了几何轮廓这一最判别性的信息。
| 传输模式 | 原始数据量/帧 | 检测准确率 | 语义信息保留 |
|---|---|---|---|
| RGB 原始 | 675 KB (640×360×3, 8-bit) | ~85%(上限) | 完整(纹理+结构+颜色) |
| JPEG 压缩 | 显著压缩 | 68% | 有损(纹理伪影干扰检测) |
| 二值草图 | 28 KB (640×360×1 bit) | 82% | 结构完整,丢弃纹理 |
| 锚帧(定期) | 等同 RGB 原始 | 校准用 | 完整 |
带宽节省显著:二值草图的原始数据量仅为 RGB 的 1/24(1 bit/pixel vs 24 bit/pixel),经专用编码后进一步压缩。由于大多数帧仅传输草图、锚帧仅偶尔发送,整体带宽消耗大幅降低。这种“只传轮廓不传像素”的思路,与 Part 4 的 DiSCo、MMSD 在哲学上一脉相承:当任务不需要像素保真时,结构信息是最高效的传输载体。
SketchVision 与 DiSCo 的关键区别在于:DiSCo 在云端用扩散模型从语义信号重建视频,而 SketchVision 直接在草图中做检测——不需要重建,也不需要生成模型。这使得 SketchVision 的云端计算开销远低于 DiSCo,更适合实时边缘-云协同场景。代价是草图不携带颜色/纹理信息,无法服务需要外观特征的任务(如细粒度分类、语义分割)。
跨方法对比总表
| 方法 | 年份 | 任务 | 轮廓类型 | 轮廓角色 | 码率 | 核心指标 |
|---|---|---|---|---|---|---|
| MPEG-4 CAE | 1997 | 视频编码 | 二值 BAB | 传输信号 | Inter 无损比 Vertex 低 20.5% | 形状保真度 |
| MC-TLCC | 2002 | 视频编码 | 二值链码 | 传输信号 | 比 CAE 低 ~30% | 形状 PSNR |
| V-PCC 链码 | 2020 | 点云编码 | 二值 occupancy | 传输信号 | 比 HEVC 省 ~22% | 点云 D1 PSNR |
| CC-SMC → ECC | 2024/26 | 语义图压缩 | 语义边界 | 传输信号 | 比 CC-SMC 再省 ~18% | 无损 |
| Seg-VVC (SAIP) | 2024 | 视频编码 | 分割 mask | 辅助信号 | 零额外开销 | BD-rate -0.82% |
| SA-NeRV | 2024 | VCM 视频 | SAM 边缘(二值) | 传输信号 | 与 NeRV 相当 | mAP +7.01 |
| MoRIC | 2025 | 图像压缩 | C* 链码 | 传输信号 | 可变 bpp | BD-rate -2.79% vs VTM |
| DiSCo | 2026 | 语义视频 | sketch(非二值) | 条件信号 | 0.0002-0.0196 | FID -83% vs H.266 |
| MMSD | 2026 | 语义通信 | edge map(二值) | 传输信号 | 22.42 KB/帧 | VLM 成功率 86.9% |
| SketchVision | 2026 | 边缘-云 OD | 二值草图 | 传输信号 | 远低于 RGB | mAP 82% vs 68% |
| MISC | 2024 | 语义图像 | CLIP map(二值) | 辅助信号 | ~0.047 bpp | 综合评分 3.90 |
五大开放问题
1. 红外/热成像视频轮廓压缩:我们已有的 FPGA 轮廓提取(精读九)只处理单帧,CV 前沿方法借鉴(系列四)也主要聚焦静态场景。红外视频流的轮廓具有独特的时域特性——热目标的运动比可见光目标更"粘连"(热扩散),帧间轮廓的连续性更强但边缘更模糊。目前没有专门针对红外视频轮廓的压缩工作。
2. 端到端学习式轮廓视频 Codec:MoRIC 只做图像,SA-NeRV 是 NeRV 而非传统 codec。能否设计一个端到端的学习式编码器,以轮廓序列为输入,利用时域冗余做运动补偿式编码?
3. 时域一致性保证:DiSCo 用 Forward Filling + Token Interleaving 维持视频时域一致性,但推理延迟 390ms/帧。如何在保持低延迟的同时确保轮廓帧间连续?
4. 二值 vs 非二值的选择策略:何时应该硬二值化(节省码率但丢梯度信息)?何时保留连续值(MoRIC 的 C* 链码可以有损压缩轮廓)?目前缺乏系统性的率-失真-任务分析框架。
5. 面向机器 vs 面向人类的统一框架:SketchVision 和 SA-NeRV 面向机器(mAP),DiSCo 和 MMSD 面向人类感知(FID/LPIPS),Seg-VVC 面向传统编码效率(BD-rate)。能否设计一个自适应框架,根据下游任务动态选择轮廓编码策略? #HumanMachine-Survey-2024
参考来源
- Ostermann J. Coding of Binary Shape in MPEG-4. PCS 1997. AT&T Labs - Research. PDF
- Lu Z, Pearlman WA. Motion-compensated two-link chain coding for binary shape sequence. SPIE 2002, 4671: 356(期刊版见 IEEE TCSVT 2002, 12(9):747-757). ADS
- Yang R, et al. Chain Code-Based Occupancy Map Coding for Video-Based Point Cloud Compression. IEEE VCIP 2020. ADS
- Yang R, et al. Chain coding-based segmentation map lossless compression. JVCIR 2024. ScienceDirect
- Yang R, et al. Context Adaptive Extended Chain Coding for Semantic Map Compression. arXiv:2603.03073. arXiv
- Object Segmentation-Assisted Inter Prediction for Versatile Video Coding. arXiv:2403.11694. arXiv
- Shindo T, et al. Image Coding for Machines with Edge Information Learning Using Segment Anything(SA-ICM 的视频扩展部分,使用 NeRV). ICIP 2024. arXiv:2403.04173. arXiv · 图像精读 →
- Li G, Wu H, Gündüz D. MoRIC: A Modular Region-based Implicit Codec for Image Compression. NeurIPS 2025. Project · PDF · 精读 →
- Wang L, et al. Low-Bitrate Video Compression through Semantic-Conditioned Diffusion. CVPR 2026. arXiv:2512.00408. arXiv
- Assylbek D, et al. Efficient Semantic Image Communication for Traffic Monitoring at the Edge. arXiv:2604.12622. arXiv
- Liu X, et al. MISC: Ultra-low Bitrate Image Semantic Compression Driven by Large Multimodal Model. IEEE TIP 2024. arXiv:2402.16749. arXiv
- Wang H, et al. SketchVision: Bandwidth-Efficient Edge-Cloud Video Object Detection via Compressed Sketches. IEEE TBC 2026, 72(2). IEEE
- Emerging Advances in Learned Video Compression. IJCAI 2025. arXiv:2504.21445. arXiv
- Human-Machine Collaborative Image and Video Compression. ATSIP 2024, 13(6). Emerald