ESC
输入关键词搜索文章
目录

轮廓视频压缩调研

MPEG-4 形状编码 · 链码 · INR · 语义扩散
本文范围:本文是 红外轮廓图像压缩系列的一部分,聚焦视频/时序中的轮廓压缩——即轮廓随时间演化时的运动补偿、帧间预测和语义条件生成等问题。静态单帧轮廓/边缘图像的编码(CCITT G4、JBIG、链码、线段编码、结构保持、Coding for Machines)在 《红外轮廓图像压缩系列(三):边缘与轮廓压缩》 中系统讨论。本文调研 11 篇论文,覆盖轮廓/边缘在视频压缩中的五种角色:二值形状传输信号(MPEG-4/V-PCC)、分割 mask 辅助帧间预测(Seg-VVC)、学习式轮廓编码(MoRIC/SA-NeRV)、语义条件信号(DiSCo/MMSD)和二值草图传输(SketchVision)。
Part 0 · 引言与问题定义
从图像压缩到视频压缩:轮廓的时域维度

我们在 《红外轮廓图像压缩系列(三):边缘与轮廓压缩》 中已经深入讨论了单帧轮廓图像的压缩:从 CCITT G4、JBIG 等经典二值编码,到链码、线段几何编码,再到面向机器的 SA-ICM 等学习式方案。然而,真实的红外观瞄、安防监控、自动驾驶等应用处理的都是视频流——轮廓不再是一张静态图,而是随时间演化的序列。

视频压缩的核心挑战是时域冗余的利用:相邻帧的轮廓高度相关,但目标运动、遮挡、形变使得简单帧间差分不够用。传统视频编码(H.264/H.265/VVC)用运动补偿预测来处理像素级的时域冗余,但轮廓图的稀疏性和拓扑变化给运动估计带来了额外困难。

轮廓在视频中的两种角色

调研发现,轮廓/边缘在视频压缩中扮演两种截然不同的角色:

角色 ①:传输信号本身 — 发送端只传轮廓(或轮廓+少量辅助信息),接收端用轮廓重建或直接用于下游任务。这是最极致的压缩:码率可以降到 0.001 bpp 以下。

角色 ②:辅助/条件信号 — 轮廓不单独传输,而是作为传统或学习式编码器的辅助输入,改进运动预测或条件生成。码率节省来自更高效的预测。

graph TB
  subgraph "轮廓在视频压缩中的五种角色"
      A[轮廓/边缘视频信号] --> B{角色类型}
      B -->|传输信号本身| C1[经典二值形状编码
MPEG-4 / MC-TLCC / V-PCC] B -->|传输信号本身| C2[学习式轮廓编码
SA-NeRV / MoRIC] B -->|传输信号本身| C3[语义条件传输
DiSCo / MMSD / SketchVision] B -->|辅助信号| D1[分割 mask 辅助帧间预测
Seg-VVC / SAIP] B -->|辅助信号| D2[边缘作为生成条件
MISC / Edge-Denoising] end

二值轮廓 vs 非二值轮廓

如我们之前讨论的,轮廓图是否二值取决于提取方法而非图像类型。在视频场景中,这个区分尤为重要:

类型提取方法视频中的典型应用时域特性
二值轮廓Canny / SAM mask / OccupancyMPEG-4 形状编码, V-PCC, SketchVision, Seg-VVC帧间轮廓可用链码运动补偿
非二值轮廓HED 概率图 / Sobel 梯度 / sketch 线描DiSCo sketch, SA-NeRV 边缘, MoRIC 链码残差需要额外编码梯度/概率值

本文调研的论文池

论文年份路线轮廓类型角色
MPEG-4 Shape #MPEG4-Shape2000s经典二值 mask传输信号
MC-TLCC #MC-TLCC-20022002经典二值轮廓传输信号
V-PCC Occupancy #Yang-V-PCC-20202020经典二值 occupancy传输信号
CC-SMC / ECC #Yang-CCSMC-2024 #Yang-ECC-20262024/26经典语义边界传输信号
Seg-VVC #SegVVC-20242024辅助分割 mask辅助信号
SA-NeRV #Shindo-SANeRV-20242024学习式SAM 边缘传输信号
MoRIC #Li-MoRIC-20252025学习式自适应链码传输信号
DiSCo #Wang-DiSCo-20262026语义sketch/pose条件信号
MMSD #Assylbek-MMSD-20262026语义edge map传输信号
SketchVision #Wang-SketchVision-20262026边缘-云二值草图传输信号
MISC #Liu-MISC-20242024语义CLIP map辅助信号
Part 1 · 经典路线
二值形状编码:MPEG-4 的遗产与链码的复兴

轮廓视频压缩的最早系统化尝试可以追溯到 1990 年代末的 MPEG-4 Part 2 标准 #MPEG4-Shape。与 MPEG-1/2 的矩形帧编码不同,MPEG-4 引入了基于对象的编码:视频被分解为若干 Video Object (VO),每个 VO 在每一帧形成一个 Video Object Plane (VOP),包含三类信息——纹理、运动和形状

Binary Alpha Plane 与五种编码方法

VOP 的形状信息被表示为二值 alpha 平面 (Binary Alpha Plane, BAB):每个像素用 1 bit 标记——1 表示对象内,0 表示对象外。MPEG-4 标准化过程中评估了五种 BAB 编码方法:

Vertex-Based:用多边形逼近轮廓,迭代插入顶点控制最大误差。Intra 模式主观质量最优,无损 intra 编码效率比 CAE 低 7.8% 码率。

Baseline:将轮廓投影到基线(最长轴),编码 y 坐标偏移和转折点地址。Intra 模式主观质量最优,但 inter 效率不如 Vertex。

MMR (Modified Modified READ):来自传真 G3 标准的二维游程编码,直接编码二值位图。

CAE (Context-based Arithmetic Encoding):将形状视为 10 状态马尔可夫信源,用 10-pel 上下文模板 + 算术编码。这是 MPEG-4 最终采纳的核心方法——选择它的决定性因素是硬件实现:块基方法允许规则访问形状信息,片上解码无需随机访问外部内存。Inter 无损场景比 Vertex 低 20.5% 码率。

Chroma-Keying:蓝幕技术,形状隐含在色度纹理中。复杂度最低但拓扑不稳定,不支持无损。

CAE 的帧间模式还引入了运动补偿:对当前帧的 BAB 做块级运动估计,用参考帧的 BAB 预测当前帧,只对残差做 CAE 编码。这使得 MPEG-4 形状编码天然利用了时域冗余。

运动补偿链码:MC-TLCC (SPIE 2002)

Lu 与 Pearlman 在 2002 年提出了Motion-Compensated Two-Link Chain Coding (MC-TLCC) #MC-TLCC-2002,将链码编码从单帧扩展到视频序列。其核心思想是:相邻帧的对象轮廓高度相似,可以用帧间运动矢量估计轮廓位移,然后只对预测残差做链码编码。

"Two-Link" 指的是将链码符号按两两配对进行联合编码——每对符号描述一个拐角或直线段,利用符号间的统计依赖性进一步降低熵。

V-PCC Occupancy Map 链码 (VCIP 2020)

MPEG 的 Video-Based Point Cloud Compression (V-PCC) 标准将 3D 点云投影为 2D 视频帧进行编码。其中 occupancy map 是一张二值辅助图:每个像素标记该位置是否有对应的 3D 点 #Yang-V-PCC-2020

Yang 等人发现,occupancy map 具有大片均匀区域 + 锐利边界的典型特征,非常适合链码编码。他们设计了四叉树分块 + 链码轮廓编码 + 自适应算术编码的方案,替代 HEVC 对 occupancy map 的编码。实验结果:链码 vs HEVC-SCM 平均节省 ~22% 码率(原始分辨率),下采样后可达 ~34%。且为无损压缩,不影响点云重建质量。

链码的语义图演进:CC-SMC → ECC

链码技术在语义图压缩中持续发展。Yang 等人 2024 年的 CC-SMC #Yang-CCSMC-2024 将四叉树分块与链码结合,用于语义分割图的无损压缩:均匀块直接编码标签,含边界的块用链码编码轮廓。2026 年的 ECC (Extended Chain Code) #Yang-ECC-2026 进一步扩展符号集,允许长距离轮廓跳转,并引入共享边界跳过机制,在语义图数据集上比 CC-SMC 再节省 ~18% 码率。ECC 还在 occupancy map 上做了扩展评估,确认链码路线在二值图压缩中具有持续生命力。

MPEG-4 形状编码为何未被广泛采用?主要原因有三:(1) 自动视频对象分割在当时极为困难;(2) 实际应用中 ROI (Region of Interest) 编码可以用更简单的方式近似;(3) H.264/AVC 放弃了对象编码路线,回归块级编码。但这并不意味着形状编码已死——它在 V-PCC、语义图压缩和当前轮廓视频压缩中持续以新形态复活。

Part 2 · 轮廓辅助传统编码
分割 Mask 如何改进 VVC 帧间预测

如果说 Part 1 讨论的是"把轮廓当作传输内容",那么本节讨论的是"把轮廓当作编码器的辅助工具"。轮廓信息不直接传输给解码端,而是在编码端帮助做出更好的编码决策。

SAIP:分割辅助帧间预测 (arXiv 2403.11694)

Object Segmentation-Assisted Inter Prediction (SAIP) #SegVVC-2024 针对 VVC 标准提出了一种巧妙的思路:用分割 mask 指导运动补偿。传统块级运动补偿在对象边界处会产生"鬼影"——一个 CU 跨越两个不同运动对象时,整块用同一个运动矢量预测会导致边界模糊。

SAIP 的解决方案:在编解码端同步运行一个轻量分割网络,获得参考帧的分割 mask。关键设计是分割在参考帧而非当前帧上进行——参考帧已重建,两端都能获得。分割 mask 随参考帧存储在 buffer 中,用于后续帧的帧间预测。

SAIP 整体框架
图 1: SAIP 整体框架。编解码端同步运行分割网络,分割 mask 无需传输,零码率开销。(来源:SAIP, arXiv:2403.11694, Fig.1)

分割管线采用两阶段策略以适配 GOP 结构:

  • IIS 阶段:GOP 第一帧(关键帧)用 SCNet(Sample Consistency Network)做图像实例分割, AP 达 48.3/42.7(box/mask),比 Cascade Mask R-CNN 快 38%
  • VOS 阶段:GOP 内其余帧用 STCN(Space-Time Correspondence Network)做视频目标分割,以第一帧的 IIS 结果为初始 label 进行时序传播

一个重要发现:IIS 的分割精度受 QP 影响(高质量参考帧分割更准),但 VOS 对画质退化不敏感——即使参考帧被量化压缩,时序传播仍能保持稳定的 mask 质量。这使得 SAIP 在整个 GOP 内都能获得可靠的分割信息。

分割 mask 定义为二值图:\(M_i(x,y) = 1\) 若像素 \((x,y)\) 属于前景实例集 \(\Phi_I\),否则为 0。mask 被翻译到当前编码块作为任意形状分区,将 CU 分为前景/背景两个运动不一致区域。

ORMC:重叠区域运动补偿

SAIP 的核心创新是 Overlapped Region-based Motion Compensation (ORMC)。直接将两个区域的预测拼接会产生严重边界伪影。ORMC 借鉴重叠块运动补偿 (OBMC) 的思想,在分割线两侧定义 2 像素宽的边缘区域,用距离自适应权重融合两个区域的预测。

具体实现:引入 Prewitt 算子对分割 mask 做边缘检测,将边缘区域像素分为三类:

  • 类别 1:紧邻分割线(1 像素内),权重 \(w_0 = \frac{1}{2}, w_1 = \frac{1}{2}\)(均等融合)
  • 类别 2:分割线旁 2 像素,权重 \(w_0 = \frac{3}{4}, w_1 = \frac{1}{4}\)(主区域占优)
  • 类别 0:距分割线 >2 像素,权重 \(w_0 = 1, w_1 = 0\)(纯主区域预测)

最终预测为:\(P_{\text{final}} = w_0 \cdot P_{\text{primary}} + w_1 \cdot P_{\text{secondary}}\),其中权重由像素到分割线的距离决定。这种距离加权融合消除了区域级边界伪影,同时保留了对象边界处的运动不连续性。

ORMC 重叠区域运动补偿框架
图 2: ORMC 重叠区域运动补偿框架。分割线两侧 2 像素宽边缘区域用距离自适应权重融合两个区域的预测。(来源:SAIP, arXiv:2403.11694, ORMC-framework)

分数像素运动补偿阶段,ORMC 策略同样适用:先用 DCTIF(离散余弦变换插值滤波器)对每个子区域分别做分数像素插值,再用相同的距离加权策略融合两个子区域的分数像素预测。这保证了亚像素精度下边界区域的一致性。

双候选列表运动矢量编码

SAIP 将运动信息分为主运动 (primary)辅运动 (secondary),对应两个 MV:

  • 主候选列表(71 个候选):包含 VVC 标准 Merge + MMVD 候选,覆盖常规运动矢量预测
  • 辅候选列表(7 个候选):由分割 mask 辅助构建,包含空间邻居中属于同一区域的 MV、pattern 匹配候选和零矢量

运动信息存储也做了适配:每个 \(4 \times 4\) 块根据 mask 值决定存储主运动还是辅运动信息,供后续 CU 的 MV 预测使用。

SA-RDO:联合分割与运动估计的率失真优化

传统 VVC 中,块级分区和运动估计是独立的两步。SAIP 的 SA-RDO 将二者联合:在两阶段搜索中,Stage 1 用 SATD 快速筛选主/辅候选组合,Stage 2 用完整 RD-cost 精确搜索最优分割模式和运动参数。这种联合优化避免了"先分区再估计运动"的次优解。

关键设计:由于分割网络在编解码端同步运行,mask 本身不需要传输——零码率开销。实验结果:LDP 配置下 BD-rate 平均 -0.82%(最大 -1.98%),且与 VVC 的 GEO(几何分割)模式互补。代价是编码时间增加 ~72%,解码时间增加 ~11%。

与 Part 1 的关联:SAIP 使用的分割 mask 在静态视角下与 Part 1 的 MPEG-4 Binary Alpha Plane 类似——都是描述对象形状的 二值图。但 MPEG-4 需要传输 shape information,而 SAIP 利用编解码端同步推理实现零开销分割。这是从“传输轮廓”到“推理轮廓”的范式转变。
Part 3 · 学习式轮廓压缩
从 SA-NeRV 到 MoRIC:边缘信息驱动的学习编码器

学习式图像/视频压缩(Learned Image/Video Compression, LIC/LVC)近年来取得了显著进展 #LearnedVCSurvey-2025。其中一个新兴方向是:能否只编码轮廓/边缘信息,而丢弃纹理细节?这对面向机器的视频编码 (Video Coding for Machines, VCM) 尤为重要——检测模型需要的是结构信息而非像素级保真。

SA-NeRV:用 SAM 边缘训练视频神经表示

Shindo 等人 2024 年提出的 SA-NeRV #Shindo-SANeRV-2024 是 SA-ICM(见《边缘与轮廓压缩》Part 5)的视频扩展:将边缘信息压缩从图像推广到视频。其核心思想是:用 Segment Anything (SAM) 生成边缘图,然后训练 NeRV (Neural Representations for Videos) 只编码这些边缘信息。

具体流程:(1) SAM 以置信度 \(\alpha\) 生成语义分割 mask → (2) Canny 边缘检测将 mask 转化为二值边缘图 \(\text{sam}_x(\alpha)\) → (3) 用边缘图训练 NeRV。损失函数为:

$$\mathcal{L}_{sa\text{-}n} = \mathcal{L}_n + \frac{1}{T}\sum_{t=1}^{T}\left[\beta \| x \odot \text{sam}_x(\alpha) - \hat{x} \odot \text{sam}_x(\alpha) \| + (1-\beta)\left(1 - \text{ssim}(x \odot \text{sam}_x(\alpha),\ \hat{x} \odot \text{sam}_x(\alpha))\right)\right]$$

其中 \(\mathcal{L}_n\) 是原始 NeRV 损失,\(\beta\) 平衡 L1 与 SSIM,\(\alpha = 0.78\) 是 SAM 置信度阈值(控制边缘密度),\(T\) 是总帧数。SA-ICM 图像压缩部分使用 COCO-train (118,287 张) 训练,LIC-TCM 架构,\(N=5\) slices,\(\lambda=0.05\)

SA-NeRV 训练流程
图 3: SA-NeRV 训练流程。SAM 生成边缘 mask 后,用边缘加权 L1 + SSIM 损失训练 NeRV 视频神经表示。(来源:SA-ICM/SA-NeRV, arXiv:2403.04173)

SA-NeRV 实验在 SFU-HW-Objects-v1 数据集(8 个视频序列)上进行,下游任务为 YOLOv7 目标检测。SA-NeRV 在 7/8 序列上优于基线 NeRV,最高提升 BlowingBubbles 序列 +7.01 mAP;仅 RaceHorsesD 序列略降 0.14 mAP(可忽略)。

MoRIC:自适应链码 + 隐式神经表示 (NeurIPS 2025)

Li 等人的 MoRIC #Li-MoRIC-2025 是本文调研中最接近"轮廓视频压缩"概念的工作——它直接以轮廓链码作为编码核心,结合隐式神经表示 (INR) 做区域级图像压缩。

传统 INR codec(如 COIN、COOL-CHIC)用单个小型 MLP 对整幅图像 overfitting:输入坐标 \((x,y)\),输出 \((R,G,B)\)。但一幅图像包含差异极大的统计分布——平滑天空、高频纹理、锐利边缘——要求单一 MLP 同时高效拟合所有分布,要么增大网络(码率爆炸),要么牺牲质量。

MoRIC 的解决方案是区域级编码:将图像分割为任意形状区域,每个区域分配一个 Local Synthesis Network (LSN),所有区域共享一个 Global Modulation Network (GMN)。

C* Coding:自适应链码的革命

MoRIC 的核心创新之一是 C* coding——一种自适应步长的链码方法。与 Freeman 8-方向链码(固定 1 像素步长)不同,C* 允许步长 \(T\) 自适应调整:

  • 长直边界:大步长,一个符号覆盖多个像素
  • 弯曲边界:小步长,精确跟踪
  • 支持角度匹配、全局重置、偏移适应和轮廓膨胀

C* 同时支持有损与无损轮廓压缩。

实验结果令人印象深刻:Kodak 数据集上 BD-rate vs VTM-19.1 (VVC 参考实现) 达到 -2.79%——这是首个 overfitted codec 在标准指标上超越 VVC。CLIC2020 上达到 -10.58%,DAVIS 单对象视频上达到 -16.31%。解码复杂度仅 < 800 MACs/pixel,远低于传统 autoencoder codec 的数十万~百万级。

轮廓码率占比分析(Figure 7)揭示了一个关键洞察:低码率时轮廓占总码率的 ~83%,高码率时降至 ~18-25%。这意味着在极低码率场景下,轮廓编码的效率直接决定了整体压缩性能。

Part 4 · 语义视频压缩
轮廓作为条件信号:DiSCo、MMSD 与 MISC

当码率降到极低(< 0.01 bpp)时,传统编码器彻底失效——像素级保真已无意义。2024-2026 年涌现的语义视频压缩路线提供了一种范式转换:只传输语义描述(文字、分割图、边缘图),接收端用生成模型重建。轮廓/边缘在这里的角色从"传输内容"变成了条件信号——引导扩散模型生成与原始视频语义一致的重建。

DiSCo:语义条件扩散视频压缩 (CVPR 2026)

Wang 等人的 DiSCo #Wang-DiSCo-2026 是目前最完整的语义视频压缩框架。它将源视频分解为三种互补模态:

模态功能提取方式编码方式
文字描述全局语义(物体、场景、动作)LLaVA 视觉-语言模型Zlib 无损压缩
退化视频粗粒度外观与结构引导联合时空下采样预训练 DCVC-RT
Sketch(可选)运动与几何线索(物体轮廓)InformativeDrawings微调 DCVC-RT
2D 姿态(可选)以人为中心的运动线索DWPoseLZMA 无损 (16-bit)
DiSCo 框架总览
图 4: DiSCo 框架总览。发送端将视频分解为文字描述、退化视频、Sketch 和 2D 姿态四种模态,各自独立编码;接收端以条件视频扩散模型从多模态码流重建高质量视频。(来源:DiSCo, arXiv:2512.00408, Fig.1)

解码端将语义压缩建模为 video-to-video 转换:以预训练的 LTX-Video (13B 参数) 为基座,采用 In-Context LoRA(rank 256,新增 ~625M 参数)适配多模态条件输入。一个关键设计是 Token Interleaving——将不同模态的 token 交错排列为统一序列,让扩散模型在一个注意力窗口内同时看到文字、退化帧和 sketch。

Token Interleaving 机制
图 5: Token Interleaving 机制。不同模态的 token 在 token 级别交错排列(而非帧级别),避免了 VAE 潜空间中的模态信息泄漏问题。(来源:DiSCo, arXiv:2512.00408, Fig.4)

时域一致性通过 Forward Filling 保证:对缺失帧用前向帧的信息填充条件序列,比零值填充提升 17.52% BD-rate(零值填充则退化 60.56%)。

实验在 HEVC-B、MCL-JCV、UVG 三个基准上测试。码率范围 0.0002 ~ 0.0196 BPP,在感知指标(FID、LPIPS、FVD)上 vs H.266 提升 5-10×,BD-rate 达 -83% ~ -91%。但像素保真度指标(PSNR/SSIM)显著低于传统编码器——这是语义压缩的固有代价。

局限:推理延迟 390ms/帧(LTX-Video 13B),极低码率下存在语义偏差(生成的物体细节可能与原始不符)。

MMSD:交通监控语义通信 (arXiv 2604.12622)

Assylbek 等人的 MMSD #Assylbek-MMSD-2026 面向交通监控场景,将图像替换为三种紧凑语义表示传输:

  • 分割图:3.96 KB,约束物体的空间布局
  • Edge map:18.41 KB,Canny 提取,提供物体边界结构引导
  • 文字描述:57-260 B,描述场景内容
MMSD 语义通信管线
图 6: MMSD 语义通信管线。发送端提取分割图、edge map 和文字描述组成语义载荷;接收端以微调扩散模型从三模态条件重建场景。(来源:MMSD, arXiv:2604.12622, Fig.1)

总载荷仅 22.42 KB,vs 原图 2.28 MB → 码率节省 ~99%(压缩比 111×)。接收端用扩散模型从语义表示重建场景。一个令人印象深刻的发现:edge map 仅占总载荷的 ~82%,但去掉 edge map 后 VLM 联合任务成功率从 86.9% 暴跌至 24.2%——edge map 虽然体积小,却是扩散模型重建物体边界的关键条件。

MISC:LMM 驱动超低码率压缩 (IEEE TIP 2024)

Liu 等人的 MISC #Liu-MISC-2024 是首个在编解码两端均集成大语言多模态模型 (GPT-4 Vision) 的压缩框架。编码端用 LMM 提取:整体语义描述(~50 词)+ 最多 3 组 Neural Descriptive Maps(物体名 + 细节描述 + 空间定位 map)。

MISC 框架
图 7: MISC 框架。LMM 编码端提取语义描述和 Neural Descriptive Maps,解码端分阶段用文本到图像生成逐步精化重建结果。(来源:MISC, arXiv:2402.16749, Fig.2)

与 DiSCo 和 MMSD 不同,MISC 不传 edge map,改用 CLIP Surgery 生成的 8×8 ~ 16×16 二值语义定位 map(< 0.001 bpp)替代。MISC-3 在 0.047 bpp 下综合评分 3.90,大幅超越 HiFiC (2.51) 和 PICS (0.97)。这暗示:在极低码率下,语义级空间定位可能比像素级边缘图更高效。

Part 5 · 边缘-云协同
二值草图传输:SketchVision 的极简哲学

在边缘计算视频分析场景中,一个根本性的问题是:从摄像头到云端,真的需要传 RGB 视频吗?如果云端只需要做目标检测,那么二值草图可能就够了。

SketchVision (IEEE TBC 2026)

Wang 等人的 SketchVision #Wang-SketchVision-2026 提出了一个极简方案:边缘端从 RGB 帧中提取二值语义线段图 (binary sketch),压缩后传输到云端,云端用上下文感知模型做目标检测。

系统架构包含四个核心模块:

  • Sketch Extractor:从 RGB 图像中提取语义关键线段,生成 0/1 二值图。与传统边缘检测器(Canny/Sobel)不同,Sketch Extractor 学习的是对检测任务有贡献的线段,而非通用边缘——它会抑制背景纹理边缘,保留物体轮廓和关键结构线
  • Detail Patcher:含 Object LoggerPresence Detector 两个子模块。Object Logger 跨帧维护已检测物体的位置日志;Presence Detector 检查当前草图是否丢失了日志中记录的物体——如果某个物体在草图中消失(可能被 Sketch Extractor 遗漏),Detail Patcher 会在该区域补充更精细的线段细节
  • Sketch Codec:专为二值草图设计的专用编解码器。由于草图是 0/1 二值图且前景稀疏,天然具有高可压缩性。论文为草图和锚帧分别设计了独立的编码路径——草图帧使用专用二值编码器,锚帧使用传统视频编码
  • 锚帧机制:定期传输完整 RGB 帧(锚帧)辅助检测校准,防止草图检测器在长时间运行后产生累积偏差
Detail Patcher 的设计哲学:草图提取不可避免地会遗漏某些物体——特别是纹理微弱或被遮挡的目标。Object Logger + Presence Detector 的组合实现了跨帧补偿:即使某一帧的草图不完整,系统仍能通过历史记录发现遗漏并请求补充信息。这是一种“轮廓 + 元数据”的混合编码策略。

带宽与性能分析

实验结果:在 COCO 数据集上,草图目标检测准确率 82% vs JPG 传输 68%(640×360 分辨率)。这一反直觉的结果——二值图比全彩 JPG 检测率更高——的核心原因是:二值草图消除了纹理干扰,迫使检测模型聚焦于结构特征。RGB 图像中的颜色、纹理和光照变化可能误导检测器,而草图只保留了几何轮廓这一最判别性的信息。

传输模式原始数据量/帧检测准确率语义信息保留
RGB 原始675 KB (640×360×3, 8-bit)~85%(上限)完整(纹理+结构+颜色)
JPEG 压缩显著压缩68%有损(纹理伪影干扰检测)
二值草图28 KB (640×360×1 bit)82%结构完整,丢弃纹理
锚帧(定期)等同 RGB 原始校准用完整

带宽节省显著:二值草图的原始数据量仅为 RGB 的 1/24(1 bit/pixel vs 24 bit/pixel),经专用编码后进一步压缩。由于大多数帧仅传输草图、锚帧仅偶尔发送,整体带宽消耗大幅降低。这种“只传轮廓不传像素”的思路,与 Part 4 的 DiSCo、MMSD 在哲学上一脉相承:当任务不需要像素保真时,结构信息是最高效的传输载体。

SketchVision 与 DiSCo 的关键区别在于:DiSCo 在云端用扩散模型从语义信号重建视频,而 SketchVision 直接在草图中做检测——不需要重建,也不需要生成模型。这使得 SketchVision 的云端计算开销远低于 DiSCo,更适合实时边缘-云协同场景。代价是草图不携带颜色/纹理信息,无法服务需要外观特征的任务(如细粒度分类、语义分割)。

Part 6 · 方法对比与开放问题
全景地图与五大未解难题

跨方法对比总表

方法年份任务轮廓类型轮廓角色码率核心指标
MPEG-4 CAE1997视频编码二值 BAB传输信号Inter 无损比 Vertex 低 20.5%形状保真度
MC-TLCC2002视频编码二值链码传输信号比 CAE 低 ~30%形状 PSNR
V-PCC 链码2020点云编码二值 occupancy传输信号比 HEVC 省 ~22%点云 D1 PSNR
CC-SMC → ECC2024/26语义图压缩语义边界传输信号比 CC-SMC 再省 ~18%无损
Seg-VVC (SAIP)2024视频编码分割 mask辅助信号零额外开销BD-rate -0.82%
SA-NeRV2024VCM 视频SAM 边缘(二值)传输信号与 NeRV 相当mAP +7.01
MoRIC2025图像压缩C* 链码传输信号可变 bppBD-rate -2.79% vs VTM
DiSCo2026语义视频sketch(非二值)条件信号0.0002-0.0196FID -83% vs H.266
MMSD2026语义通信edge map(二值)传输信号22.42 KB/帧VLM 成功率 86.9%
SketchVision2026边缘-云 OD二值草图传输信号远低于 RGBmAP 82% vs 68%
MISC2024语义图像CLIP map(二值)辅助信号~0.047 bpp综合评分 3.90

五大开放问题

1. 红外/热成像视频轮廓压缩:我们已有的 FPGA 轮廓提取(精读九)只处理单帧,CV 前沿方法借鉴(系列四)也主要聚焦静态场景。红外视频流的轮廓具有独特的时域特性——热目标的运动比可见光目标更"粘连"(热扩散),帧间轮廓的连续性更强但边缘更模糊。目前没有专门针对红外视频轮廓的压缩工作。

2. 端到端学习式轮廓视频 Codec:MoRIC 只做图像,SA-NeRV 是 NeRV 而非传统 codec。能否设计一个端到端的学习式编码器,以轮廓序列为输入,利用时域冗余做运动补偿式编码?

3. 时域一致性保证:DiSCo 用 Forward Filling + Token Interleaving 维持视频时域一致性,但推理延迟 390ms/帧。如何在保持低延迟的同时确保轮廓帧间连续?

4. 二值 vs 非二值的选择策略:何时应该硬二值化(节省码率但丢梯度信息)?何时保留连续值(MoRIC 的 C* 链码可以有损压缩轮廓)?目前缺乏系统性的率-失真-任务分析框架。

5. 面向机器 vs 面向人类的统一框架:SketchVision 和 SA-NeRV 面向机器(mAP),DiSCo 和 MMSD 面向人类感知(FID/LPIPS),Seg-VVC 面向传统编码效率(BD-rate)。能否设计一个自适应框架,根据下游任务动态选择轮廓编码策略? #HumanMachine-Survey-2024

参考来源

  • Ostermann J. Coding of Binary Shape in MPEG-4. PCS 1997. AT&T Labs - Research. PDF
  • Lu Z, Pearlman WA. Motion-compensated two-link chain coding for binary shape sequence. SPIE 2002, 4671: 356(期刊版见 IEEE TCSVT 2002, 12(9):747-757). ADS
  • Yang R, et al. Chain Code-Based Occupancy Map Coding for Video-Based Point Cloud Compression. IEEE VCIP 2020. ADS
  • Yang R, et al. Chain coding-based segmentation map lossless compression. JVCIR 2024. ScienceDirect
  • Yang R, et al. Context Adaptive Extended Chain Coding for Semantic Map Compression. arXiv:2603.03073. arXiv
  • Object Segmentation-Assisted Inter Prediction for Versatile Video Coding. arXiv:2403.11694. arXiv
  • Shindo T, et al. Image Coding for Machines with Edge Information Learning Using Segment Anything(SA-ICM 的视频扩展部分,使用 NeRV). ICIP 2024. arXiv:2403.04173. arXiv · 图像精读 →
  • Li G, Wu H, Gündüz D. MoRIC: A Modular Region-based Implicit Codec for Image Compression. NeurIPS 2025. Project · PDF · 精读 →
  • Wang L, et al. Low-Bitrate Video Compression through Semantic-Conditioned Diffusion. CVPR 2026. arXiv:2512.00408. arXiv
  • Assylbek D, et al. Efficient Semantic Image Communication for Traffic Monitoring at the Edge. arXiv:2604.12622. arXiv
  • Liu X, et al. MISC: Ultra-low Bitrate Image Semantic Compression Driven by Large Multimodal Model. IEEE TIP 2024. arXiv:2402.16749. arXiv
  • Wang H, et al. SketchVision: Bandwidth-Efficient Edge-Cloud Video Object Detection via Compressed Sketches. IEEE TBC 2026, 72(2). IEEE
  • Emerging Advances in Learned Video Compression. IJCAI 2025. arXiv:2504.21445. arXiv
  • Human-Machine Collaborative Image and Video Compression. ATSIP 2024, 13(6). Emerald