ESC
输入关键词搜索文章
目录

边缘图像压缩调研

红外轮廓图 · 二值边缘图 · 稀疏结构编码
当图像只剩轮廓,压缩对象就不再是像素纹理,而是结构、连通性与任务可用性
5技术谱系
17关键来源
1-bit核心数据形态
1961–2026时间跨度
Part 0 · 问题定义
为什么红外边缘图不能按普通图像压缩来理解

这里讨论的“边缘图像压缩”不是普通 RGB 或灰度图像压缩的一个小分支,而是一类数据形态发生改变后的编码问题:红外图像中可用信息主要表现为目标轮廓、热边界、稀疏边缘或近二值结构,图像内容从“纹理—颜色—亮度场”退化或抽象为“背景—边缘—连通结构”。因此,压缩器真正需要保留的并不总是每个像素的精确灰度,而是轮廓的连通性、拓扑关系、几何形状和下游检测/跟踪任务可用性。

传统图像压缩的默认目标通常是在人眼视觉质量、PSNR/MS-SSIM、感知质量和码率之间折中;JPEG、JPEG2000、BPG、WebP、HEVC/VVC intra 以及现代 learned image compression 都默认图像存在丰富纹理、高频细节、颜色或灰度梯度。可是红外轮廓图经常更像一张稀疏的 1-bit 图:大部分区域为空背景,少量边缘像素组成线、曲线、闭合边界、断裂边界或噪声毛刺。对这类数据,继续使用面向自然图像纹理的 transform coding,可能并不是最优选择。

核心判断:红外边缘图像应优先被看作“稀疏结构图 / 二值语义图 / 轮廓集合”,而不是普通灰度图像。压缩目标也应从“像素误差最小”转向“结构保持、连通性保持、任务性能保持”。
本文范围:本文聚焦静态图像中的轮廓/边缘压缩——即单帧二值边缘图、红外轮廓图和语义分割图的编码问题。当轮廓随时间演化形成视频序列时,时域冗余利用、运动补偿链码、语义条件扩散等视频专属问题在专题文章 《图像压缩专题(八):轮廓视频压缩》 中专门讨论。
红外灰度 / 弱纹理 边缘提取 二值边缘 / 轮廓图 结构编码 压缩码流 • 空白块 skip • 链码 / 线段 • 字典模板 + 残差 • 熵编码 保留结构而非纹理
图 1:红外边缘图像压缩的任务抽象。与自然图像压缩不同,这里首先要把灰度热辐射场转化为稀疏轮廓结构,再围绕空白块、轮廓曲线、重复边缘模式和下游任务进行编码。

这个问题同时连接五条技术线索:第一,传真和文档时代形成的二值图像压缩标准,如 CCITT Group 4、JBIG1 和 JBIG2;第二,计算机图形学和形状分析中的链码与轮廓编码;第三,结构保持的二值图像有损压缩,例如基于 Markov Random Field 的规格传输与重建;第四,语义分割图、占用图和地图轮廓压缩;第五,面向机器视觉任务的 Coding for Machines。下面按这五条线索展开。

数据特征普通自然图像红外边缘 / 轮廓图压缩启发
像素取值RGB / 灰度连续值二值或少量离散值可用二值图像标准与标签图压缩
空间分布纹理、平滑区、高频细节混合背景占绝大多数,边缘稀疏空白区域跳过、RLE、四叉树
关键信息视觉质量与感知真实性连通性、轮廓形状、拓扑结构链码、线段、结构保持指标
失真容忍轻微纹理变化可接受断裂、拓扑变化可能致命不能只看 PSNR,应看 Chamfer / connectivity / task accuracy
应用场景 · Application Scenarios
红外轮廓图像在哪些地方真正被使用

在讨论压缩算法之前,有必要先回答一个更根本的问题:红外轮廓图像究竟有哪些实际应用?理解这些场景,才能判断压缩的目标函数和约束条件。综合文献与工程实践,红外轮廓图的应用可归纳为以下几大类:

应用场景总览

领域典型应用轮廓图的角色压缩需求
军事 / 国防夜视观瞄目标提取、红外制导、热目标跟踪从热辐射场中提取目标轮廓,供火控、识别与跟踪系统使用嵌入式设备实时编码,带宽受限传输
自动驾驶夜间行人 / 车辆检测、弱光感知、多模态融合热红外轮廓作为 RGB 的补充模态,提供不受光照影响的目标边界边缘设备低延迟压缩,保持检测精度
建筑检测外墙空鼓检测、裂缝与脱落识别Canny / 热传导边缘检测提取热异常边界,量化缺陷区域无人机回传时带宽优化
工业检测电路板热故障定位、管道 / 设备热异常监测热成像提取等温线与热梯度轮廓,标示故障边界在线监测数据压缩存储
医疗诊断红外人脸识别、肿瘤 / 炎症热成像面部轮廓用于身份验证;病灶热边界用于辅助诊断医疗影像存档与传输
安防监控全天候人员检测、周界入侵识别人体热轮廓不受光照影响,适合夜间与遮挡场景多路视频流压缩传输
边缘 - 云协同 (ICM)边缘设备向云端 AI 发送图像做识别只传输目标轮廓,丢弃无关纹理,大幅降低带宽SA-ICM / ST-ICM 等面向机器的轮廓压缩
多模态融合与配准红外与可见光图像配准、融合成像轮廓特征(尤其是角点、直线段)作为跨模态配准的锚点双模态同步压缩,轮廓对齐保持

军事与国防:红外轮廓图的经典应用

红外夜视观瞄系统是红外轮廓图最早、最成熟的大规模应用场景之一。在红外夜视观瞄系统中,典型目标(人员、车辆、装备)在红外图像中通常表现为高亮度区域,系统需要在极低信噪比条件下快速提取目标轮廓,供火控计算机进行识别与跟踪 #IR-NightVision-2024。这类场景对轮廓压缩的核心约束是:轮廓连通性不能断裂,目标几何形状不能畸变,处理延迟必须在毫秒量级

红外制导系统则进一步要求轮廓在极低码率下仍可被弹载计算机识别。导引头通常将目标简化为轮廓模板进行匹配,带宽和算力都极为有限,对轮廓编码的紧凑性和鲁棒性提出了极高要求。

自动驾驶:热红外轮廓作为互补模态

热红外相机可在完全黑暗、逆光、雾天和眩光条件下检测到行人和车辆的热轮廓,这是 LiDAR、毫米波雷达和可见光相机都无法独立实现的能力 #FLIR-Dataset。FLIR ADAS 数据集的统计表明,热红外在夜间场景的行人检测召回率显著高于可见光。TIRNet 等工作专门研究热红外图像中的目标检测,利用轮廓边界作为关键判别特征 #TIRNet-2021

在 RGB-IR 多模态融合中,红外轮廓提供了不受光照影响的稳定目标边界,与可见光纹理互补。这对融合系统意味着:红外轮廓的压缩质量直接影响融合后检测器的性能——断裂的轮廓可能导致漏检,偏移的边界可能导致误检。

建筑与工业检测:热异常边界提取

红外热成像在建筑缺陷检测中的应用已有成熟案例。外墙空鼓检测使用 Canny 边缘检测算法对红外热图像进行处理,自动提取热异常区域的轮廓边界,实现缺陷的定量分析 #Canny-IR-Building-2022。近年来无人机搭载红外相机的巡检方案进一步推动了这一应用,系统需要在飞行过程中实时回传热图像或轮廓数据,带宽受限场景下的轮廓压缩成为工程瓶颈。

工业领域类似:电路板热故障定位、管道泄漏检测、设备过热预警等场景中,热成像提取的等温线与热梯度轮廓是标示故障边界的关键信息,在线监测数据的压缩存储需求持续增长。

边缘 - 云协同与 Coding for Machines

随着边缘设备与云端 AI 的协同越来越普遍,Image Coding for Machines (ICM) 成为一个快速增长的方向。其核心思想是:如果图像的最终消费者是机器识别模型而非人眼,那么压缩就应该只保留对任务有用的信息。轮廓图恰好是这种思想的最佳载体——它丢弃了人眼可见但机器不需要的纹理细节,只保留判别性最强的结构边界。

SA-ICM #SA-ICM-2024 与 ST-ICM #ST-ICM-2025 是这个方向的代表工作:前者利用 SAM 提取边缘先验监督压缩学习,后者进一步引入灵活目标选择机制,两者都专注于在极低码率下保持目标轮廓完整性,同时兼容多种下游识别模型,不在边缘设备增加额外计算负担。这类工作直接验证了一个核心假设:对机器来说,轮廓比纹理更重要,轮廓压缩比全图压缩更高效

多模态融合与配准

红外与可见光图像配准是多模态融合的基础。由于两种模态的成像机制完全不同(反射 vs 热辐射),传统基于灰度互信息的配准方法往往失效。实践中常用的策略是基于轮廓特征(角点、直线段、闭合边界)进行结构级配准 #IR-VIS-Registration-2020。这类场景对轮廓压缩的要求是:压缩后的轮廓必须保持角点位置精度和线段连通性,否则配准误差会传递到后续所有融合步骤。

对压缩研究的启示:上述应用场景共同指向一个结论——红外轮廓图的压缩目标不应是 PSNR 最大化,而应是结构完整性、任务可用性和几何精度的联合保持。这也是后续 Part 1-6 中所有压缩方案设计的出发点。
Part 1 · 二值标准
像素级二值图像压缩:从 RLE 到 JBIG2

如果把红外边缘图直接看作 1-bit 图像,最自然的第一批 baseline 是传真、扫描文档和 bi-level image 领域的经典标准。它们并不理解“红外”或“目标轮廓”,但非常擅长处理黑白图、长背景游程和局部像素相关性。

Run-Length Encoding:最小但必要的基线

Run-Length Encoding, RLE 的基本思想是把连续相同像素表示为“值 + 长度”。对红外边缘图而言,背景通常占绝大多数,一条扫描线上往往出现很长的 0 游程和少数 1 边缘点,因此 RLE 是必须实现的最小 baseline。它的优点是编码解码极快、复杂度极低、适合嵌入式设备;缺点也同样明显:斜线、曲线和孤立噪声点会不断打断长游程,导致效率下降。

一个直观例子

扫描线 000000000111000000 可以写成 0×9, 1×3, 0×6。如果边缘非常稀疏,RLE 会很有效;如果噪声点很多,原本的长背景游程就会被切碎。

扫描线:000000000111000000 0 × 9 1 × 3 0 × 6 背景越长,RLE 越高效; 孤立噪声会切碎游程。
图 2:RLE 的基本工作方式。红外边缘图中的大片背景适合游程编码,但斜线、曲线和孤立噪声会不断制造短游程。

CCITT Group 3 / Group 4:传真图像的成熟无损路线

CCITT Group 3 与 Group 4 是传真和文档扫描时代形成的二值压缩标准。Group 3 对应 ITU-T T.4,Group 4 对应 ITU-T T.6。Group 3 的一维模式使用 Modified Huffman 对每条扫描线做游程编码,二维模式 Modified READ 参考上一扫描线编码当前行;Group 4 使用 Modified Modified READ,去除面向传真同步的部分机制,更适合存档型二值图像压缩 #ITU-T-T6

美国国会图书馆的格式说明将 Group 4 描述为 bitonal / bi-level 图像的无损压缩方法,典型应用包括黑白扫描文档和 TIFF 图像,常见压缩比可达到约 15:1,具体取决于图像内容 #LOC-G4。对红外边缘图来说,Group 4 的优势来自两点:一是背景长游程,二是相邻扫描线之间的轮廓位置通常变化不大。它对水平或近水平边缘尤其友好;但对斜线、曲线和孤立噪声点不如轮廓级方法自然。

参考行 当前行 当前行不重新描述整行,只编码相对参考行变化点的偏移 / pass / vertical / horizontal mode 适合相邻扫描线相似的二值文档与水平延伸轮廓;斜向曲线会产生更多变化点。
图 3:CCITT Group 4 的二维直觉。当前扫描线参考上一行的变化点,而不是完全独立编码整行;这解释了它为何适合文档与水平延伸的二值结构。

JBIG1:上下文模板与自适应算术编码

JBIG1 对应 ITU-T T.82 / ISO/IEC 11544,是面向 bi-level image data 的无损压缩标准。它的核心不只是扫描线 RLE,而是利用邻域上下文模板预测当前像素,再用自适应算术编码接近熵极限;同时支持 progressive coding,可以先传低分辨率版本,再逐步细化到完整图像 #ITU-T-T82。JBIG-KIT 的说明也指出,JBIG1 被广泛用于传真、打印机固件、文档管理和 imaging software #JBIG-KIT

对红外边缘图而言,JBIG1 的意义在于它可以自动学习局部像素模式:曲线、角点、短断裂、孤立点都会通过上下文概率反映到码长中。它仍然是像素级方法,但比单纯 RLE 或 Group 4 更能处理不规则局部结构。渐进编码也很适合带宽受限链路:先传粗轮廓,必要时继续传细节。

JBIG2:最值得迁移思想的二值图像标准

JBIG2 对应 ITU-T T.88 / ISO/IEC 14492,标准标题即为 lossy/lossless coding of bi-level images。ITU-T T.88 明确说明 JBIG2 支持 lossy、lossless 和 lossy-to-lossless 的 bi-level image coding #ITU-T-T88。开源 jbig2enc 项目概括了 JBIG2 的几个关键能力:generic region encoding、symbol extraction、classification and text region coding、refinement coding 和 multi-page document compression #jbig2enc

JBIG2 的关键思想是把二值图像分成 text、halftone 和 generic regions。对 text region,它会提取重复符号并建立字典,后续相似符号只需要编码字典索引与位置;如果要无损,则再通过 refinement coding 编码实例和模板之间的差异。这个思想虽然最初服务于文档和字符,但对红外边缘图非常有启发:建筑边缘、道路边界、机械轮廓、车辆轮廓中可能存在重复局部结构,它们可以像“符号”一样被提取、聚类、字典化,然后只编码变换参数与残差。

JBIG2 对红外轮廓图的迁移方式

可以把红外边缘 patch 或连通组件看成“非文本符号”:编码字典 ID、位置、方向、尺度,以及少量修正 mask。无法匹配的复杂区域则回退到 generic binary arithmetic coding。这会形成一种“JBIG2-style infrared edge dictionary codec”。

重复边缘 patch 聚类 / 匹配 字典 Template #7 实例编码 ID = 7 pos = (x,y) scale / rotate residual mask JBIG2 的文本符号字典思想可以迁移为“红外边缘 patch 字典”。
图 4:JBIG2-style 字典压缩的迁移方式。文档中的重复字符可以变成字典符号;红外轮廓图中的重复局部边缘结构也可以被模板化,只传实例位置、几何变换和残差。
Part 2 · 轮廓编码
从像素图到曲线:链码、顶点码与线段几何编码

二值标准仍然把图像看成像素矩阵,而红外边缘图的真实信息更像曲线集合。因此,第二条更自然的路线是先从边缘图中提取连通轮廓,再编码轮廓的运动方向或几何参数。

Freeman Chain Code:给轮廓写“行走日记”

Freeman 在 1961 年提出 chain code,用于计算机描述任意平面曲线 #Freeman-1961。其基本做法是:找到轮廓起点,沿边界逐像素追踪,每一步只记录移动方向。4 邻域链码每步需要 2 bit,8 邻域链码每步需要 3 bit。相比直接存储每个边缘点的二维坐标,链码显著减少码长,并且显式保留轮廓连通性。

进一步地,差分链码不编码绝对方向,而编码当前方向相对前一方向的变化。真实轮廓通常方向连续,方向变化分布高度集中,因此差分链码再接 Huffman、Markov 或 arithmetic coding 可以继续降低码率。

轮廓路径 → 方向序列 0 1 2 3 4 5 6 7 示例码流 起点 + 1, 1, 0, 1 ...
图 5:Freeman 8 方向链码。轮廓不再以像素矩阵保存,而是保存起点和沿边界行走的方向序列;方向变化再做熵编码,可以进一步利用曲线平滑性。
表示方式编码对象优点缺点
点坐标列表所有边缘像素坐标简单、无损每点成本高,不利用连续性
Freeman F4/F8起点 + 方向序列保留轮廓连通性,码率低噪声和毛刺会拉长序列
差分链码方向变化序列利用方向平滑性,适合熵编码断裂轮廓需要重新启动
线段编码起点、终点、点数或误差对长直线极高效曲线需要折线逼近,有失真

Vertex Chain Code 与 Three-Orthogonal Chain Code

后续链码研究尝试进一步降低符号熵。Bribiesca 提出的 Vertex Chain Code 基于边界经过的网格顶点类型,而不是直接记录 8 个方向,因此可以用更少的符号描述曲线局部形态 #Bribiesca-1999。Three-Orthogonal Chain Code, 3OT 则经常出现在语义图压缩工作中,它通过相对转向描述边界,使符号分布更集中。

对红外轮廓图来说,VCC / 3OT 这类紧凑链码适合长而平滑的目标边界。它们比原始 Freeman F8 更接近“轮廓语言模型”:大多数时候轮廓继续向前,少数时候左转或右转。这个统计规律正适合 Markov model 或 adaptive arithmetic coding。

线段几何编码:从逐像素行走到参数化形状

如果一段轮廓本质上是直线,那么逐像素记录方向仍然冗余。Gerogiannis、Nikou 和 Kondi 在 ICIP 2015 的论文 Shape Encoding for Edge Map Image Compression 中直接研究 edge map image compression:他们将边缘图中的 shape manifold 建模为 line segments,每条线段编码 starting point、ending point 和 contributing points number,解码时在线段上均匀采样重建轮廓 #Gerogiannis-2015

这篇论文对红外轮廓图高度相关。许多红外场景包含人造结构边缘,如建筑轮廓、道路边界、车辆外形和工业设备边缘,长直线或折线非常常见。对这些结构,线段编码可能远优于逐像素链码;对曲线部分,则可以用折线近似,并通过最大偏移误差或 Chamfer distance 控制失真。

边缘点集合 线段拟合 起点 终点 编码:起点 + 终点 + 点数/误差 码流 x0,y0 x1,y1 n / error
图 6:线段几何编码。对近似直线的红外边缘,逐像素链码仍有冗余;用起点、终点和误差控制参数表示一整段轮廓,码率会明显降低。
Binary edge/contour shape used in edge map compression experiments
图 6b:Gerogiannis 等人用于 edge map compression 实验的二值轮廓形状。整条边界被建模为一组线段,只编码线段端点与贡献点数,解码时沿线段均匀采样重建(来源:Gerogiannis, Nikou & Kondi, Shape Encoding for Edge Map Image Compression, IEEE ICIP 2015)。
Rate-distortion curve comparing shape-based edge map encoding against baseline
图 6c:该论文报告的率失真曲线(横轴 bits、纵轴 distortion)。线段/形状编码在相同码率下的重建失真与逐点基线的对比,说明参数化形状表示对结构化轮廓的码率优势(来源:Gerogiannis et al., IEEE ICIP 2015)。
工程启发:一个强红外边缘 codec 不应只选链码或线段,而应按连通组件自适应选择:长直轮廓用线段,平滑曲线用差分链码,复杂噪声块用二值算术编码 fallback。
Part 3 · 结构保持
近无损压缩:不要让轮廓断裂,不要让拓扑变形

红外边缘图的有损压缩不能只看像素错误率。一个像素级误差很小的重建,如果把闭合轮廓压断,可能会直接破坏目标检测;反过来,某些边缘整体平移一两个像素,若连通性和形状仍保持,下游任务可能几乎不受影响。因此,这类数据需要结构保持视角。

Reyes & Pappas:传输结构规格,而不是传输所有像素

Reyes、Zhao、Neuhoff 和 Pappas 关于 bilevel image lossy compression 的工作提供了重要参考。他们讨论一种基于 Markov Random Fields 的二值图像有损压缩方法:编码端将图像分块,只传输块类别、run endpoint、decision bit 等 specification;解码端在满足这些结构约束的条件下,用 MRF 模型重建最平滑、最合理的二值图像 #Reyes-Pappas-2008

这一路线的关键不是“少传一点像素”,而是改变编码对象:传输的是结构约束,未指定部分由解码器根据局部相关性补全。对红外边缘图而言,可以进一步把 specification 设计为端点、交叉点、角点、进入/离开块的位置、局部方向和连通关系。这样即使码率极低,也尽量保留目标轮廓的拓扑骨架。

具体而言,MRF 方法将二值图像分为均匀块(全黑/全白)和边界块(含黑白边界)。均匀块只需 1 bit 标记类别;边界块传输的 specification 包括:run endpoints(每行黑白交替的位置)、block class(边界类型:水平/垂直/对角/L 形等)和 decision bit(具体拓扑分支)。解码端的 MRF 模型以这些 specification 为约束,在所有满足约束的重建中选取最大后验概率 (MAP)的解——即最平滑、最符合局部空间相关性的二值图像。这一过程相当于"有约束的图像修复":编码端只告诉解码器"这里有一条从左上到右下的边界",解码器自行补全具体像素路径。

层级 Cutset 采样:从粗到细的递进编码

Zhao、Neuhoff 和 Pappas 在 TIP 2021 进一步提出层级 cutset 采样方法 #Zhao-Cutset-2021。其核心思想是沿可变步长的矩形网格对二值图像进行采样——网格交叉点的像素值被传输,其余像素由解码器用 MRF 模型推断。关键是步长自适应:边缘密集区域用细网格(小步长),平坦区域用粗网格(大步长),形成从粗到细的层级结构。

与 Reyes 等人的块级 specification 不同,cutset 采样是点级的——直接选择关键像素传输,而非传输抽象的结构描述。这种方法更适合轮廓不规则、难以用有限 specification 类别描述的红外边缘图。例如,红外小目标的轮廓可能只有 3-5 个像素宽,块级 specification 可能将整个目标归入一个块而丢失形状信息;而 cutset 采样可以在目标区域加密采样点,保留局部几何。

骨架与图方法:从形态学到拓扑编码

除了 MRF 路线,形态学骨架 (morphological skeleton) 提供了另一种结构保持思路。骨架表示将二值图像分解为一系列以骨架点为中心的极大圆盘的叠加,只需编码骨架点坐标和半径。对于红外轮廓图,骨架天然对应轮廓的中轴线 (medial axis),可以高效表示细长目标。但骨架表示的弱点是对噪声敏感——少量噪声像素可能产生大量短分支骨架,导致码率膨胀。

图方法 (graph-based coding)将轮廓转化为图结构:节点对应端点、交叉点和角点,边对应轮廓段。编码时只传输图的拓扑(邻接矩阵)和节点坐标,边路径由解码器根据端点和方向信息重建。这种方法的优势是显式保留拓扑——连通组件数、欧拉数 (Euler number)、分支结构在编码过程中不会被破坏。对于红外场景中的多目标轮廓,图方法可以自然地将每个目标表示为一个连通子图,便于后续任务驱动的选择性编码。

结构保持方法编码对象解码端重建拓扑保证红外适用性
MRF Specification块类别 + run endpoints + decision bitMRF MAP 推断间接(通过 specification 约束)适合中等密度轮廓
层级 Cutset 采样网格交叉点像素值MRF 插值间接(依赖采样密度)适合不规则细轮廓
形态学骨架骨架点坐标 + 半径圆盘叠加重建弱(噪声敏感)适合细长目标
图方法节点坐标 + 邻接矩阵边路径推断显式保留适合多目标场景

结构保持压缩的核心准则

对边缘图而言,错误的严重性不只取决于错了多少像素,而取决于这些错误是否改变了轮廓的结构功能:是否断开连通组件、是否删除小目标、是否破坏闭合边界、是否改变关键角点和分叉点。

原始闭合轮廓 小偏移:结构仍保留 少量像素错误:拓扑断裂 边缘图压缩不能只数错多少像素,还要看结构是否被破坏
图 7:结构保持的评价直觉。中间图像像素位置有偏移但轮廓闭合;右侧只丢失少量关键像素,却造成拓扑断裂。对红外目标检测而言,后者可能更严重。

评价指标:从 PSNR 转向边缘结构距离

因此,红外边缘图压缩的评价指标应包括像素、几何、拓扑和任务四个层次。像素级可以用 F1 / IoU;几何层可以用 Chamfer Distance 和 Hausdorff Distance;拓扑层应统计连通组件数量变化、endpoint error、junction error、closed contour preservation;任务层则直接看目标检测 mAP、跟踪 MOTA/IDF1 或分割 mIoU。

指标层次代表指标回答的问题
像素级Precision / Recall / F1 / IoU重建边缘点和原始边缘点有多少重合?
几何级Chamfer / Hausdorff distance轮廓整体偏移了多远?是否有局部极端错误?
拓扑级Component count / endpoint / junction error连通性、闭合性、分叉结构是否被破坏?
任务级mAP / MOTA / IDF1 / mIoU压缩后还能不能服务下游红外视觉任务?
Part 4 · 语义图与占用图
现代轮廓压缩:Semantic Map Compression 给出的新工具

近年来,语义分割图、占用图和地图轮廓压缩开始成为独立问题。它们与红外边缘图高度相似:像素取值有限,区域内部常常恒定,重要信息集中在边界。红外边缘图可以看成最简单的二值 semantic map:0 是 background,1 是 edge。若区分弱边缘、强边缘、目标边界和噪声,还可以扩展成多值标签图。

从二值到多值:标签图的压缩挑战

语义分割图的像素值是类别标签而非灰度——例如 COCO 的 80 类、Cityscapes 的 30 类、ADE20K 的 150 类。这与红外边缘图的关键区别在于:多值标签图中的边界不只是“有/无”,还携带“从哪个类别过渡到哪个类别”的信息。一条轮廓段可能同时是“行人→道路”和“车辆→道路”的边界,编码时需要区分。

对红外边缘图而言,可以自然地将二值边缘扩展为多值标签:0 = 背景、1 = 弱边缘(梯度幅值 30-60)、2 = 强边缘(梯度幅值 60-100)、3 = 目标边界(由检测器确认)、4 = 噪声伪边缘。这种多值标签图比纯二值图携带更多语义信息,也为压缩提供了更大的空间——例如,弱边缘和噪声可以用更粗的量化或直接丢弃,而强边缘和目标边界需要精确保留。

多值标签图的压缩比二值图更复杂,因为同一块内可能有多个不同标签的边界重叠。CC-SMC 和 ECC 的四叉树 + 链码框架可以自然扩展到多值场景:均匀块编码标签值,边界块用链码编码每段边界的两侧标签。但码率会随标签种类数增长——若一幅图有 \(K\) 种标签,最坏情况下每个边界点需 \(\lceil\log_2 K\rceil\) bit 额外编码标签过渡信息。

占用图压缩:V-PCC 的静态视角

占用图 (occupancy map)是 3D 点云压缩中的核心数据结构——V-PCC (Video-based Point Cloud Compression) 将 3D 点云投影到 2D 平面,生成 occupancy map 标记哪些像素有几何信息。这与红外边缘图在数据结构上几乎相同:都是稀疏二值图,前景像素占比通常 < 15%,大片背景为 0。

在静态视角下,V-PCC 的占用图压缩与 Part 1 讨论的 JBIG2 高度重合。但 V-PCC 场景提供了额外结构信息:占用图的边界对应 3D 表面的轮廓投影,通常形成连续的闭合或半闭合曲线。V-PCC 标准使用基于块的后处理——先用 HEVC 编码占用图,再对边界块做形态学平滑。VCIP 2020 的工作则将占用图边界提取为链码,用运动补偿链码利用帧间冗余 #VPCC-Occupancy-2020

对红外边缘图而言,V-PCC 占用图的经验说明:如果边缘图有对应的深度/3D 信息,可以将 2D 边缘与 3D 表面轮廓联合编码。这在红外-可见光融合、红外 3D 重建等场景中有直接应用价值。即使没有 3D 信息,占用图的稀疏二值编码经验(如 run-length + 链码混合)也完全适用于红外边缘图。

CC-SMC:四叉树分块 + 链码

Yang 等人在 2024 年提出 Chain coding-based segmentation map lossless compression, CC-SMC,用于语义分割图无损压缩 #Yang-CCSMC-2024。其基本思想是:先对语义图做 quadtree partitioning,均匀块直接编码标签,含边界的块用链码编码轮廓,再对链码序列做熵编码。这个框架适合同时处理大片均匀区域和复杂边界区域。

迁移到红外边缘图时,四叉树可以快速跳过大片空白背景;边缘密集块则交给链码。它比全图链码更稳健,因为不要求所有边缘先形成干净闭合轮廓;但四叉树分块也可能截断长轮廓,降低上下文建模效率。

ECC:扩展链码与共享边界跳过编码

Yang、Liao、Choi、Racapé 和 Bajić 在 2026 年的 Context Adaptive Extended Chain Coding for Semantic Map Compression 中进一步提出 Extended Chain Code, ECC #Yang-ECC-2026。ECC 扩展了传统 Freeman F8 的符号集,允许用更长距离的轮廓跳转表示平滑或长直边界;同时保留 3OT 作为 fallback,并使用 Markov model-based entropy coding 对符号序列建模。

该工作还提出 skip-coding 机制:当相邻语义区域共享边界时,只编码一次轮廓,后续区域通过 run-length signaling 跳过重复部分。论文摘要报告,相比 state-of-the-art benchmark,平均码率降低约 18%;相对现代通用无损 codec,编码器运行时间最高减少 98%,解码器最高减少 50% #Yang-ECC-2026

对红外边缘图而言,ECC 的价值在于它更接近“轮廓专用语言”:长直边缘不必逐像素行走,方向上下文可以被 Markov 模型利用,多层等温轮廓或相邻结构也可能受益于共享边界跳过编码。即使最终不直接复现这篇方法,它也是设计现代红外轮廓 codec 的重要参照。

graph TD
  A[红外边缘图 / 二值轮廓图] --> B[空白区域检测]
  B --> C[四叉树或连通组件划分]
  C --> D{局部结构类型}
  D -->|大片背景| E[RLE / skip block]
  D -->|长直边缘| F[线段几何编码]
  D -->|平滑曲线| G[差分链码 / ECC]
  D -->|复杂噪声块| H[JBIG-style generic coding]
  E --> I[统一熵编码]
  F --> I
  G --> I
  H --> I
  I --> J[压缩码流]
Part 5 · Coding for Machines
如果边缘图是给机器看的,评价目标就应该跟任务绑定

如果红外边缘图最终用于目标检测、跟踪、识别或态势感知,那么压缩不一定要服务人眼,而应服务机器视觉模型。这就是 Image / Video / Feature Coding for Machines (ICM/VCM/FCM) 的基本视角:压缩后的数据只要能让机器完成任务,就不必保留人类视觉意义上的完整图像。JPEG 和 MPEG 已分别启动 ICM 和 VCM 标准化,目标是将"机器可识别"作为与"人眼可看"并列的压缩优化目标。

ICM 三种范式:ROI、Task-Loss 与 Region-Learning

理解 SA-ICM 之前,需要先了解 ICM 领域的三种主要范式 #Shindo-SAICM-2024

范式核心思想损失函数局限
ROI-based用 ROI-map 给目标区域分配更多比特\(\mathcal{L}_h = \mathcal{R}(y) + \lambda \cdot \text{mse}(x, \hat{x})\)(全图 MSE + ROI 加权)编码端需生成 ROI-map,负担重;对需要背景的任务无效
Task-Loss (TL)将识别模型的输出作为损失项加入训练\(\mathcal{L}_{tl} = \mathcal{R}(y) + \lambda_1 \cdot \text{mse}(x, \hat{x}) + \lambda_2 \cdot \mathcal{M}(\hat{x})\)每个任务模型需对应一个 LIC 模型,泛化性差
Region-Learning (RL)训练 LIC 只编码/解码物体区域,丢弃背景\(\mathcal{L}_{rl} = \mathcal{R}(y) + \lambda \cdot \text{mse}(x \odot m_x, \hat{x} \odot m_x)\)背景信息丢失,不适用于语义/全景分割

其中 \(\mathcal{R}(y)\) 是码率估计,\(\text{mse}\) 是均方误差,\(m_x\) 是二值 mask,\(\mathcal{M}(\hat{x})\) 是任务损失(如 YOLO 检测损失),\(\odot\) 是逐元素乘积。三种范式代表了"在哪里分配比特"和"用什么信号优化"的不同回答。

Comparison of ICM learning paradigms: baseline, ROI-based, task-loss and SA-ICM mask learning
图 8:ICM 学习范式对比。(a) 面向人眼的 MSE + rate 基线;(b) ROI-map 引导比特分配;(c) Task-Loss 用识别模型输出作监督;(d) SA-ICM 用边缘 mask 逐元素加权 MSE(来源:Shindo et al., Image Coding for Machines with Edge Information Learning Using Segment Anything, ICIP 2024, arXiv:2403.04173, Fig. 1)。

SA-ICM:用 SAM 边缘 mask 驱动 Region-Learning

Shindo 等人在 ICIP 2024 提出的 SA-ICM 属于 RL 范式的变体,但做了关键改进 #Shindo-SAICM-2024。传统 RL 方法使用 COCO 数据集的手工 mask(图 b),只保留物体区域内部像素;SA-ICM 改用 Segment Anything Model (SAM) 生成分割 mask,再经 Canny 边缘检测转化为边缘 mask。

SA-ICM 的训练流程:(1) 输入图像 \(x\) → (2) SAM 以置信度 \(\alpha\) 生成分割图 → (3) Canny 检测器将分割边界转为二值边缘 mask \(\text{sam}_x(\alpha)\) → (4) 用边缘 mask 训练 LIC 模型。关键设计:mask 仅在训练时使用,推理时不需 SAM,编码端无需额外计算。损失函数为:

$$\mathcal{L}_p = \mathcal{R}(y) + \lambda \cdot \text{mse}(x \odot \text{sam}_x(\alpha),\ \hat{x} \odot \text{sam}_x(\alpha))$$
SA-ICM masks: input image, COCO hand-labeled mask, and SAM+Canny edge masks at decreasing confidence
图 9:SA-ICM 的 mask 生成。(a) 输入图像;(b) COCO 手工物体 mask(传统 RL 使用);(c)–(e) SAM 分割 + Canny 边缘检测得到的边缘 mask,置信度 \(\alpha\) 递减时保留的边缘越来越密(来源:Shindo et al., ICIP 2024, arXiv:2403.04173, Fig. 2)。

置信度 \(\alpha\) 控制边缘 mask 的密度:\(\alpha = 0.98\) 只保留高置信度物体的主要边界;\(\alpha = 0.48\) 则生成更多、更细的边缘。较小的 \(\alpha\) 意味着更多物体被分割、更多边缘被检测,重建图像中保留的结构信息更丰富,但码率也更高。LIC 骨架使用 LIC-TCM(Mixed Transformer-CNN),码率控制使用 CompressAI 库,训练数据为 COCO 2017(118,287 张)。

对红外边缘图的启示:SA-ICM 的核心洞察是——边缘信息足以让机器识别物体。红外轮廓图本身就是边缘信息,因此可以直接将 SA-ICM 的训练目标改造成"压缩红外边缘表示,并以红外检测/跟踪任务性能为约束"。更进一步,可以用红外边缘检测器(Sobel/Canny on IR)替代 SAM,将 SA-ICM 的框架完全迁移到红外域。

Rate-Task-Distortion:面向机器的率失真优化

传统压缩的率失真优化 (RDO) 最小化 \(J = D + \lambda R\),其中 \(D\) 是像素级失真 (MSE/SSIM)。但在 Coding for Machines 场景下,像素失真与任务性能并不单调相关——一个 PSNR 更低的重建可能反而有更高的检测 mAP。因此需要 Rate-Task-Distortion (R-T-D) 优化框架。

Fischer 等人提出的 Feature-Based RDO (FRDO) #FRDO-2022 用特征空间失真替代像素失真:将重建图像输入预训练的 ResNet50,在中间特征图上计算 \(D_{\text{feat}}\),替代传统 MSE。这使得 RDO 直接优化"机器能看到什么"而非"人眼能看到什么"。类似地,Just Recognizable Distortion (JRD) 概念将 JND(Just Noticeable Distortion)从人眼感知阈值扩展到机器识别阈值——在 JRD 以下的失真不影响机器任务性能,可以大胆丢弃。

优化框架失真度量适用场景
传统 R-DMSE / SSIM / MS-SSIM面向人眼的图像/视频压缩
Feature R-D (FRDO)ResNet50 特征距离标准兼容(VTM 插件),检测/分割任务
R-D-Task (TL-based)MSE + 任务损失 \(\mathcal{M}(\hat{x})\)端到端 LIC,特定任务专用
R-JRD机器识别阈值极低码率,任务保真优先

对红外边缘图压缩而言,R-T-D 框架意味着:不必追求边缘像素的精确重建,而应保证检测器/跟踪器在压缩后的边缘图上仍能达到可接受的 mAP/MOTA。这是一个更合理的优化目标,也与 Part 3 讨论的结构保持评价体系(拓扑级、任务级指标)一脉相承。

扩散与地图辅助压缩:边缘作为生成条件

另一条相关路线是将边缘、深度或地图作为生成式压缩的条件。Morita 等人的 Edge-based Denoising Image Compression 在压缩框架中引入 Edge Estimation Network,从传输 latent 中估计边缘信息,并用边缘条件引导 diffusion denoising,以改善重建图像锐度 #Morita-EdgeDenoising-2024。Ye 等人的 MAGC 则在遥感极低码率压缩中使用 vector maps 作为语义和结构 guidance,缓解 diffusion 在低码率下的结构幻觉问题 #Ye-MAGC-2024

这些工作提醒我们:边缘图既可以是压缩对象,也可以是辅助条件。如果原始红外图仍有灰度信息,可以考虑"边缘图 + 低频残差"的分层压缩;如果只有边缘图,则可直接把边缘作为主码流,并用任务模型或结构先验约束重建。在视频时序场景下,边缘还可能作为扩散模型的时序条件引导语义一致的重建——这一方向在 《图像压缩专题(八):轮廓视频压缩》 Part 4 的 DiSCo 框架中得到了系统验证。

Part 6 · 方案建议
面向红外轮廓图的三层实验路线

第一层:建立强 baseline

第一步不应直接设计复杂模型,而应先回答:现成二值压缩标准在当前红外边缘数据上到底能做到什么程度?建议实现或调用 PNG、TIFF CCITT Group 4、JBIG1、JBIG2、packed bitmap + gzip/zstd、RLE + Huffman / arithmetic coding。评价 bpp、compression ratio、编码/解码时间、内存占用和对不同边缘密度的敏感性。

第二层:混合式轮廓 codec

最适合该任务的中期方案,是一个基于连通组件分析的 hybrid contour codec。流程可以是:红外图或已有边缘图输入,经过二值化、形态学去噪、细化、连通组件分析和轮廓追踪;随后对每个组件做 mode decision:长直轮廓用线段编码,平滑曲线用差分链码或 ECC,短小噪声点按重要性删除或点列表编码,复杂块回退到 JBIG-style generic coding;最后统一熵编码。

推荐码流结构

  • 图像尺寸与预处理参数:阈值、细化方式、是否去噪。
  • 组件数量与组件起点:支持随机访问和局部解码。
  • 组件类型:点、短线、长线、闭合轮廓、分叉结构、复杂块。
  • 编码模式:RLE、F8/differential chain code、3OT/ECC、line segment、generic bitmap fallback。
  • 可选残差层:用于近无损恢复被折线近似或噪声剪枝造成的误差。

第三层:结构保持近无损或任务驱动压缩

如果目标是研究创新,可以进一步做 topology-preserving near-lossless infrared edge map compression。核心是定义结构失真指标,设计基于端点、角点、分叉点、线段和链码的混合表示,并用连通性约束控制压缩误差。若存在下游红外检测/跟踪标签,则可以转向 task-aware compression:在码率约束下最小化边缘结构误差和任务损失,而不再执着于逐像素无损。

阶段目标方法预期产出
Baseline弄清现成方法上限G4 / JBIG / JBIG2 / RLE / PNG码率、速度、边缘密度敏感性曲线
Contour Codec针对轮廓结构提效连通组件 + 链码 + 线段 + fallback强工程算法与可解释码流
Structure-aware极低码率下保持拓扑关键点 / MRF / graph reconstruction近无损结构压缩论文方向
Task-aware服务检测/跟踪任务rate + structure loss + task lossCoding for Machines 红外压缩方向
最终建议:短期用 G4、JBIG1、JBIG2 和 RLE 建立强 baseline;中期做“空白跳过 + 线段 + 差分链码/ECC + generic fallback”的混合轮廓 codec;长期若要形成论文创新,应围绕拓扑保持近无损压缩或下游任务驱动红外边缘压缩展开。
延伸阅读:本文讨论的是静态图像中的轮廓压缩。当轮廓随时间演化形成视频序列时,MPEG-4 形状编码的运动补偿、Seg-VVC 的分割 mask 辅助帧间预测、DiSCo 的语义条件扩散等问题在 《图像压缩专题(八):轮廓视频压缩 — 从 MPEG-4 形状编码到语义条件扩散》 中系统讨论。
References · 参考来源
文献与标准索引

参考来源

  • ITU-T Recommendation T.6. Facsimile coding schemes and coding control functions for Group 4 facsimile apparatus. ITU-T
  • Library of Congress. TIFF, Group 4 Compression. Format Description
  • ITU-T Recommendation T.82 / ISO/IEC 11544. Progressive bi-level image compression. ITU-T
  • Kuhn, M. G. JBIG-KIT lossless image compression library. Project page
  • ITU-T Recommendation T.88 / ISO/IEC 14492. Lossy/lossless coding of bi-level images. ITU-T
  • zdenop. jbig2enc: JBIG2 Encoder. GitHub
  • Freeman, H. (1961). Techniques for the computer description of arbitrary planar curves. AFIPS Spring Joint Computer Conference. DOI: 10.1145/1460690.1460726.
  • Bribiesca, E. (1999/2000). A chain code for representing 3D curves. Pattern Recognition. DOI: 10.1016/S0031-3203(99)00056-X.
  • Gerogiannis, D., Nikou, C., & Kondi, D. (2015). Shape Encoding for Edge Map Image Compression. IEEE ICIP 2015. DOI: 10.1109/ICIP.2015.7350844. PDF
  • Reyes, M. G., Zhao, X., Neuhoff, D. L., & Pappas, T. N. (2008). Structure-preserving properties of bilevel image compression. HVEI / ICIP line of work. PDF
  • Yang et al. (2024). Chain coding-based segmentation map lossless compression. Journal of Visual Communication and Image Representation, 103, 104222. DOI: 10.1016/j.jvcir.2024.104222.
  • Yang, R., Liao, J., Choi, H., Racapé, F., & Bajić, I. V. (2026). Context Adaptive Extended Chain Coding for Semantic Map Compression. arXiv:2603.03073. arXiv HTML
  • Shindo, T. et al. (2024). Image Coding for Machines with Edge Information Learning Using Segment Anything. ICIP 2024 / arXiv:2403.04173. arXiv HTML
  • Morita, R. et al. (2024). Edge-based Denoising Image Compression. arXiv:2409.10978. arXiv HTML
  • Ye, Y., Wang, C., Sun, W., & Chen, Z. (2024). Map-Assisted Remote-Sensing Image Compression at Extremely Low Bitrates. arXiv:2409.01935. arXiv HTML
  • Sun, R. et al. (2022). Survey of Image Edge Detection. Frontiers in Signal Processing. DOI: 10.3389/frsip.2022.826967. Full text
  • lingyzhu0101. Awesome VCM: Paper List of Visual Data Compression for Machines. GitHub
  • 红外夜视观瞄系统的目标轮廓提取方法及 FPGA 实现. 激光与红外, 2024. PDF
  • Wei, L. et al. (2021). TIRNet: Object detection in thermal infrared images for autonomous driving. Applied Intelligence, 51(3), 1244–1261. DOI: 10.1007/s10489-020-01922-x.
  • Li, Z. et al. (2022). Application and improvement of Canny edge-detection algorithm for exterior wall hollowing detection using infrared thermal images. Energy and Buildings, 274, 112456. DOI: 10.1016/j.enbuild.2022.112456.
  • 应用特征轮廓四边形的热红外图与可见光图配准. 红外与激光工程, 2020. DOI: 10.3788/IRLA20200520. 链接
  • Shindo, T., Watanabe, T., Tatsumi, Y., & Watanabe, H. (2025). Image Coding for Object Recognition Tasks Based on Contour Feature Learning With Flexible Object Selection. IEEE Access, 13, 106606–106617. DOI: 10.1109/ACCESS.2025.3578292.
  • FLIR. FLIR ADAS Dataset v1.3. FLIR
  • Fischer, T., Brand, F., & Kaup, A. (2022). Video Coding for Machines with Feature-Based Rate-Distortion Optimization. IEEE MMSP 2022. arXiv:2203.05890. arXiv
  • Zhao, X., Neuhoff, D. L., & Pappas, T. N. (2021). Hierarchical Lossy Bilevel Image Compression Based on Cutset Sampling. IEEE Transactions on Image Processing, 30, 1837–1849. DOI: 10.1109/TIP.2021.3049243.
  • Ling, N., Liu, Y., & Liu, D. (2020). Lossless Compression of Occupancy Maps for Video-based Point Cloud Compression. IEEE VCIP 2020.