边缘图像压缩调研
这里讨论的“边缘图像压缩”不是普通 RGB 或灰度图像压缩的一个小分支,而是一类数据形态发生改变后的编码问题:红外图像中可用信息主要表现为目标轮廓、热边界、稀疏边缘或近二值结构,图像内容从“纹理—颜色—亮度场”退化或抽象为“背景—边缘—连通结构”。因此,压缩器真正需要保留的并不总是每个像素的精确灰度,而是轮廓的连通性、拓扑关系、几何形状和下游检测/跟踪任务可用性。
传统图像压缩的默认目标通常是在人眼视觉质量、PSNR/MS-SSIM、感知质量和码率之间折中;JPEG、JPEG2000、BPG、WebP、HEVC/VVC intra 以及现代 learned image compression 都默认图像存在丰富纹理、高频细节、颜色或灰度梯度。可是红外轮廓图经常更像一张稀疏的 1-bit 图:大部分区域为空背景,少量边缘像素组成线、曲线、闭合边界、断裂边界或噪声毛刺。对这类数据,继续使用面向自然图像纹理的 transform coding,可能并不是最优选择。
这个问题同时连接五条技术线索:第一,传真和文档时代形成的二值图像压缩标准,如 CCITT Group 4、JBIG1 和 JBIG2;第二,计算机图形学和形状分析中的链码与轮廓编码;第三,结构保持的二值图像有损压缩,例如基于 Markov Random Field 的规格传输与重建;第四,语义分割图、占用图和地图轮廓压缩;第五,面向机器视觉任务的 Coding for Machines。下面按这五条线索展开。
| 数据特征 | 普通自然图像 | 红外边缘 / 轮廓图 | 压缩启发 |
|---|---|---|---|
| 像素取值 | RGB / 灰度连续值 | 二值或少量离散值 | 可用二值图像标准与标签图压缩 |
| 空间分布 | 纹理、平滑区、高频细节混合 | 背景占绝大多数,边缘稀疏 | 空白区域跳过、RLE、四叉树 |
| 关键信息 | 视觉质量与感知真实性 | 连通性、轮廓形状、拓扑结构 | 链码、线段、结构保持指标 |
| 失真容忍 | 轻微纹理变化可接受 | 断裂、拓扑变化可能致命 | 不能只看 PSNR,应看 Chamfer / connectivity / task accuracy |
在讨论压缩算法之前,有必要先回答一个更根本的问题:红外轮廓图像究竟有哪些实际应用?理解这些场景,才能判断压缩的目标函数和约束条件。综合文献与工程实践,红外轮廓图的应用可归纳为以下几大类:
应用场景总览
| 领域 | 典型应用 | 轮廓图的角色 | 压缩需求 |
|---|---|---|---|
| 军事 / 国防 | 夜视观瞄目标提取、红外制导、热目标跟踪 | 从热辐射场中提取目标轮廓,供火控、识别与跟踪系统使用 | 嵌入式设备实时编码,带宽受限传输 |
| 自动驾驶 | 夜间行人 / 车辆检测、弱光感知、多模态融合 | 热红外轮廓作为 RGB 的补充模态,提供不受光照影响的目标边界 | 边缘设备低延迟压缩,保持检测精度 |
| 建筑检测 | 外墙空鼓检测、裂缝与脱落识别 | Canny / 热传导边缘检测提取热异常边界,量化缺陷区域 | 无人机回传时带宽优化 |
| 工业检测 | 电路板热故障定位、管道 / 设备热异常监测 | 热成像提取等温线与热梯度轮廓,标示故障边界 | 在线监测数据压缩存储 |
| 医疗诊断 | 红外人脸识别、肿瘤 / 炎症热成像 | 面部轮廓用于身份验证;病灶热边界用于辅助诊断 | 医疗影像存档与传输 |
| 安防监控 | 全天候人员检测、周界入侵识别 | 人体热轮廓不受光照影响,适合夜间与遮挡场景 | 多路视频流压缩传输 |
| 边缘 - 云协同 (ICM) | 边缘设备向云端 AI 发送图像做识别 | 只传输目标轮廓,丢弃无关纹理,大幅降低带宽 | SA-ICM / ST-ICM 等面向机器的轮廓压缩 |
| 多模态融合与配准 | 红外与可见光图像配准、融合成像 | 轮廓特征(尤其是角点、直线段)作为跨模态配准的锚点 | 双模态同步压缩,轮廓对齐保持 |
军事与国防:红外轮廓图的经典应用
红外夜视观瞄系统是红外轮廓图最早、最成熟的大规模应用场景之一。在红外夜视观瞄系统中,典型目标(人员、车辆、装备)在红外图像中通常表现为高亮度区域,系统需要在极低信噪比条件下快速提取目标轮廓,供火控计算机进行识别与跟踪 #IR-NightVision-2024。这类场景对轮廓压缩的核心约束是:轮廓连通性不能断裂,目标几何形状不能畸变,处理延迟必须在毫秒量级。
红外制导系统则进一步要求轮廓在极低码率下仍可被弹载计算机识别。导引头通常将目标简化为轮廓模板进行匹配,带宽和算力都极为有限,对轮廓编码的紧凑性和鲁棒性提出了极高要求。
自动驾驶:热红外轮廓作为互补模态
热红外相机可在完全黑暗、逆光、雾天和眩光条件下检测到行人和车辆的热轮廓,这是 LiDAR、毫米波雷达和可见光相机都无法独立实现的能力 #FLIR-Dataset。FLIR ADAS 数据集的统计表明,热红外在夜间场景的行人检测召回率显著高于可见光。TIRNet 等工作专门研究热红外图像中的目标检测,利用轮廓边界作为关键判别特征 #TIRNet-2021。
在 RGB-IR 多模态融合中,红外轮廓提供了不受光照影响的稳定目标边界,与可见光纹理互补。这对融合系统意味着:红外轮廓的压缩质量直接影响融合后检测器的性能——断裂的轮廓可能导致漏检,偏移的边界可能导致误检。
建筑与工业检测:热异常边界提取
红外热成像在建筑缺陷检测中的应用已有成熟案例。外墙空鼓检测使用 Canny 边缘检测算法对红外热图像进行处理,自动提取热异常区域的轮廓边界,实现缺陷的定量分析 #Canny-IR-Building-2022。近年来无人机搭载红外相机的巡检方案进一步推动了这一应用,系统需要在飞行过程中实时回传热图像或轮廓数据,带宽受限场景下的轮廓压缩成为工程瓶颈。
工业领域类似:电路板热故障定位、管道泄漏检测、设备过热预警等场景中,热成像提取的等温线与热梯度轮廓是标示故障边界的关键信息,在线监测数据的压缩存储需求持续增长。
边缘 - 云协同与 Coding for Machines
随着边缘设备与云端 AI 的协同越来越普遍,Image Coding for Machines (ICM) 成为一个快速增长的方向。其核心思想是:如果图像的最终消费者是机器识别模型而非人眼,那么压缩就应该只保留对任务有用的信息。轮廓图恰好是这种思想的最佳载体——它丢弃了人眼可见但机器不需要的纹理细节,只保留判别性最强的结构边界。
SA-ICM #SA-ICM-2024 与 ST-ICM #ST-ICM-2025 是这个方向的代表工作:前者利用 SAM 提取边缘先验监督压缩学习,后者进一步引入灵活目标选择机制,两者都专注于在极低码率下保持目标轮廓完整性,同时兼容多种下游识别模型,不在边缘设备增加额外计算负担。这类工作直接验证了一个核心假设:对机器来说,轮廓比纹理更重要,轮廓压缩比全图压缩更高效。
多模态融合与配准
红外与可见光图像配准是多模态融合的基础。由于两种模态的成像机制完全不同(反射 vs 热辐射),传统基于灰度互信息的配准方法往往失效。实践中常用的策略是基于轮廓特征(角点、直线段、闭合边界)进行结构级配准 #IR-VIS-Registration-2020。这类场景对轮廓压缩的要求是:压缩后的轮廓必须保持角点位置精度和线段连通性,否则配准误差会传递到后续所有融合步骤。
如果把红外边缘图直接看作 1-bit 图像,最自然的第一批 baseline 是传真、扫描文档和 bi-level image 领域的经典标准。它们并不理解“红外”或“目标轮廓”,但非常擅长处理黑白图、长背景游程和局部像素相关性。
Run-Length Encoding:最小但必要的基线
Run-Length Encoding, RLE 的基本思想是把连续相同像素表示为“值 + 长度”。对红外边缘图而言,背景通常占绝大多数,一条扫描线上往往出现很长的 0 游程和少数 1 边缘点,因此 RLE 是必须实现的最小 baseline。它的优点是编码解码极快、复杂度极低、适合嵌入式设备;缺点也同样明显:斜线、曲线和孤立噪声点会不断打断长游程,导致效率下降。
一个直观例子
扫描线 000000000111000000 可以写成 0×9, 1×3, 0×6。如果边缘非常稀疏,RLE 会很有效;如果噪声点很多,原本的长背景游程就会被切碎。
CCITT Group 3 / Group 4:传真图像的成熟无损路线
CCITT Group 3 与 Group 4 是传真和文档扫描时代形成的二值压缩标准。Group 3 对应 ITU-T T.4,Group 4 对应 ITU-T T.6。Group 3 的一维模式使用 Modified Huffman 对每条扫描线做游程编码,二维模式 Modified READ 参考上一扫描线编码当前行;Group 4 使用 Modified Modified READ,去除面向传真同步的部分机制,更适合存档型二值图像压缩 #ITU-T-T6。
美国国会图书馆的格式说明将 Group 4 描述为 bitonal / bi-level 图像的无损压缩方法,典型应用包括黑白扫描文档和 TIFF 图像,常见压缩比可达到约 15:1,具体取决于图像内容 #LOC-G4。对红外边缘图来说,Group 4 的优势来自两点:一是背景长游程,二是相邻扫描线之间的轮廓位置通常变化不大。它对水平或近水平边缘尤其友好;但对斜线、曲线和孤立噪声点不如轮廓级方法自然。
JBIG1:上下文模板与自适应算术编码
JBIG1 对应 ITU-T T.82 / ISO/IEC 11544,是面向 bi-level image data 的无损压缩标准。它的核心不只是扫描线 RLE,而是利用邻域上下文模板预测当前像素,再用自适应算术编码接近熵极限;同时支持 progressive coding,可以先传低分辨率版本,再逐步细化到完整图像 #ITU-T-T82。JBIG-KIT 的说明也指出,JBIG1 被广泛用于传真、打印机固件、文档管理和 imaging software #JBIG-KIT。
对红外边缘图而言,JBIG1 的意义在于它可以自动学习局部像素模式:曲线、角点、短断裂、孤立点都会通过上下文概率反映到码长中。它仍然是像素级方法,但比单纯 RLE 或 Group 4 更能处理不规则局部结构。渐进编码也很适合带宽受限链路:先传粗轮廓,必要时继续传细节。
JBIG2:最值得迁移思想的二值图像标准
JBIG2 对应 ITU-T T.88 / ISO/IEC 14492,标准标题即为 lossy/lossless coding of bi-level images。ITU-T T.88 明确说明 JBIG2 支持 lossy、lossless 和 lossy-to-lossless 的 bi-level image coding #ITU-T-T88。开源 jbig2enc 项目概括了 JBIG2 的几个关键能力:generic region encoding、symbol extraction、classification and text region coding、refinement coding 和 multi-page document compression #jbig2enc。
JBIG2 的关键思想是把二值图像分成 text、halftone 和 generic regions。对 text region,它会提取重复符号并建立字典,后续相似符号只需要编码字典索引与位置;如果要无损,则再通过 refinement coding 编码实例和模板之间的差异。这个思想虽然最初服务于文档和字符,但对红外边缘图非常有启发:建筑边缘、道路边界、机械轮廓、车辆轮廓中可能存在重复局部结构,它们可以像“符号”一样被提取、聚类、字典化,然后只编码变换参数与残差。
JBIG2 对红外轮廓图的迁移方式
可以把红外边缘 patch 或连通组件看成“非文本符号”:编码字典 ID、位置、方向、尺度,以及少量修正 mask。无法匹配的复杂区域则回退到 generic binary arithmetic coding。这会形成一种“JBIG2-style infrared edge dictionary codec”。
二值标准仍然把图像看成像素矩阵,而红外边缘图的真实信息更像曲线集合。因此,第二条更自然的路线是先从边缘图中提取连通轮廓,再编码轮廓的运动方向或几何参数。
Freeman Chain Code:给轮廓写“行走日记”
Freeman 在 1961 年提出 chain code,用于计算机描述任意平面曲线 #Freeman-1961。其基本做法是:找到轮廓起点,沿边界逐像素追踪,每一步只记录移动方向。4 邻域链码每步需要 2 bit,8 邻域链码每步需要 3 bit。相比直接存储每个边缘点的二维坐标,链码显著减少码长,并且显式保留轮廓连通性。
进一步地,差分链码不编码绝对方向,而编码当前方向相对前一方向的变化。真实轮廓通常方向连续,方向变化分布高度集中,因此差分链码再接 Huffman、Markov 或 arithmetic coding 可以继续降低码率。
| 表示方式 | 编码对象 | 优点 | 缺点 |
|---|---|---|---|
| 点坐标列表 | 所有边缘像素坐标 | 简单、无损 | 每点成本高,不利用连续性 |
| Freeman F4/F8 | 起点 + 方向序列 | 保留轮廓连通性,码率低 | 噪声和毛刺会拉长序列 |
| 差分链码 | 方向变化序列 | 利用方向平滑性,适合熵编码 | 断裂轮廓需要重新启动 |
| 线段编码 | 起点、终点、点数或误差 | 对长直线极高效 | 曲线需要折线逼近,有失真 |
Vertex Chain Code 与 Three-Orthogonal Chain Code
后续链码研究尝试进一步降低符号熵。Bribiesca 提出的 Vertex Chain Code 基于边界经过的网格顶点类型,而不是直接记录 8 个方向,因此可以用更少的符号描述曲线局部形态 #Bribiesca-1999。Three-Orthogonal Chain Code, 3OT 则经常出现在语义图压缩工作中,它通过相对转向描述边界,使符号分布更集中。
对红外轮廓图来说,VCC / 3OT 这类紧凑链码适合长而平滑的目标边界。它们比原始 Freeman F8 更接近“轮廓语言模型”:大多数时候轮廓继续向前,少数时候左转或右转。这个统计规律正适合 Markov model 或 adaptive arithmetic coding。
线段几何编码:从逐像素行走到参数化形状
如果一段轮廓本质上是直线,那么逐像素记录方向仍然冗余。Gerogiannis、Nikou 和 Kondi 在 ICIP 2015 的论文 Shape Encoding for Edge Map Image Compression 中直接研究 edge map image compression:他们将边缘图中的 shape manifold 建模为 line segments,每条线段编码 starting point、ending point 和 contributing points number,解码时在线段上均匀采样重建轮廓 #Gerogiannis-2015。
这篇论文对红外轮廓图高度相关。许多红外场景包含人造结构边缘,如建筑轮廓、道路边界、车辆外形和工业设备边缘,长直线或折线非常常见。对这些结构,线段编码可能远优于逐像素链码;对曲线部分,则可以用折线近似,并通过最大偏移误差或 Chamfer distance 控制失真。
红外边缘图的有损压缩不能只看像素错误率。一个像素级误差很小的重建,如果把闭合轮廓压断,可能会直接破坏目标检测;反过来,某些边缘整体平移一两个像素,若连通性和形状仍保持,下游任务可能几乎不受影响。因此,这类数据需要结构保持视角。
Reyes & Pappas:传输结构规格,而不是传输所有像素
Reyes、Zhao、Neuhoff 和 Pappas 关于 bilevel image lossy compression 的工作提供了重要参考。他们讨论一种基于 Markov Random Fields 的二值图像有损压缩方法:编码端将图像分块,只传输块类别、run endpoint、decision bit 等 specification;解码端在满足这些结构约束的条件下,用 MRF 模型重建最平滑、最合理的二值图像 #Reyes-Pappas-2008。
这一路线的关键不是“少传一点像素”,而是改变编码对象:传输的是结构约束,未指定部分由解码器根据局部相关性补全。对红外边缘图而言,可以进一步把 specification 设计为端点、交叉点、角点、进入/离开块的位置、局部方向和连通关系。这样即使码率极低,也尽量保留目标轮廓的拓扑骨架。
具体而言,MRF 方法将二值图像分为均匀块(全黑/全白)和边界块(含黑白边界)。均匀块只需 1 bit 标记类别;边界块传输的 specification 包括:run endpoints(每行黑白交替的位置)、block class(边界类型:水平/垂直/对角/L 形等)和 decision bit(具体拓扑分支)。解码端的 MRF 模型以这些 specification 为约束,在所有满足约束的重建中选取最大后验概率 (MAP)的解——即最平滑、最符合局部空间相关性的二值图像。这一过程相当于"有约束的图像修复":编码端只告诉解码器"这里有一条从左上到右下的边界",解码器自行补全具体像素路径。
层级 Cutset 采样:从粗到细的递进编码
Zhao、Neuhoff 和 Pappas 在 TIP 2021 进一步提出层级 cutset 采样方法 #Zhao-Cutset-2021。其核心思想是沿可变步长的矩形网格对二值图像进行采样——网格交叉点的像素值被传输,其余像素由解码器用 MRF 模型推断。关键是步长自适应:边缘密集区域用细网格(小步长),平坦区域用粗网格(大步长),形成从粗到细的层级结构。
与 Reyes 等人的块级 specification 不同,cutset 采样是点级的——直接选择关键像素传输,而非传输抽象的结构描述。这种方法更适合轮廓不规则、难以用有限 specification 类别描述的红外边缘图。例如,红外小目标的轮廓可能只有 3-5 个像素宽,块级 specification 可能将整个目标归入一个块而丢失形状信息;而 cutset 采样可以在目标区域加密采样点,保留局部几何。
骨架与图方法:从形态学到拓扑编码
除了 MRF 路线,形态学骨架 (morphological skeleton) 提供了另一种结构保持思路。骨架表示将二值图像分解为一系列以骨架点为中心的极大圆盘的叠加,只需编码骨架点坐标和半径。对于红外轮廓图,骨架天然对应轮廓的中轴线 (medial axis),可以高效表示细长目标。但骨架表示的弱点是对噪声敏感——少量噪声像素可能产生大量短分支骨架,导致码率膨胀。
图方法 (graph-based coding)将轮廓转化为图结构:节点对应端点、交叉点和角点,边对应轮廓段。编码时只传输图的拓扑(邻接矩阵)和节点坐标,边路径由解码器根据端点和方向信息重建。这种方法的优势是显式保留拓扑——连通组件数、欧拉数 (Euler number)、分支结构在编码过程中不会被破坏。对于红外场景中的多目标轮廓,图方法可以自然地将每个目标表示为一个连通子图,便于后续任务驱动的选择性编码。
| 结构保持方法 | 编码对象 | 解码端重建 | 拓扑保证 | 红外适用性 |
|---|---|---|---|---|
| MRF Specification | 块类别 + run endpoints + decision bit | MRF MAP 推断 | 间接(通过 specification 约束) | 适合中等密度轮廓 |
| 层级 Cutset 采样 | 网格交叉点像素值 | MRF 插值 | 间接(依赖采样密度) | 适合不规则细轮廓 |
| 形态学骨架 | 骨架点坐标 + 半径 | 圆盘叠加重建 | 弱(噪声敏感) | 适合细长目标 |
| 图方法 | 节点坐标 + 邻接矩阵 | 边路径推断 | 显式保留 | 适合多目标场景 |
结构保持压缩的核心准则
对边缘图而言,错误的严重性不只取决于错了多少像素,而取决于这些错误是否改变了轮廓的结构功能:是否断开连通组件、是否删除小目标、是否破坏闭合边界、是否改变关键角点和分叉点。
评价指标:从 PSNR 转向边缘结构距离
因此,红外边缘图压缩的评价指标应包括像素、几何、拓扑和任务四个层次。像素级可以用 F1 / IoU;几何层可以用 Chamfer Distance 和 Hausdorff Distance;拓扑层应统计连通组件数量变化、endpoint error、junction error、closed contour preservation;任务层则直接看目标检测 mAP、跟踪 MOTA/IDF1 或分割 mIoU。
| 指标层次 | 代表指标 | 回答的问题 |
|---|---|---|
| 像素级 | Precision / Recall / F1 / IoU | 重建边缘点和原始边缘点有多少重合? |
| 几何级 | Chamfer / Hausdorff distance | 轮廓整体偏移了多远?是否有局部极端错误? |
| 拓扑级 | Component count / endpoint / junction error | 连通性、闭合性、分叉结构是否被破坏? |
| 任务级 | mAP / MOTA / IDF1 / mIoU | 压缩后还能不能服务下游红外视觉任务? |
近年来,语义分割图、占用图和地图轮廓压缩开始成为独立问题。它们与红外边缘图高度相似:像素取值有限,区域内部常常恒定,重要信息集中在边界。红外边缘图可以看成最简单的二值 semantic map:0 是 background,1 是 edge。若区分弱边缘、强边缘、目标边界和噪声,还可以扩展成多值标签图。
从二值到多值:标签图的压缩挑战
语义分割图的像素值是类别标签而非灰度——例如 COCO 的 80 类、Cityscapes 的 30 类、ADE20K 的 150 类。这与红外边缘图的关键区别在于:多值标签图中的边界不只是“有/无”,还携带“从哪个类别过渡到哪个类别”的信息。一条轮廓段可能同时是“行人→道路”和“车辆→道路”的边界,编码时需要区分。
对红外边缘图而言,可以自然地将二值边缘扩展为多值标签:0 = 背景、1 = 弱边缘(梯度幅值 30-60)、2 = 强边缘(梯度幅值 60-100)、3 = 目标边界(由检测器确认)、4 = 噪声伪边缘。这种多值标签图比纯二值图携带更多语义信息,也为压缩提供了更大的空间——例如,弱边缘和噪声可以用更粗的量化或直接丢弃,而强边缘和目标边界需要精确保留。
多值标签图的压缩比二值图更复杂,因为同一块内可能有多个不同标签的边界重叠。CC-SMC 和 ECC 的四叉树 + 链码框架可以自然扩展到多值场景:均匀块编码标签值,边界块用链码编码每段边界的两侧标签。但码率会随标签种类数增长——若一幅图有 \(K\) 种标签,最坏情况下每个边界点需 \(\lceil\log_2 K\rceil\) bit 额外编码标签过渡信息。
占用图压缩:V-PCC 的静态视角
占用图 (occupancy map)是 3D 点云压缩中的核心数据结构——V-PCC (Video-based Point Cloud Compression) 将 3D 点云投影到 2D 平面,生成 occupancy map 标记哪些像素有几何信息。这与红外边缘图在数据结构上几乎相同:都是稀疏二值图,前景像素占比通常 < 15%,大片背景为 0。
在静态视角下,V-PCC 的占用图压缩与 Part 1 讨论的 JBIG2 高度重合。但 V-PCC 场景提供了额外结构信息:占用图的边界对应 3D 表面的轮廓投影,通常形成连续的闭合或半闭合曲线。V-PCC 标准使用基于块的后处理——先用 HEVC 编码占用图,再对边界块做形态学平滑。VCIP 2020 的工作则将占用图边界提取为链码,用运动补偿链码利用帧间冗余 #VPCC-Occupancy-2020。
对红外边缘图而言,V-PCC 占用图的经验说明:如果边缘图有对应的深度/3D 信息,可以将 2D 边缘与 3D 表面轮廓联合编码。这在红外-可见光融合、红外 3D 重建等场景中有直接应用价值。即使没有 3D 信息,占用图的稀疏二值编码经验(如 run-length + 链码混合)也完全适用于红外边缘图。
CC-SMC:四叉树分块 + 链码
Yang 等人在 2024 年提出 Chain coding-based segmentation map lossless compression, CC-SMC,用于语义分割图无损压缩 #Yang-CCSMC-2024。其基本思想是:先对语义图做 quadtree partitioning,均匀块直接编码标签,含边界的块用链码编码轮廓,再对链码序列做熵编码。这个框架适合同时处理大片均匀区域和复杂边界区域。
迁移到红外边缘图时,四叉树可以快速跳过大片空白背景;边缘密集块则交给链码。它比全图链码更稳健,因为不要求所有边缘先形成干净闭合轮廓;但四叉树分块也可能截断长轮廓,降低上下文建模效率。
ECC:扩展链码与共享边界跳过编码
Yang、Liao、Choi、Racapé 和 Bajić 在 2026 年的 Context Adaptive Extended Chain Coding for Semantic Map Compression 中进一步提出 Extended Chain Code, ECC #Yang-ECC-2026。ECC 扩展了传统 Freeman F8 的符号集,允许用更长距离的轮廓跳转表示平滑或长直边界;同时保留 3OT 作为 fallback,并使用 Markov model-based entropy coding 对符号序列建模。
该工作还提出 skip-coding 机制:当相邻语义区域共享边界时,只编码一次轮廓,后续区域通过 run-length signaling 跳过重复部分。论文摘要报告,相比 state-of-the-art benchmark,平均码率降低约 18%;相对现代通用无损 codec,编码器运行时间最高减少 98%,解码器最高减少 50% #Yang-ECC-2026。
对红外边缘图而言,ECC 的价值在于它更接近“轮廓专用语言”:长直边缘不必逐像素行走,方向上下文可以被 Markov 模型利用,多层等温轮廓或相邻结构也可能受益于共享边界跳过编码。即使最终不直接复现这篇方法,它也是设计现代红外轮廓 codec 的重要参照。
graph TD
A[红外边缘图 / 二值轮廓图] --> B[空白区域检测]
B --> C[四叉树或连通组件划分]
C --> D{局部结构类型}
D -->|大片背景| E[RLE / skip block]
D -->|长直边缘| F[线段几何编码]
D -->|平滑曲线| G[差分链码 / ECC]
D -->|复杂噪声块| H[JBIG-style generic coding]
E --> I[统一熵编码]
F --> I
G --> I
H --> I
I --> J[压缩码流]
如果红外边缘图最终用于目标检测、跟踪、识别或态势感知,那么压缩不一定要服务人眼,而应服务机器视觉模型。这就是 Image / Video / Feature Coding for Machines (ICM/VCM/FCM) 的基本视角:压缩后的数据只要能让机器完成任务,就不必保留人类视觉意义上的完整图像。JPEG 和 MPEG 已分别启动 ICM 和 VCM 标准化,目标是将"机器可识别"作为与"人眼可看"并列的压缩优化目标。
ICM 三种范式:ROI、Task-Loss 与 Region-Learning
理解 SA-ICM 之前,需要先了解 ICM 领域的三种主要范式 #Shindo-SAICM-2024:
| 范式 | 核心思想 | 损失函数 | 局限 |
|---|---|---|---|
| ROI-based | 用 ROI-map 给目标区域分配更多比特 | \(\mathcal{L}_h = \mathcal{R}(y) + \lambda \cdot \text{mse}(x, \hat{x})\)(全图 MSE + ROI 加权) | 编码端需生成 ROI-map,负担重;对需要背景的任务无效 |
| Task-Loss (TL) | 将识别模型的输出作为损失项加入训练 | \(\mathcal{L}_{tl} = \mathcal{R}(y) + \lambda_1 \cdot \text{mse}(x, \hat{x}) + \lambda_2 \cdot \mathcal{M}(\hat{x})\) | 每个任务模型需对应一个 LIC 模型,泛化性差 |
| Region-Learning (RL) | 训练 LIC 只编码/解码物体区域,丢弃背景 | \(\mathcal{L}_{rl} = \mathcal{R}(y) + \lambda \cdot \text{mse}(x \odot m_x, \hat{x} \odot m_x)\) | 背景信息丢失,不适用于语义/全景分割 |
其中 \(\mathcal{R}(y)\) 是码率估计,\(\text{mse}\) 是均方误差,\(m_x\) 是二值 mask,\(\mathcal{M}(\hat{x})\) 是任务损失(如 YOLO 检测损失),\(\odot\) 是逐元素乘积。三种范式代表了"在哪里分配比特"和"用什么信号优化"的不同回答。
SA-ICM:用 SAM 边缘 mask 驱动 Region-Learning
Shindo 等人在 ICIP 2024 提出的 SA-ICM 属于 RL 范式的变体,但做了关键改进 #Shindo-SAICM-2024。传统 RL 方法使用 COCO 数据集的手工 mask(图 b),只保留物体区域内部像素;SA-ICM 改用 Segment Anything Model (SAM) 生成分割 mask,再经 Canny 边缘检测转化为边缘 mask。
SA-ICM 的训练流程:(1) 输入图像 \(x\) → (2) SAM 以置信度 \(\alpha\) 生成分割图 → (3) Canny 检测器将分割边界转为二值边缘 mask \(\text{sam}_x(\alpha)\) → (4) 用边缘 mask 训练 LIC 模型。关键设计:mask 仅在训练时使用,推理时不需 SAM,编码端无需额外计算。损失函数为:
置信度 \(\alpha\) 控制边缘 mask 的密度:\(\alpha = 0.98\) 只保留高置信度物体的主要边界;\(\alpha = 0.48\) 则生成更多、更细的边缘。较小的 \(\alpha\) 意味着更多物体被分割、更多边缘被检测,重建图像中保留的结构信息更丰富,但码率也更高。LIC 骨架使用 LIC-TCM(Mixed Transformer-CNN),码率控制使用 CompressAI 库,训练数据为 COCO 2017(118,287 张)。
Rate-Task-Distortion:面向机器的率失真优化
传统压缩的率失真优化 (RDO) 最小化 \(J = D + \lambda R\),其中 \(D\) 是像素级失真 (MSE/SSIM)。但在 Coding for Machines 场景下,像素失真与任务性能并不单调相关——一个 PSNR 更低的重建可能反而有更高的检测 mAP。因此需要 Rate-Task-Distortion (R-T-D) 优化框架。
Fischer 等人提出的 Feature-Based RDO (FRDO) #FRDO-2022 用特征空间失真替代像素失真:将重建图像输入预训练的 ResNet50,在中间特征图上计算 \(D_{\text{feat}}\),替代传统 MSE。这使得 RDO 直接优化"机器能看到什么"而非"人眼能看到什么"。类似地,Just Recognizable Distortion (JRD) 概念将 JND(Just Noticeable Distortion)从人眼感知阈值扩展到机器识别阈值——在 JRD 以下的失真不影响机器任务性能,可以大胆丢弃。
| 优化框架 | 失真度量 | 适用场景 |
|---|---|---|
| 传统 R-D | MSE / SSIM / MS-SSIM | 面向人眼的图像/视频压缩 |
| Feature R-D (FRDO) | ResNet50 特征距离 | 标准兼容(VTM 插件),检测/分割任务 |
| R-D-Task (TL-based) | MSE + 任务损失 \(\mathcal{M}(\hat{x})\) | 端到端 LIC,特定任务专用 |
| R-JRD | 机器识别阈值 | 极低码率,任务保真优先 |
对红外边缘图压缩而言,R-T-D 框架意味着:不必追求边缘像素的精确重建,而应保证检测器/跟踪器在压缩后的边缘图上仍能达到可接受的 mAP/MOTA。这是一个更合理的优化目标,也与 Part 3 讨论的结构保持评价体系(拓扑级、任务级指标)一脉相承。
扩散与地图辅助压缩:边缘作为生成条件
另一条相关路线是将边缘、深度或地图作为生成式压缩的条件。Morita 等人的 Edge-based Denoising Image Compression 在压缩框架中引入 Edge Estimation Network,从传输 latent 中估计边缘信息,并用边缘条件引导 diffusion denoising,以改善重建图像锐度 #Morita-EdgeDenoising-2024。Ye 等人的 MAGC 则在遥感极低码率压缩中使用 vector maps 作为语义和结构 guidance,缓解 diffusion 在低码率下的结构幻觉问题 #Ye-MAGC-2024。
这些工作提醒我们:边缘图既可以是压缩对象,也可以是辅助条件。如果原始红外图仍有灰度信息,可以考虑"边缘图 + 低频残差"的分层压缩;如果只有边缘图,则可直接把边缘作为主码流,并用任务模型或结构先验约束重建。在视频时序场景下,边缘还可能作为扩散模型的时序条件引导语义一致的重建——这一方向在 《图像压缩专题(八):轮廓视频压缩》 Part 4 的 DiSCo 框架中得到了系统验证。
第一层:建立强 baseline
第一步不应直接设计复杂模型,而应先回答:现成二值压缩标准在当前红外边缘数据上到底能做到什么程度?建议实现或调用 PNG、TIFF CCITT Group 4、JBIG1、JBIG2、packed bitmap + gzip/zstd、RLE + Huffman / arithmetic coding。评价 bpp、compression ratio、编码/解码时间、内存占用和对不同边缘密度的敏感性。
第二层:混合式轮廓 codec
最适合该任务的中期方案,是一个基于连通组件分析的 hybrid contour codec。流程可以是:红外图或已有边缘图输入,经过二值化、形态学去噪、细化、连通组件分析和轮廓追踪;随后对每个组件做 mode decision:长直轮廓用线段编码,平滑曲线用差分链码或 ECC,短小噪声点按重要性删除或点列表编码,复杂块回退到 JBIG-style generic coding;最后统一熵编码。
推荐码流结构
- 图像尺寸与预处理参数:阈值、细化方式、是否去噪。
- 组件数量与组件起点:支持随机访问和局部解码。
- 组件类型:点、短线、长线、闭合轮廓、分叉结构、复杂块。
- 编码模式:RLE、F8/differential chain code、3OT/ECC、line segment、generic bitmap fallback。
- 可选残差层:用于近无损恢复被折线近似或噪声剪枝造成的误差。
第三层:结构保持近无损或任务驱动压缩
如果目标是研究创新,可以进一步做 topology-preserving near-lossless infrared edge map compression。核心是定义结构失真指标,设计基于端点、角点、分叉点、线段和链码的混合表示,并用连通性约束控制压缩误差。若存在下游红外检测/跟踪标签,则可以转向 task-aware compression:在码率约束下最小化边缘结构误差和任务损失,而不再执着于逐像素无损。
| 阶段 | 目标 | 方法 | 预期产出 |
|---|---|---|---|
| Baseline | 弄清现成方法上限 | G4 / JBIG / JBIG2 / RLE / PNG | 码率、速度、边缘密度敏感性曲线 |
| Contour Codec | 针对轮廓结构提效 | 连通组件 + 链码 + 线段 + fallback | 强工程算法与可解释码流 |
| Structure-aware | 极低码率下保持拓扑 | 关键点 / MRF / graph reconstruction | 近无损结构压缩论文方向 |
| Task-aware | 服务检测/跟踪任务 | rate + structure loss + task loss | Coding for Machines 红外压缩方向 |
参考来源
- ITU-T Recommendation T.6. Facsimile coding schemes and coding control functions for Group 4 facsimile apparatus. ITU-T
- Library of Congress. TIFF, Group 4 Compression. Format Description
- ITU-T Recommendation T.82 / ISO/IEC 11544. Progressive bi-level image compression. ITU-T
- Kuhn, M. G. JBIG-KIT lossless image compression library. Project page
- ITU-T Recommendation T.88 / ISO/IEC 14492. Lossy/lossless coding of bi-level images. ITU-T
- zdenop. jbig2enc: JBIG2 Encoder. GitHub
- Freeman, H. (1961). Techniques for the computer description of arbitrary planar curves. AFIPS Spring Joint Computer Conference. DOI: 10.1145/1460690.1460726.
- Bribiesca, E. (1999/2000). A chain code for representing 3D curves. Pattern Recognition. DOI: 10.1016/S0031-3203(99)00056-X.
- Gerogiannis, D., Nikou, C., & Kondi, D. (2015). Shape Encoding for Edge Map Image Compression. IEEE ICIP 2015. DOI: 10.1109/ICIP.2015.7350844. PDF
- Reyes, M. G., Zhao, X., Neuhoff, D. L., & Pappas, T. N. (2008). Structure-preserving properties of bilevel image compression. HVEI / ICIP line of work. PDF
- Yang et al. (2024). Chain coding-based segmentation map lossless compression. Journal of Visual Communication and Image Representation, 103, 104222. DOI: 10.1016/j.jvcir.2024.104222.
- Yang, R., Liao, J., Choi, H., Racapé, F., & Bajić, I. V. (2026). Context Adaptive Extended Chain Coding for Semantic Map Compression. arXiv:2603.03073. arXiv HTML
- Shindo, T. et al. (2024). Image Coding for Machines with Edge Information Learning Using Segment Anything. ICIP 2024 / arXiv:2403.04173. arXiv HTML
- Morita, R. et al. (2024). Edge-based Denoising Image Compression. arXiv:2409.10978. arXiv HTML
- Ye, Y., Wang, C., Sun, W., & Chen, Z. (2024). Map-Assisted Remote-Sensing Image Compression at Extremely Low Bitrates. arXiv:2409.01935. arXiv HTML
- Sun, R. et al. (2022). Survey of Image Edge Detection. Frontiers in Signal Processing. DOI: 10.3389/frsip.2022.826967. Full text
- lingyzhu0101. Awesome VCM: Paper List of Visual Data Compression for Machines. GitHub
- 红外夜视观瞄系统的目标轮廓提取方法及 FPGA 实现. 激光与红外, 2024. PDF
- Wei, L. et al. (2021). TIRNet: Object detection in thermal infrared images for autonomous driving. Applied Intelligence, 51(3), 1244–1261. DOI: 10.1007/s10489-020-01922-x.
- Li, Z. et al. (2022). Application and improvement of Canny edge-detection algorithm for exterior wall hollowing detection using infrared thermal images. Energy and Buildings, 274, 112456. DOI: 10.1016/j.enbuild.2022.112456.
- 应用特征轮廓四边形的热红外图与可见光图配准. 红外与激光工程, 2020. DOI: 10.3788/IRLA20200520. 链接
- Shindo, T., Watanabe, T., Tatsumi, Y., & Watanabe, H. (2025). Image Coding for Object Recognition Tasks Based on Contour Feature Learning With Flexible Object Selection. IEEE Access, 13, 106606–106617. DOI: 10.1109/ACCESS.2025.3578292.
- FLIR. FLIR ADAS Dataset v1.3. FLIR
- Fischer, T., Brand, F., & Kaup, A. (2022). Video Coding for Machines with Feature-Based Rate-Distortion Optimization. IEEE MMSP 2022. arXiv:2203.05890. arXiv
- Zhao, X., Neuhoff, D. L., & Pappas, T. N. (2021). Hierarchical Lossy Bilevel Image Compression Based on Cutset Sampling. IEEE Transactions on Image Processing, 30, 1837–1849. DOI: 10.1109/TIP.2021.3049243.
- Ling, N., Liu, Y., & Liu, D. (2020). Lossless Compression of Occupancy Maps for Video-based Point Cloud Compression. IEEE VCIP 2020.