ESC
输入关键词搜索文章
目录

红外压缩数据集全景

公开热红外图像与视频压缩数据集完全指南
25+数据集
6arXiv深读
4应用领域
3用途分类
Part 0 · 引言
为什么数据集是红外压缩研究的基础

红外图像压缩研究区别于通用图像压缩的一个核心特点是:数据获取难度大、公开数据集稀缺、位深分布极不均衡。与可见光图像压缩领域拥有 Kodak、CLIC、DAVIS 等大规模基准不同,热红外(Thermal Infrared)数据集在规模、位深、标注类型上呈现明显的「长尾」特征——绝大多数公开数据集只有 8-bit 灰度图像,而面向 14-bit 或 16-bit 原始辐射数据的高保真压缩研究几乎无数据可用。

本文是「红外轮廓图像压缩系列」的第六篇文章,旨在为压缩研究者提供一份可操作的数据集导航。我们不追求罗列所有数据集,而是聚焦三类核心用途:

用途 A — 综述目录: 快速检索已知数据集的基本规格(分辨率、位深、规模、标注)

用途 B — 压缩算法评测: 判断哪些数据集适合做 PSNR/SSIM/BD-Rate 等客观指标评测

用途 C — 训练学习型压缩: 评估哪些数据集的规模和许可允许用于训练端到端压缩模型

在展开数据集之前,需要先厘清一个关键概念——「原始热红外」与「提取轮廓」的关系。本文聚焦的是原始热红外图像/视频数据(8-bit / 14-bit / 16-bit 辐射响应),而非已经过分割/检测提取的二值轮廓或前景掩码。现有的公开红外数据集几乎全部只提供边界框标注,二值轮廓/前景掩码需要研究者在原始热红外数据上后续应用分割或检测模型生成。这一关系直接决定了:压缩研究者如果想评估「压缩对轮廓提取任务的影响」,需要额外完成「原始红外 → 轮廓」的转换步骤。

本文覆盖四大应用领域:监控/行人检测跟踪、通用红外压缩基准、军事/目标识别(ATR)、动物/野生与特殊场景。同时涵盖红外静态图像数据集与视频时序数据集两大类。

Part A · 综述目录
公开热红外数据集完全清单

下表汇总了本文调研覆盖的 25+ 个公开热红外数据集,按发布年份排序。每个数据集列出:名称、发布机构、年份、模态(图像/视频/图像对)、分辨率、位深、序列数/帧数、标注类型、是否与可见光配准、许可协议、下载来源。

数据集 机构 年份 模态 分辨率 位深 规模 标注 配准 许可
OTCBVS 合集 Oklahoma State Univ. 2004–13 图像/视频 多种 8-bit 15 个子集 多样 部分 免费科研
OSU Color-Thermal Ohio State Univ. 2004 视频 320×240 8-bit 17,089 帧 / 6 序列 跟踪框 ✅ Homography 免费科研
BU-TIV / TIV Boston Univ. 2014 视频 最高 1024×1024 16-bit PNG 63,782 帧 / 16 序列 跟踪/计数 免费科研
KAIST Multispectral KAIST 2015 图像对 640×480 8-bit set00–set11 检测框 ✅ 配准 免费科研
GTOT DUT 2016 视频 多种 8-bit 50 序列 / 7,800 帧 跟踪框 免费科研
RGBT234 DUT 2019 视频 多种 8-bit 234 序列 / >104K 帧 跟踪框 免费科研
LLVIP BUPT 2021 图像对 1280×1024 8-bit 15,488 对 检测框 ✅ 严格对齐 免费科研
LasHeR DUT / IEEE TIP 2021 视频 多种 8-bit 1,224 对 / >73万帧 跟踪框 ✅ 空间配准 免费科研
FLIR ADAS v2 Teledyne FLIR 2020 图像/视频 640×512 14-bit TIFF / 8-bit JPEG 26,442 帧 / 52万框 检测 (MS-COCO) 时间同步 免费(注册)
VTUAV DUT / CVPR 2022 2022 视频 RGB: 1920×1080
Thermal: 640×480
8-bit 500 序列 / 166万帧 跟踪+分割 ✅ 配准 免费科研
RGBT-Tiny NUDT / TPAMI 2025 2024 视频 512×640 → 640×512 LWIR 8–14μm 115 序列 / 93K 帧 / 120万标注 小目标检测 ✅ 配准 免费科研
LR/MR/HR Thermal Rivadeneira (PBVS) 2020–23 图像 160×120 / 320×240 / 640×512 8-bit 1,021 张 三相机同场景 免费科研
Cacophony Project LILA / NZ 2020s 视频 多种 8-bit 121,190 段视频 CC0 / CC-BY
BIRDSAI LILA / Conservation 2020s 视频 多种 8-bit 48 序列 / 61,994 帧 检测框 (MOT) CDLA
NUDT-SIRST NUDT / 国防科大 2021 图像 多种 8-bit 数百张(SIRST4 组成部分) 像素掩码/点标注 免费科研
NUAA-SIRST NUAA / 南航 2021 图像 多种 8-bit 数百张(经典基准) 像素掩码 免费科研
IRSTD-1K / SIRST4 ISNet 论文 2022 图像 512×512(SIRST4) 8-bit SIRST4: 3,352 张 像素掩码 免费科研
SIRST-UAVB SPIRE 论文 2026 图像 640×640 8-bit 3,000 张(2,400/600) 点标注 免费科研

上表中的关键发现:

位深分布极不均衡: 25+ 个数据集中,只有 BU-TIV 提供 16-bit PNG 原始辐射数据只有 FLIR ADAS 提供 14-bit TIFF(无 AGC)+ 16-bit pre-AGC 版本。其余全部是 8-bit 灰度或 8-bit JPEG。这一分布直接决定了:14-bit/16-bit 高保真红外压缩研究几乎没有公开基准可用
Part B · 压缩评测
哪些数据集适合做压缩算法评测

压缩算法评测依赖客观指标(PSNR、MS-SSIM)和率失真曲线(Rate-Distortion)。不同位深的数据集适用于不同的评测场景。

已验证的压缩评测协议

2025 年的论文 #CCEM-2025 首次在 LLVIP 和 KAIST 数据集上系统报告了 RGB-IR 联合压缩的 BD-Rate 指标。实验表明,CCEM 在 LLVIP 上实现了相对 CVPR 2022 SOTA codec 的 23.1% 比特率节省。这意味着 LLVIP 和 KAIST 是目前唯一有公开 BD-Rate 协议验证的配准 RGB-IR 压缩基准。

CCEM 在 LLVIP 上的率失真曲线
CCEM 在 LLVIP 数据集上的 PSNR 率失真曲线对比。来源:#CCEM-2025, Fig. 7
数据集 位深 压缩评测适用性 验证来源
LLVIP 8-bit ✅ PSNR / MS-SSIM / BD-Rate
(已验证协议)
#CCEM-2025
KAIST 8-bit ✅ PSNR / MS-SSIM / BD-Rate
(已验证协议)
#CCEM-2025
BU-TIV 16-bit PNG ✅ 唯一适合 16-bit 辐射率失真评测
raw vs NUC 双版本可研究预处理影响
#BU-TIV-2014
FLIR ADAS 14-bit TIFF / 16-bit pre-AGC ✅ 适合 14-bit 辐射压缩评测
同一场景可比对不同位深压缩
#FLIR-ADAS
OTCBVS / OSU 8-bit ✅ 通用 8-bit 率失真评测
❌ 不适合 14/16-bit 评测
#OTCBVS
LR/MR/HR Thermal 8-bit ✅ 多分辨率稳健性评测
适合跨分辨率压缩对比
#LR-MR-HR-2020

关键限制:OTCBVS 全系为 8-bit

OTCBVS 是红外/多光谱领域最权威的公开目录型合集,汇集了 15 个热红外/多光谱基准数据集。但是,其所有热红外数据统一以 8-bit 灰度(bitmap 或 JPEG)存储,不提供 14-bit 或 16-bit 辐射数据。因此:

重要限制

OTCBVS 全系数据集(包括 OSU Color-Thermal、OSU Thermal Pedestrian 等)不适合 14-bit 或 16-bit 辐射失真评测。如果你的研究目标是高保真 14/16-bit 红外压缩,只能使用 BU-TIV(16-bit PNG)或 FLIR ADAS(14-bit TIFF)。

BD-Rate 指标科普

Bjøntegaard Delta Rate (BD-Rate) 是视频/图像压缩领域衡量率失真性能的标准指标。负的 BD-Rate 表示比特率节省——例如 BD-Rate = -23.1% 意味着在同等质量下比参考编解码器节省 23.1% 的码率。2024 年的 #BD-Tutorial-2024 是该指标的权威教程,详细解释了 BD-Rate 的计算方法、历史演进和使用注意事项。

Part C · 训练用途
哪些数据集可用于训练端到端压缩模型

训练端到端(端到端学习型压缩模型需要大规模数据明确的许可协议两个条件。以下按规模降序排列适合训练的热红外数据集。

大规模视频数据集(>10万帧)

数据集 帧数 许可 训练适用性
Cacophony Project 121,190 段视频 CC0 / CC-BY ⭐⭐⭐ 最佳:最大规模 + CC 许可,可直接用于训练
VTUAV ~170万帧对 免费科研 ⭐⭐⭐ 高质量配准,适合 RGBT 联合压缩训练
LasHeR >73万帧对 免费科研 ⭐⭐⭐ 大规模视频,适合时序压缩模型
RGBT-Tiny 93K 帧 免费科研 ⭐⭐ 小目标专用,适合特定场景压缩

静态图像数据集(配准 RGB-IR)

数据集 图像对数 许可 训练适用性
LLVIP 15,488 对 免费科研 ⭐⭐⭐ 最高分辨率(1280×1024)+ 严格配准
已验证可用于两阶段各 150 epoch 训练 #CCEM-2025
FLIR ADAS 9,711 热 + 9,233 RGB 免费(注册) ⭐⭐ 14-bit 版本可用于高位深压缩训练
KAIST set00–set11 免费科研 ⭐⭐ 日夜多样性,适合跨光照压缩训练
LLVIP 数据集任务展示
LLVIP 数据集的应用任务场景。来源:#LLVIP-2021, Fig. 2
许可协议是训练门槛: 大多数红外数据集仅限「教育科研用途」(免费科研),禁止商业使用。如果你的压缩模型计划用于商业产品,务必核查对应数据集的许可协议。Cacophony Project 是唯一一个提供 CC0(完全公共领域)许可的大规模热红外视频数据集,可作为商业化训练的首选。
Part D · 应用领域
四大应用领域数据集分布

领域一:监控 / 行人检测与跟踪

这是红外数据集最成熟的应用领域,代表性数据集包括:

  • KAIST Multispectral Pedestrian:经典多光谱行人基准,set00–set05 训练、其余测试划分,覆盖日夜不同光照条件 #KAIST-2015
  • FLIR ADAS:ADAS 场景,15 类目标(car、person、bike 等),52 万标注框
  • CVC-14:多光谱行人检测数据集(需进一步核实链接与规格)
  • OSU Color-Thermal:6 个配准彩色/热红外序列,Homography 空间对齐

领域二:通用红外压缩基准

适合构建通用压缩评测基准的数据集:

  • OTCBVS 合集:15 个子集的目录型枢纽,覆盖人脸、行人、船舶等多种场景
  • LR/MR/HR Thermal:三相机同步采集的多分辨率热红外图像,适合跨分辨率压缩稳健性研究
  • BU-TIV:16-bit PNG 原始辐射视频,适合高位深压缩基线

领域三:军事 / 目标识别(ATR)

红外小目标检测(IRSTD)是军事/ATR 域的核心任务。该方向的数据集以静态图像为主,目标通常只占几个像素,标注方式包括像素级掩码和单点标注。

数据集 机构/来源 规模 输入分辨率 标注 特点
NUDT-SIRST 国防科技大学 数百张 多种(常 resize 至 256×256) 像素掩码/点标注 背景复杂、远距离小点目标;LoHGNet IoU 95.61% #LoHGNet-2026
NUAA-SIRST 南京航空航天大学 数百张 多种(常 resize 至 256×256) 像素掩码 IRSTD 最经典基准,场景多样性最好 #LoHGNet-2026
IRSTD-1K / SIRST4 ISNet 论文 IRSTD-1K ~1,000 张;SIRST4 共 3,352 张 512×512(SIRST4) 像素掩码 SIRST4 整合 SIRSTv1/v2 + NUDT-SIRST + IRSTD-1K;场景与目标尺度更多样 #SPIRE-2026
SIRST-UAVB SPIRE 论文 #Ni-2026 3,000 张(2,400 训练 / 600 测试) 640×640 点标注 UAV 城市场景,低信噪比、杂波主导 #SPIRE-2026

未核实数据集

以下数据集本轮未能找到可靠公开来源,建议后续补查:

  • IRDST:红外单目标飞机检测数据集,可能与 IRSTD-1K 不同
  • MILAIR:军事航空红外数据集,可能不公开或受限制
  • JPEG-AI / JPEG-Pleno 红外测试序列:标准化组织是否发布专门的红外测试集待确认

领域四:动物 / 野生 / 特殊场景

野生动物监测是热红外的重要应用方向:

  • BU-TIV 蝙蝠序列:Velifer / Bracken / Davis / Frio 系列,蝙蝠出洞行为观测
  • Cacophony Project:新西兰本土野生动物监测,121,190 段热红外视频,CC 许可
  • BIRDSAI:Conservation Drones 无人机热红外,48 序列 / 61,994 帧,CDLA 许可
  • VAIS Maritime:OTCBVS Dataset 12,海上船舶目标
  • NightWatch-TIR:夜间多物种野生动物热成像分类基准
VTUAV 数据集样例
VTUAV 数据集样例:RGB-T 配对帧与属性标注。来源:#VTUAV-2022, Fig. 1
Part E · 开放问题
当前数据集体系的五大缺口

缺口一:14-bit / 16-bit 原始辐射数据极度稀缺

当前公开数据集中,只有 BU-TIV(16-bit PNG)和 FLIR ADAS(14-bit TIFF)提供高位深原始辐射数据。这一缺口严重制约了以下研究方向:

  • 面向高保真热红外成像的压缩编码研究
  • 14-bit/16-bit 辐射域 vs 8-bit 灰度域的率失真对比研究
  • 温度标定与非均匀性校正(NUC)对压缩质量的影响研究

缺口二:军事 / ATR 域公开数据集部分核实

通过仓库内已有的 IRSTD 论文精读(SPIRE、LoHGNet、RPCASSM),已核实 NUDT-SIRST、NUAA-SIRST、IRSTD-1K/SIRST4、SIRST-UAVB 的存在与基本规格。但仍缺 IRDST、MILAIR 的可靠公开来源,且这些 8-bit 小目标数据集是否适合压缩评测(它们的目标仅几个像素)仍需讨论。

缺口三:标准化压缩评测协议缺失

除了 LLVIP/KAIST 有 BD-Rate 验证外,绝大多数数据集没有标准的压缩评测协议。JPEG-AI / JPEG-Pleno 是否发布了官方红外测试序列,仍需进一步核实。

缺口四:纯红外视频压缩基准缺乏

现有 RGBT 视频数据集(VTUAV、LasHeR、RGBT-Tiny)都是「可见光 + 热红外」配对形式,纯热红外视频压缩基准几乎不存在。这与轮廓视频压缩的需求(只传轮廓/边缘信息)存在gap。

缺口五:轮廓/前景掩码非原生

关键说明

本文覆盖的所有数据集只提供边界框标注,不原生提供二值轮廓/前景掩码。如果压缩研究者想评估「压缩对轮廓提取任务的影响」,需要额外使用分割模型(如 SAM、DeepLabV3)从原始热红外图像中生成轮廓掩码。

参考来源

参考来源

  • Wang, Z. et al. (2025). End-to-End RGB-IR Joint Image Compression With Channel-wise Cross-modality Entropy Model. arXiv:2506.21851.

  • Bjøntegaard, G. (2024). Bjøntegaard Delta (BD): A Tutorial Overview of the Metric, Evolution, Challenges, and Recommendations. arXiv:2401.04039.

  • Zheng, X. et al. (2021). LLVIP: A Visible-infrared Paired Dataset for Low-light Vision. arXiv:2108.10831.

  • Li, C. et al. (2021). LasHeR: A Large-scale High-diversity Benchmark for RGBT Tracking. IEEE TIP. arXiv:2104.13202.

  • Ying, X. et al. (2024). Visible-Thermal Tiny Object Detection: A Benchmark Dataset and Baselines. arXiv:2406.14482 (TPAMI 2025).

  • Zhang, P. et al. (2022). Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline. CVPR 2022. arXiv:2204.04120.

  • Li, C. et al. (2022). A Survey for Deep RGBT Tracking. arXiv:2201.09296.

  • Wu, Z. et al. (2014). A Thermal Infrared Video Benchmark for Visual Analysis. CVPR 2014 PBVS Workshop.

  • OTCBVS Benchmark Dataset Collection. Oklahoma State University. https://vcipl-okstate.org/pbvs/bench/.

  • Teledyne FLIR. FLIR ADAS Dataset. https://oem.flir.com/solutions/automotive/adas-dataset-form/.

  • Hwang, S. et al. (2015). Multispectral Pedestrian Detection: Benchmark Dataset and Baseline. CVPR 2015.

  • Rivadeneira, R. et al. (2020). LR/MR/HR Thermal Dataset. PBVS Thermal Infrared Challenge. GitHub.

  • Han, F. et al. (2026). LoHGNet: Infrared Small Target Detection through Lorentz Geometric Encoding with High-Order Relation Learning. arXiv:2605.07213.

  • Ni, Y. et al. (2026). SPIRE: Single-Point Supervision Guided Infrared Probabilistic Response Encoding for Infrared Small Target Detection. arXiv:2605.00722.

  • Zhang, R. et al. (2026). RPCASSM: Robust PCA State Space Model for Infrared Small Target Detection. arXiv:2605.05804.