ESC
输入关键词搜索文章
目录

LasHeR

IEEE TIP 2021 · 安徽大学 mmic-lcl
1224 对视频、734.8K 帧对,RGBT 跟踪领域规模最大的训练+评测基准
1224视频对
734.8K帧对
32目标类别
19挑战属性

论文信息

Part 1
为什么 RGBT 跟踪需要大规模基准

想象一个夜间巡逻场景:一辆汽车驶过路灯昏暗的街道,可见光相机只能捕捉到模糊的轮廓,而热红外相机却清晰地呈现了发动机的热信号。但如果此时目标车辆刚从地下车库驶出,发动机尚未预热,温度与路面接近——这就是所谓的"热交叉"(thermal crossover)现象,此时热红外相机反而失效,可见光相机凭借纹理和颜色信息更具优势。这就是 RGBT 跟踪的核心动机:可见光与热红外两种模态在不同的环境条件下各有优劣,融合使用可以实现全天候、全天时的目标追踪#Li et al., 2021

RGBT 跟踪在 2016 年之后逐渐成为计算机视觉社区的研究热点。安徽大学李成龙团队先后构建了 GTOT(50 序列)#Li et al., 2016、RGBT210(210 序列)#Li et al., 2017和 RGBT234(234 序列)#Li et al., 2018三个逐渐扩大的数据集,奠定了 RGBT 跟踪的基准框架。2019 年,VOT 挑战赛将 RGBT 跟踪纳入新赛道,推出了基于 RGBT234 设计的 VOT-RGBTIR2019 数据集#Kristan et al., 2019

然而,到 2021 年 LasHeR 发表时,RGBT 跟踪领域面临一个尴尬的矛盾:深度学习已经主导了跟踪算法研究,但可用于训练深度 RGBT 跟踪器的数据集规模极小。典型的训练流程是用 ImageNet 预训练模型初始化,然后在 GTOT(仅 50 个序列)上微调——任务间的本质差异和 GTOT 的小规模导致次优的跟踪性能。#Li et al., 2021 这就好比用 50 张照片训练一个图像分类器,远远不够让深度模型学到鲁棒的特征表示。

核心问题:深度 RGBT 跟踪器"数据饥渴"与现有数据集规模不足之间的矛盾,直接限制了 RGBT 跟踪的研究空间。

LasHeR 正是为解决这一矛盾而生:1224 个视频对、超过 730K 帧对、32 个目标类别、19 个挑战属性——在当时是 RGBT 跟踪领域规模最大、多样性最高的基准数据集。更关键的是,LasHeR 首次提供了训练/测试集划分,使深度 RGBT 跟踪器的大规模训练成为可能。#Li et al., 2021

LasHeR 与现有 RGBT 数据集的规模对比气泡图
图 1:LasHeR 与现有 RGBT 跟踪数据集的规模对比。气泡直径与帧数成正比,LasHeR 在序列数和帧数上均远超 GTOT、RGBT210、RGBT234 和 VOT-RGBTIR2019。(来源:LasHeR 论文, Fig.1)
Part 2
现有数据集的四大短板

论文在 Introduction 中明确指出了 RGBT 跟踪领域存在的四个核心问题,这四个问题正是 LasHeR 设计的直接驱动力。#Li et al., 2021

短板一:缺乏大规模数据集

现有 RGBT 视频数据集的序列数均不足 300 条。最大的 RGBT234 仅 234 个序列、116.7K 帧,而同期 RGB 跟踪领域的 LaSOT 已有 1400 个序列、TrackingNet 更是超过 30000 个视频。这种数量级上的差距直接导致深度 RGBT 跟踪器无法充分训练。

短板二:单一成像平台

每个现有数据集均由单一成像平台采集。GTOT 使用三脚架固定的热像仪和 CCD 相机,视野需固定且需精心选择场景;RGBT210/RGBT234 使用可旋转平台,但场景和类别受限。单一平台导致相同的成像参数和单一的成像设置,严重限制数据多样性#Li et al., 2021

短板三:场景和类别数量有限

RGBT 跟踪的目标是在任意视频中跟踪任意目标,但现有数据集的类别数不超过 22 个,场景类型也有限。类别和场景的不足影响了算法评估的公平性和可靠性。

短板四:缺失真实世界挑战

好的数据集应包含尽可能多的真实世界挑战。现有数据集缺失透明遮挡(hyaline occlusion)、帧丢失(frame lost)、高照度、剧烈光照变化、视野外、相似外观和长宽比变化等 7 种挑战。其中,帧丢失是一个特别有趣的问题:非制冷热像仪内置的非均匀性校正(NUC)机制在校正期间会停止成像数秒,导致热红外帧丢失,而此时目标状态可能已发生突变。#Li et al., 2021

数据集序列数总帧数类别数属性数多平台训练集
GTOT507.8K97
RGBT210210104.7K2212
RGBT234234116.7K2212
VOT-RGBTIR20196020.1K1312
CAMEL3022.4K5
KAIST4195K3
LasHeR1224734.8K3219
规模差距:LasHeR 的序列数是 RGBT234 的 5.23 倍,总帧数是 RGBT234 的 6.30 倍,且是唯一同时具备多平台成像和训练集的 RGBT 跟踪基准。

值得注意的是,RGBT210、RGBT234 和 VOT-RGBTIR2019 之间存在包含关系——VOT-RGBTIR2019 基于 RGBT234 设计,RGBT234 是 RGBT210 的扩展——因此这三个数据集的独立序列总数不超过 234。#Li et al., 2021 此外,Zhang 等人#Zhang et al., 2019曾使用 pix2pix 模型从可见光图像生成伪热红外图像,构建了 8335 个视频、125 万帧的合成 RGBT 数据集,但合成数据与真实数据之间存在巨大差距,其有效性有待验证。

Part 3
LasHeR 数据集构建方法论

LasHeR 的构建方法论可以从五个维度来理解:多平台成像、多模态对齐、标注策略、非对齐版本生成、挑战属性设计。每一步都针对 Part 2 中识别的短板提出了具体的解决方案。

graph TD
    A["① 多平台采集
可旋转平台 + 手持平台"] --> B["② 时间同步
相同帧率"] B --> C["③ 空间对齐(局部)
单应性变换 → 模态共享坐标系"] C --> D["④ 模态共享标注
ViTBAT 逐帧检查 + 手动微调"] D --> E["对齐版 LasHeR
1224 序列对 · 734.8K 帧对"] E --> F["⑤ 非对齐版自动生成
SIFT 匹配 → 单应性变换 → GT 自动迁移"] F --> G["非对齐版 LasHeR"] classDef step fill:#e3f2fd,stroke:#1565c0,stroke-width:2px classDef output fill:#e8f5e9,stroke:#2e7d32,stroke-width:2px class A,B,C,D,F step class E,G output

3.1 多平台成像系统

为突破单一平台的多样性限制,LasHeR 设计了两种互补的成像平台。#Li et al., 2021

可旋转平台

热像仪 DLS-H37DM-A(3–15 μm 波段)+ 可见光相机 SONY EXView HAD CCD,模拟视觉监控和智能交通场景。类似于 RGBT234 的设置,固定在监控杆上,提供稳定的成像条件。

手持平台

热像仪 DLD-J18-161 + 可见光相机 DS-2ZCN3007 CCD,在更大范围的场景和条件下采集图像。手持平台的移动性涵盖了更多样的拍摄角度、场景类型和环境条件。

两种平台有一个关键的同步设计:CCD 相机和热像仪的帧率设为相同值以确保时间对齐,同时两台相机的图像分辨率和成像范围一致,光轴手动对齐以最大化公共视野。#Li et al., 2021 这是一个看似简单但至关重要的工程决策——没有硬件级时间同步,后续的空间对齐和标注都无从谈起。

LasHeR 场景与目标类别示例
图 2:LasHeR 的场景与类别示例。涵盖室内(教学楼、停车库、走廊、食堂)和室外(篮球场、体育场、水池、道路)等 20+ 种场景,32 类目标包括刚性和非刚性物体。(来源:LasHeR 论文, Fig.2)

3.2 多模态对齐方案

数据采集后的第一步是空间对齐。LasHeR 的对齐方案包含一个面向任务的设计选择:选择局部对齐而非全局对齐

多模态目标检测任务需要定位多个目标,因此需要全局对齐,但径向畸变会影响对齐质量,尤其是在图像边界附近。而视觉跟踪任务只需定位单一目标,目标通常位于局部区域内。因此,LasHeR 虽然存在径向畸变,但选择不处理该问题,而是专注于覆盖目标物体的局部区域的精确对齐。#Li et al., 2021

具体方案:对每帧的两张图像,通过标注一组匹配点估计单应性矩阵(homography),保持热红外图像不变,对可见光图像施加单应性变换,将其变换到与热红外图像统一的坐标系中。#Li et al., 2021

3.3 标注策略:模态共享 vs 模态特定

LasHeR 在标注策略上做了一个重要的设计决策:采用模态共享标注(modality-shared annotation),而非 GTOT 和 RGBT234 使用的模态特定标注(modality-specific annotation)。#Li et al., 2021

两种标注方案的对比

模态特定标注:对 RGB 和热红外帧分别标注边界框。适用于两模态未良好对齐的情况,有利于特定模态下的性能评测。但没有统一的真值标签,可能引入评测偏差。GTOT 和 RGBT234 因存在标注误差而采用此方案。

模态共享标注:两个模态共享同一个边界框。适用于两模态良好对齐的情况,避免了评测偏差,但如果两模态未对齐会引入大的标注误差。

LasHeR 选择模态共享标注的原因很直接:数据经过精确的空间对齐,两个模态共享同一个边界框是合理的。在每帧对中,只需标注质量更高的模态,另一模态的标注通过严格的空间对齐自动获得。#Li et al., 2021 使用 ViTBAT 软件进行逐帧检查和手动微调,目标移出视野时将边界框宽高设为 0。

3.4 非对齐版本自动生成

LasHeR 同时发布了非对齐版本,这是论文的第三个贡献。在实际应用中,RGB 和热红外图像的对齐是劳动密集且耗时的,光学配准成像系统昂贵且对齐误差不可避免。因此,无对齐 RGBT 跟踪(alignment-free RGBT tracking)是更贴近真实应用场景的任务。#Li et al., 2021

非对齐版本的真值(GT)生成方案是一个巧妙的工程设计:利用 SIFT 特征在对齐和未对齐的 RGB 图像之间进行匹配,估计单应性变换,然后从已精确标注的对齐版 GT 自动生成未对齐版的 GT。#Li et al., 2021 由于两幅 RGB 图像的内容几乎相同,单应性变换非常精确,避免了二次标注的劳动力和偏差。

非对齐 GT 生成流程图
图 3:非对齐 RGBT 对的真值生成流程。通过对齐版 GT 和两模态间的变换关系,自动生成高质量的非对齐版 GT,无需二次标注。(来源:LasHeR 论文, Fig.6)

为什么选择 SIFT 而非深度学习方法?论文给出了明确理由:监督方法需要配准参数的真值来训练网络,而此类数据极难收集;无监督方法关注如何设计无监督损失函数,面向特定挑战。而 LasHeR 的场景——两幅 RGB 图像内容几乎相同——恰好是 SIFT 特征匹配的理想用例。#Li et al., 2021

3.5 19 个挑战属性:7 个新增填补空白

LasHeR 定义了 19 个挑战属性,其中 12 个继承自现有数据集,7 个为新增。新增的 7 个挑战及其动机值得逐一理解:

缩写属性名称核心挑战新增
HO透明遮挡热红外无法穿透致密透明材料,目标在热成像中不可见但可见光中可见
OV视野外目标离开相机视野后追踪器难以重新捕获
HI高照度光照过强导致目标难以识别,与低照度形成互补
AIV剧烈光照变化光照显著突变,对追踪器自适应能力提出更高要求
SA相似外观目标附近存在外观相似物体,需要更多上下文信息区分
FL帧丢失热像仪非均匀性校正期间停止成像,目标状态可能突变
ARC宽高比变化边界框宽高比超出 [0.5, 2] 范围,追踪器难以建模剧烈外观变化
透明遮挡与帧丢失挑战示例
图 4:透明遮挡(HO)和帧丢失(FL)两种新挑战的示例序列。透明遮挡时目标在热红外中不可见;帧丢失时热红外图像内容不变或空白,但两模态帧在时间上仍然同步。(来源:LasHeR 论文, Fig.5)

值得关注的是帧丢失(FL)这一挑战。非制冷热像仪内置的非均匀性校正方案在几秒钟内会停止成像,此时热红外图像内容不变或为空白,但仍与可见光帧保持时间同步。#Li et al., 2021 这是一个此前 RGBT 数据集从未考虑的真实世界问题,它直接影响了追踪器的连续性——在 FL 期间,追踪器只能依赖可见光模态维持跟踪。

挑战属性分布图
图 5:LasHeR 的挑战属性分布。(a) 整个 LasHeR 上各属性的序列数分布;(b) 与 RGBT234 在公共属性上的对比,可见 LasHeR 在各属性上均具有更大的规模。(来源:LasHeR 论文, Fig.4)

此外,LasHeR 的目标类别分布呈现长尾分布(long tail distribution)。作者认为这种不平衡在真实世界场景中客观存在,会带来有意义的挑战,鼓励设计更实用、更具扩展性的 RGBT 跟踪器。#Li et al., 2021

目标类别分布图
图 6:LasHeR 的目标类别分布。(a) 整个 LasHeR 上的类别分布呈长尾分布;(b) 与其他 RGBT 数据集在公共类别上的对比。(来源:LasHeR 论文, Fig.3)
Part 4
评测协议设计

4.1 三个评测指标

LasHeR 采用三个标准评测指标,每个指标从不同角度衡量追踪器性能。#Li et al., 2021

Precision Rate (PR)

计算预测位置与真值之间中心距离在阈值范围内的帧百分比。阈值设为 20 像素。给定预测中心点 $(x_p, y_p)$ 和真值中心点 $(x_g, y_g)$,中心距离为:

$$d = \sqrt{(x_p - x_g)^2 + (y_p - y_g)^2}$$

Normalized Precision Rate (NPR)

由于 PR 容易受到图像分辨率和边界框大小的影响,NPR 对 PR 按分辨率和边界框大小进行归一化(参考 TrackingNet),使评测更加公平。

Success Rate (SR)

计算预测边界框与真值重叠率大于某阈值的帧比率,使用曲线下面积(AUC)作为代表性分数。给定预测框 $B_p$ 和真值框 $B_g$,重叠率为:

$$\text{IoU} = \frac{|B_p \cap B_g|}{|B_p \cup B_g|}$$

4.2 两种评测协议

LasHeR 设计了两种互补的评测协议。#Li et al., 2021

协议一:使用整个 LasHeR(1224 序列对)作为测试集,评估 12 种 RGBT 跟踪方法。此协议提供了最全面的性能评估,无需训练集划分。

协议二:按目标类别分布将 LasHeR 划分为训练子集和测试子集。训练子集用于训练追踪器,测试子集用于评估。此协议包含基线评测(12 个追踪器原样评测)和重训练实验(在训练子集上重训练 MANet 和 mfDiMP)。

4.3 12 种评测算法分类

论文评测了 12 种 RGBT 跟踪算法,可分为两大类。#Li et al., 2021

手工特征方法(3 种):SGT、CMR、SGT++,基于加权稀疏表示正则化图或跨模态排序,使用 HOG/Color Name 等手工特征。

深度学习方法(9 种):进一步分为两个子方向。MDNet-based 方法(MANet、DAPNet、DAFNet、MaCNet、FANet、CAT、DMCNet、MANet++)基于 VGG 骨干,融合策略多样但效率较低;Siamese-based 方法(mfDiMP)基于 ResNet 的 DiMP 框架,速度快但在低分辨率目标上较弱。#Li et al., 2021

4.4 训练配置披露表

配置项内容披露状态
训练数据各追踪器原论文使用的训练数据:MANet → GTOT;mfDiMP → 合成 RGBT 数据集(8335 视频,125 万帧)或 GTOT。重训练实验使用 LasHeR 训练集已披露
训练硬件未披露
优化器未披露
学习率未披露
Batch size未披露
训练步数/轮数未披露
训练时长未披露
模型参数量未披露
精度格式未披露
Checkpoint 策略未披露
说明:本文为基准数据集论文,重点在于数据集构建和评测协议,而非追踪器的训练细节。8 项标注"未披露"的配置需参考各追踪器的原始论文。
Part 5
评测结果全景

5.1 整体评测结果

在整个 LasHeR(1224 序列)上的评测结果揭示了一个清晰的方法排序。#Li et al., 2021

排名算法PRSR速度 (fps)
1DMCNet0.5570.3952.244
2MaCNet0.5460.3920.891
3MANet0.5380.3830.904
4FANet0.5240.35917.476
5MANet++0.5230.35516.153
6mfDiMP0.5220.39938.242
7CAT0.5210.3558.938
8DAFNet0.5140.35022.208
9DAPNet0.4830.3451.475
10SGT++0.4270.2821.192
11CMR0.4200.2992.811
12SGT0.3920.2680.957
精度与效率的权衡:DMCNet 获得 15/19 个属性上的最高 PR,但速度仅 2.244 fps;mfDiMP 获得最高 SR 和最快的速度(38.242 fps),两者速度差距达 17 倍。这反映了 MDNet 在线训练(高精度低效率)与 DiMP 离线学习(较低精度高效率)之间的典型权衡。
整个 LasHeR 上的 PR/NPR/SR 评估曲线
图 7:在整个 LasHeR 上的精确率、归一化精确率和成功率曲线。图例中标注了代表性分数。DMCNet 取得最佳 PR(0.557)和 NPR(0.494),mfDiMP 取得最佳 SR(0.399)。(来源:LasHeR 论文, Fig.7)

一个值得注意的发现是:所有追踪器从 RGBT234 迁移到 LasHeR 后性能均显著下降。DMCNet 的 PR 从 RGBT234 上的 0.839 降至 LasHeR 上的 0.557(降幅 33.6%),mfDiMP 的 PR 从 RGBT210 上的 0.785 降至 0.522(降幅 33.5%)。#Li et al., 2021 这种性能下降证明了 LasHeR 的挑战性和多样性,也表明在现有数据集上训练的追踪器不足以应对真实世界跟踪应用的挑战。

5.2 挑战属性级评测

在 19 个挑战属性上的分析揭示了追踪器的薄弱环节。追踪器在新引入的 7 个挑战上一致表现出低追踪性能,其中透明遮挡(HO)、帧丢失(FL)和宽高比变化(ARC)几乎是最差的表现。#Li et al., 2021

以帧丢失(FL)为例,最佳追踪器 DMCNet 的 PR 仅为 0.393、SR 仅为 0.283——远低于其在无遮挡(NO)场景下的 PR=0.681。透明遮挡(HO)同样困难,因为热红外辐射无法穿透致密透明材料,目标在热成像中完全不可见。

5.3 重训练实验:大规模真实数据的威力

重训练实验是 LasHeR 论文最有说服力的实验之一。作者在 LasHeR 训练集上重新训练了 MANet 和 mfDiMP,与在 GTOT 和合成数据集上训练的版本进行对比。#Li et al., 2021

测试集训练数据MANet PRMANet SRmfDiMP PRmfDiMP SR
RGBT234GTOT0.7770.5390.7870.560
RGBT234合成数据集0.7850.559
RGBT234LasHeR 训练集0.8100.5690.8420.591
LasHeR 测试集GTOT0.4550.3260.4740.364
LasHeR 测试集合成数据集0.4470.343
LasHeR 测试集LasHeR 训练集0.5080.3690.5990.467
关键发现:重训练后 mfDiMP 在 LasHeR 测试集上达到 PR=0.599、SR=0.467,均超过未重训练的最佳追踪器 DMCNet(PR=0.490、SR=0.355)。这直接证明了大规模真实 RGBT 训练数据对深度追踪器的提升效果。

5.4 RGB 追踪器对比:热红外的价值

论文还评测了 7 种 RGB 追踪器在 LasHeR 上的表现,与 RGBT 追踪器进行对比。#Li et al., 2021

方法类型LasHeR 测试集 PRLasHeR 测试集 SR
TransTRGB0.5290.395
DMCNetRGBT(未重训练)0.4900.355
mfDiMP(重训练)RGBT(LasHeR 训练)0.5990.467

一个反直觉的发现是:未重训练时,最佳 RGB 追踪器 TransT(PR=0.529)竟然超过了最佳 RGBT 追踪器 DMCNet(PR=0.490)。原因在于 RGB 追踪器在大规模数据集(LaSOT、TrackingNet)上训练,而 RGBT 追踪器仅在小规模数据集(GTOT,50 序列)上训练。只有当 RGBT 追踪器也获得大规模训练数据时,热红外模态的互补优势才能充分体现。重训练后的 mfDiMP 以 PR=0.599 大幅超越 TransT(+13.2%),充分证明了 RGBT 数据在视觉跟踪中的有效性。#Li et al., 2021

5.5 实验配置表

配置项内容披露状态
评测数据集整个 LasHeR(1224 序列)+ LasHeR 测试子集已披露
评测指标PR(阈值 20 像素)、NPR(归一化精确率)、SR(AUC)已披露
Baseline 方法12 种 RGBT 追踪器 + 7 种 RGB 追踪器已披露
推理硬件未披露
推理分辨率未披露
推理环境未披露
定性评估结果
图 8:定性评估结果。在 bluebuscoming、leftbasketball、dotat43 三个代表性序列上,多数追踪器无法应对宽高比变化和尺度变化。mfDiMP 在尺度变化处理上表现最佳,但快速运动+相似外观同时出现时几乎所有追踪器都会丢失目标。(来源:LasHeR 论文, Fig.8)
Part 6
三个关键发现

发现一:性能显著下降——LasHeR 的挑战性证据

从 RGBT234 到 LasHeR,追踪器性能出现了显著退化。DMCNet 的 PR 从 0.839 降至 0.557(降幅 33.6%),SR 从 0.593 降至 0.395(降幅 33.4%)。#Li et al., 2021 这种下降不是偶然的——它反映了 LasHeR 在场景多样性、挑战属性覆盖和数据规模上的全面提升。作者指出,这种退化表明"在现有数据集上训练的追踪器不足以应对真实世界追踪应用的挑战"。

发现二:真实数据 > 合成数据——9 倍规模的逆转

这或许是论文中最有说服力的发现。Zhang 等人#Zhang et al., 2019使用 pix2pix 模型生成的合成 RGBT 数据集包含 8335 个视频、125 万帧——规模约为 LasHeR 训练集的 9 倍。然而,用合成数据训练的 mfDiMP 在 LasHeR 测试集上的表现(PR=0.447, SR=0.343)不仅低于用 LasHeR 训练集训练的版本(PR=0.599, SR=0.467),甚至比仅用 GTOT(50 序列)训练的版本还差(PR=0.474, SR=0.364)。#Li et al., 2021

核心洞察:合成数据的核心问题在于——当 RGB 数据质量差时,pix2pix 生成的伪热红外图像缺乏对应的互补信息,而这正是引入热红外模态的初衷。数据质量比数据数量更重要,真实的多模态互补信息无法通过单模态生成获得。

发现三:RGBT 互补性的实验证据

论文设计了一个巧妙的对比实验来证明 RGBT 互补性的价值。#Li et al., 2021

在未重训练的条件下,RGB 追踪器 TransT(PR=0.592)优于最佳 RGBT 追踪器 DMCNet(PR=0.557)——这似乎说明热红外模态无用。但当我们控制训练数据规模这一变量后,结论完全逆转:用 LasHeR 训练集重训练的 mfDiMP(PR=0.599, SR=0.467)大幅超越了 TransT(PR=0.529, SR=0.395),PR 提升 13.2%,SR 提升 18.2%。

实验设计的精妙之处:通过"不公平对比"(RGB 大规模训练 vs RGBT 小规模训练)和"公平对比"(两者均大规模训练)的对照,论文不仅证明了 RGBT 的互补价值,还揭示了"数据规模是发挥多模态优势的前提条件"这一深层结论。
Part 7
讨论与启发

7.1 失败模式分析

定性评估揭示了 RGBT 追踪器的几个典型失败模式。#Li et al., 2021 当完全遮挡(TO)、透明遮挡(HO)和视野外(OV)发生时,追踪器容易丢失目标——部分原因是目标重新出现时已超出搜索窗口。形变(DEF)和宽高比变化(ARC)会削弱追踪器对外观的建模能力。相似外观(SA)和热交叉(TC)则因判别特征不足导致追踪失败。

更棘手的是不同挑战之间的权衡:增大搜索范围可以应对快速运动(FM),但同时引入更多背景干扰,加剧相似外观(SA)问题。#Li et al., 2021 这种权衡关系意味着简单的"扩大搜索范围"策略并不能解决所有问题。

7.2 作者建议的改进方向

基于失败分析,论文提出了五个具体的改进方向:#Li et al., 2021

1. 轨迹推断:解决目标消失问题(TO、HO、OV)

2. 更鲁棒的外观建模和长记忆机制:使模型在目标重新出现时能重新识别

3. 在线模型更新:应对形变和宽高比变化

4. 上下文信息学习:缓解相似外观和热交叉问题

5. 不同挑战间的权衡策略:平衡搜索范围扩大与背景干扰引入之间的矛盾

7.3 局限性

作者在结论中提到两个未来工作方向:计划扩展数据类别以进一步增强多样性;将完善标注信息(包括目标掩码和语义描述)。#Li et al., 2021 此外,数据集存在径向畸变,但如 Part 3.2 所述,这是面向跟踪任务的设计选择——跟踪关注局部区域,径向畸变主要影响图像边界,因此作者选择不处理。

7.4 对后续研究的影响

(以下为编者整理的后续影响,非论文原文内容)LasHeR 发表后成为 RGBT 跟踪领域的标准基准数据集。后续多项重要工作使用了 LasHeR:VTUAV(CVPR 2022)在其基础上构建了无人机场景的大规模基准;基于 Transformer 的 RGBT 跟踪方法(如 AAAI 2024 的 Cross-modulated Attention Transformer)在 LasHeR 上验证性能;CVPR 2026 URVIS Workshop 挑战赛甚至专门使用 LasHeR 训练集设置了模态缺失 RGBT 跟踪赛道。LasHeR 推动的无对齐 RGBT 跟踪方向也在 2024-2026 年间产出了多篇 CVPR/AAAI 论文。

7.5 个人启发

从 LasHeR 论文中,我们可以获得几条对基准数据集设计有普遍意义的启发:

第一,数据集设计应面向任务需求做务实的简化。 LasHeR 选择局部对齐而非全局对齐,选择模态共享标注而非模态特定标注——这些选择都基于跟踪任务的特点(关注局部区域、需要统一真值),而非追求"完美"但对齐质量不可控的方案。 第二,评测协议的设计比数据集本身更能驱动研究。 LasHeR 的重训练实验和 RGB 追踪器对比实验,不仅评估了现有方法,还回答了"为什么需要大规模真实 RGBT 数据"这一根本问题。好的评测协议应该能产生有说服力的科学结论。 第三,合成数据的局限需要被正视。 9 倍规模的合成数据反而不如真实数据——这一发现对整个多模态学习领域都有警示意义。当模态间的互补信息是核心价值时,从单一模态生成的伪数据无法提供真正的互补性。
LasHeR 测试集上的评估曲线
图 9:LasHeR 测试子集上的精确率、归一化精确率和成功率曲线。DMCNet 在未重训练的追踪器中取得最佳 PR=0.490、NPR=0.431、SR=0.355。(来源:LasHeR 论文, Fig.9)

参考来源

  • Li, C. et al. (2021). LasHeR: A Large-scale High-diversity Benchmark for RGBT Tracking. IEEE Transactions on Image Processing. arXiv:2104.13202

    · GitHub: mmic-lcl/Datasets-and-benchmark-code

  • Li, C. et al. (2016). Learning Collaborative Sparse Representation for Grayscale-Thermal Tracking. IEEE TIP, 25(12): 5743–5756. (GTOT 数据集)
  • Li, C. et al. (2017). RGBT Object Tracking: Benchmark and Baseline. ACM MM. (RGBT210 数据集)
  • Li, C. et al. (2018). RGB-T Object Tracking: Benchmark and Baseline. Pattern Recognition, 96: 1–15. (RGBT234 数据集)
  • Kristan, M. et al. (2019). The Seventh Visual Object Tracking VOT2019 Challenge Results. ICCV Workshops. (VOT-RGBTIR2019)
  • Zhang, L. et al. (2019). Multi-fusion Strategy in DiMP Framework for RGBT Tracking. (mfDiMP + 合成 RGBT 数据集)
  • Li, C. et al. (2019). MANet: Multi-Adapter Network for RGBT Tracking. ICCV Workshop. (MANet)
  • Li, C. et al. (2020). DMCNet: Dual-Modal Cross-Modal Network for RGBT Tracking. (DMCNet)
  • Davis, J. et al. (2007). Background-subtraction using thermal and visible imagery for human detection. CVIU. (OSU-CT 数据集)
  • Torabi, A. et al. (2012). LITIV: A dataset for visible-infrared scene alignment, tracking and video analysis. CVIU. (LITIV 数据集)