Animal Kingdom 论文精读
论文信息
- 标题:Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding
- 作者:Xun Long Ng, Kian Eng Ong, Qichen Zheng, Yun Ni, Si Yong Yeo, Jun Liu
- 单位:Information Systems Technology and Design, Singapore University of Technology and Design, Singapore
- 发表:CVPR 2022 (Oral, Paper ID 5075)
- DOI:10.1109/CVPR52688.2022.01935
- 开源:https://sutdcv.github.io/Animal-Kingdom (与数据集一同打包下载,含 3 个任务的代码与 helper scripts)
系列定位
本文是动作识别系列论文精读第五篇,承接 SkeleTR(骨架 / wild 两阶段)、IGMN(身份感知时序动作) 等动作识别专题,向大模型可用的"动 + 主体 + 场景"统一生态走。
Animal Kingdom 与 SkeleTR 完全不同路线:SkeleTR 关心如何在 wild 场景中识别人的动作,Animal Kingdom 关心如何在 850 种动物类间实现跨物种动作识别。前者是骨架模态范式的新设计,后者是"数据集 + 跨类方法"双贡献。
从 Anderson and Perona 在 2014 年 Neuron 上呼吁建立"计算行为学"(computational ethology)这个学科以来,动物行为分析已经走过十余年的发展历程。#Anderson-and-Perona-2014 早期 DeepPoseKit、DeepLabCut 这样的 markerless 姿态估计工具让小鼠、黑腹果蝇、自由放养的猴子等实验室物种的行为学量化成为可能。#Graving-et-al.-2019 #Mathis-et-al.-2020-DeepLabCut #Karashchuk-et-al.-2021-Anipose 紧接着,iWildCam、Snapshot Serengeti 这类大野外数据集把红外触发相机阵列推向了生态保护,每个数据集通常达到数万到数百万张图像。#Beery-et-al.-2021-iWildCam #Swanson-et-al.-2015-SnapshotSerengeti
但截至 2022 年之前,几乎没有数据集能同时满足四件事:(1) 真正多物种(远超 100 类)、(2) 野生环境(背景、光照、视角、天气变化多)、(3) 视频(保留时间维度的细粒度动作)、(4) 多任务统一标注(同时标注动作识别、视频片段定位、姿态估计)。
Animal Kingdom 是首个把这四件事一次性补齐的数据集。论文 §1 概括了其规模:从 YouTube 收集 50 小时 视频,做 30,100 段动作识别片段(平均 6 秒,最长 117 秒),并标注 33,000 帧姿态样本,覆盖 850+ 个物种、6 大类动物(哺乳类、爬行类、两栖类、鸟类、鱼类、昆虫类)。#Ng-et-al.-2022 这三个数字(上文 50/30K/33K)正好对应三任务的规模。
为什么这件事的"经济意义"也不可小觑:论文 §1 引言引述,世界每年在野生动物保护上花费至少 $75 billion,而其中关键环节"识别动物是否异常行为"长期依赖人工巡护——这正是数据驱动方法可以大规模替代的环节。#Ng-et-al.-2022 仅这一点,Animal Kingdom 的潜在社会影响就远超其学术层面的贡献——它不仅是一个数据集,更是一个产业基础设施的"训练弹药"。
CVPR 2022 Oral 是这个数据集所获认可的标志。CVPR 在该年度的投稿近万篇,Oral 录取率约 5%(约 200+ 篇),代表审稿人对"贡献度 + 影响力 + 严谨性"三方面的综合认可。#Ng-et-al.-2022 据官方页面,数据集与代码已 公开发布——任何研究者都可以申请下载数据集 + 配套代码,并直接用 helper scripts 一键部署环境。
2.1 既有动物行为数据集的四大局限
论文 §1 把既有数据集的缺陷抽象为四个维度,这也是后续论文"为何必须有这个数据集"的论证骨架:
- 规模与标注稀缺:Animal Pose (#Cao-et-al.-2019-AnimalPose) 的 5+7 物种数据集、MacaquePose (#Labuguen-et-al.-2021-MacaquePose) 的单种猴类,已经足够支撑小规模实验,但跨物种泛化研究没法用——数据集不够大。
- 物种多样性不足:iWildCam、Snapshot Serengeti 等野外触发相机数据集虽然规模大,但目标都是单一生物群(草原大型哺乳动物,或野外红外阵列)。#Beery-et-al.-2021-iWildCam #Swanson-et-al.-2015-SnapshotSerengeti 论文 §2 在 Related Work 中说"most of the current datasets are still relatively small, disparate, animal and environment-specific"——它们难以服务于"跨物种共享特征的迁移学习"研究。
- 环境单一:Animal Pose 跨越多个动物种类,但仍以外部 BBox 区域 crop为主,环境背景相对简单;MacaquePose 全部来自实验室拍摄。论文 §1 强调需要"varying backgrounds, viewpoints, illumination and weather conditions"——野生多样性是模型泛化的关键。
- 任务单维:iWildCam 提供分类、Animal Pose 仅姿态、MacaquePose 仅姿态……一个数据集同时支持"动作识别 + 姿态估计 + 视频片段定位"的几乎不存在。这阻碍了联合训练和跨任务迁移研究。
2.2 Protocol 2 揭示的根本性难度
Animal Kingdom 的姿态估计部分还专门设计了一个leave-k-out 协议 (Protocol 2):把 12 个 sub-class 完全留出训练,测试时再让模型去估计这些未见 sub-class 的姿态。这一协议直接量化了"跨物种姿态泛化"的真实难度。
论文 §5.5 的实验结果令人警醒:
| 协议 | HRNet PCK@0.05 | HRNet-DARK PCK@0.05 |
|---|---|---|
| Protocol 1:全 80/20 split | 66.06 | 66.57 |
| Protocol 2:leave-k-out (k=12) | 39.30 | 40.28 |
| Protocol 3(五大类各自):哺乳类 | 61.59 | 62.50 |
| Protocol 3:两栖类 | 56.74 | 57.85 |
| Protocol 3:爬行类 | 56.06 | 57.06 |
| Protocol 3:鸟类 | 77.35 | 77.41 |
| Protocol 3:鱼类 | 68.25 | 69.96 |
关键数字:从 Protocol 1 到 Protocol 2,HRNet 的 PCK@0.05 从 66.06 → 39.30,整整掉了 26.76 个点。这意味着 cross-class 姿态泛化目前在 SOTA 模型上还远远不够。#Ng-et-al.-2022 这一发现本身就是 Animal Kingdom 的核心贡献之一——它给社区提供了一个"开放问题"的标准化实验台。
而 Protocol 3 显示:鸟类(77.4)远高于爬行类(57.1)和两栖类(57.9),因为后两者肢体形态变化大、伪装多、关键点位置高度异质。这一模式在 CARe 的设计动机中也会再次出现——动物之间的相似性是空间位置相关的。
论文的核心方法论贡献是 Collaborative Action Recognition (CARe) 模型。它解决了一个诱人的问题:如何用 K 种已见动物的训练数据,让模型在推理时识别另 5 种完全没见过的动物执行同一组动作? 这是典型的跨类域泛化(cross-class domain generalization)问题。#Ng-et-al.-2022
3.1 问题形式化
训练数据被分为 K 类:\(\mathbf{D} = \{D_k\}_{k=1}^{K}\),每类 \(D_k = \{(x_n^k, y_n^k)\}_{n=1}^{N_k}\),其中 \(x_n^k\) 是第 k 种动物的第 n 个视频动作样本,\(y_n^k\) 是对应的多标签动作标签(多标签意味着同一段视频可同时标注多个动作,例如"swimming + hunting")。
推理时遇到训练时完全没见过的新动物类,需要识别同一组动作。这一问题与零样本学习(ZSL)的关系:CARe 不依赖未见类的语义嵌入(不需要预先手工写出未见类的特征描述),而是直接用已见类的特征做协作组合,因此更接近域泛化(Domain Generalization)。
3.2 基础架构:双流 General + Specific Features
CARe 把 backbone 之后的特征拆成两类:
- 通用特征 \(f_{gen}\):由 所有 K 类动物 的样本都流过的 elaborator \(F_{gen}\) 提取 → 学到的是"什么是 generic 的动物动作"。
- 特定特征 \(f^k_{specific}\):由 只有第 k 类动物样本 经过的 elaborator \(F^k_{specific}\) 提取 → 学到的是"第 k 类动物独特的行为模式"。
预测时把两者 concat 送入分类器:
直觉:因为 \(F_{gen}\) 见过更多样的数据(所有 K 类),它的特征在不同类间更通用;\(F_{specific}^k\) 因为只看到一种动物,它的特征会"过度适配",但同时也保留该类独有的细粒度细节。两者拼接,通用识别能力 + 物种特定细节。互补性是这一设计的关键。
3.3 处理未见动物:Relevance Evaluator + 协作近似
基础版本处理未见动物时遇到困难——没有与未见类对应的 \(F_{specific}\)。论文 §3 的核心洞察是:
例:猎豹和老虎的相似度远大于它们与蛇的相似度。
利用这种相似度,可以协作式地近似出未见动物的 specific feature。#Ng-et-al.-2022
于是论文引入 relevance evaluator \(R\)。给定一个未见动物的视频样本 \(x\),\(R\) 计算它与 K 个已见类的相似度:
然后用 K 个 existing specific elaborators 按权重组合,得到未见动物的近似 specific feature:
关键创新:空间感知张量权重。论文 §3 还提到,\(w^k\) 不必是标量——可以做成 tensor \(w^k \in \mathbb{R}^{h \times w}\)。这样不同身体部位的相似度独立计算,不同已见动物按部位分别贡献——某一种特征 elaborator 可能对头部相似,对尾巴不相似,张量化权重自然处理了这种空间异质性。
消融实验 §5.3 直接验证了 spatial-aware 的必要性:去掉 spatial-aware → 39.7% 掉到 37.1%(-2.6 点)。#Ng-et-al.-2022
3.4 用 Meta-Learning 训练 R:MLDG 算法
R 网络的训练需要让它在真正未见的动物类上也能给出好相似度——这是一个直接优化难以处理的目标。论文借鉴了 MLDG 算法#Li-et-al.-2018-MLDG(meta-learning for domain generalization)的思想:
- 将训练集中 K 类动物划分为 meta-train(K-1 类)和 meta-test(1 类,扮演"虚拟未见")。
- 在 meta-train 上做一步梯度下降得到临时参数 \(\phi'\)。
- 在 meta-test 上用 \(\phi'\) 计算"虚拟未见" loss。
- 最终用 meta-train 梯度 + meta-test 梯度共同更新 R 参数 \(\phi\)。
补充材料 Algorithm 1 给出完整伪代码:
为何能 work 的直觉:R 在训练时就已经"见过" K-1 vs 1 的虚拟 unseen 场景,这意味着 R 在测试阶段遇到真正的新类时,分布偏移已经被模拟过——它真正"学会了如何把 seen 知识迁到 unseen"。#Ng-et-al.-2022
3.5 实现细节
- Backbone \(E\):I3D 早期部分——\(E_{conv1}, E_{conv2}, E_{conv3}\) 三层 3D 卷积 + 两层 max pooling + 一个 Inception 子模块。#Carreira-and-Zisserman-2017 输入 \(x \in \mathbb{R}^{3 \times 16 \times 180 \times 320}\),输出 \(f_{base} \in \mathbb{R}^{256 \times 8 \times 23 \times 40}\)。
- Elaborators \(F_{gen}, F^k_{specific}\):每个由 2 层 lightweight two-head self-attention 构成,源自 Video Action Transformer (VAT) 网络。#Girdhar-et-al.-2019-VAT 输出特征尺寸 \(\mathbb{R}^{4 \times 12 \times 20}\)。
- Classifier \(C\):1 个线性层,把 flattened+concat 的 \((f_{gen}, f_{specific})\) 映射到 \(\hat{y} \in \mathbb{R}^M\),\(M = 140\) 类动作。
- Relevance Evaluator \(R\):\(R_{conv1}, R_{conv2}\) 卷积变换 + K 个线性 \(R^k_{linear}\),每条路径把变换后的 base feature 与 \(f^k_{specific}\) flatten+concat 投影到 \(w^k\)。
最终架构见补充材料图 + 上图 4。
4.1 训练数据
CARe 的训练数据来源于 Animal Kingdom 数据集自身。具体:
- 从 140 动作中选 6 个"跨类共享"的动作子集:moving, eating, attending, swimming, sensing, keeping still。
- 训练集(已见 K=4 类):birds, fishes, frogs, snakes。
- 测试集(未见类 5 类):lizards, primates, spiders, orthopteran insects, water fowls。
- 每段视频只包含一个动作实例(方便评估 accuracy)。
这是一个典型的"跨类泛化"实验设计——和 image classification 的"4 训练 class / 5 真正 unseen test class"模式一致。
4.2 训练配置披露表
下表系统列出 CARe 训练的全部 10 项硬性字段。原论文(main + supplementary)中有披露的项已标明值,未披露的项明确标记"未披露"。
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | Animal Kingdom 6 个共享动作的子集;训练集 K=4 类(birds/fishes/frogs/snakes),测试 5 类未见 |
| 训练硬件 | 部分披露 | "2-GPU implementation";型号未明确给出 |
| 优化器 | 已披露 | SGD;momentum / weight_decay 未披露 |
| 学习率 | 已披露 | backbone \(E\):0.001;其他组件:0.01;后 10 epochs 衰减到初始的 10% |
| Batch size | 未披露 | 原文未给出 |
| 训练步数 / 轮数 | 已披露 | 40 epochs = 30 epochs 初始 LR + 10 epochs 衰减 LR |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 未披露 | 各模块维度已给出(256×8×23×40 base feature),总参数未给 |
| 精度格式 | 未披露 | 未明确给出 |
| Checkpoint 策略 | 未披露 | 原文未给出 |
| Input 分辨率 | 已披露 | 3 × 16 × 180 × 320(RGB × 帧数 × 高 × 宽) |
| Backbone 初始化 | 已披露 | 在 ImageNet + Kinetics 上预训练的 I3D |
| Input frames / video | 已披露 | 每段视频随机采 16 帧 |
| Self-attention heads | 已披露 | "two-head" self-attention(每个 elaborator) |
4.3 训练阶段 1:基础模型更新
在已见 K 类动物上,CARe 用 cross-entropy loss 训练 backbone \(E\)、general elaborator \(F_{gen}\)、所有 K 个 specific elaborators \(\{F^k_{specific}\}_{k=1}^K\)、classifier \(C\)。这一阶段最大化所有已见类的动作识别精度。
Loss 见 eq. eq_loss。需要注意:这一阶段只有已见类样本流过对应的 specific elaborator——\(D_k\) 走 \(F^k_{specific}\) 而不走 \(F^{j \neq k}_{specific}\)。
4.4 训练阶段 2:MLDG 训练 R
在阶段 1 之后,CARe 单独用 MLDG 算法训练 R 网络。具体步骤:
- 从 K 类中随机选 1 类作为虚拟 meta-test 类,其余 K-1 类作为 meta-train。
- Meta-train:用 K-1 类样本跨 R 计算 gradient,得到临时 R 参数 \(\phi'\)。
- Meta-test:用 meta-test(虚拟未见)的样本在 \(\phi'\) 下计算 CE loss。
- Meta update:用 meta-train 梯度(权重 \(1-\lambda\))+ meta-test 梯度(权重 \(\lambda\))更新 R 参数 \(\phi\)。
这两个阶段在训练中交替运行——阶段 1 让基础模型变强,阶段 2 让 R 在"虚拟未见"场景下学会合理输出相似度。两者的耦合让 CARe 最终在 truly unseen 类(spider, primate 等)上 work。
4.5 训练成本估算
基于 2-GPU + SGD + I3D backbone + 16 frames/video + 40 epochs 的配置,CARe 训练时长预计在数小时到 1 天量级(论文未直接给出绝对值)。论文 §1 提到的代码仓库已开源 SUTDCV/Animal_Kingdom——和数据集打包下载,包含 helper scripts 一键配置环境。
CARe 的推理流程对已见动物和未见动物完全不同——这是论文设计中需要格外强调的一点。下面逐一说明。
5.1 已见动物推理(常规路径)
推理流程与训练阶段 1 完全相同:
- 输入视频采样 16 帧 → resize 到 \(180 \times 320\);
- 送入 backbone \(E\) 得到 \(f_{base}\);
- 送入 \(F_{gen}\) 与对应已见类的 \(F^k_{specific}\);
- concat 特征送入 \(C\) 得到动作 logit;
- argmax 取动作类别。
这一路径在论文中没有刻意展示——因为它就是"基础模型的标准推理"。
5.2 未见动物推理(协作近似路径)
对于真正未见类,流程显著更复杂:
- 同样送入 \(E\) 得 \(f_{base}\);
- 同时送入所有 K 个 \(F^k_{specific}\),得 K 组 specific features \(\{f^k_{specific}\}_{k=1}^K\);
- 送入 \(R\) 计算相似度权重 \(\{w^k\}_{k=1}^K\);
- 协作组合:\(\hat{f}_{specific} = \frac{1}{K}\sum w^k \cdot f^k_{specific}\);
- 送入 \(F_{gen}\) 得 \(f_{gen}\);
- concat 两者(已用 \(\hat{f}_{specific}\) 替代真实 specific)送入 \(C\) 得到最终 logit。
推理时的算力消耗:对未见动物,CARe 需要计算 K 组 specific + 1 次 R + 1 次 classifier,比已见路径多 K 个 elaborator 的开销。这是一个可接受的代价——因为数据集规模下推理延迟远高于单次 elaborator forward(约几毫秒)。
训练 vs 推理对比的关键差异:
| 阶段 | 已见动物 | 未见动物 |
|---|---|---|
| 训练时 | 用真实 \(F^k_{specific}\)(K 类各 1 个) | 不参与训练 |
| 已见推理 | 用真实 \(F^k_{specific}\)(样本属于哪类就用哪类的) | 不适用 |
| 未见推理 | 不适用 | 用协作式近似的 \(\hat{f}_{specific}\)(R 输出的权重 + K 个 specific elaborators) |
5.3 推理成本评估
由于论文未明确给出 latency / throughput 数值,我们只能基于论文中给出的数据做近似估算。CARe 主干的算力分布:
- Backbone \(E\) (I3D early):占总 FLOPs 绝大部分。
- 4 (gen) + K×4 (specific) + 1 (R):每条 elaborator 路径都对 base feature 做 2 层 self-attention,开销较小。
- 未见动物路径每次推理多 K 次 elaborator + 1 次 R——这是精度提升的主要成本。
6.1 实验配置披露表
下表列出 4 个评测维度的实验配置硬件/评估细节。
| 评测维度 | 评估指标 | 测试集 | Baseline 列表 |
|---|---|---|---|
| 动作识别(baseline × 长尾) | overall mAP / head / middle / tail | AR 测试 20%(≈6K clips) | I3D, SlowFast, X3D × Focal/LDAM-DRW/EQL/CE |
| 动作识别(unseen class) | Accuracy % | 5 unseen class 全部(lizard/primate/spider/orthopteran/water fowl) | Episodic-DG, Mixup-DG, CARe ablation |
| 视频片段定位 | mean IoU, R@1 IoU∈{0.1, 0.3, 0.5, 0.7} | VG 测试 20% | VSLNet, LGI |
| 姿态估计 | PCK@0.05 | 3 协议(All / leave-k-out / 类内 80/20) | HRNet, HRNet-DARK |
6.2 动作识别:长尾方法 × Backbone 完整扫描(Table 3)
Animal Kingdom 的多标签动作识别数据天然 long-tailed——140 类的标注量高度不均。论文完整评估了 3 个 backbone × 4 个长尾方法 = 12 种组合。#Ng-et-al.-2022
| 组合 | overall mAP | head | middle | tail |
|---|---|---|---|---|
| Baseline (Cross-Entropy Loss) | ||||
| I3D #Carreira-and-Zisserman-2017 + CE | 16.48 | 46.39 | 20.68 | 12.28 |
| SlowFast #Feichtenhofer-et-al.-2019-SlowFast + CE | 20.46 | 54.52 | 27.68 | 15.07 |
| X3D #Feichtenhofer-2020-X3D + CE | 25.25 | 60.33 | 36.19 | 18.83 |
| Focal Loss #Lin-et-al.-2017-FocalLoss | ||||
| I3D + Focal | 26.49 | 64.72 | 40.18 | 19.07 |
| SlowFast + Focal | 24.74 | 60.72 | 34.59 | 18.51 |
| X3D + Focal | 28.85 | 64.44 | 39.72 | 22.41 |
| LDAM-DRW #Cao-et-al.-2019-LDAM | ||||
| I3D + LDAM-DRW | 22.40 | 53.26 | 27.73 | 17.82 |
| SlowFast + LDAM-DRW | 22.65 | 50.02 | 29.23 | 17.61 |
| X3D + LDAM-DRW | 30.54 | 62.46 | 39.48 | 24.96 |
| EQL #Tan-et-al.-2020-EQL | ||||
| I3D + EQL | 24.85 | 60.63 | 35.36 | 18.47 |
| SlowFast + EQL | 24.41 | 59.70 | 34.99 | 18.07 |
| X3D + EQL | 30.55 | 63.33 | 38.62 | 25.09 |
关键数字解读:
- 长尾方法普遍有效:所有 backbone 加任意长尾损失都比 baseline CE 显著提升——X3D 在 head/middle/tail 上分别提升了 3.00 / 2.43 / 6.26 个点。
- EQL 与 LDAM-DRW 并列最佳:X3D + EQL (30.55) ≈ X3D + LDAM-DRW (30.54),两者效果相当。
- X3D 始终最强:X3D 作为轻量化 backbone,在所有 4 个损失下都是 3 个 backbone 里最好的。这印证了 X3D 的 progressive expanding 思路在 cross-species 数据上依然可用。
- tail mAP 不到 1/3 of head:X3D+EQL 的 head 63.33 vs tail 25.09 → 长尾问题的本质挑战仍未解决。
6.3 CARe 消融 + 域泛化对比(Table 4)
这是论文方法论核心的验证。CARe 在 K=4 类动物(birds/fishes/frogs/snakes)训练、5 类未见动物(lizards/primates/spiders/orthopteran insects/water fowls)测试,并对比两类 baseline:(1) 跨类域泛化方法 Episodic-DG #Li-et-al.-2019-EpisodicDG 和 Mixup-DG #Wang-et-al.-2020-MixupDG;(2) CARe 自身的 4 个消融变体。#Ng-et-al.-2022
| 方法 | Accuracy (%) | 说明 |
|---|---|---|
| Episodic-DG #Li-et-al.-2019-EpisodicDG | 34.0 | 基于 episodic 任务的域泛化 baseline |
| Mixup-DG #Wang-et-al.-2020-MixupDG | 36.2 | 基于样本域间 mixup 的 baseline |
| CARe w/o specific feature | 27.3 | 去掉 specific,只用 \(f_{gen} + \hat{f}_{specific}\) 用均值 |
| CARe w/o general feature | 38.2 | 去掉 general,只用协作 specific |
| CARe w/o spatially-aware weighting | 37.1 | 权重 \(w^k\) 退化为标量,丢失空间异质性 |
| CARe(full) | 39.7 | 完整方法 |
消融表揭示了几个非平凡的设计选择:
- Specific feature 对 unseen 任务至关重要:去掉 specific feature 后精度从 39.7 暴跌到 27.3(-12.4 点)——这是全表最大跌幅。说明对未见动物,通用特征 + 协作特征 不够,必须有 specific feature 介入。
- General 也有不可替代的价值:去掉 general 只剩 38.2。差异 1.5 个点——general 的"跨类共有信息"对未见类提供了额外的泛化支撑。
- 空间感知权重贡献 2.6 点:从 37.1 到 39.7。印证了"动物身体不同部位对不同已见类的相似度独立"这一设计直觉。
- 超过域泛化 baseline:CARe full (39.7) > Mixup-DG (36.2) > Episodic-DG (34.0)。3.5 个点的领先是显著的——CARe 在 cross-species 任务上有特定领域优势。
6.4 视频片段定位结果(Table 5)
Animal Kingdom 的视频片段定位(video grounding)任务给定一段长视频 + 自然语言描述,要求定位描述对应的时间段。论文 §5.4 评估了 VSLNet #Zhang-et-al.-2020-VSLNet 和 LGI #Mun-et-al.-2020-LGI 两个 SOTA。#Ng-et-al.-2022
| Method | R@1, IoU=0.1 | R@1, IoU=0.3 | R@1, IoU=0.5 | R@1, IoU=0.7 | mean IoU |
|---|---|---|---|---|---|
| LGI | 50.84 | 33.51 | 19.74 | 8.94 | 22.90 |
| VSLNet | 53.59 | 33.74 | 20.83 | 12.22 | 25.02 |
6.5 姿态估计:三协议的对比(Table 6)
前文 Part 2 已经铺垫过姿态估计的三协议。这里给出 PCK@0.05 完整数据。
| 协议 | 说明 | HRNet | HRNet-DARK |
|---|---|---|---|
| Protocol 1 | All 80/20 split | 66.06 | 66.57 |
| Protocol 2 | leave-k-out (k=12 sub-classes) | 39.30 | 40.28 |
| Protocol 3 | 哺乳类 | 61.59 | 62.50 |
| Protocol 3 | 两栖类 | 56.74 | 57.85 |
| Protocol 3 | 爬行类 | 56.06 | 57.06 |
| Protocol 3 | 鸟类 | 77.35 | 77.41 |
| Protocol 3 | 鱼类 | 68.25 | 69.96 |
关键观察:
- HRNet-DARK 始终优于 HRNet,但优势微小(0.5-1.5 点)。
- 鸟类最高(77.4),可能因羽毛-身体对比明显,骨骼结构相对一致。
- 爬行 / 两栖类最低(57 左右),因为肢体形态变化大、伪装多、姿态视角多样。
- Protocol 2 vs Protocol 1 掉 27 点 仍然是最触目惊心的发现——cross-sub-class 姿态泛化还远未解决。
7.1 与同类数据集/方法的对比
| 维度 | Animal Kingdom | iWildCam #Beery-et-al.-2021-iWildCam | Snapshot Serengeti #Swanson-et-al.-2015-SnapshotSerengeti | Animal Pose #Cao-et-al.-2019-AnimalPose | MacaquePose #Labuguen-et-al.-2021-MacaquePose |
|---|---|---|---|---|---|
| 物种数 | 850+ | ~250 | ~61 | 5+7 | 1(猴) |
| 任务 | VG + AR + PE 三任务 | 分类 | 分类 | 姿态 | 姿态 |
| 模态 | 视频(50h) | 触发相机图 | 触发相机图 | 图像 | 实验室视频 |
| 环境 | 野生 + 多样 | 红外野外 | 草原固定点 | 多样 | 实验室 |
| 动作类别 | 140 行为 | — | — | — | — |
| 代码 / 数据 | 全开源 | 公开挑战 | 公开 | 公开 | 公开 |
Animal Kingdom 的核心位置:在数据集维度上比 iWildCam / Snapshot Serengeti 更宽(850 vs 250/61 物种),比 Animal Pose 更全(视频 + 多任务 vs 图像 + 姿态),在代码 + 数据集可获得性上完全开放。这是当前"动物视觉" benchmark 中最完整的实证。
7.2 CARe 与跨类域泛化方法谱系
| 维度 | CARe | Episodic-DG | Mixup-DG | 零样本学习 |
|---|---|---|---|---|
| 核心思路 | general + 协作 specific + MLDG | episodic task split | 跨域样本 mixup | 语义嵌入最近邻 |
| 依赖语义描述 | 不需要 | 不需要 | 不需要 | 需要 |
| 空间感知 | ✓(张量权重) | — | — | — |
| Animal Kingdom 上精度 | 39.7% | 34.0% | 36.2% | — |
| Meta-Learning 用量 | 重(MLDG 训练 R) | 轻 | 无 | 无 |
7.3 局限性
- Protocol 2 掉 27 点的开放性:cross-sub-class 姿态估计仍是开放问题——HRNet 在 K=12 unseen 上 PCK@0.05 仅 39-40。这指向"如何学到部位级别的跨物种共享特征"这一深层研究问题。
- 长尾问题未见彻底解决:X3D+EQL 最好的 tail mAP 25.09,仍只有 head 63.33 的 39.6%。#Ng-et-al.-2022 这意味着某些动物专属动作(如"snake spitting venom")几乎不可能在标准 cross-entropy 训练中学到——可能需要额外 few-shot 或 meta-learning 介入。
- 视频片段定位 IoU=0.7 表现差:12.22% 的 R@1 (IoU=0.7) 说明模型对时间边界的精度仍有很大提升空间。语言描述(如"the leopard was stalking")本身的边界就很模糊,这是任务定义而非模型的局限。
- 实施细节披露不完整:batch size、训练时长(小时/天)、GPU 型号、MLDG 算法的超参 (\(\alpha, \beta, \lambda\)) 在原文中均未明确给出,复现时需要按 2-GPU + batch size 4-16 等常规 CV 训练经验自调。
- CARe 39.7% 的精度仍偏低:虽然显著超过 Mixup-DG (36.2),但绝对值上仍未达到"实用"水平。考虑到测试时是真的未见类(训练时连一张图都没见过),可以理解;但仍有改善空间。
- 6 大类中 5 类都做姿态:昆虫因为解剖结构差异过大(外骨骼 vs 内骨骼)被排除出姿态任务——意味着论文在"全面的动物姿态"上仍有结构性缺口。
7.4 可操作启发
- 任何"跨物种"行为识别系统都应考虑 general + specific 双特征。CARe 的设计思路可以推广到动作识别以外的跨类任务(如跨人种 / 跨年龄段 / 跨体型的视觉识别)。
- MLDG 是"虚拟 unseen"训练的标准工具。当你有"K 个源域"且需要泛化到 unknown target 时,把一个源域随机抽出来当 meta-test,其余当 meta-train,是稳定且低成本的做法。论文 §3 的 Algorithm 1 是良好模板。
- 长尾数据集一定要 head / middle / tail 分段报告。整体 mAP 看不到头部主导问题。Animal Kingdom 把评估指标三维拆解,可以作为同类数据集的参照。
- 空间感知张量权重是个通用 trick。把标量权重升级为空间张量以表达"空间位置相关"的相似度——不仅适用于 CARe,也适用于任何 feature fusion 场景(如多视角融合、多模态融合)。
- CV 数据集基准应该向 CVPR 2022 Animal Kingdom 学习——同时提供多任务 + 统一代码发布 + 多维度评估指标 + 跨域泛化能力评估。这是新时代视觉数据集的标杆。
参考来源
- Ng, X. L., Ong, K. E., Zheng, Q., Ni, Y., Yeo, S. Y., Liu, J. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022 (Oral). arXiv:2204.08129 · GitHub: SUTDCV/Animal_Kingdom
- Carreira, J., Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR 2017. arXiv:1705.07750
- Feichtenhofer, C., Fan, H., Malik, J., He, K. (2019). SlowFast Networks for Video Recognition. ICCV 2019. arXiv:1812.03982
- Feichtenhofer, C. (2020). X3D: Progressive Expanding Model for Efficient Video Recognition. CVPR 2020. arXiv:2004.04730
- Sun, K., Xiao, B., Liu, C., Wang, X., Tang, J. (2019). Deep High-Resolution Representation Learning for Visual Recognition. CVPR 2019 / TPAMI 2020. arXiv:1908.07919
- Zhang, F., Zhu, X., Wang, C., Mei, Y., Liu, W., Wang, Q. (2020). Distribution-Aware Coordinate Representation for Human Pose Estimation. CVPR 2020. arXiv:1910.06278
- Mun, J., Cho, M., Han, B. (2020). Localizing Moments in Video with Natural Language. ICCV 2021 / arXiv 2020. arXiv:2008.09037
- Zhang, H., Sun, A., Jing, W., Zhou, J. T. (2020). Span-based Localizing Network for Natural Language Video Localization. ECCV 2020. arXiv:2004.13931
- Li, D., Yang, Y., Song, Y.-Z., Hospedales, T. (2018). Learning to Generalize: Meta-Learning for Domain Generalization. AAAI 2018. arXiv:1710.03463
- Li, D., Zhang, J., Yang, Y., Liu, C., Song, Y.-Z., Hospedales, T. (2019). Episodic Training for Domain Generalization. ICCV 2019. arXiv:1903.04063
- Wang, H., He, H., Oyen, D., Yang, Z., Lin, M. (2020). Heterogeneous Domain Generalization With Domain-Specific Regressors via Weighted Combination Coefficients. T-PAMI. (Mixup-DG)
- Girdhar, R., Carreira, J., Doersch, C., Zisserman, A. (2019). Video Action Transformer Network. CVPR 2019. arXiv:1812.02707
- Lin, T.-Y., Goyal, P., Girshick, R., He, K., Dollár, P. (2017). Focal Loss for Dense Object Detection. ICCV 2017. arXiv:1708.02002
- Cao, K., Wei, C., Gaidon, A., Arechiga, N., Ma, T. (2019). Learning Imbalanced Datasets with Label-Distribution-Aware Margin Loss. NeurIPS 2019. arXiv:1906.07413
- Tan, J., Wang, C., Li, B., Li, Q., Ouyang, W., Yin, C., Yan, J. (2020). Equalization Loss for Long-Tailed Object Recognition. CVPR 2020. arXiv:2003.05176
- Cao, J., Tang, H., Fang, H.-S., Shen, X., Lu, C., Tai, Y.-W. (2019). Cross-Domain Adaptation for Animal Pose Estimation. ICCV 2019. arXiv:1908.05806
- Mathis, A., Yüksekgönül, M., Rogers, S., Bethge, M., Mathis, M. (2020). DeepLabCut: Markerless Pose Estimation of User-Defined Body Parts with Deep Learning. Nature Protocols. Nature Protocols
- Graving, J. M., Chae, D., Naik, H., Li, L., Koger, B., Costelloe, B. R., Couzin, I. D. (2019). DeepPoseKit, a software toolkit for fast and robust animal pose estimation using deep learning. eLife 8:e47994. eLife
- Karashchuk, P., Rupp, K. L., Dickinson, E. S., Woolford, S. J., Tavoni, G., Sajid, A., ... Tytell, E. D. (2021). Anipose: A framework for markerless motion capture in freely-moving animals. bioRxiv. bioRxiv 2020.09.14.295766
- Beery, S., Agarwal, A., Cole, E., Birodkar, V. (2021). The iWildCam 2021 Competition Dataset. arXiv 2021 / CVPR FGVC Workshop. arXiv:2105.03494
- Swanson, A., Kosmala, M., Lintott, C., Simpson, R., Smith, A., Packer, C. (2015). Snapshot Serengeti, high-frequency annotated camera trap images of 40 mammalian species in an African savanna. Scientific Data 2: 150026. Nature: Scientific Data
- Labuguen, R., Matsumoto, J., White, S., Rogel, A., Kogo, J., Rehhorn, M., ... Yamada, Y. (2021). MacaquePose: A Novel Dataset for Macaque Pose Estimation in the Wild and its Benchmark Evaluation. arXiv 2021. arXiv:2112.13793
- Anderson, D. J., Perona, P. (2014). Toward a science of computational ethology. Neuron 84(1): 18-31. Neuron
- Sigurdsson, G. A., Varol, G., Wang, X., Farhadi, A., Laptev, I., Gupta, A. (2016). Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding. ECCV 2016. mAP 评估指标的引用依据。