ESC
输入关键词搜索文章
目录

Animal Kingdom 论文精读

CVPR 2022 Oral · 850 物种行为理解标杆数据集
数据集 + CARe 协作特征双贡献,让未见动物的动作识别 accuracy 从 36.2 提升到 39.7。
50h视频片段定位
30K动作识别 clips
33K姿态估计帧
850物种 × 6 大类

论文信息

一句话读懂:Animal Kingdom 是 CVPR 2022 Oral 中首个跨 850 物种、跨 6 大类、统一视频片段定位 + 多标签动作识别 + 姿态估计三任务的野生动物数据集,并把 CARe 这种协作式 general + specific feature + MLDG 元学习范式带到了动物动作识别——首次让"训练时见的 K 种动物"的经验能迁移到未见的 5 种新动物(spider、primate、water fowl 等)上。#Ng-et-al.-2022

系列定位

本文是动作识别系列论文精读第五篇,承接 SkeleTR(骨架 / wild 两阶段)、IGMN(身份感知时序动作) 等动作识别专题,向大模型可用的"动 + 主体 + 场景"统一生态走。

Animal Kingdom 与 SkeleTR 完全不同路线:SkeleTR 关心如何在 wild 场景中识别人的动作,Animal Kingdom 关心如何在 850 种动物类间实现跨物种动作识别。前者是骨架模态范式的新设计,后者是"数据集 + 跨类方法"双贡献。

Part 1
引言:从一只果蝇到 850 个物种的动物王国

从 Anderson and Perona 在 2014 年 Neuron 上呼吁建立"计算行为学"(computational ethology)这个学科以来,动物行为分析已经走过十余年的发展历程。#Anderson-and-Perona-2014 早期 DeepPoseKit、DeepLabCut 这样的 markerless 姿态估计工具让小鼠、黑腹果蝇、自由放养的猴子等实验室物种的行为学量化成为可能。#Graving-et-al.-2019 #Mathis-et-al.-2020-DeepLabCut #Karashchuk-et-al.-2021-Anipose 紧接着,iWildCam、Snapshot Serengeti 这类大野外数据集把红外触发相机阵列推向了生态保护,每个数据集通常达到数万到数百万张图像。#Beery-et-al.-2021-iWildCam #Swanson-et-al.-2015-SnapshotSerengeti

但截至 2022 年之前,几乎没有数据集能同时满足四件事:(1) 真正多物种(远超 100 类)、(2) 野生环境(背景、光照、视角、天气变化多)、(3) 视频(保留时间维度的细粒度动作)、(4) 多任务统一标注(同时标注动作识别、视频片段定位、姿态估计)。

Animal Kingdom 是首个把这四件事一次性补齐的数据集。论文 §1 概括了其规模:从 YouTube 收集 50 小时 视频,做 30,100 段动作识别片段(平均 6 秒,最长 117 秒),并标注 33,000 帧姿态样本,覆盖 850+ 个物种、6 大类动物(哺乳类、爬行类、两栖类、鸟类、鱼类、昆虫类)。#Ng-et-al.-2022 这三个数字(上文 50/30K/33K)正好对应三任务的规模。

为什么这件事的"经济意义"也不可小觑:论文 §1 引言引述,世界每年在野生动物保护上花费至少 $75 billion,而其中关键环节"识别动物是否异常行为"长期依赖人工巡护——这正是数据驱动方法可以大规模替代的环节。#Ng-et-al.-2022 仅这一点,Animal Kingdom 的潜在社会影响就远超其学术层面的贡献——它不仅是一个数据集,更是一个产业基础设施的"训练弹药"。

CVPR 2022 Oral 是这个数据集所获认可的标志。CVPR 在该年度的投稿近万篇,Oral 录取率约 5%(约 200+ 篇),代表审稿人对"贡献度 + 影响力 + 严谨性"三方面的综合认可。#Ng-et-al.-2022 据官方页面,数据集与代码已 公开发布——任何研究者都可以申请下载数据集 + 配套代码,并直接用 helper scripts 一键部署环境。

850+ 物种在 6 大类的分布
图 1:Animal Kingdom 数据集的物种分布。物种按外观、肢数、移动方式聚成 6 大类,再细分为 sub-classes。这是论文 Table 1(数据集对比)的核心可视化——也是 why 850+ species matters 的直接证据。(来源:Animal Kingdom, supp Fig.1)
6 大类动物示例
图 2:6 大类的代表性物种示例。从哺乳类、爬行类、两栖类、鸟类、鱼类到昆虫类,每个大类都跨越了体型、骨骼、表面纹理、生活环境等维度的极端多样性。(来源:Animal Kingdom, supp Fig.2)
Part 2
问题剖析:既有数据集为何满足不了"跨物种 + 真实环境 + 多任务"

2.1 既有动物行为数据集的四大局限

论文 §1 把既有数据集的缺陷抽象为四个维度,这也是后续论文"为何必须有这个数据集"的论证骨架:

  1. 规模与标注稀缺:Animal Pose (#Cao-et-al.-2019-AnimalPose) 的 5+7 物种数据集、MacaquePose (#Labuguen-et-al.-2021-MacaquePose) 的单种猴类,已经足够支撑小规模实验,但跨物种泛化研究没法用——数据集不够大。
  2. 物种多样性不足:iWildCam、Snapshot Serengeti 等野外触发相机数据集虽然规模大,但目标都是单一生物群(草原大型哺乳动物,或野外红外阵列)。#Beery-et-al.-2021-iWildCam #Swanson-et-al.-2015-SnapshotSerengeti 论文 §2 在 Related Work 中说"most of the current datasets are still relatively small, disparate, animal and environment-specific"——它们难以服务于"跨物种共享特征的迁移学习"研究。
  3. 环境单一:Animal Pose 跨越多个动物种类,但仍以外部 BBox 区域 crop为主,环境背景相对简单;MacaquePose 全部来自实验室拍摄。论文 §1 强调需要"varying backgrounds, viewpoints, illumination and weather conditions"——野生多样性是模型泛化的关键。
  4. 任务单维:iWildCam 提供分类、Animal Pose 仅姿态、MacaquePose 仅姿态……一个数据集同时支持"动作识别 + 姿态估计 + 视频片段定位"的几乎不存在。这阻碍了联合训练跨任务迁移研究。
反直觉观察:上述四点是"数据不足"、"标注不足"的双重短缺——它们不是同一个问题,但都让"跨物种行为识别"难以实证。Animal Kingdom 之所以能成为 CVPR 2022 Oral,正是因为它用一个 23 人团队、3 轮交叉校验的工作,同时把四个维度全部推到了实用规模#Ng-et-al.-2022

2.2 Protocol 2 揭示的根本性难度

Animal Kingdom 的姿态估计部分还专门设计了一个leave-k-out 协议 (Protocol 2):把 12 个 sub-class 完全留出训练,测试时再让模型去估计这些未见 sub-class 的姿态。这一协议直接量化了"跨物种姿态泛化"的真实难度。

论文 §5.5 的实验结果令人警醒:

协议HRNet PCK@0.05HRNet-DARK PCK@0.05
Protocol 1:全 80/20 split66.0666.57
Protocol 2:leave-k-out (k=12)39.3040.28
Protocol 3(五大类各自):哺乳类61.5962.50
Protocol 3:两栖类56.7457.85
Protocol 3:爬行类56.0657.06
Protocol 3:鸟类77.3577.41
Protocol 3:鱼类68.2569.96

关键数字:从 Protocol 1 到 Protocol 2,HRNet 的 PCK@0.05 从 66.06 → 39.30,整整掉了 26.76 个点。这意味着 cross-class 姿态泛化目前在 SOTA 模型上还远远不够#Ng-et-al.-2022 这一发现本身就是 Animal Kingdom 的核心贡献之一——它给社区提供了一个"开放问题"的标准化实验台。

而 Protocol 3 显示:鸟类(77.4)远高于爬行类(57.1)和两栖类(57.9),因为后两者肢体形态变化大、伪装多、关键点位置高度异质。这一模式在 CARe 的设计动机中也会再次出现——动物之间的相似性是空间位置相关的。

Part 3
CARe 架构详解:让"见过 K 种"的知识迁移到"未见"的物种

论文的核心方法论贡献是 Collaborative Action Recognition (CARe) 模型。它解决了一个诱人的问题:如何用 K 种已见动物的训练数据,让模型在推理时识别另 5 种完全没见过的动物执行同一组动作? 这是典型的跨类域泛化(cross-class domain generalization)问题。#Ng-et-al.-2022

3.1 问题形式化

训练数据被分为 K 类:\(\mathbf{D} = \{D_k\}_{k=1}^{K}\),每类 \(D_k = \{(x_n^k, y_n^k)\}_{n=1}^{N_k}\),其中 \(x_n^k\) 是第 k 种动物的第 n 个视频动作样本,\(y_n^k\) 是对应的多标签动作标签(多标签意味着同一段视频可同时标注多个动作,例如"swimming + hunting")。

推理时遇到训练时完全没见过的新动物类,需要识别同一组动作。这一问题与零样本学习(ZSL)的关系:CARe 不依赖未见类的语义嵌入(不需要预先手工写出未见类的特征描述),而是直接用已见类的特征做协作组合,因此更接近域泛化(Domain Generalization)。

3.2 基础架构:双流 General + Specific Features

CARe 把 backbone 之后的特征拆成两类

  • 通用特征 \(f_{gen}\):由 所有 K 类动物 的样本都流过的 elaborator \(F_{gen}\) 提取 → 学到的是"什么是 generic 的动物动作"。
  • 特定特征 \(f^k_{specific}\):由 只有第 k 类动物样本 经过的 elaborator \(F^k_{specific}\) 提取 → 学到的是"第 k 类动物独特的行为模式"。

预测时把两者 concat 送入分类器:

$$\hat{y}_n^k = C\Big(F_{gen}\big(E(x_n^k)\big),\; F^k_{specific}\big(E(x_n^k)\big)\Big)$$
$$\ell = \ell_{CE}(\hat{y}_n^k,\; y_n^k) \quad\quad \text{(eq. eq\_loss)}$$

直觉:因为 \(F_{gen}\) 见过更多样的数据(所有 K 类),它的特征在不同类间更通用\(F_{specific}^k\) 因为只看到一种动物,它的特征会"过度适配",但同时也保留该类独有的细粒度细节。两者拼接,通用识别能力 + 物种特定细节。互补性是这一设计的关键。

CARe 基础架构
图 3:CARe 基础架构。视频经 I3D backbone \(E\) 得到 \(f_{base}\),并行送入共享的 \(F_{gen}\) 与 K 个 \(F^k_{specific}\),concat 后由 classifier \(C\) 输出动作 logit。(来源:Animal Kingdom, main Fig.2 / arch.png)

3.3 处理未见动物:Relevance Evaluator + 协作近似

基础版本处理未见动物时遇到困难——没有与未见类对应的 \(F_{specific}\)。论文 §3 的核心洞察是:

动物之间共享不同程度的外观与行为相似性
例:猎豹和老虎的相似度远大于它们与蛇的相似度。
利用这种相似度,可以协作式地近似出未见动物的 specific feature。#Ng-et-al.-2022

于是论文引入 relevance evaluator \(R\)。给定一个未见动物的视频样本 \(x\)\(R\) 计算它与 K 个已见类的相似度:

$$\mathbf{w} = R\Big(f_{base},\; \{f^k_{specific}\}_{k=1}^K\Big),\quad \mathbf{w} = \{w^k\}_{k=1}^K$$

然后用 K 个 existing specific elaborators 按权重组合,得到未见动物的近似 specific feature:

$$\hat{f}_{specific} = \frac{1}{K}\sum_{k=1}^{K} w^k \cdot f^k_{specific} \quad\quad \text{(eq. eq\_moe)}$$

关键创新:空间感知张量权重。论文 §3 还提到,\(w^k\) 不必是标量——可以做成 tensor \(w^k \in \mathbb{R}^{h \times w}\)。这样不同身体部位的相似度独立计算,不同已见动物按部位分别贡献——某一种特征 elaborator 可能对头部相似,对尾巴不相似,张量化权重自然处理了这种空间异质性。

消融实验 §5.3 直接验证了 spatial-aware 的必要性:去掉 spatial-aware → 39.7% 掉到 37.1%(-2.6 点)。#Ng-et-al.-2022

CARe 完整架构(含 R)
图 4:CARe 完整架构。补充材料展示了 R 网络的内部结构——\(R_{conv1}, R_{conv2}\) + K 个 \(R^k_{linear}\) 线性层,分别输出 \(w^k\)。(来源:Animal Kingdom, supp Fig.1)

3.4 用 Meta-Learning 训练 R:MLDG 算法

R 网络的训练需要让它在真正未见的动物类上也能给出好相似度——这是一个直接优化难以处理的目标。论文借鉴了 MLDG 算法#Li-et-al.-2018-MLDG(meta-learning for domain generalization)的思想:

  1. 将训练集中 K 类动物划分为 meta-train(K-1 类)和 meta-test(1 类,扮演"虚拟未见")。
  2. 在 meta-train 上做一步梯度下降得到临时参数 \(\phi'\)
  3. 在 meta-test 上用 \(\phi'\) 计算"虚拟未见" loss。
  4. 最终用 meta-train 梯度 + meta-test 梯度共同更新 R 参数 \(\phi\)

补充材料 Algorithm 1 给出完整伪代码:

$$\phi' \leftarrow \phi - \alpha \nabla_\phi \ell_{mtrain}(\phi) \quad \text{(meta-train)}$$
$$\ell_{mtest} = \ell_{CE}(\hat{y}(\phi'), y)$$
$$\phi \leftarrow \phi - \beta\Big((1-\lambda)\nabla_\phi \ell_{mtrain}(\phi) + \lambda \nabla_\phi \ell_{mtest}(\phi')\Big) \quad \text{(meta update)}$$

为何能 work 的直觉:R 在训练时就已经"见过" K-1 vs 1 的虚拟 unseen 场景,这意味着 R 在测试阶段遇到真正的新类时,分布偏移已经被模拟过——它真正"学会了如何把 seen 知识迁到 unseen"。#Ng-et-al.-2022

3.5 实现细节

  • Backbone \(E\):I3D 早期部分——\(E_{conv1}, E_{conv2}, E_{conv3}\) 三层 3D 卷积 + 两层 max pooling + 一个 Inception 子模块。#Carreira-and-Zisserman-2017 输入 \(x \in \mathbb{R}^{3 \times 16 \times 180 \times 320}\),输出 \(f_{base} \in \mathbb{R}^{256 \times 8 \times 23 \times 40}\)
  • Elaborators \(F_{gen}, F^k_{specific}\):每个由 2 层 lightweight two-head self-attention 构成,源自 Video Action Transformer (VAT) 网络。#Girdhar-et-al.-2019-VAT 输出特征尺寸 \(\mathbb{R}^{4 \times 12 \times 20}\)
  • Classifier \(C\):1 个线性层,把 flattened+concat 的 \((f_{gen}, f_{specific})\) 映射到 \(\hat{y} \in \mathbb{R}^M\)\(M = 140\) 类动作。
  • Relevance Evaluator \(R\)\(R_{conv1}, R_{conv2}\) 卷积变换 + K 个线性 \(R^k_{linear}\),每条路径把变换后的 base feature 与 \(f^k_{specific}\) flatten+concat 投影到 \(w^k\)

最终架构见补充材料图 + 上图 4。

Part 4
训练 CARe:双阶段交替 + MLDG

4.1 训练数据

CARe 的训练数据来源于 Animal Kingdom 数据集自身。具体:

  • 从 140 动作中选 6 个"跨类共享"的动作子集:moving, eating, attending, swimming, sensing, keeping still
  • 训练集(已见 K=4 类):birds, fishes, frogs, snakes。
  • 测试集(未见类 5 类):lizards, primates, spiders, orthopteran insects, water fowls。
  • 每段视频只包含一个动作实例(方便评估 accuracy)。

这是一个典型的"跨类泛化"实验设计——和 image classification 的"4 训练 class / 5 真正 unseen test class"模式一致。

4.2 训练配置披露表

下表系统列出 CARe 训练的全部 10 项硬性字段。原论文(main + supplementary)中有披露的项已标明值,未披露的项明确标记"未披露"。

配置项披露状态值 / 说明
训练数据已披露Animal Kingdom 6 个共享动作的子集;训练集 K=4 类(birds/fishes/frogs/snakes),测试 5 类未见
训练硬件部分披露"2-GPU implementation";型号未明确给出
优化器已披露SGD;momentum / weight_decay 未披露
学习率已披露backbone \(E\)0.001;其他组件:0.01;后 10 epochs 衰减到初始的 10%
Batch size未披露原文未给出
训练步数 / 轮数已披露40 epochs = 30 epochs 初始 LR + 10 epochs 衰减 LR
训练时长未披露原文未给出
模型参数量未披露各模块维度已给出(256×8×23×40 base feature),总参数未给
精度格式未披露未明确给出
Checkpoint 策略未披露原文未给出
Input 分辨率已披露3 × 16 × 180 × 320(RGB × 帧数 × 高 × 宽)
Backbone 初始化已披露在 ImageNet + Kinetics 上预训练的 I3D
Input frames / video已披露每段视频随机采 16 帧
Self-attention heads已披露"two-head" self-attention(每个 elaborator)

4.3 训练阶段 1:基础模型更新

在已见 K 类动物上,CARe 用 cross-entropy loss 训练 backbone \(E\)、general elaborator \(F_{gen}\)、所有 K 个 specific elaborators \(\{F^k_{specific}\}_{k=1}^K\)、classifier \(C\)。这一阶段最大化所有已见类的动作识别精度。

Loss 见 eq. eq_loss。需要注意:这一阶段只有已见类样本流过对应的 specific elaborator——\(D_k\)\(F^k_{specific}\) 而不走 \(F^{j \neq k}_{specific}\)

4.4 训练阶段 2:MLDG 训练 R

在阶段 1 之后,CARe 单独用 MLDG 算法训练 R 网络。具体步骤:

  1. 从 K 类中随机选 1 类作为虚拟 meta-test 类,其余 K-1 类作为 meta-train。
  2. Meta-train:用 K-1 类样本跨 R 计算 gradient,得到临时 R 参数 \(\phi'\)
  3. Meta-test:用 meta-test(虚拟未见)的样本在 \(\phi'\) 下计算 CE loss。
  4. Meta update:用 meta-train 梯度(权重 \(1-\lambda\))+ meta-test 梯度(权重 \(\lambda\))更新 R 参数 \(\phi\)

这两个阶段在训练中交替运行——阶段 1 让基础模型变强,阶段 2 让 R 在"虚拟未见"场景下学会合理输出相似度。两者的耦合让 CARe 最终在 truly unseen 类(spider, primate 等)上 work。

4.5 训练成本估算

基于 2-GPU + SGD + I3D backbone + 16 frames/video + 40 epochs 的配置,CARe 训练时长预计在数小时到 1 天量级(论文未直接给出绝对值)。论文 §1 提到的代码仓库已开源 SUTDCV/Animal_Kingdom——和数据集打包下载,包含 helper scripts 一键配置环境。

复现提示:论文未明确披露 batch size 与 GPU 型号,复现时建议从 batch size 8-16(per-GPU)开始尝试。若 2 卡 P100 / V100 跑不动,尝试把 batch size 降到 4,因为 I3D backbone 在该 backbone 早期输出上占用显存。
Part 5
推理 CARe:已见 / 未见两条完全不同路径

CARe 的推理流程对已见动物和未见动物完全不同——这是论文设计中需要格外强调的一点。下面逐一说明。

5.1 已见动物推理(常规路径)

推理流程与训练阶段 1 完全相同:

  1. 输入视频采样 16 帧 → resize 到 \(180 \times 320\)
  2. 送入 backbone \(E\) 得到 \(f_{base}\)
  3. 送入 \(F_{gen}\) 与对应已见类的 \(F^k_{specific}\)
  4. concat 特征送入 \(C\) 得到动作 logit;
  5. argmax 取动作类别。

这一路径在论文中没有刻意展示——因为它就是"基础模型的标准推理"。

5.2 未见动物推理(协作近似路径)

对于真正未见类,流程显著更复杂:

  1. 同样送入 \(E\)\(f_{base}\)
  2. 同时送入所有 K 个 \(F^k_{specific}\),得 K 组 specific features \(\{f^k_{specific}\}_{k=1}^K\)
  3. 送入 \(R\) 计算相似度权重 \(\{w^k\}_{k=1}^K\)
  4. 协作组合:\(\hat{f}_{specific} = \frac{1}{K}\sum w^k \cdot f^k_{specific}\)
  5. 送入 \(F_{gen}\)\(f_{gen}\)
  6. concat 两者(已用 \(\hat{f}_{specific}\) 替代真实 specific)送入 \(C\) 得到最终 logit。

推理时的算力消耗:对未见动物,CARe 需要计算 K 组 specific + 1 次 R + 1 次 classifier,比已见路径多 K 个 elaborator 的开销。这是一个可接受的代价——因为数据集规模下推理延迟远高于单次 elaborator forward(约几毫秒)。

训练 vs 推理对比的关键差异

阶段已见动物未见动物
训练时用真实 \(F^k_{specific}\)(K 类各 1 个)不参与训练
已见推理用真实 \(F^k_{specific}\)(样本属于哪类就用哪类的)不适用
未见推理不适用用协作式近似的 \(\hat{f}_{specific}\)(R 输出的权重 + K 个 specific elaborators)

5.3 推理成本评估

由于论文未明确给出 latency / throughput 数值,我们只能基于论文中给出的数据做近似估算。CARe 主干的算力分布:

  • Backbone \(E\) (I3D early):占总 FLOPs 绝大部分。
  • 4 (gen) + K×4 (specific) + 1 (R):每条 elaborator 路径都对 base feature 做 2 层 self-attention,开销较小。
  • 未见动物路径每次推理多 K 次 elaborator + 1 次 R——这是精度提升的主要成本
实用价值:CARe 的"未见动物推理"路径设计的核心优势在于无需重新训练就能对训练时完全没见过的新物种做动作识别。这一特性让 Animal Kingdom + CARe 范式特别适合生物多样性监测——实践中发现某种新物种的样本时,不需要重新训练模型,只需让 R + K 个 specific elaborators 协作即可。这在生产部署上是显著的成本节约。
Part 6
实验验证:三任务 + 失败案例的全面图景

6.1 实验配置披露表

下表列出 4 个评测维度的实验配置硬件/评估细节。

评测维度评估指标测试集Baseline 列表
动作识别(baseline × 长尾)overall mAP / head / middle / tailAR 测试 20%(≈6K clips)I3D, SlowFast, X3D × Focal/LDAM-DRW/EQL/CE
动作识别(unseen class)Accuracy %5 unseen class 全部(lizard/primate/spider/orthopteran/water fowl)Episodic-DG, Mixup-DG, CARe ablation
视频片段定位mean IoU, R@1 IoU∈{0.1, 0.3, 0.5, 0.7}VG 测试 20%VSLNet, LGI
姿态估计PCK@0.053 协议(All / leave-k-out / 类内 80/20)HRNet, HRNet-DARK

6.2 动作识别:长尾方法 × Backbone 完整扫描(Table 3)

Animal Kingdom 的多标签动作识别数据天然 long-tailed——140 类的标注量高度不均。论文完整评估了 3 个 backbone × 4 个长尾方法 = 12 种组合。#Ng-et-al.-2022

组合overall mAPheadmiddletail
Baseline (Cross-Entropy Loss)
I3D #Carreira-and-Zisserman-2017 + CE16.4846.3920.6812.28
SlowFast #Feichtenhofer-et-al.-2019-SlowFast + CE20.4654.5227.6815.07
X3D #Feichtenhofer-2020-X3D + CE25.2560.3336.1918.83
Focal Loss #Lin-et-al.-2017-FocalLoss
I3D + Focal26.4964.7240.1819.07
SlowFast + Focal24.7460.7234.5918.51
X3D + Focal28.8564.4439.7222.41
LDAM-DRW #Cao-et-al.-2019-LDAM
I3D + LDAM-DRW22.4053.2627.7317.82
SlowFast + LDAM-DRW22.6550.0229.2317.61
X3D + LDAM-DRW30.5462.4639.4824.96
EQL #Tan-et-al.-2020-EQL
I3D + EQL24.8560.6335.3618.47
SlowFast + EQL24.4159.7034.9918.07
X3D + EQL30.5563.3338.6225.09

关键数字解读:

  • 长尾方法普遍有效:所有 backbone 加任意长尾损失都比 baseline CE 显著提升——X3D 在 head/middle/tail 上分别提升了 3.00 / 2.43 / 6.26 个点。
  • EQL 与 LDAM-DRW 并列最佳:X3D + EQL (30.55) ≈ X3D + LDAM-DRW (30.54),两者效果相当。
  • X3D 始终最强:X3D 作为轻量化 backbone,在所有 4 个损失下都是 3 个 backbone 里最好的。这印证了 X3D 的 progressive expanding 思路在 cross-species 数据上依然可用。
  • tail mAP 不到 1/3 of head:X3D+EQL 的 head 63.33 vs tail 25.09 → 长尾问题的本质挑战仍未解决。

6.3 CARe 消融 + 域泛化对比(Table 4)

这是论文方法论核心的验证。CARe 在 K=4 类动物(birds/fishes/frogs/snakes)训练、5 类未见动物(lizards/primates/spiders/orthopteran insects/water fowls)测试,并对比两类 baseline:(1) 跨类域泛化方法 Episodic-DG #Li-et-al.-2019-EpisodicDG 和 Mixup-DG #Wang-et-al.-2020-MixupDG;(2) CARe 自身的 4 个消融变体。#Ng-et-al.-2022

方法Accuracy (%)说明
Episodic-DG #Li-et-al.-2019-EpisodicDG34.0基于 episodic 任务的域泛化 baseline
Mixup-DG #Wang-et-al.-2020-MixupDG36.2基于样本域间 mixup 的 baseline
CARe w/o specific feature27.3去掉 specific,只用 \(f_{gen} + \hat{f}_{specific}\) 用均值
CARe w/o general feature38.2去掉 general,只用协作 specific
CARe w/o spatially-aware weighting37.1权重 \(w^k\) 退化为标量,丢失空间异质性
CARe(full)39.7完整方法

消融表揭示了几个非平凡的设计选择:

  • Specific feature 对 unseen 任务至关重要:去掉 specific feature 后精度从 39.7 暴跌到 27.3(-12.4 点)——这是全表最大跌幅。说明对未见动物,通用特征 + 协作特征 不够,必须有 specific feature 介入。
  • General 也有不可替代的价值:去掉 general 只剩 38.2。差异 1.5 个点——general 的"跨类共有信息"对未见类提供了额外的泛化支撑。
  • 空间感知权重贡献 2.6 点:从 37.1 到 39.7。印证了"动物身体不同部位对不同已见类的相似度独立"这一设计直觉。
  • 超过域泛化 baseline:CARe full (39.7) > Mixup-DG (36.2) > Episodic-DG (34.0)。3.5 个点的领先是显著的——CARe 在 cross-species 任务上有特定领域优势

6.4 视频片段定位结果(Table 5)

Animal Kingdom 的视频片段定位(video grounding)任务给定一段长视频 + 自然语言描述,要求定位描述对应的时间段。论文 §5.4 评估了 VSLNet #Zhang-et-al.-2020-VSLNet 和 LGI #Mun-et-al.-2020-LGI 两个 SOTA。#Ng-et-al.-2022

MethodR@1, IoU=0.1R@1, IoU=0.3R@1, IoU=0.5R@1, IoU=0.7mean IoU
LGI50.8433.5119.748.9422.90
VSLNet53.5933.7420.8312.2225.02
失败案例分析:从 IoU=0.1 → 0.7,R@1 从 53.6 → 12.2,掉 41.4 个点。这说明模型能"大致找到行为发生的时间窗",但精确边界极差——因为视频中文本描述的边界本身可能就是模糊的(比如 "the monkey is eating" 何时开始 / 结束)。这一困难指向了未来工作的方向。
视频片段定位样例
图 5:Animal Kingdom 视频片段定位样例。给定"the cobra is attacking the mongoose"这类描述,模型需定位对应时间段。(来源:Animal Kingdom, main Fig.1)

6.5 姿态估计:三协议的对比(Table 6)

前文 Part 2 已经铺垫过姿态估计的三协议。这里给出 PCK@0.05 完整数据。

协议说明HRNetHRNet-DARK
Protocol 1All 80/20 split66.0666.57
Protocol 2leave-k-out (k=12 sub-classes)39.3040.28
Protocol 3哺乳类61.5962.50
Protocol 3两栖类56.7457.85
Protocol 3爬行类56.0657.06
Protocol 3鸟类77.3577.41
Protocol 3鱼类68.2569.96
33K 帧姿态标注在 5 大类的分布
图 6:33K 帧姿态标注在 5 大类的分布(昆虫类因为解剖结构差异大,被排除出姿态标注)。来源:supp Fig.4。

关键观察:

  • HRNet-DARK 始终优于 HRNet,但优势微小(0.5-1.5 点)。
  • 鸟类最高(77.4),可能因羽毛-身体对比明显,骨骼结构相对一致。
  • 爬行 / 两栖类最低(57 左右),因为肢体形态变化大、伪装多、姿态视角多样。
  • Protocol 2 vs Protocol 1 掉 27 点 仍然是最触目惊心的发现——cross-sub-class 姿态泛化还远未解决。
姿态估计样例
图 7:Animal Kingdom 姿态估计样例。覆盖 5 大类动物的关键点标注。(来源:Animal Kingdom, main Fig.4)
Part 7
讨论与启发:Animal Kingdom 在地图上的位置

7.1 与同类数据集/方法的对比

维度Animal KingdomiWildCam #Beery-et-al.-2021-iWildCamSnapshot Serengeti #Swanson-et-al.-2015-SnapshotSerengetiAnimal Pose #Cao-et-al.-2019-AnimalPoseMacaquePose #Labuguen-et-al.-2021-MacaquePose
物种数850+~250~615+71(猴)
任务VG + AR + PE 三任务分类分类姿态姿态
模态视频(50h)触发相机图触发相机图图像实验室视频
环境野生 + 多样红外野外草原固定点多样实验室
动作类别140 行为
代码 / 数据全开源公开挑战公开公开公开

Animal Kingdom 的核心位置:在数据集维度上比 iWildCam / Snapshot Serengeti 更宽(850 vs 250/61 物种),比 Animal Pose 更全(视频 + 多任务 vs 图像 + 姿态),在代码 + 数据集可获得性上完全开放。这是当前"动物视觉" benchmark 中最完整的实证。

7.2 CARe 与跨类域泛化方法谱系

维度CAReEpisodic-DGMixup-DG零样本学习
核心思路general + 协作 specific + MLDGepisodic task split跨域样本 mixup语义嵌入最近邻
依赖语义描述不需要不需要不需要需要
空间感知✓(张量权重)
Animal Kingdom 上精度39.7%34.0%36.2%
Meta-Learning 用量重(MLDG 训练 R)

7.3 局限性

  1. Protocol 2 掉 27 点的开放性:cross-sub-class 姿态估计仍是开放问题——HRNet 在 K=12 unseen 上 PCK@0.05 仅 39-40。这指向"如何学到部位级别的跨物种共享特征"这一深层研究问题。
  2. 长尾问题未见彻底解决:X3D+EQL 最好的 tail mAP 25.09,仍只有 head 63.33 的 39.6%。#Ng-et-al.-2022 这意味着某些动物专属动作(如"snake spitting venom")几乎不可能在标准 cross-entropy 训练中学到——可能需要额外 few-shot 或 meta-learning 介入。
  3. 视频片段定位 IoU=0.7 表现差:12.22% 的 R@1 (IoU=0.7) 说明模型对时间边界的精度仍有很大提升空间。语言描述(如"the leopard was stalking")本身的边界就很模糊,这是任务定义而非模型的局限。
  4. 实施细节披露不完整:batch size、训练时长(小时/天)、GPU 型号、MLDG 算法的超参 (\(\alpha, \beta, \lambda\)) 在原文中均未明确给出,复现时需要按 2-GPU + batch size 4-16 等常规 CV 训练经验自调。
  5. CARe 39.7% 的精度仍偏低:虽然显著超过 Mixup-DG (36.2),但绝对值上仍未达到"实用"水平。考虑到测试时是真的未见类(训练时连一张图都没见过),可以理解;但仍有改善空间。
  6. 6 大类中 5 类都做姿态:昆虫因为解剖结构差异过大(外骨骼 vs 内骨骼)被排除出姿态任务——意味着论文在"全面的动物姿态"上仍有结构性缺口。

7.4 可操作启发

  1. 任何"跨物种"行为识别系统都应考虑 general + specific 双特征。CARe 的设计思路可以推广到动作识别以外的跨类任务(如跨人种 / 跨年龄段 / 跨体型的视觉识别)。
  2. MLDG 是"虚拟 unseen"训练的标准工具。当你有"K 个源域"且需要泛化到 unknown target 时,把一个源域随机抽出来当 meta-test,其余当 meta-train,是稳定且低成本的做法。论文 §3 的 Algorithm 1 是良好模板。
  3. 长尾数据集一定要 head / middle / tail 分段报告。整体 mAP 看不到头部主导问题。Animal Kingdom 把评估指标三维拆解,可以作为同类数据集的参照。
  4. 空间感知张量权重是个通用 trick。把标量权重升级为空间张量以表达"空间位置相关"的相似度——不仅适用于 CARe,也适用于任何 feature fusion 场景(如多视角融合、多模态融合)。
  5. CV 数据集基准应该向 CVPR 2022 Animal Kingdom 学习——同时提供多任务 + 统一代码发布 + 多维度评估指标 + 跨域泛化能力评估。这是新时代视觉数据集的标杆。
一句话总结:Animal Kingdom + CARe 的组合是数据集规模优势 + 跨物种泛化方法论的双贡献范本。在 CV 已经从单一数据集时代进入"大规模 + 多任务 + 跨域"的新时代,Animal Kingdom 为后续工作提供了这种范式的工业级示例
动作识别样例
图 8:Animal Kingdom 动作识别样例。覆盖 6 大类的 140 个动作的代表性图像——同一动作在不同物种上展现出截然不同的视觉模式。(来源:Animal Kingdom, main Fig.3)

参考来源

  • Ng, X. L., Ong, K. E., Zheng, Q., Ni, Y., Yeo, S. Y., Liu, J. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022 (Oral). arXiv:2204.08129 · GitHub: SUTDCV/Animal_Kingdom
  • Carreira, J., Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR 2017. arXiv:1705.07750
  • Feichtenhofer, C., Fan, H., Malik, J., He, K. (2019). SlowFast Networks for Video Recognition. ICCV 2019. arXiv:1812.03982
  • Feichtenhofer, C. (2020). X3D: Progressive Expanding Model for Efficient Video Recognition. CVPR 2020. arXiv:2004.04730
  • Sun, K., Xiao, B., Liu, C., Wang, X., Tang, J. (2019). Deep High-Resolution Representation Learning for Visual Recognition. CVPR 2019 / TPAMI 2020. arXiv:1908.07919
  • Zhang, F., Zhu, X., Wang, C., Mei, Y., Liu, W., Wang, Q. (2020). Distribution-Aware Coordinate Representation for Human Pose Estimation. CVPR 2020. arXiv:1910.06278
  • Mun, J., Cho, M., Han, B. (2020). Localizing Moments in Video with Natural Language. ICCV 2021 / arXiv 2020. arXiv:2008.09037
  • Zhang, H., Sun, A., Jing, W., Zhou, J. T. (2020). Span-based Localizing Network for Natural Language Video Localization. ECCV 2020. arXiv:2004.13931
  • Li, D., Yang, Y., Song, Y.-Z., Hospedales, T. (2018). Learning to Generalize: Meta-Learning for Domain Generalization. AAAI 2018. arXiv:1710.03463
  • Li, D., Zhang, J., Yang, Y., Liu, C., Song, Y.-Z., Hospedales, T. (2019). Episodic Training for Domain Generalization. ICCV 2019. arXiv:1903.04063
  • Wang, H., He, H., Oyen, D., Yang, Z., Lin, M. (2020). Heterogeneous Domain Generalization With Domain-Specific Regressors via Weighted Combination Coefficients. T-PAMI. (Mixup-DG)
  • Girdhar, R., Carreira, J., Doersch, C., Zisserman, A. (2019). Video Action Transformer Network. CVPR 2019. arXiv:1812.02707
  • Lin, T.-Y., Goyal, P., Girshick, R., He, K., Dollár, P. (2017). Focal Loss for Dense Object Detection. ICCV 2017. arXiv:1708.02002
  • Cao, K., Wei, C., Gaidon, A., Arechiga, N., Ma, T. (2019). Learning Imbalanced Datasets with Label-Distribution-Aware Margin Loss. NeurIPS 2019. arXiv:1906.07413
  • Tan, J., Wang, C., Li, B., Li, Q., Ouyang, W., Yin, C., Yan, J. (2020). Equalization Loss for Long-Tailed Object Recognition. CVPR 2020. arXiv:2003.05176
  • Cao, J., Tang, H., Fang, H.-S., Shen, X., Lu, C., Tai, Y.-W. (2019). Cross-Domain Adaptation for Animal Pose Estimation. ICCV 2019. arXiv:1908.05806
  • Mathis, A., Yüksekgönül, M., Rogers, S., Bethge, M., Mathis, M. (2020). DeepLabCut: Markerless Pose Estimation of User-Defined Body Parts with Deep Learning. Nature Protocols. Nature Protocols
  • Graving, J. M., Chae, D., Naik, H., Li, L., Koger, B., Costelloe, B. R., Couzin, I. D. (2019). DeepPoseKit, a software toolkit for fast and robust animal pose estimation using deep learning. eLife 8:e47994. eLife
  • Karashchuk, P., Rupp, K. L., Dickinson, E. S., Woolford, S. J., Tavoni, G., Sajid, A., ... Tytell, E. D. (2021). Anipose: A framework for markerless motion capture in freely-moving animals. bioRxiv. bioRxiv 2020.09.14.295766
  • Beery, S., Agarwal, A., Cole, E., Birodkar, V. (2021). The iWildCam 2021 Competition Dataset. arXiv 2021 / CVPR FGVC Workshop. arXiv:2105.03494
  • Swanson, A., Kosmala, M., Lintott, C., Simpson, R., Smith, A., Packer, C. (2015). Snapshot Serengeti, high-frequency annotated camera trap images of 40 mammalian species in an African savanna. Scientific Data 2: 150026. Nature: Scientific Data
  • Labuguen, R., Matsumoto, J., White, S., Rogel, A., Kogo, J., Rehhorn, M., ... Yamada, Y. (2021). MacaquePose: A Novel Dataset for Macaque Pose Estimation in the Wild and its Benchmark Evaluation. arXiv 2021. arXiv:2112.13793
  • Anderson, D. J., Perona, P. (2014). Toward a science of computational ethology. Neuron 84(1): 18-31. Neuron
  • Sigurdsson, G. A., Varol, G., Wang, X., Farhadi, A., Laptev, I., Gupta, A. (2016). Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding. ECCV 2016. mAP 评估指标的引用依据。