ESC
输入关键词搜索文章
目录

从粗粒度到细粒度

Springer AIR 2026 · Zia et al. · 动物动作识别综述
四层分类框架 · 8 种整合策略 · 8 个数据集 · CG vs FG 性能鸿沟
8整合策略
8数据集对比
88%→12.7%CG vs FG 鸿沟
73参考文献
Part 1
为什么动物动作识别值得单独写一篇综述

人体动作识别已经相当成熟——Kinetics-400 有 24 万条视频、COCO 17 关键点骨架是统一标准、MMPose + MMAction2 工具链开箱即用。但当我们把镜头转向动物时,会发现一个尴尬的事实:整套 pipeline 几乎不能直接迁移。原因不仅是动物长得千差万别,而是从数据底层到评估范式都存在结构性差异。#Zia et al., 2025

动物动作识别横跨多个应用场景:精准畜牧业(PLF)需要实时监控牛群行为以早期预警疾病;动物行为学(Ethology)依赖自动化行为分析来理解社会互动;野生动物保护需要追踪濒危物种的行为模式。#Zia et al., 2025 与人类动作识别相比,这个领域面临几个独有的挑战——非刚性体结构(non-rigid body structures)、频繁的遮挡(occlusions)、大规模标注数据集的极度匮乏,以及自然栖息地的环境复杂性。

核心矛盾:粗粒度(Coarse-Grained)行为识别准确率已可达 88%–97%,但细粒度(Fine-Grained)行为识别准确率仅 12.7%–29.6%。两者之间存在巨大的技术鸿沟。#Zia et al., 2025

这篇由 Ali Zia(ANU/CSIRO 联合博士后)等 11 位作者撰写、发表于 Springer Artificial Intelligence Review 的综述#Zia et al., 2025,是目前第一篇专门以"Coarse to Fine-Grained"视角系统梳理动物动作识别的 survey。它不仅提供了 8 种 CG→FG 整合策略的分类框架,还引入了 CVB(Cattle Visual Behaviours)数据集——502 个视频片段、11 种行为类别、450 帧逐帧专家标注——为这个数据稀缺的领域注入了新的基准。

论文链接:arXiv:2506.01214 | DOI: 10.1007/s10462-026-11526-5
Figure 1: General framework for animal action recognition
图 1:动物动作识别的通用框架。'S' 代表状态(State),展示了从输入视频到行为识别的完整 pipeline,包含姿态估计、时空特征提取和分类三个核心阶段(来源:Zia et al., 2025, Fig.1)
Part 2
粗粒度与细粒度之间的鸿沟从何而来

什么是粗粒度,什么是细粒度

粗粒度行为(Coarse-Grained, CG)指一般性运动模式:行走(walking)、站立(standing)、奔跑(running)等。这些行为相对容易识别,区分度大,已有较多研究。#Zia et al., 2025

细粒度行为(Fine-Grained, FG)涉及行为的细节和微妙差异:反刍(ruminating)、理毛(grooming)、反刍-躺卧(ruminating-lying)vs 反刍-站立(ruminating-standing)。识别这些行为需要分析姿势、运动序列、互动甚至面部表情的微妙差异。#Zia et al., 2025

八大核心挑战

论文在 Introduction 和 §5.1 中系统列举了细粒度动物动作识别面临的核心挑战:

#挑战核心困难
1行为复杂性动物行为固有多样性,微妙和快速动作难以分类
2数据稀缺专门的 fine-grained 数据集极少;标注耗时且需领域专家
3标注复杂性需要动物行为学家参与,成本高、周期长
4种内变异性同一物种不同个体的行为差异大
5遮挡多动物互遮挡、植被遮挡
6环境多样性光照变化、动态背景、非受控户外环境
7泛化困难从受控环境到野外场景的迁移困难
8实时处理实时分析数据以提供即时洞察的技术挑战

技术演进脉络:从工具到智能

论文 §2.1 梳理了一条清晰的技术演进线——从基础工具到视频级动作识别,再到新兴方向:

flowchart TD
    subgraph "阶段1: 基础工具(~2015-2020)"
        A1["DeepLabCut
多动物姿态估计"] A2["3D-Motion Framework
三维运动分析"] A3["DeepHL
轨迹比较分析"] A4["Stern CNN
逐帧分类"] end subgraph "阶段2: 视频级识别(2017-2022)" B1["I3D → C3D → SlowFast
从人类动作迁移"] B2["DSTS / TQN
细粒度特化"] B3["TSPCNN
双流 Pose+RGB"] end subgraph "阶段3: 新兴方向(2023+)" C1["Stable Diffusion
判别任务"] C2["单点监督
减少标注"] C3["基础模型
迁移学习"] end A1 --> B1 A4 --> B1 B1 --> B2 B2 --> B3 B3 --> C1 B3 --> C2 B3 --> C3

这条演进线的核心逻辑是:从逐帧空间特征提取 → 时空联合建模 → 动态自适应 → 多模态融合。人类动作识别中的成熟方法(I3D、SlowFast、C3D 等)均首先在 Kinetics-400 上验证,再迁移到动物场景。#Zia et al., 2025

Figure 2: Evolution of action recognition techniques
图 2:动物动作识别技术演进路线图。从人工监控 → CNN 逐帧分类 → 渐进式深度学习 → 动态时空特化 → 双流姿态 CNN,最终展望 Stable Diffusion、单点监督和基础模型三个前沿方向(来源:Zia et al., 2025, Fig.2)
Part 3
四层分类框架:Survey 的核心贡献

这篇 survey 最有价值的贡献不是某个具体方法,而是一个四层分类框架——从技术演进、关键考量、整合策略、感知模态四个维度系统地组织了动物动作识别领域。

层次一 · 技术演进框架(§2.1)

从基础工具(DeepLabCut 姿态估计)到 CNN 视频帧分类(Stern 2015),再到渐进式深度学习(Feng 2023 的 PBRD 框架)、动态时空特化(DSTS)、双流姿态 CNN(TSPCNN),最后展望 Stable Diffusion / 单点监督 / 基础模型。这条线索已在 Part 2 的演进图中展示。

层次二 · 两个关键考量维度(§2.2)

Survey 提出两个坐标轴来定位所有方法:

  • 时间动态(Temporal Dynamics):动作如何随时间演变,捕获每个运动的序列和持续时间。挑战在于检测微妙且快速的动作。#Zia et al., 2025
  • 空间上下文(Spatial Context):动作发生的空间背景,包括动物与环境、与其他个体的交互。空间上下文提供额外线索来引导更精确的动作识别。#Zia et al., 2025

两者是相互依存的(interdependent),结合时能提供对动物行为的全面理解。

层次三 · 八种 CG→FG 整合策略(§2.3)

这是 survey 最核心的分类贡献——按策略导向将整合方法分为八类:

#策略核心思想技术细节代表方法
1Hierarchical分层识别:先 coarse → 再 fine-grained,仅在必要时启用密集分析先识别 walking/running 等粗粒度,再对相关子集做 jumping/scratching 细粒度分析。优化计算资源——仅在必要时启用密集计算Zhao et al. 2017 #Zia et al., 2025
2Open-set既识别已知行为,也检测未见过的动作;适用于动态环境动物可能展现训练集中未出现的新行为。开放集识别使用距离度量或概率模型判断样本是否属于已知类别Bendale & Boult 2016
3Action Segmentation将连续视频流切分为独立动作段,每段对应一个特定动作由于动物运动的流畅性,精确定位起始/结束帧极具挑战性。时序卷积网络(TCN)在此方向展示了潜力Lea et al. 2017; MS-TCN
4Feature Fusion融合 coarse + fine 特征,同时捕获高层上下文和细微细节构建更全面的特征表示,增强判别力。可在早期(数据级)、中期(特征级)或晚期(决策级)进行融合Shaikh et al. 2024
5Two-stage级联架构:第一阶段 coarse,歧义时第二阶段 fine第一阶段快速筛选明确样本,第二阶段仅处理模糊案例。平衡速度与精度。TSPCNN 一流处理 RGB,一流处理 Pose+RGB,通过 attention + late fusion 融合Hacker et al. 2023 (TSPCNN)
6Feedback迭代精化:coarse → fine → coarse → fine,随时间提升精度双向反馈机制——粗粒度结果引导细粒度分析方向,细粒度结果反过来修正粗粒度判断。允许自适应特征学习Yang et al. 2021
7Ensemble投票或加权平均组合 coarse + fine 分类器受益于两个识别层级的互补性。可使用投票、加权平均或 stacking 等集成策略Vu et al. 2023
8Adaptive根据输入复杂度动态切换策略;动态核机制细化关注包括自适应模型切换(按输入复杂度选择策略)和动态核机制(细化对复杂细节的关注)Yang et al. 2023; Yenduri et al. 2022

八种策略的选择指南

从工程实践角度,这 8 种策略可归纳为三大范式:

  • 级联范式(Hierarchical / Two-stage):粗粒度快速筛选 + 细粒度精准分析。适合计算资源受限的边缘部署场景(如宠物摄像头)。
  • 融合范式(Feature Fusion / Ensemble / Feedback):粗粒度和细粒度同时运行后融合。精度更高但计算量倍增,适合云端高精度场景。
  • 自适应范式(Open-set / Action Segmentation / Adaptive):根据输入动态调整策略。最灵活但实现复杂度最高,适合野生动物监控等不可预测场景。
与已有博客文章的互补:我们此前的 动物动作识别综述 采用"技术路线导向"分类(数据层 → 姿态提取 → 行为识别),而本文提供的是"策略导向"分类。两种视角高度互补——本文的 8 种整合策略填补了我们此前分析框架的盲区。

层次四 · 四种感知模态(§2.4)

模态描述优势
视觉(Vision)视频帧 CNN/DL 特征提取细粒度动作识别的基石
音频(Audio)发声行为和环境交互线索Bain et al. 在野生灵长类中展示音视频联合识别
惯性传感器(Inertial)加速度计/陀螺仪连续高精度数据与视觉数据互补,推断详细运动模式
生理信号(Physiological)心率/体温/肌电反映动物内部状态(压力、兴奋)

Survey 给出了多模态融合的一般形式:

$$F_{\text{fused}} = h\bigl(f(X_v; \theta_v),\; f(X_a; \theta_a),\; \ldots\bigr)$$

其中 $X_v, X_a, \ldots$ 分别代表视觉、听觉等模态输入,$f(\cdot;\theta)$ 为各模态的特征提取函数,$h$ 为融合函数。论文未限定 $h$ 的具体形式,允许早期融合、晚期融合或中间层融合。#Zia et al., 2025

Part 4
8 个数据集与现有方法的性能全景

数据集结构化对比(Table 1)

Survey 系统对比了 8 个动物视觉行为识别数据集,按 5 个关键维度组织:

数据集Multi-Object模态CGFG公开特色
Large AnimalsVideo60 cattle videos,6 种跟踪算法评估
Wild FelinesVideo猫科动物监控视频
Wildlife ActionVideo106 action categories, UCF CRCV
Wildlife MonitoringVideoCamera trap,red/fallow/roe deer
PBRDImage灵长类 30 类行为, 7500 图像, progressive attention
Animal Kingdom #Ng et al., 2022Video850 物种, 50h 视频, 30K 序列, CVPR 2022
MammalNet #Chen et al., 2023Video173 种哺乳动物, 12 种行为, CVPR 2023
CVBVideo牛 11 类行为, 502 clips × 450 帧, 4 视角
关键发现:8 个数据集中仅 4 个(PBRD、Animal Kingdom、MammalNet、CVB)同时包含 CG + FG 标注。其中 MammalNet 和 CVB 是仅有的两个 multi-object 数据集,包含对象间交互复杂性。CVB 是唯一聚焦单一物种(牛)但覆盖 11 种行为的数据集。

方法精度对比(Table 2)

类型方法数据集精度
CGTrajectory-basedLarge Animals88.4%–94.1%
CGTwo-Stream NetworkWild Felines92%–97%
CGI3D + HierarchicalWildlife Action33%–36%
CGMAROONWildlife Monitoring43.05%–69.16%
CG+FGProgressive DLPBRDCG 48%–91.53%, FG 29.62%–81.90%
CG+FGCARe (I3D/X3D/SlowFast)Animal KingdomMixed 27.3%–39.7%
CG+FGI3D/C3D/SlowFast/MViT V2MammalNetMixed 34.2%–46.6%
CG+FGSlowFastCVBCG 58%–73.96%, FG 12.7%–29.6%

"Mixed" 精度说明

表中标注 "Mixed" 的方法未单独报告 CG 和 FG 结果。这意味着 fine-grained 识别拉低了整体性能——Animal Kingdom 上 CARe 模型的混合准确率仅 27.3%–39.7%,揭示了跨物种细粒度识别的巨大挑战。

骨干网络技术谱系

Survey 引用的视频识别骨干网络主要来自人类动作识别领域的迁移:

骨干网络架构特点在动物场景中的表现
I3D #Carreira & Zisserman, 2017膨胀 3D CNN,将 2D ImageNet 权重膨胀为 3DMammalNet 34.2%–46.6%
SlowFast #Feichtenhofer et al., 2019双路径:慢通道低帧率捕空间语义,快通道高帧率捕运动CVB CG 73.96%, FG 29.6%
C3D #Tran et al., 20153D CNN 先驱MammalNet 中使用
X3D #Feichtenhofer, 2020渐进扩展策略,效率优先Animal Kingdom 27.3%–39.7%(CARe)
MViT V2 #Li et al., 2022多尺度 Vision TransformerMammalNet 中使用
DeepLabCut #Lauer et al., 2022多动物姿态估计+识别+跟踪广泛用于预处理阶段

SlowFast 双路径架构:为何成为动物场景的主力

在所有被引用的骨干网络中,SlowFast #Feichtenhofer et al., 2019 是使用频率最高的——出现在 Animal Kingdom、MammalNet 和 CVB 三个数据集的评估中。其核心设计是双路径架构:

慢通道(Slow Pathway):以低帧率 $f_s$ 处理输入(通常为每 16 帧取 1 帧),通道数较大($C_s$),负责捕获空间语义信息——"在哪里发生了什么"。

快通道(Fast Pathway):以高帧率 $f_f = \alpha \cdot f_s$$\alpha > 1$,通常 $\alpha = 8$)处理输入,通道数较小($C_f = \beta \cdot C_s$$\beta \approx 1/8$),负责捕获运动时序细节——"动作如何演变"。

两路径间通过横向连接(lateral connections)进行信息交换:快通道的特征通过 time-stride 卷积下采样后注入慢通道。这种设计使得 SlowFast 在不显著增加计算量的前提下,同时捕获空间语义和运动细节——这对动物行为识别尤为重要,因为动物行为中的微妙差异(如"反刍-躺卧"vs"反刍-站立")主要体现在运动模式而非空间外观上。

然而,在 CVB 数据集上,即使是 SlowFast 也只能达到 FG 12.7%–29.6% 的准确率。这揭示了单靠架构设计无法解决的核心难题:细粒度行为的判别信息可能不在视频帧的像素级特征中,而在于姿态序列的拓扑变化——这正是后续 个体特定动作检测 中 skeleton-based 方法(如 SkeleTR)的切入点。

I3D 权重膨胀:从 2D 到 3D 的优雅迁移

I3D #Carreira & Zisserman, 2017 的核心创新是将 2D ImageNet 预训练权重膨胀为 3D 卷积核:将 $k \times k$ 的 2D 卷积核沿时间维度膨胀为 $t \times k \times k$ 的 3D 卷积核,其中 $t$ 为时间窗口大小。这种膨胀策略使得 I3D 可以直接利用 ImageNet 的大规模预训练权重——这在动物场景中尤为重要,因为动物行为数据的预训练资源远不如人类动作识别丰富。I3D 在 MammalNet 上达到 34.2%–46.6% 的混合准确率,虽然绝对值不高,但考虑到 MammalNet 覆盖 173 种哺乳动物和 12 种行为,这个结果表明 2D→3D 权重迁移在跨物种场景中仍然有效。

Part 5
三条新兴技术路线

Survey §4 提出了三个前沿方向,虽然都停留在概念讨论层面(未进行实验验证),但方向值得关注:

Stable Diffusion 用于判别任务(§4.1)

扩散模型已从生成任务扩展到判别任务(目标检测、图像分割)。其核心价值在于:渐进去噪过程有助于突出细微差异,使模型能区分高度相关的动作。在去噪过程中融入编码视频特征,可增强模型提取上下文和时序细节的能力。相关工作包括 DiffTAD#Nag et al., 2023、Diffusion Action Segmentation#Liu et al., 2023 等。

单点监督减少标注成本(§4.2)

用极少量标注点实现高精度——这在野生动物行为研究中特别有价值,因为全面标注几乎不可能。挑战在于效果高度依赖初始标注质量,且可能需要更复杂的 ML 技术。相关代表工作为 Proposal-based Temporal Action Localization with Point-level Supervision#Yin et al., 2023

基础模型迁移学习(§4.3)

大规模预训练网络 → fine-tuning for fine-grained action recognition → 减少对大规模标注数据的需求。基础模型擅长提取丰富的层次化特征,识别粗粒度分析常忽略的微妙行为差异。组合策略包括:

  • 基础模型(特征提取+泛化)+ 定制层(针对 fine-grained 优化)
  • 知识蒸馏:compact student model 学习 mimicking teacher model 输出
  • 多模态融合:结合视觉、听觉、传感器数据

Survey 未覆盖的 2024–2025 工作

Survey 的引用最新到 2024 年初,缺少以下已验证基础模型路线可行性的重要工作:

  • SuperAnimal(2024):跨 45+ 物种零样本姿态估计
  • Animal-CLIP(IJCV 2025):双 Prompt 增强 VLM
  • AnimalMotionCLIP(2025):CLIP + 光流,mAP 74.63
  • EthoCLIP(CVPR 2026 Highlight):本体增强视频-语言预训练
  • DiffPose-Animal(2024):扩散模型 + 语言条件姿态估计
  • ARTEMIS(2024):多模态行为识别 mAP 79.82

详见我们此前的 动物动作识别综述

Part 6
实验评估:数字背后的故事

CG vs FG 性能鸿沟的量化证据

Survey 最有力的论证来自数据本身。将所有方法的 CG 和 FG 精度并列对比:

flowchart LR
    subgraph "CG 准确率"
        CG1["轨迹方法 88-94%"]
        CG2["双流网络 92-97%"]
        CG3["Progressive DL 91.53%"]
        CG4["SlowFast CVB 73.96%"]
    end
    subgraph "FG 准确率"
        FG1["Progressive DL 81.90%"]
        FG2["SlowFast CVB 29.6%"]
        FG3["SlowFast CVB 12.7%"]
    end
    CG1 -.->|"鸿沟"| FG3
    CG4 -.->|"鸿沟"| FG2
  
Figure 3: CG vs FG accuracy comparison bar chart
图 3:CG vs FG 准确率对比。蓝色为粗粒度准确率,红色为细粒度准确率。轨迹方法和双流网络未报告 FG 结果(N/A);Progressive DL 在 PBRD 上实现了 CG 91.53% / FG 81.90% 的最佳平衡;SlowFast 在 CVB 上 CG 达 73.96% 但 FG 仅 12.7%–29.6%,鸿沟超过 44 个百分点(数据来源:Zia et al., 2025, Table 2)
核心数据:CVB 数据集上 SlowFast 的 CG 精度达 73.96% 而 FG 仅 29.6%(最高)和 12.7%(最低),差距超过 44 个百分点。这个数据本身就是细粒度动物动作识别核心挑战的最佳证据。

PBRD 的亮点:渐进式学习的突破

在所有方法中,Progressive Deep Learning Framework 在 PBRD 数据集上实现了唯一一组 CG 和 FG 都达到较高水平的结果(CG 91.53%, FG 81.90%)。这归功于其区域聚焦和渐进注意力训练策略——逐步细化对判别性区域的关注,使模型能捕获相似动作间的微妙差异。#Feng et al., 2023

大规模 ≠ 高精度

一个反直觉的发现是:数据集规模越大,精度反而可能越低。Animal Kingdom(30,000 视频序列)和 MammalNet(173 哺乳动物类别、539 小时)上的混合准确率仅 27%–46%。原因很清晰——物种多样性和类间差异对模型构成了更大挑战。相比之下,PBRD 虽然只有 7500 张图像、30 类行为,但得益于 progressive attention 策略,精度远超大规模数据集上的方法。

实验配置对比

方法数据集骨干网络模态计算成本硬件复现性
Trajectory-basedLarge Animals6 种跟踪算法Video❌ 未披露❌ 未披露⚠️ 数据集未公开
Two-Stream NetworkWild Felines双流 CNNVideo❌ 未披露❌ 未披露⚠️ 数据集未公开
I3D + HierarchicalWildlife ActionI3DVideo❌ 未披露❌ 未披露⚠️ 106 类别极多
MAROONWildlife MonitoringSWIFT + Action RecVideo❌ 未披露❌ 未披露⚠️ Camera trap 场景
Progressive DLPBRDRegion-focused CNNImage❌ 未披露❌ 未披露⚠️ 代码未开源
CARe (I3D/X3D/SlowFast)Animal KingdomI3D / X3D / SlowFastVideo❌ 未披露❌ 未披露✅ 数据集公开
I3D/C3D/SlowFast/MViT V2MammalNet四种骨干Video❌ 未披露❌ 未披露✅ 数据集公开
SlowFast (lightweight)CVBSlowFast 轻量版Video❌ 未披露❌ 未披露✅ 数据集公开 (DOI)

注:该 survey 为综述性质,未报告任何自有实验的超参数、训练时间或硬件配置。即使是引用的 CVB SlowFast 实验 #Zia et al., 2023,也未给出学习率、batch size、epoch 数等关键信息。这反映了该领域在实验可复现性方面的普遍不足。

Survey 自身的实验局限

需要指出的是,本文唯一的实验贡献(CVB 上的 SlowFast 评估)引用自 CVB 数据集原始论文#Zia et al., 2023,并非本文新增实验。原文未给出 SlowFast 的具体架构配置、训练超参数或硬件环境,因此即使想复现其基线结果也缺乏足够细节。此外,Table 2 中 "Mixed" 标注的方法未明确说明 CG 和 FG 的区分方式,使得跨方法定量比较的可靠性受限。

可复现性评估

  • 自身实验:无自有实验,CVB SlowFast 结果引用自原始论文
  • 超参数:未报告任何方法的完整超参数(学习率、batch size、epoch 数均缺失)
  • 硬件环境:未提及 GPU 型号、训练时间、推理速度
  • 数据划分:未报告各数据集的 train/val/test split 比例
  • 评估指标:部分报告 top-1 accuracy,部分报告 mixed accuracy,未统一指标
  • 开源代码:SlowFast / I3D / X3D / DeepLabCut 均有开源实现;Progressive DL / DSTS 未提供代码
Part 7
在地图上的位置

Survey 的独特定位

与同领域的其他综述相比,本文有几个不可替代的价值点:

维度本文 #Zia et al., 2025#Kleanthous et al., 2022#Broome et al., 2023
视角CG→FG 演进 + 整合策略广泛的 ML 方法综述聚焦动物疼痛/情绪识别
分类框架8 种整合策略(策略导向)按 ML 方法分类按情感维度分类
数据集贡献引入 CVB(502 clips, 11 行为)
实验验证SlowFast 在 CVB 上的评估
伦理讨论§5.2 全面讨论(隐私/偏见/误分类)未涉及部分涉及

局限与缺失

需注意的几点

  • 前沿覆盖不足:未覆盖 2024-2025 年涌现的 VLM 方法(Animal-CLIP、AnimalMotionCLIP、EthoCLIP、SuperAnimal 等)
  • 方法创新有限:主要是综述性质,§4 提出的三个未来方向停留在概念讨论层面
  • 物种特异性:CVB 数据集仅覆盖牛(Bos taurus),对其他物种的泛化性未经验证
  • 小错误:SlowFast #Feichtenhofer et al., 2019 实际发表于 ICCV 2019,论文引用标注为 CVPR 2019

伦理讨论的亮点

Survey §5.2 关于伦理和负责任 AI 的讨论在同类 survey 中较为少见,涵盖了三个层面:(1) 野生动物监控的隐私问题;(2) 畜牧业自动化中过度依赖 AI 可能延迟人工干预的风险;(3) 数据偏见导致的模型泛化问题和人类中心的动物行为解读偏差。#Zia et al., 2025

从 CG→FG 鸿沟到 Stitching-Retargeting 范式

这篇 survey 最重要的发现——CG 88%–97% vs FG 12.7%–29.6% 的巨大性能鸿沟——实际上指向了一个更深层的结构性问题:细粒度行为的判别信息不在像素级外观特征中,而在于个体姿态序列的拓扑变化。SlowFast 在 CVB 上的 FG 精度仅 29.6%,正是因为双路径架构捕获的是时空像素特征,而非个体特定的运动模式。

这一洞察直接连接到我们此后的 个体特定动作检测 一文中提出的 Stitching-Retargeting 范式——该范式借鉴机器人运动重定向(Motion Retargeting)的思想,将个体特定动作检测分解为两个阶段:

  • Stitching 阶段:从分散的个体观测中缝合出连贯的个体表征(如 DeepLabCut 姿态序列、SuperAnimal 跨物种模型),对应本 survey 中 Part 2 的“姿态估计”前置步骤
  • Retargeting 阶段:将通用动作识别能力重定向到个体特定空间(如 SkeleTR 的图卷积骨架建模、IGMN 的个体特定高斯混合),对应本 survey 中从 CG 到 FG 的跨越

换言之,本 survey 识别出的 CG→FG 鸿沟,正是 Stitching-Retargeting 范式要解决的核心问题。八种整合策略中的 Two-stage(TSPCNN)和 Feedback 策略,可以看作 Stitching-Retargeting 思想的隐式实现——它们在不同粒度之间切换,但没有显式地建模个体表征。

跨文章连接:阅读建议——先通过本 survey 理解 CG→FG 的技术全景和性能鸿沟,再阅读 个体特定动作检测 了解 Stitching-Retargeting 范式如何从理论上弥合这一鸿沟,最后参考 SkeleTR 精读 了解骨架图卷积的具体实现。

可操作的启发

对于希望进入这个领域的研究者,从 survey 中可提炼以下方向:

  • 整合策略选型:8 种 CG→FG 整合策略为系统设计提供了清晰的架构选择菜单
  • Stitching-Retargeting 路线:先建个体模型(stitching),再做个体特定识别(retargeting),是弥合 CG→FG 鸿沟最有前景的方向
  • 基础模型路线:SuperAnimal、Animal-CLIP 等 2024-2025 工作已部分验证了 survey 提出的基础模型方向的可行性
  • CVB 数据集:作为单物种多行为的基准,适合验证新的细粒度识别方法(DOI: 10.25919/3g3t-p068
  • 多模态融合:视觉+音频+惯性传感器的融合仍是蓝海,目前大多数工作仅使用视觉模态
References
参考来源

参考来源

  • Zia, A. et al. (2025). A Review on Coarse to Fine-Grained Animal Action Recognition. Artificial Intelligence Review, 59, 133. arXiv:2506.01214
  • Zia, A. et al. (2023). CVB: A Video Dataset of Cattle Visual Behaviors. DOI: 10.25919/3g3t-p068
  • Feichtenhofer, C. et al. (2019). SlowFast Networks for Video Recognition. ICCV 2019. arXiv:1812.03982
  • Carreira, J. & Zisserman, A. (2017). Quo Vadis, Action Recognition? CVPR 2017. arXiv:1705.07750
  • Lauer, J. et al. (2022). Multi-animal pose estimation, identification and tracking with DeepLabCut. Nature Methods, 19(4):496-504. Nature Methods
  • Feng, J. et al. (2023). A progressive deep learning framework for fine-grained primate behaviour recognition. Applied Animal Behaviour Science, 269:106099.
  • Ng, X.L. et al. (2022). Animal Kingdom: A Large and Diverse Dataset. CVPR 2022. arXiv:2204.08129 · 精读 →
  • Chen, J. et al. (2023). MammalNet: A Large-scale Video Benchmark. CVPR 2023. arXiv:2306.00576 · 精读 →
  • Tran, D. et al. (2015). Learning Spatiotemporal Features with 3D CNN. ICCV 2015.
  • Feichtenhofer, C. (2020). X3D: Expanding Architectures for Efficient Video Recognition. CVPR 2020.
  • Li, Y. et al. (2022). MViTv2: Improved Multiscale Vision Transformers. CVPR 2022.
  • Nag, S. et al. (2023). DiffTAD: Temporal Action Detection with Proposal Denoising Diffusion. ICCV 2023.
  • Liu, D. et al. (2023). Diffusion Action Segmentation. CVPR 2023.
  • Yin, Y. et al. (2023). Proposal-based Temporal Action Localization with Point-level Supervision. BMVC 2023.
  • Kleanthous, N. et al. (2022). A survey of machine learning approaches in animal behaviour. Neurocomputing.
  • Broome, S. et al. (2023). Going Deeper than Tracking: A Survey of CV-Based Recognition of Animal Pain and Emotions. IJCV.