从粗粒度到细粒度
人体动作识别已经相当成熟——Kinetics-400 有 24 万条视频、COCO 17 关键点骨架是统一标准、MMPose + MMAction2 工具链开箱即用。但当我们把镜头转向动物时,会发现一个尴尬的事实:整套 pipeline 几乎不能直接迁移。原因不仅是动物长得千差万别,而是从数据底层到评估范式都存在结构性差异。#Zia et al., 2025
动物动作识别横跨多个应用场景:精准畜牧业(PLF)需要实时监控牛群行为以早期预警疾病;动物行为学(Ethology)依赖自动化行为分析来理解社会互动;野生动物保护需要追踪濒危物种的行为模式。#Zia et al., 2025 与人类动作识别相比,这个领域面临几个独有的挑战——非刚性体结构(non-rigid body structures)、频繁的遮挡(occlusions)、大规模标注数据集的极度匮乏,以及自然栖息地的环境复杂性。
这篇由 Ali Zia(ANU/CSIRO 联合博士后)等 11 位作者撰写、发表于 Springer Artificial Intelligence Review 的综述#Zia et al., 2025,是目前第一篇专门以"Coarse to Fine-Grained"视角系统梳理动物动作识别的 survey。它不仅提供了 8 种 CG→FG 整合策略的分类框架,还引入了 CVB(Cattle Visual Behaviours)数据集——502 个视频片段、11 种行为类别、450 帧逐帧专家标注——为这个数据稀缺的领域注入了新的基准。
论文链接:arXiv:2506.01214 | DOI: 10.1007/s10462-026-11526-5
什么是粗粒度,什么是细粒度
粗粒度行为(Coarse-Grained, CG)指一般性运动模式:行走(walking)、站立(standing)、奔跑(running)等。这些行为相对容易识别,区分度大,已有较多研究。#Zia et al., 2025
细粒度行为(Fine-Grained, FG)涉及行为的细节和微妙差异:反刍(ruminating)、理毛(grooming)、反刍-躺卧(ruminating-lying)vs 反刍-站立(ruminating-standing)。识别这些行为需要分析姿势、运动序列、互动甚至面部表情的微妙差异。#Zia et al., 2025
八大核心挑战
论文在 Introduction 和 §5.1 中系统列举了细粒度动物动作识别面临的核心挑战:
| # | 挑战 | 核心困难 |
|---|---|---|
| 1 | 行为复杂性 | 动物行为固有多样性,微妙和快速动作难以分类 |
| 2 | 数据稀缺 | 专门的 fine-grained 数据集极少;标注耗时且需领域专家 |
| 3 | 标注复杂性 | 需要动物行为学家参与,成本高、周期长 |
| 4 | 种内变异性 | 同一物种不同个体的行为差异大 |
| 5 | 遮挡 | 多动物互遮挡、植被遮挡 |
| 6 | 环境多样性 | 光照变化、动态背景、非受控户外环境 |
| 7 | 泛化困难 | 从受控环境到野外场景的迁移困难 |
| 8 | 实时处理 | 实时分析数据以提供即时洞察的技术挑战 |
技术演进脉络:从工具到智能
论文 §2.1 梳理了一条清晰的技术演进线——从基础工具到视频级动作识别,再到新兴方向:
flowchart TD
subgraph "阶段1: 基础工具(~2015-2020)"
A1["DeepLabCut
多动物姿态估计"]
A2["3D-Motion Framework
三维运动分析"]
A3["DeepHL
轨迹比较分析"]
A4["Stern CNN
逐帧分类"]
end
subgraph "阶段2: 视频级识别(2017-2022)"
B1["I3D → C3D → SlowFast
从人类动作迁移"]
B2["DSTS / TQN
细粒度特化"]
B3["TSPCNN
双流 Pose+RGB"]
end
subgraph "阶段3: 新兴方向(2023+)"
C1["Stable Diffusion
判别任务"]
C2["单点监督
减少标注"]
C3["基础模型
迁移学习"]
end
A1 --> B1
A4 --> B1
B1 --> B2
B2 --> B3
B3 --> C1
B3 --> C2
B3 --> C3
这条演进线的核心逻辑是:从逐帧空间特征提取 → 时空联合建模 → 动态自适应 → 多模态融合。人类动作识别中的成熟方法(I3D、SlowFast、C3D 等)均首先在 Kinetics-400 上验证,再迁移到动物场景。#Zia et al., 2025
这篇 survey 最有价值的贡献不是某个具体方法,而是一个四层分类框架——从技术演进、关键考量、整合策略、感知模态四个维度系统地组织了动物动作识别领域。
层次一 · 技术演进框架(§2.1)
从基础工具(DeepLabCut 姿态估计)到 CNN 视频帧分类(Stern 2015),再到渐进式深度学习(Feng 2023 的 PBRD 框架)、动态时空特化(DSTS)、双流姿态 CNN(TSPCNN),最后展望 Stable Diffusion / 单点监督 / 基础模型。这条线索已在 Part 2 的演进图中展示。
层次二 · 两个关键考量维度(§2.2)
Survey 提出两个坐标轴来定位所有方法:
- 时间动态(Temporal Dynamics):动作如何随时间演变,捕获每个运动的序列和持续时间。挑战在于检测微妙且快速的动作。#Zia et al., 2025
- 空间上下文(Spatial Context):动作发生的空间背景,包括动物与环境、与其他个体的交互。空间上下文提供额外线索来引导更精确的动作识别。#Zia et al., 2025
两者是相互依存的(interdependent),结合时能提供对动物行为的全面理解。
层次三 · 八种 CG→FG 整合策略(§2.3)
这是 survey 最核心的分类贡献——按策略导向将整合方法分为八类:
| # | 策略 | 核心思想 | 技术细节 | 代表方法 |
|---|---|---|---|---|
| 1 | Hierarchical | 分层识别:先 coarse → 再 fine-grained,仅在必要时启用密集分析 | 先识别 walking/running 等粗粒度,再对相关子集做 jumping/scratching 细粒度分析。优化计算资源——仅在必要时启用密集计算 | Zhao et al. 2017 #Zia et al., 2025 |
| 2 | Open-set | 既识别已知行为,也检测未见过的动作;适用于动态环境 | 动物可能展现训练集中未出现的新行为。开放集识别使用距离度量或概率模型判断样本是否属于已知类别 | Bendale & Boult 2016 |
| 3 | Action Segmentation | 将连续视频流切分为独立动作段,每段对应一个特定动作 | 由于动物运动的流畅性,精确定位起始/结束帧极具挑战性。时序卷积网络(TCN)在此方向展示了潜力 | Lea et al. 2017; MS-TCN |
| 4 | Feature Fusion | 融合 coarse + fine 特征,同时捕获高层上下文和细微细节 | 构建更全面的特征表示,增强判别力。可在早期(数据级)、中期(特征级)或晚期(决策级)进行融合 | Shaikh et al. 2024 |
| 5 | Two-stage | 级联架构:第一阶段 coarse,歧义时第二阶段 fine | 第一阶段快速筛选明确样本,第二阶段仅处理模糊案例。平衡速度与精度。TSPCNN 一流处理 RGB,一流处理 Pose+RGB,通过 attention + late fusion 融合 | Hacker et al. 2023 (TSPCNN) |
| 6 | Feedback | 迭代精化:coarse → fine → coarse → fine,随时间提升精度 | 双向反馈机制——粗粒度结果引导细粒度分析方向,细粒度结果反过来修正粗粒度判断。允许自适应特征学习 | Yang et al. 2021 |
| 7 | Ensemble | 投票或加权平均组合 coarse + fine 分类器 | 受益于两个识别层级的互补性。可使用投票、加权平均或 stacking 等集成策略 | Vu et al. 2023 |
| 8 | Adaptive | 根据输入复杂度动态切换策略;动态核机制细化关注 | 包括自适应模型切换(按输入复杂度选择策略)和动态核机制(细化对复杂细节的关注) | Yang et al. 2023; Yenduri et al. 2022 |
八种策略的选择指南
从工程实践角度,这 8 种策略可归纳为三大范式:
- 级联范式(Hierarchical / Two-stage):粗粒度快速筛选 + 细粒度精准分析。适合计算资源受限的边缘部署场景(如宠物摄像头)。
- 融合范式(Feature Fusion / Ensemble / Feedback):粗粒度和细粒度同时运行后融合。精度更高但计算量倍增,适合云端高精度场景。
- 自适应范式(Open-set / Action Segmentation / Adaptive):根据输入动态调整策略。最灵活但实现复杂度最高,适合野生动物监控等不可预测场景。
层次四 · 四种感知模态(§2.4)
| 模态 | 描述 | 优势 |
|---|---|---|
| 视觉(Vision) | 视频帧 CNN/DL 特征提取 | 细粒度动作识别的基石 |
| 音频(Audio) | 发声行为和环境交互线索 | Bain et al. 在野生灵长类中展示音视频联合识别 |
| 惯性传感器(Inertial) | 加速度计/陀螺仪连续高精度数据 | 与视觉数据互补,推断详细运动模式 |
| 生理信号(Physiological) | 心率/体温/肌电 | 反映动物内部状态(压力、兴奋) |
Survey 给出了多模态融合的一般形式:
其中 $X_v, X_a, \ldots$ 分别代表视觉、听觉等模态输入,$f(\cdot;\theta)$ 为各模态的特征提取函数,$h$ 为融合函数。论文未限定 $h$ 的具体形式,允许早期融合、晚期融合或中间层融合。#Zia et al., 2025
数据集结构化对比(Table 1)
Survey 系统对比了 8 个动物视觉行为识别数据集,按 5 个关键维度组织:
| 数据集 | Multi-Object | 模态 | CG | FG | 公开 | 特色 |
|---|---|---|---|---|---|---|
| Large Animals | ✗ | Video | ✓ | ✗ | ✗ | 60 cattle videos,6 种跟踪算法评估 |
| Wild Felines | ✗ | Video | ✓ | ✗ | ✗ | 猫科动物监控视频 |
| Wildlife Action | ✗ | Video | ✓ | ✗ | ✗ | 106 action categories, UCF CRCV |
| Wildlife Monitoring | ✗ | Video | ✓ | ✗ | ✗ | Camera trap,red/fallow/roe deer |
| PBRD | ✗ | Image | ✓ | ✓ | ✓ | 灵长类 30 类行为, 7500 图像, progressive attention |
| Animal Kingdom #Ng et al., 2022 | ✗ | Video | ✓ | ✓ | ✓ | 850 物种, 50h 视频, 30K 序列, CVPR 2022 |
| MammalNet #Chen et al., 2023 | ✓ | Video | ✓ | ✓ | ✓ | 173 种哺乳动物, 12 种行为, CVPR 2023 |
| CVB | ✓ | Video | ✓ | ✓ | ✓ | 牛 11 类行为, 502 clips × 450 帧, 4 视角 |
方法精度对比(Table 2)
| 类型 | 方法 | 数据集 | 精度 |
|---|---|---|---|
| CG | Trajectory-based | Large Animals | 88.4%–94.1% |
| CG | Two-Stream Network | Wild Felines | 92%–97% |
| CG | I3D + Hierarchical | Wildlife Action | 33%–36% |
| CG | MAROON | Wildlife Monitoring | 43.05%–69.16% |
| CG+FG | Progressive DL | PBRD | CG 48%–91.53%, FG 29.62%–81.90% |
| CG+FG | CARe (I3D/X3D/SlowFast) | Animal Kingdom | Mixed 27.3%–39.7% |
| CG+FG | I3D/C3D/SlowFast/MViT V2 | MammalNet | Mixed 34.2%–46.6% |
| CG+FG | SlowFast | CVB | CG 58%–73.96%, FG 12.7%–29.6% |
"Mixed" 精度说明
骨干网络技术谱系
Survey 引用的视频识别骨干网络主要来自人类动作识别领域的迁移:
| 骨干网络 | 架构特点 | 在动物场景中的表现 |
|---|---|---|
| I3D #Carreira & Zisserman, 2017 | 膨胀 3D CNN,将 2D ImageNet 权重膨胀为 3D | MammalNet 34.2%–46.6% |
| SlowFast #Feichtenhofer et al., 2019 | 双路径:慢通道低帧率捕空间语义,快通道高帧率捕运动 | CVB CG 73.96%, FG 29.6% |
| C3D #Tran et al., 2015 | 3D CNN 先驱 | MammalNet 中使用 |
| X3D #Feichtenhofer, 2020 | 渐进扩展策略,效率优先 | Animal Kingdom 27.3%–39.7%(CARe) |
| MViT V2 #Li et al., 2022 | 多尺度 Vision Transformer | MammalNet 中使用 |
| DeepLabCut #Lauer et al., 2022 | 多动物姿态估计+识别+跟踪 | 广泛用于预处理阶段 |
SlowFast 双路径架构:为何成为动物场景的主力
在所有被引用的骨干网络中,SlowFast #Feichtenhofer et al., 2019 是使用频率最高的——出现在 Animal Kingdom、MammalNet 和 CVB 三个数据集的评估中。其核心设计是双路径架构:
慢通道(Slow Pathway):以低帧率 $f_s$ 处理输入(通常为每 16 帧取 1 帧),通道数较大($C_s$),负责捕获空间语义信息——"在哪里发生了什么"。
快通道(Fast Pathway):以高帧率 $f_f = \alpha \cdot f_s$($\alpha > 1$,通常 $\alpha = 8$)处理输入,通道数较小($C_f = \beta \cdot C_s$,$\beta \approx 1/8$),负责捕获运动时序细节——"动作如何演变"。
两路径间通过横向连接(lateral connections)进行信息交换:快通道的特征通过 time-stride 卷积下采样后注入慢通道。这种设计使得 SlowFast 在不显著增加计算量的前提下,同时捕获空间语义和运动细节——这对动物行为识别尤为重要,因为动物行为中的微妙差异(如"反刍-躺卧"vs"反刍-站立")主要体现在运动模式而非空间外观上。
然而,在 CVB 数据集上,即使是 SlowFast 也只能达到 FG 12.7%–29.6% 的准确率。这揭示了单靠架构设计无法解决的核心难题:细粒度行为的判别信息可能不在视频帧的像素级特征中,而在于姿态序列的拓扑变化——这正是后续 个体特定动作检测 中 skeleton-based 方法(如 SkeleTR)的切入点。
I3D 权重膨胀:从 2D 到 3D 的优雅迁移
I3D #Carreira & Zisserman, 2017 的核心创新是将 2D ImageNet 预训练权重膨胀为 3D 卷积核:将 $k \times k$ 的 2D 卷积核沿时间维度膨胀为 $t \times k \times k$ 的 3D 卷积核,其中 $t$ 为时间窗口大小。这种膨胀策略使得 I3D 可以直接利用 ImageNet 的大规模预训练权重——这在动物场景中尤为重要,因为动物行为数据的预训练资源远不如人类动作识别丰富。I3D 在 MammalNet 上达到 34.2%–46.6% 的混合准确率,虽然绝对值不高,但考虑到 MammalNet 覆盖 173 种哺乳动物和 12 种行为,这个结果表明 2D→3D 权重迁移在跨物种场景中仍然有效。
Survey §4 提出了三个前沿方向,虽然都停留在概念讨论层面(未进行实验验证),但方向值得关注:
Stable Diffusion 用于判别任务(§4.1)
扩散模型已从生成任务扩展到判别任务(目标检测、图像分割)。其核心价值在于:渐进去噪过程有助于突出细微差异,使模型能区分高度相关的动作。在去噪过程中融入编码视频特征,可增强模型提取上下文和时序细节的能力。相关工作包括 DiffTAD#Nag et al., 2023、Diffusion Action Segmentation#Liu et al., 2023 等。
单点监督减少标注成本(§4.2)
用极少量标注点实现高精度——这在野生动物行为研究中特别有价值,因为全面标注几乎不可能。挑战在于效果高度依赖初始标注质量,且可能需要更复杂的 ML 技术。相关代表工作为 Proposal-based Temporal Action Localization with Point-level Supervision#Yin et al., 2023。
基础模型迁移学习(§4.3)
大规模预训练网络 → fine-tuning for fine-grained action recognition → 减少对大规模标注数据的需求。基础模型擅长提取丰富的层次化特征,识别粗粒度分析常忽略的微妙行为差异。组合策略包括:
- 基础模型(特征提取+泛化)+ 定制层(针对 fine-grained 优化)
- 知识蒸馏:compact student model 学习 mimicking teacher model 输出
- 多模态融合:结合视觉、听觉、传感器数据
Survey 未覆盖的 2024–2025 工作
Survey 的引用最新到 2024 年初,缺少以下已验证基础模型路线可行性的重要工作:
- SuperAnimal(2024):跨 45+ 物种零样本姿态估计
- Animal-CLIP(IJCV 2025):双 Prompt 增强 VLM
- AnimalMotionCLIP(2025):CLIP + 光流,mAP 74.63
- EthoCLIP(CVPR 2026 Highlight):本体增强视频-语言预训练
- DiffPose-Animal(2024):扩散模型 + 语言条件姿态估计
- ARTEMIS(2024):多模态行为识别 mAP 79.82
详见我们此前的 动物动作识别综述。
CG vs FG 性能鸿沟的量化证据
Survey 最有力的论证来自数据本身。将所有方法的 CG 和 FG 精度并列对比:
flowchart LR
subgraph "CG 准确率"
CG1["轨迹方法 88-94%"]
CG2["双流网络 92-97%"]
CG3["Progressive DL 91.53%"]
CG4["SlowFast CVB 73.96%"]
end
subgraph "FG 准确率"
FG1["Progressive DL 81.90%"]
FG2["SlowFast CVB 29.6%"]
FG3["SlowFast CVB 12.7%"]
end
CG1 -.->|"鸿沟"| FG3
CG4 -.->|"鸿沟"| FG2
PBRD 的亮点:渐进式学习的突破
在所有方法中,Progressive Deep Learning Framework 在 PBRD 数据集上实现了唯一一组 CG 和 FG 都达到较高水平的结果(CG 91.53%, FG 81.90%)。这归功于其区域聚焦和渐进注意力训练策略——逐步细化对判别性区域的关注,使模型能捕获相似动作间的微妙差异。#Feng et al., 2023
大规模 ≠ 高精度
一个反直觉的发现是:数据集规模越大,精度反而可能越低。Animal Kingdom(30,000 视频序列)和 MammalNet(173 哺乳动物类别、539 小时)上的混合准确率仅 27%–46%。原因很清晰——物种多样性和类间差异对模型构成了更大挑战。相比之下,PBRD 虽然只有 7500 张图像、30 类行为,但得益于 progressive attention 策略,精度远超大规模数据集上的方法。
实验配置对比
| 方法 | 数据集 | 骨干网络 | 模态 | 计算成本 | 硬件 | 复现性 |
|---|---|---|---|---|---|---|
| Trajectory-based | Large Animals | 6 种跟踪算法 | Video | ❌ 未披露 | ❌ 未披露 | ⚠️ 数据集未公开 |
| Two-Stream Network | Wild Felines | 双流 CNN | Video | ❌ 未披露 | ❌ 未披露 | ⚠️ 数据集未公开 |
| I3D + Hierarchical | Wildlife Action | I3D | Video | ❌ 未披露 | ❌ 未披露 | ⚠️ 106 类别极多 |
| MAROON | Wildlife Monitoring | SWIFT + Action Rec | Video | ❌ 未披露 | ❌ 未披露 | ⚠️ Camera trap 场景 |
| Progressive DL | PBRD | Region-focused CNN | Image | ❌ 未披露 | ❌ 未披露 | ⚠️ 代码未开源 |
| CARe (I3D/X3D/SlowFast) | Animal Kingdom | I3D / X3D / SlowFast | Video | ❌ 未披露 | ❌ 未披露 | ✅ 数据集公开 |
| I3D/C3D/SlowFast/MViT V2 | MammalNet | 四种骨干 | Video | ❌ 未披露 | ❌ 未披露 | ✅ 数据集公开 |
| SlowFast (lightweight) | CVB | SlowFast 轻量版 | Video | ❌ 未披露 | ❌ 未披露 | ✅ 数据集公开 (DOI) |
注:该 survey 为综述性质,未报告任何自有实验的超参数、训练时间或硬件配置。即使是引用的 CVB SlowFast 实验 #Zia et al., 2023,也未给出学习率、batch size、epoch 数等关键信息。这反映了该领域在实验可复现性方面的普遍不足。
Survey 自身的实验局限
需要指出的是,本文唯一的实验贡献(CVB 上的 SlowFast 评估)引用自 CVB 数据集原始论文#Zia et al., 2023,并非本文新增实验。原文未给出 SlowFast 的具体架构配置、训练超参数或硬件环境,因此即使想复现其基线结果也缺乏足够细节。此外,Table 2 中 "Mixed" 标注的方法未明确说明 CG 和 FG 的区分方式,使得跨方法定量比较的可靠性受限。
可复现性评估
- 自身实验:无自有实验,CVB SlowFast 结果引用自原始论文
- 超参数:未报告任何方法的完整超参数(学习率、batch size、epoch 数均缺失)
- 硬件环境:未提及 GPU 型号、训练时间、推理速度
- 数据划分:未报告各数据集的 train/val/test split 比例
- 评估指标:部分报告 top-1 accuracy,部分报告 mixed accuracy,未统一指标
- 开源代码:SlowFast / I3D / X3D / DeepLabCut 均有开源实现;Progressive DL / DSTS 未提供代码
Survey 的独特定位
与同领域的其他综述相比,本文有几个不可替代的价值点:
| 维度 | 本文 #Zia et al., 2025 | #Kleanthous et al., 2022 | #Broome et al., 2023 |
|---|---|---|---|
| 视角 | CG→FG 演进 + 整合策略 | 广泛的 ML 方法综述 | 聚焦动物疼痛/情绪识别 |
| 分类框架 | 8 种整合策略(策略导向) | 按 ML 方法分类 | 按情感维度分类 |
| 数据集贡献 | 引入 CVB(502 clips, 11 行为) | 无 | 无 |
| 实验验证 | SlowFast 在 CVB 上的评估 | 无 | 无 |
| 伦理讨论 | §5.2 全面讨论(隐私/偏见/误分类) | 未涉及 | 部分涉及 |
局限与缺失
需注意的几点
- 前沿覆盖不足:未覆盖 2024-2025 年涌现的 VLM 方法(Animal-CLIP、AnimalMotionCLIP、EthoCLIP、SuperAnimal 等)
- 方法创新有限:主要是综述性质,§4 提出的三个未来方向停留在概念讨论层面
- 物种特异性:CVB 数据集仅覆盖牛(Bos taurus),对其他物种的泛化性未经验证
- 小错误:SlowFast #Feichtenhofer et al., 2019 实际发表于 ICCV 2019,论文引用标注为 CVPR 2019
伦理讨论的亮点
Survey §5.2 关于伦理和负责任 AI 的讨论在同类 survey 中较为少见,涵盖了三个层面:(1) 野生动物监控的隐私问题;(2) 畜牧业自动化中过度依赖 AI 可能延迟人工干预的风险;(3) 数据偏见导致的模型泛化问题和人类中心的动物行为解读偏差。#Zia et al., 2025
从 CG→FG 鸿沟到 Stitching-Retargeting 范式
这篇 survey 最重要的发现——CG 88%–97% vs FG 12.7%–29.6% 的巨大性能鸿沟——实际上指向了一个更深层的结构性问题:细粒度行为的判别信息不在像素级外观特征中,而在于个体姿态序列的拓扑变化。SlowFast 在 CVB 上的 FG 精度仅 29.6%,正是因为双路径架构捕获的是时空像素特征,而非个体特定的运动模式。
这一洞察直接连接到我们此后的 个体特定动作检测 一文中提出的 Stitching-Retargeting 范式——该范式借鉴机器人运动重定向(Motion Retargeting)的思想,将个体特定动作检测分解为两个阶段:
- Stitching 阶段:从分散的个体观测中缝合出连贯的个体表征(如 DeepLabCut 姿态序列、SuperAnimal 跨物种模型),对应本 survey 中 Part 2 的“姿态估计”前置步骤
- Retargeting 阶段:将通用动作识别能力重定向到个体特定空间(如 SkeleTR 的图卷积骨架建模、IGMN 的个体特定高斯混合),对应本 survey 中从 CG 到 FG 的跨越
换言之,本 survey 识别出的 CG→FG 鸿沟,正是 Stitching-Retargeting 范式要解决的核心问题。八种整合策略中的 Two-stage(TSPCNN)和 Feedback 策略,可以看作 Stitching-Retargeting 思想的隐式实现——它们在不同粒度之间切换,但没有显式地建模个体表征。
可操作的启发
对于希望进入这个领域的研究者,从 survey 中可提炼以下方向:
- 整合策略选型:8 种 CG→FG 整合策略为系统设计提供了清晰的架构选择菜单
- Stitching-Retargeting 路线:先建个体模型(stitching),再做个体特定识别(retargeting),是弥合 CG→FG 鸿沟最有前景的方向
- 基础模型路线:SuperAnimal、Animal-CLIP 等 2024-2025 工作已部分验证了 survey 提出的基础模型方向的可行性
- CVB 数据集:作为单物种多行为的基准,适合验证新的细粒度识别方法(DOI: 10.25919/3g3t-p068)
- 多模态融合:视觉+音频+惯性传感器的融合仍是蓝海,目前大多数工作仅使用视觉模态
参考来源
- Zia, A. et al. (2025). A Review on Coarse to Fine-Grained Animal Action Recognition. Artificial Intelligence Review, 59, 133. arXiv:2506.01214
- Zia, A. et al. (2023). CVB: A Video Dataset of Cattle Visual Behaviors. DOI: 10.25919/3g3t-p068
- Feichtenhofer, C. et al. (2019). SlowFast Networks for Video Recognition. ICCV 2019. arXiv:1812.03982
- Carreira, J. & Zisserman, A. (2017). Quo Vadis, Action Recognition? CVPR 2017. arXiv:1705.07750
- Lauer, J. et al. (2022). Multi-animal pose estimation, identification and tracking with DeepLabCut. Nature Methods, 19(4):496-504. Nature Methods
- Feng, J. et al. (2023). A progressive deep learning framework for fine-grained primate behaviour recognition. Applied Animal Behaviour Science, 269:106099.
- Ng, X.L. et al. (2022). Animal Kingdom: A Large and Diverse Dataset. CVPR 2022. arXiv:2204.08129 · 精读 →
- Chen, J. et al. (2023). MammalNet: A Large-scale Video Benchmark. CVPR 2023. arXiv:2306.00576 · 精读 →
- Tran, D. et al. (2015). Learning Spatiotemporal Features with 3D CNN. ICCV 2015.
- Feichtenhofer, C. (2020). X3D: Expanding Architectures for Efficient Video Recognition. CVPR 2020.
- Li, Y. et al. (2022). MViTv2: Improved Multiscale Vision Transformers. CVPR 2022.
- Nag, S. et al. (2023). DiffTAD: Temporal Action Detection with Proposal Denoising Diffusion. ICCV 2023.
- Liu, D. et al. (2023). Diffusion Action Segmentation. CVPR 2023.
- Yin, Y. et al. (2023). Proposal-based Temporal Action Localization with Point-level Supervision. BMVC 2023.
- Kleanthous, N. et al. (2022). A survey of machine learning approaches in animal behaviour. Neurocomputing.
- Broome, S. et al. (2023). Going Deeper than Tracking: A Survey of CV-Based Recognition of Animal Pain and Emotions. IJCV.