动物动作识别
上一篇我们梳理了人体动作识别的技术全景——从 Two-Stream CNN 到 VideoMAE 到 InternVideo。但当我们把镜头转向动物时,会发现一个尴尬的现实:人体动作识别的整套 pipeline 不能直接迁移。原因不仅是动物长得不一样,而是从数据底层到方法范式都存在结构性差异。
人体动作识别有 Kinetics-400(240k 视频)、有统一的 COCO 17 关键点骨架、有成熟的 MMPose + MMAction2 工具链。而动物动作识别呢?最大的数据集 MammalNet 只有 18K 视频(539 小时),物种间骨架拓扑差异巨大(猫 17 点 vs 鸟 22 点 vs 蛇完全没有四肢),标注还需要动物行为学家参与且需通过伦理审批(IACUC)。
这意味着动物动作识别必须走一条完全不同的路:更依赖迁移学习、更依赖合成数据、更依赖基础模型的零样本能力。本文系统梳理这个方向的方法、数据集和工具。
graph TD
subgraph 数据层
D1[Animal Kingdom
850物种 / 30K片段]
D2[MammalNet
173种 / 539h]
D3[AP-10K
10K帧 / 54种]
D4[Animal3D
40种 / SMAL]
end
subgraph 姿态提取
P1[SuperAnimal
跨 45+物种零样本]
P2[DeepLabCut
微调 50-200帧]
P3[DiffPose-Animal
扩散+语言条件]
end
subgraph 行为识别
A1[ARTEMIS
多模态 mAP 79.82]
A2[AnimalMotionCLIP
CLIP+光流 mAP 74.63]
A2b[Animal-CLIP
双 Prompt VLM]
A3[BehaviorVLM
免微调 VLM]
A4[V-JEPA 2.1
PlayClass F1=77.0]
end
D3 --> P1
D3 --> P2
D3 --> P3
P1 --> A1
P1 --> A2
P2 --> A1
P3 --> A2b
D1 --> A1
D1 --> A2
D2 --> A3
D2 --> A4
style P1 fill:#c8e6c9
style A1 fill:#fff3e0
style A4 fill:#e1bee7
| 维度 | 人体动作识别 | 动物动作识别 |
|---|---|---|
| 骨架拓扑 | 17–25 关键点,COCO/H36M 统一 | 无统一拓扑;SMAL 提供四足参数化模型,但鸟类/爬行类/鱼类差异巨大 |
| 数据规模 | Kinetics-700 百万级视频 | 最大 MammalNet 仅 539h(18K 视频),差一个数量级 |
| 标注成本 | 众包标注即可 | 需动物行为学家 + 伦理审批(IACUC),慢且贵 |
| 物种多样性 | 单一物种 | 长尾分布(Animal Kingdom 覆盖 850 物种 / 6 大类) |
| 遮挡模式 | 主要是人-人/物-人遮挡 | 严重的多动物互遮挡、植被遮挡、外观相似导致 ID 混淆 |
| 形态变化 | 近似刚体比例 | 高度非刚体;蛇/鱼/鸟翅膀/鳍的运动模式完全不同 |
| 视角 | 室内相对固定 | 野外远距离、低分辨率、多角度 |
| 行为定义 | 动作类别相对明确 | 微动作(咀嚼 vs 吞咽)vs 宏观行为(觅食 vs 求偶),时间尺度跨 3 个数量级 |
根据 2025 年综述 A Review on Coarse to Fine-Grained Animal Action Recognition #zia2025survey 的框架,动物动作识别可以按行为粒度分为粗粒度(Coarse-Grained, CG)和细粒度(Fine-Grained, FG)两个层次。粗粒度指一般运动模式(行走、站立、奔跑),细粒度指行为的微妙细节(反刍、梳理、抓挠)。两者在算法设计上有显著差异——FG 需要更强的时序建模和更精细的姿态信息。
从技术路线上,动物动作识别已经形成 7 个清晰的子方向:
| 子方向 | 核心任务 | 代表方法/数据集 | 应用场景 |
|---|---|---|---|
| A. 行为分类 | 短片段多标签/单标签动作识别 | Animal Kingdom, MammalNet, ARTEMIS, MSQNet | 通用动物学 |
| B. 时序行为定位 | 长视频中定位行为起止时刻 | Animal Kingdom Grounding, RaSeformer | 医疗/神经科学 |
| C. 姿态驱动行为识别 | 先估姿态/骨架,再做行为分类 | APT-36K, SuperAnimal + 动作分类头 | 畜牧业、神经科学 |
| D. 3D 行为恢复 | 估计动物 SMAL mesh + 3D 关键点 | Animal3D, PRIMA, BigMaQ, SAM 3D Animal | 神经科学、动画 |
| E. VLM/基础模型 | 零样本/少样本视频问答与行为发现 | BehaviorVLM, AnimalMotionCLIP, PlayClass | 生态监测 |
| F. 畜牧传感 | IMU/可穿戴传感器 + 分类器 | IBA-Net, AnimalFormer, RayPet | 精准畜牧 |
| G. 多动物跟踪 | ReID + 跟踪 + 群体行为 | CHIRP, BaboonLand, MammAlps | 野生动物保护 |
数据集是动物动作识别的瓶颈。以下按重要性排序:
行为识别数据集
| 数据集 | 年份 | 规模 | 物种覆盖 | 任务 | 关键特点 |
|---|---|---|---|---|---|
| Animal Kingdom | CVPR 2022 | 50h 视频 + 30K clip + 33K 帧 | 850 物种 / 6 大类 | grounding + 动作识别 + 姿态 | 领域标杆;多标签 140 动作类;物种最多样 |
| MammalNet | CVPR 2023 | 18K 视频 / 539h | 173 哺乳种 / 17 目 / 69 科 | 行为分类 + 组合零样本 | 最大规模;按生物分类学标注;12 类高层行为 |
| EgoPet | 2024 | 2,500+ 视频片段 | 狗/猫为主(+鹰/狼等) | 第一视角动作 + 交互 | 宠物 egocentric 视角;Yann LeCun 参与;机器人预训练 + 行为理解 |
| BaboonLand | 2024 | 长期野外 | 狒狒 | 跟踪 + 行为识别 | 群体行为自动化 |
| MammAlps | 2025 | 多视角 | 阿尔卑斯野生哺乳 | 行为监测 | 多视角集成姿态+行为+跟踪 |
姿态估计数据集
| 数据集 | 年份 | 规模 | 物种 | 标注类型 | 关键特点 |
|---|---|---|---|---|---|
| AP-10K | NeurIPS 2021 | 10,015 图像 | 23 科 / 54 哺乳种 | 2D 17 关键点 | 首个大规模动物姿态基准;已集成 MMPose |
| APT-36K / APTv2 | 2022/2023 | 36K+ 帧 | 多科 | 2D 关键点 + 追踪 | 加入时间维度跟踪 |
| Animal3D | ICCV 2023 | 3,379 图像 | 40 哺乳种 | SMAL + 2D + 分割 | 首个 3D 网格基准 |
| BigMaQ | ICLR 2026 | 750 段 | 恒河猴 | 3D mesh + 行为 | 3D 姿态显著提升行为识别 mAP |
| SAM 3D Animal | Meta 2026 | 多物种 | 哺乳/鸟/爬行 | SAM-promptable 3D 重建 | 用 SAM2 提示 → 单图/多图 3D mesh 恢复;突破传统 SMAL 限制 |
数据稀缺的严重程度
Animal Kingdom 覆盖 850 物种,但平均每个物种只有约 35 个动作片段——对于深度学习来说这几乎是零样本场景。80% 的物种缺乏 3D 标注或精细行为标注。这是动物动作识别方法必须依赖迁移学习和基础模型的根本原因。
阶段一:专用架构(2018–2022)
早期工作直接将人体动作识别的方法(C3D, I3D, SlowFast)迁移到动物数据上。Animal Kingdom 的 CARe(Collaborative Action Recognition)模型是这一阶段的代表——它分离 general feature(跨物种共享)和 specific feature(物种特有),通过 collaborative learning 在 unseen species 上做泛化。
但核心问题是:人体模型的归纳偏置不适用于动物。SlowFast 在 Kinetics-400 上的双速通道设计基于人类运动的帧率特征,但动物的运动频率(蜂鸟翅膀 vs 大象行走)跨越的数量级远大于人类。
阶段二:多模态融合与 CLIP 注入(2023–2024)
MSQNet #mondal2023msqnet(ICCV 2023 Workshop)提出了 Actor-agnostic 多模态查询网络——不再为每种动物设计专用模型,而是用 CLIP 的文本编码器为每个动作类别生成可学习的多模态 query,通过 Transformer decoder 从视频编码器中提取相关信息。这种设计天然跨物种。
ARTEMIS #artemis2025(2025)更进一步:用 BLIP2 和 Llama 3 从视频帧中自动生成文本描述,将文本作为额外的模态注入分类器。在 Animal Kingdom 上达到 mAP 79.82(当前 SOTA),并通过遗传算法和强化学习动态调整集成权重。
阶段三:视频基础模型 + 零样本(2024–至今)
最新趋势不再专门设计模型,而是直接用冻结的视频基础模型做行为理解:
- AnimalMotionCLIP #animalmotionclip2025 — 在 CLIP 空间中嵌入光流运动信息,提出 dense/semi/sparse 三种时间聚合策略,其中 sparse 策略在 Animal Kingdom 上达到 mAP 74.63(RGB+光流融合,比 MSQNet+pre-training 的 73.10 高 1.53 个百分点)。CV4Animals 2024 Best Paper。
- Animal-CLIP #animalclip2025 — 双 Prompt 增强的 VLM 框架(IJCV 2025):为每个动物物种动态生成 species-aware prompt 和 action-specific prompt,在 Animal Kingdom 上显著优于纯 CLIP 和 MSQNet。核心发现:物种信息作为先验注入文本端,比修改视觉端更高效。
- BehaviorVLM #behaviorvlm2026 — 无需下游微调,用多阶段 VLM 推理同时完成姿态估计和行为发现。这意味着不需要标注数据。
- PlayClass #playclass2026 — 用 Meta 的 V-JEPA 2.1 作为 backbone,加上 SAM 3 分割和手工运动特征,在鸡只玩耍行为分类上达到 F1=77.0。V-JEPA 2.1 是当前最强的视频编码器。
- Mamba-MSQNet — Selective State Space Model(Mamba)替代 Transformer,实现更高效的动物动作识别。在 Animal Kingdom 上用更少参数达到与 MSQNet 相当的 mAP。
姿态估计:从单物种到跨物种
动物姿态估计是行为分析的关键前置步骤。过去每个物种需要单独标注和训练(用 DeepLabCut 标 50–200 帧再微调)。2024 年,Mathis Lab 发布了 SuperAnimal #superanimal2024(Nature Communications 2024)——一个跨 45+ 物种的通用姿态估计基础模型,零样本即可使用,支持无监督视频自适应来消除抖动。如果效果不够,微调时比传统迁移学习高效 10–100 倍。
SuperAnimal 的意义在于:它让"姿态估计 → 行为识别"的 pipeline 在动物上变得可行。你可以先用 SuperAnimal 提取关节点序列,再用 ST-GCN 或 PoseConv3D 做行为分类。
2025 新进展:扩散模型 + 语言引导
DiffPose-Animal #diffposeanimal2025(arXiv 2508.08783, 2025)将扩散模型引入动物姿态估计:用语言条件引导热图生成,把姿态估计重构为"从噪声中恢复关键点热图"的生成过程。相比传统热图回归(HRNet/HigherHRNet),扩散模型能更好地处理遮挡和模糊边界——这在动物场景中极为常见(植被遮挡、多动物重叠)。该方法在 AP-10K 上展示了优于传统热图方法的 PCK 指标,同时语言条件使得模型能适配不同物种的骨架定义,而不必重新训练。
与此同时,AniMer #animer2024(arXiv 2412.00837, 2024)提出了 Family-Aware Transformer:在 Transformer 编码器中嵌入动物的科属分类信息,让模型在估计姿态时自动利用生物分类学先验(猫科和犬科的关节拓扑更相似,而与鸟类的差异更大)。这种思路与 Animal-CLIP 的物种 prompt 异曲同工——生物分类学先验是跨物种泛化的关键信号。
graph LR
V[原始视频] --> S1[SuperAnimal
零样本姿态估计]
S1 --> S2[关节点序列
T×N×C]
S2 --> G1[ST-GCN / PoseConv3D
时空图卷积]
G1 --> C[行为分类]
V -.并行.-> V2[VideoMAE / V-JEPA
RGB特征提取]
V2 --> C2[行为分类]
V -.新模态.-> V3[CoTracker3
稀疏轨迹]
V3 --> C3[轨迹Transformer
运动特征]
V -.新模态.-> V4[MiDaS
单目深度估计]
V4 --> C4[Depth分支
空间关系特征]
C --> F[融合决策]
C2 --> F
C3 --> F
C4 --> F
F --> R[输出:动作类别]
style S1 fill:#c8e6c9
style G1 fill:#e3f2fd
style V2 fill:#fff3e0
style V3 fill:#f3e5f5
style V4 fill:#e0f2f1
style F fill:#fce4ec输入模态扩展:RGB 和骨架之外的新路线
2024–2026 年,动作识别领域出现了多种新的输入表示,不再局限于 RGB 和骨架两条传统路线。这些新模态对动物行为识别有特殊的适配价值——因为动物场景的外观偏差(appearance bias)比人体场景更严重(毛色变化、物种差异、野外背景干扰),运动驱动或几何驱动的模态天然更具跨物种泛化能力。
| 模态 | 代表方法 | 输入形式 | 动物场景适配性 | 关键障碍 |
|---|---|---|---|---|
| RGB | SlowFast, VideoMAE, V-JEPA | 原始视频帧 | ⭐⭐⭐⭐⭐ — 信息完整 | 外观偏差严重,跨物种泛化弱 |
| Skeleton | ST-GCN, PoseConv3D | 关键点序列 | ⭐⭐⭐⭐ — 轻量、外观不变 | 需物种专用姿态估计(SuperAnimal 缓解) |
| RGB-D / Depth | DEAR (ECCV 2024) | RGB + 单目深度图 | ⭐⭐⭐ — 增加空间关系 | 动物表面深度估计精度下降 |
| 稀疏轨迹 | TrAction (2026) | CoTracker3 点轨迹 | ⭐⭐⭐⭐ — 纯运动、跨物种 | CoTracker3 在动物上未验证;静态行为无效 |
| 3D 点云 | 3DInAction (2023) | 点云序列 | ⭐⭐ — 几何完整 | 需深度传感器/多视角,成本过高 |
| 事件相机 | POKER (CVPR 2026) | 异步事件流 | ⭐⭐ — 极低功耗 | 专用硬件;静态行为无信号 |
| 热成像 | 野生动物监测 | 红外热辐射 | ⭐⭐ — 夜间检测 | 行为分类研究极少 |
| IMU/传感器 | IBA-Net, AnimalFormer | 加速度计/陀螺仪 | ⭐⭐⭐ — 精准畜牧成熟 | 需佩戴设备,宠物场景接受度低 |
| 毫米波雷达 | RayPet (2024) | FMCW 雷达信号 | ⭐⭐⭐ — 隐私友好、穿遮挡 | 需专用雷达硬件 |
三条值得关注的新模态
RGB-D / 单目深度:DEAR(ECCV 2024 Workshop)证明了从普通 RGB 视频用 MiDaS 生成 depth map,再与 RGB 双流融合(Gated Cross-Attention),在 SSV2 上提升 +0.6%。关键是无需额外硬件。对动物场景,深度信息对涉及空间关系的行为(跳上/跳下、钻进洞穴、捕食距离判断)可能有更大提升。但动物毛发表面会导致单目深度估计退化,作为辅助模态而非主模态是可接受的。
稀疏轨迹(TrAction, 2026):用 CoTracker3 提取数百个稀疏点的 2.5D 运动轨迹,完全不含外观信息。在 SSV2 上纯轨迹达到 45% Top-1,与 DINOv2 融合后提升 +8.7 个点。这个方向对动物行为识别特别有吸引力——动物行为主要由运动模式区分(走/跑/跳/捕食/求偶),外观信息反而引入物种偏差。轨迹表示天然跨物种、对背景和光照鲁棒。但 CoTracker3 在动物上的跟踪质量需实测验证,且静态行为(趴/睡)几乎无轨迹信号。
3D 点云(3DInAction, 2023):提出 t-patch(时序局部点块)+ 分层 MLP 架构,在 DFAUST 上提升 +13%。2025 年的扩展工作支持单目深度估计生成的点云,在 NTU RGB-D 120 上达到 89.3%。但数据获取成本是最大瓶颈——深度传感器或多视角重建远超普通监控成本,猫的毛发表面也会严重退化深度估计。
动物动作识别没有像 MMAction2 这样的统一框架,但有成熟的工具组件:
| 工具 | 类型 | 功能 | 关键特性 |
|---|---|---|---|
| DeepLabCut | 姿态估计工具箱 | 2D/3D markerless pose estimation | 50–200 帧即可训练;支持多动物;最成熟的动物行为分析工具 |
| SuperAnimal | 基础模型 | 跨 45+ 物种零样本姿态估计 | 无需额外标注;支持视频自适应;微调比迁移学习高效 10–100× |
| MMPose (AP-10K) | 姿态估计框架 | OpenMMLab 体系动物姿态估计 | 已集成 AP-10K 数据集;可对接 MMAction2 |
| SMAL/SMAL+ | 3D 形态模型 | 四足动物可变形 3D 网格 | 参数化模型;覆盖狮/虎/马/牛/河马/狗 |
| idtracker.ai | 多动物跟踪 | 大群体无标记动物追踪 | 鱼群/昆虫/鼠群;自动个体识别 |
| SAMannot | 标注工具 | SAM2 视频实例分割 | 本地运行;专为动物行为追踪设计 |
| MMAction2 | 动作识别框架 | 训练 + 评测 + 部署 | 可通过自定义数据适配动物行为 |
推荐 Pipeline
对于宠物/动物行为识别项目,推荐的完整 pipeline:
- 姿态提取:SuperAnimal(零样本)或 DeepLabCut(微调)提取关节点序列
- 行为分类:用 ST-GCN/PoseConv3D(骨架路线)或 SlowFast/VideoMAE(RGB 路线)做分类
- 零样本增强:用 AnimalMotionCLIP 或 BehaviorVLM 做开放词汇行为识别
- 部署:通过 MMDeploy 导出 TensorRT / ONNX Runtime
CV4Animals Workshop是动物行为视觉分析的核心学术阵地,自 2023 年起连续在 CVPR 举办,2026 年已是第 4 届。新工作优先关注此 Workshop + CVPR/ECCV/ICCV/NeurIPS 主会。
从趋势上看,2026 年的主题词是 3D + 大模型 + 生态落地:BigMaQ(猴 3D mesh + 行为,ICLR 2026)、SAM 3D Animal(Meta 标志性工作)、CHIRP(鸟类长期生态监测)、PRIMA(用 BioCLIP 解决长尾物种 3D mesh 恢复)。
Must-Read(必读)
| 论文 | 年份 | Venue | 核心贡献 |
|---|---|---|---|
| Animal Kingdom | 2022 | CVPR Oral | 850 物种标杆数据集;CARe 基线模型 |
| MammalNet | 2023 | CVPR | 最大视频基准 539h;组合零样本评测 |
| AP-10K | 2021 | NeurIPS D&B | 首个大规模动物 2D 姿态基准 |
| Animal3D | 2023 | ICCV | 首个动物 3D mesh 数据集 |
| AnimalMotionCLIP | 2024 | CV4Animals Best | CLIP + 光流运动嵌入;mAP 74.63 |
| Animal-CLIP | 2025 | IJCV | 双 Prompt VLM;物种感知 + 动作感知 |
| ARTEMIS | 2025 | IJMLC | 多模态融合 SOTA mAP 79.82 |
| SuperAnimal | 2024 | Nature Comm. | 跨 45+ 物种零样本姿态估计 |
| DiffPose-Animal | 2025 | arXiv | 扩散模型 + 语言条件动物姿态估计 |
Route-Representative(路线代表)
| 论文 | 年份 | 方向 | 核心贡献 |
|---|---|---|---|
| MSQNet | 2023 | 多模态 | Actor-agnostic 多模态查询网络 |
| BehaviorVLM | 2026 | 基础模型 | 免微调 VLM 行为理解 |
| PlayClass (V-JEPA) | 2026 | 基础模型 | V-JEPA 2.1 作为行为分类 backbone |
| BigMaQ | 2026 | 3D | 猴 3D mesh 数据集;3D 姿态提升 mAP |
| AniMer+ | 2025 | 3D | 跨哺乳+鸟类的 Family-aware Transformer |
| SAM 3D Animal | 2026 | 3D | Meta 标志性工作;SAM2 提示 3D 重建 |
| AnimalFormer | 2024 | 畜牧 | 精准畜牧多模态视觉框架 |
| RayPet | 2024 | 宠物传感 | 毫米波雷达宠物姿态/活动识别 |
| Forecasting Motion in the Wild | 2026 | 运动预测 | 类无关 motion trajectory token + 扩散预测 |
| TrAction | 2026 | 稀疏轨迹 | CoTracker3 点轨迹 + 掩码预训练,纯运动驱动行为识别 |
| DEAR | 2024 | RGB-D | 单目深度估计 + 双流 GCA 融合,无需额外硬件 |
| 3DInAction | 2023 | 3D 点云 | t-patch + 分层 MLP,3D 点云序列行为识别 |
考虑到你的背景(生成式 AI / 视频理解 / ComfyUI / 扩散模型 / LoRA),以下是三个最有差异化潜力的切入方向:
方向一:生成式数据增强(解决长尾物种数据稀缺)
用扩散模型生成"长尾物种 + 细粒度行为"视频数据,解决 Animal Kingdom 中 80% 物种缺乏标注的核心瓶颈。基础工作是 AP-CAP、PRIMA、AniMer+ 的合成管道,你的 Stable Diffusion / LoRA 经验直接对口。
方向二:视频基础模型 × 动物行为
将 V-JEPA / CLIP / VideoMAE 等通用视频基础模型适配到宠物/特定物种行为识别。基于 AnimalMotionCLIP、BehaviorVLM 的路线,做 few-shot 个性化。这与你在钉钉的视频/AI Agent 方向可能直接相关。
方向三:多模态宠物行为理解系统
构建跨模态(视觉 + IMU/雷达 + 声音)的宠物日常行为理解系统。基础工作是 AnimalFormer、RayPet(雷达)、Beyond Discrete Categories(声音情感)。落地路径明确:智能家居/IoT 场景。
方向四:稀疏轨迹 × 动物行为(高差异化)
将 TrAction 的稀疏轨迹表示迁移到动物行为识别。核心假设:运动轨迹的跨物种泛化能力远强于外观特征——猫和豹的跳跃轨迹模式相似,但外观差异巨大。需要验证 CoTracker3 在动物上的跟踪质量,并解决静态行为无信号的问题(与 RGB 分支互补)。这是一个几乎空白的研究方向,2026 年 6 月 TrAction 才刚发表,动物方向尚无人探索。
参考来源
- Ng et al., "Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding," CVPR 2022. arXiv:2204.08129
- Chen et al., "MammalNet: A Large-scale Video Benchmark for Mammal Recognition and Behavior Understanding," CVPR 2023. arXiv:2306.00576
- Yu et al., "AP-10K: A Benchmark for Animal Pose Estimation in the Wild," NeurIPS 2021. arXiv:2108.12617
- Xu et al., "Animal3D: A Comprehensive Dataset of 3D Animal Pose and Shape," ICCV 2023. arXiv:2308.11737
- Zia et al., "A Review on Vision-Centric Coarse to Fine-Grained Animal Action Recognition," Artificial Intelligence Review, 2026. arXiv:2506.01214
- ARTEMIS: "Animal Recognition Through Enhanced Multimodal Integration System," International Journal of Machine Learning and Cybernetics, 2025.
- Mondal et al., "Actor-Agnostic Multi-label Action Recognition with Multi-modal Query (MSQNet)," ICCV 2023 Workshop. arXiv:2307.10763
- "AnimalMotionCLIP: Embedding Motion in CLIP for Animal Behavior Analysis," CV4Animals 2024 Best Paper. arXiv:2505.00569
- "Animal-CLIP: A Dual-Prompt Enhanced Vision-Language Model for Animal Action Recognition," International Journal of Computer Vision, 2025. DOI:10.1007/s11263-025-02408-4
- "DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation," arXiv:2508.08783, 2025.
- "AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer," arXiv:2412.00837, 2024.
- "BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning," arXiv:2603.12176, 2026.
- "PlayClass: Automated Play Behaviour Classification in Poultry," CV4Animals 2026. arXiv:2605.27304
- Ye et al., "SuperAnimal Pretrained Pose Estimation Models for Behavioral Analysis," Nature Communications, 2024.
- Bar et al., "EgoPet: Egomotion and Interaction Data from an Animal's Perspective," arXiv:2404.09991, 2024.
- "BigMaQ: A Big Macaque Motion and Animation Dataset," ICLR 2026. arXiv:2602.19874
- "RayPet: Activity and Posture Recognition in Pets Using FMCW Mm-Wave Radar," arXiv:2404.15340, 2024.
- "AnimalFormer: Multimodal Vision Framework for Behavior-based Precision Livestock," arXiv:2406.09711, 2024.
- Rahmani et al., "DEAR: Depth-Enhanced Action Recognition," ECCV 2024 Workshop. GitHub
- Meier et al., "TrAction: Action Recognition with Sparse Trajectories," arXiv:2606.03490, 2026. GitHub
- Ben-Shabat et al., "3DInAction: Understanding Human Actions in 3D Point Clouds," arXiv:2303.06346, 2023. GitHub
- Cao et al., "Seeing Motion Through Polarity for Event-based Action Recognition," CVPR 2026.
- "A Comprehensive Survey on RGB-D-based Human Action Recognition," Springer JIVP, 2025.