ESC
输入关键词搜索文章
目录

动物动作识别

从数据稀缺到基础模型的破局之路
数据集 · 跨物种泛化 · 姿态估计 · 行为理解 · 工具链
系列导览 · 动物方向
为什么动物动作识别是一门完全不同的学问

上一篇我们梳理了人体动作识别的技术全景——从 Two-Stream CNN 到 VideoMAE 到 InternVideo。但当我们把镜头转向动物时,会发现一个尴尬的现实:人体动作识别的整套 pipeline 不能直接迁移。原因不仅是动物长得不一样,而是从数据底层到方法范式都存在结构性差异。

人体动作识别有 Kinetics-400(240k 视频)、有统一的 COCO 17 关键点骨架、有成熟的 MMPose + MMAction2 工具链。而动物动作识别呢?最大的数据集 MammalNet 只有 18K 视频(539 小时),物种间骨架拓扑差异巨大(猫 17 点 vs 鸟 22 点 vs 蛇完全没有四肢),标注还需要动物行为学家参与且需通过伦理审批(IACUC)。

这意味着动物动作识别必须走一条完全不同的路:更依赖迁移学习、更依赖合成数据、更依赖基础模型的零样本能力。本文系统梳理这个方向的方法、数据集和工具。

graph TD
    subgraph 数据层
        D1[Animal Kingdom
850物种 / 30K片段] D2[MammalNet
173种 / 539h] D3[AP-10K
10K帧 / 54种] D4[Animal3D
40种 / SMAL] end subgraph 姿态提取 P1[SuperAnimal
跨 45+物种零样本] P2[DeepLabCut
微调 50-200帧] P3[DiffPose-Animal
扩散+语言条件] end subgraph 行为识别 A1[ARTEMIS
多模态 mAP 79.82] A2[AnimalMotionCLIP
CLIP+光流 mAP 74.63] A2b[Animal-CLIP
双 Prompt VLM] A3[BehaviorVLM
免微调 VLM] A4[V-JEPA 2.1
PlayClass F1=77.0] end D3 --> P1 D3 --> P2 D3 --> P3 P1 --> A1 P1 --> A2 P2 --> A1 P3 --> A2b D1 --> A1 D1 --> A2 D2 --> A3 D2 --> A4 style P1 fill:#c8e6c9 style A1 fill:#fff3e0 style A4 fill:#e1bee7
图 1: 动物动作识别技术栈——从数据集到姿态提取再到行为识别的完整 pipeline
Problem Gap
动物 vs 人体动作识别:差异在哪
维度人体动作识别动物动作识别
骨架拓扑17–25 关键点,COCO/H36M 统一无统一拓扑;SMAL 提供四足参数化模型,但鸟类/爬行类/鱼类差异巨大
数据规模Kinetics-700 百万级视频最大 MammalNet 仅 539h(18K 视频),差一个数量级
标注成本众包标注即可需动物行为学家 + 伦理审批(IACUC),慢且贵
物种多样性单一物种长尾分布(Animal Kingdom 覆盖 850 物种 / 6 大类)
遮挡模式主要是人-人/物-人遮挡严重的多动物互遮挡、植被遮挡、外观相似导致 ID 混淆
形态变化近似刚体比例高度非刚体;蛇/鱼/鸟翅膀/鳍的运动模式完全不同
视角室内相对固定野外远距离、低分辨率、多角度
行为定义动作类别相对明确微动作(咀嚼 vs 吞咽)vs 宏观行为(觅食 vs 求偶),时间尺度跨 3 个数量级
核心挑战一句话:人体动作识别的核心矛盾是"如何高效建模时序",而动物动作识别的核心矛盾是"数据太稀缺 + 物种太分散 + 骨架不统一",方法设计的重心从"更好的时序建模"转向"更好的跨物种泛化和数据效率"。
Taxonomy
子方向分类与代表工作

根据 2025 年综述 A Review on Coarse to Fine-Grained Animal Action Recognition #zia2025survey 的框架,动物动作识别可以按行为粒度分为粗粒度(Coarse-Grained, CG)细粒度(Fine-Grained, FG)两个层次。粗粒度指一般运动模式(行走、站立、奔跑),细粒度指行为的微妙细节(反刍、梳理、抓挠)。两者在算法设计上有显著差异——FG 需要更强的时序建模和更精细的姿态信息。

从技术路线上,动物动作识别已经形成 7 个清晰的子方向:

子方向核心任务代表方法/数据集应用场景
A. 行为分类短片段多标签/单标签动作识别Animal Kingdom, MammalNet, ARTEMIS, MSQNet通用动物学
B. 时序行为定位长视频中定位行为起止时刻Animal Kingdom Grounding, RaSeformer医疗/神经科学
C. 姿态驱动行为识别先估姿态/骨架,再做行为分类APT-36K, SuperAnimal + 动作分类头畜牧业、神经科学
D. 3D 行为恢复估计动物 SMAL mesh + 3D 关键点Animal3D, PRIMA, BigMaQ, SAM 3D Animal神经科学、动画
E. VLM/基础模型零样本/少样本视频问答与行为发现BehaviorVLM, AnimalMotionCLIP, PlayClass生态监测
F. 畜牧传感IMU/可穿戴传感器 + 分类器IBA-Net, AnimalFormer, RayPet精准畜牧
G. 多动物跟踪ReID + 跟踪 + 群体行为CHIRP, BaboonLand, MammAlps野生动物保护
Datasets
关键数据集

数据集是动物动作识别的瓶颈。以下按重要性排序:

图 3: Animal Kingdom 数据集物种覆盖——850 个物种横跨哺乳、鸟、爬行、鱼、两栖、昆虫六大类,是当前物种多样性最高的动物行为数据集(来源:Ng et al., Animal Kingdom, CVPR 2022)

行为识别数据集

数据集年份规模物种覆盖任务关键特点
Animal KingdomCVPR 202250h 视频 + 30K clip + 33K 帧850 物种 / 6 大类grounding + 动作识别 + 姿态领域标杆;多标签 140 动作类;物种最多样
MammalNetCVPR 202318K 视频 / 539h173 哺乳种 / 17 目 / 69 科行为分类 + 组合零样本最大规模;按生物分类学标注;12 类高层行为
EgoPet20242,500+ 视频片段狗/猫为主(+鹰/狼等)第一视角动作 + 交互宠物 egocentric 视角;Yann LeCun 参与;机器人预训练 + 行为理解
BaboonLand2024长期野外狒狒跟踪 + 行为识别群体行为自动化
MammAlps2025多视角阿尔卑斯野生哺乳行为监测多视角集成姿态+行为+跟踪

姿态估计数据集

数据集年份规模物种标注类型关键特点
AP-10KNeurIPS 202110,015 图像23 科 / 54 哺乳种2D 17 关键点首个大规模动物姿态基准;已集成 MMPose
APT-36K / APTv22022/202336K+ 帧多科2D 关键点 + 追踪加入时间维度跟踪
Animal3DICCV 20233,379 图像40 哺乳种SMAL + 2D + 分割首个 3D 网格基准
BigMaQICLR 2026750 段恒河猴3D mesh + 行为3D 姿态显著提升行为识别 mAP
SAM 3D AnimalMeta 2026多物种哺乳/鸟/爬行SAM-promptable 3D 重建用 SAM2 提示 → 单图/多图 3D mesh 恢复;突破传统 SMAL 限制

数据稀缺的严重程度

Animal Kingdom 覆盖 850 物种,但平均每个物种只有约 35 个动作片段——对于深度学习来说这几乎是零样本场景。80% 的物种缺乏 3D 标注或精细行为标注。这是动物动作识别方法必须依赖迁移学习和基础模型的根本原因。

Methods
方法演进:从专用架构到基础模型

阶段一:专用架构(2018–2022)

早期工作直接将人体动作识别的方法(C3D, I3D, SlowFast)迁移到动物数据上。Animal Kingdom 的 CARe(Collaborative Action Recognition)模型是这一阶段的代表——它分离 general feature(跨物种共享)和 specific feature(物种特有),通过 collaborative learning 在 unseen species 上做泛化。

但核心问题是:人体模型的归纳偏置不适用于动物。SlowFast 在 Kinetics-400 上的双速通道设计基于人类运动的帧率特征,但动物的运动频率(蜂鸟翅膀 vs 大象行走)跨越的数量级远大于人类。

图 4: Animal Kingdom 的 CARe 架构——Backbone 提取共享特征后分支为 General Feature Elaborator 和 K 个 Specific Feature Elaborator,通过 Relevance Evaluator 加权融合解决 unseen species 泛化(来源:Ng et al., Animal Kingdom, CVPR 2022)

阶段二:多模态融合与 CLIP 注入(2023–2024)

MSQNet #mondal2023msqnet(ICCV 2023 Workshop)提出了 Actor-agnostic 多模态查询网络——不再为每种动物设计专用模型,而是用 CLIP 的文本编码器为每个动作类别生成可学习的多模态 query,通过 Transformer decoder 从视频编码器中提取相关信息。这种设计天然跨物种。

ARTEMIS #artemis2025(2025)更进一步:用 BLIP2 和 Llama 3 从视频帧中自动生成文本描述,将文本作为额外的模态注入分类器。在 Animal Kingdom 上达到 mAP 79.82(当前 SOTA),并通过遗传算法和强化学习动态调整集成权重。

阶段三:视频基础模型 + 零样本(2024–至今)

最新趋势不再专门设计模型,而是直接用冻结的视频基础模型做行为理解:

  • AnimalMotionCLIP #animalmotionclip2025 — 在 CLIP 空间中嵌入光流运动信息,提出 dense/semi/sparse 三种时间聚合策略,其中 sparse 策略在 Animal Kingdom 上达到 mAP 74.63(RGB+光流融合,比 MSQNet+pre-training 的 73.10 高 1.53 个百分点)。CV4Animals 2024 Best Paper。
  • Animal-CLIP #animalclip2025 — 双 Prompt 增强的 VLM 框架(IJCV 2025):为每个动物物种动态生成 species-aware prompt 和 action-specific prompt,在 Animal Kingdom 上显著优于纯 CLIP 和 MSQNet。核心发现:物种信息作为先验注入文本端,比修改视觉端更高效
  • BehaviorVLM #behaviorvlm2026 — 无需下游微调,用多阶段 VLM 推理同时完成姿态估计和行为发现。这意味着不需要标注数据
  • PlayClass #playclass2026 — 用 Meta 的 V-JEPA 2.1 作为 backbone,加上 SAM 3 分割和手工运动特征,在鸡只玩耍行为分类上达到 F1=77.0。V-JEPA 2.1 是当前最强的视频编码器
  • Mamba-MSQNet — Selective State Space Model(Mamba)替代 Transformer,实现更高效的动物动作识别。在 Animal Kingdom 上用更少参数达到与 MSQNet 相当的 mAP。
范式转移:从"设计动物专用模型"到"用通用视频基础模型 + prompt/微调适配"。这与人体动作识别的 InternVideo 趋势一致,但动物领域受益更大——因为基础模型的零样本能力直接缓解了数据稀缺问题。

姿态估计:从单物种到跨物种

动物姿态估计是行为分析的关键前置步骤。过去每个物种需要单独标注和训练(用 DeepLabCut 标 50–200 帧再微调)。2024 年,Mathis Lab 发布了 SuperAnimal #superanimal2024(Nature Communications 2024)——一个跨 45+ 物种的通用姿态估计基础模型,零样本即可使用,支持无监督视频自适应来消除抖动。如果效果不够,微调时比传统迁移学习高效 10–100 倍。

SuperAnimal 的意义在于:它让"姿态估计 → 行为识别"的 pipeline 在动物上变得可行。你可以先用 SuperAnimal 提取关节点序列,再用 ST-GCN 或 PoseConv3D 做行为分类。

2025 新进展:扩散模型 + 语言引导

DiffPose-Animal #diffposeanimal2025(arXiv 2508.08783, 2025)将扩散模型引入动物姿态估计:用语言条件引导热图生成,把姿态估计重构为"从噪声中恢复关键点热图"的生成过程。相比传统热图回归(HRNet/HigherHRNet),扩散模型能更好地处理遮挡和模糊边界——这在动物场景中极为常见(植被遮挡、多动物重叠)。该方法在 AP-10K 上展示了优于传统热图方法的 PCK 指标,同时语言条件使得模型能适配不同物种的骨架定义,而不必重新训练。

与此同时,AniMer #animer2024(arXiv 2412.00837, 2024)提出了 Family-Aware Transformer:在 Transformer 编码器中嵌入动物的科属分类信息,让模型在估计姿态时自动利用生物分类学先验(猫科和犬科的关节拓扑更相似,而与鸟类的差异更大)。这种思路与 Animal-CLIP 的物种 prompt 异曲同工——生物分类学先验是跨物种泛化的关键信号

graph LR
    V[原始视频] --> S1[SuperAnimal
零样本姿态估计] S1 --> S2[关节点序列
T×N×C] S2 --> G1[ST-GCN / PoseConv3D
时空图卷积] G1 --> C[行为分类] V -.并行.-> V2[VideoMAE / V-JEPA
RGB特征提取] V2 --> C2[行为分类] V -.新模态.-> V3[CoTracker3
稀疏轨迹] V3 --> C3[轨迹Transformer
运动特征] V -.新模态.-> V4[MiDaS
单目深度估计] V4 --> C4[Depth分支
空间关系特征] C --> F[融合决策] C2 --> F C3 --> F C4 --> F F --> R[输出:动作类别] style S1 fill:#c8e6c9 style G1 fill:#e3f2fd style V2 fill:#fff3e0 style V3 fill:#f3e5f5 style V4 fill:#e0f2f1 style F fill:#fce4ec
图 2: 推荐的动物行为识别 pipeline——骨架路线、RGB 路线、稀疏轨迹和单目深度四路融合

输入模态扩展:RGB 和骨架之外的新路线

2024–2026 年,动作识别领域出现了多种新的输入表示,不再局限于 RGB 和骨架两条传统路线。这些新模态对动物行为识别有特殊的适配价值——因为动物场景的外观偏差(appearance bias)比人体场景更严重(毛色变化、物种差异、野外背景干扰),运动驱动或几何驱动的模态天然更具跨物种泛化能力

模态代表方法输入形式动物场景适配性关键障碍
RGBSlowFast, VideoMAE, V-JEPA原始视频帧⭐⭐⭐⭐⭐ — 信息完整外观偏差严重,跨物种泛化弱
SkeletonST-GCN, PoseConv3D关键点序列⭐⭐⭐⭐ — 轻量、外观不变需物种专用姿态估计(SuperAnimal 缓解)
RGB-D / DepthDEAR (ECCV 2024)RGB + 单目深度图⭐⭐⭐ — 增加空间关系动物表面深度估计精度下降
稀疏轨迹TrAction (2026)CoTracker3 点轨迹⭐⭐⭐⭐ — 纯运动、跨物种CoTracker3 在动物上未验证;静态行为无效
3D 点云3DInAction (2023)点云序列⭐⭐ — 几何完整需深度传感器/多视角,成本过高
事件相机POKER (CVPR 2026)异步事件流⭐⭐ — 极低功耗专用硬件;静态行为无信号
热成像野生动物监测红外热辐射⭐⭐ — 夜间检测行为分类研究极少
IMU/传感器IBA-Net, AnimalFormer加速度计/陀螺仪⭐⭐⭐ — 精准畜牧成熟需佩戴设备,宠物场景接受度低
毫米波雷达RayPet (2024)FMCW 雷达信号⭐⭐⭐ — 隐私友好、穿遮挡需专用雷达硬件

三条值得关注的新模态

RGB-D / 单目深度:DEAR(ECCV 2024 Workshop)证明了从普通 RGB 视频用 MiDaS 生成 depth map,再与 RGB 双流融合(Gated Cross-Attention),在 SSV2 上提升 +0.6%。关键是无需额外硬件。对动物场景,深度信息对涉及空间关系的行为(跳上/跳下、钻进洞穴、捕食距离判断)可能有更大提升。但动物毛发表面会导致单目深度估计退化,作为辅助模态而非主模态是可接受的。

稀疏轨迹(TrAction, 2026):用 CoTracker3 提取数百个稀疏点的 2.5D 运动轨迹,完全不含外观信息。在 SSV2 上纯轨迹达到 45% Top-1,与 DINOv2 融合后提升 +8.7 个点。这个方向对动物行为识别特别有吸引力——动物行为主要由运动模式区分(走/跑/跳/捕食/求偶),外观信息反而引入物种偏差。轨迹表示天然跨物种、对背景和光照鲁棒。但 CoTracker3 在动物上的跟踪质量需实测验证,且静态行为(趴/睡)几乎无轨迹信号。

3D 点云(3DInAction, 2023):提出 t-patch(时序局部点块)+ 分层 MLP 架构,在 DFAUST 上提升 +13%。2025 年的扩展工作支持单目深度估计生成的点云,在 NTU RGB-D 120 上达到 89.3%。但数据获取成本是最大瓶颈——深度传感器或多视角重建远超普通监控成本,猫的毛发表面也会严重退化深度估计。

模态选择的策略思考:对动物行为识别,RGB + 稀疏轨迹的互补组合可能是最有潜力的方向——RGB 提供外观和静态行为信息,轨迹提供运动判别力和跨物种泛化。RGB-D 作为低成本增强也值得尝试。3D 点云和事件相机短期更适合研究场景而非落地部署。
Tools
工具链:从姿态估计到行为分析

动物动作识别没有像 MMAction2 这样的统一框架,但有成熟的工具组件:

工具类型功能关键特性
DeepLabCut姿态估计工具箱2D/3D markerless pose estimation50–200 帧即可训练;支持多动物;最成熟的动物行为分析工具
SuperAnimal基础模型跨 45+ 物种零样本姿态估计无需额外标注;支持视频自适应;微调比迁移学习高效 10–100×
MMPose (AP-10K)姿态估计框架OpenMMLab 体系动物姿态估计已集成 AP-10K 数据集;可对接 MMAction2
SMAL/SMAL+3D 形态模型四足动物可变形 3D 网格参数化模型;覆盖狮/虎/马/牛/河马/狗
idtracker.ai多动物跟踪大群体无标记动物追踪鱼群/昆虫/鼠群;自动个体识别
SAMannot标注工具SAM2 视频实例分割本地运行;专为动物行为追踪设计
MMAction2动作识别框架训练 + 评测 + 部署可通过自定义数据适配动物行为

推荐 Pipeline

对于宠物/动物行为识别项目,推荐的完整 pipeline:

  1. 姿态提取:SuperAnimal(零样本)或 DeepLabCut(微调)提取关节点序列
  2. 行为分类:用 ST-GCN/PoseConv3D(骨架路线)或 SlowFast/VideoMAE(RGB 路线)做分类
  3. 零样本增强:用 AnimalMotionCLIP 或 BehaviorVLM 做开放词汇行为识别
  4. 部署:通过 MMDeploy 导出 TensorRT / ONNX Runtime
Community
学术社区与前沿阵地

CV4Animals Workshop是动物行为视觉分析的核心学术阵地,自 2023 年起连续在 CVPR 举办,2026 年已是第 4 届。新工作优先关注此 Workshop + CVPR/ECCV/ICCV/NeurIPS 主会。

从趋势上看,2026 年的主题词是 3D + 大模型 + 生态落地:BigMaQ(猴 3D mesh + 行为,ICLR 2026)、SAM 3D Animal(Meta 标志性工作)、CHIRP(鸟类长期生态监测)、PRIMA(用 BioCLIP 解决长尾物种 3D mesh 恢复)。

Paper Pool
论文池速查

Must-Read(必读)

论文年份Venue核心贡献
Animal Kingdom2022CVPR Oral850 物种标杆数据集;CARe 基线模型
MammalNet2023CVPR最大视频基准 539h;组合零样本评测
AP-10K2021NeurIPS D&B首个大规模动物 2D 姿态基准
Animal3D2023ICCV首个动物 3D mesh 数据集
AnimalMotionCLIP2024CV4Animals BestCLIP + 光流运动嵌入;mAP 74.63
Animal-CLIP2025IJCV双 Prompt VLM;物种感知 + 动作感知
ARTEMIS2025IJMLC多模态融合 SOTA mAP 79.82
SuperAnimal2024Nature Comm.跨 45+ 物种零样本姿态估计
DiffPose-Animal2025arXiv扩散模型 + 语言条件动物姿态估计

Route-Representative(路线代表)

论文年份方向核心贡献
MSQNet2023多模态Actor-agnostic 多模态查询网络
BehaviorVLM2026基础模型免微调 VLM 行为理解
PlayClass (V-JEPA)2026基础模型V-JEPA 2.1 作为行为分类 backbone
BigMaQ20263D猴 3D mesh 数据集;3D 姿态提升 mAP
AniMer+20253D跨哺乳+鸟类的 Family-aware Transformer
SAM 3D Animal20263DMeta 标志性工作;SAM2 提示 3D 重建
AnimalFormer2024畜牧精准畜牧多模态视觉框架
RayPet2024宠物传感毫米波雷达宠物姿态/活动识别
Forecasting Motion in the Wild2026运动预测类无关 motion trajectory token + 扩散预测
TrAction2026稀疏轨迹CoTracker3 点轨迹 + 掩码预训练,纯运动驱动行为识别
DEAR2024RGB-D单目深度估计 + 双流 GCA 融合,无需额外硬件
3DInAction20233D 点云t-patch + 分层 MLP,3D 点云序列行为识别
Strategy
研究切入建议

考虑到你的背景(生成式 AI / 视频理解 / ComfyUI / 扩散模型 / LoRA),以下是三个最有差异化潜力的切入方向:

方向一:生成式数据增强(解决长尾物种数据稀缺)

用扩散模型生成"长尾物种 + 细粒度行为"视频数据,解决 Animal Kingdom 中 80% 物种缺乏标注的核心瓶颈。基础工作是 AP-CAP、PRIMA、AniMer+ 的合成管道,你的 Stable Diffusion / LoRA 经验直接对口。

方向二:视频基础模型 × 动物行为

将 V-JEPA / CLIP / VideoMAE 等通用视频基础模型适配到宠物/特定物种行为识别。基于 AnimalMotionCLIP、BehaviorVLM 的路线,做 few-shot 个性化。这与你在钉钉的视频/AI Agent 方向可能直接相关。

方向三:多模态宠物行为理解系统

构建跨模态(视觉 + IMU/雷达 + 声音)的宠物日常行为理解系统。基础工作是 AnimalFormer、RayPet(雷达)、Beyond Discrete Categories(声音情感)。落地路径明确:智能家居/IoT 场景。

方向四:稀疏轨迹 × 动物行为(高差异化)

将 TrAction 的稀疏轨迹表示迁移到动物行为识别。核心假设:运动轨迹的跨物种泛化能力远强于外观特征——猫和豹的跳跃轨迹模式相似,但外观差异巨大。需要验证 CoTracker3 在动物上的跟踪质量,并解决静态行为无信号的问题(与 RGB 分支互补)。这是一个几乎空白的研究方向,2026 年 6 月 TrAction 才刚发表,动物方向尚无人探索。

参考来源

  • Ng et al., "Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding," CVPR 2022. arXiv:2204.08129
  • Chen et al., "MammalNet: A Large-scale Video Benchmark for Mammal Recognition and Behavior Understanding," CVPR 2023. arXiv:2306.00576
  • Yu et al., "AP-10K: A Benchmark for Animal Pose Estimation in the Wild," NeurIPS 2021. arXiv:2108.12617
  • Xu et al., "Animal3D: A Comprehensive Dataset of 3D Animal Pose and Shape," ICCV 2023. arXiv:2308.11737
  • Zia et al., "A Review on Vision-Centric Coarse to Fine-Grained Animal Action Recognition," Artificial Intelligence Review, 2026. arXiv:2506.01214
  • ARTEMIS: "Animal Recognition Through Enhanced Multimodal Integration System," International Journal of Machine Learning and Cybernetics, 2025.
  • Mondal et al., "Actor-Agnostic Multi-label Action Recognition with Multi-modal Query (MSQNet)," ICCV 2023 Workshop. arXiv:2307.10763
  • "AnimalMotionCLIP: Embedding Motion in CLIP for Animal Behavior Analysis," CV4Animals 2024 Best Paper. arXiv:2505.00569
  • "Animal-CLIP: A Dual-Prompt Enhanced Vision-Language Model for Animal Action Recognition," International Journal of Computer Vision, 2025. DOI:10.1007/s11263-025-02408-4
  • "DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation," arXiv:2508.08783, 2025.
  • "AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer," arXiv:2412.00837, 2024.
  • "BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning," arXiv:2603.12176, 2026.
  • "PlayClass: Automated Play Behaviour Classification in Poultry," CV4Animals 2026. arXiv:2605.27304
  • Ye et al., "SuperAnimal Pretrained Pose Estimation Models for Behavioral Analysis," Nature Communications, 2024.
  • Bar et al., "EgoPet: Egomotion and Interaction Data from an Animal's Perspective," arXiv:2404.09991, 2024.
  • "BigMaQ: A Big Macaque Motion and Animation Dataset," ICLR 2026. arXiv:2602.19874
  • "RayPet: Activity and Posture Recognition in Pets Using FMCW Mm-Wave Radar," arXiv:2404.15340, 2024.
  • "AnimalFormer: Multimodal Vision Framework for Behavior-based Precision Livestock," arXiv:2406.09711, 2024.
  • Rahmani et al., "DEAR: Depth-Enhanced Action Recognition," ECCV 2024 Workshop. GitHub
  • Meier et al., "TrAction: Action Recognition with Sparse Trajectories," arXiv:2606.03490, 2026. GitHub
  • Ben-Shabat et al., "3DInAction: Understanding Human Actions in 3D Point Clouds," arXiv:2303.06346, 2023. GitHub
  • Cao et al., "Seeing Motion Through Polarity for Event-based Action Recognition," CVPR 2026.
  • "A Comprehensive Survey on RGB-D-based Human Action Recognition," Springer JIVP, 2025.