动作识别论文精读(六):MammalNet,539 小时哺乳动物视频基准与组合零样本评测
论文信息
- 标题:MammalNet: A Large-scale Video Benchmark for Mammal Recognition and Behavior Understanding
- 作者:Jun Chen, Ming Hu, Darren J. Coker, Michael L. Berumen, Blair Costelloe, Sara Beery, Anna Rohrbach, Mohamed Elhoseiny
- 单位:King Abdullah University of Science and Technology (KAUST);Max Planck Institute of Animal Behavior / University of Konstanz;MIT;UC Berkeley
- 发表:CVPR 2023
- 开源:https://github.com/Vision-CAIR/MammalNet
动物物种是地球生态系统的核心组成部分。通过它们的行为,动物驱动着种子传播、营养循环、种群动态、物种形成与灭绝等多样化的生态过程 #ceballos2020vertebrates。因此,理解并监测动物行为及其与物理和社会环境的互动,是理解世界生态系统复杂性的关键——在当前生物多样性危机持续加剧的背景下,这一点尤为重要。
现代传感器(包括相机陷阱、无人机和智能手机)使野生动物研究人员能够以前所未有的规模收集动物行为视频数据 #tuia2022perspectives。然而,将这些数据转化为可操作的及时洞察仍然是一个重大挑战。人工审查和标注视频以识别和定位感兴趣的物种及行为序列,是一个耗时且无法扩展到大数据集的过程。
我们可以看到,自动化的动物和行为识别方法有望开启大规模行为监测的新时代,加速从原始视频到可用数据的转化周期。但构建这样的 AI 系统,第一步是构建一个多样化、具有代表性的数据集,使我们能够将这些挑战形式化为计算机视觉任务并对潜在解决方案进行基准测试。
这就是 MammalNet 的出发点。由 KAUST 的 Jun Chen 等人于 CVPR 2023 提出,MammalNet 是迄今为止最大的动物行为视频数据集,包含 18,346 个视频,总计 539 小时,约为之前最大动物行为数据集(Animal Kingdom)的 10 倍 #ng2022animal。它覆盖了 17 目、69 科、173 个哺乳动物类别,并捕捉了 12 种高层动物行为。
MammalNet 的核心贡献可以概括为三个方面:
- 科学分类学指导的标注:首次按照科学哺乳动物分类学组织视频数据,使数据集可以从进化视角探索行为,并支持标准化的数据集扩展
- 高层行为而非原子动作:聚焦生态学研究关注的 12 种高层行为(如 hunt、feed baby),而非 walk、fly 等原子动作
- 三大基准任务:标准动物与行为分类、组合零样本动物与行为识别、行为检测
在这篇精读中,我们将深入理解 MammalNet 的构建方法论、评测协议设计、实验结果及其对动物行为理解领域的意义。
在 MammalNet 出现之前,动物行为理解领域长期受到数据集稀缺的制约。我们可以从三个维度来理解这个问题的严重性。
缺陷一:缺乏行为理解
许多已有的动物数据集仅关注图像级别的动物识别或姿态估计,缺乏行为学习。例如,iNaturalist 收集了 859,000 张图像,覆盖 5,000 多种动植物,但仅提供物种分类标签 #inaturalist。NABirds 收集了 48,562 张北美鸟类图像,覆盖 555 个物种,同样不涉及行为 #van2015building。姿态估计工作如 DeepPoseKit #graving2019deepposekit 和 AP-10K #yu2021ap 虽然提供了动物姿态标注,但姿态本身并不等同于行为。
缺陷二:缺乏分类学多样性
已有的动物行为数据集通常只覆盖单一物种。例如,存在针对大象 #laws2007case、绵羊 #owoeye2018online、猴子 #bala2020automated、老虎 #dishman2014self 等的行为识别数据集。这些数据集虽然对特定物种研究有用,但无法支持跨物种的行为探索——而这正是实现"无需每个物种-行为组合的训练样本即可识别行为"的关键前提。
缺陷三:缺乏分类学指导的动物标注
这是最核心的问题。已有的动物行为数据集要么不包含动物识别任务,要么按照主观标准而非科学分类法对物种进行分组。例如,Animal Kingdom(CVPR 2022)是当时最大的动物行为数据集,包含 4,301 个视频、50 小时、850 个物种,但它:
- 仅关注原子动作(atomic actions),如打哈欠、游泳、飞行等基础动作,共 140 个类别
- 不支持动物识别任务(不提供动物类型标注)
- 不支持行为检测任务(无法在长视频中定位行为时段)
- 不按科学分类学组织动物类别
原子动作 vs. 高层行为
这是 MammalNet 的核心设计理念。原子动作(atomic actions)是 walk、stand still、fly、yawn 等基础运动单元;高层行为(high-level behaviors)是 hunt、feed baby、mate、fight 等具有生态学意义的复杂活动。
关键区别在于:行为是一段时间内的主要活动实例,通常由多个原子动作组成。例如,狩猎行为(hunt)可分解为 running → chasing → killing 等原子动作序列。高层行为对生态学家和动物学家更有价值,因为它们直接对应生态学研究中关注的行为状态 #breed2021animal。
此外,Animal Kingdom 仅 50 小时的规模,对大规模动物行为研究可能不足。考虑到动物行为的多样性和长尾分布特性,我们需要一个数量级更大的数据集。
MammalNet 的构建是一个系统性的工程,涉及分类学构建、行为定义、视频检索、质量控制和时间边界标注五个核心环节。我们逐一分析。
3.1 哺乳动物分类学构建
MammalNet 选择聚焦哺乳动物,因为与其他动物类群(如鸟类或昆虫)不同,哺乳动物通常具有更多样化且可区分的行为状态 #Chen-et-al.-2023。
分类学构建流程如下:
- 从 National Geographic 和 Animal A-Z 网站收集约 800 种哺乳动物物种和亚种 #national_geographic #animal_a_z
- 手动将每种哺乳动物映射到 Wikipedia 的哺乳动物分类学结构(纲 → 目 → 科 → 属 → 族 → 亚科 → 物种)
- 最终覆盖:17 目、69 科、173 个哺乳动物类别
- 多人验证分类学正确性
这里有一个关键设计决策:不分类到物种级别。原因有三:
- YouTube 视频包含模糊且不专业的物种标签
- 众包标注者非专家,甚至专家也难以从众包或野外图像中可靠识别物种或属级别 #kays2022mammals
- 不同物种可能有极细微差异(如喜马拉雅小熊猫与中国小熊猫仅面部和尾部颜色略有不同)
因此,MammalNet 分类到最低可行的分类学层级——亚科(sub-family)、族(tribe)、属(genus),共 173 个可区分类别。
3.2 12 种高层行为的定义
MammalNet 聚焦 12 种高层行为,这些行为的选择参考了动物行为学经典教材 #breed2021animal #dugatkin2020principles #alcock2009animal。行为分为五大组:
| 行为组 | 具体行为 | 生态学意义 |
|---|---|---|
| 觅食行为(Foraging) | eat food, drink water, hunt | 能量获取 |
| 繁殖行为(Reproductive) | mate, feed baby, give birth | 种群延续 |
| 卫生行为(Hygiene) | groom | 健康维持 |
| 争斗行为(Agonistic) | fight | 社会结构 |
| 维持行为(Maintenance) | urinate, defecate, sleep, vomit | 生理需求 |
这里的行为定义是:一段时间内的主要活动实例,通常由多个原子动作组成,服务于更高层次的目的。例如,狩猎行为可分解为 running、chasing、killing 等原子动作。这种行为层级的定义对生态学家和动物学家更有用 #mench1998important。
3.3 YouTube 视频检索策略
视频收集采用半自动众包方法,灵感来自 ImageNet #deng2009imagenet 和 ActivityNet #caba2015activitynet 的数据集构建流程。
检索策略:
- 查询词:动物通用名 + 行为(如 "tiger hunting")
- 稀有动物使用更通用的名称(如用 "hyena" 代替 "Brown hyena" 或 "Spotted hyena")
- 同义词扩展:从 Wikipedia 获取同义词(如 "arctic fox" → "white fox"、"polar fox"、"snow fox")
- 下载最高分辨率视频
过滤规则:
- 仅下载 16 岁以下可访问的视频(避免暴力内容)
- 优先下载 10 分钟以内的视频(控制存储)
- 排除:卡通/玩具动物、静态图像、大量人-动物交互、无关内容
3.4 Amazon Mechanical Turk 质量控制
MammalNet 采用严格的两阶段众包标注流程:
阶段一:视频验证
- 每个视频分配给 3 名不同的 AMT 标注者
- 提供动物图片和通用名、预期行为
- 标注者验证动物和行为是否确实出现在视频中
- 仅保留 3 名标注者都"通过"的视频
标注者资质控制:
- 提供验证指南
- 完成 20 道选择题的资质测试
- 仅合格标注者可参与
3.5 行为时间边界标注
目标行为通常不会跨越整个视频。为了定位目标行为实际发生的时间段,MammalNet 设计了鲁棒的时间边界标注流程:
- 5 名合格标注者为每个视频标注目标行为的起止帧
- 每个视频至少获得 5 组行为边界
- 使用完全链接聚类算法(complete linkage algorithm)#defays1977efficient 合并不同边界
- 聚类后得到 1 个或多个稳定的边界(获得多次一致)
这里的关键设计是:单个视频可能包含同一行为的多次离散出现,因此可能有多个边界定义。聚类算法确保了标注的鲁棒性。
3.6 数据集统计
最终 MammalNet 数据集的统计如下:
| 指标 | 数值 |
|---|---|
| 视频总数(未裁剪) | 18,346 |
| 视频总数(裁剪后) | 20,033 |
| 总时长(未裁剪) | 539 小时 |
| 总时长(裁剪后) | 394 小时 |
| 哺乳动物类别 | 173 |
| 科(families) | 69 |
| 目(orders) | 17 |
| 高层行为类别 | 12 |
| 平均时长(未裁剪) | 106 秒 |
| 平均时长(裁剪后) | 77 秒 |
| HD 分辨率比例 | >54%(1280×720) |
数据集呈现显著的长尾分布。从每个哺乳动物类别的视频数量分布可以看出,少数常见类别(如 dog、cat、tiger)拥有大量视频,而多数稀有类别仅有少量视频。这种分布特性使得 MammalNet 成为测试模型在长尾分布下泛化能力的理想基准。
MammalNet 建立了三个基准任务,每个任务都受到生态学研究需求的启发。我们逐一分析每个任务的设计动机和评测协议。
4.1 任务一:标准动物与行为分类
这是最基础的任务:给定裁剪后的视频,预测动物类别和行为类别。
数据划分:
- 按动物-行为组合级别划分(确保同一组合不会同时出现在训练集和测试集)
- 70% 训练 / 10% 验证 / 20% 测试
- 训练集:14,554 个视频;验证集:1,638 个视频;测试集:3,841 个视频
Many/Medium/Few 划分:为了捕捉数据集的长尾分布效应,将动物、行为和联合类别按频率分为三组:
| 类别 | Many | Medium | Few |
|---|---|---|---|
| 动物类别 | 前 7%(12 类) | 中 16%(28 类) | 后 77%(133 类) |
| 行为类别 | 前 33%(4 类) | 中 33%(4 类) | 后 33%(4 类) |
| 联合类别 | 前 3%(33 类) | 中 17%(180 类) | 后 80%(823 类) |
评估指标:
- Per-class Top-1 accuracy:各类别准确率的平均值(对长尾分布更公平)
- Per-example Top-1 accuracy:样本级别的准确率
4.2 任务二:组合零样本动物与行为识别
这是 MammalNet 最具创新性的任务设计。核心思想是:测试模型在未见过的动物-行为组合上的泛化能力。
动机:很难为所有动物找到足够的标注行为样本。例如,numbat 和 florida panther 的行为标注非常少。但可以想象,行为可以在具有相似外观和运动风格的不同动物之间迁移。同样,不同行为(狩猎、争斗)下的动物识别也可以相互迁移。
数据划分:
- 选择包含 >5 个样本的动物-行为组合类别
- 25% 类别分配给测试集(4,088 视频,134 组合类别)
- 剩余类别:90% 训练,10% 验证(898 视频,53 组合类别)
- 从测试集每个组合类别随机采样 5 个样本,移动 0/1/5 个到训练集
| 设置 | 训练视频数 | 验证视频数 | 测试视频数 |
|---|---|---|---|
| 0-shot | 14,377 | 898 | 4,088 |
| 1-shot | 14,511 | 898 | 4,088 |
| 5-shot | 15,047 | 898 | 4,088 |
训练集包含 983 个组合类别,验证集 53 个,测试集 134 个。
4.3 任务三:行为检测
行为检测任务要求在未裁剪视频中定位目标行为的时间范围。这是实际应用中最重要的任务——在野外监控视频中,我们通常需要知道行为何时发生。
数据划分:
- 70% 训练 / 10% 验证 / 20% 测试
- 训练集:13,318 个未裁剪视频;验证集:1,486 个;测试集:3,542 个
评估指标:
- mAP @ tIoU [0.5:0.1:0.9](时序交并比阈值从 0.5 到 0.9)
- 平均 mAP(所有 tIoU 阈值的平均)
4.4 联合损失函数
由于基线模型原本设计用于人类动作识别,默认不具备同时预测动作和主体的能力。MammalNet 为它们添加了两个任务头:一个用于动物类别识别,一个用于行为识别。
联合损失函数定义为:
其中 \(M\) 是动物类别数(173),\(N\) 是行为类别数(12),\(p^a_i\) 和 \(y^a_i\) 分别表示动物类别 \(i\) 的预测概率和真实标签,\(p^b_j\) 和 \(y^b_j\) 分别表示行为类别 \(j\) 的预测概率和真实标签 #Chen-et-al.-2023。
这个设计的直觉是:联合训练使模型同时学习动物和行为特征,两种任务可以相互促进。实验表明,联合训练比独立训练行为识别提升约 2.2% per-class accuracy。
MammalNet 评估了四种主流的视频识别模型,这些模型在人类动作识别领域已被证明有效。我们来看看它们的选择和配置。
5.1 四种基线模型
| 模型 | 类型 | 核心思想 | 预训练 |
|---|---|---|---|
| C3D #c3d | 3D CNN | 3D 卷积学习时空特征 | Kinetics 400 |
| I3D #i3d | 双流 3D CNN | RGB + 光流双流膨胀 2D 卷积 | ImageNet + Kinetics 400 |
| SlowFast #feichtenhofer2019slowfast | 双流 3D CNN | 慢通道(空间)+ 快通道(运动) | Kinetics 400 |
| MViT V2 #li2022mvitv2 | 多尺度 Vision Transformer | 多尺度注意力池化 | Kinetics 400 |
每种模型评估两个版本:(1)随机初始化训练,(2)使用 Kinetics 400 预训练权重初始化。这使我们能够量化从人类动作识别到动物行为识别的迁移学习效果。
5.2 训练配置披露表
| 项目 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | MammalNet,14,554 个裁剪视频(标准分类) |
| 训练硬件 | 未披露 | 原文未给出 GPU 型号和数量 |
| 优化器 | 未披露 | 原文未给出(在补充材料中) |
| 学习率 | 未披露 | 原文未给出(在补充材料中) |
| Batch size | 未披露 | 原文未给出(在补充材料中) |
| 训练步数 | 未披露 | 原文未给出 |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 未披露 | 原文未给出 |
| 精度格式 | 未披露 | 原文未给出 |
| Checkpoint 策略 | 未披露 | 原文未给出 |
| 初始化来源 | 已披露 | Kinetics 400 预训练权重(*版本) |
| 损失函数 | 已披露 | 联合损失 \(\mathcal{L}_{joint}\) |
| 超参数调优 | 已披露 | 在验证集上调优所有超参数 |
5.3 行为检测特征提取
行为检测任务的基线方法(ActionFormer #actionformer、TAGS #tags、CoLA #zhang2021cola)需要预提取视频特征。MammalNet 使用双流 I3D 模型(RGB + 光流),在 ImageNet 和 Kinetics 400 上预训练,然后在 MammalNet 上微调,提取 RGB 和光流特征后拼接作为模型输入。
光流使用传统方法计算 #horn1981determining #lucas1981iterative,这是视频理解中的标准做法。
现在来看 MammalNet 上的实验结果。这些结果揭示了动物行为识别的挑战性和当前模型的能力边界。
6.1 标准分类结果
下表展示了四种基线模型在标准分类任务上的 per-class Top-1 accuracy(使用 Kinetics 400 预训练权重):
| 模型 | 动物分类 | 行为分类 | 联合分类 |
|---|---|---|---|
| SlowFast | 24.5 | 30.9 | 12.1 |
| C3D | 26.8 | 32.2 | 13.5 |
| I3D | 24.8 | 32.1 | 13.3 |
| MViT V2 | 32.5 | 37.8 | 17.8 |
我们可以看到几个关键发现:
发现一:MViT V2 全面领先。MViT V2 在所有三个任务上都取得了最佳性能,动物分类达到 32.5%,行为分类达到 37.8%,联合分类达到 17.8%。这表明多尺度注意力机制在处理动物行为的时空模式时比 3D CNN 更有效。
发现二:联合分类显著更难。联合分类的准确率(17.8%)远低于单独的动物分类(32.5%)或行为分类(37.8%)。这是因为联合分类需要在 1,036 个组合类别中正确预测,空间远大于单独的 173 个动物类别或 12 个行为类别。
发现三:整体性能仍然很低。即使最佳模型,动物分类 per-class accuracy 也仅为 32.5%,意味着在 173 个类别中,平均每个类别只有约 1/3 的样本被正确分类。这为后续研究留下了巨大的改进空间。
6.2 长尾分布的影响
长尾分布对性能的影响非常显著。以 MViT V2 为例:
| 分裂 | 动物分类 | 行为分类 | 联合分类 |
|---|---|---|---|
| Many | 66.7 | 50.9 | 46.2 |
| Medium | 56.0 | 42.4 | 33.0 |
| Few | 23.4 | 20.0 | 11.8 |
Few 类别的性能仅为 Many 类别的 1/3 到 1/4。这说明当前模型在处理低频类别时面临严重挑战——而这正是野生动物保护中最需要关注的类别(濒危物种通常数据最少)。
6.3 迁移学习的增益
从人类动作识别迁移到动物行为识别的效果非常显著:
| 设置 | 动物分类 | 行为分类 | 联合分类 |
|---|---|---|---|
| 随机初始化 | 19.7 | 27.7 | 9.0 |
| Kinetics 400 预训练 | 32.5 | 37.8 | 17.8 |
| 增益 | +12.8 | +10.1 | +8.8 |
这个结果告诉我们:人类动作和动物行为之间存在可迁移的时空特征。Kinetics 400 预训练使模型学习到了通用的运动模式表示,这些表示可以迁移到动物领域。有趣的是,预训练带来的增益在高频类别上更大,说明迁移学习对数据充足的类别帮助更大。
6.4 组合零样本识别结果
这是 MammalNet 最具特色的实验。结果如下(MViT V2):
| 设置 | per-example (A/B) | per-class (A/B) |
|---|---|---|
| 0-shot | 32.2 / 26.2 | 20.7 / 18.1 |
| 1-shot | 33.7 / 28.9 | 22.9 / 22.5 |
| 5-shot | 39.3 / 31.7 | 31.0 / 26.0 |
A 表示动物类别,B 表示行为类别。
关键发现:
- 零样本下行为分类仍可达 26.2%(per-example),说明行为特征可在动物间迁移。即使从未见过某种动物的某种行为,模型也能从其他动物的相似行为中学习到可迁移的模式
- 5-shot 提升到 31.7%,说明目标动物的视频仍然重要。少量样本就能带来显著提升,这为数据稀缺物种的研究提供了实用方案
- 动物识别迁移效果类似:0-shot 动物识别 32.2%,5-shot 提升到 39.3%
6.5 行为检测结果
行为检测任务的评估结果如下:
| 模型 | tIoU=0.50 | tIoU=0.60 | tIoU=0.70 | tIoU=0.80 | tIoU=0.90 | Avg |
|---|---|---|---|---|---|---|
| CoLA | 26.02 | 22.70 | 18.98 | 13.46 | 3.05 | 15.81 |
| TAGS | 23.09 | 20.97 | 19.09 | 16.98 | 12.56 | 17.63 |
| ActionFormer | 28.48 | 26.14 | 23.17 | 18.69 | 10.48 | 20.07 |
ActionFormer 在平均 mAP 上达到 20.07,在 tIoU=0.50 时达到 28.48。整体来看,行为检测任务对当前方法仍然非常具有挑战性——特别是在高 tIoU 阈值下(tIoU=0.90 时 mAP 仅为 10.48)。
6.6 联合识别 vs. 独立识别
MammalNet 还比较了联合训练和独立训练的效果。研究发现:联合训练(同时预测动物和行为)比独立训练行为识别提升约 2.2% per-class accuracy。这说明理解动物类型有助于行为预测——不同动物的行为模式确实存在差异,模型通过学习动物身份可以获得行为识别的额外信号。
但反过来,独立动物识别比联合识别的动物识别更准确。这说明行为信息对动物识别的帮助不如动物信息对行为识别的帮助大。
7.1 数据集偏差
MammalNet 的数据来自 YouTube,这带来了两类重要偏差:
行为过度/不足表示:人们更喜欢观看 fight 或 eat food 的视频,这些行为被过度表示;而 urinate 和 defecate 行为对人类来说不太有趣,因此在 YouTube 上表示不足。然而,这些行为在 informing 保护相关行动中仍然重要 #Chen-et-al.-2023。
圈养动物偏差:许多视频拍摄于动物园、农场和家庭等场所。这些动物可能表现出与野生或非习惯化动物不同的行为。这意味着在 MammalNet 上训练的模型在野外相机陷阱数据上的泛化能力可能受限。
7.2 与 Animal Kingdom 的对比总结
| 维度 | Animal Kingdom (2022) | MammalNet (2023) |
|---|---|---|
| 视频数 | 4,301 | 18,346 |
| 总时长 | 50 小时 | 539 小时 |
| 动物覆盖 | 850 种(6 纲) | 173 哺乳类(17 目 69 科) |
| 行为类型 | 140 原子动作 | 12 高层行为 |
| 分类学标注 | ❌ | ✅ 科学哺乳动物分类学 |
| 动物识别 | ❌ | ✅ |
| 行为检测 | ❌ | ✅ |
| 组合零样本 | ❌ | ✅ |
7.3 实用价值
MammalNet 的实用价值体现在多个维度:
- 野生动物保护:自动监控濒危物种行为,提供保护决策依据。Jun Chen 在 KAUST 的专题报道中强调:"构建一个自动从视频镜头中识别动物物种和行为的 AI 系统,需要在多样化的动物和相关行为上进行训练" #KAUST-2023
- 生态学研究:大规模行为监测,理解生态系统功能
- AI 基准测试:测试模型在长尾分布、层级分类、零样本泛化上的能力
- 仿生学研究:动物行为启发工程设计
7.4 开放问题与未来方向
MammalNet 开启了动物行为理解的新篇章,但仍有许多开放问题:
- 跨域泛化:从 YouTube 视频到野外相机陷阱数据的域适应
- 多物种扩展:从哺乳动物扩展到鸟类、爬行类、鱼类
- 物种级识别:如何在众包标注的限制下实现更细粒度的分类
- 行为层次结构:从原子动作到高层行为的层次化建模
- 视频基础模型:利用 VideoMAE、VideoPrism 等预训练视频模型提升动物行为识别性能
事实上,后续工作已经开始探索这些方向。MammAlps(CVPR 2025)提出了瑞士阿尔卑斯山的多视角野生动物监控数据集,引用 MammalNet 为"最大的野生动物视频数据集" #MammAlps-2025。Video Foundation Models for Animal Behavior Analysis(bioRxiv 2024)使用 MammalNet 评估视频基础模型在动物行为分析上的性能 #VideoFM-Animal-2024。
参考来源
- Chen, J. et al. (2023). MammalNet: A Large-scale Video Benchmark for Mammal Recognition and Behavior Understanding. CVPR 2023. arXiv:2306.00576
- Ng, X.L. et al. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022. CVPR 2022 Open Access
- Ceballos, G. et al. (2020). Vertebrates on the brink as indicators of biological annihilation and the sixth mass extinction. PNAS. doi:10.1073/pnas.1922686117
- Tuia, D. et al. (2022). Perspectives in machine learning for wildlife conservation. Nature Communications. doi:10.1038/s41467-022-03204-4
- Breed, M.D. & Moore, J. (2021). Animal Behavior. Academic Press.
- Dugatkin, L.A. (2020). Principles of Animal Behavior. University of Chicago Press.
- Alcock, J. (2009). Animal Behavior: An Evolutionary Approach. Sinauer Associates.
- Mench, J. (1998). Why it is important to understand animal behavior. ILAR Journal. doi:10.1093/ilar.39.1.20
- Kays, R. et al. (2022). Which mammals can be identified from camera traps and crowdsourced photographs? Journal of Mammalogy.
- Defays, D. (1977). An efficient algorithm for a complete link method. The Computer Journal.
- Deng, J. et al. (2009). ImageNet: A Large-Scale Hierarchical Image Database. CVPR 2009.
- Caba Heilbron, F. et al. (2015). ActivityNet: A Large-Scale Video Benchmark for Human Activity Understanding. CVPR 2015.
- Li, Y. et al. (2022). MViTv2: Improved Multiscale Vision Transformers for Classification and Detection. CVPR 2022.
- Feichtenhofer, C. et al. (2019). SlowFast Networks for Video Recognition. ICCV 2019.
- Carreira, J. & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR 2017.
- Tran, D. et al. (2015). Learning Spatiotemporal Features with 3D Convolutional Networks. ICCV 2015.
- Kay, W. et al. (2017). The Kinetics Human Action Video Dataset. arXiv:1705.06950
- Zhang, C. et al. (2022). ActionFormer: Localizing Moments of Actions with Transformers. ECCV 2022.
- Nag, S. et al. (2022). Temporal Action Detection with Global Segmentation Mask Learning. ECCV 2022.
- Zhang, C. et al. (2021). CoLA: Weakly-Supervised Temporal Action Localization with Snippet Contrastive Learning. CVPR 2021.
- Van Horn, G. et al. (2018). The iNaturalist Species Classification and Detection Dataset. CVPR 2018.
- Van Horn, G. et al. (2015). Building a Bird Recognition App and Large Scale Dataset with Citizen Scientists. CVPR 2015.
- Graving, J.M. et al. (2019). DeepPoseKit, a software toolkit for fast and robust animal pose estimation using deep learning. eLife.
- Yu, H. et al. (2021). AP-10K: A Benchmark for Animal Pose Estimation in the Wild. arXiv:2108.12617
- National Geographic. nationalgeographic.com
- A-Z Animals. a-z-animals.com
- KAUST CEMSE (2023). A knack for data and love of animals breeds a tool for mammal conservation. KAUST 官网报道
- Gabeff, V. et al. (2025). MammAlps: A Multi-view Video Behavior Monitoring Dataset of Wild Mammals in the Swiss Alps. CVPR 2025.
- Video Foundation Models for Animal Behavior Analysis. bioRxiv 2024. bioRxiv:2024.07.30.605655
- Horn, B.K.P. & Schunck, B.G. (1981). Determining optical flow. Artificial Intelligence.
- Lucas, B.D. & Kanade, T. (1981). An iterative image registration technique with an application to stereo vision.