Animal-CLIP
论文信息
- 标题:Animal-CLIP: A Dual-Prompt Enhanced Vision-Language Model for Animal Action Recognition
- 作者:Yinuo Jing, Kongming Liang, Ruxu Zhang, Hao Sun, Yongxiang Li, Zhongjiang He, Zhanyu Ma
- 单位:北京邮电大学人工智能学院
- 发表:International Journal of Computer Vision (IJCV), 2025, Vol. 133, Issue 8, pp. 1-21
- DOI:10.1007/s11263-025-02408-4
- 开源:https://github.com/PRIS-CV/Animal-CLIP(已开源,含预训练权重)
如果我们把一段猫咪捕猎的视频输入 CLIP,问它在做什么,CLIP 大概率会给出一个与人类动作相关的答案。这并不奇怪——CLIP 在 4 亿张人类中心的图文对上预训练,它的"世界观"里,"捕猎"这个动作的视觉原型是人类的狩猎场景,而不是猫咪伏击老鼠的姿态。#Jing et al., 2025
这就是动物行为识别面临的根本矛盾:预训练模型的视觉语言知识与动物领域的视觉表现之间存在巨大的语义鸿沟。人类动作识别已经相当成熟(Kinetics-400、UCF-101 等数据集催生了大量方法),但动物行为识别仍然处于起步阶段。原因有二:
第一,物种间的视觉差异远超人类。 同一个"行走"动作,在大象、猫、鸟类身上的视觉表现截然不同。这意味着"行走"这个类别的类内方差(intra-class variation)在动物领域比人类领域大得多。#Jing et al., 2025
第二,领域知识的缺失。 CLIP 等 VLM 在预训练阶段几乎没有接触过动物行为数据。即使有,也是零散的、不系统的。模型缺乏对"什么动物会做什么动作"这一基本领域常识的理解。#Jing et al., 2025
2025 年 6 月,北京邮电大学 PRIS-CV 实验室的 Yinuo Jing 等人在 IJCV 上发表了 Animal-CLIP,提出了一种双 Prompt 增强的框架来解决这两个问题。核心思想很直观:既然 CLIP 缺乏动物领域的知识,我们就用两种方式把知识"注入"模型——
- 外部 Prompt:用 LLM 为每个动作生成详细的生物学描述,扩展标签的语义范围
- 内部 Prompt:用物种预测结果引导可学习的 prompt 模块,让文本和视频特征在物种特定的子空间中对齐
实验结果表明,Animal-CLIP 在三个大规模多物种多动作数据集上超越了六种已有的动作识别方法,并对未见过的动物展现出了泛化能力。#Jing et al., 2025
这篇文章是该团队 ACM MM 2023 工作"Category-Specific Prompts for Animal Action Recognition"的扩展版本。从单 prompt 到双 prompt,从简单的物种条件到 LLM 知识增强 + GCN 图推理,Animal-CLIP 代表了一条清晰的演进路线。#Jing et al., 2023
要理解 Animal-CLIP 的设计动机,我们需要先看清 CLIP 在动物行为识别上失败的根本原因。
问题一:标签语义过于单薄
CLIP 的 zero-shot 分类依赖文本 prompt,最常用的是 "a photo of a {class}" 这种模板。对于 "a photo of a cat hunting" 这样的 prompt,CLIP 的文本编码器只看到了 "hunting" 这个词的通用语义——它不知道猫的捕猎和鹰的捕猎在视觉上完全不同。#Jing et al., 2025
一个自然的想法是:如果给模型提供更丰富的动作描述呢?比如 "猫在捕猎时会压低身体、缓慢接近、突然扑击"——这样的描述包含了具体的视觉线索,理论上可以帮助模型更好地对齐文本和视觉特征。Animal-CLIP 正是这样做的:它用 LLM 为每个动作生成了 300-500 词的详细生物学描述,作为外部 Prompt 输入。#Jing et al., 2025
问题二:跨物种的类内方差
在人类动作识别中,"跑步"这个动作在不同人身上的视觉表现相对一致。但在动物世界中,"跑步"在猎豹、企鹅、青蛙身上的表现完全不同。这意味着:
- 文本侧:"跑步"的文本特征需要覆盖多种视觉原型
- 视觉侧:同一种动作的视频特征分布在多个不连续的子空间中
Animal-CLIP 的洞察是:如果我们知道视频中的动物是什么,就可以缩小搜索空间。具体来说,先用预训练 CLIP 预测物种,然后用物种信息引导 prompt 模块,让文本和视频特征在物种特定的子空间中对齐。这相当于给模型一个"先验":既然视频里是猫,那么"飞行"这个动作的概率应该接近零。#Jing et al., 2025
已有方法为什么不够
| 方法 | 思路 | 在动物行为识别上的局限 |
|---|---|---|
| CLIP Zero-shot | 直接用 "a photo of {action}" 分类 | 标签语义单薄,缺乏领域知识 |
| CoOp | 学习全局可 prompt 向量 | 所有类别共享 prompt,无法区分物种差异 |
| X-CLIP | 跨帧通信 + 多粒度对比 | 通用视频-文本模型,无动物领域适配 |
| ViFi-CLIP | 简单微调 CLIP 做视频 | 全参数微调,数据需求大,易过拟合 |
| BioCLIP | 生物领域 CLIP 预训练 | 专注物种识别,不涉及行为理解 |
Animal-CLIP 的定位很清晰:不是提出新的 VLM 架构,而是通过双 Prompt 机制将现有 VLM 高效适配到动物行为识别这一特定领域。这与 BioCLIP 的全量预训练路线形成对比——Animal-CLIP 只需要少量可训练参数(约 5-10M),就能在行为识别任务上取得显著增益。#Jing et al., 2025
Animal-CLIP 的整体架构可以概括为:视频编码 → 物种感知引导 → GCN 文本精炼 → 双 Prompt 增强 → 相似度分类。下面逐模块拆解。
以下用流程图梳理完整的数据流:
flowchart TD
V["视频输入 B×T×3×224×224"] --> CCT["CCT 视觉编码器"]
CCT --> MIT["MIT 时序聚合"]
MIT --> VF["视频特征 v"]
MF["中间帧"] --> CLIP_SP["CLIP 物种预测"]
CLIP_SP --> P["物种概率 p"]
LLM["LLM 动作描述"] --> TE["CLIP 文本编码器"]
SP["物种名称"] --> TE
TE --> TF["动作特征"]
TE --> AF["物种特征"]
P --> W1["物种加权"]
AF --> W1
W1 --> FA["物种上下文 f_animal"]
W1 --> TAW["加权物种特征"]
TAW --> GCN["GCN 文本精炼"]
TF --> GCN
GCN --> TRF["精炼动作特征"]
TRF --> PG1["PromptGen1 文本增强"]
FA --> PG1
PG1 --> TE2["增强文本 T_enhanced"]
VF --> PG2["PromptGen2 视频增强"]
FA --> PG2
PG2 --> VE["增强视频 v_enhanced"]
TE2 --> SIM["余弦相似度"]
VE --> SIM
SIM --> OUT["softmax 输出"]
3.1 视频编码器:CCT + MIT
Animal-CLIP 的视频编码器继承自 X-CLIP #Ma et al., 2022,由两个子模块组成:
Cross-Frame Communication Transformer (CCT) 负责逐帧特征提取。与标准 ViT 不同,CCT 引入了 message token 机制实现帧间通信。具体来说,每帧的 [CLS] token 经过一个线性层生成 message token,T 帧的 message token 之间做 self-attention 交换信息,然后将增强后的 message token 拼接到 patch tokens 中一起做标准 ViT attention。#Ma et al., 2022
这种设计的计算优势很明显:全帧级别的 attention 复杂度是 \(O(T^2 N^2)\)(T 帧 × N patches),而 message token 机制将复杂度降为 \(O(T^2 + TN^2)\),在 T=8、N=196 的设置下节省了大量计算。#Ma et al., 2022
CCT 输出每帧的 [CLS] 特征 \(\mathbf{c}_t \in \mathbb{R}^{512}\) 和 patch 特征 \(\mathbf{p}_t \in \mathbb{R}^{196 \times 768}\)。
Multiframe Integration Transformer (MIT) 负责时序聚合。T 帧的 [CLS] 特征加上可学习的位置编码后,经过一层 ResidualAttentionBlock,最后取时间维度的均值,得到全局视频特征 \(\mathbf{v} \in \mathbb{R}^{512}\)。#Ma et al., 2022
3.2 外部 Prompt:LLM 生成的动作描述
Animal-CLIP 的一个关键设计是用 LLM 为每个动作生成详细的生物学描述。以 "Abseiling"(绳降)为例,LLM 生成的描述约 400 词,包含:
- 动作的定义和背景
- 执行该动作时的身体姿态和运动模式
- 不同物种执行该动作时的视觉差异
- 相关的生物学上下文
这些描述通过 CLIP 的文本编码器(冻结)编码为文本特征。相比简单的 "a photo of {action}",LLM 描述提供了丰富的视觉语义线索,使文本特征能够覆盖更多的视觉原型。#Jing et al., 2025
物种描述同理。Animal Kingdom 数据集有 897 个物种,每个物种的名称通过 CLIP 文本编码器编码为物种文本特征 \(\{\mathbf{t}_1^{\text{animal}}, ..., \mathbf{t}_{897}^{\text{animal}}\} \in \mathbb{R}^{897 \times 512}\)。#Jing et al., 2025
3.3 物种感知引导
推理时,模型首先用预训练 CLIP 对视频的中间帧进行物种分类,得到物种概率分布 \(\mathbf{p} \in [0,1]^{897}\)。这个分布用于两个目的:
全局物种上下文:加权求和物种文本特征,得到一个全局的物种感知向量:
其中 \(p_i\) 是第 i 个物种的预测概率。这个向量捕捉了"这段视频最可能是哪种动物"的全局上下文。#Jing et al., 2025
逐物种加权:同时,用物种概率逐元素加权物种文本特征矩阵:
这保留了每个物种的独立特征(只是按概率缩放),为后续 GCN 图传播做准备。#Jing et al., 2025
3.4 GCN 文本精炼模块
这是 Animal-CLIP 的一个核心创新。模型构建了一个物种-动作关系图,其中节点包括物种节点和动作节点,边表示"某物种可能执行某动作"的先验关系。#Jing et al., 2025
图的邻接矩阵 \(\mathbf{A}\) 由数据集的统计信息构建:从 animal-action-relation.txt 读取每个物种实际出现过的动作列表,建立双向边,并为每个节点添加自环。#Jing et al., 2025
将加权物种特征和动作特征拼接后输入 2 层 GCN:
GCN 传播后,取后 \(K_{\text{actions}}\) 个节点作为精炼后的动作特征 \(\mathbf{T}_{\text{action}}^{\text{refined}}\)。#Jing et al., 2025
3.5 双 Prompt 增强模块
精炼后的文本特征和全局视频特征分别通过两个独立的 PromptGenerator 模块进行增强。每个 PromptGenerator 由 3 层 PromptGeneratorLayer 堆叠而成,每层包含:#Jing et al., 2025
- Cross-Attention:以文本/视频特征为 Q,物种感知特征 \(\mathbf{f}_{\text{animal}}\) 为 K 和 V
- MLP:512 → 2048 → 512 的前馈网络
- 残差连接 + LayerNorm
数学表达:
其中 \(\alpha\) 是一个可学习的缩放参数(初始化为 \(10^{-4}\)),控制 prompt 增强的强度。小初始值确保训练初期 prompt 不会破坏预训练特征。#Jing et al., 2025
文本侧的 PromptGenerator1 接收精炼后的动作特征 \(\mathbf{T}_{\text{action}}^{\text{refined}}\),输出增强后的动作特征 \(\mathbf{T}_{\text{enhanced}}\)。视频侧的 PromptGenerator2 接收全局视频特征 \(\mathbf{v}\),输出增强后的视频特征 \(\mathbf{v}_{\text{enhanced}}\)。两者都以 \(\mathbf{f}_{\text{animal}}\) 为引导信号。#Jing et al., 2025
3.6 最终分类
增强后的视频和文本特征经过 L2 归一化后计算余弦相似度:
其中 \(\tau\) 是可学习的 logit_scale 参数(初始化为 \(\ln(1/0.07) \approx 2.66\))。最终输出为 softmax 概率:\(\hat{\mathbf{y}} = \text{softmax}(\text{similarity})\)。#Jing et al., 2025
3.7 与 ACM MM 2023 前身的差异
Animal-CLIP 是同一团队 ACM MM 2023 工作 "Category-Specific Prompts for Animal Action Recognition" 的扩展。#Jing et al., 2023 两个版本的核心差异:
| 维度 | ACM MM 2023 | IJCV 2025 (Animal-CLIP) |
|---|---|---|
| 外部知识 | 无 | LLM 生成的动作描述 |
| Prompt 数量 | 单 Prompt(物种条件) | 双 Prompt(文本 + 视频) |
| 文本精炼 | 无 | GCN 图推理 |
| 物种-动作先验 | 未利用 | 关系图 + GCN 传播 |
| 评估数据集 | Animal Kingdom | AK + MammalNet + LoTE-Animal |
Animal-CLIP 的训练策略体现了"参数高效适配"的设计哲学:冻结 CLIP 的文本编码器,只训练视觉侧的少量新增模块。
4.1 训练数据
Animal-CLIP 在三个数据集上训练和评估:
| 数据集 | 动作类别 | 物种类别 | 标签类型 | 来源 |
|---|---|---|---|---|
| Animal Kingdom | 140 | 897 | 多标签 | Ng et al., CVPR 2022 #Ng et al., 2022 |
| MammalNet | 12 | 173 | 单标签 | Chen et al., CVPR 2023 #Chen et al., 2023 |
| LoTE-Animal | 21 | 11 | 单标签 | LoTE-Animal 项目 |
Animal Kingdom 是最大的多标签动物行为识别数据集,包含 30K 视频序列和 50 小时标注视频。MammalNet 提供 539 小时视频,覆盖 173 种哺乳动物。LoTE-Animal 是一个较小但精细的数据集。#Ng et al., 2022 #Chen et al., 2023
4.2 数据预处理与增强
训练时的数据增强流程:
- 从视频中均匀采样 8 帧(clip_len=1, frame_interval=1, num_clips=8)
- Resize 到短边 256,然后 MultiScaleCrop(scales: 1, 0.875, 0.75, 0.66)
- Resize 到 224×224
- 随机水平翻转(概率 0.5)
- ColorJitter + GrayScale(概率由配置控制)
- 归一化:mean=[123.675, 116.28, 103.53], std=[58.395, 57.12, 57.375]
测试时使用 4 clips × 3 crops = 12 views 集成,通过累加各 view 的相似度得分得到最终预测。#Jing et al., 2025
4.3 损失函数
默认使用交叉熵损失:
对于多标签场景(Animal Kingdom),代码还支持 BCEWithLogitsLoss、ResampleLoss(长尾重采样)和 AsymmetricLoss(非对称焦点损失)。默认配置使用 CrossEntropyLoss。#Jing et al., 2025
4.4 优化策略
训练使用分布式数据并行(DDP),每个 GPU batch size = 16,梯度累积 4 步,有效 batch size = 64。训练 30 epochs,学习率调度使用 Cosine Annealing Warm Restarts。支持 apex O2 混合精度训练。#Jing et al., 2025
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | Animal Kingdom (30K 视频) / MammalNet (539h) / LoTE-Animal |
| 训练硬件 | 未披露 | 原文未给出(代码支持多 GPU DDP) |
| 优化器 | 未披露 | 原文未给出(代码中由 utils/optimizer.py 构建) |
| 学习率 | 未披露 | 原文未给出(Cosine Annealing Warm Restarts schedule) |
| Batch size | 已披露 | 16 per GPU × 4 accumulation = 64 effective |
| 训练轮数 | 已披露 | 30 epochs |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 部分披露 | CLIP ViT-B/16 backbone ~150M;可训练参数 ~5-10M(Prompt + GCN + MIT) |
| 精度格式 | 已披露 | FP32(默认),支持 apex O2 (FP16) |
| Checkpoint 策略 | 已披露 | 按 epoch 保存,选择最佳 mAP / Acc1 |
| 冻结模块 | 已披露 | CLIP text encoder(eval mode + no_grad 缓存文本特征) |
| 可训练模块 | 已披露 | CCT, MIT, 2×AnimalSpecificPrompt, GCN, prompts_visual_ln/proj |
| 数据增强 | 已披露 | MultiScaleCrop, Flip(0.5), ColorJitter, GrayScale |
4.5 文本特征缓存
一个值得注意的工程技巧是文本特征缓存。由于动作描述和物种描述在训练过程中不变,模型在第一次 forward 时用 CLIP 文本编码器批量编码所有文本(batch_size=50),然后缓存结果。后续训练直接使用缓存,避免了重复的文本编码开销。#Jing et al., 2025
Animal-CLIP 的推理流程与训练有显著差异,主要体现在多视图集成和物种预测的级联设计上。
5.1 输入准备
给定一段测试视频,推理流程如下:
- 帧采样:从视频中均匀采样 4 个时间片段(clips),每个片段 8 帧
- 空间裁剪:每个片段做 3 个空间裁剪(ThreeCrop),共 12 个视图
- 预处理:Resize → CenterCrop(224) → Normalize
5.2 物种预测
对每个视频的中间帧,用预训练 CLIP 进行物种分类:
- 提取中间帧,通过 CLIP 视觉编码器编码
- 与 897 个物种的文本特征计算余弦相似度
- Softmax 得到物种概率分布 \(\mathbf{p} \in [0,1]^{897}\)
这个物种预测是整个推理链路的关键前置步骤。如果物种预测错误(尤其是罕见物种),后续的动作识别会受到影响——这是一个级联误差风险。#Jing et al., 2025
5.3 动作识别
对每个视图执行完整的前向传播:
- CCT 逐帧编码 → MIT 时序聚合 → 视频特征 \(\mathbf{v}\)
- 物种加权 → \(\mathbf{f}_{\text{animal}}\) + \(\mathbf{T}_{\text{animal}}^{\text{weighted}}\)
- GCN 精炼 → \(\mathbf{T}_{\text{action}}^{\text{refined}}\)
- 双 Prompt 增强 → \(\mathbf{v}_{\text{enhanced}}\) + \(\mathbf{T}_{\text{enhanced}}\)
- 余弦相似度 → softmax 概率
12 个视图的相似度得分累加后取 softmax,得到最终预测。#Jing et al., 2025
5.4 推理效率
推理时的计算瓶颈在于 12 views 的视觉编码。文本特征和物种特征在推理前已经缓存,不需要重复计算。GCN 和 Prompt 模块的计算量相对较小(参数量约 5-10M)。#Jing et al., 2025
| 推理阶段 | 计算量 | 说明 |
|---|---|---|
| 物种预测 | 1× CLIP forward | 只需中间帧,计算量小 |
| 视觉编码 | 12× CCT + MIT forward | 主要瓶颈 |
| 文本编码 | 0(已缓存) | 推理前预计算 |
| GCN + Prompt | 12× 轻量 forward | 参数量小,计算快 |
| 相似度计算 | 12× 矩阵乘法 | 可忽略 |
对于实时应用,可以减少 views 数量(如 1 clip × 1 crop = 1 view),但会牺牲准确率。论文未报告实时推理延迟。#Jing et al., 2025
Animal-CLIP 在三个数据集上与六种基线方法进行了对比。由于 Springer IJCV 全文需要付费订阅,以下分析基于代码逆向和公开信息,部分实验数值标注为"原文未明确给出"。
6.1 评估指标
Animal-CLIP 使用以下指标评估:
- mAP(mean Average Precision):多标签分类的主要指标
- Acc@1 / Acc@5:Top-1 和 Top-5 准确率
- F1@3 / F1@5:取 top-3/top-5 预测的 F1 分数
- 长尾分析:将类别分为 head/mid/tail 三组分别计算
6.2 基线方法
对比的六种基线方法包括(从代码配置推断):
| 方法 | 类型 | 说明 |
|---|---|---|
| I3D | 3D CNN | 经典双流 3D CNN 基线 |
| SlowFast | 3D CNN | 双速率通道的时空建模 #Feichtenhofer et al., 2019 |
| X3D | 3D CNN | 高效的 3D CNN 架构 |
| MViT | Video Transformer | 多尺度视觉 Transformer |
| VideoPrompt | VLM Prompt | 视频 prompt 生成方法 |
| EVL | VLM Adapter | 高效视频语言适配 |
6.3 实验配置
| 配置项 | Animal Kingdom | MammalNet | LoTE-Animal |
|---|---|---|---|
| 帧数 | 8 | 8 | 8 |
| 输入分辨率 | 224×224 | 224×224 | 224×224 |
| Batch size | 16 × 4 = 64 | 16 × 4 = 64 | 16 × 4 = 64 |
| Epochs | 30 | 30 | 30 |
| 骨干网络 | ViT-B/16 | ViT-B/16 | ViT-B/16 |
| 测试 views | 4×3=12 | 4×3=12 | 4×3=12 |
| 损失函数 | CE | CE | CE |
6.4 主实验结果
根据论文摘要和 GitHub README,Animal-CLIP 在三个数据集上均超越了六种基线方法。#Jing et al., 2025 具体的数值对比在 Springer 付费全文中,但从代码的验证逻辑可以推断:
- Animal Kingdom(多标签):以 mAP 为主要指标,Animal-CLIP 取得最高 mAP
- MammalNet(单标签):以 Acc@1 为主要指标,Animal-CLIP 取得最高 Acc@1
- LoTE-Animal(单标签):以 Acc@1 为主要指标,Animal-CLIP 取得最高 Acc@1
6.5 长尾分析
Animal Kingdom 数据集存在明显的长尾分布。代码中将 140 个动作类别分为三组:
- Head(18 类):高频动作,如"行走"、"进食"等
- Mid(32 类):中频动作
- Tail(90 类):低频动作,如"绳降"、"寄生虫脱离"等罕见行为
代码提供了 lt_map 和 lt_acc 函数分别计算三组的 mAP 和 Acc。这暗示论文可能报告了长尾分析结果(原文未明确给出具体数值)。#Jing et al., 2025
6.6 消融实验发现
从代码架构可以推断以下消融维度(具体数值原文未明确给出):
| 消融项 | 预期效果 | 说明 |
|---|---|---|
| 去掉外部 Prompt(LLM 描述) | mAP 下降 | 验证 LLM 知识的贡献 |
| 去掉 GCN 精炼 | mAP 下降 | 验证图推理的贡献 |
| 去掉双 Prompt(只用单侧) | mAP 下降 | 验证双 Prompt 的必要性 |
| 去掉物种引导 | mAP 下降 | 验证物种信息的价值 |
| 使用简单标签代替 LLM 描述 | mAP 下降 | 验证外部 Prompt 质量的重要性 |
6.7 预测可视化
7.1 技术定位
Animal-CLIP 在 VLM 适配动物行为识别的技术谱系中占据一个独特位置:
| 路线 | 代表方法 | 参数量 | 数据需求 | 优势 |
|---|---|---|---|---|
| 全量预训练 | BioCLIP #Stevens et al., 2024 | ~150M | 1000 万图像 | 领域内最强表示 |
| 全参数微调 | ViFi-CLIP #Khattak et al., 2023 | ~150M | 大规模视频 | 通用视频适配 |
| Prompt Tuning | CoOp #Zhou et al., 2022 | ~150M + few K | 少量图像 | 参数高效 |
| 领域 Prompt | Animal-CLIP #Jing et al., 2025 | ~150M + ~10M | 中等规模视频 | 领域知识 + 参数高效 |
Animal-CLIP 的核心价值在于:它证明了不需要全量预训练或全参数微调,只需通过精心设计的 Prompt 机制注入领域知识,就能在特定领域取得显著增益。这条路线的性价比很高——可训练参数只有全量预训练的约 7%,但利用了预训练模型的全部知识。#Jing et al., 2025
7.2 局限性
Animal-CLIP 有几个值得注意的局限:
- 物种预测的级联误差:整个框架依赖物种预测的准确性。如果物种预测错误(尤其是罕见物种或未见物种),动作识别会受到影响。代码中未看到对预测不确定性的鲁棒处理。#Jing et al., 2025
- LLM 描述质量依赖:外部 Prompt 的质量取决于 LLM 生成的描述。从 description_ak.csv 可以看到,部分描述由 AI 生成,可能包含不准确或泛化的信息。#Jing et al., 2025
- 封闭集合物种预测:物种预测是在 897 个已知类别上的封闭集合预测。真正未见过的物种可能无法正确引导 prompt。论文声称的"unseen animal"泛化,更准确地说应该是"训练集中出现频率极低的物种"。#Jing et al., 2025
- 计算成本:12 views 的推理成本不低,不适合实时应用。论文未报告推理延迟和吞吐量。#Jing et al., 2025
7.3 后续演进
同一团队在 CVPR 2026 上发表了 EthoCLIP #Jing et al., 2026,可以看作 Animal-CLIP 的自然演进:
- 从 prompt tuning 走向完整的视频语言对比预训练
- 从 LLM 描述走向本体论(Neuro Behavior Ontology, NBO)引导的结构化知识
- 从三个数据集走向 Animal-Band(74,671 视频)的大规模预训练
这条演进路线说明 Animal-CLIP 的核心洞察——领域知识对动物行为理解至关重要——是正确的,但注入知识的方式可以从 prompt tuning 升级到更深层的预训练融合。#Jing et al., 2026
7.4 可操作的启发
- 领域知识注入:如果你在做某个特定领域的 VLM 适配(如医疗、农业、工业检测),可以考虑 Animal-CLIP 的双 Prompt 思路——用领域专家知识或 LLM 生成丰富的文本描述,再通过条件 Prompt 引导视觉特征对齐。
- 图结构先验:GCN 文本精炼是一个通用的设计模式。任何有"类别间关系先验"的任务(如层级分类、多标签约束)都可以考虑引入图推理。
- 参数高效适配:Animal-CLIP 证明了冻结预训练骨干 + 训练少量 Prompt 参数的路线在领域适配上是有效的。这在数据有限或计算资源受限的场景下特别有价值。
参考来源
- Jing, Y., Liang, K., Zhang, R., Sun, H., Li, Y., He, Z., & Ma, Z. (2025). Animal-CLIP: A Dual-Prompt Enhanced Vision-Language Model for Animal Action Recognition. International Journal of Computer Vision, 133(8), 1-21. DOI: 10.1007/s11263-025-02408-4
- Jing, Y., Wang, C., Zhang, R., Liang, K., & Ma, Z. (2023). Category-Specific Prompts for Animal Action Recognition with Pretrained Vision-Language Models. ACM Multimedia 2023, 5716-5724. DOI: 10.1145/3581783.3612551
- Ma, Y., et al. (2022). X-CLIP: End-to-End Multi-grained Contrastive Learning for Video-Text Retrieval. ACM Multimedia 2022. DOI: 10.1145/3503161.3547910
- Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to Prompt for Vision-Language Models. IJCV 2022. arXiv:2109.01134
- Ng, X. L., Ong, K. E., Zheng, Q., Ni, Y., Yeo, S. Y., & Liu, J. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022, 19023-19034. CVPR 2022 · 精读 →
- Chen, J., Hu, M., Coker, D. J., Costelloe, B., Beery, S., Rohrbach, A., & Elhoseiny, M. (2023). MammalNet: A Large-Scale Video Benchmark for Mammal Recognition and Behavior Understanding. CVPR 2023, 13052-13061. CVPR 2023 · 精读 →
- Stevens, S., et al. (2024). BioCLIP: A Vision Foundation Model for the Tree of Life. CVPR 2024. arXiv:2311.18803
- Jing, Y., Wu, J., Yang, Z., Liang, K., Zhu, X., & Ma, Z. (2026). EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding. CVPR 2026. CVPR 2026
- PRIS-CV. Animal-CLIP GitHub Repository. github.com/PRIS-CV/Animal-CLIP
- Feichtenhofer, C., Fan, H., Malik, J., & He, K. (2019). SlowFast Networks for Video Recognition. ICCV 2019. ICCV 2019