PMTNet
论文信息
- 标题:PMTNet: A Part-Centric Missing-Aware Temporal Network for Cat Behavior Recognition in Unconstrained Videos
- 作者:Chunxi Tu, Jiatao Wu, Zeguang Huang, Jiaxing Xie
- 单位:华南农业大学人工智能学院;广东省农业信息监测工程技术研究中心
- 发表:Animals (MDPI), 2026, Vol. 16, No. 11
- DOI:10.3390/ani16111589
- 开源:论文提及代码待开源(截至 2026.06 未在 GitHub 上找到官方仓库)
在 上一篇模型全景 中,我们提到 PMTNet (2026) 是目前公开文献中唯一专门面向非受限视频中猫咪行为识别的工作。对于我们的端侧宠物行为识别项目,它具有极高的参考价值:
- 它针对的物种正是家猫,而不是野生动物或哺乳动物泛化研究
- 它处理的是真实非受限视频,与家庭监控场景高度相关
- 它提出的部件级时序建模思路,对解决猫遮挡、姿态变化、尾巴/头部不稳定可见等问题非常对症
与人类动作识别相比,猫行为识别有几个独特难点:
难点 1:关键行为线索分散在可变形的局部部件
猫的头部、尾巴、耳朵等部位高度灵活,且携带大量行为信息。例如:
- 尾巴摆动 → Tail-Expressive 行为
- 头部低伏 + 耳朵后压 → 紧张/攻击
- 全身理毛 → Grooming
这些局部部件在视频中经常部分遮挡或完全消失,传统全帧视频分类模型难以稳定捕捉。
难点 2:非受限视频的质量问题
真实家庭监控视频面临:
- 光照变化、运动模糊
- 多猫重叠、背景杂乱
- 相机角度和距离变化
- 猫的姿态高度非刚性(蜷缩、跳跃、快速转身)
难点 3:部件检测的不稳定性
即使能检测出身体、头部、尾巴,检测器在视频序列中也会时有时无。如何在部分部件缺失的情况下仍然稳定识别行为,是 PMTNet 要解决的核心问题。
PMTNet 将猫行为识别解耦为三个阶段:
flowchart LR S1["Stage 1
部件检测器训练与选择"] --> S2["Stage 2
离线部件特征提取"] S2 --> S3["Stage 3
缺失感知时序行为建模"]
Stage 1:下游感知的部件检测器选择
1.1 部件定义
PMTNet 将猫分解为三个语义部件:
- Cat Body:身体主体
- Head:头部
- Tail:尾巴
为了训练检测器,作者构建了一个 COCO 格式的部件检测数据集:
- 训练集:4,000 张图像
- 验证集:500 张图像
- 数据来自自拍视频帧和公开图像(未公开具体来源)
1.2 检测器候选与选择协议
论文没有使用单一检测器,而是训练了多个 DEIM 检测器变体,并从下游行为识别效果反推最佳检测器。候选变体包括不同的 IoU 损失函数组合:
| 候选检测器 | 保留原因 | 特点 |
|---|---|---|
| WIoU v3 | 严格定位性能最强 | 边界框回归精确 |
| CIoU + SimAM | 对跟踪丢失鲁棒 | 注意力机制增强 |
| GIoU | 稳定性参考 | 抖动最小 |
选择标准不只是静态检测 mAP,而是引入了一套视频域时序鲁棒性指标:
时序鲁棒性指标
分为三类:
- 检测可用性:有效帧比例、平均置信度
- 绝对时序稳定性:IoU 抖动、中心点抖动、宽高抖动
- 猫相对时序稳定性:头部/尾巴相对于身体中心点的稳定性
这些指标的设计动机是:一个好的部件检测器不仅要单帧准,还要在视频序列中稳定,不能让下游行为分类器被噪声淹没。
Stage 2:离线部件特征提取
选定检测器后,对整个视频逐帧推理,缓存三个部件的:
- 边界框(BBox)
- 置信度分数
- ROI 对齐的外观特征(使用 ResNet50 提取)
论文提到 Stage 2 是离线缓存的,主要是为了 Stage 3 训练时的高效和可控。实际部署时也可以改为在线推理。
Stage 3:缺失感知时序行为建模
3.1 显式几何运动描述符
除了 ROI 外观特征,PMTNet 还构造了一个几何运动描述符,显式编码:
- 身体中心点在归一化图像坐标中的轨迹
- 头部中心点相对于检测到的猫框的轨迹
- 尾巴中心点相对于猫框的轨迹
这个设计非常巧妙——它把全局运动(身体位移)和局部相对运动(头/尾相对于身体的运动)解耦,让模型能分别学习。
3.2 缺失感知融合机制
这是 PMTNet 的核心创新。每个时间步,模型收到三个部件对齐的特征:
- 身体 ROI 外观特征 + 几何运动特征
- 头部 ROI 外观特征 + 几何运动特征(可能缺失)
- 尾巴 ROI 外观特征 + 几何运动特征(可能缺失)
论文对比了两种融合策略:
| 策略 | 机制 | 局限 |
|---|---|---|
| ConcatFusion | 缺失部件用掩码填充后拼接 | 非自适应,所有可用部件权重相同 |
| GateFusion | 轻量 MLP 根据当前帧状态预测各部件门控权重 | 计算量稍大,但自适应 |
GateFusion 的直觉
当尾巴可见且摆动明显时,模型应该更依赖尾巴特征来判断 Tail-Expressive;当尾巴被遮挡时,模型应该自动降低尾巴权重,更多依赖身体和头部。GateFusion 就是学习这种动态权重分配。
3.3 时序编码与聚合
融合后的特征序列送入时序编码器,论文比较了两种:
- TCN:一维卷积,计算高效,擅长局部时序模式
- GRU:门控循环单元,保留更强序列顺序信息
时序聚合策略也有三种:
- Last-step:取最后时刻隐藏状态(最差)
- Mean pooling:掩码时序平均
- Attention:学习时序注意力权重(最佳)
3.4 训练目标
使用加权交叉熵损失处理类别不平衡:
其中类别权重 \(w_c\) 与训练集中各类样本数成反比,缓解少数类影响。
行为类别定义
PMTNet 采用的是面向任务的 5 分类体系,不是严格的行为学分类:
| 类别 | 行为含义 | 与我们项目的映射 |
|---|---|---|
| Rest | 休息、睡眠、轻微头部动作 | 长时间静止 |
| Locomotion | 持续行走/奔跑 | 活动(走/跑) |
| Grooming | 舔毛、自我清洁 | 舔毛 |
| Active | 活跃互动:玩耍、抓挠、探索 | 跳跃、多宠打闹、异常分类 2 |
| Tail-Expressive | 身体基本静止但尾巴有明显表达性动作 | 无直接对应,可视为特殊状态 |
标注消歧规则
论文设计了一套清晰的优先级规则来处理多行为共存:
- 主要活动优先:如果 Grooming 或 Active 清晰可见,优先标为该类
- 运动优先:如果存在持续行走/奔跑,标为 Locomotion
- 尾巴主导表达:身体基本静止但尾巴明显运动时,标为 Tail-Expressive
- 默认休息:只有轻微头部动作且无上述行为时,标为 Rest
数据规模
| 数据集 | 训练集 | 验证集 | 测试集 | 总计 |
|---|---|---|---|---|
| 行为识别视频 | 969 | 154 | 160 | 1,283 |
| 部件检测图像 | 4,000 | 500 | — | 4,500 |
数据集规模的局限
1,283 个视频片段对于 5 分类来说规模偏小,且 5 个类别之间的语义边界并不完全清晰(例如 Active 可能包含玩耍、抓挠、探索等多种行为)。论文结果需要在自己数据集上重新验证。
主要结果
在最佳配置下,PMTNet 达到:
- Top-1 Accuracy:93.1%
- Macro-F1:90.9%
相比全帧视频基线(TimeSformer、SlowFast 等),PMTNet 在猫的 5 类行为上明显更优。这说明部件级建模对猫行为识别确实有显著价值。
关键 Ablation 发现
| Ablation 维度 | 关键发现 | 对项目的启示 |
|---|---|---|
| 检测器选择 | 视频域稳定性比单帧 mAP 更重要;CIoU+SimAM 在下游任务上表现最好 | 部件检测器要针对视频稳定性优化,不只是静态精度 |
| 部件组合 | Cat + Head + Tail 优于只用 Cat;不同部件对不同类别贡献不同 | 身体、头、尾巴三路信息互补 |
| 融合策略 | GateFusion 优于 ConcatFusion,特别是在尾巴缺失比例高时 | 缺失感知机制有效 |
| 时序编码器 | TCN 和 GRU 各有偏好,TCN 整体更优 | 轻量 TCN 足够 |
| 聚合策略 | Attention 聚合优于 Mean,Mean 优于 Last-step | 不要只用最后时刻输出 |
失败案例分析
论文展示了 PMTNet 的失败案例:一个 Tail-Expressive 视频被错分为 Active。原因是头部运动和局部自我接触线索过强,压倒了尾巴运动的证据。
值得借鉴的地方
| 设计 | 借鉴价值 |
|---|---|
| 部件级建模 | 身体/头部/尾巴三路检测 + 时序建模,对猫这类非刚性动物非常有效 |
| 下游感知检测器选择 | 不只看检测 mAP,而是用下游行为识别效果反推最佳检测器 |
| 视频域稳定性指标 | IoU 抖动、中心点抖动等指标可直接复用 |
| 缺失感知融合 | GateFusion 思路可迁移到我们的多模态/多部件融合中 |
| 几何运动描述符 | 全局轨迹 + 局部相对轨迹的解耦设计值得参考 |
| 主导行为标注规则 | 优先级规则可减少标注歧义,提升一致性 |
局限与需要注意的地方
未覆盖异常行为
PMTNet 的 5 类行为中没有包含呕吐、抽搐等我们项目关注的关键异常场景。它的方法主要适用于常见行为分类,异常检测仍需额外设计。
三阶段 pipeline 的部署成本
PMTNet 是离线三阶段 pipeline(检测 → 特征提取 → 时序分类),每个阶段都需要独立的模型和缓存。在 500 元 BOM 的端侧设备上,这种复杂度的实时部署有挑战。简化版(如单阶段 YOLO + 动作头)可能更实用。
数据集未开源
截至 2026 年 6 月,PMTNet 的代码和数据集尚未在 GitHub 等平台上公开。我们只能借鉴方法,无法直接复用数据或代码。
短期可落地:简化版部件级 pipeline
考虑到端侧 500 元 BOM 约束,不建议直接复刻 PMTNet 的三阶段 pipeline。更实际的方案是:
flowchart LR A["YOLOv8/v11 猫检测"] --> B["轻量部件检测
身体/头/尾"] B --> C["提取 ROI 特征
MobileNet / EfficientNet"] C --> D["时序 TCN 分类"]
关键点:
- 用 YOLOv8/v11 同时做猫检测和部件检测(多任务头)
- 部件特征提取用轻量 backbone(MobileNetV3 / EfficientNet-Lite)
- 时序模型用 TCN 而非 GRU,计算量更小
- 加入 GateFusion 处理部件缺失
中期可探索:与 X3D-M 的融合
将 PMTNet 的部件级特征作为 X3D-M 全帧特征的补充:
- X3D-M 捕获全局场景和全猫外观
- 部件级分支捕获头部、尾巴的局部细节
- 两路特征 late fusion,提升对 Tail-Expressive / Active 等类别的区分
关键超参数建议
| 组件 | 建议 |
|---|---|
| 部件检测器 | YOLOv8/v11 + WIoU/CIoU 损失,针对视频稳定性微调 |
| 部件定义 | Body / Head / Tail,可考虑增加 ears/paws |
| 特征 backbone | MobileNetV3-Small 或 EfficientNet-B0 |
| 时序编码器 | TCN,kernel size 3,dilation 指数增长 |
| 聚合策略 | Attention 或 Mean,避免 Last-step |
| 损失函数 | 加权交叉熵 + 类别重采样 |
PMTNet 给我们的 3 个核心 takeaway
- 猫行为识别需要部件级视角:只看全帧不够,头、尾巴等部位携带关键行为信息
- 检测器选择要下游感知:视频域稳定性比单帧 mAP 更重要
- 缺失感知融合是刚需:真实视频中部件遮挡不可避免,GateFusion 类机制有效
PMTNet 是目前唯一专门面向非受限视频中猫咪行为识别的公开工作,虽然数据集规模不大且未开源,但其方法论对项目有重要参考价值。
核心贡献可以概括为:把猫看成"身体+头部+尾巴"三个可变形部件,分别检测、分别建模时序、再通过门控机制自适应融合。这套思路直接回应了猫行为识别中的遮挡、姿态变化、局部线索关键等难题。
- Tu, C., Wu, J., Huang, Z., & Xie, J. (2026). PMTNet: A Part-Centric Missing-Aware Temporal Network for Cat Behavior Recognition in Unconstrained Videos. Animals, 16(11), 1589. https://doi.org/10.3390/ani16111589
- DEIM: DETR with Improved Matching for Fast Convergence. (2024). arXiv:2412.04233
- Bertasius, G., Wang, H., & Torresani, L. (2021). Is Space-Time Attention All You Need for Video Understanding? ICML 2021. arXiv:2102.05095