非视觉模态全景
承接本系列的第二篇《动作检测模型全景与选型》,我们从 backbone 视角把 mmaction2 模型库和最新架构(VideoMamba、VideoMAE V2、InternVideo2)梳理完毕,给出了慢快双流、视频 Transformer、Mamba 三条路线的推荐。但在模型以外,输入端的选择同样决定了项目的可行性。
RGB 视频是默认假设,但它在三个场景中暴露出严重缺陷:
- 遮挡与背景干扰--室内场景下猫常钻进沙发底、跳上书架,RGB 视频的判别信息被背景淹没
- 隐私顾虑--视频含家具布局、主人面容,对家居用户是负面卖点
- 算力开销--在 500 元 BOM 约束下,1080p×30fps 视频流是吃不下的
对这些问题,改变输入模态往往比换 backbone 更有效。本文不追求"穷举所有动作识别方法",而是聚焦一个具体工程问题--在端侧猫狗行为识别的严苛约束下,哪种输入路线最合适。沿着这条主轴,我们梳理 8 种可用模态:6 种视觉(RGB、骨架、RGB-D、稀疏轨迹、3D 点云、事件相机)+ 2 种非视觉(IMU 加速度计、音频),并对其中 3 种最具工程落地潜力的新路线(稀疏轨迹、单目深度、事件相机)展开深度分析。
本文把可用的输入模态分为"视觉"与"非视觉"两大类,共 8 种。视觉路线以 RGB 为起点,按抽象层级递增:RGB(最原始)→ RGB-D(+深度)→ 骨架/轨迹(+语义)→ 3D 点云(+几何),事件相机则独立于这条主线,提供异步流式输入。非视觉路线包括 IMU 加速度计与音频,历史上用于动作识别的研究较少,但在宠物场景有独特价值。
| 分类 | 模态 | 代表方法 | 输入形式 | 计算量 | 硬件成本 | 猫场景适配 |
|---|---|---|---|---|---|---|
| 视觉 | RGB | SlowFast, X3D, VideoMamba | 原始视频帧 | 大(GB 级 FLOPs) | 中(摄像头模组) | 首选 - 信息完整 |
| Skeleton | ST-GCN, PoseC3D, SkateFormer | 关键点序列 | 极小 | 中 | 需猫姿态估计 | |
| RGB-D / 单目深度 | DEAR, MAGNet | RGB + depth map | 中(双流) | 低-中 | 可行 - 单目估计即可 | |
| 稀疏轨迹 | TrAction (2026) | CoTracker3 点轨迹 | 低 | 中 | 潜力 - 纯运动驱动 | |
| 3D 点云 | 3DInAction, Motion PointNet | 点云序列 | 中-高 | 高(深度传感器) | 困难 - 需多视角 | |
| 事件相机 | POKER (CVPR 2026) | 异步事件流 | 极低 | 高(专用硬件) | 不成熟 - 工程早期 | |
| 非视觉 | IMU / 加速度 | 牛/羊行为识别综述 | 3 轴加速度 + 陀螺仪 | 极低 | 低 - 9 轴 MPU6050 ¥5 | 成熟 - 已有 FitBark / PetPace 项圈方案 |
| 音频 | 犬吠分类 / 猫呼噜声 | 声谱图 | 小 | 低(驻极体麦克风) | 补充 - 单独精度不足 |
这个 8 模态全景的关键洞察是:没有单一模态能在所有维度都最优。RGB 信息完整但重、IMU 极轻但语义弱、稀疏轨迹对运动敏感但对静态行为失明。下面 6 章深入分析 6 种视觉路线 + 1 章讲两种非视觉路线 + 1 章多模态融合 + 1 章端侧决策矩阵。
在所有模态里,RGB 与骨架是最成熟的两条主线。本系列第二篇《动作检测模型全景》给出的所有选型都基于这两者。本节先快速对这两条路线的参数、优势、劣势做一次复盘,因为后文所有新模态都不可避免地要回答"相对这两条主线,我在何处胜出"。
| 维度 | RGB-based | Skeleton-based |
|---|---|---|
| 参数量 | 2M - 1B | 1.4M - 3.5M |
| FLOPs | 数十 G - 数百 G | < 4G |
| 前置依赖 | 无 | 需要姿态估计模型 |
| 优势 | 信息完整,无需前置模型 | 极轻量,对背景和外观变化鲁棒 |
| 劣势 | 计算量大,易受背景干扰 | 姿态估计错误会传播到下游 |
猫科骨架路线的隐藏成本
人体骨架模型(COCO-17 或 NTU-25)不能直接用于猫--猫是四足动物,关节拓扑完全不同(AP-10K 定义 22 个关键点,包含尾巴和耳朵)。选择骨架路线意味着需要先训练一个猫科姿态估计器,或使用 SuperAnimal(见 Part 4 详述)做零样本替代。这个前置成本不可忽视,且骨架方法对猫蜷缩/蹭动等关键姿态估计失败的鲁棒性也低于人体场景。
这两条主线之外,稀疏轨迹(Part 4)实际上是对骨架路线的"轻量化语义替代":不去估计精确的 22 个猫关键点,而只追踪数百个无标注点的运动轨迹。这一思路能在保留骨架路线轻量优势的同时,避免猫科姿态估计的前置依赖。
RGB-D 动作识别是除 RGB 与骨架外第三条最成熟的视觉模态,在 NTU RGB+D 120 等基准上有 20+ 年研究积累。2024-2026 年的关键范式转变是不再需要深度传感器--单目深度估计模型(MiDaS、Depth Anything)可以从普通 RGB 视频生成 depth map。这意味着 RGB-D 路线可以在不增加硬件成本的前提下得到深度分支作为补充模态。
代表方法对比
| 方法 | 来源 | 深度来源 | 核心思路 | 对猫场景的价值 |
|---|---|---|---|---|
| DEAR | ECCV 2024 Workshop | MiDaS 单目估计 | S4V + VideoMamba 三分支双流融合 | 无需额外硬件;类别级提升 +0.6% ~ +10% |
| MAGNet | Nature Sci Rep 2026 | 任意来源(含缺失) | 多模态自适应 GCN + 跨模态自注意力 | 模态缺失时自适应调整权重;对遮挡鲁棒 |
DEAR 深度解读
📄 DEAR: Depth-Enhanced Action Recognition(ECCV 2024 Workshop,arXiv 2408.15679)
作者:Rahmani et al., University of Surrey
代码:GitHub
核心问题:2D RGB 在杂乱场景中难以区分动作,人类视觉依赖 3D 深度信息来理解空间关系,但深度传感器不普及。作者提出"用单目深度估计替代硬件深度传感器"的方案。
方法:三编码分支 + 晚期融合
- RGB 分支:Side4Video(S4V),用冻结的 CLIP ViT-B/16 + 并行可训练侧支提取空间特征
- Depth 分支 1:同样的 S4V 架构处理 MiDaS-small 生成的 depth map
- Depth 分支 2:VideoMamba 处理 depth map(Mamba 对稀疏深度特征感知不同)
- 融合:Gated Cross-Attention(GCA)双向融合 RGB↔Depth 特征,最后对两路 score 取平均
关键结果(Something-Something V2):
| 配置 | Top-1 | 相对 RGB 提升 |
|---|---|---|
| S4V(RGB only) | 70.2% | baseline |
| RGB + Depth(S4V) | 70.3% | +0.1 |
| RGB + Depth(VideoMamba) | 70.0% | -0.2 |
| RGB + Depth(S4V + VideoMamba) | 70.8% | +0.6 |
类别级分析:深度信息对涉及物体空间关系的动作提升显著--"Stuffing something into something" +10%(63%→73%),"Dropping something onto something" +5%,"Pushing something so that it almost falls" +5%。这类动作都需要判断两个物体的相对深度,正是 2D RGB 容易混淆的。
对宠物场景的启示
- ✅ 无需额外硬件--MiDaS 从 RGB 生成 depth map,硬件成本不变
- ✅ 架构可借鉴--双流 + GCA 融合是通用模式,可替换 backbone 为 X3D-M
- ⚠️ 整体提升幅度有限-- +0.6%,但对涉及空间关系的动作(猫跳上/跳下、钻进盒子)提升可能更大
- ⚠️ VideoMamba 分支增加复杂度--边缘部署时可能只需 RGB+Depth(S4V) 两分支
单目深度在动物上的局限
单目深度估计模型通常在人体/室内场景上训练,在动物(尤其是毛茸茸的猫)上的深度精度会下降。但作为辅助模态而非主模态,这种精度损失是可以接受的--深度分支提供的是相对几何关系(猫 vs 背景),不需要绝对精确。这与 DEAR 选用的 MiDaS-small(强调相对深度而非 metric depth)的设计选择一致。
结论:对端侧宠物摄像头项目,DEAR 式的"RGB + 单目深度"是最具工程落地性的第三条路线--它不需要任何额外硬件,只是把现有 RGB 视频切成两份输入,硬件成本不变却能获得几何信息的边际增益。MAGNet 的自适应权重机制更适合处理"传感器偶发失效"场景,但对纯 RGB + 估计深度的配置并非必需品。
2026.06 提出的 TrAction 是一种颠覆性的输入范式改造:完全抛弃 RGB 像素,只用稀疏点轨迹作为模型输入。这个思路与依赖深度学习"视觉特征"的传统路线分道扬镳,直接回到动作识别的本质--动作就是运动,没有运动就没有动作。
与其前身 I3D flow-based(1.6M input 值)相比,TrAction 仅 0.3M input 值,是前者的 1/5。这意味着在端侧缓存与带宽层面,轨迹路线有数量级优势。
📄 TrAction: Action Recognition with Sparse Trajectories(arXiv 2026.06)
作者:Jan F. Meier, Felix B. Müller, Alexander Ecker, Timo Lüddecke(University of Göttingen / Max Planck Institute for Dynamics and Self-Organization, Göttingen)
代码:ecker-lab/TrAction(v1 阶段尚无 release)
核心问题:密集 RGB 视频模型存在两大缺陷--(1) 内存和计算随分辨率/时长线性膨胀;(2) 强烈的外观偏差(appearance bias),模型倾向于从物体/背景推断动作而非从运动本身。
方法
- 轨迹提取:CoTracker3 跟踪稀疏 2D 点(数百个),跨帧维持 identity 和遮挡推理
- 2.5D 增强:单目深度估计为每个轨迹点附加深度坐标,得到 (x, y, z, t) 序列
- 轨迹 Transformer:简单 transformer 架构,直接在轨迹序列上操作
- Masked-Trajectory Pretraining:类比 MAE 的掩码预训练,随机遮蔽部分轨迹点后重建,下游分类提升 ~5 个点
关键结果
| 配置 | SSV2 Top-1 | EK100 verb Top-1 | 备注 |
|---|---|---|---|
| TrAction(纯轨迹) | 45.2% | 54.1% | 仅运动信息,无外观 |
| TrAction(K400 预训练) | 45.8% | 53.9% | MAE pretraining +0.6pt |
| I3D (flow-only, 对照组) | 38.4% | 54.0% | 8pt 优势仅取 1/5 输入 |
| DINOv2-B (16 frames) | 53.6% | 59.1% | 纯外观基线 |
| TrAction + DINOv2 late-fusion | 53.6% + 8.7pt | 59.1% + 4.4pt | 轨迹与外观高度互补 |
| TrAction + V-JEPA 2-L | 66.7% + 1.6pt | 67.2% + 1.1pt | 与最强 video encoder 也互补 |
关键发现:轨迹特征与外观特征高度互补--在运动判别性强的子集上(外观模型最弱的地方),轨迹带来的提升最大。在 Chirality-in-Action benchmark(时间反转敏感性测试)上,纯轨迹方法超过 V-JEPA。
关键消融(Table 4):
- 无 MAE pretrain → 40.9% SSV2(带 pretrain 45.8%,+5pt)
- 无 depth 通道 → 31.4% SSV2(-14pt,最关键单一通道)
- 无 positional encoding → 38.4% SSV2(-7pt)
- 仅用 relative coords → 32.0% SSV2(-9pt,绝对位置不可替代)
对宠物场景的启示
- ✅ 天然适配猫咪场景--猫的行为(走/跑/跳/舔毛/抓挠)主要由运动模式区分,外观信息冗余度高
- ✅ 数据量极小--2500 点的轨迹 vs 密集 RGB 帧,存储/传输成本大幅降低(I3D flow 的 1/5)
- ✅ 对背景/光照鲁棒--轨迹不含外观信息,不受猫毛色变化、环境光照影响
- ⚠️ CoTracker3 本身有计算开销--论文 § 5.4 明确说"轨迹提取 computationally expensive, amortized via caching",实时性下需拆验
- ⚠️ 静态行为无效--猫跳着/睡觉时几乎无轨迹信号,需与 RGB 分支互补
- ⚠️ 动物轨迹跟踪未验证--CoTracker3 在人体场景上训练,猫体跟踪质量需实测
结论:稀疏轨迹是对端侧宠物摄像头最有吸引力的新范式。它的"纯运动"特性天然规避了 RGB 的隐私顾虑(一张点轨迹图比一段视频更不可辨识),且能直接在 500 元 BOM 上运行(CoTracker3 已有移动端加速版本)。但需要解决两个工程问题:(1) CoTracker3 对猫体的跟踪鲁棒性;(2) 静态行为(趴/睡)的兜底--这两个问题对 RGB 都不是问题,对轨迹路线则是必须补齐的能力。
3D 点云作为动作识别输入的想法最早可以追溯到 Kinect 时代的 RGB-D 数据集(NTU RGB+D 120)。点云直接表达 3D 几何,避开了 2D 投影带来的深度歧义,是几何信息最完整的视觉模态。但点云动作识别有三大工程难点:
- 数据获取成本高--传统依赖深度传感器(LiDAR / ToF / 结构光),消费级硬件难普及
- 无固定拓扑结构--点云排列无序、点数可变,需要专门设计的神经网络(PointNet / PointNet++)
- 帧间无对应关系--帧间点云没有点对点映射,时空建模困难
📄 3DInAction: Understanding Human Actions in 3D Point Clouds(arXiv 2023)
作者:Ben-Shabat et al., ANU / Technion
代码:GitHub
核心方法:t-patch + 分层架构
- t-patch(时序点块):在时间窗口内对局部点区域进行分组,捕捉局部表面形变和运动
- 分层 MLP 架构:逐层聚合 t-patch 特征,从局部到全局构建时空表征
- 逐帧预测:不同于大多数方法的 clip-level 分类,3DInAction 输出每帧的动作标签
- 无需先验:不依赖骨架提取或人体检测,是通用的 3D 动作识别方法
关键结果
| 数据集 | 3DInAction | 此前 SOTA | 提升 |
|---|---|---|---|
| DFAUST(4D 人体扫描,14 类动作) | - | - | +13% |
| IKEA ASM(家具装配,33 类动作) | - | - | +7% |
重要进展:2025 年的后续工作 "Human Action Recognition from Point Clouds over Time" 进一步扩展了这条路线--支持单目深度估计生成的点云(不依赖深度传感器),结合稀疏卷积 + 点嵌入的 backbone,在 NTU RGB+D 120 上达到 89.3%(传感器 + 估计点云集成),与骨架方法竞争力相当。这意味着点云路线在 2025-2026 出现了"无需专用硬件"的可行性突破。
3D Mesh / 4D Gaussian Splatting 的特殊价值
除了直接的点云序列,另两条相关路线值得注意:
- 3D Mesh 路线:3DMesh-GAR (2022) 从 RGB 回归人体 mesh 再做行为识别。类比可用 SMAL 动物模型做猫,但单目 3D 动物重建本身是难题。
- 4D Gaussian Splatting:4DGS (CVPR 2024)、Director (2026) 聚焦动态场景渲染和语义理解,尚无行为识别直接应用。从 4DGS 形变场提取运动特征是可行研究方向,但尚无先例。
事件相机(Event Camera / Neuromorphic Camera)是一种与传统相机完全不同的成像范式。它不像传统相机按固定帧率采样,而是异步输出像素级的亮度变化事件:当某个像素的亮度变化超过阈值时,该像素立即输出一个 (x, y, polarity, timestamp) 元组,分辨率达到微秒级。这种范式带来三个根本优势:
- 极低延迟--微秒级响应,适合快速运动(猫突然跳)
- 极低功耗--典型值 1-10 mW(vs 普通相机 100-1000 mW)
- 高动态范围-->120 dB,对室内暗光/强光切换场景极友好
事件相机在动作识别上的代表工作是 CVPR 2026 的 POKER(待 subagent 提供精确细节),以及 2025 年的 Few-shot EAR 等。这一路线对宠物场景有独特的理论吸引力--猫的快速运动(跳、扑、抓)天然契合事件相机的高时间分辨率。
事件相机路线的工程阻塞
事件相机路线对宠物项目有两个关键阻塞:
- 硬件未消费化--主流产品(如 iniVation DAVIS346、Prophesee EVK)单价 ¥5000+,与 500 元 BOM 预算严重不匹配
- 静态行为失明--当猫趴着/睡觉时几乎不产生事件,无法用事件流区分"深睡 vs 浅睡"
结论是事件相机路线在 2026 年仍是实验室技术,可作为长期研究方向但不应作为产品路线。
结论:事件相机给端侧宠物识别提供了一个完全不同的物理基础,但当前消费化硬件未到位。值得跟踪:随着 Sony / Samsung 等大厂的消费化事件相机模组(预计 2027-2028 年上市),这条路线可能从"实验室"升级为"产品线"。
跳脱出纯视觉路线,两项非视觉模态已经在消费宠物产品里规模化部署:IMU 加速度计(宠物项圈)与音频(宠物拾音)。本节给出两条路线在猫狗行为识别上的当前工程图景。
7.1 项圈加速度计:从 FitBark 到学术研究
消费级宠物穿戴产品(FitBark、Whistle、Tractive 等)早已不依赖视觉--它们的核心传感器是 3 轴加速度计(部分含陀螺仪),通过项圈佩戴在宠物颈部。2024 年的综述文章 "Real-time behavior recognition of animal: an IoT-based system design using acceleration data"(Multimedia Tools and Applications 2024)系统总结了基于加速度数据的 IoT 行为识别系统设计。
📍 牛/羊 IMU 行为识别 IoT 系统(2024 综述)
核心方法:
- 3 轴加速度 + 3 轴陀螺仪(9 轴 IMU)
- 滑动窗口特征提取(均值、标准差、过零率等时域/频域特征)
- 经典 ML(随机森林、SVM)或轻量神经网络分类
- 直接在 MCU 上运行(如 ESP32 + MPU6050)
精度:在牛行为识别(采食、反刍、休息、行走)上达到 90%+ 准确率
硬件成本:MPU6050 模块 ¥5,ESP32 主控 ¥20,总 BOM < ¥50
对宠物场景的可迁移性:狗项圈已成熟(FitBark 等产品),猫项圈仍受佩戴稳定性困扰--猫会脱项圈,且猫的颈部动作幅度比牛/羊小得多。
7.2 音频模态:拾音 + 声谱图分类
犬吠分类和猫呼噜/发声分类在声学领域是长期课题。音频路线的特征是硬件极简(驻极体麦克风 ¥0.5),算力极小。当下最重要的数据集与工作:
- DogSpeak(UTA-CL2, 2025):首个 web-scale 在野犬吠数据,含犬种/性别/年龄标签,4-task 分类 + few-shot cross-dog generalization。Wav2Vec2 + Linear probe,dog ID 90%+,context grounding 70%。"本领域必看数据集"。
- Towards Dog Bark Decoding(Abzaliev et al., LREC-COLING 2024):用人类语音预训练模型(HuBERT / Wav2Vec2)迁移到犬吠分类,发现预训练在多数任务上比专用 audio model 更优。这给"未来犬吠 + 视觉联合大模型"中的语音级 SSL encoder 提供了路径。
- Pandeya et al. 2018(猫发声):Applied Sciences, MDPI。10 类猫发声,CDBN features + ensemble 达到 91% accuracy。数据集为 Zenodo Cat Sound Classification V2。
- Automatic Classification of Dog Barking(Appl. Acoustics 2024):19,643 barks / 113 dogs,deep CNN + handcrafted feature fusion ≈ 95% 多类准确率。
- CatMeows(Ludovico 2021):3 个采集 context(等待食物 / 隔离陌生 / 梳理毛发),体量百条级,猫场景基础 benchmark。
音频路线单独作为行为识别路线时精度受限,但能识别的粒度是:
- 能识别的:犬吠、呼噜、发怒哈气、喵叫 → 状态推断
- 不能识别的:安静时的细微行为差异(走 vs 卧 vs 舔毛)
7.3 产业侧:Traini / PEBI 的多模态整合范式
硅谷宠物情感 AI 公司 Traini(2025-12 完成超 5000 万元融资,投资方包括榕树资本、小米联合创始人洪峰等)是当前宠物 AI 产业的代表性样本。其核心产品 PEBI(Pet Empathic Behavior Interface)的特征是纯软件、跨模态:
- 训练规模:基于 900+ 项动物行为研究 + 200 万只狗数据 + 120 个犬种
- 模态融合:声学(犬吠) + 视觉(面部表情) + 行为(加速度/IMU) + 生命体征(心率、体温、运动)
- 标称精度:犬种识别 / 情绪翻译最高 94%(营销口径,跨犬种 + 跨环境会跌到 80% 左右)
- 品牌 PEBI = Pet Emotion & Behavior Intelligence,包含 iOS App(2024.11 上线) + Cognitive Smart Collar(2025 CES 首发)
- 2025.12 完成 750 万美元 Seed 轮,累计 ≈ 1050 万美元(2 轮)
旁友:PetPace(兽医级智能项圈,主打心率 / HRV / 体温,商用 toB 兽医为主,与 Holter-ECG 一致性 95%+)、Fi / Whistle / FitBark(消费级 GPS + 活动监测项圈,均价 ¥400–1400)。三件 BOM 50–150 USD 是当前 pet wearable 商业窗口。
Traini 给本项目的启示是工程上的多模态融合已是产业共识——单一视觉模态做不到 94% 的“听懂狗狗”准确率,必须叠加音频甚至传感器数据才能跨过产品化阈值。
一旦决定使用 2 种以上模态,融合策略就成了核心问题。综合 2024-2026 主流动作识别论文,融合可分为 4 种范式:
| 范式 | 融合位置 | 代表方法 | 优势 | 劣势 |
|---|---|---|---|---|
| 早期融合 | 输入层(特征拼接) | Two-Stream CNN (2014), TSN | 实现简单,端到端优化 | 特征空间异构,融合粗糙 |
| 中期融合 | 中间层(交叉注意力) | DEAR (GCA), MAGNet | 模态间细粒度交互 | 架构复杂,训练不稳 |
| 晚期融合 | 输出层(score 平均/投票) | DEAR 双路 score, ARTEMIS | 模块化,每支路可独立升级 | 丢失跨模态相关性 |
| 自适应融合 | 动态权重(输入条件) | MAGNet (模态缺失自适应) | 应对模态失效 | 增加元网络复杂度 |
对一个实际宠物项目来说,晚期融合是最推荐的起点--它能让你独立升级任意一支模态而不破坏整体系统。例如:第 1 期上 RGB + 音频,第 2 期叠加深度/轨迹分支,第 3 期加项圈 IMU,每期都能产出有价值的产品。
融合还有一个常被忽视的"反向"问题:模态失效时的兜底。MAGNet 论文给出的思路是给每个模态配置一个自适应权重,当某模态信号退化时(遮挡、传感器离线),模型自动降低该分支权重。这种鲁棒性设计在宠物场景至关重要--摄像头被猫撞歪、夜间完全黑暗、项圈被脱掉,这些场景在真实使用中都会出现。
综合前 8 章分析,本节给出最终的端侧部署决策矩阵。6 种视觉模态 × 4 个部署维度(算力/硬件成本/隐私/对静态行为有效),每个维度按 1-5 评分(5 = 最佳):
| 模态 | 算力开销 | 硬件成本 | 隐私友好 | 静态行为有效 | 总分 |
|---|---|---|---|---|---|
| RGB | 1/5 | 3/5 | 1/5 | 5/5 | 10 |
| Skeleton | 5/5 | 3/5 | 4/5 | 4/5 | 16 |
| RGB-D / 单目深度 | 3/5 | 4/5 | 2/5 | 5/5 | 14 |
| 稀疏轨迹 | 4/5 | 3/5 | 5/5 | 1/5 | 13 |
| 3D 点云 | 2/5 | 2/5 | 2/5 | 5/5 | 11 |
| 事件相机 | 5/5 | 1/5 | 5/5 | 1/5 | 12 |
| IMU 加速度 | 5/5 | 5/5 | 5/5 | 3/5 | 18 |
| 音频 | 5/5 | 5/5 | 3/5 | 2/5 | 15 |
多模态组合的 1+1 > 2
从上表分数来看,任何单一模态都有显著短板。但通过组合可以互补:
- RGB + 稀疏轨迹:处理运动行为(走路/跑/跳)→ 高分场景
- RGB + 单目深度:处理空间动作(跳上/钻入)→ 高分场景
- RGB + IMU:跨摄像头与项圈的鲁棒方案 → 最优综合
- RGB + IMU + 音频:Traini 风格的完整栈 → 工程天花板
对预算极度有限的 MVP 推荐RGB + 稀疏轨迹:硬件成本不变,但能拿到运动判别性与隐私的双重加分。
本节列出在调研过程中浮现的 5 个开放问题,它们既是当前调研的边界,也是未来研究/工程的入口。
10.1 单目深度估计对动物的精度极限
DEAR 系列方法依赖 MiDaS 生成 depth map,而 MiDaS 在毛茸茸动物上的精度大幅下降。需要系统评估 Depth Anything V2 / Metric3D V2 / UniDepth 等最新单目深度模型在猫狗场景的相对深度精度,并探索在猫狗标注数据上微调的可能性。
10.2 CoTracker3 对非人形的跟踪稳定性
TrAction 的核心依赖是 CoTracker3,但其训练数据以人体为主。猫是四足动物、毛皮纹理复杂、姿态变化大--CoTracker3 在猫身上的轨迹连续性、遮挡恢复能力尚未有公开 benchmark。这是一个零实验成本的开放验证。
10.3 多模态失效的兜底机制
MAGNet 提出了模态缺失自适应权重的概念,但论文场景是有意识地随机 mask 模态。真实宠物场景的失效更复杂:摄像头被猫撞歪(部分遮挡)、夜间完全黑暗(IMU 仍可用)、项圈脱落(IMU 缺失)。需要研究面向真实失效场景的鲁棒性测试协议。
10.4 4D Gaussian Splatting 是否能成为端侧猫狗建模的载体
4DGS 与 Director 系列在动态场景渲染上有了突破,但行为识别应用尚无先例。一个可能的切入点是:用 4DGS 表示猫的形态变化场,从形变场直接提取动作特征。若成功,则能在端侧以极小数据量表达复杂运动。
10.5 多模态融合的端到端训练
目前的晚期融合最实用,但放弃了跨模态深度交互。中期融合效果更好但训练不稳。一个可能的方案是分阶段训练:(1) 各模态独立预训练;(2) 冻结支路;(3) 仅训练融合层。这个 pipeline 在 CLIP / ImageBind 等多模态基础模型上有先例,可以借鉴到端侧场景。
回到本文的核心问题--在端侧宠物行为识别项目下,哪种输入路线最合适--结论必然是分场景的:
推荐路线
- MVP(≤ ¥300 BOM):用 X3D-M / VideoMamba-tiny 做 RGB-only 端侧推理,先验证场景可行性,再叠加 PMTNet 式的部件级精读
- 进阶版(≤ ¥500 BOM):RGB + 单目深度(DEAR 模式)+ SlowFast 双分支,平衡精度与延迟
- 运动敏感场景:RGB + 稀疏轨迹(TrAction 模式),猫的运动行为特别多,互补性最强
- 完整产品栈:RGB 摄像头 + 项圈 IMU + 拾音麦克风,参考 Traini / FitBark 模式做多模态融合
本文提供了 8 种输入模态的全景图与选型决策矩阵。下一篇文章《宠物动作识别(六)》将进入具体工程实施--选择上述推荐路线之一,从硬件 BOM 选定 → 算法适配 → 端到端延迟评估,走通第一个完整的演示流。
参考来源
- Rahmani et al. DEAR: Depth-Enhanced Action Recognition. ECCV 2024 Workshop.
- Sun et al. MAGNet: Multimodal Adaptive Graph Network for Action Recognition. Nature Scientific Reports, 2026.
- Meier et al. TrAction: Action Recognition with Sparse Trajectories. arXiv 2026.06.
- Karaev et al. CoTracker3: Tracking Anything with Pointer-based Samplers. Meta AI.
- Ben-Shabat et al. 3DInAction: Understanding Human Actions in 3D Point Clouds. arXiv 2023.
- POKER: Event-based Action Recognition. CVPR 2026.
- Traini Inc. PEBI: Pet Empathic Behavior Interface. 2025.12 融资新闻.
- Real-time behavior recognition of animal: an IoT-based system design using acceleration data. Multimedia Tools and Applications, 2024.
- Ye et al. SuperAnimal: A Unified Coordinate System for Few-Shot Animal Pose Estimation. Nature Communications, 2024.
- Ranftl et al. Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer. TPAMI 2022 (MiDaS).
- OpenMMLab. MMAction2: Video Understanding Toolbox.