Co-Speech NPR:非真实感角色的语音驱动
现有的共语音手势生成方法(如 EMAGE, CVPR 2024)都是为真实人类设计的。当目标角色变成动漫风格的大眼睛、夸张比例的 3D 模型时,这些方法面临两个根本性问题:
- 手势语义失配:真实人类的手势语料不能直接用于动漫角色——动漫角色的手势更夸张、更符号化(如"竖大拇指"在动漫里可能伴随闪光特效)。
- 表情文化差异:动漫有一套独特的表情语言(震惊蓝线、冒汗、脸红、不等号眼),这些在真实人脸上不存在。
Sony 的这篇 SIGGRAPH 2025 Poster #Omine-et-al.-2025 是第一个专门为非真实感 3D 角色设计共语音手势和表情的方法。
2.1 语义优先手势生成
核心思路:将对话文本分割为短语,用 SentenceBERT 提取句子嵌入,然后与自建手势数据集中的手势做余弦相似度匹配。
自建对话手势数据集:500 个实例,覆盖 6 大语境分类:
| 语境 | 示例 |
|---|---|
| 问候 | 挥手、鞠躬、点头 |
| 情感 | 握拳、双手捂脸 |
| 强调 | 指向、拍桌 |
| 标志性手势 | OK 手势、竖大拇指 |
| 积极倾听 | 点头、歪头 |
| 注视引导 | 视线转移、回头 |
匹配流程:短语分割 → SentenceBERT 嵌入 → 余弦相似度检索 Top-K → 序列整合 → 时长对齐。当相似度低于阈值时,回退到随机中性手势。
2.2 漫画数据驱动的夸张表情
这是本文最有趣的创新:利用多模态 LLM 从 Manga109 等漫画中自动提取夸张表情数据。
提取流程:漫画页面 → 多模态 LLM 面部区域识别 → 表情类型分类 → 约 130 种情感类别的表情库。提取的表情类型包括动漫特有的符号化表情:
- 震惊蓝线(额头的平行线条表示震惊)
- 冒汗滴(太阳穴的汗珠表示紧张)
- 脸红(面颊的红晕表示害羞/兴奋)
- 圆眼/星星眼(表示兴奋/崇拜)
- 不等号眼(>< 表示困扰/疼痛)
表情应用:通过余弦相似度匹配对话文本的情感,从表情库中检索最合适的夸张表情,再通过平滑过渡与唇同步和眨眼整合。
评测设计采用 Likert 量表,评估 5 个维度 × 7 种情绪。报告 "Agree" + "Somewhat Agree" 百分比之和:
| 维度 | EMAGE | Ours | 提升 |
|---|---|---|---|
| Overall Appeal | 16% | 61% | +45pp |
| Text Reflection | 15% | 63% | +48pp |
| Visual Match | 31% | 66% | +35pp |
| Audio Sync | 32% | 80% | +48pp |
| Diversity | 32% | 77% | +45pp |
所有 7 种情绪 × 5 个维度上几乎全面领先。最显著的提升出现在 Fear 情绪的 Audio Sync(48% vs 92%)和 Happy 情绪的 Audio Sync(37% vs 88%)。
本文最引人深思的评测选择是:完全不做客观指标评测,只进行 User Study。
这个选择背后有合理的方法论逻辑:对于非真实感角色的"整体吸引力"和"视觉匹配度",现有客观指标(FID、FVD、LMD)无法提供有意义的评估——这些指标是为真实人体设计的,对动漫风格角色的大眼、夸张手势、符号化表情完全失效。
这与 THEval 的发现高度一致:即使在真实场景,传统指标也与人类感知不相关。在非真实感场景下,问题只会更严重。
参考来源
- Omine, T., Kawabata, N., Homma, F. (2025). Co-Speech Gesture and Facial Expression Generation for Non-Photorealistic 3D Characters. SIGGRAPH 2025 Poster. arXiv:2506.16159