ESC
输入关键词搜索文章
目录

Co-Speech NPR:非真实感角色的语音驱动

当 EMAGE 的泛化能力在动漫角色上崩溃,漫画数据能拯救吗?
论文精读(三十四)· Non-Photorealistic · Manga109 · Gesture · SIGGRAPH 2025
Part 1
非真实感角色的独特挑战

现有的共语音手势生成方法(如 EMAGE, CVPR 2024)都是为真实人类设计的。当目标角色变成动漫风格的大眼睛、夸张比例的 3D 模型时,这些方法面临两个根本性问题:

  1. 手势语义失配:真实人类的手势语料不能直接用于动漫角色——动漫角色的手势更夸张、更符号化(如"竖大拇指"在动漫里可能伴随闪光特效)。
  2. 表情文化差异:动漫有一套独特的表情语言(震惊蓝线、冒汗、脸红、不等号眼),这些在真实人脸上不存在。

Sony 的这篇 SIGGRAPH 2025 Poster #Omine-et-al.-2025 是第一个专门为非真实感 3D 角色设计共语音手势和表情的方法。

Part 2
两条管线:语义手势 + 漫画表情

2.1 语义优先手势生成

核心思路:将对话文本分割为短语,用 SentenceBERT 提取句子嵌入,然后与自建手势数据集中的手势做余弦相似度匹配。

自建对话手势数据集:500 个实例,覆盖 6 大语境分类:

语境示例
问候挥手、鞠躬、点头
情感握拳、双手捂脸
强调指向、拍桌
标志性手势OK 手势、竖大拇指
积极倾听点头、歪头
注视引导视线转移、回头

匹配流程:短语分割 → SentenceBERT 嵌入 → 余弦相似度检索 Top-K → 序列整合 → 时长对齐。当相似度低于阈值时,回退到随机中性手势。

2.2 漫画数据驱动的夸张表情

这是本文最有趣的创新:利用多模态 LLM 从 Manga109 等漫画中自动提取夸张表情数据。

提取流程:漫画页面 → 多模态 LLM 面部区域识别 → 表情类型分类 → 约 130 种情感类别的表情库。提取的表情类型包括动漫特有的符号化表情:

  • 震惊蓝线(额头的平行线条表示震惊)
  • 冒汗滴(太阳穴的汗珠表示紧张)
  • 脸红(面颊的红晕表示害羞/兴奋)
  • 圆眼/星星眼(表示兴奋/崇拜)
  • 不等号眼(>< 表示困扰/疼痛)

表情应用:通过余弦相似度匹配对话文本的情感,从表情库中检索最合适的夸张表情,再通过平滑过渡与唇同步和眨眼整合。

Part 3
User Study:全面碾压 EMAGE

评测设计采用 Likert 量表,评估 5 个维度 × 7 种情绪。报告 "Agree" + "Somewhat Agree" 百分比之和:

维度EMAGEOurs提升
Overall Appeal16%61%+45pp
Text Reflection15%63%+48pp
Visual Match31%66%+35pp
Audio Sync32%80%+48pp
Diversity32%77%+45pp

所有 7 种情绪 × 5 个维度上几乎全面领先。最显著的提升出现在 Fear 情绪的 Audio Sync(48% vs 92%)和 Happy 情绪的 Audio Sync(37% vs 88%)。

Part 4
为什么完全不做客观指标评测

本文最引人深思的评测选择是:完全不做客观指标评测,只进行 User Study。

这个选择背后有合理的方法论逻辑:对于非真实感角色的"整体吸引力"和"视觉匹配度",现有客观指标(FID、FVD、LMD)无法提供有意义的评估——这些指标是为真实人体设计的,对动漫风格角色的大眼、夸张手势、符号化表情完全失效。

这与 THEval 的发现高度一致:即使在真实场景,传统指标也与人类感知不相关。在非真实感场景下,问题只会更严重。

方法论启示:当目标域的视觉特征与指标训练域差异过大时,放弃客观指标、只依赖精心设计的 User Study,可能比强行使用不适用的指标更诚实、更有说服力。

参考来源

  • Omine, T., Kawabata, N., Homma, F. (2025). Co-Speech Gesture and Facial Expression Generation for Non-Photorealistic 3D Characters. SIGGRAPH 2025 Poster. arXiv:2506.16159