ESC
输入关键词搜索文章
目录

卡通与风格化数字人

从跨域生成到评测方法论
系列(十三)· Cartoon · Stylized · Non-Photorealistic · Evaluation · User Study
8+核心代表工作
5主观评测设计拆解
6客观指标失效分析
8THEval 评测维度
3新兴评测方向
系列位置
当数字人走出恐怖谷——卡通与风格化路线的方法论全景

前面十二篇系列文章几乎都围绕一个隐含假设展开:数字人的终极目标是尽可能像真人。但产业里有一条同样活跃、却很少被系统讨论的路线——卡通与风格化数字人。从迪士尼风格的 2D 卡通头像,到动漫风格的 3D 角色,再到手绘质感的非真实感肖像动画,这些工作追求的恰恰不是"逼真",而是"风格化的自然"。

这条路线带来一个根本性的评测难题:如果目标不是"像真人",那 FID 衡量的"生成分布与真实分布的距离"还有意义吗?SyncNet 训练的唇同步判别器能看懂卡通嘴型吗?CSIM 用 ArcFace 提取的身份特征对二次元角色还有效吗?

本文从代表性工作出发,拆解卡通数字人的生成方法、主观测试设计和客观指标适用性,最后给出评测方法论的反思与建议。

Part 1
什么是卡通/风格化数字人

"卡通数字人"并不是一个严格的技术术语。在本系列的语境下,我们用三个层次来界定这个领域:

层次定义代表工作视觉特征
卡通域生成在卡通/动漫图像空间中直接生成 talking headToonTalker、MakeItTalk、GenEAva2D 卡通角色、动漫风格头像
跨域迁移将真实域运动迁移到卡通域,或反向ToonTalker(Real↔Cartoon)、SadTalker真实运动 → 卡通渲染
风格化控制在保持身份的前提下施加视觉风格SVP、ChatAnyone、HunyuanPortrait、CapTalk说话风格迁移、anime 化、手绘质感

还有一个特殊子方向:非真实感 3D 角色(Non-Photorealistic Characters)——以 Sony 2025 年 SIGGRAPH 工作为代表,专门为动漫风格 3D 角色生成共语音手势和夸张表情。这些角色的面部结构(大眼睛、夸张比例)与真实人脸有本质差异,评测方法也需要相应调整。

1.1 为什么需要卡通数字人

三个驱动力:

  • 隐私与匿名性:虚拟主播、匿名播客、企业内部培训——用户希望有一个能说话的"形象",但不想暴露真实面孔。
  • IP 与品牌一致性:品牌吉祥物、游戏 NPC、教育类动画角色需要"活起来",且保持固定的视觉风格。
  • 恐怖谷回避:当数字人用于儿童教育、心理健康辅助等场景时,卡通形象比“几乎像真人但不够像”的形象更容易被接受。

1.2 任务 Taxonomy:卡通数字人要解决什么问题

从“要生成什么”的角度,卡通数字人领域可以划分为四类任务:

任务类型输入输出评测重点代表论文不适用场景
音频驱动卡通 Talking Head卡通/动漫图像 + 音频唇音同步的卡通视频唇同步质量、风格一致性、时序稳定性MakeItTalk、ToonTalker需要全身动作的场景
跨域面部重演源域视频(真人)+ 目标域图像(卡通)目标域风格的重演视频身份保持、运动保真、风格一致性ToonTalker(Real↔Cartoon)无配对训练数据时
风格化表情/手势生成音频/文本 + 角色模型风格化的 3D 动画序列表现力、风格匹配、夸张度合理性Co-Speech NPR、CapTalk实时交互场景
卡通头像数据集构建真实人脸表情数据卡通风格头像集表情覆盖度、身份多样性、平衡性GenEAva视频级动画需求

1.3 技术路线 Taxonomy:用什么方法解决

从“用什么表示和模型”的角度,卡通数字人的技术路线可分为四条:

flowchart TD
  A["卡通数字人技术路线"] --> B["关键点驱动"]
  A --> C["3DMM 运动系数"]
  A --> D["扩散模型"]
  A --> E["Transformer 直接映射"]
  B --> B1["MakeItTalk"]
  B --> B2["ToonTalker"]
  C --> C1["SadTalker"]
  C --> C2["ChatAnyone"]
  D --> D1["GenEAva"]
  D --> D2["HunyuanPortrait"]
  E --> E1["Co-Speech NPR"]
  E --> E2["CapTalk"]
技术路线核心表示适配任务优势限制工程可得性
关键点驱动面部关键点(2D/3D landmarks)音频驱动 2D 卡通生成、跨域重演简单直观,卡通域可定制关键点关键点检测在卡通域不稳定,缺乏标准工具MakeItTalk 开源;ToonTalker 开源
3DMM 运动系数3D Morphable Model 的 pose/expression 参数跨域迁移、风格化控制天然跨域(同一组系数驱动不同渲染器),物理可解释对卡通夸张表情建模能力有限SadTalker 开源;ChatAnyone 开源
扩散模型去噪扩散过程 + 条件控制高质量图像/视频生成、数据集构建生成质量最高,支持多模态条件推理慢,不适合实时场景GenEAva 代码可用;HunyuanPortrait 开源
Transformer 直接映射注意力机制学习输入-输出映射共语音手势/表情生成、文本引导风格化可处理多模态输入,建模长距离依赖训练数据需求大,推理开销较高Co-Speech NPR 未开源;CapTalk 开源
Part 2
代表性工作:从 MakeItTalk 到 Co-Speech NPR

以下按时间线梳理卡通/风格化数字人的核心工作。重点关注每篇论文如何处理"卡通域"的特殊挑战。

2.1 MakeItTalk(SIGGRAPH Asia 2020)——统一框架的先驱

MakeItTalk 是第一个在统一框架内同时处理真实人脸和非真实感风格的音频驱动 talking head 方法 #Zhou-et-al.-2020。其核心思路是:

  1. 从音频中解耦内容信息(说了什么)和说话人信息(怎么说的);
  2. 用面部关键点(facial landmarks)作为中间表示,驱动图像合成;
  3. 为非真实感图像设计了专门的关键点驱动合成方法,区别于真实人脸的渲染路径。

支持的风格范围极广:艺术绘画、素描、2D 卡通角色、日本漫画、风格化漫画。但局限也很明显——卡通域的关键点检测比真实人脸更具挑战性,缺乏标准工具,面部变形容易产生伪影。

2.2 SadTalker(CVPR 2023)——3DMM 作为跨域桥梁

SadTalker 的全称本身就是 "Stylized Audio-Driven Talking-head"#Zhang-et-al.-2023。它通过 3DMM(3D Morphable Model)的运动系数作为中间表示,ExpNet 学习表情、PoseVAE 生成头部运动,再映射到无监督 3D 关键点空间。

虽然主实验仅在真实人脸上进行,但论文明确指出方法可扩展到 2D Cartoon animation(类似 MakeItTalk 管线)。3DMM 系数作为"运动语言",天然具有跨域迁移的潜力——同一组表情和姿态参数可以驱动不同的渲染器。

指标Wav2LipMakeItTalkSadTalker
LSE-C ↑8.2115.1107.290
FID ↓21.72528.24322.057
CPBD ↑0.3680.2830.335
运动多样性 ↑0.2120.278

2.3 ToonTalker(ICCV 2023)——首个跨域卡通面部重演 · 精读三十三

ToonTalker 是目前最纯粹的"卡通数字人"工作 #Gong-et-al.-2023。它基于 Transformer 架构,使用域特异和域共享组件将真实域和卡通域的运动对齐到共享规范运动空间,通过类比约束(Analogy Constraint)解决无配对训练数据问题。

ToonTalker 三阶段架构:特征提取、规范空间变换、图像生成
图 4:ToonTalker 框架——域特异组件(外观/动作编码器、生成器)+ 域共享 Query Transformer,通过规范空间中的向量加法实现跨域运动迁移(来源:ToonTalker, Fig. 3)

关键设计:自建 Disney 风格卡通视频数据集(344 个视频,约 47K 帧),双向跨域重演(Real→Cartoon 和 Cartoon→Real)。

方向方法FID ↓CPBD ↑
Real→CartoonFOMM30.3690.0436
LIA30.4420.0493
DaGAN29.7790.0735
ToonTalker28.5310.0840
Cartoon→RealDaGAN(次优)47.2220.0985
ToonTalker31.8520.1230

精读三十三补充发现 #Gong-et-al.-2023:架构消融实验揭示了一个令人惊讶的事实——将 Query Transformer 替换为 MLP 导致 Real→Cartoon FID 从 28.5 灾难性恶化至 116.7(4 倍以上),证明 Transformer 在跨域动作对齐中不可替代。此外,类比约束损失权重 \(\lambda_m\) 在两个跨域方向之间存在根本性张力:\(\lambda_m = 0\) 时 Real→Cartoon 最优但 Cartoon→Real 最差,\(\lambda_m = 100\) 时反向。这揭示了一个评测方法论上的重要洞察:跨域评测的两个方向可能受不同机制主导,单一超参数设置无法同时优化双向表现。

2.4 GenEAva(2025)——首个细粒度表情卡通头像数据集 · 精读三十五

GenEAva 解决的是静态图像生成问题,但为卡通数字人的评测提供了重要的数据基础设施 #Yu-et-al.-2025。其流程是:在 SDXL 上用 135 类表情数据集(Emo135)微调 → 生成高质量真实人脸表情 → 通过 DCTNet 转换为 3D cartoon 风格。

最终产出 GenEAva 1.0 数据集:13,230 张卡通头像,135 种表情,平衡性别、7 个种族群体和年龄分布。这是第一个专门为细粒度表情设计的卡通头像数据集。

2.5 Co-Speech NPR(SIGGRAPH 2025)——非真实感角色的共语音生成 · 精读三十四

Sony 的这项工作是目前唯一专门为非真实感 3D 角色设计共语音手势和表情的方法 #Omine-et-al.-2025。两个核心创新:

  • 语义优先手势生成:通过句子嵌入匹配对话短语到自建手势数据集(500 个实例);
  • 漫画数据驱动表情:利用多模态 LLM 从 Manga109 等漫画中自动提取约 130 种情感类别的夸张表情(震惊蓝线、冒汗、脸红、圆眼等动漫特有表情)。

这篇工作有一个值得注意的评测选择:完全不做客观指标评测,只进行 User Study。作者的判断是:对于动漫风格角色的“整体吸引力”和“视觉匹配度”,现有客观指标无法提供有意义的评估。

Co-Speech NPR 的夸张表情类型
图 1:Co-Speech NPR 针对非真实感角色设计的五类夸张表情(震惊蓝线、冒汗、脸红、圆眼、不等式眼),这些表情在真实域无对应物(来源:Co-Speech NPR, Fig. 2)
Co-Speech NPR vs EMAGE 用户研究对比
图 2:User Study 中 EMAGE(左)与 Co-Speech NPR(右)在三段对话中的对比,右侧在表情丰富度和手势语义匹配上显著优于左侧(来源:Co-Speech NPR, Fig. 1)

2.6 其他重要工作

工作年份风格化类型核心贡献
SVP #Tan-et-al.-20242024说话风格首个建模内在说话风格的扩散 talking head,风格聚类强度 8.38
ChatAnyone #Qi-et-al.-20252025说话风格 + 表情强度实时 30fps 上半身生成,支持参考视频风格迁移
HunyuanPortrait #Xu-et-al.-20252025Anime 风格隐式条件控制 + 扩散模型,身份-运动解耦
CapTalk #Chu-et-al.-2025(精读三十七)2025文本引导 3D 风格化24,441 clips 数据集 + 文本引导风格化 3D 头部动画
Style Transfer 2D TH #Pham-et-al.-20242024可学习风格参考给定风格参考帧生成风格化 2D talking head

2.7 方法矩阵:系统对比

以下矩阵从 7 个维度系统对比卡通/风格化数字人的代表方法:

方法核心表示驱动信号训练数据输出形式实时性可控性主要评测指标
MakeItTalk2D 关键点音频(内容+说话人解耦)VoxCeleb2 + 风格化图像2D 卡通视频非实时低(仅音频驱动)LSE-C, FID, User Study
SadTalker3DMM 运动系数音频VoxCeleb22D 视频(可扩展卡通)非实时中(3DMM 系数可控)LSE-C, FID, CPBD
ToonTalkerTransformer + 共享运动空间视频(跨域重演)Disney 卡通数据集(344 视频)双向跨域视频非实时中(源视频控制)FID, CPBD, User Study
ChatAnyone3DMM + 扩散模型音频 + 参考视频MEAD + VoxCeleb2上半身视频实时 30fps高(风格参考视频)FID, 风格聚类, User Study
GenEAvaSDXL + DCTNet表情标签Emo135(自建)卡通头像图像非实时高(135 类表情)AMT 身份/表情保持率
Co-Speech NPRTransformer + 漫画数据音频 + 语义嵌入自建手势库 + Manga1093D NPR 角色动画非实时高(情绪类别控制)仅 User Study(5 维 Likert)
HunyuanPortrait扩散模型 + 隐式条件视频(运动迁移)VoxCeleb2 + AnimeGAN 转换风格化视频非实时中(隐式控制)FID, SSIM, User Study
CapTalk多尺度 Codec + T5 文本条件音频 + 文本CapTalk 数据集(24,441 clips)风格化 3D 头部动画非实时高(文本引导风格)LVE, FFD, User Study (2AFC)

几个值得注意的发现:实时性是目前只有 ChatAnyone 达到的(30fps),其余方法均为离线生成;可控性从“仅音频驱动”到“文本引导风格化”跨度极大;评测指标的碎片化程度严重——没有两个方法使用完全相同的指标组合。

2.8 发展时间线:从探索到评测反思

卡通数字人领域的发展可以分为三个阶段:

2020–2022
探索期:“能不能做”——MakeItTalk(2020)首次证明统一框架可同时处理真实人脸和非真实感风格,社区开始关注卡通域的 talking head 生成。核心共识:关键点可以作为中间表示桥接真实域和卡通域。但缺乏专门的卡通数据集和评测标准。
2023–2024
跨域期:“怎么迁移”——SadTalker(2023)证明 3DMM 运动系数可作跨域桥梁;ToonTalker(2023)首次实现双向跨域卡通重演并自建 Disney 数据集;SVP(2024)和 Style Transfer 2D TH(2024)将风格化控制引入讨论。核心共识:运动表示与视觉渲染可以解耦,同一运动可驱动不同风格。
2025–
评测反思期:“怎么评”——THEval(CVPR 2025)用统计证据证明传统指标与人类偏好不显著相关;GenEAva 构建首个细粒度卡通表情数据集;Co-Speech NPR 完全放弃客观指标只做 User Study;CapTalk 引入文本引导的风格化控制。核心共识:卡通域需要专门的评测方法论,传统指标不能直接迁移。
Part 3
主观测试设计:User Study 的方法论拆解

卡通数字人领域有一个反直觉的现象:几乎所有核心工作都重度依赖 User Study,而非客观指标。这不是因为作者们偏好主观评测,而是因为——如 Part 4 将详细分析的——客观指标在风格化场景下大面积失效。

3.1 ToonTalker:20 人四选一偏好测试

ToonTalker 的 User Study 设计相对简洁 #Gong-et-al.-2023

设计要素具体设置
被试数量20 人
任务形式20 道选择题,从 4 个竞争方法 + ToonTalker 生成的卡通视频中选最佳
量表类型单选(Best-of-4)
结果ToonTalker 72.75% 被选,LIA 13.75%,DaGAN 9%,FOMM 4.5%

优势是简洁直观,劣势是缺少多维度评估(只问"整体最佳",不拆画质/同步/自然度)。

3.2 Co-Speech NPR:Likert 量表五维评估

Sony 的非真实感角色工作采用了更系统的评测设计 #Omine-et-al.-2025

设计要素具体设置
对比方法EMAGE(CVPR 2024)
评测维度Overall Appeal、Text Reflection、Visual Match、Audio Sync、Diversity
情绪覆盖7 种:Angry、Disgusted、Contempt、Fear、Happy、Sad、Surprised
量表类型Likert 量表,报告 "Agree" + "Somewhat Agree" 百分比之和

结果差距极大:Overall Appeal 维度,EMAGE 仅 16%,本文 61%(+45pp)。最显著提升出现在 Fear 情绪的 Audio Sync(48% vs 92%)。

3.3 CapTalk:13 人四维成对比较 · 精读三十七

CapTalk 的 User Study 是风格化 3D talking head 领域目前最细粒度的设计 #Chu-et-al.-2025

设计要素具体设置
被试数量13 人
每人任务量132 个问题(38 对对比试验)
评测维度Sync(唇同步)、Style(风格一致性)、Expression(表情一致性)、Pose(头部姿态)
量表类型成对比较(2AFC),随机化呈现顺序

CapTalk vs FaceFormer:Sync 63%、Style 75%、Expression 73%。vs SelfTalk 差距最大:Sync 92%、Style 96%、Expression 98%。

3.4 GenEAva:AMT 众包身份/表情双维验证 · 精读三十五

GenEAva 在 Amazon Mechanical Turk 上做了卡通头像的身份和表情保持验证 #Yu-et-al.-2025

设计要素具体设置
平台Amazon Mechanical Turk (AMT)
被试数9 名 Turkers / HIT
评测维度身份保持 & 表情保持(二分类:保持/未保持)
质量控制每人 15 个示例 + 1 个测试题(明显不同身份),无效 HIT 丢弃
结果表情保持 96%,身份保持 93%

3.5 THEval:成对比较 + Krippendorff α 一致性 · 精读三十二

THEval 虽然主要针对真实 talking head,但其 User Study 方法论对整个领域有重要参考价值 #Quignon-et-al.-2025

设计要素具体设置
任务形式成对比较(Pairwise),两视频并排播放,选更真实的
每人视频对数153 对(覆盖所有方法对 + 真实视频)
偏差控制位置随机化 + 内容随机化
一致性度量Krippendorff's α = 0.74(substantial agreement)
统计方法Spearman 秩相关 + Bootstrap (n=10,000) 95% CI

3.6 主观测试设计要点总结

论文被试数维度数量表类型统计方法适用场景
ToonTalker201(整体)Best-of-4偏好率快速方法对比
Co-Speech NPR未报5 × 7 情绪LikertAgree% 汇总多维度细粒度评估
CapTalk1342AFC偏好率 + 随机化风格化质量对比
GenEAva9/HIT2二分类批准率静态图像验证
THEval未报1(整体)PairwiseSpearman + Bootstrap指标-人类对齐验证
4DHumanQA48(24有效)1(退化程度)DSIS 5 级 MOSANOVA + SROCC3D 动画质量评估
VIP-QA251 + 失真标注MOS (Z-score)SRCC / PLCC大规模 Talking Head QA
被试数量的隐含门槛:卡通/风格化领域的 User Study 被试数普遍偏少(9-25 人),远低于计算机图形学推荐的 30+ 人。THEval 和 4DHumanQA 虽然没有明确报告被试总数,但通过一致性系数(α = 0.74)和 ITU 标准化流程(24 人/刺激)间接保证了可信度。
Part 4
客观指标的失效分析:为什么 FID 看不懂卡通

THEval #Quignon-et-al.-2025 提供了目前最直接的证据:传统指标与人类偏好的相关性在统计上不显著。以下 Spearman 秩相关系数来自 17 个 talking head 模型的 benchmark:

4.1 传统指标与人类评分的相关性

指标Spearman ρp-value95% CI结论
LSE-C (SyncNet Confidence)-0.1640.530[-0.613, 0.388]不显著,甚至为负
LSE-D (SyncNet Distance)-0.2690.297[-0.675, 0.282]不显著
FVD0.2890.260[-0.321, 0.782]不显著
FID0.2100.416[-0.344, 0.710]不显著
LMD-F0.2310.389[-0.392, 0.775]不显著
LMD-L0.2270.399[-0.389, 0.759]不显著

所有 p 值均远大于 0.05,没有一个传统指标与人类评分的相关性达到统计显著。

4.2 六大指标的具体失效模式

FID:依赖 Inception-v3 提取特征,假设特征服从高斯分布。问题在于:(1) Inception 在 ImageNet 上训练,对卡通/动漫风格的特征提取不可靠;(2) 在有限样本上有偏;(3) 用于视频时只评估独立帧,忽略时序一致性。在卡通场景下,FID 衡量的是"生成分布与真实分布的距离"——但卡通图像本来就不属于"真实分布"。

FVD:虽然使用了视频网络,但仍偏向单帧质量评估。对卡通视频的时序连贯性评估能力有限。

SyncNet(LSE-C / LSE-D):这可能是问题最严重的指标。SyncNet 在真实人脸上训练,对嘴部裁剪、图像质量、亮度等因素高度敏感。THEval 发现音频编码格式(mp4a vs mpga)变化可导致 LSE-D 差异高达 1.2。更讽刺的是,Wav2Lip 以 SyncNet 为判别器训练,算法分数最高但在 User Study 中最不被选中

CSIM:使用 ArcFace 提取身份特征,计算余弦相似度。ArcFace 在真实人脸上训练,对二次元角色的大眼睛、夸张比例等非真实感特征无法有效编码。

LMD(Landmark Distance):直接与 Ground Truth 对比关键点位距离。问题在于:头部运动和表情的微小差异会被过度惩罚,但人类评估者可能完全注意不到。卡通域的关键点定义本身就与真实域不同。

SSIM / PSNR:需要图像完美对齐,关注局部结构而非全局感知质量。对风格化图像的评估几乎无意义。

4.3 卡通场景的额外挑战

除了上述通用失效模式,卡通/风格化场景还有三个独特挑战:

  1. 关键点检测的域偏移:标准面部关键点检测器(如 dlib、MediaPipe)在卡通面部上表现不稳定。ToonTalker 自建了卡通数据集但未报告关键点检测精度;MakeItTalk 明确承认卡通域关键点检测是瓶颈。
  2. "风格一致性"的度量缺失:一个卡通 talking head 需要在所有帧中保持相同的视觉风格(线条粗细、色彩饱和度、阴影风格),但现有指标不衡量这一点。FaceIt 提出的 StyleLoss 是目前唯一的尝试。
  3. 夸张表情的"正确性"标准:动漫角色的惊讶表情可能包括眼睛放大 3 倍、嘴巴变成 "O" 形等非物理变形。用什么标准判断这种夸张是否"正确"?Co-Speech NPR 的回答是:只能靠人类判断。
Part 5
THEval 八维评测框架:一个可能的方向

THEval(CVPR 2025 Findings)#Quignon-et-al.-2025 提出了一套与人类评分高度对齐的评测框架,Final Score 的 Spearman ρ 达到 0.870(p < 0.0001)。虽然它主要针对真实 talking head,但其设计思路对卡通场景有重要启示。

THEval 评测框架总览
图 3:THEval 评测框架——基于 Quality / Naturalness / Sync 三个维度、8 个指标的无权重平均,Final Score 与人类评分的 Spearman ρ 达到 0.870(来源:THEval, Fig. 1)

5.1 三个维度 × 八个指标 · 精读三十二

维度指标计算方式ρ(与人类评分)卡通适用性
QualityGlobal AestheticsTOPIQ 逐帧 IAA 评分均值0.544*部分适用(需卡通美学适配)
Mouth Quality嘴部区域 MUSIQ IQA 评分0.765***受限(卡通嘴部检测不稳定)
Face Quality全脸 TOPIQ IQA 评分0.699**部分适用
NaturalnessLip Dynamics唇部关键点标准差均值0.414受限(需卡通关键点)
Head Motion Dynamicspitch/yaw/roll 标准差 × 差分方差0.763***较适用(3DMM 可跨域)
Eyebrow Dynamics眉-眼距离标准差0.527*受限(卡通眉毛风格多样)
SyncSilent Lip Stability静音段嘴张开度 MAD0.484*适用(与风格无关)
Lip-Sync归一化嘴张开度与音频 RMS 平均绝对差0.404部分适用

Final Score 计算:每个指标先相对 Ground Truth 归一化 \(s = 1 - \frac{|Model - GT|}{GT}\),然后对 8 个归一化指标取无权重平均。

5.2 对卡通场景的适配方向

THEval 的核心洞察是:不比较生成图像和真实图像的"分布距离",而是比较生成视频和真实视频在运动特征统计量上的对齐程度。这个思路天然适合卡通场景——只要把关键点检测器替换为卡通域检测器,大部分指标就可以直接使用。

三个最有可能直接迁移的指标:

  • Head Motion Dynamics(ρ = 0.763):基于 3DMM 的 pitch/yaw/roll,卡通域可通过 ToonTalker 的共享运动空间获取。
  • Silent Lip Stability(ρ = 0.484):静音段嘴部稳定性,与视觉风格无关。
  • Global Aesthetics(ρ = 0.544):需要针对卡通美学训练专门的 IAA 模型。
THEval 的局限:评测数据集包含 5,011 个视频,覆盖 6 种语言,但全部是真实 talking head。卡通适配需要构建专门的卡通评测数据集,这是目前尚未有人做的工作。
Part 6
新兴评测方向:为风格化而生的指标

6.1 StyleLoss(FaceIt, CGF 2025)

FaceIt 提出了目前唯一专门衡量风格保持能力的客观指标 #FaceIt-2025。基于 VGG 特征图的 Gram Matrix 差异(经典 Gatys 风格损失),计算生成帧与参考风格图像之间的风格距离。

方法StyleLoss ↓
FaceBlit0.01774
Act-One0.01318

StyleLoss 的价值在于:它不衡量"像不像真人",而是衡量"像不像参考风格"——这正是卡通数字人最需要的评测维度之一。局限是 Gram Matrix 只捕获纹理统计,对线条风格、色彩方案等高层风格特征的区分能力有限。

6.2 FSCD(VIP-QA, ICCV 2025)

VIP-QA("Who is a Better Talker")#Zhou-et-al.-2025 构建了 THQA-10K 数据集:10,457 个 AI 生成的 talking head,25 名被试产生 261,425 个主观评分,并设计了 FSCD 客观评估方法:

  • First Frame:首帧质量
  • Y-T Slice:时空切片捕获时序特征
  • Tone-lip Consistency:LSE-C
  • Tone-lip Detection:LSE-D

FSCD 在 THQA-10K 上达到 SRCC = 0.8066、PLCC = 0.8322。虽然数据集包含多种角色材质(含风格化角色),但主要针对 T2I + Talker 管线,纯卡通场景的适用性尚需验证。

6.3 4DHumanQA(2025)——感知验证的 3D 动画评估

4DHumanQA #Rekik-et-al.-2025(精读三十六)构建了 4DHumanPercept 数据集:250 个 3D 人体动画 + 48 名被试的 MOS 评分。使用 ITU 标准的 DSIS(Double Stimulus Impairment Scale)5 级量表。关键发现:

  • 单一客观特征与 MOS 的 Spearman 相关系数仅为 0.144-0.436
  • 组合 7 个特征的线性回归模型在测试集上 SROCC = 0.961
  • 自动评估指标无法有效替代主观用户研究。

这为卡通 3D 角色的评测提供了方法论参考:单指标不可靠,需要组合特征 + 人类验证。

6.4 "Wild West" 评测反思(CGF 2025)

Utrecht 大学的这篇工作 #Haque-et-al.-2025 识别了语音驱动 3D 面部动画评测的五大问题:

  1. 无标准化评测方法:研究者之间对评测方法没有共识;
  2. 实验设置不一致:不同论文使用不同数据集、指标、设置,跨论文比较困难;
  3. A/B 测试的局限性:感知研究通常只关注 2 个常见指标;
  4. 主观与客观指标脱节:感知评分与客观指标缺乏相关性;
  5. 模型排名不泛化:在不同数据集上的排名不一致。

这五个问题在卡通/风格化场景下更加严重——不仅跨论文比较困难,连同一篇论文内的卡通实验和真实实验都可能使用完全不同的评测标准。

Part 7
评测方法论反思:卡通数字人应该怎么评

综合以上分析,卡通/风格化数字人的评测需要一个不同于真实 talking head 的方法论框架。

7.1 评测维度的重新设计

评测维度真实场景关注卡通场景应关注推荐指标
视觉质量像不像真人风格是否一致、是否有伪影StyleLoss + 卡通域 IQA
运动自然度头部/嘴部运动像不像真人运动是否符合角色风格(如卡通的夸张 vs 动漫的克制)Head Motion Dynamics + User Study
唇音同步嘴型是否与音频对齐卡通嘴型变化是否与音频节奏对齐Silent Lip Stability + Lip-Sync(THEval)
身份/风格保持是否仍像同一个人是否仍保持同一卡通角色的视觉特征StyleLoss + DINO 相似度 + User Study
时序稳定性长视频是否漂移风格是否随时间退化(线条变模糊、颜色偏移)Temporal Style Consistency(新指标)

7.2 最小可行评测协议

基于现有证据,一个卡通 talking head 的最小可行评测应包含:

  1. 客观指标
    • StyleLoss(风格保持)
    • Head Motion Dynamics(运动自然度,基于 3DMM 或卡通关键点)
    • Silent Lip Stability(唇部稳定性)
    • DINO 相似度(结构保持,对风格变化更鲁棒 than ArcFace)
  2. 主观评测
    • 至少 20 名被试
    • 至少 3 个维度(整体吸引力、唇音同步、风格一致性)
    • 成对比较(2AFC)+ Likert 量表结合
    • 报告评估者间一致性(Krippendorff's α 或 Fleiss' κ)
  3. 定性分析
    • 至少 5 个典型成功案例 + 5 个失败案例的可视化
    • 极端表情/姿态下的表现分析

7.3 实验配置披露现状

以下表格梳理代表工作在实验配置方面的披露情况,以便跨论文比较和复现:

工作训练数据集评测数据集硬件配置训练配置推理配置
MakeItTalkVoxCeleb2(已披露)HDTF + 自建风格集(已披露)未报告未报告未报告
SadTalkerVoxCeleb2(已披露)HDTF + MEAD(已披露)4×V100(已披露)学习率/epoch(已披露)未报告
ToonTalkerDisney 数据集 344 视频(自建,已披露)自建测试集(已披露)未报告两阶段 450K+10K iter,\(\lambda_m=20\)(已披露)未报告
ChatAnyoneMEAD + VoxCeleb2(已披露)MEAD 测试集(已披露)8×A100(已披露)两阶段训练(已披露)单卡 30fps(已披露)
GenEAvaEmo135(自建,已披露)AMT 众包验证(已披露)未报告SDXL 微调配置(部分披露)未报告
Co-Speech NPR自建手势库 500 实例 + Manga109(已披露)仅 User Study(已披露)未报告未报告未报告
CapTalkCapTalk 数据集 24,441 clips / 200.8h(自建,已披露)LRS3 + VoxCeleb2 测试集(已披露)8×A100(已披露)学习率/batch/epoch(已披露)未报告
披露缺口:硬件配置和推理配置是披露最薄弱的环节。对于卡通数字人,推理配置尤为重要——卡通渲染通常比真实渲染更轻量,但关键点检测和风格迁移可能增加开销。

7.4 待解决的基础设施问题

  • 卡通域关键点检测器:StylizedFacePoint(ACM 2024)是目前唯一的专门工作,但覆盖面有限。
  • 卡通评测数据集:GenEAva 1.0 是第一个卡通头像数据集,但只覆盖静态图像。需要卡通 talking head 视频数据集 + 人类 MOS 标注。
  • 卡通域 IAA 模型:TOPIQ 等图像美学评估模型在 ImageNet 上训练,对卡通美学的理解有限。
Part 8
开放问题与未来方向
  1. 跨风格统一评测基准:能否设计一个同时适用于真实、卡通、动漫、手绘等多种风格的评测框架?THEval 的运动特征统计量思路是一个起点,但需要跨域关键点检测和风格适配。
  2. 风格化程度的连续评估:从"轻微风格化"到"高度抽象卡通",评测标准如何平滑过渡?是否存在一个"风格化程度"的度量,使得指标可以在不同风格化级别之间比较?
  3. 卡通数字人的实时性:ChatAnyone 在真实场景达到 30fps,但卡通域的实时生成尚缺乏 benchmark。卡通渲染通常比真实渲染更轻量,但关键点检测和风格迁移可能增加开销。
  4. 多模态卡通数字人:Co-Speech NPR 只做手势和表情,不涉及视频生成。能否在统一的卡通数字人框架中同时生成面部动画、身体手势和夸张表情?
  5. 评测指标的"风格感知"改造:FID 使用 Inception-v3 特征,能否替换为在卡通/动漫数据集上训练的视觉编码器(如 CLIP 的 anime 微调版本)来计算"卡通域 FID"?
  6. 用户研究的标准化:卡通数字人领域的 User Study 设计差异极大(被试数从 9 到 48,量表从二分类到 5 级 Likert),需要社区共识建立标准化评测协议。
  7. 恐怖谷效应与卡通数字人的关系:在什么条件下,卡通数字人的"不完美"反而增加了吸引力?这对评测指标的设计意味着什么?

参考来源

  • Zhou, Y. et al. (2020). MakeItTalk: Speaker-Aware Talking-Head Animation. SIGGRAPH Asia 2020, ACM TOG. arXiv:2004.12992
  • Zhang, W. et al. (2023). SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation. CVPR 2023. arXiv:2211.12194 · 精读 →
  • Gong, Y. et al. (2023). ToonTalker: Cross-Domain Face Reenactment. ICCV 2023. arXiv:2308.12866 · 精读 →
  • Pham, T.T. et al. (2024). Style Transfer for 2D Talking Head Generation. CVPR 2024 Workshop on GCV. arXiv:2403.09089
  • Tan, W. et al. (2024). SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model. arXiv:2409.03270
  • Yu, H. et al. (2025). GenEAva: Generating Cartoon Avatars with Fine-Grained Facial Expressions from Realistic Diffusion-based Faces. arXiv:2504.07945 · 精读 →
  • Qi, J. et al. (2025). ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model. arXiv:2503.21144
  • Omine, T. et al. (2025). Co-Speech Gesture and Facial Expression Generation for Non-Photorealistic 3D Characters. SIGGRAPH 2025 Poster. arXiv:2506.16159 · 精读 →
  • Chu, X. et al. (2025). CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation. arXiv:2605.29316 · 精读 →
  • Quignon, N. et al. (2025). THEval. Evaluation Framework for Talking Head Video Generation. CVPR 2025 Findings. arXiv:2511.04520 · 精读 →
  • Zhou, Y. et al. (2025). Who is a Better Talker: Subjective and Objective Quality Assessment. ICCV 2025. arXiv:2503.17428
  • Rekik, R. et al. (2025). 4DHumanQA: Quality Assessment of 3D Human Animation. arXiv:2505.23301 · 精读 →
  • Haque, K.I. et al. (2025). Wild West of Evaluating Speech-Driven 3D Facial Animation. Computer Graphics Forum. arXiv:2503.08590
  • Xu, Z. et al. (2025). HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation. CVPR 2025. arXiv:2503.18860
  • FaceIt: Real-Time On-Device Identity-Preserving Portrait Animation. Computer Graphics Forum, 2025. arXiv:2504.14988