ToonTalker:跨域卡通重演
让卡通角色"活起来"的核心挑战是:卡通视频数据稀缺且难以标注。真实人脸有丰富的数据集(VoxCeleb 有 171K 视频 #Gong-et-al.-2023,MEAD、HDTF 规模也在万级以上),但卡通域的数据通常是无配对、无标注的。现实中不可能找到"同一角色做同一表情"的配对数据,更不存在卡通人脸的 3DMM 参数标注。
ToonTalker #Gong-et-al.-2023 来自清华深研院、腾讯 AI Lab 和蚂蚁集团,发表于 ICCV 2023。它提出了一种优雅的解决方案:通过共享的规范运动空间(Canonical Motion Space)和类比约束(Analogy Constraint),在无配对数据条件下实现真实域和卡通域的双向运动迁移。
1.1 与已有路线的核心区别
在 ToonTalker 之前,卡通域的 talking head 方法大致有三条路线:
- 关键点驱动(FOMM #Siarohin-et-al.-2020、LIA #Wang-et-al.-2022、DaGAN #Wang-et-al.-2023):这些方法本身不支持跨域,只能在卡通数据上微调,但微调后跨域泛化能力有限
- 3DMM 配对数据(AnimeCeleb #Liu-et-al.-2022):依赖卡通 3DMM 参数标注(20D 向量),虽然有效但数据获取成本极高,且 20D 参数无法捕捉精细表情
- 角度一致性(MAA #Xu-et-al.-2022):仅约束头部角度一致,无法捕捉表情级变化
ToonTalker 的独特之处在于:不依赖配对数据、不依赖 3DMM、不预设动作表示,而是让模型自己学习一个跨域共享的规范运动空间,通过类比约束保证跨域动作语义的一致性。
这篇论文是数字人系列中第一篇以卡通/风格化为核心对象的精读,也是系列(十三)卡通评测专题 #tangwen-2026-cartoon-eval 的上游工作之一。
2.1 架构总览
ToonTalker 的框架分为三个功能模块:
- 特征提取:外观编码器 \(E_a\) 提取源图像的多尺度空间特征 \(S = \{S^i\}_{i=1}^N\),动作编码器 \(E_m\) 从源图像和驱动图像中提取动作描述符 \(F_s, F_d \in \mathbb{R}^{512}\)
- 规范空间变换:Source Query Transformer \(T_{s\to r}\) 和 Driving Query Transformer \(T_{r\to d}\) 将不同域的动作描述符投射到共享的规范运动空间,运动迁移通过向量加法实现:\(w_{s \to d} = w_{s \to r} + w_{r \to d}\)
- 图像生成:Backward Transformer \(T_B\) 将编辑后的运动码投射回源域,渐进式生成器 \(G\) 逐层扭曲和细化特征图
2.2 域特异 vs 域共享的设计哲学
| 组件 | 数量 | 域属性 | 作用 |
|---|---|---|---|
| Appearance Encoder \(E_a\) | ×2 | 域特异 | 6 层 ResBlock,提取多尺度空间特征 |
| Motion Encoder \(E_m\) | ×2 | 域特异 | 7 层 ResBlock + 4×4 Conv → 512D 动作描述符 |
| Motion Code Base \(p\) | ×2 | 域特异 | \(K=20\) 个可学习嵌入,\(p^k \in \mathbb{R}^{512}\) |
| Backward Transformer \(T_B\) | ×2 | 域特异 | 3 层 Transformer,投射回源域 |
| Generator \(G\) | ×2 | 域特异 | 6 层 StyleConv + SFT 细化 |
| Discriminator \(D\) | ×2 | 域特异 | 对抗训练保证生成质量 |
| Source Query Transformer | ×1 | 域共享 | 投射到规范空间 |
| Driving Query Transformer | ×1 | 域共享 | 投射到规范空间 |
核心设计思路:域特异组件负责"各说各话"(提取各域独有的外观和动作),域共享组件负责"翻译对齐"(确保不同域的运动在同一个语义空间中可比)。两个 Query Transformer 共享参数 #Gong-et-al.-2023,这是跨域对齐的关键——因为参数共享,不同域的动作描述符被强制投射到同一个向量空间。
Motion Code Base \(p\) 的设计借鉴了 Perceiver #Jaegle-et-al.-2021 中的 latent array 思想:\(K=20\) 个可学习嵌入向量作为 Query Token,通过 Attention 机制与输入的动作描述符交互,输出一个紧凑的规范空间运动码。
2.3 类比约束:无配对数据的桥梁
跨域重演的最大难题是无配对数据。ToonTalker 的解决方案是类比约束(Analogy Constraint),其直觉来自一个关键观察:虽然我们无法获得配对数据,但"运动的变化量"在两个域中应该是可比的。
具体来说,给定真实域的两张图像 \(x_a^R, x_b^R\) 和卡通源图像 \(x_s^C\),首先计算真实域的相对动作 \(\Delta\omega_{real} = w_{r \to b} - w_{r \to a}\),然后将其应用于卡通域:
生成合成卡通人脸后,验证规范空间中的动作一致性:
这个损失不需要配对数据——它只要求"真实域的动作差异"等于"卡通域的对应动作差异"。在几何上,这等价于在规范空间中构造一个平行四边形:真实域和卡通域的相对动作向量应当平行且等长。
2.4 SFT:高分辨率特征细化
生成器的最后 3 层使用 Spatial Feature Transformation (SFT) 减少扭曲伪影:
其中 \(\alpha^i = \text{StyleConv}(f_w^i, w_{s \to d})\),\(\beta^i = \text{StyleConv}(f_w^i, w_{s \to d})\)。SFT 对高分辨率特征图的逐像素调制,有效减轻了扭曲带来的伪影。
2.5 与先前方法的关键区别
| 特性 | ToonTalker | AnimeCeleb | MAA | FOMM/LIA/DaGAN |
|---|---|---|---|---|
| 配对数据需求 | ❌ 不需要 | ✅ 需要 | ❌ | ❌ |
| 3DMM 依赖 | ❌ | ✅ | ❌ | ❌ |
| 动作表示 | 潜在空间码(512D) | 20D 预定义向量 | 关键点 | 关键点/潜在码 |
| 跨域训练 | 类比约束 | 配对监督 | 角度一致性 | 不支持 |
| 精细表情捕捉 | ✅ | ❌(20D 限制) | 有限 | 域内有效 |
| 双向跨域 | ✅ | 单向 | ❌ | ❌ |
3.1 两阶段训练策略
真实视频数据量(171K 视频)远大于卡通视频数据量(289 训练视频),数据极度不平衡。直接混合训练会导致真实域主导数据分布,卡通域学习不充分。
Stage 1:大规模真实数据预训练——用 VoxCeleb 训练集(171K 视频)执行域内重建任务,学习面部动作的通用知识:
| 参数 | Stage 1 | Stage 2 |
|---|---|---|
| 数据集 | VoxCeleb 训练集 | Disney 卡通 + VoxCeleb 子集 |
| 训练视频数 | 171K | 289 卡通 + VoxCeleb 子集 |
| Iterations | 450,000 | 10,000 |
| Batch Size | 64 | 8 |
| 优化器 | Adam | Adam |
| 初始学习率 | 5×10⁻⁴ | 1×10⁻⁴ |
| 损失函数 | \(\mathcal{L}_{rec}^R\) | 完整 \(\mathcal{L}\)(Eq. 12) |
Stage 2:跨域联合微调——将 Stage 1 的真实域特异组件(\(E_a^R\)、\(E_m^R\)、\(p^R\)、\(T_B^R\)、\(G^R\))复制作为卡通域初始组件 #Gong-et-al.-2023,用少量卡通数据 + 类比约束联合微调。
3.2 完整目标函数
完整损失函数包含 6 项:
| 损失项 | 符号 | 作用 | 公式 |
|---|---|---|---|
| 重建 L1 | \(\mathcal{L}_1\) | 像素级重建精度 | \(\|x_{s \to d} - x_d\|_1\) |
| 感知损失 | \(\mathcal{L}_{per}\) | 感知层面重建质量 | VGG 特征距离 |
| 对抗损失 | \(\mathcal{L}_{adv}\) | 生成图像真实性 | \(-\log(D(x_g))\) |
| 重建总损失 | \(\mathcal{L}_{rec}\) | 域内重建综合 | \(\mathcal{L}_1 + \lambda_{per}\mathcal{L}_{per} + \mathcal{L}_{adv}\) |
| Motion Loss | \(\mathcal{L}_{motion}\) | 跨域动作一致性 | \(\|(\Delta\omega_{cartoon}) - (\Delta\omega_{real})\|_1\) |
关键超参数:\(\lambda_{per} = 10\)(感知损失权重),\(\lambda_m = 20\)(类比约束权重)。后者的权衡效应将在 §5.4 消融实验中详细分析。
3.3 训练配置披露表
按照可复现性标准,下表逐项列出论文的训练配置披露情况。未披露的项明确标注"未披露",不臆测。
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | Stage 1: VoxCeleb 训练集(171K 视频);Stage 2: Disney 卡通(289 训练视频)+ VoxCeleb 子集 |
| 训练硬件 | 未披露 | 原文未给出 GPU 型号与数量 |
| 优化器 | 已披露 | Adam(β1/β2/ε/weight decay 原文未给出) |
| 学习率 | 已披露 | Stage 1: 5×10⁻⁴;Stage 2: 1×10⁻⁴;无 schedule 与 warmup 描述 |
| Batch size | 已披露 | Stage 1: 64;Stage 2: 8 |
| 训练步数 / 轮数 | 已披露 | Stage 1: 450,000 iterations;Stage 2: 10,000 iterations |
| 训练时长 | 部分披露(tex 注释) | tex 源码注释提及 Stage 2 微调约 4 小时(%which will cost about four hours),但论文正文未保留;Stage 1 时长未披露 |
| 模型参数量 | 未披露 | 原文未给出总参数量或可训练参数量 |
| 精度格式 | 未披露 | 原文未提及 FP32/FP16/BF16 等 |
| Checkpoint 策略 | 未披露 | 原文未给出模型选择标准 |
| 初始化来源 | 已披露 | Stage 2 将 Stage 1 真实域组件复制为卡通域初始组件 |
| Motion Code Base 维度 | 已披露 | \(K=20\) 个可学习嵌入,每个 \(p^k \in \mathbb{R}^{512}\) |
| 损失权重 | 已披露 | \(\lambda_{per}=10\),\(\lambda_m=20\) |
3.4 补充材料:网络架构细节(Supplementary Appendix A)
论文 supplementary material 的 Appendix A 提供了各关键模块的详细架构规格 #Gong-et-al.-2023。真实域和卡通域的模块结构完全相同,仅参数独立。下表汇总 supplementary 中披露的架构细节:
| 模块 | 层数 / 结构 | 特征图尺寸 | 输出维度 | 关键细节 |
|---|---|---|---|---|
| Appearance Encoder \(E_a\) | 6 层 ResBlock | 逐层下采样:8×8, 16×16, 32×32, 64×64, 128×128, 256×256 | 多尺度空间特征 \(S = \{S^i\}_{i=1}^N\) | 每个 ResBlock 后下采样,共 6 个尺度 |
| Motion Encoder \(E_m\) | 7 层 ResBlock + 4×4 Conv | — | \(F \in \mathbb{R}^{512}\) | 7 层 ResBlock 后接 4×4 卷积下采样 |
| Motion Query Transformer \(T\) | Transformer blocks(两域共享参数) | — | 规范空间运动码 \(w\) | Motion Base: \(K=20\) 个可学习嵌入,\(p^k \in \mathbb{R}^{512}\);嵌入→Query,动作描述符→Key/Value |
| Backward Transformer \(T_B\) | 3 层 Transformer block | 多尺度:16×16, 32×32, 64×64 | 域特异条件特征 | 第 1 层 Query = 运动码线性投影;后续层 Query = 前一层输出;Key/Value = 对应尺度外观特征 |
| Generator \(G\) | 6 层 StyleConv block | 从低分辨率到 256×256 | 动画图像 | 前 3 层:条件扭曲 + 上采样;后 3 层:扭曲 + SFT 细化(\(\alpha^i, \beta^i\) 由 StyleConv 预测) |
Supplementary 还提到 ResBlock-64 表示残差块中特征图通道数为 64。生成器的 StyleConv 设计借鉴了 StyleGAN 的架构思路,通过运动码调制特征图实现条件生成。
4.1 推理输入准备
ToonTalker 的推理需要两个输入:源图像(被驱动的肖像,可以是卡通或真实)和驱动视频(提供运动信号的序列,来自另一个域)。在 Real→Cartoon 方向,源图像是一张卡通角色图,驱动视频是一段真实人脸视频;在 Cartoon→Real 方向,角色互换。源图像和驱动帧的分辨率均为 \(256 \times 256\)。
论文未提及推理时是否需要对输入做特殊预处理(如人脸检测、对齐或裁剪),也未提及是否需要指定参考帧。从训练流程推断,推理时直接使用原始裁剪后的图像即可,无需额外对齐步骤——因为规范空间变换由 Query Transformer 自动完成域间对齐。
4.2 Real→Cartoon 推理流程
以真实驱动卡通为例,推理链路分为三个阶段。第一阶段是特征提取:卡通源图像 \(x_s^C\) 分别送入外观编码器 \(E_a^C\) 和动作编码器 \(E_m^C\),前者提取多尺度空间特征 \(S^C = \{S^i\}_{i=1}^N\)(从 \(8 \times 8\) 到 \(256 \times 256\) 共 6 个尺度),后者输出 512 维动作描述符 \(F_s^C\)。同时,真实驱动视频的每一帧 \(x_d^R\) 送入真实域动作编码器 \(E_m^R\),得到驱动动作描述符 \(F_d^R\)。
第二阶段是规范空间变换:源动作描述符 \(F_s^C\) 和卡通域 Motion Code Base \(p^C\)(20 个可学习嵌入向量)送入 Source Query Transformer \(T_{s \to r}\),输出规范空间运动码 \(w_{s \to r}\)。驱动动作描述符 \(F_d^R\) 和真实域 Motion Code Base \(p^R\) 送入 Driving Query Transformer \(T_{r \to d}\),输出 \(w_{r \to d}\)。由于两个 Query Transformer 共享参数,不同域的动作描述符被投射到同一个规范空间中,使运动码可以直接相加:\(w_{s \to d} = w_{s \to r} + w_{r \to d}\)。
第三阶段是图像生成:规范空间运动码 \(w_{s \to d}\) 送入卡通域 Backward Transformer \(T_B^C\)(3 层 Transformer),投射回卡通域生成多尺度条件特征。这些条件特征与外观编码器提取的空间特征 \(S^C\) 一起送入渐进式生成器 \(G^C\)。生成器包含 6 个 StyleConv 块:前 3 个块对低分辨率特征图进行条件扭曲和上采样,后 3 个块不仅扭曲特征图,还通过 Spatial Feature Transformation (SFT) 对高分辨率特征进行逐像素调制(\(o^i = \alpha^i \odot f_w^i + \beta^i\)),有效减轻扭曲伪影,最终输出 \(256 \times 256\) 的动画卡通图像。
4.3 Cartoon→Real 推理流程
Cartoon→Real 方向的推理流程与 Real→Cartoon 完全对称:卡通视频帧经 \(E_m^C\) 提取动作描述符,经 \(T_{r \to d}\) 投射到规范空间;真实源图像经 \(E_a^R\) 提取外观特征,经 \(T_{s \to r}\) 投射到规范空间。向量加法后,\(T_B^R\) 投射回真实域,\(G^R\) 生成动画真实图像。整个推理过程不需要任何域特异的预处理或后处理——规范空间充当了"通用翻译中间层",任何域的动作都先"翻译"到规范空间,再"翻译"回目标域。这使得方法在理论上可以扩展到更多域,而无需重新训练。
4.4 推理硬件与效率
论文未披露推理所使用的 GPU 型号、推理速度(FPS)、延迟或显存占用。从模型架构推断,推理时需要前向传播外观编码器(6 层 ResBlock)、动作编码器(7 层 ResBlock)、两个 Query Transformer、Backward Transformer(3 层)和生成器(6 层 StyleConv + SFT),计算量中等。但由于论文未公开代码和预训练模型,无法直接测量推理性能。
5.1 Disney 风格卡通数据集
ToonTalker 自建了一个 Disney 动画风格的卡通数据集:
| 属性 | 值 |
|---|---|
| 总视频数 | 344 |
| 总帧数 | 约 47,000 |
| 帧率 | 30 FPS |
| 训练/测试划分 | 289 / 55 |
| 配对数据 | ❌ |
| 3DMM 标注 | ❌ |
与 AnimeCeleb 不同,该数据集不需要 3DMM 标注或配对数据,更接近实际应用——现实中卡通数据通常是无标注的。
5.2 实验配置表
| 评估任务 | 驱动源 | 源图像 | 生成视频数 | 主要指标 |
|---|---|---|---|---|
| Real→Cartoon | 60 VoxCeleb 视频 | 300 卡通图像 | 18,000 | FID, CPBD |
| Cartoon→Real | 55 卡通视频 | 275 CelebA-HQ | 15,125 | FID, CSIM, CPBD |
| 域内同身份重建 | 200 VoxCeleb 测试视频 | 同源视频帧 | — | L1, LPIPS, AKD, AED |
| 域内跨身份(真实) | 200 VoxCeleb 视频 | 1,000 CelebA-HQ | 1,000 | FID, CSIM, CPBD |
| 域内跨身份(卡通) | 55 卡通视频 | 275 卡通图像 | — | FID, CPBD |
所有对比方法(FOMM #Siarohin-et-al.-2020、LIA #Wang-et-al.-2022、DaGAN #Wang-et-al.-2023)均使用相同卡通训练数据微调,保证公平比较。
5.2b 训练与推理实验配置表
下表汇总论文中涉及的全部训练与推理环境信息,逐项标注披露状态。
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据集 | 已披露 | VoxCeleb(171K 视频)+ Disney 卡通(289 训练视频) |
| 数据规模 | 已披露 | 真实域 171K 视频,卡通域 ~47K 帧(344 视频) |
| 训练硬件 | 未披露 | 原文未给出 GPU 型号与数量 |
| 推理硬件 | 未披露 | 原文未给出推理 GPU 型号 |
| 优化器 | 已披露 | Adam |
| 学习率 | 已披露 | Stage 1: 5×10⁻⁴,Stage 2: 1×10⁻⁴ |
| Batch size | 已披露 | Stage 1: 64,Stage 2: 8 |
| 训练 iterations | 已披露 | Stage 1: 450K,Stage 2: 10K |
| 训练时长 | 部分披露(tex 注释) | tex 注释提及 Stage 2 约 4 小时;Stage 1 未披露 |
| 推理速度 / FPS | 未披露 | 原文未给出 |
| 推理延迟 | 未披露 | 原文未给出 |
| 分辨率 | 已披露 | 训练和推理均为 256×256 |
| 代码开源 | 未开源 | 截至发文时代码和预训练模型未公开 |
| 数据集开源 | 计划开源 | Disney 卡通数据集计划公开发布 |
5.3 Real→Cartoon 跨域重演
| 方法 | FID ↓ | CPBD ↑ |
|---|---|---|
| FOMM | 30.369 | 0.0436 |
| LIA | 30.442 | 0.0493 |
| DaGAN | 29.779 | 0.0735 |
| ToonTalker | 28.531 | 0.0840 |
Real→Cartoon 方向的改进相对温和(FID 降低 4.2%–6.1%),这是因为真实域驱动信号本身就比较规范,各方法的差异不大。
5.4 Cartoon→Real 跨域重演
| 方法 | FID ↓ | CSIM ↑ | CPBD ↑ |
|---|---|---|---|
| FOMM | 51.929 | 0.536 | 0.0626 |
| LIA | 48.611 | 0.515 | 0.0727 |
| DaGAN | 47.222 | 0.561 | 0.0985 |
| ToonTalker | 31.852 | 0.655 | 0.1230 |
Cartoon→Real 方向的改进幅度惊人:FID 从 47.222 降到 31.852(降低 32.5%),CSIM 从 0.561 提升到 0.655(提升 16.8%)。这证明了类比约束在"高难度方向"上的价值更大——卡通面部比例和运动范围与真实差异巨大,传统方法很难处理。
5.5 消融实验
| \(\lambda_m\) | Real→Cartoon FID ↓ | Cartoon→Real FID ↓ |
|---|---|---|
| 0 | 26.885 | 33.463 |
| 20 | 28.531 | 31.852 |
| 40 | 32.094 | 30.176 |
| 100 | 41.936 | 28.166 |
\(\lambda_m\) 本质上在两个跨域方向之间进行权衡:\(\lambda_m = 0\) 时 Real→Cartoon 最优但 Cartoon→Real 最差,\(\lambda_m = 100\) 时反过来。\(\lambda_m = 20\) 是两个方向的最佳平衡点。
5.6 User Study:20 人四选一偏好测试
| 设计要素 | 具体设置 |
|---|---|
| 被试数量 | 20 人 |
| 任务形式 | 20 道选择题,从 4 个方法生成的卡通视频中选最佳 |
| 量表类型 | Best-of-4 单选 |
| 方法 | 偏好率 |
|---|---|
| ToonTalker | 72.75% |
| LIA | 13.75% |
| DaGAN | 9.00% |
| FOMM | 4.50% |
ToonTalker 以压倒性优势获得最高偏好率,是第二名(LIA)的 5.3 倍。该 User Study 只问"整体最佳",不拆分画质/同步/自然度——在卡通领域这是合理选择,因为卡通的"好"是一个整体感知,很难像真实 talking head 那样分解为独立维度。
5.7 规范空间 t-SNE 可视化
为验证跨域对齐是否真正生效,作者使用 t-SNE 对规范空间的相对动作进行了可视化:从 3 个模板姿态出发,分别计算真实域和卡通域的相对动作向量。结果显示,同一模板驱动的真实域和卡通域相对动作在规范空间中聚集在一起 #Gong-et-al.-2023,证明两个域的动作已成功对齐。
5.8 补充材料:Stable Diffusion 生成图像评测(Appendix C)
Supplementary 的 Appendix C 展示了 ToonTalker 在 Stable Diffusion 生成的卡通角色上的跨域重演效果 #Gong-et-al.-2023。作者使用若干 SD 生成的卡通角色作为源图像,用真实人脸视频驱动。定性结果显示模型在 SD 风格角色上仍能合理迁移表情和姿态,表明方法对训练分布外的卡通风格具有一定泛化能力。但 supplementary 未提供 SD 生成图像的定量评测数据。
6.1 局限
极端姿态:极端头部姿态下产生伪影和形变,因为训练集中罕见这类样本。无 3D 先验:方法不依赖 3DMM,适用范围比 AnimeCeleb 更广,但也无法利用 3D 先验来约束不合理变形。单一卡通风格:Disney 数据集只包含一种风格,对日本动画、3D 渲染等风格的泛化能力未充分验证(虽然作者展示了 Stable Diffusion 生成角色的初步结果 #Gong-et-al.-2023)。计算开销:tex 源码注释中提及“由于有两个域的模块,训练需要更多计算和时间”(since we have modules for two domains, it requires more compute and time for training),但该讨论在正文和 supplementary 中均被删除。
6.2 对评测的启示
ToonTalker 使用的 FID、CPBD、CSIM 等指标在卡通域的可靠性存疑(如系列(十三) #tangwen-2026-cartoon-eval 所分析的)。但它是目前唯一提供双向跨域定量评测的卡通 talking head 工作,其 Disney 数据集也为后续研究提供了重要的基础设施。
6.3 类比约束的普适性
类比约束的核心思想——"相对变化在不同域之间应当等价"——具有很强的普适性。它不仅适用于卡通-真实跨域,也可以推广到:
- 不同艺术风格之间的运动迁移(如写实风格 → 抽象风格)
- 不同物种之间的表情迁移(如人脸 → 动物脸)
- 不同模态之间的运动对齐(如音频 → 视觉)
关键在于能否定义一个"规范空间"使得不同域的相对运动可以比较。ToonTalker 通过参数共享的 Query Transformer 实现了这一点,这为后续的跨域生成工作提供了一个优雅的参考范式。
- 跨域核心创新:类比约束在无配对数据条件下实现双向跨域运动迁移,核心思想是"相对动作在不同域之间等价"
- 架构设计:域特异组件 + 域共享 Transformer 的组合,规范空间充当"通用翻译中间层"
- 数据贡献:自建 Disney 卡通数据集(344 视频 / 47K 帧),不需要配对数据或 3DMM 标注
- 定量优势:Cartoon→Real FID 降低 32.5%,CSIM 提升 16.8%;User Study 72.75% 压倒性偏好
- 架构消融:Query Transformer 不可被 MLP 替代(FID 恶化 4 倍),SFT 对 Cartoon→Real 影响最大
- 评测启示:卡通域 FID/CPBD 的可靠性仍需审视,ToonTalker 为评测方法论研究提供了重要的实验基础设施
参考来源
- Gong, Y. et al. (2023). ToonTalker: Cross-Domain Face Reenactment. ICCV 2023. arXiv:2308.12866
- Siarohin, A. et al. (2020). First Order Motion Model for Image Animation. NeurIPS 2019. arXiv:2003.00196
- Wang, S. et al. (2022). Latent Image Animator: Learning to Animate Images via Latent Space Navigation. ICLR 2022. arXiv:2203.09043
- Wang, Z. et al. (2023). Dense Intra-adversarial Inconsistencies-aware Network for Face Animation. CVPR 2022. arXiv:2203.11317
- Liu, S. et al. (2022). AnimeCeleb: Large-Scale Animation Celebrities Dataset for Head Reenactment. ECCV 2022. arXiv:2111.07640
- Xu, Z. et al. (2022). Motion Adaptive Transformer for Face Animation. arXiv preprint. arXiv:2204.13377
- Jaegle, A. et al. (2021). Perceiver: General Perception with Iterative Attention. ICML 2021. arXiv:2103.03206
- tangwen (2026). 数字人系列(十三):卡通与风格化数字人——从跨域生成到评测方法论. 博客文章