ESC
输入关键词搜索文章
目录

训练全景

从 Wing Loss 到 Denoising Score Matching:7 大 Loss 族 × 5 条技术路线 × 12 个系统的训练细节
系列(十五)· Loss 函数 · 训练策略 · 跨系统对比
7Loss 函数族
5技术路线
12系统深拆
20+公式
4训练策略
系列位置
为什么需要专门整理数字人的训练 Loss?

数字人(talking head / talking face / digital avatar)的研究在 2020–2026 年间经历了从 GAN warp 到 NeRF 再到 Diffusion 的范式跃迁。大量的综述文章梳理了架构分类、数据集和评测指标 #Rakesh-et-al.-2025 #Springer-THG-2025,但训练过程中使用的 Loss 函数始终被当作每个论文的"实现细节"散落在各处,缺乏系统性的整理和对比。

这个缺口带来的实际问题是:当你想复现或改进一个数字人系统时,架构图能从论文里抄,但 Loss 组合、权重配比、训练阶段划分和冲突处理策略往往需要从代码里逆向工程。更关键的是,不同技术路线(GAN warping、lip-sync、3DMM、NeRF、Diffusion)的 Loss 设计哲学差异巨大——LivePortrait 用了 8 项损失协同优化,Wav2Lip 靠一个冻结的 SyncNet 判别器就把唇形同步做到了 SOTA,而 MuseTalk 专门写了一节讨论"GAN loss 和 SyncNet loss 为什么会互相打架"。

本文的目标是填这个缺口:把数字人训练中使用的 Loss 函数按功能分成 7 大族,按技术路线梳理 5 种典型系统的 Loss 组合,总结 4 类训练策略,最后给出一张跨系统对比总表。用户提到的 Wing Loss #Feng-et-al.-2018 是其中"关键点与运动约束损失"族的核心成员,LivePortrait 用它来约束隐式关键点与 2D landmark 对齐,从而驱动微表情。

本文回答以下问题:

  • Part 1:数字人训练 Loss 分成哪 7 大族?每族的数学形式、作用和典型系统是什么?
  • Part 2:Wing Loss 为什么比 L2 更适合微表情?它的数学形式和梯度特性是什么?
  • Part 3:5 条技术路线各自用哪些 Loss?它们为什么这样组合?
  • Part 4:训练策略——分阶段训练、模块化 vs 端到端、Loss 冲突如何解决?
  • Part 5:12 个系统的 Loss 对比总表。
  • Part 6:设计模式与 Trade-offs。
  • Part 7:开放问题。
前置阅读:本文假设读者已了解数字人的基本技术路线分类。如需背景,请先读 实时数字人 Survey评测指标、算力与产品选型。本文聚焦训练侧的 Loss 和策略,不重复评测指标的内容。
Part 1
Loss 函数分类体系:7 大族

数字人训练中使用的 Loss 函数可以按监督信号的类型分为 7 大族。下表是总览,随后逐节展开。

Loss 族核心作用典型成员代表系统
  • 像素级重建损失
  • 像素一致性L1, L2, Smooth L1几乎所有系统
  • 感知损失
  • 高层语义一致性VGG Perceptual, LPIPSLivePortrait, Wav2Lip, MuseTalk
  • 对抗损失
  • 纹理真实感GAN loss, Multi-scale, CascadeLivePortrait, Wav2Lip, MuseTalk
  • 同步损失
  • 音画对齐SyncNet, Lip-sync DiscriminatorWav2Lip, SadTalker, MuseTalk
  • 身份保持损失
  • 身份不漂移ArcFace, Face ID, Cross-IDLivePortrait, VASA-1
  • 关键点与运动约束损失
  • 运动精度与几何一致性Wing Loss, Equivariance, Keypoint Prior, Head Pose, Deformation Priorface vid2vid, LivePortrait, SadTalker
  • 生成模型专属损失
  • 分布匹配与采样质量VAE ELBO, Denoising Score Matching, CFG, DMD DistillationSadTalker, Hallo, VASA-1, EMO2

    1.1 像素级重建损失

    最基本的损失族,衡量生成帧与真实帧在像素空间的一致性。数字人系统几乎都用 L1 而非 L2,原因有二:L2 对大误差的二次惩罚会导致生成结果偏向"平均脸"(模糊),而 L1 对异常值更鲁棒。

    L1 与 L2 损失

    $$\mathcal{L}_{L1} = \frac{1}{N} \sum_{i=1}^{N} |x_i - \hat{x}_i|, \quad \mathcal{L}_{L2} = \frac{1}{N} \sum_{i=1}^{N} (x_i - \hat{x}_i)^2$$

    Smooth L1 在 $|x - \hat{x}| < 1$ 时退化为 L2,在 $|x - \hat{x}| \geq 1$ 时退化为 L1,兼顾两者的优势。

    在实际系统中,重建损失通常作为"保底"损失与其他损失联合使用。例如 Wav2Lip 的总损失包含 $\mathcal{L}_{recon}$(L1)+ $\mathcal{L}_{perceptual}$ + $\mathcal{L}_{sync}$ + $\mathcal{L}_{adv}$ #Prajwal-et-al.-2020。MuseTalk 在第一阶段只用重建 + 感知损失训练"facial abstraction"能力,第二阶段才引入同步和对抗损失 #Zhang-et-al.-2024-MuseTalk

    关键限制:纯像素级重建损失会导致牙齿、嘴角等高频细节被抹平——因为模型通过生成"平均值"来最小化逐像素误差。这正是感知损失和对抗损失被引入的原因。

    1.2 感知损失

    感知损失使用预训练的图像分类网络(通常是 VGG-19)提取中间层特征,在特征空间而非像素空间计算距离。它的核心作用是让生成结果在"高层语义"上与真实图像一致,即使像素不完全匹配,也能保证视觉上的合理性。

    VGG 感知损失

    $$\mathcal{L}_{perceptual} = \sum_{l} \frac{1}{C_l H_l W_l} \|\phi_l(x) - \phi_l(\hat{x})\|_1$$

    其中 $\phi_l$ 是 VGG-19 第 $l$ 层的特征提取,$C_l, H_l, W_l$ 是该层特征图的通道数、高度和宽度。

    LivePortrait 将感知损失设计为级联结构:在全局(full image)、面部(face region)、唇部(lip region)三个区域分别施加感知损失,对应三个从零训练的判别器 $\mathcal{D}_{global}$$\mathcal{D}_{face}$$\mathcal{D}_{lip}$ #Guo-et-al.-2024。这种分层设计确保了局部纹理细节(尤其是嘴唇和牙齿)被精确优化,而不只是全局"看起来像"。

    Wav2Lip 使用感知损失来约束生成器输出的整体视觉质量,与同步损失和对抗损失联合优化 #Prajwal-et-al.-2020。研究表明,去掉感知损失后生成图像质量会显著下降——纹理变得平面化,边缘模糊 #Liang-et-al.-2022

    1.3 对抗损失

    对抗损失来自 GAN 框架,通过训练判别器 $D$ 区分真实图像和生成图像,间接推动生成器 $G$ 产出更真实的纹理。在数字人系统中,对抗损失主要解决两个问题:高频细节(牙齿、皮肤纹理)的清晰度,以及整体图像的真实感。

    对抗损失(Hinge 版本)

    $$\mathcal{L}_{adv} = \mathbb{E}_{x \sim p_{data}}[\min(0, -1 + D(x))] + \mathbb{E}_{\hat{x} \sim p_G}[\min(0, -1 - D(\hat{x}))]$$

    生成器侧的对抗损失为 $\mathcal{L}_G = -D(\hat{x})$,推动判别器对生成图像给出高分。

    LivePortrait 的级联 GAN 损失是其中最精细的设计:三个判别器分别负责全局、面部和唇部区域,由 2D semantic landmarks 定义 ROI #Guo-et-al.-2024。这种设计的核心洞察是——不同面部区域的纹理复杂度和失败模式不同:唇部需要精确的牙齿和嘴角纹理,面部需要皮肤质感,全局需要背景和头发的一致性。

    MuseTalk 在第二阶段引入 face 和 lip 两个判别器,但发现了一个关键问题:GAN loss 可能让模型"偷懒"复制参考帧中已有的嘴型,而非根据音频生成正确的嘴部运动 #Zhang-et-al.-2024-MuseTalk。这个问题通过 Informative Frame Sampling(IFS)和 Dynamic Margin Sampling(DMS)从数据侧切断捷径来解决。

    1.4 同步损失

    同步损失是数字人区别于一般图像生成任务的核心损失。它约束生成视频的嘴部运动与驱动音频在时序上精确对齐——不仅要求"嘴在动",还要求"嘴的每个开合对应正确的音素"。

    数字人领域最重要的同步损失是 SyncNet 损失,由 Chung & Zisserman 首次提出 #Chung-et-al.-2016,在 Wav2Lip 中被发扬光大 #Prajwal-et-al.-2020。SyncNet 是一个双流网络,音频编码器处理 80 维 mel-spectrogram,视频编码器处理 96×96 的嘴唇区域图像,输出两组 embedding 后计算余弦相似度。

    SyncNet 同步损失

    $$\mathcal{L}_{sync} = -\cos(\phi_a(a_{t:t+T}), \phi_v(v_{t:t+T}))$$

    其中 $\phi_a$$\phi_v$ 分别是 SyncNet 的音频和视频编码器,$a_{t:t+T}$$v_{t:t+T}$ 是时间窗口 $T$ 内的音频和视频片段。相似度越高(损失越低),嘴部运动与音频越同步。

    Wav2Lip 的关键设计是冻结 SyncNet 判别器——在大规模唇读数据集 LRS2 上预训练后,训练生成器时判别器权重不更新 #Prajwal-et-al.-2020。这防止判别器被生成器的伪影"带偏",保持其作为"客观裁判"的角色。SadTalker 的 ExpNet 借鉴了同样的思路 #Zhang-et-al.-2023

    Wav2Lip full architecture with frozen SyncNet lip-sync expert
    图 1:Wav2Lip 的完整架构,冻结的 SyncNet 唇形专家提供 $\mathcal{L}_{sync}$ 梯度,与 L1、感知、对抗损失联合优化(来源:Prajwal et al., Wav2Lip, ACM MM 2020, architecture)。
    同步 vs 真实感的冲突:MuseTalk 首次系统分析了 SyncNet loss 与 GAN loss 的冲突——直接联合优化会导致训练不稳定,SyncNet loss 难以收敛。解决方案是两阶段训练:先学重建和感知(建立基础视觉能力),再引入同步和对抗(精细化音画对齐)#Zhang-et-al.-2024-MuseTalk

    1.5 身份保持损失

    身份保持损失约束生成过程中人物身份不发生漂移。在长时间生成或跨身份驱动(用 A 的表情驱动 B 的脸)时,生成器可能"忘了"原始身份,产出像但不是同一个人的结果。

    主流方案是使用预训练的人脸识别模型(如 ArcFace #Deng-et-al.-2019)提取身份嵌入,约束生成帧与源帧的嵌入余弦相似度。

    ArcFace 身份损失

    $$\mathcal{L}_{faceid} = 1 - \cos(\mathcal{R}(I_s), \mathcal{R}(\hat{I}_d))$$

    其中 $\mathcal{R}$ 是 ArcFace 人脸识别网络,$I_s$ 是源图像,$\hat{I}_d$ 是生成帧。

    LivePortrait 使用 ArcFace 提取的身份嵌入保持源图像身份 #Guo-et-al.-2024。VASA-1 进一步提出了跨身份相似性损失 $\mathcal{L}_{cross\_id}$:将一个主体的运动传输到另一个主体,计算原始身份特征与传输后身份特征的余弦相似度,确保运动传输不会破坏身份信息。消融实验显示该损失将身份保持评分从 0.72 提升到 0.80 #Li-et-al.-2024-VASA1

    1.6 关键点与运动约束损失

    这一族是数字人特有的损失,约束隐式或显式关键点的几何一致性和运动精度。它是 face vid2vid 和 LivePortrait 这类隐式关键点系统的训练基石。

    1.6.1 Wing Loss——为微表情而生

    Wing Loss 由 Feng 等人在 2018 年提出 #Feng-et-al.-2018,最初用于人脸关键点定位。它的核心动机是:L2 loss 在零点附近的梯度恒定(等于误差值),对小误差不够敏感;L1 loss 在零点附近梯度恒为 $\pm 1$,也不区分大小误差。而人脸关键点定位中,小到中等范围的误差恰恰是最需要关注的。

    Wing Loss 定义

    $$\text{Wing}(x) = \begin{cases} w \ln(1 + |x|/\epsilon) & \text{if } |x| < w \\ |x| - C & \text{otherwise} \end{cases}$$

    其中 $C = w - w \ln(1 + w/\epsilon)$ 保证分段连续。$w$ 定义了"小误差"区间的宽度,$\epsilon$ 控制对数曲线的曲率。

    Wing Loss 的关键特性是:在 $|x| < w$ 区间内使用对数函数,对小误差的梯度远大于 L1 或 L2。具体来说,当 $|x| \to 0$ 时,Wing Loss 的梯度 $\frac{w}{\epsilon + |x|} \to \frac{w}{\epsilon}$,可以远大于 1(L1 的梯度),从而使模型更关注微小的定位误差。当 $|x| \geq w$ 时,Wing Loss 退化为线性函数(类似 L1),对大误差不过度惩罚。

    LivePortrait 引入 Wing Loss 的场景是微表情驱动 #Guo-et-al.-2024。face vid2vid 的隐式关键点在无监督方式下难以学到微表情,LivePortrait 从眼睛和嘴唇区域选取 N=10 个 2D landmarks,用 Wing Loss 约束隐式关键点的前两维与 landmark 对齐:

    $$\mathcal{L}_{guide} = \frac{1}{2N} \sum_{i=1}^{N} \big( \text{Wing}(l_i, x_{s,i,:2}) + \text{Wing}(l_i, x_{d,i,:2}) \big)$$

    Wing Loss 对小误差更敏感的特性,恰好适合微表情这类小幅运动。该损失同时施加在 source 和 driving 关键点上 #Guo-et-al.-2024

    1.6.2 等变性损失(Equivariance Loss)

    等变性损失由 face vid2vid 提出 #Wang-et-al.-2020,约束隐式关键点的几何一致性:对图像施加 2D 几何变换 $T$(如旋转、平移),关键点提取器输出的变化应该与 $T$ 一致。

    等变性损失

    $$\mathcal{L}_E = \sum_k \| T(x_{d,k}) - x'_{d,k} \|^2$$

    其中 $x_{d,k}$ 是原始图像的第 $k$ 个隐式关键点,$T(x_{d,k})$ 是对关键点施加变换 $T$ 后的结果,$x'_{d,k}$ 是对变换后图像提取的关键点。如果两者一致,说明关键点提取器学到了几何上有意义的表示。

    1.6.3 关键点先验损失(Keypoint Prior)

    关键点先验损失约束隐式关键点分布在人脸区域内,防止关键点"飘"到背景中 #Wang-et-al.-2020。face vid2vid 使用一个 coverage loss,鼓励关键点覆盖面部区域但不超出边界。

    1.6.4 头部姿态损失与形变先验损失

    头部姿态损失 $\mathcal{L}_H$ 惩罚头部旋转预测的误差,形变先验损失 $\mathcal{L}_\Delta$ 约束形变场的幅度和光滑性,防止过度变形导致面部撕裂 #Wang-et-al.-2020

    值得注意的是,CVPR 2026 的 PerformRecast 工作显式丢弃了等变性、关键点先验、头部姿态和形变先验四项损失 #Liang-et-al.-2026,认为这些约束在新的解耦框架中不再需要。这暗示着当架构设计足够好时,某些手工设计的约束损失可以被移除——但这一观点尚需更多验证。

    1.7 生成模型专属损失

    随着数字人从 GAN 走向扩散模型,训练目标也从对抗损失转向去噪分数匹配。这一族损失来自生成模型本身的理论框架。

    1.7.1 VAE ELBO

    SadTalker 的 PoseVAE 使用标准 ELBO 作为训练目标 #Zhang-et-al.-2023

    $$\mathcal{L}_{\text{PoseVAE}} = \mathbb{E}_{q(z|\rho,a)}[\log p(\rho|z,a)] - \text{KL}(q(z|\rho,a) \| p(z|a))$$

    其中 $\rho$ 是头姿序列,$a$ 是音频条件,$z$ 是隐变量。第一项保证解码出的头姿能重构真实运动,第二项把后验分布拉向条件先验,使推理时可以直接从先验采样。

    1.7.2 去噪分数匹配

    VASA-1 和 Hallo 等基于扩散模型的系统使用去噪分数匹配作为核心训练目标 #Li-et-al.-2024-VASA1 #Xu-et-al.-2024-Hallo

    $$\mathcal{L}_{diffusion} = \mathbb{E}_{t, X_0, \epsilon} \| X_0 - H(X_t, t, C) \|^2$$

    其中 $X_t$ 是前向过程添加噪声后的运动序列,$H$ 是网络(VASA-1 中是 Transformer,Hallo 中是 UNet),$C$ 是条件信号(音频、参考图像等)。VASA-1 的网络预测原始信号 $X_0$ 而非噪声 $\epsilon$,参数量仅 29M #Li-et-al.-2024-VASA1

    1.7.3 Classifier-Free Guidance(CFG)

    VASA-1 采用 CFG 提升生成质量,训练时随机丢弃条件,推理时应用引导 #Li-et-al.-2024-VASA1

    $$\hat{X}_0 = (1 + \sum_{c \in C} \lambda_c) \cdot H(X_t, t, C) - \sum_{c \in C} \lambda_c \cdot H(X_t, t, C|_{c=\emptyset})$$

    消融实验表明,合理的 CFG 参数能显著提升同步性和质量,但过强的 CFG(如音频引导系数 $\lambda_A = 2.0$)会导致头部抖动和夸张嘴部动作 #Li-et-al.-2024-VASA1

    1.7.4 蒸馏损失

    对于需要实时推理的系统,蒸馏是将多步扩散压缩到少步的关键。DMD(Distribution Matching Distillation) 让学生生成器的分布直接匹配教师扩散模型的分布 #Yin-et-al.-2024-DMD。DMD2 移除了初代 DMD 依赖的昂贵 LPIPS 回归损失,改用双时间尺度更新和 GAN 损失稳定训练,使学生不仅追平甚至超越了教师。

    Part 2
    5 条技术路线的系统级 Loss 分析

    不同的技术路线因为架构设计不同,Loss 组合的哲学也截然不同。以下按路线逐一分析。

    2.1 GAN/Warping 路线:face vid2vid → LivePortrait

    这条路线的核心是"隐式关键点 + warping + GAN 生成"。face vid2vid #Wang-et-al.-2020 奠定了 4 项基础损失:

    face vid2vid 训练目标

    $$\mathcal{L}_{fvid2vid} = \mathcal{L}_E + \mathcal{L}_L + \mathcal{L}_H + \mathcal{L}_\Delta + \mathcal{L}_{equiv} + \mathcal{L}_{recon}$$
    • $\mathcal{L}_E$:等变性损失——几何一致性
    • $\mathcal{L}_L$:关键点先验——关键点不飘出面部
    • $\mathcal{L}_H$:头部姿态——旋转预测精度
    • $\mathcal{L}_\Delta$:形变先验——形变场光滑性
    • $\mathcal{L}_{equiv}$:等变性约束(特征层面)
    • $\mathcal{L}_{recon}$:重建损失

    LivePortrait 在此基础上从 6 项扩展到 8 项 #Guo-et-al.-2024

    $$\mathcal{L}_{base} = \underbrace{\mathcal{L}_E + \mathcal{L}_L + \mathcal{L}_H + \mathcal{L}_\Delta}_{\text{继承 face vid2vid}} + \underbrace{\mathcal{L}_{P,cascade}}_{\text{级联感知}} + \underbrace{\mathcal{L}_{G,cascade}}_{\text{级联 GAN}} + \underbrace{\mathcal{L}_{faceid}}_{\text{ArcFace 身份}} + \underbrace{\mathcal{L}_{guide}}_{\text{Wing Loss}}$$

    新增的 4 项损失各有明确目的:

    • 级联感知损失 $\mathcal{L}_{P,cascade}$:在全局、面部、唇部三个区域分别施加 VGG 感知损失
    • 级联 GAN 损失 $\mathcal{L}_{G,cascade}$:三个从零训练的判别器分别负责三个区域
    • ArcFace 身份损失 $\mathcal{L}_{faceid}$:保持源图像身份不漂移
    • Wing Loss 引导损失 $\mathcal{L}_{guide}$:用 2D landmarks 约束隐式关键点,驱动微表情

    这个 8 项损失的组合是当前 GAN/Warping 路线中最复杂的。LivePortrait 的消融实验表明,去掉任何一项都会导致特定方面的质量下降——去掉 Wing Loss 微表情不生动,去掉级联 GAN 唇部纹理模糊,去掉 ArcFace 身份漂移 #Guo-et-al.-2024

    2.2 Lip-Sync 路线:Wav2Lip → MuseTalk

    这条路线的核心是"音频驱动局部嘴部生成",Loss 设计围绕同步精度与视觉质量的平衡

    Wav2Lip 的 Loss 组合相对简洁 #Prajwal-et-al.-2020

    $$\mathcal{L}_{Wav2Lip} = \mathcal{L}_{sync} + \mathcal{L}_{adv} + \mathcal{L}_{recon} + \mathcal{L}_{perceptual}$$

    其中 $\mathcal{L}_{sync}$ 来自冻结的 SyncNet 判别器——这是整个系统的核心。Wav2Lip 的关键创新不是 Loss 函数本身,而是训练策略:先用 SyncNet 预训练唇形专家判别器,再在训练生成器时冻结判别器权重 #Prajwal-et-al.-2020

    MuseTalk 继承了 Wav2Lip 的 Loss 结构,但首次系统性地分析了 Loss 冲突问题 #Zhang-et-al.-2024-MuseTalk

    训练目标带来的好处单独使用的风险MuseTalk 的处理
    重建 / 感知损失稳定、保身份、学基础纹理牙齿与嘴角过度平滑第一阶段,先训练 facial abstraction
    SyncNet loss嘴型跟音频同步嘴部边界和牙齿变糊第二阶段引入,用 DMS 避免偷看嘴型
    GAN loss提升清晰度和真实感可能复制参考图嘴型,忽视音频第二阶段引入 face/lip 两个判别器

    MuseTalk 的核心贡献不是新增 Loss,而是揭示了"三个 Loss 之间不是天然兼容的"——直接联合优化会导致训练不稳定,SyncNet loss 难以收敛。解决方案是两阶段训练 + 采样策略切断捷径 #Zhang-et-al.-2024-MuseTalk

    MuseTalk latent inpainting framework and two-stage training
    图 2:MuseTalk 的 latent inpainting 框架,两阶段训练先学重建/感知再引入 SyncNet 与 face/lip 对抗损失,以化解 Loss 冲突(来源:Zhang et al., MuseTalk, arXiv:2501.01895, framework)。

    2.3 3DMM 路线:SadTalker

    SadTalker 的 Loss 设计哲学是"模块化拆分"——把音频到视频的任务拆成三个子问题,各自用最合适的损失训练 #Zhang-et-al.-2023

    SadTalker 分模块 Loss

    • ExpNet(音频→表情系数):表情系数回归损失 + 唇形同步判别器损失(借鉴 Wav2Lip 的冻结 SyncNet 思路)
    • PoseVAE(音频→头姿序列):条件 VAE 的 ELBO = 重构项 + KL 正则项
    • Face Render(运动系数→图像):自重演训练(同视频不同帧互相驱动),重建 + 感知损失

    SadTalker 的设计启示是:强相关(表情)、弱相关(头姿)、纯视觉(渲染)这三类子问题的最优监督信号不同——表情需要精确回归 + 同步约束,头姿需要生成式建模(多样性),渲染需要像素级一致性。把它们拆开训练比硬塞进一个端到端网络更容易收敛 #Zhang-et-al.-2023

    2.4 NeRF 路线:GeneFace

    GeneFace #Zielonka-et-al.-2023 将 3DMM 运动预测与 NeRF 渲染结合。其 Loss 包含:

    • 3DMM 运动预测损失:音频到 3DMM 系数的回归损失(类似 SadTalker 的 ExpNet)
    • NeRF 渲染损失:光度重建损失(photometric loss),即渲染图像与真实图像的像素级 L1/L2
    • 同步损失:SyncNet 约束嘴部与音频对齐
    • 感知损失:VGG 特征空间距离

    NeRF 路线的特点是渲染损失替代了 GAN 损失——NeRF 的体积渲染天然提供密集的像素级监督,不需要判别器来推动纹理真实感。但 NeRF 的训练成本高(每个身份需要单独训练),且推理速度慢,这也是 GeneFace++ 改进实时性的动机 #Zielonka-et-al.-2023

    2.5 Diffusion 路线:Hallo → VASA-1 → EMO2

    扩散路线的 Loss 设计从"去噪分数匹配"出发,逐步加入更多条件控制。

    Hallo 基于 Stable Diffusion 1.5 的 latent diffusion 体系,核心训练目标是标准的扩散去噪损失 #Xu-et-al.-2024-Hallo。它的创新不在 Loss 函数本身,而在条件注入方式——Hierarchical Audio-Driven Visual Synthesis(HADVS)将音频条件分层注入 lip、expression、pose 三个区域,使不同面部区域各自接收音频驱动信号。

    VASA-1 在扩散框架中引入了更多损失 #Li-et-al.-2024-VASA1

    • 解耦一致性损失 $\mathcal{L}_{consist}$:通过交换潜在变量构建重构损失,防止头部姿态和面部动力学纠缠
    • 跨身份相似性损失 $\mathcal{L}_{cross\_id}$:将运动传输到不同身份后计算身份特征相似度
    • 去噪分数匹配:网络预测 $X_0$ 而非 $\epsilon$
    • Classifier-Free Guidance:训练时随机丢弃条件,推理时应用引导

    EMO2 进一步扩展到全身生成,采用两阶段扩散:Stage 1 生成 MANO 手部运动,Stage 2 用 ReferenceNet 视频扩散补全身体 #Wang-et-al.-2025-EMO2。每个阶段的 Loss 都是标准扩散去噪损失,但条件信号不同。

    VASA-1 diffusion transformer pipeline with disentangled latent space
    图 3:VASA-1 的扩散管线——先学解耦的面部潜在空间,再用 DiT 做去噪分数匹配,并引入跨身份相似性损失与 CFG(来源:Xu et al., VASA-1, Microsoft Research, pipeline)。
    Part 3
    训练策略:分阶段、模块化、数据策略与 Loss 冲突

    3.1 分阶段训练

    分阶段训练是数字人领域最常见的策略。不同系统的分阶段动机不同:

    系统阶段划分动机
    LivePortraitStage I: 基础模型(8 项 Loss 联合优化)→ Stage II: 冻结基础模型,只训练 stitching/retargeting MLP避免轻量控制模块被基础生成能力淹没
    Wav2LipStage I: 预训练 SyncNet 判别器 → Stage II: 冻结判别器训练生成器保持判别器作为"客观裁判"
    MuseTalkStage I: 重建 + 感知(学基础视觉) → Stage II: 加入 SyncNet + GAN(精细化同步和真实感)解决 Loss 冲突——先建立基础能力再引入冲突目标
    SadTalkerStage I: ExpNet → Stage II: PoseVAE → Stage III: Face Render(各模块独立训练)不同子问题用不同最优监督信号
    HalloStage I: 单帧生成(reference + target pairs) → Stage II: 音频驱动视频序列(训练 hierarchical cross-attention + temporal modules)先学静态生成能力再学时序动态
    VASA-1Stage I: 解耦表示学习(encoder/decoder + 一致性损失) → Stage II: 扩散 Transformer 运动生成先学解耦的面部潜在空间再学生成

    这些分阶段策略可以归纳为两种模式:能力递进式(MuseTalk, Hallo——先学基础再学精细)和模块独立式(SadTalker, VASA-1——各模块用不同 Loss 独立训练再组合)。LivePortrait 的两阶段是混合型:Stage I 是联合优化,Stage II 是模块冻结 + 轻量微调。

    3.2 模块化训练 vs 端到端

    模块化训练(SadTalker, VASA-1)的优势是每个模块可以用最合适的 Loss 和数据训练,调试方便——口型不准查 ExpNet,头动僵硬查 PoseVAE。但模块间的误差会累积:3DMM 系数预测不准会直接传播到渲染器。

    端到端训练(Hallo, VASA-1 的扩散阶段)的优势是可以全局优化,但训练更难收敛,且定位问题更困难。VASA-1 的折中方案是"两阶段端到端"——Stage I 做解耦表示学习(模块化),Stage II 在解耦空间中做端到端扩散生成 #Li-et-al.-2024-VASA1

    3.3 数据策略

    LivePortrait 的混合图像-视频训练是一个值得单独提及的数据策略 #Guo-et-al.-2024。仅在真实肖像视频上训练的模型对风格化肖像(如 anime)泛化差,而风格化肖像视频非常稀缺。LivePortrait 将单张图像视为一帧的视频片段参与训练,这种混合策略显著提升了泛化能力。

    Wing Loss 论文提出了pose-based data balancing #Feng-et-al.-2018——通过复制大姿态旋转的少数样本并注入随机扰动来平衡训练数据。这与 LivePortrait 的 cross-id motion 训练 stitching 模块异曲同工:都是通过故意增加训练难度来提升泛化。

    3.4 Loss 冲突与解决策略

    MuseTalk 对 Loss 冲突的分析是现有文献中最清晰的 #Zhang-et-al.-2024-MuseTalk。三个核心 Loss 的冲突关系:

    • 重建 vs GAN:重建损失倾向于平均化(模糊),GAN 推动真实感(锐利但可能不稳定)
    • GAN vs SyncNet:GAN 可能让模型复制参考帧已有的嘴型(偷懒),SyncNet 要求嘴型必须对应音频
    • SyncNet vs 重建:SyncNet 推动嘴部按音频变化,但边界可能变糊(重建损失的相反方向)

    解决策略总结:

    1. 两阶段训练(MuseTalk):先学基础视觉能力,再引入冲突目标
    2. 冻结判别器(Wav2Lip):保持 SyncNet 作为客观裁判不被生成伪影带偏
    3. 数据侧切断捷径(MuseTalk IFS/DMS):不让模型在训练时"偷看"参考帧的嘴型
    4. 分层区域优化(LivePortrait cascade):不同区域用不同判别器,避免全局优化互相干扰
    5. 模块化拆分(SadTalker):把冲突目标分到不同模块,各自独立训练
    Part 4
    跨系统 Loss 对比总表

    下表汇总了 12 个数字人系统的 Loss 使用情况。"✓"表示该系统使用了对应 Loss 族,括号内为具体形式。

    系统
  • 重建
  • 感知
  • 对抗
  • 同步
  • 身份
  • 关键点/运动
  • 生成模型
  • 阶段数
    face vid2vid✓ (L1)✓ (VGG)✓ (Equiv, KP, Pose, Def)1
    LivePortrait✓ (L1)✓ (VGG cascade)✓ (3×D cascade)✓ (ArcFace)✓ (Equiv, KP, Pose, Def, Wing)2
    Wav2Lip✓ (L1)✓ (VGG)✓ (Visual D)✓ (SyncNet frozen)2
    MuseTalk✓ (L1)✓ (VGG)✓ (Face+Lip D)✓ (SyncNet)2
    SadTalker✓ (3DMM)✓ (SyncNet frozen)✓ (3DMM residual)✓ (VAE ELBO)3
    Hallo✓ (Face enc)✓ (Diffusion ε)2
    VASA-1✓ (L1 swap)✓ (Cross-ID)✓ (DSM + CFG)2
    GeneFace✓ (Photometric)✓ (VGG)✓ (SyncNet)✓ (3DMM)2
    EMO2✓ (RefNet)✓ (MANO kp)✓ (Diffusion)2
    PerformRecast✗ (显式丢弃)1
    趋势观察:从 face vid2vid 到 LivePortrait,Loss 项从 6 个增长到 8 个,反映出 GAN 路线的 Loss 越来越精细。但从 Hallo 和 VASA-1 开始,扩散路线的系统反而用更少的 Loss——扩散去噪目标本身已经足够强大,很多约束(如感知质量、身份保持)可以通过架构设计(ReferenceNet, face encoder)而非额外 Loss 来实现。PerformRecast 甚至显式丢弃了 4 项关键点约束损失,暗示着当架构足够好时,手工约束可以被简化。
    Part 5
    设计模式与 Trade-offs

    5.1 "冻结专家"模式

    Wav2Lip 和 SadTalker 都采用了"冻结预训练判别器"的模式。SyncNet 在大规模唇读数据上预训练后,训练生成器时权重不更新。这个模式的本质是用预训练模型提供稳定的梯度信号——如果判别器跟着生成器一起训练,它会被生成伪影"带偏",失去客观裁判的角色。

    5.2 "级联区域"模式

    LivePortrait 的级联损失(全局 + 面部 + 唇部)是一个可复用的设计模式。核心思想是:不同面部区域的失败模式不同,需要独立的监督信号。唇部需要精确的牙齿和嘴角纹理,面部需要皮肤质感,全局需要背景一致性。这个模式可以推广到其他生成任务中。

    5.3 "先基础后冲突"模式

    MuseTalk 的两阶段训练揭示了一个通用原则:当多个 Loss 之间存在冲突时,先训练不冲突的子集建立基础能力,再引入冲突目标。这个原则不仅适用于 GAN + SyncNet 的冲突,也适用于其他多目标优化场景。

    5.4 "模块化拆分"模式

    SadTalker 的三模块独立训练(ExpNet + PoseVAE + Renderer)展示了"不同子问题用不同最优监督信号"的原则。强相关问题(表情)用确定性回归,弱相关问题(头姿)用生成式建模,纯视觉问题(渲染)用像素级一致性。这种拆分使训练更容易收敛和调试。

    5.5 "架构替代 Loss"模式

    VASA-1 和 Hallo 展示了一个趋势:当架构设计足够好时,某些 Loss 可以被简化或省略。VASA-1 用解耦表示学习(架构层面)替代了显式的身份保持 Loss 的一部分功能;Hallo 用 HADVS 的分层注意力(架构层面)替代了显式的区域级 Loss。PerformRecast 更进一步,直接丢弃了 4 项约束损失 #Liang-et-al.-2026

    5.6 Loss 数量 vs 训练复杂度的 Trade-off

    Loss 项越多,模型的表达能力越强,但训练复杂度也越高——需要调超参(权重配比)的维度增加,Loss 冲突的概率也增加。LivePortrait 的 8 项 Loss 是目前最复杂的组合,但论文没有给出完整的权重敏感性分析。相比之下,Hallo 只用扩散去噪损失 + 架构设计就达到了很好的效果,训练也更简单。

    Part 6
    开放问题
    1. Loss 权重的自动搜索:目前 Loss 权重几乎全靠手工调参。LivePortrait 的 8 项损失权重怎么配?Wav2Lip 的 4 项权重怎么配?缺乏系统性的自动搜索方法(如 Bayesian optimization 或 meta-learning)。
    2. Loss 冲突的自动检测:MuseTalk 手动分析了三个 Loss 的冲突关系,但更一般的问题是——给定一组 Loss,如何自动检测哪些 Loss 会冲突?梯度冲突检测(如 PCGrad #Yu-et-al.-2020)是一个可能的方向,但在数字人领域的应用尚未被系统研究。
    3. 扩散路线的 Loss 简化:扩散模型用去噪分数匹配一个目标就能训练,但生成质量高度依赖架构设计(ReferenceNet, HADVS, CFG)。哪些 GAN 路线中的 Loss(如身份保持、同步约束)可以"免费"被扩散架构吸收,哪些仍需显式约束?
    4. 跨语言同步损失:SyncNet 在英语数据(LRS2)上训练,对中文、日语等语言的同步判断可能不准。是否需要为不同语言训练专门的 SyncNet?或者设计语言无关的同步损失?
    5. 长时生成的 Loss 设计:现有 Loss 大多在短片段(几秒到几十秒)上评估。在长时生成(几分钟到几小时)中,身份漂移、表情冻结、运动重复等问题如何通过 Loss 设计来缓解?
    6. 3DGS 路线的 Loss 标准化:3D Gaussian Splatting 在数字人中的应用日益增长,但 Loss 设计(渲染损失、感知损失、同步损失、平滑损失)尚未形成像 GAN 路线那样的共识组合。
    7. Wing Loss 的泛化:Wing Loss 目前主要用于关键点定位和微表情驱动。它是否适用于其他需要关注小误差的场景,如 gaze 估计、眨眼检测?最优超参($w$, $\epsilon$)如何根据任务自动选择?
    References
    参考来源

    参考来源

    • Feng, Z.-H. et al. (2018). Wing Loss for Robust Facial Landmark Localisation with Convolutional Neural Networks. CVPR 2018. arXiv:1711.06753
    • Wang, T.-C. et al. (2020). One-Shot Free-View Neural Talking-Head Synthesis for Video Portraits (face vid2vid). NeurIPS 2020. arXiv:2011.15126 · 精读 →
    • Guo, J. et al. (2024). LivePortrait: Animate Every Face Quickly and Well with a Few Keypoints. arXiv 2024. arXiv:2406.02880 · 精读 →
    • Prajwal, K. et al. (2020). A Lip Sync Expert Is All You Need: Cascaded GANs for Rich Audio-to-Video Generation (Wav2Lip). ACM MM 2020. arXiv:2008.10010 · 精读 →
    • Zhang, W. et al. (2023). SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation. CVPR 2023. arXiv:2211.12194 · 精读 →
    • Zhang, Y. et al. (2024). MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling. arXiv 2024. arXiv:2501.01895 · 精读 →
    • Xu, M. et al. (2024). Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation. arXiv 2024. arXiv:2406.08801 · 精读 →
    • Li, S. et al. (2024). VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time. arXiv 2024
    • Zielonka, W. et al. (2023). GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis. ICLR 2023. arXiv:2301.13430
    • Wang, J. et al. (2025). EMO2: End-Effector Emotive Body Beyond Face. arXiv 2025 · 精读 →
    • Chung, J.S. & Zisserman, A. (2016). Out of time: automated lip sync in the wild. ACCV 2016 Workshop (SyncNet).
    • Deng, J. et al. (2019). ArcFace: Additive Angular Margin Loss for Deep Face Recognition. CVPR 2019. · 精读 →
    • Yin, T. et al. (2024). One-step Diffusion with Distribution Matching Distillation (DMD/DMD2). ICML 2024.
    • Liang, X. et al. (2026). PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing. CVPR 2026. arXiv:2603.19731 · 精读 →
    • Rakesh, V.K. et al. (2025). Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions. arXiv:2507.02900
    • Springer The Visual Computer (2025). Advancements in talking head generation: a comprehensive review. DOI:10.1007/s00371-025-04232-w
    • Yu, T. et al. (2020). Gradient Surgery for Multi-Task Learning (PCGrad). NeurIPS 2020.
    • Liang, B. et al. (2022). Expressive Talking Head Generation with Granular Audio-Visual Control. CVPR 2022.