JoyVASA
论文信息
- 标题:JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation
- 作者:Xuyang Cao, Guoxin Wang, Sheng Shi, Jun Zhao, Yang Yao, Jintao Fei, Minyu Gao, Pei Xie
- 单位:JD Health International;Zhejiang University
- 发表:arXiv, 2024
- DOI:10.48550/arXiv.2411.09209
- 开源:https://github.com/jdh-algo/JoyVASA
音频驱动肖像动画(Audio-Driven Portrait Animation)是数字人领域中最具应用价值的方向之一:给定一张静态图片和一段音频,生成嘴型同步、表情自然的动画视频 #Cao-et-al.-2024。这个方向经历了三代技术演进——从早期 GAN 端到端方法(Wav2Lip、DINet)的"只动嘴",到 Two-stage 中间表征方法(SadTalker、DreamTalk)的解耦尝试,再到 2024 年扩散模型(EMO、Hallo、VASA-1)带来的质量飞跃 #Tian-et-al.-2024 #Xu-et-al.-2024-VASA。
然而,扩散模型在提升生成质量的同时,也带来了新的问题。多数端到端扩散方法一次只生成约 10 帧(约 0.4 秒 @ 25fps),导致帧间连续性不足、时序抖动 #Cao-et-al.-2024。更关键的是,这些方法的运动生成往往与特定身份绑定——换一张脸就需要重新提取参考动作,无法做到"一次训练,万物驱动"。
JoyVASA 的核心思路是:把身份和运动彻底拆开。通过复用 Ditto">LivePortrait 的解耦表征框架分离静态外观与动态运动,再用一个轻量的扩散 Transformer 仅从音频生成身份无关的运动序列。这种设计使得同一个运动生成模型可以驱动人类、动物、动漫角色甚至手工艺品——这在端到端方法中几乎不可能实现。
要理解 JoyVASA 的设计动机,我们需要看清当前扩散驱动方法面临的两个结构性问题。
问题一:短帧生成的时序断裂
多数端到端扩散方法(EMO、Hallo、EchoMimic 等)在推理时一次预测约 10 帧图像,对应标准 25fps 帧率下的 0.4 秒 #Guan-et-al.-2023 #Chen-et-al.-2024。这意味着模型在每一段只"看到"极短的上下文,无法有效捕捉前序运动趋势。结果就是帧间拼接处容易出现时序抖动和外观形变——尤其是头部大幅转动时,不同段之间的姿态可能不一致。
部分工作试图通过增加预测帧数和前序帧数来缓解这一问题 #Jiang-et-al.-2024,但这直接增加了扩散模型的计算负担——对于像素级端到端生成,每多一帧都意味着 UNet 或 DiT 需要处理更多的空间信息。
问题二:身份与运动的纠缠
端到端方法的另一个隐性约束是:运动生成过程依赖图像特征。无论是 EMO 的 speed embedding、Hallo 的 facial landmarks 还是 AniPortrait 的 keypoints guidance,这些额外条件都从参考图像或参考视频中提取。这意味着:
- 灵活性受限:每次生成新角色的动画,都需要从该角色的视频中提取参考动作
- 跨域泛化差:模型训练在人脸数据上,很难直接驱动动物或卡通角色
- 训练成本高:扩散模型同时学习外观渲染和运动生成,参数量大、训练周期长
JoyVASA 的核心 Insight
如果把面部表示拆成"静态外观"和"动态运动"两个独立分量,那么扩散模型只需要学习 音频 → 运动 这个低维映射,完全不需要"看到"图像。运动序列一旦生成,可以配合任意身份的外观特征做渲染。这就是 JoyVASA 两阶段设计的出发点。
JoyVASA 的架构清晰地分为两个阶段。第一阶段利用 LivePortrait 完成面部表示的解耦,第二阶段训练一个轻量扩散 Transformer 从音频生成运动序列。
Stage 1:面部表示解耦
第一阶段直接复用 LivePortrait #Guo-et-al.-2024 的解耦框架。给定源图像 $s$ 和驱动视频 $d_1, \ldots, d_N$,框架通过两个编码器提取不同性质的特征:
- 外观编码器 $E_{app}$:从源图像提取 3D 面部嵌入 $f_{face}$,编码身份、纹理、结构等静态属性
- 运动编码器 $E_{mnt}$:从每帧图像提取运动参数,包括规范空间关键点 $x_c$、位移 $\delta$、旋转矩阵 $R$、平移向量 $t$ 和缩放因子 $s$
核心变换公式定义了从规范空间到实际空间的映射:
这个公式的物理含义非常直观:$x_c$ 是一张"标准正面脸"的基准关键点;乘以 $R$ 旋转到实际头部朝向;加上 $\delta$ 做局部表情位移(张嘴、皱眉);乘以 $s$ 缩放到实际距离;最后加上 $t$ 平移到图像中的位置。源图像和驱动帧共享同一套 $x_c$,但运动参数不同——这正是解耦的关键。
为什么选择 LivePortrait 而非 3DMM?
传统 3DMM(如 FLAME)用线性基底表示面部,表达能力有限,难以捕捉复杂微妙表情 #Li-et-al.-2017。LivePortrait 用深度网络将 3D 面部映射到非线性参数空间,用更少的参数表示更复杂的动态,同时保持显式的物理可解释性(旋转、平移、缩放、位移都有明确含义)。
Stage 2:音频驱动运动序列生成
第二阶段是 JoyVASA 的核心贡献。目标是训练一个扩散模型,仅从音频线索生成完整的运动序列 $X_i = [R_i, t_i, \delta_i, s_i]$,完全独立于角色身份。
其中 $D$ 是 6 层 Transformer decoder,$X^t$ 是加噪运动,$X^0$ 是已知干净运动,$A$ 是音频特征,$t$ 是扩散时间步。初始窗口的前序部分用可学习的起始特征 $A_{start}$ 和 $X_{start}$ 替代。
与 VASA-1 条件设计的对比
JoyVASA 的条件集 $C = [X_{-W_{pre}:0},\; A_{-W_{pre}:W_{cur}}]$ 比 VASA-1 更紧凑。VASA-1 额外编码了凝视方向(gaze direction)和头部到相机距离作为独立条件,而在 JoyVASA 中,这些信息已经隐含在运动参数 $\delta$(关键点位移,包含凝视相关信息)和 $s$(缩放因子,编码距离变化)中 #Xu-et-al.-2024-VASA。
其中 $\gamma_c$ 是 CFG 尺度参数。一个实用的好处是:通过调节 $\gamma_c$,用户可以在推理时控制运动风格的多样性——较高的 $\gamma_c$ 产生更夸张的表情,较低的 $\gamma_c$ 则更保守。
直接预测干净运动而非噪声:与标准扩散模型预测噪声 $\epsilon$ 再间接恢复信号不同,JoyVASA 的扩散模型直接采样干净运动序列 $X^0$。这一选择使得四重损失函数可以直接在预测值与真实值之间施加约束,而不需要经过噪声预测的间接传导 #Cao-et-al.-2024。配合 velocity loss 和 smooth loss 的多层级约束,模型在生成运动序列的时序一致性上获得了显著优势。 随机截断训练:训练过程中,音频样本的长度会被随机截断。这一策略看似简单,实际上至关重要——它使模型对不同长度的语音序列具有鲁棒性,为滑窗推理时处理不等长音频打下了基础。如果没有这种训练时的数据增强,模型在推理时遇到短于窗口长度的音频段时可能产生不稳定输出 #Cao-et-al.-2024。训练数据与清洗
训练数据来自三个来源:公开的 HDTF 数据集 #Zhang-et-al.-2021、CelebV-HQ 数据集 #Zhu-et-al.-2022 和团队自建的私有中文高分辨率说话数据集。数据清洗采用三重过滤流水线:
- 视频质量过滤:使用 QAlign #Wu-et-al.-2023 视频质量评估模型排除低质量样本
- 唇同步过滤:使用 SyncNet #Chung-et-al.-2016 排除音频-视觉同步分数低的视频
- 运动幅度过滤:移除头部运动过大的 clips,避免训练中的形变失真
最终获得 5,578 个视频 clips,单个 clip 时长从 8 秒到数分钟不等。为平衡三个数据集的样本量,训练时采用 oversampling 策略确保每个数据集贡献可比的样本量。
损失函数设计
JoyVASA 的扩散模型直接预测干净运动序列 $X^0$(而非噪声 $\epsilon$),配合四重损失施加多层级约束:
- Sample Loss $\mathcal{L}_{sample}$(权重 1.0):预测运动与真实运动的 $L_2$ 距离,位置级精度约束
- Velocity Loss $\mathcal{L}_{vel}$(权重 $\lambda_{vel}=5.0$):相邻帧速度差的 $L_2$ 距离,最高优先级,确保帧间运动连续
- Smooth Loss $\mathcal{L}_{smooth}$(权重 $\lambda_{smooth}=0.5$):加速度级约束,惩罚剧烈变化
- Expression Loss $\mathcal{L}_{exp}$(权重 $\lambda_{exp}=0.1$):专门针对关键点位移 $\delta$ 的损失,聚焦唇部运动和面部表情
从权重数值可以推断优先级为:速度一致性 > 位置精度 > 平滑性 > 表情细节。velocity loss 的权重高达 5.0,反映了作者对时序连续性的极端重视——这也直接呼应了 Part 2 中分析的"短帧困境"问题。
训练配置披露
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | HDTF + CelebV-HQ + 私有中文数据集,共 5,578 clips(8s~数分钟/clip) |
| 训练硬件 | 已披露 | NVIDIA A800 GPU × 1(通常 80GB 显存) |
| 优化器 | 已披露 | Adam(β1, β2, ε, weight decay 未给出) |
| 学习率 | 已披露 | 1×10⁻⁴(schedule / warmup 未给出) |
| Batch size | 已披露 | 16 |
| 训练步数 | 已披露 | 20,000 iterations |
| 训练时长 | 未披露 | 原文未给出(推断:6 层 Transformer + 20k steps + 单卡 A800,预计数小时量级) |
| 模型参数量 | 部分披露 | 6-layer transformer decoder, 8 heads, dim=512(总参数量未给出) |
| 精度格式 | 未披露 | 原文未给出 FP16/BF16/mixed precision 信息 |
| Checkpoint 策略 | 未披露 | 原文未给出选择标准 |
| 窗口参数 | 已披露 | W_cur=100, W_pre=25 |
| CFG drop 概率 | 已披露 | 0.1(训练时随机 drop audio condition) |
值得注意的是,整个第二阶段只需训练一个轻量的 6 层 Transformer——外观编码器、运动编码器和渲染器全部来自第一阶段的 LivePortrait 且冻结不更新。这使得训练成本远低于端到端扩散方法。
推理时,JoyVASA 的管线分为四步:
关于推理速度,论文未给出精确的 latency 或 throughput 数值。但可以推断:6 层 Transformer(dim=512)的去噪网络在单个窗口内(100 帧)的推理开销远低于端到端扩散模型处理同等帧数的 UNet——前者操作在低维运动参数空间,后者操作在高维像素/latent 空间。实际推理瓶颈更可能出现在 LivePortrait 的逐帧渲染环节,而非扩散采样环节。
实验配置
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | celebV-HQ test(50 人 × 2 clips)+ Openset(50 张互联网图片 + 50 段音频,含真人/动漫/手工/动物) |
| 评测指标 | 已披露 | IQA↑ / VQA↑ / Sync-C↑ / Sync-D↓ / FVD-25↓ / Smooth↑ |
| Baseline 方法 | 已披露 | EchoMimic, AniPortrait, Hallo, JoyHallo |
| 推理硬件 | 未披露 | 原文未给出推理使用的 GPU 型号(训练用 A800) |
| 推理分辨率 | 未披露 | 原文未给出 |
| 推理环境 | 未披露 | 原文未给出框架/版本信息 |
主实验结果:celebV-HQ 测试集
| Method | IQA(%)↑ | VQA(%)↑ | Sync-C↑ | Sync-D↓ | FVD-25↓ | Smooth(%)↑ |
|---|---|---|---|---|---|---|
| EchoMimic | 64.46 | 68.85 | 4.60 | 13.90 | 904.07 | 99.44 |
| AniPortrait | 74.85 | 78.00 | 1.98 | 13.28 | 623.00 | 99.66 |
| Hallo | 68.83 | 72.95 | 6.25 | 14.05 | 558.96 | 99.47 |
| JoyHallo | 69.15 | 74.00 | 6.36 | 14.23 | 755.61 | 99.38 |
| JoyVASA | 68.97 | 72.42 | 4.85 | 13.53 | 459.04 | 99.60 |
JoyVASA 在有 ground truth 的 celebV-HQ 测试集上取得了最低的 FVD-25 分数(459.04),比第二名 Hallo(558.96)低了约 18% #Cao-et-al.-2024。FVD 衡量的是生成视频的时序分布与真实视频分布的距离——这个指标最优说明 JoyVASA 生成的视频在整体时序连贯性和自然度上确实领先。Smoothness 达到 99.60%,仅次于 AniPortrait 的 99.66%。
但在 IQA/VQA 图像/视频质量评分上,JoyVASA(68.97/72.42)落后于 AniPortrait(74.85/78.00)。Sync-C 也不如 JoyHallo 的 6.36。这反映了一个 trade-off:解耦设计换来了更好的时序一致性(FVD),但单帧渲染质量受限于 LivePortrait 生成器的上界。
消融实验
论文未提供正式的消融实验。从实验结果和方法设计可以推断的关键结论是:velocity loss($\lambda_{vel}=5.0$)和滑窗策略是 FVD 指标领先的主要贡献因素,但这一推断缺乏逐组件去除的定量验证。论文也未给出不同 CFG 尺度 $\gamma_c$ 的系统对比,仅在定性结果中提到可调节。
Openset 测试集:跨域泛化
| Method | IQA↑ | VQA↑ | Sync-C↑ | Sync-D↓ | Smooth↑ |
|---|---|---|---|---|---|
| EchoMimic | 75.66 | 82.73 | 4.12 | 13.79 | 99.20 |
| AniPortrait | 81.84 | 87.62 | 2.67 | 14.09 | 99.55 |
| Hallo | 75.37 | 83.85 | 5.39 | 13.91 | 99.33 |
| JoyHallo | 73.87 | 84.09 | 5.91 | 14.11 | 99.32 |
| JoyVASA | 71.45 | 77.78 | 5.72 | 14.01 | 99.48 |
Openset 的结果进一步印证了 JoyVASA 的优劣势分布。IQA/VQA 差距更大(71.45 vs AniPortrait 的 81.84),因为开放域图像包含动漫、动物等非人脸内容,LivePortrait 的泛化能力不如端到端方法的像素级渲染。
跨物种驱动:JoyVASA 的独特能力
这是 JoyVASA 最引人注目的特性。由于扩散模型在生成运动时完全不"看到"图像,同一套音频→运动映射可以直接应用于:人类肖像、动漫角色、手绘艺术品、甚至动物面部。这在端到端方法中很难实现——EMO 和 Hallo 的扩散模型深度耦合人脸先验与参考动作条件,在动物图片上的适用性极为有限。
作者也坦诚承认了代价:因为运动与身份解耦,不同角色在同一段音频下可能产生相似的表情模式。但通过调节 CFG 权重 $\gamma_c$,可以获得不同风格的运动结果。
失败案例与局限
- 大姿态退化:LivePortrait 在大头部姿态时性能下降,这是生成质量的上界瓶颈,作者明确承认 #Cao-et-al.-2024
- 表情趋同:不同角色对同一音频可能产生相似表情,需手动调节 CFG 缓解
- Retargeting 不适用:LivePortrait 的跨身份 retargeting 模块在纯音频驱动场景下不可用
竞品定位对比
| 维度 | JoyVASA | VASA-1 | SadTalker | EMO/Hallo |
|---|---|---|---|---|
| 核心路线 | 解耦 + 扩散运动 | 扩散运动 + Megaportrait | 3DMM + GAN | 端到端扩散 |
| 运动表征 | LivePortrait 参数 | Holistic dynamics | 3DMM 系数 | 像素/latent |
| 音频条件 | wav2vec2 | wav2vec2 | mel-spectrogram | whisper/wav2vec2 |
| 身份独立性 | 完全独立 | 部分独立 | 部分独立 | 强耦合 |
| 跨物种驱动 | 支持 | 不支持 | 不支持 | 不支持 |
| 长视频能力 | 滑窗,无上限 | 实时流式 | 逐帧 | 约 0.4s/段 |
| FVD-25 | 459 | — | — | 559 (Hallo) |
可操作的启发
- 解耦路线在 FVD 上有结构性优势:JoyVASA 的 FVD-25 比所有端到端方法都低,说明"先生成运动再渲染"的管线在时序一致性上确实更优。如果你的应用场景更看重"自然流畅"而非"单帧清晰度",解耦路线是更好的选择。
- 冻结预训练编码器是降本利器:wav2vec2 和 LivePortrait 编码器全部冻结,只训练 6 层 Transformer 的 20k steps——这是工程上非常务实的设计,训练成本极低。
- velocity loss 的权重设计值得借鉴:$\lambda_{vel}=5.0$ 是四个 loss 中最高的,反映了作者对时序连续性的优先级判断。在做任何序列生成任务时,速度一致性约束都是减少抖动的第一道防线。
- 身份解耦的 trade-off 需要正视:跨物种驱动是亮点,但单帧质量的损失也是真实的。在数字人产品中,如果只需要驱动真人肖像,端到端方法可能仍然是更优选择。
未来方向
作者提到的改进路线包括:用 EMOPortrait #Drobyshev-et-al.-2024 替代 LivePortrait 以增强大姿态鲁棒性、优化实时推理能力、以及引入更精细的表情控制机制。这些方向与数字人领域的整体演进趋势一致——从"能生成"到"生成得好"再到"可控地生成"。
参考来源
- Cao, X. et al. (2024). JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation. arXiv:2411.09209
- Guo, Y. et al. (2024). LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control. arXiv:2407.03168 · 精读 →
- Xu, S. et al. (2024). VASA-1: Lifelike Audio-Talking Avatars. arXiv:2404.10667
- Tian, Q. et al. (2024). EMO: Emote Portrait Alive. ECCV 2024. arXiv:2402.17485
- Baevski, A. et al. (2020). wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations. NeurIPS 2020. arXiv:2006.11477
- Zhang, W. et al. (2023). SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation. CVPR 2023. arXiv:2211.12194
- Wei, Z. et al. (2024). AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation. arXiv:2402.17768 · 精读 →
- Xu, S. et al. (2024). Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation. arXiv:2406.08801 · 精读 →
- Chen, J. et al. (2024). EchoMimic: Lifelike Audio-Driven Portrait Animations. arXiv:2407.08136 · 精读 →
- Shi, S. et al. (2024). JoyHallo: Digital Human Model for Mandarin. arXiv:2409.13268
- Zhang, S. et al. (2021). FACIAL: Synthesizing Dynamic Talking Face with Implicit Attribute Learning. ICCV 2021. · 精读 →
- Zhu, H. et al. (2022). CelebV-HQ: A Large-Scale Video Facial Attributes Dataset. ECCV 2022.
- Wu, H. et al. (2023). Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels. arXiv:2312.17090
- Chung, J.S. & Zisserman, A. (2016). Out of Time: Automated Lip Sync in the Wild. ACCV 2016.
- Li, T. et al. (2017). Learning a Model of Facial Shape and Expression from 4D Scans (FLAME). SIGGRAPH Asia 2017.
- Drobyshev, A. et al. (2024). EMOPortraits: Emotion-enhanced Multimodal One-shot Head Avatars. arXiv:2404.19110
- Guan, Z. et al. (2023). StyleSync: High-Fidelity Generalized and Customizable Lip Sync Animation. CVPR 2023.
- Jiang, Z. et al. (2024). Loopy-Audio-Driven Expressive and Vivid Talking Face Generation.