LIA-X
肖像动画的核心任务是将驱动视频中的面部动态(头部姿态、表情)迁移到一张静态肖像图像上。当前主流方法遵循 warp-render 范式:先估计运动(关键点、光流或隐式运动码),再用 warp 操作变形源图像,最后通过渲染网络生成结果。FOMM #Siarohin-et-al.-2019、face vid2vid #Wang-TC-et-al.-2021、LivePortrait #Guo-et-al.-2024 和 LIA #WangY-et-al.-2024 都属于这一路线。
这些方法有一个共同的瓶颈:当源肖像和驱动视频的初始姿态、表情差异较大时,动画质量急剧下降。原因在于 warp-render 范式没有"对齐源和驱动初始帧"的机制——源图像是什么样就是什么样,模型只能被动地从源出发做运动迁移 #WangY-et-al.-2025。
LIA-X 来自上海 AI Lab 和法国 Inria 的联合团队,一作 Yaohui Wang(王耀晖)正是前作 LIA 的作者。论文的核心洞察是:如果运动字典的每个向量都有明确的语义含义(如"张嘴"、"转头"),那么我们就可以在动画前先用这些向量编辑源肖像,让它尽量接近驱动视频的第一帧,再做运动传递。这就是 LIA-X 提出的 edit-warp-render 策略 #WangY-et-al.-2025。
实现这一目标的关键技术是 Sparse Motion Dictionary——在 LIA 的运动字典上施加 $L_1$ 稀疏约束,迫使模型用最少数量的运动向量重建每帧图像。这个看似简单的改进带来了深刻的变化:稀疏约束使运动向量自然解耦,不同向量编码不同语义,几乎所有被激活的向量都对应人类可理解的含义(如 yaw、pitch、roll、张/闭嘴、皱/挑眉等)。
此外,LIA-X 还验证了该架构的可扩展性,成功训练了约 10 亿参数的大规模模型,在多个基准测试上超越了 SOTA 方法 #WangY-et-al.-2025。论文已被 ICCV 2025 接收(Paper ID: 3057)。
运动字典的语义纠缠
LIA(Latent Image Animator)是 LIA-X 的直接前身,首次将肖像动画建模为潜空间中的线性导航 #WangY-et-al.-2024。LIA 的运动字典 $D_m$ 包含一组正交运动向量 $\{\mathbf{d}_1, ..., \mathbf{d}_M\}$,任意运动可表示为这些向量的线性组合。虽然 LIA 的运动字典已含有一定的语义信息,但作者发现一个关键问题:多个语义纠缠在同一个向量中,难以独立控制单个因素如嘴部运动、眉毛表情等。
具体来说,当运动字典没有稀疏约束时,模型在重建每帧图像时会激活几乎所有运动向量。这意味着每个向量都需要同时编码多种语义,不同语义之间高度耦合。用户无法单独操纵某个向量来实现特定的面部编辑——调一个向量可能同时改变嘴巴、眼睛和头部姿态。
规模化的天花板
另一个问题是架构可扩展性。此前基于隐式关键点的方法(FOMM、face vid2vid、LivePortrait)通常使用简单且小规模的网络架构,模型容量受限。LIA 的原始实现同样如此。要提升生成质量和泛化能力,需要更大的模型和更多的训练数据,但简单堆叠网络层会导致训练不稳定 #WangY-et-al.-2025。
同时,diffusion-based 方法(如 X-Portrait #WangD-et-al.-2024)凭借大规模预训练的强大泛化能力正在崛起,但推理速度慢是其固有劣势。autoencoder 路线如果能在规模化后达到与 diffusion 方法相当的质量,同时保持推理速度优势,将是更有工程价值的方向。
| 方法 | 范式 | 运动表示 | 可编辑 | 推理速度 |
|---|---|---|---|---|
| FOMM #Siarohin-et-al.-2019 | warp-render | 一阶关键点 | 否 | 快 |
| LIA #WangY-et-al.-2024 | warp-render | 稠密运动字典 | 困难(语义纠缠) | 快 |
| LivePortrait #Guo-et-al.-2024 | warp-render | 隐式关键点 + stitching | 否 | 快 |
| X-Portrait #WangD-et-al.-2024 | warp-render | SD 分层运动注意力 | 否 | 慢(多步去噪) |
| LIA-X | edit-warp-render | 稀疏运动字典 | 是(细粒度) | 快 |
LIA 的线性导航框架
要理解 LIA-X 的创新,需要先理解 LIA 的数学基础。LIA 将肖像动画建模为潜空间中的"线性导航":对于源图像 $x_s$ 和驱动图像 $x_d$ 之间的变换 $x_s \to x_d$,LIA 证明存在一个"隐式参考图像" $x_r$,使得变换可以分解为 $x_s \to x_r \to x_d$。在隐空间中,运动码 $z_{s \to d}$ 可表示为:
线性导航公式(LIA 核心)
其中 $z_{s \to r} = E(x_s)$ 是编码器从源图像提取的变换码,$\{\mathbf{d}_1, ..., \mathbf{d}_M\}$ 是运动字典 $D_m$ 中的 $M$ 个正交运动向量,$\mathcal{A}_{r \to d} = \{a_1, ..., a_M\}$ 是由 FC 层从驱动图像编码获得的运动系数。运动路径 $w_{r \to d} = \sum a_i \mathbf{d}_i$ 表示从参考到驱动的运动方向。
获得 $z_{s \to d}$ 后,光流生成器 $G_f$ 生成多尺度光流 $\phi_{s \to d}$,warp 操作 $\mathcal{T}$ 变形源图像特征,渲染网络 $G_r$ 生成最终图像:
LIA 的训练使用自监督学习,目标函数包含 $L_1$ 重建损失、VGG 感知损失和对抗损失:
一个自然的疑问是:既然 LIA 已经有了运动字典,为什么语义还会纠缠?答案在于 LIA 的字典没有稀疏约束——训练时模型可以自由地激活所有向量来最小化重建误差,没有动力让不同向量编码不同语义。
Sparse Motion Dictionary:一个简单但深刻的改进
LIA-X 的核心创新是受稀疏字典编码(Sparse Dictionary Coding)#Aharon-et-al.-2006 启发,在运动系数 $\mathcal{A}_{r \to d}$ 上施加 $L_1$ 稀疏惩罚。改进后的损失函数为:
LIA-X 损失函数
其中 $S(\cdot)$ 实现为 $L_1$ 范数:$S(\mathcal{A}) = \|\mathcal{A}\|_1 = \sum_{i=1}^{M} |a_i|$。$\lambda_1$ 和 $\lambda_2$ 是平衡系数。与 LIA 相比,唯一的区别是多了最后一项稀疏惩罚。
$L_1$ 范数促使运动系数稀疏化——大部分 $a_i$ 趋近于零,仅少数被显著激活。这迫使模型用最少数量的运动向量重建每帧图像。不同帧激活不同的向量子集,自然引导不同向量编码不同语义。
论文的可视化(Figure 3)清晰地展示了这一效果:无稀疏约束时,几乎全部向量被激活;有稀疏约束时,仅少数向量被激活,且激活模式对不同输入具有选择性。
Edit-Warp-Render:从被动迁移到主动对齐
有了可解释的运动字典,LIA-X 提出了 edit-warp-render 策略。传统 warp-render 的推理公式为:
即在源图像自重建的基础上叠加驱动的相对运动。LIA-X 将自重建项 $z_{s \to s}$ 替换为编辑后的运动码 $z_{s \to \mathcal{E}(s)}$:
Edit-Warp-Render 推理公式
其中 $\mathcal{E}(\cdot)$ 表示对源图像的编辑操作。不编辑时 $\mathcal{E}(s) = s$,公式退化为 LIA 的原始形式。编辑操作通过线性操纵运动向量实现:$z_{s \to \mathcal{E}(s)} = z_{s \to s} + a_i \mathbf{d}_i$。
核心思路是:先用可解释运动向量编辑源肖像,使其头部姿态和表情尽量接近驱动视频第一帧,再做运动传递。编辑操作缩小了源与驱动初始帧的差异,使后续运动传递在更小的偏差上进行,从而显著提升大姿态/表情差异场景下的动画质量。
以下是 LIA-X 完整 pipeline 的流程图:
graph TD S["源图像 xs"] --> E["编码器 E"] E --> ZSR["z_s→r"] D["驱动图像 xd"] --> E2["编码器 E"] E2 --> FC["FC 层"] FC --> A["运动系数 A"] A --> SPARSE["L1 稀疏约束"] DM["运动字典 Dm"] --> W["w_r→d = Σ ai·di"] A --> W ZSR --> ZSD["z_s→d = z_s→r + w_r→d"] W --> ZSD ZSD --> GF["光流生成器 Gf"] GF --> PHI["多尺度光流 φ"] S --> WARP["Warp 操作 T"] PHI --> WARP WARP --> GR["渲染网络 Gr"] GR --> OUT["生成图像 x_s→d"] SPARSE -.->|训练时约束| A
可扩展架构
LIA-X 沿用 LIA 的整体架构(编码器 $E$ + 光流生成器 $G_f$ + 渲染网络 $G_r$),但在编码器和生成器中引入了受 StyleGAN-T #Sauer-et-al.-2023 启发的残差块。为防止大规模模型训练不稳定,作者为 $G_f$ 和 $G_r$ 设计了新型残差块。规模化策略聚焦于三个维度:增加通道数、增加残差块深度、增大运动字典大小。三个维度同时扩展,最大模型达到约 10 亿参数。
训练配置
训练数据混合了 4 个公开数据集(VoxCelebHQ、TalkingHead-1KH、HDTF、MEAD)和 1 个内部数据集,共约 50 万 talking head 序列、9400 万帧、5.5 万身份。训练使用 8 张 A100 GPU,大规模模型训练时使用梯度累积(gradient accumulation)增加有效 batch size。训练分辨率为 256×256 和 512×512 两个版本。
以下是按 10 项标准字段整理的训练配置披露表:
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | VoxCelebHQ + TalkingHead-1KH + HDTF + MEAD + 1 内部集;共 0.5M 序列 / 94M 帧 / 55K 身份 |
| 训练硬件 | 已披露 | 8× A100 GPU(显存规格未说明) |
| 优化器 | 未披露 | 原文未明确给出(推测 Adam/AdamW,基于 GAN 训练惯例) |
| 学习率 | 未披露 | 原文未明确给出初始值、schedule 和 warmup |
| Batch size | 部分披露 | 使用 gradient accumulation 增加 effective batch size,具体累积步数未给出 |
| 训练步数 / 轮数 | 未披露 | 原文未明确给出 iterations 或 epochs |
| 训练时长 | 未披露 | 原文未明确给出训练总时长 |
| 模型参数量 | 已披露 | 三个规模:Base 0.05B、Middle 0.3B、Large 0.9B(~1B) |
| 精度格式 | 未披露 | 原文未明确给出 FP32/FP16/BF16/混合精度 |
| Checkpoint 策略 | 未披露 | 原文未明确给出模型选择标准 |
| 损失函数参数 | 部分披露 | $\lambda_1$(感知损失权重)和 $\lambda_2$(稀疏惩罚权重)具体数值未给出 |
| 编辑扰动范围 | 已披露 | 推理编辑时 $a_i \in [-0.5, 0.5]$,步长 0.1 |
| 训练分辨率 | 已披露 | 256×256 和 512×512 两个版本分别训练 |
有了 Sparse Motion Dictionary,LIA-X 展现出多种传统 warp-render 方法无法实现的应用能力。这些应用都基于同一个操作:线性操纵单个运动向量 $z_{s \to \mathcal{E}(s)} = z_{s \to s} + a_i \mathbf{d}_i$。
3D-aware 肖像操控
无需任何显式 3D 表征(3DMM、深度图等),LIA-X 的运动向量中自然涌现了三维旋转语义。通过操纵对应向量,可以实现 yaw(偏航)、pitch(俯仰)和 roll(翻滚)三个维度的头部旋转控制 #WangY-et-al.-2025。
细粒度图像编辑
除了 3D 旋转,LIA-X 还能控制更细粒度的面部属性:张/闭嘴、皱/挑眉、张/闭眼、嘟嘴、微笑等。所有这些语义都是通过自监督学习自动解耦的,无需任何标注。用户可以线性组合不同语义操作来实现复杂编辑 #WangY-et-al.-2025。
视频编辑
将图像编辑扩展到视频层面:对真实视频的首帧应用编辑操作,然后用 edit-warp-render 公式传递运动。下图展示了用 LIA-X 旋转真实视频中人物头部姿态的效果,身份保持良好 #WangY-et-al.-2025。
自重演(Self-Reenactment)
在 VoxCelebHQ 和 TalkingHead-1KH 验证集上,LIA-X 在 256×256 和 512×512 两个分辨率下与 GAN-based 和 diffusion-based 方法对比。L1、LPIPS、SSIM、PSNR、FID 五个指标上的结果如下(节选 512×512 分辨率):
| 方法 | L1 ↓ | LPIPS ↓ | SSIM ↑ | PSNR ↑ | FID ↓ |
|---|---|---|---|---|---|
| X-Portrait #WangD-et-al.-2024 | 0.110 | 0.302 | 0.56 | 16.99 | 19.92 |
| LivePortrait #Guo-et-al.-2024 | 0.087 | 0.264 | 0.67 | 17.45 | 12.90 |
| LIA #WangY-et-al.-2024 | 0.052 | 0.211 | 0.68 | 22.14 | 21.86 |
| LIA-X | 0.040 | 0.160 | 0.75 | 24.39 | 12.50 |
以上为 VoxCelebHQ 512×512 分辨率结果。LIA-X 在所有指标上全面超越所有方法。与直接前身 LIA 相比,L1 从 0.052 降至 0.040(↓23%),PSNR 从 22.14 升至 24.39(↑2.25 dB),提升幅度显著。
跨重演(Cross-Reenactment)
跨重演是更 challenging 的任务——源和驱动来自不同身份。在 HDTF + AAHQ 构建的 140 个测试视频上,用 Identity Similarity 和 Image Quality 两个指标评估:
| 方法 | ID Similarity ↓ | Image Quality ↑ |
|---|---|---|
| FOMM #Siarohin-et-al.-2019 | 0.262 | 37.08 |
| DaGAN | 0.272 | 39.30 |
| TPS | 0.216 | 38.27 |
| MCNet | 0.252 | 37.88 |
| X-Portrait #WangD-et-al.-2024 | 0.217 | 55.41 |
| LivePortrait #Guo-et-al.-2024 | 0.243 | 51.41 |
| LIA-X | 0.206 | 58.74 |
LIA-X 在两个指标上均取得最优。Identity Similarity 越低越好(0.206),说明生成图像更好地保持了源身份。Image Quality 越高越好(58.74),说明生成质量最优。这正是 edit-warp-render 策略的价值——通过先编辑源肖像对齐驱动初始帧,大幅减少了跨身份场景下的初始偏差。
规模化消融实验
论文训练了三个规模的模型(0.05B、0.3B、0.9B),保持其他训练配置不变,仅改变残差块数量、通道数和运动字典大小:
| 模型 | VoxCelebHQ L1 ↓ | VoxCelebHQ PSNR ↑ | TalkingHead L1 ↓ | TalkingHead PSNR ↑ |
|---|---|---|---|---|
| Base (0.05B) | 0.043 | 23.62 | 0.042 | 24.98 |
| Middle (0.3B) | 0.040 | 24.31 | 0.035 | 25.84 |
| Large (0.9B) | 0.040 | 24.39 | 0.035 | 26.07 |
值得注意的是,在 TalkingHead-1KH 上 0.3B → 0.9B 的 PSNR 提升为 0.23 dB,比 VoxCelebHQ 上的 0.08 dB 更大。这可能说明不同数据集的数据分布对模型规模扩展的响应不同。
论文承认的局限性
作者明确指出了两个局限:(1)固定分辨率——当前模型只能在训练分辨率下运行,不支持动态分辨率,限制了实际部署灵活性;(2)CNN 架构天花板——基于卷积网络,进一步扩展到更大规模受限,作者建议未来探索 DiT-based #Peebles-et-al.-2023 架构 #WangY-et-al.-2025。
此外,从消融实验看,第三个隐性局限是数据规模不足。0.3B→0.9B 的收益递减表明,10 亿参数模型可能需要远超 9400 万帧的训练数据才能充分发挥潜力。
技术启发
稀疏约束作为解耦工具:LIA-X 最深刻的启发不是某个具体技术,而是"$L_1$ 约束 → 自动解耦"这一范式。在自监督学习中,当模型有多个可用组件时,施加稀疏约束可以迫使不同组件编码不同语义。这个思路可以迁移到任何涉及"字典学习"或"多分量表示"的场景。
edit-warp-render 的设计哲学:传统方法把"源图像"视为不可改变的输入,LIA-X 把它视为可编辑的起点。这个思路提示我们:在 animation/generation 任务中,允许模型先"预处理"输入再生成,可能比直接端到端生成更可控。
autoencoder vs diffusion 的竞争:LIA-X 证明了规模化 autoencoder 在质量上可以超越 diffusion 方法,同时保持推理速度优势。这暗示着 autoencoder 路线在肖像动画这一特定任务上可能仍有竞争力——关键在于找到正确的架构设计(稀疏约束 + 可扩展残差块)。
后续方向
论文提到的 Future Work 方向包括:设计支持动态分辨率的技术、探索 DiT-based 架构。从领域发展看,DeX-Portrait(CVPR 2026)已在 diffusion 框架下实现了姿态/表情解耦,可视为 LIA-X 解耦思路在 diffusion 方向的后续探索。如何在 diffusion 框架中实现类似的稀疏运动字典,是一个值得关注的方向。
参考来源
- Wang, Yaohui et al. (2025). LIA-X: Interpretable Latent Portrait Animator. ICCV 2025. arXiv:2508.09959 · Project Page · GitHub
- Wang, Yaohui et al. (2024). Latent Image Animator: Learning to Extract Smooth Motion Representations from Videos. TPAMI 2024. arXiv:2203.09043
- Siarohin, Aliaksandr et al. (2019). First Order Motion Model for Image Animation. NeurIPS 2019. arXiv:2003.00196
- Guo, Jianzhu et al. (2024). LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control. arXiv:2407.03168 · 精读 →
- Wang, Dingchun et al. (2024). X-Portrait: Expressive Portrait Animation with Hierarchical Motion Attention. SIGGRAPH 2024. arXiv:2403.15931
- Wang, Ting-Chun et al. (2021). One-Shot Free-View Neural Talking-Head Synthesis for Video Conferencing. CVPR 2021.
- Sauer, Axel et al. (2023). StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis. ICML 2023.
- Aharon, Michal et al. (2006). K-SVD: An Algorithm for Designing Overcomplete Dictionaries for Sparse Representation. IEEE TSP.
- Peebles, William et al. (2023). Scalable Diffusion Models with Transformers. ICCV 2023.