SoulX-LiveAct
数字人动画领域在 2025-2026 年迎来了一条新路线:自回归(AR)扩散模型。与全序列扩散不同,AR 扩散把视频切成块(block),逐块生成,天然支持流式推理——这对于实时交互场景(直播、视频会议数字人)至关重要。但 AR 扩散面临一个根本问题:沿着 AR 链传播什么信息 #Zhen et al., 2026。这个看似简单的选择,直接决定了训练能否收敛、推理能否做到实时、视频能否持续到小时级。
SoulX-LiveAct 来自 Soul AI Lab(Soul App 的 AI 团队),由 Dingcheng Zhen、Xu Zheng、Ruixin Zhang、Zhiqi Jiang(共同第一作者)与 Yichao Yan、Ming Tao、Shunshun Yin 联合完成,机构包括 Soul AI Lab、HKUST(GZ) 和 Soochow University #Zhen et al., 2026。团队此前已发布 Teller(CVPR 2025)、SoulX-FlashTalk 14B、SoulX-FlashHead 1.3B 等数字人产品线,LiveAct 是其面向小时级实时场景的最新方案。
论文直指 AR 扩散的两大瓶颈:(i)已有 Forcing 策略传播的表征与扩散步骤不匹配,导致训练信号不一致、收敛不稳定;(ii)历史 KV 表征无限增长,无法在有限显存内做小时级推理。为此,论文提出 Neighbor Forcing——在同一步扩散步骤下传播时间相邻帧的 latent,以及 ConvKV Memory——用轻量 1D 卷积将 KV cache 压缩为固定长度。最终实现在 2 张 H100/H200 上 20 FPS 实时流式推理,支持小时级甚至无限长视频生成 #Zhen et al., 2026。
Forcing 策略演进:从 Teacher 到 Neighbor
AR 扩散的核心决策是:用什么表征作为下一个 block 的条件?论文 Table 1 系统对比了四种 Forcing 策略 #Zhen et al., 2026:
| 方法 | ARPP(沿 AR 链传播的表征) | 训练 AR 分解 | KV Reuse |
|---|---|---|---|
| Teacher Forcing | ground-truth 样本 | $p(\hat{x}_t^f \mid x^{1:f-1})$ | ✗ |
| Diffusion Forcing | 噪声/重采样 GT 样本 | $p(\hat{x}_t^f \mid \tilde{x}_{t'}^{1:f-1})$ | ✗ |
| Self Forcing | 自生成的上一步样本 | $p(\hat{x}_t^f \mid \hat{x}_{t'}^{1:f-1})$ | ✓ |
| Neighbor Forcing | 同步骤 neighbor 参考状态 | $p(\hat{x}_t^f \mid \hat{x}_t^{1:f-1})$ | ✓ |
三种已有策略各有陷阱:
陷阱一:Teacher Forcing 的 train-test mismatch。训练时用 ground-truth 样本作为条件,推理时条件变成模型自己的预测。这种分布偏移导致推理时误差逐帧累积,越往后越偏 #Chen et al., 2024。
陷阱二:Diffusion Forcing 的步骤不匹配。Diffusion Forcing 给序列中的每帧分配独立的噪声水平 #Chen et al., 2024。这意味着条件帧和目标帧处于不同的扩散步骤——模型需要在 $t \neq t'$ 的异构噪声空间之间对齐时间依赖,训练信号不一致,收敛困难 #Zhen et al., 2026。
陷阱三:Self Forcing 的高训练成本。Self Forcing 用模型自生成的样本作为条件,虽然解决了 train-test mismatch,但需要昂贵的 ODE 初始化训练(16K 数据)和 1000 步蒸馏 #Boyd et al., 2025。对于双向模型需要大幅修改,工程门槛很高 #Zhen et al., 2026。
下图直观对比了四种 Forcing 策略在传播表征、训练成本和 KV 复用能力上的差异:
graph LR
TF["Teacher Forcing
传播: GT 样本
KV Reuse: ✗"]
DF["Diffusion Forcing
传播: 异步骤噪声
KV Reuse: ✗"]
SF["Self Forcing
传播: 自生成样本
KV Reuse: ✓"]
NF["Neighbor Forcing
传播: 同步骤 neighbor latent
KV Reuse: ✓"]
TF -->|"解决 mismatch"| DF
DF -->|"解决步骤不匹配"| SF
SF -->|"降低训练成本"| NF
KV cache 的无限增长问题
即使 Forcing 策略解决了,AR 扩散推理时 KV cache 仍随帧数线性增长。一小时视频以 20 FPS 计算约 72,000 帧——KV cache 根本放不下。现有方案(如 motion-frame overlap)只能保留最近几帧的 KV,超出窗口的历史信息被完全丢弃,导致长视频中身份漂移、配饰消失等问题 #Zhen et al., 2026。FramePack #Zhang et al., 2025 用额外的 UNet 压缩历史信息,但复杂架构不适合实时场景。
整体架构:DiT + Flow Matching + Block-wise AR
SoulX-LiveAct 采用 DiT(Diffusion Transformer)+ Flow Matching 框架。视频帧通过 3D VAE 编码为 latent chunks $\{z^1, ..., z^F\}$,生成在 latent 空间中由去噪网络 $G_\theta$ 完成。为了支持流式生成,序列被划分为 $m$ 个连续 chunk 组成的 block,逐 block 自回归生成 #Zhen et al., 2026:
Block-wise AR 生成公式
其中 $\hat{x}^n$ 是第 $n$ 个 block 的预测 latent,$x_{ref}$ 是参考图像的 latent,$c_{audio}$ 和 $c_{text}$ 是音频和文本条件,$\Psi$ 是积分器(UniPC Solver),从第 $T$ 步积分到第 0 步得到 $\hat{x}$。
模型初始化采用分层混合策略:DiT 的 self-attention 和 text&image cross-attention 层从 Wan2.1 #Wan et al., 2025 初始化,audio cross-attention 层从 InfiniteTalk #Lin et al., 2025 初始化。这种"继承已有预训练权重"的策略大幅降低了训练成本 #Zhen et al., 2026。
Neighbor Forcing:步骤一致的 AR 传播
Neighbor Forcing 的核心思想很简洁:在相同的扩散步骤 $t$ 下,将时间相邻帧的 noisy latent 作为条件传播。这不同于 Diffusion Forcing 的异步骤传播,也不同于 Self Forcing 的样本级传播。
首先,使用 Flow Matching 的标准前向过程对每个 block 的 clean latent $x_0^n$ 加噪:
然后,在 block $n$ 处,Neighbor Forcing 以同步骤的参考帧为条件训练去噪器:
Neighbor Forcing 训练损失
注意条件 $x_t^{1:n-1}$ 中的下标 $t$——所有参考帧和目标帧共享同一个扩散步骤 $t$。这保证了条件信号在统计上是对齐的。
由于所有 block 在共享步骤 $t$ 下优化,训练可以避免 Self Forcing 中复杂的参考状态过程(如 ODE 初始化训练),损失函数简化为:
其中 $Mask$ 是 block-wise 因果注意力掩码,block size 为 $m$:
消融实验表明,第一个 block size 设为 6、后续设为 8 时效果最优 #Zhen et al., 2026。
理论支撑:为什么同步骤传播更稳定?
论文在 Appendix A 中给出两个命题为 Neighbor Forcing 提供理论支撑 #Zhen et al., 2026:
Proposition 1:时间相邻帧是 latent 相邻帧
在局部平滑动态和正则编码器假设下,时间相邻帧在 latent 空间中保持相近:
这意味着相邻帧的运动信息在 latent 空间中是局部可追踪的。
Proposition 2:同步骤加噪保持期望邻域结构
在 $\epsilon^f$ 独立同分布假设下,固定步骤 $t$ 的期望平方距离分解为信号项和噪声项:
第一项是信号差异(随 $t$ 衰减),第二项是与帧无关的各向同性噪声。这意味着同步骤条件下的邻域结构在期望意义下被保持,使得 AR 建模更容易、更稳定。
ConvKV Memory:轻量 KV 压缩与常量显存推理
Neighbor Forcing 使 KV cache 步骤一致——一旦前帧 latent 在步骤 $t$ 构建,后续同步骤预测无需重算。但 naive KV cache 仍随帧数线性增长。ConvKV Memory 的解决方案是:保留近期 KV 不压缩,将旧 KV 用 1D 卷积压缩为固定长度的长期记忆 #Zhen et al., 2026。
ConvKV 压缩公式
其中 $Conv_\theta$ 是 kernel=stride=$\lambda=5$ 的 1D 卷积,将每 5 个 chunk 的 KV 压缩为 1 个。RoPE(Rotary Position Embedding,旋转位置编码)reset 操作将位置编码对齐到起始位置 $s$,确保压缩后位置一致。
推理时,KV context 被分为四个分区:参考图像状态(2 chunks)+ 长期记忆(2 chunks)+ 短期记忆(2 chunks)+ 当前 block。前两个生成的 latent block 不做压缩,从第三个 block 开始启动 ConvKV 压缩。由于 Neighbor Forcing 保证了同步骤的 KV 状态一致性,已缓存的 KV 可以直接复用——新增帧只需计算新增 token 的 KV,已缓存的 KV 保持不变(append-only 模式)#Zhen et al., 2026。
分层初始化策略
SoulX-LiveAct 不从零训练,而是继承两个预训练模型的权重 #Zhen et al., 2026:
| 模块 | 初始化来源 | 原因 |
|---|---|---|
| Self-attention + text&image cross-attention | Wan2.1 #Wan et al., 2025 | 提供视觉生成基础能力 |
| Audio cross-attention | InfiniteTalk #Lin et al., 2025 | 提供音频-运动对齐能力 |
Stage 1:Neighbor Forcing 训练
Stage 1 使用 300 小时多模态配对数据(视频 + 音频 + emotion/action caption)训练,仅优化 audio cross-attention 模块 #Zhen et al., 2026。这一阶段的目标是学习音频、文本条件与生成视频之间的对齐——确保唇形、手势和情感表达的一致性。Neighbor Forcing 的步骤一致性设计使得训练信号干净稳定,不需要 Self Forcing 那样的 ODE 初始化训练 #Zhen et al., 2026。
Stage 2:ConvKV Memory + DMD 蒸馏
Stage 2 将 ConvKV Memory 集成到 DMD(Distribution Matching Distillation)#Yin et al., 2024 蒸馏训练中,在 3 步推理设置下联合优化,仅训练 400 步 #Zhen et al., 2026。相比 Self Forcing 的 1000 步蒸馏 + 16K 数据 ODE 初始化,Neighbor Forcing 只需 300 步蒸馏,无需 ODE 初始化:
| 方法 | ODE 初始化训练 | DMD 蒸馏步数 |
|---|---|---|
| Self Forcing | 需要(16K 数据) | 1000 步 |
| Neighbor Forcing | 不需要 | 300 步 |
此外,框架还包含一个 Emotion and Action Editing Module,可独立控制面部表情和手势,支持悲伤表情、比心、遮脸、大笑等可控编辑 #Zhen et al., 2026。
训练配置披露
| 项目 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | 300 小时多模态配对数据(视频+音频+emotion/action caption) |
| 训练硬件 | 未披露 | 原文未给出 GPU 型号与数量 |
| 优化器 | 未披露 | 原文未给出 |
| 学习率 | 未披露 | 原文未给出 |
| Batch size | 未披露 | 原文未给出 |
| 训练步数 / 轮数 | 已披露 | Stage 1: 未明确; Stage 2: 400 training steps(3-step inference 设置) |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 未披露 | 原文未给出层数 / 隐藏维度(GitHub 标注 18B) |
| 精度格式 | 已披露 | FP8 端到端自适应(推理),训练精度未明确 |
| Checkpoint 策略 | 未披露 | 原文未给出 |
| 初始化来源 | 已披露 | Wan2.1(self-attn)+ InfiniteTalk(audio-attn) |
| Stage 1 优化范围 | 已披露 | 仅优化 audio cross-attention 模块 |
| Block size | 已披露 | 首个 block=6, 后续=8 |
| ConvKV 压缩比 λ | 已披露 | 5(每 5 chunks KV → 1 chunk) |
| KV context 结构 | 已披露 | 6 chunks = 2 ref + 2 long-term + 2 short-term |
| 训练代码 | 未披露 | GitHub 仅提供推理代码 |
3 步蒸馏推理
Stage 2 的 DMD 蒸馏将推理步数压缩到 3 步 #Zhen et al., 2026。这意味着每个 block 只需 3 次去噪迭代即可生成——相比标准的 20-50 步推理大幅降低了延迟。
系统级优化:FP8 + 序列并行 + 算子融合
为了在 2 张 H100/H200 上达到 20 FPS,LiveAct 采用了三层系统优化 #Zhen et al., 2026:
(1) 端到端自适应 FP8 精度。将模型推理从 FP16/BF16 降到 FP8,吞吐翻倍。H100/H200 的硬件级 FP8 支持使这一精度切换几乎不损失质量。
(2) 序列并行(Sequence Parallelism)。将序列维度切分到 2 张 GPU 上并行计算,每张 GPU 处理序列的一半,通过通信同步。
(3) 算子融合(Operator Fusion)。将多个小算子(如 RoPE + attention + FFN)融合为大算子,减少 GPU kernel 启动开销和中间结果读写。
Streaming Pipeline:常量显存的无限生成
推理时的 KV cache 管理是 LiveAct 的核心工程创新。完整流程如下 #Zhen et al., 2026:
第 1-2 个 block:正常生成,KV 不压缩。KV cache 随 block 增长。
第 3 个 block 起:KV cache 被分为四个分区:
| 分区 | chunk 数 | 说明 |
|---|---|---|
| 参考图像状态 | 2 | 固定不变 |
| 长期记忆 | 2 | ConvKV 压缩后的历史 KV |
| 短期记忆 | 2 | 上一轮的最后 2 个 chunk |
| 当前 block | 6-8 | 正在生成的 block |
由于 Neighbor Forcing 保证了同步骤的 KV 状态一致性,已缓存的 KV 不需要在后续步骤中重算——每个新生成帧只需计算新增 token 的 KV,已缓存部分保持不变(append-only 模式)。ConvKV 的 1D 卷积压缩仅在 block 之间执行一次,开销仅 +1.9% #Zhen et al., 2026。
这种设计使得 KV cache 大小恒定——无论生成 1 分钟还是 1 小时视频,显存占用不变。这是实现小时级无限视频生成的关键。
实时性能指标
| 模型 | 吞吐 (FPS) | 延迟 (s)↓ | GPU 数↓ | TFLOPs/帧↓ |
|---|---|---|---|---|
| InfiniteTalk † | 25 | 3.20 | 8 | 50.2 |
| Live-Avatar | 20 | 2.89 | 5 | 39.1 |
| SoulX-LiveAct | 20 | 0.94 | 2 | 27.2 |
LiveAct 以 27.2 TFLOPs/帧的计算量实现了 20 FPS——相比 InfiniteTalk #Lin et al., 2025(50.2 TFLOPs, 8 GPU)节省 46% 计算、75% GPU;相比 Live-Avatar(39.1 TFLOPs, 5 GPU)节省 30% 计算、60% GPU #Zhen et al., 2026。延迟从秒级降到 0.94 秒,是唯一满足实时交互(< 1s)的方案。
† InfiniteTalk 使用 LightX2V 提供的 LoRA 加权 4 步蒸馏 #Zhen et al., 2026。
测试设置
评测在两个数据集上进行:HDTF(面部动态为主)和 EMTD(含全身运动),每个数据集随机采样 50 个视频,共 100 个测试视频,在 512×512 分辨率下评测 #Zhen et al., 2026。指标包括:Sync-C/Sync-D(唇同步)、FID/FVD(分布距离)、VBench Temporal Quality / Image Quality / Human Fidelity(视频质量与人物保真度)。
主实验:HDTF 全面领先
| 数据集 | 模型 | Sync-C↑ | Sync-D↓ | FID↓ | FVD↓ | Temporal↑ | Image↑ | Human Fid.↑ |
|---|---|---|---|---|---|---|---|---|
| HDTF | OmniAvatar | 5.13 | 10.19 | 27.90 | 268.47 | 86.1 | 61.6 | 96.8 |
| HDTF | InfiniteTalk | 7.12 | 8.01 | 18.15 | 169.88 | 94.5 | 59.9 | 99.4 |
| HDTF | Live-Avatar | 7.68 | 8.38 | 15.85 | 206.20 | 91.8 | 59.2 | 99.8 |
| HDTF | Ours | 9.40 | 6.76 | 10.05 | 69.43 | 97.6 | 63.0 | 99.9 |
| EMTD | OmniAvatar | 6.24 | 8.63 | 33.63 | 589.5 | 91.9 | 63.2 | 96.7 |
| EMTD | InfiniteTalk | 7.98 | 7.44 | 37.26 | 339.0 | 94.9 | 61.6 | 96.7 |
| EMTD | Live-Avatar | 6.93 | 8.23 | 42.52 | 365.0 | 93.6 | 63.0 | 96.6 |
| EMTD | Ours | 8.61 | 7.29 | 80.90 | 771.6 | 97.3 | 65.7 | 98.9 |
消融实验
ConvKV Memory 的贡献:Figure 6 显示,去掉 ConvKV Memory 后,服装图案和指甲颜色等细节出现不一致。ConvKV Memory 确保长程身份和细节保持 #Zhen et al., 2026。
Block size 消融:为满足 20 FPS 实时约束(单帧延迟 < 50ms),对 memory-block size 和 current-block size 进行消融 #Zhen et al., 2026:
| Memory-block Size | Current-block Size | Cost/frame | 满足实时? |
|---|---|---|---|
| 6 | 6 | 52ms | ✗ |
| 8 | 8 | 60ms | ✗ |
| 6 | 8 | 49ms | ✓ |
Memory-block=6 + Current-block=8 是唯一满足 50ms/帧约束的配置。这是一个实时性与上下文长度的工程折中:更大的 block 虽然提供更长的上下文,但延迟超标。
Neighbor Forcing vs Self Forcing:路线之争
Neighbor Forcing 和 Self Forcing 代表了 AR 扩散的两种设计哲学 #Zhen et al., 2026:
Self Forcing 追求推理一致性——用模型自己的输出作为条件,训练和推理分布完全匹配。但代价是高昂的 ODE 初始化训练(16K 数据)和 1000 步蒸馏,工程门槛极高 #Boyd et al., 2025。
Neighbor Forcing 追求步骤一致性——不要求训练和推理的样本完全匹配,但要求条件信号处于相同的扩散步骤。理论证明(Proposition 2)表明,同步骤的邻域结构在期望意义下被保持,因此即使不做 ODE 初始化也能稳定收敛。蒸馏只需 300 步 #Zhen et al., 2026。
这不是"谁对谁错"的问题,而是"精度 vs 成本"的工程权衡。如果目标是极致的推理一致性且不差钱,Self Forcing 可能更好;如果目标是快速落地且控制训练成本,Neighbor Forcing 更实际。
局限性
论文没有显式讨论 Limitations,但分析可识别以下隐含局限:
(1) EMTD 上分布距离退化。FID 和 FVD 远劣于 baseline,说明全身运动的分布建模能力不足。这可能是因为 300 小时训练数据中面部视频占比更高。
(2) 实时约束下的超参数妥协。block size=6+8 是唯一满足 50ms 约束的配置,更大的 block 虽然质量更好但无法实时——说明模型质量仍有提升空间。
(3) 企业级 GPU 门槛。2× H100/H200 虽然是同方法中最少的,但对中小团队仍是高门槛。FP8 的质量影响也未充分讨论。
(4) 训练细节缺失。优化器、学习率、batch size、训练 GPU 数量和时间、模型参数量均未披露。训练代码未开源。GitHub 仅提供推理代码和预训练权重 #Zhen et al., 2026。
工程启发
(1) 步骤一致性 > 样本一致性。Neighbor Forcing 的成功表明,在 AR 扩散中,保证条件信号和目标信号处于同一扩散步骤,比追求样本级一致性更重要且更高效。这一思路可推广到其他 AR 生成任务。
(2) 轻量压缩 > 复杂记忆模块。ConvKV Memory 用一个 1D 卷积替代了 FramePack 等方法的 UNet 压缩架构,仅增加 1.9% 开销。这说明预训练 Transformer 的 KV 表征本身具有高度可压缩性——前提是传播策略(Neighbor Forcing)保证了冗余性。
(3) 分层系统优化是实时 AI 的标配。算法创新(Neighbor Forcing + ConvKV)+ 精度优化(FP8)+ 并行策略(Sequence Parallelism)+ 工程优化(Operator Fusion)四层叠加,才把延迟从 3.2 秒压到 0.94 秒。任何一层单独都不够。
参考来源
- Zhen, D. et al. (2026). SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory. arXiv:2603.11746 · GitHub · Project Page
- Wan et al. (2025). Wan2.1. arXiv:2503.20314
- Lin et al. (2025). InfiniteTalk. arXiv:2508.14033
- Sun et al. (2025). OmniAvatar. arXiv:2506.18866
- Live-Avatar (2025). arXiv:2512.04677
- Boyd et al. (2025). Self Forcing. NeurIPS 2025 Spotlight. arXiv:2506.08009
- Chen et al. (2024). Diffusion Forcing. NeurIPS 2024. arXiv:2407.01392 · 精读 →
- Yin et al. (2024). Distribution Matching Distillation (DMD). CVPR 2024. arXiv:2311.18828
- Zhang et al. (2025). FramePack. NeurIPS 2025. arXiv:2504.12626 · 精读 →
- Guo, J. et al. (2024). LivePortrait. arXiv:2407.03168 · 精读 →