ESC
输入关键词搜索文章
目录

SoulX-LiveAct

arXiv 2026 · Soul AI Lab
20 FPS 实时流式推理 · 2× H100 · 小时级无限视频生成
系列说明:本文属于 AI / 数字人系列论文精读,聚焦 AR 扩散模型在实时数字人动画中的工程化落地。SoulX-LiveAct 的核心价值不是堆大模型,而是从 Forcing 策略和 KV 记忆两个底层问题入手,把 AR 扩散推到 20 FPS / 小时级可用的工程门槛。
第一章
引言:为什么小时级实时动画是 AR 扩散的终极挑战?

数字人动画领域在 2025-2026 年迎来了一条新路线:自回归(AR)扩散模型。与全序列扩散不同,AR 扩散把视频切成块(block),逐块生成,天然支持流式推理——这对于实时交互场景(直播、视频会议数字人)至关重要。但 AR 扩散面临一个根本问题:沿着 AR 链传播什么信息 #Zhen et al., 2026。这个看似简单的选择,直接决定了训练能否收敛、推理能否做到实时、视频能否持续到小时级。

SoulX-LiveAct 来自 Soul AI Lab(Soul App 的 AI 团队),由 Dingcheng Zhen、Xu Zheng、Ruixin Zhang、Zhiqi Jiang(共同第一作者)与 Yichao Yan、Ming Tao、Shunshun Yin 联合完成,机构包括 Soul AI Lab、HKUST(GZ) 和 Soochow University #Zhen et al., 2026。团队此前已发布 Teller(CVPR 2025)、SoulX-FlashTalk 14B、SoulX-FlashHead 1.3B 等数字人产品线,LiveAct 是其面向小时级实时场景的最新方案。

论文直指 AR 扩散的两大瓶颈:(i)已有 Forcing 策略传播的表征与扩散步骤不匹配,导致训练信号不一致、收敛不稳定;(ii)历史 KV 表征无限增长,无法在有限显存内做小时级推理。为此,论文提出 Neighbor Forcing——在同一步扩散步骤下传播时间相邻帧的 latent,以及 ConvKV Memory——用轻量 1D 卷积将 KV cache 压缩为固定长度。最终实现在 2 张 H100/H200 上 20 FPS 实时流式推理,支持小时级甚至无限长视频生成 #Zhen et al., 2026

Neighbor Forcing zero-shot phenomenon
图 1:关键现象——当因果注意力掩码直接施加到预训练非 AR 扩散模型时,已有 Forcing 策略(Diffusion Forcing、Self Forcing)无法产生时间一致的视频;而使用同一步骤的 neighbor latent 作为参考,同一模型在零样本下即可生成主体一致、时间稳定的视频(来源:arXiv source Figure 1)。
一句话概括:LiveAct 的核心发现是——AR 扩散的关键不在「是否 AR」,而在「沿 AR 链传播什么」。传播同步骤的 neighbor latent,比传播样本级预测或异步骤噪声更稳定、更高效,且天然支持 KV 复用。
第二章
问题剖析:Forcing 策略的三大陷阱与 KV cache 的无限增长

Forcing 策略演进:从 Teacher 到 Neighbor

AR 扩散的核心决策是:用什么表征作为下一个 block 的条件?论文 Table 1 系统对比了四种 Forcing 策略 #Zhen et al., 2026

方法ARPP(沿 AR 链传播的表征)训练 AR 分解KV Reuse
Teacher Forcingground-truth 样本$p(\hat{x}_t^f \mid x^{1:f-1})$
Diffusion Forcing噪声/重采样 GT 样本$p(\hat{x}_t^f \mid \tilde{x}_{t'}^{1:f-1})$
Self Forcing自生成的上一步样本$p(\hat{x}_t^f \mid \hat{x}_{t'}^{1:f-1})$
Neighbor Forcing同步骤 neighbor 参考状态$p(\hat{x}_t^f \mid \hat{x}_t^{1:f-1})$

三种已有策略各有陷阱:

陷阱一:Teacher Forcing 的 train-test mismatch。训练时用 ground-truth 样本作为条件,推理时条件变成模型自己的预测。这种分布偏移导致推理时误差逐帧累积,越往后越偏 #Chen et al., 2024

陷阱二:Diffusion Forcing 的步骤不匹配。Diffusion Forcing 给序列中的每帧分配独立的噪声水平 #Chen et al., 2024。这意味着条件帧和目标帧处于不同的扩散步骤——模型需要在 $t \neq t'$ 的异构噪声空间之间对齐时间依赖,训练信号不一致,收敛困难 #Zhen et al., 2026

陷阱三:Self Forcing 的高训练成本。Self Forcing 用模型自生成的样本作为条件,虽然解决了 train-test mismatch,但需要昂贵的 ODE 初始化训练(16K 数据)和 1000 步蒸馏 #Boyd et al., 2025。对于双向模型需要大幅修改,工程门槛很高 #Zhen et al., 2026

下图直观对比了四种 Forcing 策略在传播表征、训练成本和 KV 复用能力上的差异:

graph LR
    TF["Teacher Forcing
传播: GT 样本
KV Reuse: ✗"] DF["Diffusion Forcing
传播: 异步骤噪声
KV Reuse: ✗"] SF["Self Forcing
传播: 自生成样本
KV Reuse: ✓"] NF["Neighbor Forcing
传播: 同步骤 neighbor latent
KV Reuse: ✓"] TF -->|"解决 mismatch"| DF DF -->|"解决步骤不匹配"| SF SF -->|"降低训练成本"| NF
四种 Forcing 策略的演进路线:从 Teacher Forcing 的 train-test mismatch,到 Diffusion Forcing 的步骤不匹配,再到 Self Forcing 的高训练成本,Neighbor Forcing 以同步骤传播同时解决了这三个问题。

KV cache 的无限增长问题

即使 Forcing 策略解决了,AR 扩散推理时 KV cache 仍随帧数线性增长。一小时视频以 20 FPS 计算约 72,000 帧——KV cache 根本放不下。现有方案(如 motion-frame overlap)只能保留最近几帧的 KV,超出窗口的历史信息被完全丢弃,导致长视频中身份漂移、配饰消失等问题 #Zhen et al., 2026。FramePack #Zhang et al., 2025 用额外的 UNet 压缩历史信息,但复杂架构不适合实时场景。

核心洞察:论文在 Figure 1 中展示了一个关键现象——当用同一步骤的 neighbor latent 作为参考时,即使是未训练的预训练非 AR 模型,也能在零样本下生成一致的视频。这说明步骤一致性是 AR 扩散的关键归纳偏置,而非更复杂的模型架构。
第三章
模型结构:Neighbor Forcing + ConvKV Memory 双创新

整体架构:DiT + Flow Matching + Block-wise AR

SoulX-LiveAct 采用 DiT(Diffusion Transformer)+ Flow Matching 框架。视频帧通过 3D VAE 编码为 latent chunks $\{z^1, ..., z^F\}$,生成在 latent 空间中由去噪网络 $G_\theta$ 完成。为了支持流式生成,序列被划分为 $m$ 个连续 chunk 组成的 block,逐 block 自回归生成 #Zhen et al., 2026

Block-wise AR 生成公式

$$\hat{x}^{1:N} = \{\Psi_{T:0}(G_\theta, c^n, t) \mid n = 1, ..., N\}, \quad c^n = \{x_{ref}, x_t^{1:n-1}, c_{audio}, c_{text}\}$$

其中 $\hat{x}^n$ 是第 $n$ 个 block 的预测 latent,$x_{ref}$ 是参考图像的 latent,$c_{audio}$$c_{text}$ 是音频和文本条件,$\Psi$ 是积分器(UniPC Solver),从第 $T$ 步积分到第 0 步得到 $\hat{x}$

模型初始化采用分层混合策略:DiT 的 self-attention 和 text&image cross-attention 层从 Wan2.1 #Wan et al., 2025 初始化,audio cross-attention 层从 InfiniteTalk #Lin et al., 2025 初始化。这种"继承已有预训练权重"的策略大幅降低了训练成本 #Zhen et al., 2026

SoulX-LiveAct training pipeline
图 2:训练 Pipeline 总览。左:DiT block 架构。右:两阶段训练——Stage 1 Neighbor Forcing 训练 + Stage 2 ConvKV Memory & Step Distill 联合训练(来源:arXiv source Figure 2)。

Neighbor Forcing:步骤一致的 AR 传播

Neighbor Forcing 的核心思想很简洁:在相同的扩散步骤 $t$ 下,将时间相邻帧的 noisy latent 作为条件传播。这不同于 Diffusion Forcing 的异步骤传播,也不同于 Self Forcing 的样本级传播。

首先,使用 Flow Matching 的标准前向过程对每个 block 的 clean latent $x_0^n$ 加噪:

$$x_t^n = (1-t)x_0^n + t\epsilon^n, \quad \epsilon^n \sim \mathcal{N}(0, I)$$

然后,在 block $n$ 处,Neighbor Forcing 以同步骤的参考帧为条件训练去噪器:

Neighbor Forcing 训练损失

$$\mathcal{L}(\theta) = \mathbb{E}_{n \sim \text{U}(0, N), t \sim \text{U}(0, 1)}\big[\|(\epsilon^n - x^n) - G_\theta(x_t^n, t \mid x_t^{1:n-1})\|^2\big]$$

注意条件 $x_t^{1:n-1}$ 中的下标 $t$——所有参考帧和目标帧共享同一个扩散步骤 $t$。这保证了条件信号在统计上是对齐的。

由于所有 block 在共享步骤 $t$ 下优化,训练可以避免 Self Forcing 中复杂的参考状态过程(如 ODE 初始化训练),损失函数简化为:

$$\mathcal{L}(\theta) = \mathbb{E}_{t \sim \text{U}(0, 1)}\big[\|(\epsilon - x) - G_\theta(x_t, t, Mask)\|^2\big]$$

其中 $Mask$ 是 block-wise 因果注意力掩码,block size 为 $m$

$$Mask_{i,j} = \begin{cases} 1, & \text{if } \lfloor j/m \rfloor \leq \lfloor i/m \rfloor \\ 0, & \text{otherwise} \end{cases}$$

消融实验表明,第一个 block size 设为 6、后续设为 8 时效果最优 #Zhen et al., 2026

理论支撑:为什么同步骤传播更稳定?

论文在 Appendix A 中给出两个命题为 Neighbor Forcing 提供理论支撑 #Zhen et al., 2026

Proposition 1:时间相邻帧是 latent 相邻帧

在局部平滑动态和正则编码器假设下,时间相邻帧在 latent 空间中保持相近:

$$\|z_0^{f+1} - z_0^f\| \leq L_E(L_g \Delta_u + 2\varepsilon_r)$$

这意味着相邻帧的运动信息在 latent 空间中是局部可追踪的。

Proposition 2:同步骤加噪保持期望邻域结构

$\epsilon^f$ 独立同分布假设下,固定步骤 $t$ 的期望平方距离分解为信号项和噪声项:

$$\mathbb{E}\|z_t^{f+1} - z_t^f\|^2 = \alpha_t^2 \|z_0^{f+1} - z_0^f\|^2 + 2\sigma_t^2 d$$

第一项是信号差异(随 $t$ 衰减),第二项是与帧无关的各向同性噪声。这意味着同步骤条件下的邻域结构在期望意义下被保持,使得 AR 建模更容易、更稳定。

ConvKV Memory:轻量 KV 压缩与常量显存推理

Neighbor Forcing 使 KV cache 步骤一致——一旦前帧 latent 在步骤 $t$ 构建,后续同步骤预测无需重算。但 naive KV cache 仍随帧数线性增长。ConvKV Memory 的解决方案是:保留近期 KV 不压缩,将旧 KV 用 1D 卷积压缩为固定长度的长期记忆 #Zhen et al., 2026

ConvKV 压缩公式

$$M_t^{s:e} = \big(RoPE(Conv_\theta(k_t^{s:e}), freq^s), \; RoPE(Conv_\theta(v_t^{s:e}), freq^s)\big)$$

其中 $Conv_\theta$ 是 kernel=stride=$\lambda=5$ 的 1D 卷积,将每 5 个 chunk 的 KV 压缩为 1 个。RoPE(Rotary Position Embedding,旋转位置编码)reset 操作将位置编码对齐到起始位置 $s$,确保压缩后位置一致。

ConvKV Memory mechanism
图 3:ConvKV Memory 机制。左:长期 KV 通过轻量 1D 卷积压缩;右:推理 Pipeline 统一 Neighbor Forcing + ConvKV Memory(来源:arXiv source Figure 3)。

推理时,KV context 被分为四个分区:参考图像状态(2 chunks)+ 长期记忆(2 chunks)+ 短期记忆(2 chunks)+ 当前 block。前两个生成的 latent block 不做压缩,从第三个 block 开始启动 ConvKV 压缩。由于 Neighbor Forcing 保证了同步骤的 KV 状态一致性,已缓存的 KV 可以直接复用——新增帧只需计算新增 token 的 KV,已缓存的 KV 保持不变(append-only 模式)#Zhen et al., 2026

关键优势:ConvKV Memory 仅增加 1.9% 的推理时间开销,却将 KV cache 从 $O(N)$ 降到 $O(1)$——使得小时级甚至无限长视频生成成为可能。
第四章
Training Pipeline:两阶段训练与分层初始化

分层初始化策略

SoulX-LiveAct 不从零训练,而是继承两个预训练模型的权重 #Zhen et al., 2026

模块初始化来源原因
Self-attention + text&image cross-attentionWan2.1 #Wan et al., 2025提供视觉生成基础能力
Audio cross-attentionInfiniteTalk #Lin et al., 2025提供音频-运动对齐能力

Stage 1:Neighbor Forcing 训练

Stage 1 使用 300 小时多模态配对数据(视频 + 音频 + emotion/action caption)训练,仅优化 audio cross-attention 模块 #Zhen et al., 2026。这一阶段的目标是学习音频、文本条件与生成视频之间的对齐——确保唇形、手势和情感表达的一致性。Neighbor Forcing 的步骤一致性设计使得训练信号干净稳定,不需要 Self Forcing 那样的 ODE 初始化训练 #Zhen et al., 2026

Stage 2:ConvKV Memory + DMD 蒸馏

Stage 2 将 ConvKV Memory 集成到 DMD(Distribution Matching Distillation)#Yin et al., 2024 蒸馏训练中,在 3 步推理设置下联合优化,仅训练 400 步 #Zhen et al., 2026。相比 Self Forcing 的 1000 步蒸馏 + 16K 数据 ODE 初始化,Neighbor Forcing 只需 300 步蒸馏,无需 ODE 初始化:

方法ODE 初始化训练DMD 蒸馏步数
Self Forcing需要(16K 数据)1000 步
Neighbor Forcing不需要300 步

此外,框架还包含一个 Emotion and Action Editing Module,可独立控制面部表情和手势,支持悲伤表情、比心、遮脸、大笑等可控编辑 #Zhen et al., 2026

训练配置披露

项目披露状态值 / 说明
训练数据已披露300 小时多模态配对数据(视频+音频+emotion/action caption)
训练硬件未披露原文未给出 GPU 型号与数量
优化器未披露原文未给出
学习率未披露原文未给出
Batch size未披露原文未给出
训练步数 / 轮数已披露Stage 1: 未明确; Stage 2: 400 training steps(3-step inference 设置)
训练时长未披露原文未给出
模型参数量未披露原文未给出层数 / 隐藏维度(GitHub 标注 18B)
精度格式已披露FP8 端到端自适应(推理),训练精度未明确
Checkpoint 策略未披露原文未给出
初始化来源已披露Wan2.1(self-attn)+ InfiniteTalk(audio-attn)
Stage 1 优化范围已披露仅优化 audio cross-attention 模块
Block size已披露首个 block=6, 后续=8
ConvKV 压缩比 λ已披露5(每 5 chunks KV → 1 chunk)
KV context 结构已披露6 chunks = 2 ref + 2 long-term + 2 short-term
训练代码未披露GitHub 仅提供推理代码
第五章
Inference Pipeline:3 步蒸馏 + FP8 + 流式 KV 管理

3 步蒸馏推理

Stage 2 的 DMD 蒸馏将推理步数压缩到 3 步 #Zhen et al., 2026。这意味着每个 block 只需 3 次去噪迭代即可生成——相比标准的 20-50 步推理大幅降低了延迟。

系统级优化:FP8 + 序列并行 + 算子融合

为了在 2 张 H100/H200 上达到 20 FPS,LiveAct 采用了三层系统优化 #Zhen et al., 2026

(1) 端到端自适应 FP8 精度。将模型推理从 FP16/BF16 降到 FP8,吞吐翻倍。H100/H200 的硬件级 FP8 支持使这一精度切换几乎不损失质量。

(2) 序列并行(Sequence Parallelism)。将序列维度切分到 2 张 GPU 上并行计算,每张 GPU 处理序列的一半,通过通信同步。

(3) 算子融合(Operator Fusion)。将多个小算子(如 RoPE + attention + FFN)融合为大算子,减少 GPU kernel 启动开销和中间结果读写。

Streaming Pipeline:常量显存的无限生成

推理时的 KV cache 管理是 LiveAct 的核心工程创新。完整流程如下 #Zhen et al., 2026

第 1-2 个 block:正常生成,KV 不压缩。KV cache 随 block 增长。

第 3 个 block 起:KV cache 被分为四个分区:

分区chunk 数说明
参考图像状态2固定不变
长期记忆2ConvKV 压缩后的历史 KV
短期记忆2上一轮的最后 2 个 chunk
当前 block6-8正在生成的 block

由于 Neighbor Forcing 保证了同步骤的 KV 状态一致性,已缓存的 KV 不需要在后续步骤中重算——每个新生成帧只需计算新增 token 的 KV,已缓存部分保持不变(append-only 模式)。ConvKV 的 1D 卷积压缩仅在 block 之间执行一次,开销仅 +1.9% #Zhen et al., 2026

这种设计使得 KV cache 大小恒定——无论生成 1 分钟还是 1 小时视频,显存占用不变。这是实现小时级无限视频生成的关键。

工程启示:LiveAct 的推理系统把"算法创新"(Neighbor Forcing 的步骤一致性)和"系统优化"(FP8 + 并行 + 融合)分层解耦——算法层保证 KV 可复用,系统层保证每步够快。这种分层设计值得实时 AI 系统借鉴。

实时性能指标

模型吞吐 (FPS)延迟 (s)↓GPU 数↓TFLOPs/帧↓
InfiniteTalk †253.20850.2
Live-Avatar202.89539.1
SoulX-LiveAct200.94227.2

LiveAct 以 27.2 TFLOPs/帧的计算量实现了 20 FPS——相比 InfiniteTalk #Lin et al., 2025(50.2 TFLOPs, 8 GPU)节省 46% 计算、75% GPU;相比 Live-Avatar(39.1 TFLOPs, 5 GPU)节省 30% 计算、60% GPU #Zhen et al., 2026。延迟从秒级降到 0.94 秒,是唯一满足实时交互(< 1s)的方案。

† InfiniteTalk 使用 LightX2V 提供的 LoRA 加权 4 步蒸馏 #Zhen et al., 2026

第六章
实验验证:HDTF 全面领先,EMTD 暴露短板

测试设置

评测在两个数据集上进行:HDTF(面部动态为主)和 EMTD(含全身运动),每个数据集随机采样 50 个视频,共 100 个测试视频,在 512×512 分辨率下评测 #Zhen et al., 2026。指标包括:Sync-C/Sync-D(唇同步)、FID/FVD(分布距离)、VBench Temporal Quality / Image Quality / Human Fidelity(视频质量与人物保真度)。

主实验:HDTF 全面领先

数据集模型Sync-C↑Sync-D↓FID↓FVD↓Temporal↑Image↑Human Fid.↑
HDTFOmniAvatar5.1310.1927.90268.4786.161.696.8
HDTFInfiniteTalk7.128.0118.15169.8894.559.999.4
HDTFLive-Avatar7.688.3815.85206.2091.859.299.8
HDTFOurs9.406.7610.0569.4397.663.099.9
EMTDOmniAvatar6.248.6333.63589.591.963.296.7
EMTDInfiniteTalk7.987.4437.26339.094.961.696.7
EMTDLive-Avatar6.938.2342.52365.093.663.096.6
EMTDOurs8.617.2980.90771.697.365.798.9
关键发现:在 HDTF 上,LiveAct 全面领先——Sync-C 9.40(比第二名 InfiniteTalk 高 32%)、FID 10.05(低 45%)、FVD 69.43(低 59%)。但在 EMTD 上,FID(80.90)和 FVD(771.6)显著劣于所有 baseline——全身运动的分布建模仍是短板。
Lip motion and emotion-action comparison
图 4:唇形与情感-动作协调对比。LiveAct 在双唇音和开元音的口型上更精确,在情感-动作交互(如手势遮挡)场景下保持面部表情和身体运动的一致性(来源:arXiv source Figure 4)。
Long-video consistency comparison
图 5:长视频一致性对比。红框标识身份漂移(OmniAvatar 最严重),黄框标识细节不一致(InfiniteTalk 和 Live-Avatar 配饰消失)。LiveAct 在整个序列中保持稳定身份和细节(来源:arXiv source Figure 5)。

消融实验

ConvKV Memory 的贡献:Figure 6 显示,去掉 ConvKV Memory 后,服装图案和指甲颜色等细节出现不一致。ConvKV Memory 确保长程身份和细节保持 #Zhen et al., 2026

ConvKV Memory ablation
图 6:ConvKV Memory 消融。红框显示无 ConvKV 时服装和手部细节的不一致性(来源:arXiv source Figure 6)。
Emotion and Action Editing Module
图 7:Emotion and Action Editing Module 效果。支持悲伤表情、比心手势、遮脸、大笑等可控编辑(来源:arXiv source Figure 7)。

Block size 消融:为满足 20 FPS 实时约束(单帧延迟 < 50ms),对 memory-block size 和 current-block size 进行消融 #Zhen et al., 2026

Memory-block SizeCurrent-block SizeCost/frame满足实时?
6652ms
8860ms
6849ms

Memory-block=6 + Current-block=8 是唯一满足 50ms/帧约束的配置。这是一个实时性与上下文长度的工程折中:更大的 block 虽然提供更长的上下文,但延迟超标。

失败案例:EMTD 上 FID(80.90)和 FVD(771.6)远劣于 OmniAvatar(33.63 / 589.5)。论文未分析原因,可能与全身运动的分布复杂度更高有关——LiveAct 在面部动态(HDTF)上表现优异,但全身运动建模仍是开放挑战。
第七章
讨论与启发:工程化 AR 扩散的路线选择

Neighbor Forcing vs Self Forcing:路线之争

Neighbor Forcing 和 Self Forcing 代表了 AR 扩散的两种设计哲学 #Zhen et al., 2026

Self Forcing 追求推理一致性——用模型自己的输出作为条件,训练和推理分布完全匹配。但代价是高昂的 ODE 初始化训练(16K 数据)和 1000 步蒸馏,工程门槛极高 #Boyd et al., 2025

Neighbor Forcing 追求步骤一致性——不要求训练和推理的样本完全匹配,但要求条件信号处于相同的扩散步骤。理论证明(Proposition 2)表明,同步骤的邻域结构在期望意义下被保持,因此即使不做 ODE 初始化也能稳定收敛。蒸馏只需 300 步 #Zhen et al., 2026

这不是"谁对谁错"的问题,而是"精度 vs 成本"的工程权衡。如果目标是极致的推理一致性且不差钱,Self Forcing 可能更好;如果目标是快速落地且控制训练成本,Neighbor Forcing 更实际。

局限性

论文没有显式讨论 Limitations,但分析可识别以下隐含局限:

(1) EMTD 上分布距离退化。FID 和 FVD 远劣于 baseline,说明全身运动的分布建模能力不足。这可能是因为 300 小时训练数据中面部视频占比更高。

(2) 实时约束下的超参数妥协。block size=6+8 是唯一满足 50ms 约束的配置,更大的 block 虽然质量更好但无法实时——说明模型质量仍有提升空间。

(3) 企业级 GPU 门槛。2× H100/H200 虽然是同方法中最少的,但对中小团队仍是高门槛。FP8 的质量影响也未充分讨论。

(4) 训练细节缺失。优化器、学习率、batch size、训练 GPU 数量和时间、模型参数量均未披露。训练代码未开源。GitHub 仅提供推理代码和预训练权重 #Zhen et al., 2026

工程启发

(1) 步骤一致性 > 样本一致性。Neighbor Forcing 的成功表明,在 AR 扩散中,保证条件信号和目标信号处于同一扩散步骤,比追求样本级一致性更重要且更高效。这一思路可推广到其他 AR 生成任务。

(2) 轻量压缩 > 复杂记忆模块。ConvKV Memory 用一个 1D 卷积替代了 FramePack 等方法的 UNet 压缩架构,仅增加 1.9% 开销。这说明预训练 Transformer 的 KV 表征本身具有高度可压缩性——前提是传播策略(Neighbor Forcing)保证了冗余性。

(3) 分层系统优化是实时 AI 的标配。算法创新(Neighbor Forcing + ConvKV)+ 精度优化(FP8)+ 并行策略(Sequence Parallelism)+ 工程优化(Operator Fusion)四层叠加,才把延迟从 3.2 秒压到 0.94 秒。任何一层单独都不够。

在地图上的位置:SoulX-LiveAct 不是追汷新 SOTA 的学术作品,而是一个工程化系统——它把 AR 扩散从"理论可行"推到了"工程可用"。在数字人 / talking head 领域,它与 LivePortrait #Guo et al., 2024(隐式关键点路线)、Live-Avatar(AR 扩散路线)形成三角竞争:LivePortrait 精度高但非扩散,Live-Avatar 是扩散但成本高,LiveAct 用 Neighbor Forcing 在扩散框架内把成本压到了实时级。

参考来源