LHM:秒级可动画人体重建
论文信息
- 标题:LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds
- 作者:Lingteng Qiu, Xiaodong Gu, Peihao Li, Qi Zuo, Weichao Shen, Junfei Zhang, Kejie Qiu, Weihao Yuan, Guanying Chen, Zilong Dong, Liefeng Bo
- 单位:Tongyi Lab, Alibaba Group
- 发表:ICCV 2025
- 开源:https://github.com/aigc3d/LHM
上一篇我们精读了 AniGS——同一个团队(阿里通义实验室邱陵腾等)用 CogVideo 生成多视角 canonical 图像,再用 4D Gaussian Splatting 做不一致重建,从单图得到可动画 3D Avatar。AniGS 的效果很好,但有一个痛点:4DGS 优化需要约 15 分钟,距离"实时"还有不小距离。
LHM(Large Animatable Human Reconstruction Model)是同一团队的后续工作,被 ICCV 2025 收录。#Qiu et al., 2025 它的核心思路是:跳过多视角生成和优化两步,用一个大 Transformer 直接从前馈通路预测 3D Gaussian Splatting 参数。结果是推理时间从 15 分钟降到 2.01 秒(LHM-0.5B 模型),PSNR 还提升了 3.322 dB(LHM-1B 模型)。
这个跃迁的背后是"大重建模型"(Large Reconstruction Model, LRM)范式的延伸——LRM 证明了 Transformer 可以从单图前馈重建 3D 物体,LHM 把这个思路扩展到了可动画人体。但扩展并不简单:人体有复杂的铰接结构、面部细节、衣物褶皱,还需要大规模训练数据。LHM 通过三个关键设计解决了这些挑战:Multimodal Body-Head Transformer(MBHT)、Head Feature Pyramid Encoding(HFPE)、以及基于视频数据的自监督训练策略。
单图可动画 3D 人体重建面临的核心矛盾是:高质量和泛化能力不可兼得。我们可以把现有方法分为三类,每类都有结构性缺陷:
| 方法类型 | 代表工作 | 优势 | 核心缺陷 |
|---|---|---|---|
| 参数化模型 | SMPL/ARCH | 强结构先验 | 无法表示宽松衣物和面部细节 |
| 优化式方法 | AniGS、DreamGaussian | 高保真 | 数分钟到十分钟优化,需受控采集 |
| 合成数据训练 | PSHuman、CharacterGen | 训练可控 | 合成→真实域差距大,泛化能力有限 |
LHM 的 Insight 是:用大模型的前馈能力替代优化过程,用大规模视频数据替代稀缺的 3D 扫描数据。这正是 LRM 范式在可动画人体领域的具体实现。
LHM 的架构可以概括为"三类 Token + 多层 MBHT Block + MLP 回归"。我们从输入到输出逐层拆解。
三类 Token 编码
LHM 将输入信息编码为三类 Token,送入 Transformer 进行注意力交互:
1. 几何 Token($\mathbf{T}_{\text{3D}}$):从 SMPL-X 模板的 A-pose mean mesh 上采样 $N_{\text{points}}$ 个表面点,每个点 $\mathbf{x}_i \in \mathbb{R}^3$ 经过 $L$ 频率正弦位置编码 $\gamma(\cdot)$ 和 MLP 投影:
MBHT Block:Body-Head 分离注意力
LHM 的核心架构创新是 Multimodal Body-Head Transformer Block(MBHT-block),改编自 SD3 的 MM-Transformer #Esser et al., 2024。关键设计是先让头部 Token 交互,再拼回身体 Token 做整体交互:其中 $\mathbf{F}_{\text{global}}$ 是从 body Token 经 max pooling 和 MLP 提取的全局上下文特征,用于 Adaptive Layer Normalization(adaLN)调制。
为什么要做 Body-Head 分离?论文实验发现,如果直接用标准 MM-Transformer 让所有 Token 一起做注意力,模型会过度依赖头部特征,导致身体部分的表达能力下降。MBHT 的两阶段设计让头部先获得充分的信息融合,再与身体进行全局交互,取得了更好的平衡。
Head Token Shrinkage Regularization
尽管有了 MBHT 的分离设计,模型在训练中仍然倾向于过度关注头部 Token。LHM 借鉴 MAE #He et al., 2022 的思路,在训练时随机 mask 掉 0–50% 的头部输入区域,迫使模型增强对身体上下文的利用。消融实验显示这一正则化提升了整体性能,但 Face Consistency 指标略有下降——这是预期的权衡。
3DGS 参数预测
经过 $N_{\text{layer}}$ 个 MBHT-block 后,MLP 回归每个查询点的 3D Gaussian 参数:
其中 $\Delta\mathbf{p}_i$ 是相对于 SMPL-X 初始化位置的残差偏移,这种参数化方式让网络只需学习微调而非从零预测,训练更稳定。
与 AniGS 的架构对比
| 维度 | AniGS | LHM |
|---|---|---|
| 范式 | 两阶段:生成 + 优化 | 单阶段:前馈预测 |
| 推理时间 | ~15 分钟 | 2–7 秒 |
| 核心架构 | CogVideo-2B + 4DGS | MBHT Transformer + MLP |
| 训练数据 | 合成 3D 扫描 | 301K 真实视频 + 5.7K 合成 |
| 监督方式 | 多视角图像重建 | 自监督(视频帧渲染损失) |
| 动画 PSNR | 18.681 | 22.003(+3.322) |
训练数据
LHM 的训练数据由两部分组成:
真实视频数据:从 50 万条初始人类运动视频素材中,经过多阶段筛选(去除多人互动、遮挡面部、低质量帧),最终获得 301,733 条单人视频序列。这些视频提供了丰富的真实世界外观和运动模式。 合成数据增强:为弥补自然视频中的视角偏差(正面居多),补充了 5,724 个合成 3D 人体扫描,来自三个来源:2K2K 数据集(1,000 个模型)、Human4DiT(4,324 个角色)、RenderPeople(400 个商业资产)。沿用 AniGS 的渲染策略,每个模型从 30 个均匀分布的方位角(12° 间隔)渲染,使用 HDRI 环境光照。#Qiu et al., 2025 预处理:使用 SAMURAI #Yang et al., 2024 提取前景 mask,Multi-HMR #Baradel et al., 2024 估计 SMPL-X 参数。每次训练迭代从一条视频中随机采样 1 张源视图图像和 4 张目标视图图像。损失函数
LHM 的训练是完全自监督的——不需要 3D 扫描标注,只用视频帧的渲染损失。预测的 canonical 3DGS 通过 Linear Blend Skinning(LBS)转换到目标视角,经可微分光栅化渲染后与真实视频帧对比。
损失函数分为两部分:
视角空间监督(渲染损失):- ASAP(As Spherical As Possible):惩罚高斯各向异性,防止针状椭球体:
其中 $d = 5.25\text{cm}$,允许局部微调但防止灾难性漂移。
训练配置披露
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | 301,733 真实视频 + 5,724 合成 3D 扫描 |
| 训练硬件 | 已披露 | NVIDIA A100 80GB × (32/32/64) |
| 优化器 | 已披露 | AdamW |
| 学习率 | 已披露 | 4×10⁻⁴ |
| Batch size | 已披露 | 500M/700M: 16/GPU × 32 = 512; 1B: 8/GPU × 64 = 512 |
| 训练步数 | 已披露 | 40K iterations |
| 训练时长 | 已披露 | 500M: 78h, 700M: 112h, 1B: 189h |
| 模型参数量 | 已披露 | 500M / 700M / 1B 三个变体 |
| 精度格式 | 已披露 | 混合精度训练 + dynamic loss scaling |
| Checkpoint 策略 | 未披露 | 原文未明确给出 |
| 权重衰减 | 已披露 | 5×10⁻⁴ |
| 梯度裁剪 | 已披露 | ‖∇‖₂ = 0.1 |
推理流程
LHM 的推理极其简洁——单次前馈传播,无需任何后处理:
Step 1:图像预处理。 输入单张 RGB 图像,经前景分割(SAMURAI)和 SMPL-X 参数估计(Multi-HMR),获得人体区域裁剪和姿态参数。 Step 2:特征提取。 冻结的 Sapiens-1B 提取 Body Token,DINOv2 多尺度提取 Head Token,SMPL-X 表面采样点编码为几何 Token。 Step 3:Transformer 前馈。 三类 Token 经过 $N_{\text{layer}}$ 个 MBHT-block,每层通过 Body-Head 分离注意力完成信息融合。 Step 4:3DGS 回归。 MLP 从几何 Token 回归每个查询点的 3D Gaussian 参数(位置偏移、旋转、SH 特征、不透明度、尺度)。 Step 5:动画渲染。 得到的 canonical 3DGS 可直接用任意 SMPL-X 姿态参数驱动,通过 LBS 转换到目标姿态后做 3DGS 光栅化渲染。graph LR
A["单张 RGB 图像"] --> B["SAMURAI 前景分割"]
B --> C["Multi-HMR SMPL-X 估计"]
C --> D["Sapiens-1B Body Token"]
C --> E["DINOv2 HFPE Head Token"]
C --> F["SMPL-X 几何 Token"]
D --> G["MBHT Transformer × N layers"]
E --> G
F --> G
G --> H["MLP 回归 3DGS 参数"]
H --> I["Canonical 3DGS"]
I --> J["LBS 姿态驱动"]
J --> K["3DGS 光栅化渲染"]
推理效率对比
| 方法 | 推理时间 | 显存 | 范式 |
|---|---|---|---|
| En3D | 5 分钟 | 32 GB | 优化式 |
| AniGS | 15 分钟 | 24 GB | 生成+优化 |
| LHM-0.5B | 2.01 秒 | 18 GB | 前馈 |
| LHM-0.7B | 4.13 秒 | 21 GB | 前馈 |
| LHM-1B | 6.57 秒 | 24 GB | 前馈 |
前馈推理 vs 优化推理
AniGS 的推理链路是"生成多视角图像 → 4DGS 优化",每一步都是耗时瓶颈。LHM 的前馈推理将两步合并为一个 Transformer 前向传播,推理时间仅取决于模型规模和输入分辨率,不受视角数量或优化迭代次数影响。
值得注意的是,LHM-0.5B 虽然推理最快(2.01s),但性能已全面超越 AniGS。更大的模型(0.7B、1B)进一步提升质量,但推理时间也相应增加。这种可伸缩的模型规模设计让用户可以根据算力预算选择合适的变体。
在实际部署中,LHM-0.5B 的 18 GB 显存需求意味着可以在 RTX 4090(24 GB)等消费级显卡上运行,而 LHM-1B 的 24 GB 则刚好触及 RTX 4090 的显存上限。所有变体的推理时间都在 7 秒以内,满足交互式应用的响应时间要求。不过需要注意的是,这里的推理时间仅包含模型前馈部分,前置的 SMPL-X 估计和后置的 3DGS 光栅化渲染还会额外消耗时间,完整 pipeline 的端到端延迟会更高。#Qiu et al., 2025
实验配置
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | 200 合成场景(静态重建); 200 in-the-wild 视频(动画重建) |
| 评测指标 | 已披露 | PSNR↑ / SSIM↑ / LPIPS↓ / FC↓(Face Consistency, ArcFace L2) |
| Baseline 方法 | 已披露 | 静态: GTA, SIFU, PSHuman, DreamGaussian; 动画: En3D, AniGS |
| 推理硬件 | 部分披露 | 训练用 A100 80GB;推理仅报告显存需求 18–24 GB,未明确推理 GPU 型号 |
| 推理分辨率 | 未披露 | 原文未明确给出评测分辨率 |
| 推理环境 | 未披露 | 原文未给出框架/版本 |
静态重建:定量对比
| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FC ↓ |
|---|---|---|---|---|
| GTA | 17.025 | 0.919 | 0.087 | 0.051 |
| SIFU | 16.681 | 0.917 | 0.093 | 0.060 |
| PSHuman | 17.556 | 0.921 | 0.076 | 0.037 |
| DreamGaussian | 18.544 | 0.917 | 0.075 | 0.056 |
| LHM-0.5B* | 25.183 | 0.951 | 0.029 | 0.035 |
动画重建:定量对比
| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FC ↓ | Time ↓ | Memory ↓ |
|---|---|---|---|---|---|---|
| En3D | 15.231 | 0.734 | 0.172 | 0.058 | 5 min | 32 GB |
| AniGS | 18.681 | 0.871 | 0.103 | 0.053 | 15 min | 24 GB |
| LHM-0.5B | 21.648 | 0.924 | 0.044 | 0.042 | 2.01s | 18 GB |
| LHM-0.7B | 21.879 | 0.930 | 0.039 | 0.039 | 4.13s | 21 GB |
| LHM-1B | 22.003 | 0.930 | 0.040 | 0.035 | 6.57s | 24 GB |
消融实验
1. 模型参数规模:从 0.5B → 0.7B → 1B,PSNR 从 21.648 → 21.879 → 22.003,逐步提升。但推理时间也从 2.01s 增至 6.57s,存在速度-质量权衡。 2. 数据规模:| 训练数据 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FC ↓ |
|---|---|---|---|---|
| 仅合成数据 | 19.753 | 0.904 | 0.060 | 0.057 |
| + 10K 视频 | 20.692 | 0.911 | 0.052 | 0.048 |
| + 50K 视频 | 21.108 | 0.915 | 0.050 | 0.043 |
| + 100K 视频 | 21.429 | 0.920 | 0.049 | 0.045 |
| + 300K(全部) | 21.648 | 0.924 | 0.044 | 0.042 |
关键发现:合成数据单独训练泛化能力极差,加入真实视频后性能大幅提升。数据量从 10K→300K,PSNR 持续提升但边际递减效应明显——100K→300K 只提升 0.219 dB。这暗示 300K 可能已接近当前架构的收益上限。
3. Transformer 架构设计:| 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FC ↓ |
|---|---|---|---|---|
| w/ MM-Transformer(标准) | 20.072 | 0.907 | 0.100 | 0.053 |
| w/o Shrinkage Reg. | 21.037 | 0.915 | 0.049 | 0.041 |
| LHM-0.5B(完整) | 21.648 | 0.924 | 0.044 | 0.042 |
MBHT 相比标准 MM-Transformer 提升 PSNR 1.576、LPIPS 降 0.056,证实了 Body-Head 分离注意力的有效性。Shrinkage Regularization 进一步提升整体性能,但 FC 从 0.041 升至 0.042——这是预期的权衡:牺牲少量面部一致性换取更好的身体建模。
技术贡献定位
LHM 在"单图可动画 3D 人体重建"这一任务上实现了从"优化式"到"前馈式"的范式跃迁。如果说 AniGS 是"先生成再优化"的两阶段方案,LHM 则是"端到端回归"的一阶段方案。这种跃迁与 2D 图像生成领域从 GAN 到扩散模型的变化不同——LHM 的进步体现在推理范式的简化上,而非生成质量的提升。
局限性
论文承认的主要局限是视角偏差:真实视频数据以正面视角为主,对罕见姿态和极端角度的覆盖不足,影响模型对新视角的泛化。#Qiu et al., 2025 此外从工程角度还有几个值得注意的问题:
- 推理分辨率未披露:论文未明确给出评测时的渲染分辨率,使得指标的可复现性存在不确定性。
- 运动驱动方式有限:LHM 只支持 SMPL-X 姿态参数驱动,无法直接接收文本或音频输入做语义级动画控制。
- 衣物动态缺失:LHM 重建的是 canonical 空间的静态 3DGS,动画时只通过 LBS 做刚性形变,无法表示衣物的非刚性物理动态。
- 显存门槛:虽然推理显存 18–24 GB 看似可接受,但这只是模型推理部分,加上前置的 SMPL-X 估计和后置渲染,完整 pipeline 的显存需求会更高。
启发与展望
1. LRM 范式的可扩展性得到验证。 LRM 在通用物体上证明了"大 Transformer + 大数据"的前馈重建可行,LHM 将其成功扩展到可动画人体。这意味着 LRM 范式可能适用于更多结构化对象(如手部、面部、动物)。 2. 冻结预训练编码器的策略值得借鉴。 LHM 冻结 Sapiens-1B 和 DINOv2,只训练 Transformer 和 MLP 部分。这种"冻结-提取-融合"的设计大幅降低了训练成本,同时利用了大规模预训练的语义知识。 3. 自监督视频训练的潜力。 LHM 不需要任何 3D 扫描标注,只用视频帧的渲染损失训练。这为解决 3D 标注稀缺问题提供了一个可行路径——只要有足够多的视频数据和可靠的 SMPL-X 估计,就可以训练出泛化能力强的人体重建模型。 4. Body-Head 分离注意力是一种通用的 part-aware 设计。 这种"先局部后全局"的注意力模式不限于人体,可以推广到任何有明显部件结构的任务(如车辆的车身-车灯、家具的框架-装饰)。参考文献
- Qiu, L. et al. (2025). LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds. arXiv:2503.10625. ICCV 2025.
- Qiu, L. et al. (2024). AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction. arXiv:2412.02684. CVPR 2025. · 精读 →
- Hong, Y. et al. (2023). LRM: Large Reconstruction Model for Single Image to 3D. arXiv:2311.04400. ICLR 2024.
- Esser, P. et al. (2024). Scaling Rectified Flow Transformers for High-Resolution Images (SD3). arXiv:2403.03206. ICML 2024.
- Khirodkar, R. et al. (2024). Sapiens: Foundations for Human Vision Models. arXiv:2408.12569. ECCV 2024.
- Oquab, M. et al. (2023). DINOv2: Learning Robust Visual Features without Supervision. arXiv:2304.07193. TMLR 2024.
- He, K. et al. (2022). Masked Autoencoders Are Scalable Vision Learners (MAE). arXiv:2111.06377. CVPR 2022.
- Yang, T. et al. (2024). SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking. arXiv:2410.22455.
- Baradel, N. et al. (2024). Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot. arXiv:2403.07528.
- Pavlakos, G. et al. (2019). Expressive Body Capture: 3D Hands, Face, and Body from One Image (SMPL-X). arXiv:1904.05866. CVPR 2019.
- Kerbl, B. et al. (2013). 3D Gaussian Splatting for Real-Time Radiance Field Rendering. arXiv:2308.15240. SIGGRAPH 2023.