ESC
输入关键词搜索文章
目录

LHM:秒级可动画人体重建

ICCV 2025 · 阿里巴巴通义实验室
论文精读(四十五)· 前馈 Transformer · 3DGS 直接回归 · 2 秒推理
2.01秒推理 ↓
22.0Anim PSNR ↑
1B模型参数
301K训练视频

论文信息

Part 1
引言:从 15 分钟优化到 2 秒前馈

上一篇我们精读了 AniGS——同一个团队(阿里通义实验室邱陵腾等)用 CogVideo 生成多视角 canonical 图像,再用 4D Gaussian Splatting 做不一致重建,从单图得到可动画 3D Avatar。AniGS 的效果很好,但有一个痛点:4DGS 优化需要约 15 分钟,距离"实时"还有不小距离。

LHM(Large Animatable Human Reconstruction Model)是同一团队的后续工作,被 ICCV 2025 收录。#Qiu et al., 2025 它的核心思路是:跳过多视角生成和优化两步,用一个大 Transformer 直接从前馈通路预测 3D Gaussian Splatting 参数。结果是推理时间从 15 分钟降到 2.01 秒(LHM-0.5B 模型),PSNR 还提升了 3.322 dB(LHM-1B 模型)。

关键数据:LHM-1B 在动画重建任务上达到 PSNR 22.003、SSIM 0.930、LPIPS 0.040,而 AniGS 为 18.681/0.871/0.103。推理仅需 6.57 秒(1B 模型)或 2.01 秒(0.5B 模型),显存 18–24 GB,可在单张消费级 GPU 上运行。#Qiu et al., 2025

这个跃迁的背后是"大重建模型"(Large Reconstruction Model, LRM)范式的延伸——LRM 证明了 Transformer 可以从单图前馈重建 3D 物体,LHM 把这个思路扩展到了可动画人体。但扩展并不简单:人体有复杂的铰接结构、面部细节、衣物褶皱,还需要大规模训练数据。LHM 通过三个关键设计解决了这些挑战:Multimodal Body-Head Transformer(MBHT)、Head Feature Pyramid Encoding(HFPE)、以及基于视频数据的自监督训练策略。

Part 2
问题剖析:为什么现有方法都不够好

单图可动画 3D 人体重建面临的核心矛盾是:高质量和泛化能力不可兼得。我们可以把现有方法分为三类,每类都有结构性缺陷:

方法类型代表工作优势核心缺陷
参数化模型SMPL/ARCH强结构先验无法表示宽松衣物和面部细节
优化式方法AniGS、DreamGaussian高保真数分钟到十分钟优化,需受控采集
合成数据训练PSHuman、CharacterGen训练可控合成→真实域差距大,泛化能力有限
优化式方法的瓶颈在于:AniGS 虽然能从单图重建,但需要先用视频扩散模型生成多视角 canonical 图像(约 30 秒),再用 4DGS 优化处理视角间不一致性(约 15 分钟)。DreamGaussian 用 SDS 优化也需约 2 分钟。这些方法无法做到"输入一张图,秒级出结果"。 合成数据训练的瓶颈在于:3D 扫描数据稀缺且昂贵,但只用合成数据训练的模型在真实图像上泛化能力很差。LHM 的消融实验直接证实了这一点:仅用合成数据训练,PSNR 只有 19.753;加入 300K 真实视频后提升到 21.648,提升了近 2 dB。#Qiu et al., 2025 表示方法的瓶颈在于:IDOL 用 UV 空间参数化 3D Gaussian,但 UV 映射对复杂衣物几何的表达受限;隐式表面方法(PiFU/PIFuHD)无法做到实时渲染。LHM 选择了 3D Gaussian Splatting 作为输出表示——它既支持实时光栅化渲染,又不需要 UV 参数化。

LHM 的 Insight 是:用大模型的前馈能力替代优化过程,用大规模视频数据替代稀缺的 3D 扫描数据。这正是 LRM 范式在可动画人体领域的具体实现。

Part 3
模型结构:Multimodal Body-Head Transformer
LHM 整体流程
图 1:LHM 整体流程。输入单张图像,提取 Body 和 Head 两种图像 Token,与 SMPL-X 表面采样的 3D 几何 Token 通过 MBHT 融合,最终回归 3D Gaussian 参数。来源:LHM, Fig. 2

LHM 的架构可以概括为"三类 Token + 多层 MBHT Block + MLP 回归"。我们从输入到输出逐层拆解。

三类 Token 编码

LHM 将输入信息编码为三类 Token,送入 Transformer 进行注意力交互:

1. 几何 Token($\mathbf{T}_{\text{3D}}$:从 SMPL-X 模板的 A-pose mean mesh 上采样 $N_{\text{points}}$ 个表面点,每个点 $\mathbf{x}_i \in \mathbb{R}^3$ 经过 $L$ 频率正弦位置编码 $\gamma(\cdot)$ 和 MLP 投影:
$$\mathbf{T}_{\text{3D}} = \text{MLP}_{\text{proj}}\left(\gamma(\mathbf{X})\right) \in \mathbb{R}^{N_{\text{points}} \times C}$$
这些 Token 携带人体几何结构的先验信息,是后续预测 3D Gaussian 参数的"查询点"。 2. Body 图像 Token($\mathbf{T}_{\text{body}}$:使用在 1000 万张人体图像上预训练的 Sapiens-1B 编码器 #Khirodkar et al., 2024 提取语义级身体特征。编码器冻结不训练,只通过 MLP 对齐维度:
$$\mathbf{T}_{\text{body}} = \text{MLP}_{\text{proj}}\left(\mathcal{E}_{\text{Sapiens}}(I)\right) \in \mathbb{R}^{N_{\text{body}} \times C}$$
3. Head 图像 Token($\mathbf{T}_{\text{head}}$:这是 LHM 的核心创新之一。由于人脸在整张图中占比很小,经过编码器下采样后细节严重丢失。LHM 提出 Head Feature Pyramid Encoding(HFPE),从 DINOv2 #Oquab et al., 2023 的第 4、11、17、23 层提取多尺度特征:
$$\mathbf{T}_{\text{head}} = \mathcal{F}_{\text{fusion}}\left( \mathcal{E}_{\text{dino}}^4, \mathcal{E}_{\text{dino}}^{11}, \mathcal{E}_{\text{dino}}^{17}, \mathcal{E}_{\text{dino}}^{23} \right) \in \mathbb{R}^{N_{\text{head}} \times C}$$
浅层保留高频纹理细节,深层编码语义级头部几何先验。$\mathcal{F}_{\text{fusion}}$ 通过深度级联和 $1 \times 1$ 卷积融合四层特征。
HFPE 架构
图 2:Head Feature Pyramid Encoding 架构。从 DINOv2 的第 4/11/17/23 层提取多尺度特征,通过融合模块生成头部 Token。来源:LHM, Suppl. Fig.

MBHT Block:Body-Head 分离注意力

LHM 的核心架构创新是 Multimodal Body-Head Transformer Block(MBHT-block),改编自 SD3 的 MM-Transformer #Esser et al., 2024。关键设计是先让头部 Token 交互,再拼回身体 Token 做整体交互
$$\begin{aligned} \mathbf{T}^{\text{head}}_{\text{3D}}, \mathbf{T}_{\text{head}} &\coloneqq \text{MM-T}\left(\mathbf{T}^{\text{head}}_{\text{3D}}, \mathbf{T}_{\text{head}}; \mathbf{F}_{\text{global}}\right) \\ \mathbf{T}_{\text{3D}} &\coloneqq \text{Norm}(\mathbf{T}^{\text{head}}_{\text{3D}}) ~\Vert~ \text{Norm}(\mathbf{T}^{\text{body}}_{\text{3D}}) \\ \mathbf{T}_{\text{3D}}, \mathbf{T}_{\text{body}} &\coloneqq \text{MM-T}\left(\mathbf{T}_{\text{3D}}, \mathbf{T}_{\text{body}}; \mathbf{F}_{\text{global}}\right) \end{aligned}$$

其中 $\mathbf{F}_{\text{global}}$ 是从 body Token 经 max pooling 和 MLP 提取的全局上下文特征,用于 Adaptive Layer Normalization(adaLN)调制。

MBHT Block 架构
图 3:MBHT-block 架构。头部 3D Token 先与头部图像 Token 做 MM-T 交互,然后与身体 3D Token 拼接,再与身体图像 Token 做第二次 MM-T 交互。来源:LHM, Fig. 3

为什么要做 Body-Head 分离?论文实验发现,如果直接用标准 MM-Transformer 让所有 Token 一起做注意力,模型会过度依赖头部特征,导致身体部分的表达能力下降。MBHT 的两阶段设计让头部先获得充分的信息融合,再与身体进行全局交互,取得了更好的平衡。

Head Token Shrinkage Regularization

尽管有了 MBHT 的分离设计,模型在训练中仍然倾向于过度关注头部 Token。LHM 借鉴 MAE #He et al., 2022 的思路,在训练时随机 mask 掉 0–50% 的头部输入区域,迫使模型增强对身体上下文的利用。消融实验显示这一正则化提升了整体性能,但 Face Consistency 指标略有下降——这是预期的权衡。

3DGS 参数预测

经过 $N_{\text{layer}}$ 个 MBHT-block 后,MLP 回归每个查询点的 3D Gaussian 参数:

$$\{\Delta\mathbf{p}_i, \mathbf{r}_i, \mathbf{f}_i, \rho_i, \sigma_i\} = \text{MLP}_{\text{regress}}(\mathbf{T}_{\text{points}}^{(i)})$$
$$\mathbf{p}_i = \mathbf{x}_i + \Delta\mathbf{p}_i$$

其中 $\Delta\mathbf{p}_i$ 是相对于 SMPL-X 初始化位置的残差偏移,这种参数化方式让网络只需学习微调而非从零预测,训练更稳定。

与 AniGS 的架构对比

维度AniGSLHM
范式两阶段:生成 + 优化单阶段:前馈预测
推理时间~15 分钟2–7 秒
核心架构CogVideo-2B + 4DGSMBHT Transformer + MLP
训练数据合成 3D 扫描301K 真实视频 + 5.7K 合成
监督方式多视角图像重建自监督(视频帧渲染损失)
动画 PSNR18.68122.003(+3.322)
Part 4
Training Pipeline:自监督视频训练与 Canonical 正则化

训练数据

LHM 的训练数据由两部分组成:

真实视频数据:从 50 万条初始人类运动视频素材中,经过多阶段筛选(去除多人互动、遮挡面部、低质量帧),最终获得 301,733 条单人视频序列。这些视频提供了丰富的真实世界外观和运动模式。 合成数据增强:为弥补自然视频中的视角偏差(正面居多),补充了 5,724 个合成 3D 人体扫描,来自三个来源:2K2K 数据集(1,000 个模型)、Human4DiT(4,324 个角色)、RenderPeople(400 个商业资产)。沿用 AniGS 的渲染策略,每个模型从 30 个均匀分布的方位角(12° 间隔)渲染,使用 HDRI 环境光照。#Qiu et al., 2025 预处理:使用 SAMURAI #Yang et al., 2024 提取前景 mask,Multi-HMR #Baradel et al., 2024 估计 SMPL-X 参数。每次训练迭代从一条视频中随机采样 1 张源视图图像和 4 张目标视图图像。

损失函数

LHM 的训练是完全自监督的——不需要 3D 扫描标注,只用视频帧的渲染损失。预测的 canonical 3DGS 通过 Linear Blend Skinning(LBS)转换到目标视角,经可微分光栅化渲染后与真实视频帧对比。

损失函数分为两部分:

视角空间监督(渲染损失):
$$\mathcal{L}_{\text{photometric}} = \lambda_{\text{rgb}} \mathcal{L}_{\text{color}} + \lambda_{\text{mask}} \mathcal{L}_{\text{mask}} + \lambda_{\text{per}} \mathcal{L}_{\text{lpips}}$$
权重为 $\lambda_{\text{rgb}} = 1.0$, $\lambda_{\text{mask}} = 0.5$, $\lambda_{\text{per}} = 1.0$Canonical 空间正则化:由于单目重建是病态问题,canonical 空间缺少约束会导致新姿态下的形变伪影。LHM 设计了两个互补的正则项:
$$\mathcal{L}_{\text{reg}} = 50\mathcal{L}_{\text{ASAP}} + 10\mathcal{L}_{\text{ACAP}}$$
  • ASAP(As Spherical As Possible):惩罚高斯各向异性,防止针状椭球体:
$$\mathcal{L}_{\text{ASAP}} = \frac{1}{N}\sum_{i=1}^N \| \mathbf{S}_i - \text{diag}(1) \|_F^2$$
- ACAP(As Close As Possible):位置锚定,防止高斯位置漂移过远:
$$\mathcal{L}_{\text{ACAP}} = \frac{1}{N_{\text{points}}}\sum_{i=1}^{N_{\text{points}}} \max\left(\|\Delta\mathbf{p}_i\|_2 - d, 0\right)$$

其中 $d = 5.25\text{cm}$,允许局部微调但防止灾难性漂移。

设计要点:ASAP 权重(50)远大于 ACAP(10),说明形状约束比位置约束更关键。消融实验证实:去掉 ASAP 会出现半透明边界伪影,去掉 ACAP 会出现人体周围的浮点。#Qiu et al., 2025

训练配置披露

配置项披露状态值 / 说明
训练数据已披露301,733 真实视频 + 5,724 合成 3D 扫描
训练硬件已披露NVIDIA A100 80GB × (32/32/64)
优化器已披露AdamW
学习率已披露4×10⁻⁴
Batch size已披露500M/700M: 16/GPU × 32 = 512; 1B: 8/GPU × 64 = 512
训练步数已披露40K iterations
训练时长已披露500M: 78h, 700M: 112h, 1B: 189h
模型参数量已披露500M / 700M / 1B 三个变体
精度格式已披露混合精度训练 + dynamic loss scaling
Checkpoint 策略未披露原文未明确给出
权重衰减已披露5×10⁻⁴
梯度裁剪已披露‖∇‖₂ = 0.1
训练成本估算:1B 模型训练 189 小时 × 64 张 A100 = 12,096 GPU·小时。按 A100 云租约 $2/小时计算,约 $24,192。
Part 5
Inference Pipeline:秒级前馈推理

推理流程

LHM 的推理极其简洁——单次前馈传播,无需任何后处理:

Step 1:图像预处理。 输入单张 RGB 图像,经前景分割(SAMURAI)和 SMPL-X 参数估计(Multi-HMR),获得人体区域裁剪和姿态参数。 Step 2:特征提取。 冻结的 Sapiens-1B 提取 Body Token,DINOv2 多尺度提取 Head Token,SMPL-X 表面采样点编码为几何 Token。 Step 3:Transformer 前馈。 三类 Token 经过 $N_{\text{layer}}$ 个 MBHT-block,每层通过 Body-Head 分离注意力完成信息融合。 Step 4:3DGS 回归。 MLP 从几何 Token 回归每个查询点的 3D Gaussian 参数(位置偏移、旋转、SH 特征、不透明度、尺度)。 Step 5:动画渲染。 得到的 canonical 3DGS 可直接用任意 SMPL-X 姿态参数驱动,通过 LBS 转换到目标姿态后做 3DGS 光栅化渲染。
graph LR
    A["单张 RGB 图像"] --> B["SAMURAI 前景分割"]
    B --> C["Multi-HMR SMPL-X 估计"]
    C --> D["Sapiens-1B Body Token"]
    C --> E["DINOv2 HFPE Head Token"]
    C --> F["SMPL-X 几何 Token"]
    D --> G["MBHT Transformer × N layers"]
    E --> G
    F --> G
    G --> H["MLP 回归 3DGS 参数"]
    H --> I["Canonical 3DGS"]
    I --> J["LBS 姿态驱动"]
    J --> K["3DGS 光栅化渲染"]
  

推理效率对比

方法推理时间显存范式
En3D5 分钟32 GB优化式
AniGS15 分钟24 GB生成+优化
LHM-0.5B2.01 秒18 GB前馈
LHM-0.7B4.13 秒21 GB前馈
LHM-1B6.57 秒24 GB前馈
速度跃迁:LHM-0.5B 相比 AniGS 加速 447 倍(2.01s vs 15min),同时 PSNR 从 18.681 提升到 21.648。这意味着从"离线工具"到"交互式应用"的质变。#Qiu et al., 2025

前馈推理 vs 优化推理

AniGS 的推理链路是"生成多视角图像 → 4DGS 优化",每一步都是耗时瓶颈。LHM 的前馈推理将两步合并为一个 Transformer 前向传播,推理时间仅取决于模型规模和输入分辨率,不受视角数量或优化迭代次数影响。

值得注意的是,LHM-0.5B 虽然推理最快(2.01s),但性能已全面超越 AniGS。更大的模型(0.7B、1B)进一步提升质量,但推理时间也相应增加。这种可伸缩的模型规模设计让用户可以根据算力预算选择合适的变体。

在实际部署中,LHM-0.5B 的 18 GB 显存需求意味着可以在 RTX 4090(24 GB)等消费级显卡上运行,而 LHM-1B 的 24 GB 则刚好触及 RTX 4090 的显存上限。所有变体的推理时间都在 7 秒以内,满足交互式应用的响应时间要求。不过需要注意的是,这里的推理时间仅包含模型前馈部分,前置的 SMPL-X 估计和后置的 3DGS 光栅化渲染还会额外消耗时间,完整 pipeline 的端到端延迟会更高。#Qiu et al., 2025

Part 6
实验配置与验证

实验配置

配置项披露状态值 / 说明
评测数据集已披露200 合成场景(静态重建); 200 in-the-wild 视频(动画重建)
评测指标已披露PSNR↑ / SSIM↑ / LPIPS↓ / FC↓(Face Consistency, ArcFace L2)
Baseline 方法已披露静态: GTA, SIFU, PSHuman, DreamGaussian; 动画: En3D, AniGS
推理硬件部分披露训练用 A100 80GB;推理仅报告显存需求 18–24 GB,未明确推理 GPU 型号
推理分辨率未披露原文未明确给出评测分辨率
推理环境未披露原文未给出框架/版本

静态重建:定量对比

方法PSNR ↑SSIM ↑LPIPS ↓FC ↓
GTA17.0250.9190.0870.051
SIFU16.6810.9170.0930.060
PSHuman17.5560.9210.0760.037
DreamGaussian18.5440.9170.0750.056
LHM-0.5B*25.1830.9510.0290.035
关键发现:LHM 在静态重建上 PSNR 达到 25.183,比最强 baseline DreamGaussian 高出 6.6 dB。LPIPS 从 0.075 降到 0.029,降幅 61%。* 表示该模型仅用合成数据训练,与 baseline 公平对比。#Qiu et al., 2025
静态重建定性对比
图 4:单视角重建的定性对比。LHM 在面部细节和衣物褶皱上保持最佳的外观保真度和纹理清晰度。来源:LHM, Fig. 4

动画重建:定量对比

方法PSNR ↑SSIM ↑LPIPS ↓FC ↓Time ↓Memory ↓
En3D15.2310.7340.1720.0585 min32 GB
AniGS18.6810.8710.1030.05315 min24 GB
LHM-0.5B21.6480.9240.0440.0422.01s18 GB
LHM-0.7B21.8790.9300.0390.0394.13s21 GB
LHM-1B22.0030.9300.0400.0356.57s24 GB
核心结论:LHM-1B 相比 AniGS 在 PSNR 上提升 3.322、SSIM 提升 0.059、LPIPS 降低 0.063、FC 降低 0.018。同时推理时间从 15 分钟降到 6.57 秒,显存持平。#Qiu et al., 2025
动画重建对比
图 5:动画重建定性对比。LHM 生成更准确、更逼真的动画结果,而 AniGS 的结果在忠实于输入图像方面存在不足。来源:LHM, Fig. 5

消融实验

1. 模型参数规模:从 0.5B → 0.7B → 1B,PSNR 从 21.648 → 21.879 → 22.003,逐步提升。但推理时间也从 2.01s 增至 6.57s,存在速度-质量权衡。 2. 数据规模
训练数据PSNR ↑SSIM ↑LPIPS ↓FC ↓
仅合成数据19.7530.9040.0600.057
+ 10K 视频20.6920.9110.0520.048
+ 50K 视频21.1080.9150.0500.043
+ 100K 视频21.4290.9200.0490.045
+ 300K(全部)21.6480.9240.0440.042

关键发现:合成数据单独训练泛化能力极差,加入真实视频后性能大幅提升。数据量从 10K→300K,PSNR 持续提升但边际递减效应明显——100K→300K 只提升 0.219 dB。这暗示 300K 可能已接近当前架构的收益上限。

3. Transformer 架构设计
配置PSNR ↑SSIM ↑LPIPS ↓FC ↓
w/ MM-Transformer(标准)20.0720.9070.1000.053
w/o Shrinkage Reg.21.0370.9150.0490.041
LHM-0.5B(完整)21.6480.9240.0440.042

MBHT 相比标准 MM-Transformer 提升 PSNR 1.576、LPIPS 降 0.056,证实了 Body-Head 分离注意力的有效性。Shrinkage Regularization 进一步提升整体性能,但 FC 从 0.041 升至 0.042——这是预期的权衡:牺牲少量面部一致性换取更好的身体建模。

模型架构消融
图 6:模型架构消融。(a) 标准 MM-Transformer; (b) LHM-0.5B; (c) LHM-1B。更大的模型在面部区域有更准确的重建。来源:LHM, Fig. 6
Canonical 正则化消融
图 7:Canonical 空间正则化消融。ASAP 损失消除半透明边界伪影,ACAP 损失消除人体周围的浮点。来源:LHM, Suppl. Fig.
Part 7
讨论与启发

技术贡献定位

LHM 在"单图可动画 3D 人体重建"这一任务上实现了从"优化式"到"前馈式"的范式跃迁。如果说 AniGS 是"先生成再优化"的两阶段方案,LHM 则是"端到端回归"的一阶段方案。这种跃迁与 2D 图像生成领域从 GAN 到扩散模型的变化不同——LHM 的进步体现在推理范式的简化上,而非生成质量的提升。

局限性

论文承认的主要局限是视角偏差:真实视频数据以正面视角为主,对罕见姿态和极端角度的覆盖不足,影响模型对新视角的泛化。#Qiu et al., 2025 此外从工程角度还有几个值得注意的问题:

  • 推理分辨率未披露:论文未明确给出评测时的渲染分辨率,使得指标的可复现性存在不确定性。
  • 运动驱动方式有限:LHM 只支持 SMPL-X 姿态参数驱动,无法直接接收文本或音频输入做语义级动画控制。
  • 衣物动态缺失:LHM 重建的是 canonical 空间的静态 3DGS,动画时只通过 LBS 做刚性形变,无法表示衣物的非刚性物理动态。
  • 显存门槛:虽然推理显存 18–24 GB 看似可接受,但这只是模型推理部分,加上前置的 SMPL-X 估计和后置渲染,完整 pipeline 的显存需求会更高。

启发与展望

1. LRM 范式的可扩展性得到验证。 LRM 在通用物体上证明了"大 Transformer + 大数据"的前馈重建可行,LHM 将其成功扩展到可动画人体。这意味着 LRM 范式可能适用于更多结构化对象(如手部、面部、动物)。 2. 冻结预训练编码器的策略值得借鉴。 LHM 冻结 Sapiens-1B 和 DINOv2,只训练 Transformer 和 MLP 部分。这种"冻结-提取-融合"的设计大幅降低了训练成本,同时利用了大规模预训练的语义知识。 3. 自监督视频训练的潜力。 LHM 不需要任何 3D 扫描标注,只用视频帧的渲染损失训练。这为解决 3D 标注稀缺问题提供了一个可行路径——只要有足够多的视频数据和可靠的 SMPL-X 估计,就可以训练出泛化能力强的人体重建模型。 4. Body-Head 分离注意力是一种通用的 part-aware 设计。 这种"先局部后全局"的注意力模式不限于人体,可以推广到任何有明显部件结构的任务(如车辆的车身-车灯、家具的框架-装饰)。

参考文献

  1. Qiu, L. et al. (2025). LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds. arXiv:2503.10625. ICCV 2025.
  2. Qiu, L. et al. (2024). AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction. arXiv:2412.02684. CVPR 2025. · 精读 →
  3. Hong, Y. et al. (2023). LRM: Large Reconstruction Model for Single Image to 3D. arXiv:2311.04400. ICLR 2024.
  4. Esser, P. et al. (2024). Scaling Rectified Flow Transformers for High-Resolution Images (SD3). arXiv:2403.03206. ICML 2024.
  5. Khirodkar, R. et al. (2024). Sapiens: Foundations for Human Vision Models. arXiv:2408.12569. ECCV 2024.
  6. Oquab, M. et al. (2023). DINOv2: Learning Robust Visual Features without Supervision. arXiv:2304.07193. TMLR 2024.
  7. He, K. et al. (2022). Masked Autoencoders Are Scalable Vision Learners (MAE). arXiv:2111.06377. CVPR 2022.
  8. Yang, T. et al. (2024). SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking. arXiv:2410.22455.
  9. Baradel, N. et al. (2024). Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot. arXiv:2403.07528.
  10. Pavlakos, G. et al. (2019). Expressive Body Capture: 3D Hands, Face, and Body from One Image (SMPL-X). arXiv:1904.05866. CVPR 2019.
  11. Kerbl, B. et al. (2013). 3D Gaussian Splatting for Real-Time Radiance Field Rendering. arXiv:2308.15240. SIGGRAPH 2023.