FlexAvatar
论文信息
- 标题:FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformation
- 作者:Cheng Peng, Zhuo Su, Liao Wang, Chen Guo, Zhaohu Li, Chengjiang Long, Zheng Lv, Jingxiang Sun, Chenyangguang Zhang, Yebin Liu
- 单位:清华大学(刘烨斌组);字节跳动 PICO
- 发表:CVPR 2026(arXiv 2512.17717)
- 开源:未开源(截至 2026.07 未找到官方仓库,项目页 pengc02.github.io/flexavatar)
照片级、可驱动的 3D 头部 Avatar 是沉浸式通信、远程会议和数字人应用的长期目标。3D Gaussian Splatting(3DGS)出现后,复杂场景的实时渲染变得实用,带起了一波高斯 Avatar 重建方法 #Kerbl et al., 2023。但对普通用户来说,现有管线仍然"娇贵":绝大多数方法要么需要多视角同步采集,要么需要已知相机位姿,要么需要每帧表情标签——这三样东西,随手用手机拍照的用户一样都给不了 #Peng et al., 2025a。
FlexAvatar 的目标可以用一句话概括:从 1 到 N 张随手拍的照片(无相机位姿、无表情标签、张数不限),前馈式地重建出一个高保真、可实时驱动、带表情细节形变的高斯头部 Avatar #Peng et al., 2025a。这里的每个定语都在砍掉一个使用门槛——"无位姿"意味着不需要标定,"无表情标签"意味着输入照片可以是任意表情,"张数不限"意味着一张自拍也行、四张连拍也行。
这篇论文来自清华大学刘烨斌组与字节跳动 PICO,一作彭程,发表于 CVPR 2026 #Peng et al., 2025a。刘烨斌组是国内 4D 人体捕捉与数字人方向的头部实验室,这篇工作延续了该组"大数据 + 前馈重建"的路线——与我们此前精读过的 LAM、MATCH 同属"大重建模型(LRM)做 Avatar"这一快速升温的赛道 #Hong et al., 2023。
arXiv 上同期还有另一篇同名 "FlexAvatar"(arXiv 2512.15599,Kirschstein 等人),是完全不同的工作。本文精读的是清华 + PICO 的 arXiv 2512.17717,检索时请勿混淆。
要理解 FlexAvatar 的设计,先要看清它想同时打败的三类前作,以及各自的失败方式 #Peng et al., 2025a。
2.1 现有方法的三类局限
| 路线 | 代表工作 | 优势 | 失败方式 |
|---|---|---|---|
| 2D 驱动生成器 | GAGAvatar、Portrait4D | 大规模 2D 数据带来高视觉保真度 | 3D 几何一致性差,侧脸畸变;细节动态形变复现不忠实 |
| 3D 先验系统 | HeadGAP、One2Avatar | 几何一致性强 | 3D 数据身份多样性小;依赖耗时的 inversion 或逐人微调 |
| 大重建 / 基础模型 | LRM、LAM、Avat3r | 数据与模型规模化带来强泛化 | 输入张数固定;输出与驱动信号不完全匹配;依赖 cross-attention 注入表情,难以实时 |
论文把这三类问题归纳为三个关键障碍 #Peng et al., 2025a:弱灵活性(要么只吃单图、要么必须多视角 + 已知位姿 + 一致表情)、弱表情保真度(眼睑、皱纹、牙齿等表情敏感区域的动态细节丢失)、伪 3D 伪影(正脸好看、侧脸拉伸变形)。
2.2 论文的 Insight:把"聚合"与"驱动"拆成两个专用模块
一个自然的疑问是:为什么 LAM、Avat3r 这些大重建模型不能既灵活又实时?答案藏在架构里。以 LAM 为例,它用纯 LBS(线性混合蒙皮)驱动规范空间高斯——快是快了,但 LBS 是低频形变,表达不出皱纹和露齿这类高频细节 #He et al., 2025。Avat3r 反过来,用 cross-attention 把表情注入重建网络——细节有了,但每帧都要过一遍大 Transformer,据其报告只能跑约 8 FPS #Kirschstein et al., 2025。GAGAvatar 用轻量 MLP 预测形变,介于两者之间,但形变缺乏空间结构,常出伪影 #Chu et al., 2024。
FlexAvatar 的 Insight 是:重建慢一点没关系(只做一次),驱动必须快(每帧都做);所以把"重"的 Transformer 全部放在重建端,驱动端只留一个轻量 UNet。而要让轻量 UNet 也能产生高质量形变,关键是给它一个空间对齐的工作空间——FLAME 的 UV 空间 #Li et al., 2017:身份特征和驱动表情都展开成 UV 图,逐像素对齐后,卷积网络就能高效地学"这个像素的皮肤在这个表情下应该怎么动"。
FlexAvatar 是一个两段式前馈架构:上半段是灵活重建模型(任意输入 → 规范空间静态高斯),下半段是动态高斯解码器(驱动表情 → 细节形变)。整体流程如图 2。
3.1 灵活重建模型:结构化 Head Query token
Motivation:输入可能是 1 张也可能是 4 张,可能是任意角度、任意表情,且没有相机位姿。网络需要一个"锚",把这些杂乱信息统一到规范空间。
Mechanism:每张输入图(512×512)先经过冻结的 DINOv3 编码器提取 token #Simeoni et al., 2025:
N 张图的 token 直接拼接后过 6 层 Self-Attention 做跨视角融合——注意这里没有任何位姿编码,网络纯靠内容对应关系对齐视角:
真正的"锚"是一组可学习的结构化 Head Query token \(Q_H \in \mathbb{R}^{2500 \times 512}\)。这 2500 个 token 对应 FLAME UV 空间的 50×50 网格——每个 token 天生"负责"头部的一个固定区域。它们通过 6 层 Cross-Attention 从聚合特征中"认领"属于自己区域的信息:
由于 query 数量固定为 2500,无论输入 1 张还是 N 张图,输出维度都不变——输入张数无关性就是这样免费获得的。\(F_Q\) 重排为 50×50×512 的 UV 特征图后,经卷积 Decoder 上采样 8 倍到 400×400,输出两样东西:
重建模型输出
其中 \(F_{\text{id}} \in \mathbb{R}^{400 \times 400 \times 32}\) 是 ID 特征图(身份的 UV 空间编码,供下游动态解码用);\(G_{\text{st}} \in \mathbb{R}^{400 \times 400 \times 14}\) 是静态高斯图,每个 UV 像素对应一个 3D 高斯的位置 \(P\)、不透明度 \(\alpha\)、尺度 \(S\)、颜色 \(C\)、旋转 \(R\),共 141,445 个有效高斯。
值得注意的一个工程细节:论文把 FLAME 模板从 5023 个顶点扩展到 5143 个,新增的顶点全部用于牙齿区域——这是为"露齿"这一高难表情预留的几何容量 #Peng et al., 2025a。
3.2 动态高斯解码器:UNet 在 UV 空间画形变
Motivation:LBS 只能表达骨骼级的低频运动,皱纹、嘴唇挤压、眼睑闭合这些高频细节需要额外的形变场。前作要么不建模(LAM),要么建得太贵(Avat3r 的 cross-attention)。
Mechanism:驱动信号是 FLAME 表情系数对应的 UV 位置图 \(P_{\text{driving}}\)——把驱动表情下每个顶点的 3D 坐标烘焙到 UV 平面上。它与 ID 特征图逐通道拼接:
为什么用 UV 位置图而不是直接把 FLAME 系数向量喂进去?因为系数是全局向量,没有空间结构;而 UV 位置图与 \(F_{\text{id}}\) 逐像素对齐——同一个 UV 坐标上,一边是"这块皮肤是谁的",另一边是"这块皮肤现在应该在哪"。这正是卷积网络最擅长处理的输入。一个 4 层下采样 + 4 层上采样的轻量 UNet 输出形变量:
动态形变解码
\(M_{\text{dyn}}\) 是动态区域掩码,限制形变只作用于面部表情敏感区域,避免头发、肩膀被误动。最终图像由 LBS 变换 + 高斯 Splatting 渲染:\(I = \mathcal{R}(\text{LBS}(G_{\text{dyn}}), \Theta)\),其中 \(\Theta\) 为相机参数。
3.3 数据分布调整:让模型多看"极端表情"
Motivation:训练视频里绝大多数帧是中性或过渡表情,皱眉、龇牙这类"关键帧"占比极低。均匀采样训练,模型自然学不好稀有表情。
Mechanism:论文选定 20 个锚点表情(皱纹、露齿等),对每个锚点用 FLAME 系数的余弦相似度在全体训练序列中检索相似帧,把它们提升为高频训练样本;同时每个 ID 再补 6 帧随机样本防止过拟合 #Peng et al., 2025a。
3.4 可选 Refinement:10 秒补齐长尾身份
前馈模型再强,也会在长尾外观(头发、衣物等)上失手。FlexAvatar 提供一个轻量测试时微调:只用输入的那几张图,微调编码器参数 20 步(约 10 秒),UNet 全程冻结、嘴部区域梯度截断——保证提升身份细节的同时不破坏已学好的动态形变能力 #Peng et al., 2025a:
"冻结 UNet + 截断嘴部梯度"是这个 refinement 最聪明的地方:微调只有几张图,如果放开动态解码器,它会立刻过拟合到输入表情上,驱动泛化能力崩掉。把可动的部分锁死,只让"长相"更新,10 秒微调才敢做。
4.1 训练数据与预处理
FlexAvatar 的训练数据由两部分组成 #Peng et al., 2025a:
- NeRSemble:公开多视角头部视频数据集,取 150 个身份训练、16 个测试,每人 16 个视角 #Kirschstein et al., 2023;
- FaceCap:团队自采的 2000 个身份、30 视角 360° 环拍数据集(未公开),16 个身份留作测试,每人采集 26 种表情。
预处理管线:VHAP 估计每帧 FLAME 参数,MODNet 抠前景,ParsingHuman 做头部解析分割;对野外单图测试数据用 Pixel3DMM 估计 FLAME #Peng et al., 2025a。训练时 FaceCap 每个 ID 采样 30 视角 × 26 时间步(NeRSemble 为 16 视角),输入端随机取 1~4 张图模拟灵活输入,并从同一 ID 的 4 个不同时间步采样监督视角以实现身份 / 表情解耦。
4.2 损失函数
训练目标是多视角光度重建损失的加权和 #Peng et al., 2025a:
其中 \(\lambda_{l1}=1\)、\(\lambda_{\text{ssim}}=0.1\)、\(\lambda_{\text{lpips}}=0.2\)、\(\lambda_{\text{mouth}}=10\)、\(\lambda_{\text{xyz}}=0.01\)、\(\lambda_{\text{scale}}=1\)。嘴部损失权重高达 10——嘴是表情驱动最难也最显眼的区域,专门用解析掩码裁出嘴部区域重点监督;\(\mathcal{L}_{\text{xyz}}\) 和 \(\mathcal{L}_{\text{scale}}\) 是对高斯位置偏移和尺度的正则,防止高斯"飞出"头部表面 #Peng et al., 2025a。
4.3 训练配置披露表
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | NeRSemble 150 ID + FaceCap(自采)2000 ID,26 表情,16/30 视角 |
| 训练硬件 | 已披露 | 16× 80GB GPU(型号未披露) |
| 优化器 | 已披露 | Adam |
| 学习率 | 已披露 | 3e-5(schedule / warmup 未披露) |
| Batch size | 未披露 | 原文未给出 |
| 训练步数 / 轮数 | 未披露 | 原文未给出 |
| 训练时长 | 已披露 | 约 4 天 |
| 模型参数量 | 未披露 | 原文未给出 |
| 精度格式 | 未披露 | 原文未给出 |
| Checkpoint 策略 | 未披露 | 原文未给出 |
| 图像编码器 | 已披露 | DINOv3,训练中冻结 |
| 损失权重 | 已披露 | λ_l1=1, λ_ssim=0.1, λ_lpips=0.2, λ_mouth=10, λ_xyz=0.01, λ_scale=1 |
| 数据分布调整 | 已披露 | 20 锚点表情 + FLAME 余弦相似度检索 + 每 ID 6 随机帧 |
Batch size、总步数、参数量、训练精度均未披露,且核心训练数据 FaceCap(2000 ID)为私有数据、代码未开源。第三方完整复现这篇工作的实际门槛非常高——能拿到的只有 NeRSemble 的 150 个身份,而论文自己的 scaling 实验(Part 6)恰恰说明身份数是质量的决定性因素。
FlexAvatar 是实时系统,推理链路值得逐段拆解。整个流程分"一次性"与"每帧"两段,这个划分正是它能实时的根本原因。
graph TD
subgraph ONCE["一次性阶段(约 0.4 秒 / 4 张输入图)"]
A["1~N 张无位姿照片"] --> B["冻结 DINOv3 编码"]
B --> C["Self-Attention 跨视角融合"]
C --> D["Head Query 2500 token 聚合"]
D --> E["卷积 Decoder"]
E --> F["ID 特征图 400×400×32"]
E --> G["静态高斯图 400×400×14"]
F -.-> H["可选 Refinement:20 步约 10 秒"]
end
subgraph FRAME["每帧阶段(UNet+LBS+渲染 22 ms,约 45 FPS)"]
I["驱动 FLAME 表情系数"] --> J["烘焙 UV 位置图"]
F --> K["逐通道拼接"]
J --> K
K --> L["轻量 UNet(4 下采样 + 4 上采样)"]
L --> M["动态形变 ΔG"]
G --> N["静态高斯 + 掩码形变"]
M --> N
N --> O["LBS 姿态变换"]
O --> P["3DGS Splatting 渲染"]
end5.1 一次性阶段:编码与重建
用户提供 1~4 张照片(无需位姿、表情不限),网络前向一次得到 ID 特征图与静态高斯图。4 张输入图的编码耗时约 0.4 秒 #Peng et al., 2025a。此后这两张图就被缓存,输入图片不再参与任何计算——这意味着重建成本与后续驱动时长完全解耦,驱动一分钟和驱动一小时的单帧成本相同。
若用户身份特殊(头发、衣物等长尾外观),可追加 20 步 refinement(约 10 秒)。注意这仍属"一次性"成本:微调的是编码器,不影响每帧速度。
5.2 每帧阶段:22 ms 的形变 + 渲染
驱动信号可以来自任何 FLAME 参数源:另一段视频的表情追踪结果(reenactment)、语音驱动模型的输出、或手工编辑的系数。每帧执行四步:烘焙 UV 位置图 → UNet 解码形变 → LBS 姿态变换 → Splatting 渲染。论文报告的 22 ms/帧(约 45 FPS)覆盖 UNet + LBS + Splatting 三步,UV 烘焙不计入该计时 #Peng et al., 2025a。
值得一问的是:驱动端全程没有表情标签监督,UNet 是怎么学会"表情 → 形变"映射的?答案在训练协议里——每次迭代从同一 ID 的 4 个不同时间步采样监督视角,输入图与监督图的表情互不相同,网络被迫把身份(跨时间步不变)与表情(由驱动 UV 位置图给定)解耦开来。这正是"无表情标签输入"能成立的机制基础 #Peng et al., 2025a。
这里可以清楚看到架构决策如何兑现成速度:每帧路径上只有一个 4 下采样 + 4 上采样的小 UNet 和线性的 LBS——没有 Transformer,没有 cross-attention。作为对照,Avat3r 每帧都要让表情信号过一遍重建网络的 cross-attention,据其报告约 8 FPS,不到 FlexAvatar 的五分之一 #Kirschstein et al., 2025。
5.3 实时性对比与部署视角
| 方法 | 驱动机制 | 帧率 | 细节形变 |
|---|---|---|---|
| LAM | 纯 LBS | 实时(快) | ❌ 无高频细节 |
| GAGAvatar | 轻量 MLP 形变 | 实时 | ⚠️ 有细节但常出伪影 |
| Avat3r | Cross-Attention 注入 | 约 8 FPS(据其报告) | ✅ 细节好但不实时 |
| FlexAvatar | UV 空间轻量 UNet | 45 FPS | ✅ 细节 + 实时 |
需要指出的是,论文未披露达成 45 FPS 的具体 GPU 型号,也未报告端到端延迟的分项拆解(UV 烘焙、UNet、渲染各占多少),部署评估时应以自测为准 #Peng et al., 2025a。
6.1 实验配置表
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | NeRSemble 16 测试 ID + FaceCap 16 测试 ID + 野外单图 |
| 评测指标 | 已披露 | PSNR↑ / SSIM↑ / LPIPS↓ / CSIM↑ / AKD↓ / AED↓ |
| Baseline 方法 | 已披露 | LAM、Portrait4D-v1/v2、GAGAvatar;另与 HeadGAP、Avat3r 单独对比 |
| 推理硬件 | 未披露 | 45 FPS 对应的 GPU 型号原文未给出 |
| 推理分辨率 | 已披露 | 输入 512×512 |
| 推理环境 | 未披露 | 框架 / 版本原文未给出 |
指标覆盖了数字人评测的三个维度:画质(PSNR/SSIM/LPIPS)、身份保持(CSIM)、驱动准确度(AKD 关键点距离 / AED 表情距离)。这套指标没有覆盖音画同步与长时稳定性——FlexAvatar 是表情系数驱动而非音频驱动,属合理范围,但接语音管线时需另行评测同步质量。
6.2 主实验:NeRSemble 自重演与跨身份重演
评测协议:主表中所有方法均以单张图片为输入(保证与单图基线公平),3D 一致性通过 4 个 held-out 测试视角同时评测;Portrait4D 系列的数值为其公开模型在同一协议下的测试结果 #Deng et al., 2024。
| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | CSIM↑ | AKD↓ | AED↓ | 跨身份 CSIM↑ | 跨 AKD↓ | 跨 AED↓ |
|---|---|---|---|---|---|---|---|---|---|
| LAM | 17.83 | 0.8031 | 0.2730 | 0.8213 | 5.76 | 2.81 | 0.8278 | 8.38 | 4.88 |
| Portrait4D-v1 | 19.37 | 0.8121 | 0.2410 | 0.8390 | 4.67 | 2.39 | 0.8399 | 8.07 | 4.20 |
| Portrait4D-v2 | 19.63 | 0.8184 | 0.2360 | 0.8385 | 4.69 | 2.43 | 0.8389 | 8.06 | 4.24 |
| GAGAvatar | 19.17 | 0.8283 | 0.2567 | 0.8474 | 3.87 | 2.12 | 0.8479 | 8.26 | 4.05 |
| Ours(前馈) | 21.15 | 0.8335 | 0.2193 | 0.8490 | 3.65 | 2.05 | 0.8501 | 7.87 | 3.64 |
| Ours(+refinement) | 22.63 | 0.8491 | 0.1833 | 0.8532 | 3.44 | 1.91 | 0.8549 | 7.24 | 3.59 |
与 3D 先验路线的 HeadGAP 单独对比在 FaceCap 测试集上进行(HeadGAP 需逐人 inversion):HeadGAP PSNR 20.77 / LPIPS 0.2210 / AKD 3.67,FlexAvatar 前馈版与之大体相当,refinement 后则明显超越——前馈 + 10 秒微调即可换掉一条逐人优化管线 #Zheng et al., 2024。
6.3 消融实验
在 FaceCap 测试集上的消融结果 #Peng et al., 2025a:
| 配置 | PSNR↑ | LPIPS↓ | SSIM↑ |
|---|---|---|---|
| w/o UV 位置图(直接用 FLAME 系数) | 22.51 | 0.1845 | 0.8772 |
| w/o 数据分布调整 | 22.74 | 0.1868 | 0.8745 |
| w/o 嘴部损失 | 23.10 | 0.1810 | 0.8890 |
| 完整模型 | 23.32 | 0.1797 | 0.8895 |
三个组件中 UV 位置图贡献最大(去掉后 PSNR 掉 0.81 dB)——验证了 Part 3 的核心论点:驱动信号的空间对齐表示比信号本身的信息量更重要。数据分布调整去掉后 SSIM 从 0.8895 降到 0.8745、LPIPS 为三组消融中最差(0.1868),说明极端表情训练不足时,结构相似度退化、动态纹理在大表情下失真。
6.4 灵活性与 scaling 验证
输入张数实验:从 1 张增加到 4 张输入,重建质量单调提升——验证了 Head Query 聚合机制的输入张数无关性 #Peng et al., 2025a。输入上限 4 张是 GPU 显存限制,不是架构限制。由于高斯定义在完整的 FLAME UV 空间上,即便单图输入,重建结果也支持 360° 全头渲染(含后脑勺等未观测区域)。
身份数 scaling:训练身份从 250 增加到 2000+,测试集 PSNR 持续上升、LPIPS 持续下降,曲线尚未出现明显饱和迹象 #Peng et al., 2025a。
7.1 在地图上的位置
| 维度 | LAM | GAGAvatar | Avat3r | HeadGAP | FlexAvatar |
|---|---|---|---|---|---|
| 输入 | 单图 | 单图 | 4 图(固定) | 少样本 + inversion | 1~N 图,无位姿 |
| 表情标签 | 不需要 | 不需要 | 需要一致表情 | 需要 | 不需要 |
| 驱动帧率 | 快(纯 LBS) | 实时 | 8 FPS | 实时 | 45 FPS |
| 细节形变 | ❌ | ⚠️ | ✅ | ⚠️ | ✅ |
| 逐人优化 | 无 | 无 | 无 | 需要 | 可选 10 秒 |
FlexAvatar 代表了前馈 Avatar 赛道的一个清晰趋势:从"套用通用 LRM"走向"为头部任务专用化设计"。结构化 Head Query 是把 FLAME 拓扑先验编进 query 的专用化;UV 空间 UNet 是把"形变有空间局部性"这一先验编进解码器的专用化。与之呼应,我们精读过的 MATCH(CVPR 2026)在配准任务上做了类似的"前馈专用头部化"——这批工作共同显示出逐人优化时代在头部 Avatar 领域正在落幕。
7.2 局限性
论文坦承的局限 #Peng et al., 2025a:眼镜、帽子等配饰易出伪影(训练数据中罕见);蓬松长发建模不佳(高斯贴 FLAME UV 的拓扑限制);只建头部,无身体与衣物;光照泛化一般;输入上限 4 张受显存限制。论文给出的未来方向包括引入生成先验补全长尾外观、扩展到头肩 / 上半身建模。此外从复现角度:代码未开源、FaceCap 私有、推理 GPU 未披露,是工程落地评估时必须自行补测的空白。
7.3 可操作启发
- 驱动信号表示 > 驱动网络容量:消融显示把 FLAME 系数烘焙成 UV 位置图(空间对齐)比换更大网络收益直接。任何"全局系数驱动局部形变"的任务(身体、手、衣物)都可以套用这个思路。
- 重建 / 驱动算力分离:把重计算放进一次性阶段、每帧路径只留卷积,是实时数字人系统的通用架构模式;语音驱动管线同样适用。
- 锚点检索式数据重加权:用参数空间余弦相似度检索稀有样本做分布调整,成本极低,适用于任何"长尾表情 / 姿态学不好"的生成任务。
- 测试时微调的安全边界:只调身份分支、冻结动态分支并截断关键区域梯度——few-shot 个性化时防止驱动能力退化的可复用配方。
参考来源
- Peng, C., Su, Z., Wang, L., Guo, C., Li, Z., Long, C., Lv, Z., Sun, J., Zhang, C., Liu, Y. (2025). FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformation. CVPR 2026. arXiv:2512.17717
- Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. (2023). 3D Gaussian Splatting for Real-Time Radiance Field Rendering. SIGGRAPH 2023. arXiv:2308.04079
- He, Y. et al. (2025). LAM: Large Avatar Model for One-shot Animatable Gaussian Head. SIGGRAPH Asia 2025. arXiv:2502.17796 · 精读 →
- Kirschstein, T., Romero, J., Sevastopolsky, A., Nießner, M., Saito, S. (2025). Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars. ICCV 2025. arXiv:2502.20220
- Chu, X., Li, Y., Zeng, A., Yang, T., Lin, L., Liu, Y., Harada, T. (2024). GAGAvatar: Generalizable and Animatable Gaussian Head Avatar. NeurIPS 2024. arXiv:2410.07971
- Deng, Y., Wang, D., Wang, B. (2024). Portrait4D-v2: Pseudo Multi-View Data Creates Better 4D Head Synthesizer. ECCV 2024. arXiv:2403.13570
- Zheng, X. et al. (2024). HeadGAP: Few-shot 3D Head Avatar via Generalizable Gaussian Priors. 3DV 2025. arXiv:2408.06019
- Li, T., Bolkart, T., Black, M. J., Li, H., Romero, J. (2017). Learning a Model of Facial Shape and Expression from 4D Scans (FLAME). SIGGRAPH Asia 2017. flame.is.tue.mpg.de
- Kirschstein, T., Qian, S., Giebenhain, S., Walter, T., Nießner, M. (2023). NeRSemble: Multi-view Radiance Field Reconstruction of Human Heads. SIGGRAPH 2023. arXiv:2305.03027
- Siméoni, O. et al. (2025). DINOv3. arXiv preprint. arXiv:2508.10104
- Hong, Y. et al. (2023). LRM: Large Reconstruction Model for Single Image to 3D. ICLR 2024. arXiv:2311.04400