MATCH:前馈式高斯配准
论文信息
- 标题:Feed-forward Gaussian Registration for Head Avatar Creation and Editing
- 作者:Malte Prinzler, Paulo Gotardo, Siyu Tang, Timo Bolkart
- 单位:ETH Zürich; Google
- 发表:CVPR 2026
- 开源:https://github.com/malteprinzler/MATCH
创建一个高质量、可动画的 3D 头部 Avatar 需要多长时间?如果你用 2025 年最先进的方法 GEM,答案是45.3 小时——先花 10.7 小时做 mesh tracking,再花 27.7 小时优化 CNN-based avatar,最后花 6.9 小时训练 expression regressor。#Zielonka-et-al.-2025 这意味着,即使你拥有顶级的多视图采集系统,为 100 个受试者创建 Avatar 也需要近半年的计算时间。
这个瓶颈的根源在于一个看似合理的两阶段流水线:先建立跨视图和跨帧的几何对应(mesh-based tracking),再优化附着在 mesh 表面的外观基元(如 Gaussian splats)。#Kerbl-et-al.-2023 #Huang-et-al.-2024 每个阶段都依赖耗时的优化过程,且后一阶段必须等前一阶段完成。
MATCH(Multi-view Avatars from Topologically Corresponding Heads)提出了一个截然不同的思路:用单个前馈 transformer 直接从标定的多视图图像预测密集语义对应的 Gaussian splat 纹理,每帧仅需 0.5 秒。#Prinzler-et-al.-2026 这里的"密集语义对应"意味着:无论输入的是谁的脸、什么表情,输出纹理中的每个 Gaussian 都始终代表同一个语义区域(例如鼻尖始终是同一个 Gaussian)。
作者 Malte Prinzler 在 Google 实习期间完成本工作,合作者 Timo Bolkart 是 FLAME 3DMM 和 TEMPEH 的创建者,Siyu Tang 是 ETH Zürich 视觉与学习组(VLG)的 PI。团队此前在 Neural Head Avatars、DINER、Joker 等工作中积累了丰富的 3D 头部建模经验。
要理解 MATCH 解决了什么问题,我们需要先看清楚现有方法的技术路线和各自的瓶颈。#Prinzler-et-al.-2026
三类方法的困境
论文 Related Works 将已有头部 Avatar 方法分为三类:
| 类别 | 代表方法 | 核心思路 | 关键瓶颈 |
|---|---|---|---|
| 优化式头部对应 | FLAME, TEMPEH, VHAP | 优化 mesh 到 3D 扫描/多视图图像 | VHAP tracking 需 12s/帧,整个序列 10.7h |
| 优化式 Avatar | GaussianAvatars, GEM, RGBAvatar | 先 tracking 再优化外观基元 | GEM 总计 45.3h/avatar |
| 推理式 Avatar | LAM, FastAvatar, Avat3r, FaceLift | 前馈网络直接预测 3D 表示 | 无跨帧对应 / 质量差 / 泛化弱 |
优化式方法的质量最高,但时间成本令人望而却步。推理式方法速度快,但存在一个根本性缺陷:它们预测的 Gaussian splats 缺乏跨帧语义对应。Avat3r 和 FaceLift 预测的是 pixel-aligned Gaussians,每个像素位置的 Gaussian 在不同帧之间没有语义关联;LAM 和 FastAvatar 虽然在 3DMM 顶点上预测 Gaussians,但在 canonical 空间而非 posed 空间中工作,保真度受限。#Kirschstein-et-al.-2025 #Lyu-et-al.-2025 #He-et-al.-2025 #Wu-et-al.-2025
Dense Attention 的陷阱
一个自然的想法是用 Large Reconstruction Model(LRM)风格的 transformer,让 UV tokens 和 image tokens 之间做全量 cross-attention。#Zhang-et-al.-2024 #Tang-et-al.-2024 但论文发现这条路线有两个严重问题:
第一,计算复杂度随输入图像数量二次增长。12 张 640×512 的图像经 patch 化后产生大量 image tokens,与 UV tokens 做全量 attention 的计算量惊人。
第二,更反直觉的是,全量 attention 反而降低了泛化能力。在未见过的受试者上,dense attention 的 LPIPS 从 0.187 恶化到 0.221,PSNR 从 23.032 降到 20.364 #Prinzler-et-al.-2026。原因在于:当每个 UV token 试图关注所有 image tokens 时,模型容易被无关区域干扰,难以聚焦真正有用的信息。
MATCH 的目标是从 $V$ 张标定的多视图图像 $\mathcal{I} \in \mathbb{R}^{H_\text{img} \times W_\text{img} \times 3}$ 预测一张 UV 纹理图 $\mathcal{G} \in \mathbb{R}^{H_\text{uv} \times W_\text{uv} \times C}$,其中每个 texel 编码一个 Gaussian splat 的全部属性:RGB 颜色 $\mathbf{c}$、不透明度 $\boldsymbol{\alpha}$、位置 $\boldsymbol{\phi}$、各向异性缩放 $\boldsymbol{\sigma}$ 和旋转四元数 $\boldsymbol{\theta}$。#Prinzler-et-al.-2026
Image Tokenization
输入图像首先与 Plücker ray coordinates 拼接,然后被分割为 $8 \times 8$ 的 patch,通过 2D 卷积层转为 tokens。借鉴 Avat3r 的做法,这些 tokens 与 Sapiens 预训练特征拼接后线性投影到 $d=512$ 维。#Kirschstein-et-al.-2025 #Khirodkar-et-al.-2024
粗略 Mesh Registration
MATCH 使用 TEMPEH 的 global stage(不含 head localization)从输入图像估计粗略 mesh $\mathcal{M} \in \mathbb{R}^{N_\text{vert} \times 3}$。#Bolkart-et-al.-2023 TEMPEH 在 Ava-256 数据集上训练,采用该数据集提供的 mesh topology(包含头发代理几何),能在单次推理中完成。这个粗略 mesh 是后续 registration-guided attention 的基础——它告诉我们每个 UV token 应该关注图像中的哪个区域。
UV Tokenization
UV tokenization 将高分辨率 UV 纹理编码为低分辨率 token grid。具体步骤:(1) 通过 per-texel barycentric interpolation 计算密集 3D 位置纹理;(2) 将输入图像重投影到 mesh $\mathcal{M}$ 上获取 RGB 纹理;(3) 拼接 RGB 和 3D 位置纹理,分割为 $16 \times 16$ 的非重叠 patch;(4) 展平并与可学习位置编码拼接,线性投影为 $d=512$ 维 UV tokens。最终产生 $64 \times 64$ 个 UV tokens,对应 $1024 \times 1024$ 的纹理(1M Gaussians)。
Registration-Guided Attention(核心创新)
这是 MATCH 的核心模块。核心问题是:如何确定每个 UV token 应该关注哪些 image tokens?
MATCH 通过将粗略 mesh $\mathcal{M}$ 的 UV 坐标 rasterize 到输入图像平面上来确定对应关系。由于每个 UV token 代表一个纹理 patch,可以用其 UV 坐标范围过滤 rasterized UV 坐标,得到该 token 的感兴趣区域 $\text{RoI}_{\mathcal{T}, \text{uv}}$。对应分数定义为:
对应分数(Correspondence Score)
其中 $\mathcal{B}_{\mathcal{T},\text{img}}$ 是 image token 的 bounding box,$\mathcal{B}_\text{encomp}$ 是同时包含 $\mathcal{B}_{\mathcal{T},\text{img}}$ 和 $\text{RoI}_{\mathcal{T},\text{uv}}$ 的包围框,$\lambda = 0.1$。第一项衡量 image token 落在 RoI 内的像素比例(类似 precision),第二项衡量 image token 在 RoI 附近的比例(类似 recall,防止边缘 token 被遗漏)。
Grouped Attention
Registration-guided attention 之后是 grouped attention block,对 UV tokens 和每张图像的 image tokens 分别做 self-attention。这一模块将信息传播到未被观测到的头部区域,并允许图像空间特征处理,计算复杂度随输入图像数量线性增长。UV De-tokenization
Transformer 输出的 UV tokens 被线性投影回 $16 \times 16 \times C$ 的纹理 patch,组装成 $1024 \times 1024 \times C$ 的 Gaussian splat 纹理。对于颜色和位置,借鉴 Avat3r 的 skip connection,将预测值作为 UV tokenization 阶段初始值的偏移量(offset),而非直接预测绝对值。与已有方法的技术对比
| 维度 | MATCH | Avat3r | LAM/FastAvatar | GEM |
|---|---|---|---|---|
| 核心表示 | UV-aligned Gaussian 纹理 | Pixel-aligned Gaussians | 3DMM-vertex Gaussians | CNN avatar → PCA |
| 跨帧对应 | ✅ 密集语义对应 | ❌ 无 | ✅ 3DMM 拓扑 | ✅ mesh tracking |
| 重建空间 | Posed space(所见即所得) | Posed space | Canonical space | Canonical space |
| Attention 机制 | Registration-guided(局部) | Dense(全局) | — | — |
| 推理速度 | 0.5s/帧 | — | — | 12s/帧(tracking) |
| Avatar 创建 | 4.6h | 不适用 | 不适用 | 45.3h |
损失函数
总损失
光度损失 $\mathcal{L}_\text{photometric} = w_\text{LPIPS} \cdot \mathcal{L}_\text{LPIPS} + w_\text{L1} \cdot \mathcal{L}_\text{L1} + w_\text{SSIM} \cdot \mathcal{L}_\text{SSIM}$,匹配预测外观与真值图像。几何损失 $\mathcal{L}_\text{geometry}$ 最小化预测 Gaussian 3D 位置与真值 mesh registration 的 L2 距离。正则化损失 $\mathcal{L}_\text{reg}$ 对 scale 和 opacity 施加 L2 约束,目标值分别为 $5 \times 10^{-4}$ 和 $0.7$。
躯干和肩部区域使用预训练的 Sapiens 语义分割模型进行 mask。#Khirodkar-et-al.-2024
三阶段训练策略
| 阶段 | 迭代范围 | 训练数据 | 激活损失 | 关键权重 |
|---|---|---|---|---|
| Geometry Only | 0 – 100k | Ava-256 | $\mathcal{L}_\text{geometry}$ + $\mathcal{L}_\text{reg}$ | $w_\text{geometry} = 10^{-3}$, $w_\text{reg} = 10^{-3}$ |
| Geometry & Appearance | 100k – 400k | Ava-256 | 加入 $\mathcal{L}_\text{photometric}$ | $w_\text{L1} = 0.8$, $w_\text{SSIM} = 0.2$, LPIPS 从 0 线性增至 1.0 |
| Mixed Training | 400k – 860k | Ava-256 + NeRSemble | 全部损失(NeRSemble 无 $\mathcal{L}_\text{geometry}$) | $w_\text{LPIPS} = 1.0$ |
LPIPS 损失的 warmup 策略值得注意:在 150k 步之前权重为 0,然后线性增加到 200k 步时达到 1.0。这是一个防止训练早期被感知损失主导的实用技巧。
训练配置披露
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | Ava-256 (256 subjects, 80 cameras) + NeRSemble v2 (425 subjects, 16 cameras),各采样 123k 训练帧 + 1k 验证帧 |
| 训练硬件 | 已披露 | 4× NVIDIA H100 80GB |
| 优化器 | 已披露 | AdamW, weight decay = 0.05 |
| 学习率 | 已披露 | 初始 4e-5, cosine schedule 衰减至 0(1M 步内),1000 步 linear warmup |
| Batch size | 已披露 | per-GPU batch size = 1 |
| 训练步数 | 已披露 | 860k iterations |
| 训练时长 | 已披露 | 11.8 天 |
| 模型参数量 | 未披露 | 原文未明确给出总参数量 |
| 精度格式 | 未披露 | 原文未明确给出 |
| Checkpoint 策略 | 未披露 | 原文未明确给出 |
| UV 纹理分辨率 | 已披露 | 1024×1024(1M Gaussians) |
| UV token 数 | 已披露 | 64×64,patch size 16 |
| Token 维度 | 已披露 | d = 512 |
| Attention blocks | 已披露 | 6 registration-guided + 6 grouped |
| k_T,img | 已披露 | 100(每个 UV token 关注的 image tokens 数) |
MATCH 的推理流程不只是"输入图像→输出 Gaussians"那么简单。预测出的 Gaussian 纹理因其密集语义对应特性,支持多种下游应用。#Prinzler-et-al.-2026
推理流程
给定 12 张 $640 \times 512$ 的标定多视图图像:(1) TEMPEH global stage 在单次前馈中估计粗略 mesh;(2) MATCH transformer 预测 1024×1024 的 Gaussian splat 纹理;(3) 输出的 1M Gaussians 可用 2D Gaussian Splatting 以 570 fps 渲染。#Huang-et-al.-2024 整个过程每帧仅需 0.5 秒(2 fps),无需任何数据预处理。
Avatar 创建:MATCH-based GEM
GEM(Gaussian Eigen Models)展示了将高质量 3D 头部 Avatar 蒸馏为轻量级 PCA 表示的方法。#Zielonka-et-al.-2025 原始 GEM 流程需要 mesh tracking(10.65h)+ CNN avatar 优化(27.70h)+ regressor 训练(6.94h),总计 45.29h。
MATCH 的密集对应预测使 GEM 流程可以被大幅简化:
MATCH 对 GEM 做了四项关键改进:
1. 跳过 Tracking 和 CNN Avatar 训练:MATCH 直接预测对应的 Gaussians,通过 inverse linear blend skining 转换到 canonical space 后直接做 PCA 分解
2. 联合 PCA:GEM 对每个属性(rotation, position, opacity, scale)分别做 PCA;MATCH 发现联合 PCA 能捕捉跨属性关联(如抬眉毛时额头皱纹颜色变化),效果更好
3. 动态颜色:GEM 禁用动态颜色以促进对应;MATCH 放弃这一约束,因为其预测本身就具有高语义对应。口腔内部区域例外——固定为均值以避免 MLP 无法学习复杂动态
4. 均值精修:GEM 只精修 PCA 基向量;MATCH 额外精修 PCA 均值 $\boldsymbol{\mu}_i$
| 阶段 | GA | RGBAvatar | GEM | MATCH (Ours) |
|---|---|---|---|---|
| VHAP Tracking | 10.65h | 10.65h | 10.65h | — |
| Coarse Mesh Registration | — | — | — | 0.09h |
| Avatar Optimization | 4.83h | 0.75h | 27.70h (CNN) | 0.44h (MATCH inference) |
| PCA Decomp. | — | — | 6.94h | 0.16h |
| EMOCA & DECA Inference | — | — | — | 0.05h |
| PCA Refinement | — | — | — | 2.75h |
| Expression Regressor | — | — | — | 1.14h |
| 总计 | 15.48h | 11.40h | 45.29h | 4.63h |
下游应用:编辑与表情迁移
密集语义对应使以下应用成为"免费"的副产品:
- 身份插值:两个不同身份/表情的 Gaussian 纹理之间做线性插值 $\mathcal{G}_\text{interp} = (1-\gamma)\mathcal{G}_A + \gamma\mathcal{G}_B$,产生平滑过渡
- 语义编辑:将源身份鼻部区域的 Gaussian 属性替换为目标身份的对应属性,无缝融合
- 表情迁移:计算目标身份表情帧与中性帧的 Gaussian 残差,加到源身份的中性重建上
- 免优化 Tracking:从预测的 3D 位置纹理直接提取 mesh,无需优化
野外泛化与单图推理
MATCH 虽然只在工作室捕获数据上训练,但可以泛化到野外拍摄。用 COLMAP 估计相机参数后,MATCH 能对户外相机拍摄的照片产生高质量重建。对于单图输入场景,可以先用 CAP4D 的 2D prior 生成额外视角,再输入 MATCH。#Taubner-et-al.-2025
实验配置
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | Ava-256 (11 held-out subjects, 1000 samples) + NeRSemble (6 held-out, 1000 samples) |
| 评测指标 | 已披露 | LPIPS↓, CSIM↑ (ArcFace), PSNR↑, SSIM↑, L1↓, L2↓; Geometry: P2P↓, P2S↓ (mm); Avatar: EmoL1↓ |
| Baseline 方法 | 已披露 | GPAvatar, FastAvatar, LAM, Avat3r, FaceLift, CAP4D (NVS); GA, RGBAvatar, GEM (Avatar); TEMPEH (Geometry) |
| 推理硬件 | 部分披露 | NVS 推理未明确 GPU 型号;Avatar 时间测量使用单张 NVIDIA A100 40GB, 16 CPUs, 500GB RAM |
| 推理分辨率 | 已披露 | 输入 640×512(12 张),评测裁剪至 512×512 |
| 推理环境 | 未披露 | 原文未给出框架/版本 |
Novel View Synthesis 结果
| 数据集 | 方法 | LPIPS↓ | CSIM↑ | PSNR↑ | SSIM↑ |
|---|---|---|---|---|---|
| Ava-256 | LAM | 0.273 | 0.678 | 15.898 | 0.734 |
| Avat3r | 0.274 | 0.626 | 22.722 | 0.745 | |
| FaceLift | 0.208 | 0.868 | 21.661 | 0.825 | |
| Ours | 0.163 | 0.928 | 23.680 | 0.848 | |
| NeRSemble | GPAvatar | 0.259 | 0.599 | 25.296 | 0.801 |
| FastAvatar | 0.248 | 0.725 | 18.676 | 0.797 | |
| LAM | 0.254 | 0.746 | 16.996 | 0.789 | |
| FaceLift | 0.200 | 0.866 | 21.524 | 0.853 | |
| Ours (Ava-256 only) | 0.182 | 0.892 | 23.182 | 0.861 | |
| Ours (NeRSemble only) | 0.168 | 0.927 | 24.136 | 0.870 | |
| Ours (joint) | 0.152 | 0.944 | 25.509 | 0.884 |
Avatar 质量对比
| 方法 | 重建时间 | Self-Reenactment LPIPS↓ | PSNR↑ | Cross CSIM↑ | EmoL1↓ |
|---|---|---|---|---|---|
| GaussianAvatars | 15.5h | 0.233 | 21.248 | 0.629 | 10.618 |
| RGBAvatar | 11.4h | 0.233 | 22.185 | 0.657 | 10.333 |
| GEM | 45.3h | 0.214 | 21.761 | 0.800 | 9.866 |
| Ours | 4.6h | 0.174 | 24.122 | 0.813 | 9.837 |
MATCH 在 self-reenactment 上显著优于所有 baseline(LPIPS 从 GEM 的 0.214 降至 0.174),cross-reenactment 与 GEM 持平,而重建时间仅为 GEM 的 1/10。
消融实验
| 变体 | LPIPS↓ | PSNR↑ | 关键发现 |
|---|---|---|---|
| Dense Attention(替代 registration-guided) | 0.221 | 20.364 | 最大幅度掉点,LPIPS +0.034, PSNR −2.668 |
| w/o Sapiens features | 0.202 | 22.104 | 第二大影响,泛化变差 |
| w/o Skip connections | 0.192 | 23.075 | 轻微下降 |
| Orig. TEMPEH(非 adapted 版本) | 0.190 | 22.775 | 轻微下降 |
| Ours (full) | 0.187 | 23.032 | — |
额外消融还发现:(1) MATCH 从仅 4 张输入图像就能产生合理重建(假设 TEMPEH 几何质量足够);(2) $k_{\mathcal{T},\text{img}}$ 从 100 降到 25 时性能反而略有提升(LPIPS 0.184 vs 0.187);(3) image token self-attention 可以跳过而不影响性能,推理速度提升 8%。
几何重建
MATCH 预测的 3D 位置纹理可以转换为 mesh,使其成为推理式头部 tracker。在 Ava-256 上,MATCH 的全头 P2P 距离为 6.69mm,优于 TEMPEH(7.84mm)和 adapted TEMPEH global(7.34mm)。在嘴部和眼部,MATCH 与 TEMPEH 表现相当,因为 ground truth mesh 用平面近似口腔和眼睛,而 MATCH 为了渲染质量会偏离这种粗略近似。
失败案例与局限性
论文承认的主要局限性:(1) 依赖 mesh registration 监督,完全去除仍是 future work;(2) 直接表情迁移在差异大的身份间会产生外观泄漏;(3) 几何重建可能出现自相交表面;(4) Avatar 受限于训练表情的插值空间,不追踪眼部运动。
MATCH 在技术地图上的位置
MATCH 代表了头部 Avatar 创建从优化范式到前馈范式的转变。在此之前,推理式方法(LAM、FastAvatar)虽然快,但质量不足且缺乏跨帧对应;优化式方法(GEM)质量高但太慢。MATCH 首次在前馈框架中同时实现了高质量重建和密集语义对应,弥合了这两条路线。
Registration-Guided Attention 的启发
MATCH 的 registration-guided attention 对更广泛的 3D 重建领域有方法论启发:当你有一个粗略的几何先验时,不要忽视它。Dense attention 不是万能的——通过将 attention 限制在语义相关区域,可以同时获得更好的效率和质量。这一思路可以推广到其他有几何先验的重建任务,如人体重建、物体重建等。
工程实践启发
1. 跨数据集训练时关闭缺失监督:MATCH 对没有 geometry annotation 的 NeRSemble 样本关闭 $\mathcal{L}_\text{geometry}$,这种"选择性损失"策略可以推广到任何多数据集训练场景。
2. LPIPS warmup:感知损失在训练早期可能导致不稳定,延迟引入(150k 步后从 0 线性增加到 1.0)是一个实用的训练 trick。
3. 联合 PCA 优于分模态 PCA:当不同属性间存在关联(如表情皱纹的颜色变化),联合建模能捕捉这些关联。
开放问题
- MATCH 仍然依赖 Ava-256 的 mesh registrations 作为训练监督。能否在完全无 geometry supervision 的情况下训练(例如仅用合成数据训练 geometry 部分)?
- Avatar 的表情空间受限于训练数据中的表情,无法泛化到未见表情。MATCH 的跨身份/跨表情对应能否用于学习跨身份和表情的 prior,以提升泛化?
- 表情迁移目前使用简单的算术残差方法,对极端表情和差异大的身份会产生不自然结果。学习式方法(如 conditional VAE)可能是更好的选择。
代码与可复现性
MATCH 的推理代码和模型权重已在 GitHub 开源(MIT 协议)。#Prinzler-et-al.-2026 训练代码标注为"Coming soon"。论文提供了完整的超参数表、三阶段训练 loss weights 表和详细的消融实验,可复现性较好。主要障碍是训练需要 4× H100 80GB 运行 11.8 天,以及 Ava-256 数据集的获取(该数据集需要申请)。
参考来源
- Prinzler, M. et al. (2026). "Feed-forward Gaussian Registration for Head Avatar Creation and Editing." CVPR 2026. arXiv:2603.15811 · 项目页 · GitHub
- Zielonka, W. et al. (2025). "Gaussian Eigen Models for Human Heads." CVPR 2025. arXiv:2407.04545
- Bolkart, T. et al. (2023). "Instant Multi-View Head Capture through Learnable Registration." CVPR 2023. arXiv:2306.07437
- Kirschstein, T. et al. (2025). "Avat3r: Large Animatable Gaussian Reconstruction Model for Three-dimensional Heads." arXiv:2504.07156
- Lyu, T. et al. (2025). "FaceLift: Single-View 3D Head Reconstruction via Physics-aware Lifting." ICCV 2025. arXiv:2501.05405
- Kerbl, B. et al. (2023). "3D Gaussian Splatting for Real-Time Radiance Field Rendering." ACM TOG. arXiv:2308.14737
- Huang, B. et al. (2024). "2D Gaussian Splatting for Geometrically Accurate Radiance Fields." SIGGRAPH 2024. arXiv:2403.17888
- Khirodkar, R. et al. (2024). "Sapiens: Foundation for Human Vision Models." arXiv:2408.12569
- Zhang, K. et al. (2024). "GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting." CVPR 2024. arXiv:2308.14853
- Tang, J. et al. (2024). "LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation." ICLR 2024. arXiv:2312.07717
- Taubner, T. et al. (2025). "CAP4D: Consistent Avatar Generation with Panoptic 4D Diffusion." arXiv:2505.16378
- He, Z. et al. (2025). "LAM: Large Avatar Model for One-shot Animatable Gaussian Head." arXiv:2504.05515 · 精读 →
- Wu, Y. et al. (2025). "FastAvatar: Towards Unified Fast High-Fidelity 3D Avatar Reconstruction." arXiv:2508.19754