MotionShop-2:视频角色替换
在前面几篇精读中,我们分析了阿里通义 aigc3d 团队的学术工作:AniGS 从单图生成可动画 3D 高斯 Avatar(CVPR 2025)#Qiu et al., 2024,LHM 用前馈 Transformer 秒级重建可动画 3D 人体(ICCV 2025)#Qiu et al., 2025。这些研究解决了"如何从一张照片得到 3D 数字人"的问题,但距离用户可用的产品还有一个关键环节:如何把 3D 数字人放进真实视频中。
MotionShop-2 就是这个环节的答案。它是阿里通义 aigc3d 团队的视频角色替换工程系统,于 2024 年 10 月发布,已集成到通义 App 和 ModelScope 平台。#aigc3d Team, 2024给定一段视频和任意 3D Avatar 模型,MotionShop-2 能将视频中的人物替换为 3D 虚拟角色,保持原始运动轨迹和背景不变。整个过程在分钟级完成。
与 AniGS/LHM 不同,MotionShop-2 不是一篇学术论文,而是一个完整的工程管线。它不解决单一的算法问题,而是将检测、分割、修复、姿态估计、动画重定向、渲染和合成等多个环节组装成一个端到端系统。这正是"工程解读"系列的价值所在——理解学术成果如何被组装成可用的产品。
视频角色替换看似简单——把人抠掉、换成 3D 模型——但每个环节都有工程级的难度:
| 挑战 | 具体问题 | 为什么难 |
|---|---|---|
| 角色检测 | 从视频中找到要替换的人物 | 多人场景、遮挡、小目标 |
| 背景修复 | 人物移除后的空洞区域填充 | 需要时序一致的背景重建 |
| 姿态估计 | 从 2D 视频恢复 3D 人体运动 | 单目模糊、手脚遮挡、时序抖动 |
| 动画重定向 | 将人体运动映射到不同体型/物种的 Avatar | 骨骼比例差异、拓扑不匹配 |
| 光照一致 | 让 3D Avatar 的光照匹配真实场景 | 环境光、阴影、反射的复杂交互 |
| 渲染合成 | 将 3D Avatar 自然地融入视频帧 | 运动模糊、抗锯齿、时序去噪 |
MotionShop-2 的架构可以概括为"双并行管线 + 合成输出"。我们从输入到输出逐层拆解。原始 MotionShop 的架构(图 2)奠定了双管线设计的基础,MotionShop-2 在此基础上升级了三个核心模块。
管线 1:视频处理(背景提取)
这条管线的目标是:从原始视频中移除人物,生成干净的背景视频序列。
Step 1:角色检测。 输入视频帧序列,使用 open-set 物体检测器结合 Transformer 框架,将文本信息与闭集检测器融合。然后通过 Dominant Selection 方法确定最终目标区域。这一步的挑战在于多人场景中准确锁定要替换的角色。 Step 2:分割与跟踪。 检测到目标后,使用 SAM(Segment Anything Model)#Kirillov et al., 2023初始化零样本分割,再通过视频对象分割跟踪方法维持时序一致性。相比直接使用 SAM 逐帧分割,这种方法利用了时序对应关系,能更好地处理快速运动和遮挡。 Step 3:视频修复。 移除人物后的空洞区域由 ProPainter(ICCV 2023)#Zhou et al., 2023填充。ProPainter 的三大核心组件是:循环流补全(Recurrent Flow Completion)修复被破坏的光流场,速度约 192 fps;双域传播(Dual-domain Propagation)在图像域和特征域同时做传播,兼顾全局时序一致性和局部细节;掩码引导稀疏 Transformer 只处理 token 子集,提升效率。MotionShop-2 在此基础上做了工程优化,提速 20% 且质量不降#aigc3d Team, 2024。管线 2:姿态估计与渲染
这条管线的目标是:从视频中提取人体运动,映射到 3D Avatar 上,渲染成动画序列。
Step 1:姿态估计。 从角色视频序列中估计人体姿态。原始 MotionShop 使用 CVFFS(Cross-View Fusion and Foot Stabilization, CVPR 2023)#Zhuo et al., 2023方法,输出 SMPL 参数(24 个身体关节)。MotionShop-2 升级为 SMPL-X(约 55 个关节,含手部和面部),并在此基础上 fine-tune 了估计器。 Step 2:动画重定向。 将估计的 shape 和 pose 参数重映射到选定的 3D Avatar 模型。即使原始角色与新模型有显著体型差异(如真人→卡通角色、人形→动物),也能获得自然的动画效果。 Step 3:光照估计。 估计原始场景的光照条件,使 3D Avatar 的光照与环境一致。MotionShop-2 新增了 relighting 功能,在 Gaussian-splatting 光栅化中实现动态重光照。 Step 4:渲染。 原始 MotionShop 使用 TIDE 路径追踪渲染器(支持精确材质系统、运动模糊、时序抗锯齿和时序去噪)。MotionShop-2 将其升级为 UniTIDE,新增 3D 高斯泼溅渲染和混合渲染能力。 Step 5:合成。 将渲染的 Avatar 图像与管线 1 生成的干净背景合成,输出最终视频。graph LR
subgraph P1["管线 1:视频处理"]
A["视频帧"] --> B["角色检测"]
B --> C["SAM 分割+跟踪"]
C --> D["ProPainter 修复"]
D --> E["干净背景"]
end
subgraph P2["管线 2:姿态渲染"]
F["视频帧"] --> G["SMPL-X 姿态估计"]
G --> H["动画重定向"]
H --> I["光照估计"]
I --> J["UniTIDE 渲染"]
J --> K["角色序列"]
end
E --> L["合成输出"]
K --> L
L --> M["最终视频"]
并行化设计的关键
两条管线完全独立:管线 1 不需要等待姿态估计完成,管线 2 也不需要等待背景修复完成。它们各自处理相同的输入视频帧,最终在合成阶段汇合。这种设计将总处理时间从 $T_1 + T_2$ 压缩到 $\max(T_1, T_2)$,是 MotionShop 实现分钟级处理的核心优化。
升级 1:Video Inpainting 提速 20%
原始 MotionShop 使用 ProPainter 做视频修复。ProPainter 的核心流程是:先用循环网络补全被 mask 区域的光流场,再在图像域和特征域双重传播修复结果,最后用稀疏 Transformer 细化细节。MotionShop-2 在此基础上做了工程层面的优化(非算法替换),使生成速度提升 20%,且修复质量未降级。 值得注意的是,MotionShop-2 并没有更换修复算法——仍然在 ProPainter 框架内。这说明 ProPainter 的算法本身已经足够好,瓶颈在于工程实现效率。这种"不换算法换实现"的优化策略在工程系统中非常常见,也是学术成果产品化时的典型路径。升级 2:SMPL → SMPL-X + 手工校正 + 时序正则化
这是 MotionShop-2 最实质性的算法升级。原始 MotionShop 使用 SMPL(24 个身体关节)做姿态估计,无法捕捉手指和面部表情。MotionShop-2 升级为 SMPL-X(约 55 个关节,每只手 15 个关节 + 面部 blendshape)#Pavlakos et al., 2019,但 SMPL-X 的参数空间更大,估计难度也更高。 为解决精度问题,MotionShop-2 团队采用了数据驱动的工程方法: 1. 收集大规模人类视频序列数据集 2. 用 off-the-shelf 估计器预测 SMPL-X 参数 3. 人工校正错误预测(特别是脚部和手部) 4. 在校正后的数据集上 fine-tune 估计器 这种"先标注再微调"的方法在工业界很常见,但在学术论文中较少提及——因为手工校正的规模和质量难以标准化描述。MotionShop-2 敢于公开这个流程,说明他们对数据质量的重视超过了对"全自动"叙事的追求。| 维度 | SMPL | SMPL-X |
|---|---|---|
| 关节数 | 24(身体) | ~55(身体+手部+面部) |
| 参数维度 | $\theta \in \mathbb{R}^{24 \times 3}$, $\beta \in \mathbb{R}^{10}$ | $\theta \in \mathbb{R}^{55 \times 3}$, $\beta \in \mathbb{R}^{10}$, $\psi$(表情) |
| 手部 | 无 | 每只手 15 关节 |
| 面部 | 无 | 3D 面部 blendshape |
| 估计难度 | 中等 | 高(参数空间大,遮挡多) |
其中 $\theta \in \mathbb{R}^{55 \times 3}$ 是姿态参数(身体 24 + 手部 30 + 面部 1),$\beta \in \mathbb{R}^{10}$ 是体型参数,$\psi$ 是面部表情 blendshape 参数,$W(\cdot)$ 是线性混合蒙皮函数。MotionShop-2 选择 SMPL-X 是为了在动画重定向时保留更精细的手部和面部运动。
此外,MotionShop-2 还加入了时序正则化项,增强 SMPL-X 参数序列的平滑度。这解决了单帧估计的时序抖动问题——即使每帧估计都正确,帧间的小幅波动也会导致动画不自然。时序正则化通过约束相邻帧的参数变化幅度,使输出运动更加流畅。
升级 3:TIDE → UniTIDE 混合渲染
原始 TIDE 是一个纯路径追踪渲染器,只支持三角网格。MotionShop-2 将其升级为 UniTIDE(Unified TIDE),新增了三项关键能力:
1. 3D 高斯泼溅渲染。 UniTIDE 现在可以直接渲染 3DGS 模型(来自 AniGS 或 LHM 生成的 Avatar),而不需要先转换为三角网格。这避免了"3DGS→mesh"转换过程中的几何损失,特别是面部细节和衣物褶皱。 2. 混合渲染。 这是 MotionShop-2 的全新特性——同时渲染 3DGS 模型和传统三角网格。应用场景是:3DGS 角色与手工设计的网格道具/场景同时出现时,不需要分两次渲染再合成,而是在一个统一的渲染管线中完成。这简化了制作流程,也避免了合成时的光照不一致。 3. 重光照(Relighting)。 在 Gaussian-splatting 光栅化中加入了 relighting 功能,使 3DGS Avatar 的光照能动态匹配视频场景。这比原始 MotionShop 的静态光照估计更灵活,特别是在角色运动穿过不同光照区域时。| 特性 | TIDE(原始) | UniTIDE(MotionShop-2) |
|---|---|---|
| 渲染类型 | 路径追踪(mesh only) | 路径追踪 + 3DGS 光栅化 |
| 混合渲染 | 不支持 | mesh + 3DGS 同时渲染 |
| 重光照 | 仅静态光照估计 | Gaussian-splatting 中 relighting |
| 运动模糊 | 支持 | 支持 |
| 时序抗锯齿 | 支持 | 支持 |
| 时序去噪 | 支持 | 支持 |
Hybrid Rendering:mesh 与 3DGS 的共融
传统渲染管线只能处理一种表示——要么是三角网格(路径追踪),要么是 3D 高斯(光栅化)。如果场景中同时需要 mesh 和 3DGS,通常的做法是分别渲染再合成,但这会导致光照不一致和边缘伪影。
MotionShop-2 的 Hybrid Rendering 在单一渲染管线中同时处理两种表示。从架构图可以看到,UniTIDE Rendering 模块同时接收 GS(3D 高斯 Avatar)和 Mesh(传统三角网格)作为输入,统一处理光照、阴影和合成。这种设计的关键技术挑战是:
- 深度排序:3DGS 的 splatting 和 mesh 的光栅化需要统一的深度缓冲
- 光照一致性:mesh 表面的 BRDF 和 3DGS 的球谐函数需要在同一光照模型下求解
- 材质融合:mesh 的精确材质(金属、玻璃)和 3DGS 的近似材质需要视觉一致
AvatarShop + GA² + AniGS:Avatar 来源的三层结构
从架构图分析,MotionShop-2 的 Avatar 来源形成了一个三层结构:
| 层级 | 组件 | Avatar 来源 | 特点 |
|---|---|---|---|
| 第 1 层 | AvatarShop | 预制 3D 模型库 | 60+ 角色,统一 T-pose,即选即用 |
| 第 2 层 | GA² | 生成式 Avatar 组件 | 从输入资产生成新 Avatar |
| 第 3 层 | AniGS 集成 | 单张照片→3DGS Avatar | 用户上传照片即可生成自定义 Avatar |
AniGS 的集成是 MotionShop-2 最具用户价值的更新。在原始 MotionShop 中,用户只能从预制模型库中选择 Avatar;而在 MotionShop-2 中,用户可以上传自己的照片,通过 AniGS 生成个性化的 3D 高斯 Avatar,然后直接替换到视频中。这实现了"3D Animation Engine for Your Photos"的产品愿景。
推理流程
MotionShop-2 的完整推理流程:
Phase A(并行):背景处理管线(检测→分割→修复)和姿态渲染管线(SMPL-X 估计→重定向→光照→渲染)同时执行。 Phase B(合成):将渲染的角色序列与干净背景合成,输出最终视频。 Phase C(可选):如果用户选择"3D Animation Engine"功能,先用 AniGS 从照片生成 3DGS Avatar(约 15 分钟),再进入 Phase A 的渲染管线。整个系统的处理时间在分钟级,主要瓶颈在于视频修复(ProPainter)和渲染(UniTIDE 路径追踪)。AniGS Avatar 生成是离线预处理步骤,不进入实时管线。
各模块技术栈
| 模块 | 原始 MotionShop | MotionShop-2 | 技术来源 |
|---|---|---|---|
| 角色检测 | Open-set + Transformer | 同 | 自研 |
| 分割跟踪 | SAM + VOS | 同 | ICCV 2023 |
| 视频修复 | ProPainter | ProPainter(优化) | ICCV 2023 |
| 姿态估计 | CVFFS + SMPL | Fine-tuned SMPL-X | CVPR 2023 / CVPR 2019 |
| 动画重定向 | Shape/Pose 映射 | 同 | 自研 |
| 光照估计 | 场景匹配 | + Relighting | 自研 |
| 渲染器 | TIDE(mesh) | UniTIDE(mesh+3DGS) | 自研 |
| Avatar 来源 | AvatarShop 预制 | + AniGS 单图生成 | CVPR 2025 |
| 新特性 | — | Hybrid Rendering | 自研 |
工程配置披露
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 推理硬件 | 未披露 | 项目页未明确给出推理 GPU 型号;已部署在通义 App 和 ModelScope 云端 |
| 处理时间 | 部分披露 | 分钟级(具体数值未给出);Inpainting 提速 20% |
| 输入限制 | 已披露 | 视频时长 ≤ 15 秒,人物需完整可见(来自通义 App) |
| 输出分辨率 | 未披露 | 项目页未明确给出 |
| Avatar 模型数 | 已披露 | AvatarShop 含 60+ 预制角色 |
| 人体模型 | 已披露 | SMPL-X(~55 关节,含手部+面部) |
| 训练数据 | 部分披露 | 大规模人类视频序列(用于 fine-tune SMPL-X 估计器) |
| 代码开源 | 已披露 | GitHub 项目页,代码"将在 2025 年 3 月前发布" |
产品集成状态
| 平台 | 时间 | 状态 |
|---|---|---|
| ModelScope Demo | 2024-01 | 在线体验 |
| 通义 App | 2024-08 | 集成上线 |
| MotionShop-2 发布 | 2024-10 | 项目页公开 |
| GitHub 代码 | 2025-03(计划) | 项目页占位,代码待发布 |
| 阿里云 API | 已上线 | Motionshop-gen3D 图生 3D 模型 |
技术贡献定位
MotionShop-2 的核心贡献不在于发明新算法,而在于将多个学术成果组装成一个可用的产品管线。这种"集成创新"在工业界可能比单一算法突破更有价值——因为用户需要的是端到端体验,不是某个模块的 SOTA 指标。
| 维度 | AniGS / LHM | MotionShop-2 |
|---|---|---|
| 定位 | 学术研究(Avatar 生成) | 工程产品(视频替换) |
| 输入 | 单张照片 | 视频 + Avatar |
| 输出 | 3DGS Avatar 模型 | 替换后的视频 |
| 处理时间 | 2 秒~15 分钟 | 分钟级 |
| 开源 | 是(论文+代码) | 否(仅项目页) |
| 产品形态 | 研究 demo | 通义 App 功能 |
局限性
- 代码未开源:尽管项目页承诺"2025 年 3 月前发布代码",但截至本文撰写时 GitHub 仍为空仓库。这使得学术社区无法复现或基于 MotionShop-2 做进一步研究。
- 定量评估缺失:MotionShop-2 没有提供与竞品的定量对比(如 PSNR、LPIPS、用户偏好测试)。Inpainting 提速 20% 是唯一的定量数据,但没有基准参照。
- 输入限制:通义 App 限制视频 ≤ 15 秒且人物需完整可见,这对复杂场景的适用性有限。
- SMPL-X 依赖人工校正:虽然 fine-tune 后精度提升,但数据集构建依赖人工校正,难以大规模扩展。
- 非实时:分钟级处理无法用于直播等实时场景。
启发与展望
1. 学术到产品的桥梁很重要。 AniGS 和 LHM 是出色的学术工作,但用户不能直接用它们做视频。MotionShop-2 的价值在于把"3D Avatar 生成"嵌入了一个完整的视频处理管线,让学术成果真正可用。这种"学术→工程→产品"的链条值得更多研究者关注。 2. 数据质量 > 算法创新(在工程语境下)。 MotionShop-2 的姿态估计升级不是靠新算法,而是靠手工校正数据集 + fine-tune。这说明在产品级别,数据质量往往比算法选择更关键——一个在干净数据上 fine-tune 的"旧"算法可能胜过在噪声数据上训练的"新"算法。 3. 混合渲染是 3DGS 走向生产的必经之路。 纯 3DGS 渲染在处理精确材质(金属、玻璃、透明物体)时仍有不足。MotionShop-2 的 Hybrid Rendering 在同一个管线中同时处理 mesh 和 3DGS,让两者各司其职——3DGS 负责角色,mesh 负责精确道具。这种混合策略可能成为 3DGS 产品化的标准做法。 4. 并行管线设计值得借鉴。 将视频处理和姿态渲染拆为两个独立管线并行执行,是工程系统优化的经典模式。这种设计不仅减少了总处理时间,也让两个管线可以独立迭代和扩展。参考文献
- aigc3d Team. (2024). MotionShop-2: An advanced version of the Motionshop. Project Page. GitHub.
- aigc3d Team. (2024). MotionShop: Replace the characters in video with 3D avatars. Project Page.
- Qiu, L. et al. (2024). AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction. arXiv:2412.02684. CVPR 2025. · 精读 →
- Qiu, L. et al. (2025). LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds. arXiv:2503.10625. ICCV 2025. · 精读 →
- Zhou, S. et al. (2023). ProPainter: Improving Propagation and Transformer for Video Inpainting. arXiv:2309.07216. ICCV 2023.
- Kirillov, A. et al. (2023). Segment Anything (SAM). arXiv:2304.02643. ICCV 2023.
- Zhuo, Y. et al. (2023). Towards Stable Human Pose Estimation via Cross-View Fusion and Foot Stabilization (CVFFS). CVPR 2023.
- Pavlakos, G. et al. (2019). Expressive Body Capture: 3D Hands, Face, and Body from One Image (SMPL-X). arXiv:1904.05866. CVPR 2019.