ESC
输入关键词搜索文章
目录

MotionShop-2:视频角色替换

阿里通义 · aigc3d 团队
工程解读(十)· 双并行管线 · SMPL-X 姿态升级 · UniTIDE 混合渲染 · AniGS 集成
3+1模块升级
20%Inpainting 提速
~55SMPL-X 关节
3DGS混合渲染
Part 1
引言:从论文到产品的视频角色替换

在前面几篇精读中,我们分析了阿里通义 aigc3d 团队的学术工作:AniGS 从单图生成可动画 3D 高斯 Avatar(CVPR 2025)#Qiu et al., 2024LHM 用前馈 Transformer 秒级重建可动画 3D 人体(ICCV 2025)#Qiu et al., 2025。这些研究解决了"如何从一张照片得到 3D 数字人"的问题,但距离用户可用的产品还有一个关键环节:如何把 3D 数字人放进真实视频中

MotionShop-2 就是这个环节的答案。它是阿里通义 aigc3d 团队的视频角色替换工程系统,于 2024 年 10 月发布,已集成到通义 App 和 ModelScope 平台。#aigc3d Team, 2024给定一段视频和任意 3D Avatar 模型,MotionShop-2 能将视频中的人物替换为 3D 虚拟角色,保持原始运动轨迹和背景不变。整个过程在分钟级完成。

与 AniGS/LHM 不同,MotionShop-2 不是一篇学术论文,而是一个完整的工程管线。它不解决单一的算法问题,而是将检测、分割、修复、姿态估计、动画重定向、渲染和合成等多个环节组装成一个端到端系统。这正是"工程解读"系列的价值所在——理解学术成果如何被组装成可用的产品

技术链定位:AniGS/LHM 负责"从照片到 3D Avatar",MotionShop-2 负责"从 3D Avatar 到视频"。MotionShop-2 的"3D Animation Engine"功能直接集成了 AniGS,实现了"上传照片→生成 Avatar→替换视频"的完整用户流程。
MotionShop-2 演示效果
图 3:MotionShop-2 实际效果演示。左侧 Player-3 为输入的 3D Avatar 模型(犬头角色),中间 Motion 为原始视频中的人物动作(武术姿势),右侧 Animation 为最终替换结果——3D Avatar 复现了原始人物的运动轨迹。来源:MotionShop-2 项目页演示视频
Part 2
问题剖析:视频角色替换的工程挑战

视频角色替换看似简单——把人抠掉、换成 3D 模型——但每个环节都有工程级的难度:

挑战具体问题为什么难
角色检测从视频中找到要替换的人物多人场景、遮挡、小目标
背景修复人物移除后的空洞区域填充需要时序一致的背景重建
姿态估计从 2D 视频恢复 3D 人体运动单目模糊、手脚遮挡、时序抖动
动画重定向将人体运动映射到不同体型/物种的 Avatar骨骼比例差异、拓扑不匹配
光照一致让 3D Avatar 的光照匹配真实场景环境光、阴影、反射的复杂交互
渲染合成将 3D Avatar 自然地融入视频帧运动模糊、抗锯齿、时序去噪
已有方案的不足:学术界有大量针对单个环节的研究(如视频修复、3D 姿态估计),但缺乏将它们组装成端到端产品的工程框架。AniGS 和 LHM 解决了 Avatar 生成问题,但它们的输出是 canonical 空间的 3D 模型,不能直接用于视频替换。MotionShop-2 的核心价值是将多个学术组件组装成一个可用的管线,并通过工程优化让每个环节都达到产品级质量。 并行化设计是 MotionShop 的第一个关键决策。它将整个流程拆为两条并行管线——背景处理和姿态渲染——同时执行,而不是串行等待。这样总处理时间从"两管线之和"压缩到"两管线之最大值",实现了分钟级响应。
Part 3
双并行管线架构:从检测到合成的完整流程
MotionShop-2 架构图
图 1:MotionShop-2 整体架构。左侧输入视频和 Avatar 资产,中间双并行管线(姿态估计+视频修复),右侧 UniTIDE 混合渲染输出最终结果。来源:MotionShop-2 项目页
原始 MotionShop 架构图
图 2:原始 MotionShop 架构。两并行管线:左侧视频处理(检测→分割→修复),右侧姿态渲染(CVFFS→SMPL→重定向→光照→TIDE→合成)。来源:MotionShop 项目页

MotionShop-2 的架构可以概括为"双并行管线 + 合成输出"。我们从输入到输出逐层拆解。原始 MotionShop 的架构(图 2)奠定了双管线设计的基础,MotionShop-2 在此基础上升级了三个核心模块。

管线 1:视频处理(背景提取)

这条管线的目标是:从原始视频中移除人物,生成干净的背景视频序列。

Step 1:角色检测。 输入视频帧序列,使用 open-set 物体检测器结合 Transformer 框架,将文本信息与闭集检测器融合。然后通过 Dominant Selection 方法确定最终目标区域。这一步的挑战在于多人场景中准确锁定要替换的角色。 Step 2:分割与跟踪。 检测到目标后,使用 SAM(Segment Anything Model)#Kirillov et al., 2023初始化零样本分割,再通过视频对象分割跟踪方法维持时序一致性。相比直接使用 SAM 逐帧分割,这种方法利用了时序对应关系,能更好地处理快速运动和遮挡。 Step 3:视频修复。 移除人物后的空洞区域由 ProPainter(ICCV 2023)#Zhou et al., 2023填充。ProPainter 的三大核心组件是:循环流补全(Recurrent Flow Completion)修复被破坏的光流场,速度约 192 fps;双域传播(Dual-domain Propagation)在图像域和特征域同时做传播,兼顾全局时序一致性和局部细节;掩码引导稀疏 Transformer 只处理 token 子集,提升效率。MotionShop-2 在此基础上做了工程优化,提速 20% 且质量不降#aigc3d Team, 2024

管线 2:姿态估计与渲染

这条管线的目标是:从视频中提取人体运动,映射到 3D Avatar 上,渲染成动画序列。

Step 1:姿态估计。 从角色视频序列中估计人体姿态。原始 MotionShop 使用 CVFFS(Cross-View Fusion and Foot Stabilization, CVPR 2023)#Zhuo et al., 2023方法,输出 SMPL 参数(24 个身体关节)。MotionShop-2 升级为 SMPL-X(约 55 个关节,含手部和面部),并在此基础上 fine-tune 了估计器。 Step 2:动画重定向。 将估计的 shape 和 pose 参数重映射到选定的 3D Avatar 模型。即使原始角色与新模型有显著体型差异(如真人→卡通角色、人形→动物),也能获得自然的动画效果。 Step 3:光照估计。 估计原始场景的光照条件,使 3D Avatar 的光照与环境一致。MotionShop-2 新增了 relighting 功能,在 Gaussian-splatting 光栅化中实现动态重光照。 Step 4:渲染。 原始 MotionShop 使用 TIDE 路径追踪渲染器(支持精确材质系统、运动模糊、时序抗锯齿和时序去噪)。MotionShop-2 将其升级为 UniTIDE,新增 3D 高斯泼溅渲染和混合渲染能力。 Step 5:合成。 将渲染的 Avatar 图像与管线 1 生成的干净背景合成,输出最终视频。
graph LR
    subgraph P1["管线 1:视频处理"]
        A["视频帧"] --> B["角色检测"]
        B --> C["SAM 分割+跟踪"]
        C --> D["ProPainter 修复"]
        D --> E["干净背景"]
    end
    subgraph P2["管线 2:姿态渲染"]
        F["视频帧"] --> G["SMPL-X 姿态估计"]
        G --> H["动画重定向"]
        H --> I["光照估计"]
        I --> J["UniTIDE 渲染"]
        J --> K["角色序列"]
    end
    E --> L["合成输出"]
    K --> L
    L --> M["最终视频"]
  

并行化设计的关键

两条管线完全独立:管线 1 不需要等待姿态估计完成,管线 2 也不需要等待背景修复完成。它们各自处理相同的输入视频帧,最终在合成阶段汇合。这种设计将总处理时间从 $T_1 + T_2$ 压缩到 $\max(T_1, T_2)$,是 MotionShop 实现分钟级处理的核心优化。

$$T_{\text{total}} = \max(T_{\text{inpaint}}, T_{\text{render}}) \quad \text{s.t.} \quad T_{\text{inpaint}} \perp T_{\text{render}}$$
其中 $T_{\text{inpaint}}$ 是视频修复管线耗时(检测+分割+ProPainter),$T_{\text{render}}$ 是姿态渲染管线耗时(SMPL-X 估计+重定向+UniTIDE 渲染)。两条管线完全独立($\perp$),因此可以并行执行。
Part 4
三大模块升级:Inpainting / SMPL-X / UniTIDE
MotionShop-2 相比原始 MotionShop 的核心改进集中在三个模块,我们逐一拆解。

升级 1:Video Inpainting 提速 20%

原始 MotionShop 使用 ProPainter 做视频修复。ProPainter 的核心流程是:先用循环网络补全被 mask 区域的光流场,再在图像域和特征域双重传播修复结果,最后用稀疏 Transformer 细化细节。MotionShop-2 在此基础上做了工程层面的优化(非算法替换),使生成速度提升 20%,且修复质量未降级。 值得注意的是,MotionShop-2 并没有更换修复算法——仍然在 ProPainter 框架内。这说明 ProPainter 的算法本身已经足够好,瓶颈在于工程实现效率。这种"不换算法换实现"的优化策略在工程系统中非常常见,也是学术成果产品化时的典型路径。

升级 2:SMPL → SMPL-X + 手工校正 + 时序正则化

这是 MotionShop-2 最实质性的算法升级。原始 MotionShop 使用 SMPL(24 个身体关节)做姿态估计,无法捕捉手指和面部表情。MotionShop-2 升级为 SMPL-X(约 55 个关节,每只手 15 个关节 + 面部 blendshape)#Pavlakos et al., 2019,但 SMPL-X 的参数空间更大,估计难度也更高。 为解决精度问题,MotionShop-2 团队采用了数据驱动的工程方法: 1. 收集大规模人类视频序列数据集 2. 用 off-the-shelf 估计器预测 SMPL-X 参数 3. 人工校正错误预测(特别是脚部和手部) 4. 在校正后的数据集上 fine-tune 估计器 这种"先标注再微调"的方法在工业界很常见,但在学术论文中较少提及——因为手工校正的规模和质量难以标准化描述。MotionShop-2 敢于公开这个流程,说明他们对数据质量的重视超过了对"全自动"叙事的追求。
维度SMPLSMPL-X
关节数24(身体)~55(身体+手部+面部)
参数维度$\theta \in \mathbb{R}^{24 \times 3}$, $\beta \in \mathbb{R}^{10}$$\theta \in \mathbb{R}^{55 \times 3}$, $\beta \in \mathbb{R}^{10}$, $\psi$(表情)
手部每只手 15 关节
面部3D 面部 blendshape
估计难度中等高(参数空间大,遮挡多)
SMPL-X 的参数空间显著大于 SMPL:
$$\mathcal{M}_{\text{SMPL-X}}(\theta, \beta, \psi) = W(T_P(\theta, \beta), \psi)$$

其中 $\theta \in \mathbb{R}^{55 \times 3}$ 是姿态参数(身体 24 + 手部 30 + 面部 1),$\beta \in \mathbb{R}^{10}$ 是体型参数,$\psi$ 是面部表情 blendshape 参数,$W(\cdot)$ 是线性混合蒙皮函数。MotionShop-2 选择 SMPL-X 是为了在动画重定向时保留更精细的手部和面部运动。

此外,MotionShop-2 还加入了时序正则化项,增强 SMPL-X 参数序列的平滑度。这解决了单帧估计的时序抖动问题——即使每帧估计都正确,帧间的小幅波动也会导致动画不自然。时序正则化通过约束相邻帧的参数变化幅度,使输出运动更加流畅。

升级 3:TIDE → UniTIDE 混合渲染

原始 TIDE 是一个纯路径追踪渲染器,只支持三角网格。MotionShop-2 将其升级为 UniTIDE(Unified TIDE),新增了三项关键能力:

1. 3D 高斯泼溅渲染。 UniTIDE 现在可以直接渲染 3DGS 模型(来自 AniGS 或 LHM 生成的 Avatar),而不需要先转换为三角网格。这避免了"3DGS→mesh"转换过程中的几何损失,特别是面部细节和衣物褶皱。 2. 混合渲染。 这是 MotionShop-2 的全新特性——同时渲染 3DGS 模型和传统三角网格。应用场景是:3DGS 角色与手工设计的网格道具/场景同时出现时,不需要分两次渲染再合成,而是在一个统一的渲染管线中完成。这简化了制作流程,也避免了合成时的光照不一致。 3. 重光照(Relighting)。 在 Gaussian-splatting 光栅化中加入了 relighting 功能,使 3DGS Avatar 的光照能动态匹配视频场景。这比原始 MotionShop 的静态光照估计更灵活,特别是在角色运动穿过不同光照区域时。
特性TIDE(原始)UniTIDE(MotionShop-2)
渲染类型路径追踪(mesh only)路径追踪 + 3DGS 光栅化
混合渲染不支持mesh + 3DGS 同时渲染
重光照仅静态光照估计Gaussian-splatting 中 relighting
运动模糊支持支持
时序抗锯齿支持支持
时序去噪支持支持
Part 5
新特性:Hybrid Rendering 与 AniGS 集成

Hybrid Rendering:mesh 与 3DGS 的共融

传统渲染管线只能处理一种表示——要么是三角网格(路径追踪),要么是 3D 高斯(光栅化)。如果场景中同时需要 mesh 和 3DGS,通常的做法是分别渲染再合成,但这会导致光照不一致和边缘伪影。

MotionShop-2 的 Hybrid Rendering 在单一渲染管线中同时处理两种表示。从架构图可以看到,UniTIDE Rendering 模块同时接收 GS(3D 高斯 Avatar)和 Mesh(传统三角网格)作为输入,统一处理光照、阴影和合成。这种设计的关键技术挑战是:

  • 深度排序:3DGS 的 splatting 和 mesh 的光栅化需要统一的深度缓冲
  • 光照一致性:mesh 表面的 BRDF 和 3DGS 的球谐函数需要在同一光照模型下求解
  • 材质融合:mesh 的精确材质(金属、玻璃)和 3DGS 的近似材质需要视觉一致

AvatarShop + GA² + AniGS:Avatar 来源的三层结构

从架构图分析,MotionShop-2 的 Avatar 来源形成了一个三层结构:

层级组件Avatar 来源特点
第 1 层AvatarShop预制 3D 模型库60+ 角色,统一 T-pose,即选即用
第 2 层GA²生成式 Avatar 组件从输入资产生成新 Avatar
第 3 层AniGS 集成单张照片→3DGS Avatar用户上传照片即可生成自定义 Avatar

AniGS 的集成是 MotionShop-2 最具用户价值的更新。在原始 MotionShop 中,用户只能从预制模型库中选择 Avatar;而在 MotionShop-2 中,用户可以上传自己的照片,通过 AniGS 生成个性化的 3D 高斯 Avatar,然后直接替换到视频中。这实现了"3D Animation Engine for Your Photos"的产品愿景。

推理流程

MotionShop-2 的完整推理流程:

Phase A(并行):背景处理管线(检测→分割→修复)和姿态渲染管线(SMPL-X 估计→重定向→光照→渲染)同时执行。 Phase B(合成):将渲染的角色序列与干净背景合成,输出最终视频。 Phase C(可选):如果用户选择"3D Animation Engine"功能,先用 AniGS 从照片生成 3DGS Avatar(约 15 分钟),再进入 Phase A 的渲染管线。

整个系统的处理时间在分钟级,主要瓶颈在于视频修复(ProPainter)和渲染(UniTIDE 路径追踪)。AniGS Avatar 生成是离线预处理步骤,不进入实时管线。

Part 6
工程配置与技术栈

各模块技术栈

模块原始 MotionShopMotionShop-2技术来源
角色检测Open-set + Transformer自研
分割跟踪SAM + VOSICCV 2023
视频修复ProPainterProPainter(优化)ICCV 2023
姿态估计CVFFS + SMPLFine-tuned SMPL-XCVPR 2023 / CVPR 2019
动画重定向Shape/Pose 映射自研
光照估计场景匹配+ Relighting自研
渲染器TIDE(mesh)UniTIDE(mesh+3DGS)自研
Avatar 来源AvatarShop 预制+ AniGS 单图生成CVPR 2025
新特性Hybrid Rendering自研

工程配置披露

配置项披露状态值 / 说明
推理硬件未披露项目页未明确给出推理 GPU 型号;已部署在通义 App 和 ModelScope 云端
处理时间部分披露分钟级(具体数值未给出);Inpainting 提速 20%
输入限制已披露视频时长 ≤ 15 秒,人物需完整可见(来自通义 App)
输出分辨率未披露项目页未明确给出
Avatar 模型数已披露AvatarShop 含 60+ 预制角色
人体模型已披露SMPL-X(~55 关节,含手部+面部)
训练数据部分披露大规模人类视频序列(用于 fine-tune SMPL-X 估计器)
代码开源已披露GitHub 项目页,代码"将在 2025 年 3 月前发布"
披露评估:作为工程项目而非论文,MotionShop-2 的技术披露主要在模块级别——说明了用了什么技术和升级了什么,但缺乏具体的超参数、训练配置和定量评估指标。Inpainting 提速 20% 是唯一的定量数据,但没有给出基准时间和绝对时间。

产品集成状态

平台时间状态
ModelScope Demo2024-01在线体验
通义 App2024-08集成上线
MotionShop-2 发布2024-10项目页公开
GitHub 代码2025-03(计划)项目页占位,代码待发布
阿里云 API已上线Motionshop-gen3D 图生 3D 模型
Part 7
讨论与启发:学术成果产品化的启示

技术贡献定位

MotionShop-2 的核心贡献不在于发明新算法,而在于将多个学术成果组装成一个可用的产品管线。这种"集成创新"在工业界可能比单一算法突破更有价值——因为用户需要的是端到端体验,不是某个模块的 SOTA 指标。

维度AniGS / LHMMotionShop-2
定位学术研究(Avatar 生成)工程产品(视频替换)
输入单张照片视频 + Avatar
输出3DGS Avatar 模型替换后的视频
处理时间2 秒~15 分钟分钟级
开源是(论文+代码)否(仅项目页)
产品形态研究 demo通义 App 功能

局限性

  • 代码未开源:尽管项目页承诺"2025 年 3 月前发布代码",但截至本文撰写时 GitHub 仍为空仓库。这使得学术社区无法复现或基于 MotionShop-2 做进一步研究。
  • 定量评估缺失:MotionShop-2 没有提供与竞品的定量对比(如 PSNR、LPIPS、用户偏好测试)。Inpainting 提速 20% 是唯一的定量数据,但没有基准参照。
  • 输入限制:通义 App 限制视频 ≤ 15 秒且人物需完整可见,这对复杂场景的适用性有限。
  • SMPL-X 依赖人工校正:虽然 fine-tune 后精度提升,但数据集构建依赖人工校正,难以大规模扩展。
  • 非实时:分钟级处理无法用于直播等实时场景。

启发与展望

1. 学术到产品的桥梁很重要。 AniGS 和 LHM 是出色的学术工作,但用户不能直接用它们做视频。MotionShop-2 的价值在于把"3D Avatar 生成"嵌入了一个完整的视频处理管线,让学术成果真正可用。这种"学术→工程→产品"的链条值得更多研究者关注。 2. 数据质量 > 算法创新(在工程语境下)。 MotionShop-2 的姿态估计升级不是靠新算法,而是靠手工校正数据集 + fine-tune。这说明在产品级别,数据质量往往比算法选择更关键——一个在干净数据上 fine-tune 的"旧"算法可能胜过在噪声数据上训练的"新"算法。 3. 混合渲染是 3DGS 走向生产的必经之路。 纯 3DGS 渲染在处理精确材质(金属、玻璃、透明物体)时仍有不足。MotionShop-2 的 Hybrid Rendering 在同一个管线中同时处理 mesh 和 3DGS,让两者各司其职——3DGS 负责角色,mesh 负责精确道具。这种混合策略可能成为 3DGS 产品化的标准做法。 4. 并行管线设计值得借鉴。 将视频处理和姿态渲染拆为两个独立管线并行执行,是工程系统优化的经典模式。这种设计不仅减少了总处理时间,也让两个管线可以独立迭代和扩展。

参考文献

  1. aigc3d Team. (2024). MotionShop-2: An advanced version of the Motionshop. Project Page. GitHub.
  2. aigc3d Team. (2024). MotionShop: Replace the characters in video with 3D avatars. Project Page.
  3. Qiu, L. et al. (2024). AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction. arXiv:2412.02684. CVPR 2025. · 精读 →
  4. Qiu, L. et al. (2025). LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds. arXiv:2503.10625. ICCV 2025. · 精读 →
  5. Zhou, S. et al. (2023). ProPainter: Improving Propagation and Transformer for Video Inpainting. arXiv:2309.07216. ICCV 2023.
  6. Kirillov, A. et al. (2023). Segment Anything (SAM). arXiv:2304.02643. ICCV 2023.
  7. Zhuo, Y. et al. (2023). Towards Stable Human Pose Estimation via Cross-View Fusion and Foot Stabilization (CVFFS). CVPR 2023.
  8. Pavlakos, G. et al. (2019). Expressive Body Capture: 3D Hands, Face, and Body from One Image (SMPL-X). arXiv:1904.05866. CVPR 2019.