通义万象开源Wan-Animate-2!角色动画比肩商业SOTA

发布时间:2026/8/11 17:58:53
通义万象开源Wan-Animate-2!角色动画比肩商业SOTA 通义万象刚刚开源了 Wan-Animate-2一个端到端的角色动画框架。不提取骨架、不压缩运动特征DiT扩散Transformer直接喂驱动视频角色就动了还能做到 24 fps 实时流式输出。而且与商业闭源方案对比效果也具备竞争力。看得见的效果Wan-Animate-2 的整体质量优于前代 Wan-Animate。相比第1代它能自动完成动作重定向按参考图的实际尺寸驱动手部形变和肢体伪影明显减少。与 Dreamina、Kling-MotionControl 等商业闭源方案对比效果也具备竞争力。具体能力上几个亮点值得展开。高保真动画。复杂肢体动作、细微面部表情、角色与场景的物理交互Wan-Animate-2 都能处理。不同宽高比、不同体型的角色输入稳定性和鲁棒性表现良好。多角色动画。支持单人驱动多人、多人驱动多人的视频合成。多机位动画。同一段角色动画可以通过显式相机位姿条件生成多角度观察。因为运动不绑定刚性空间锚点视角和参考信息之间可以解耦多视角内容保持一致。扔掉中间环节角色动画这个领域过去的方案大致分三条路。第一条显式运动表示。先从驱动视频里提取骨架、姿态关键点再拿这些中间表示去驱动目标角色。问题在于提取本身就会出错误差一路传递身份也容易漂移。第二条隐式运动特征。把运动压缩成一组隐向量省去了显式骨架但压缩过程会丢掉细粒度的动态信息手指的微妙弯曲、嘴角的轻微抽动可能就没了。第三条上下文学习。把参考信息直接塞进生成模型的上下文窗口绕开中间表示但计算开销大得离谱。更关键的是以上方案全部面向离线合成做不了实时交互。Wan-Animate-2 直接把中间环节全部去掉。它采用双分支 DiT 架构一支处理参考图像提供外观一支处理参考视频提供运动。没有姿态提取网络没有骨架检测驱动视频原封不动地进入模型。运动先验直接从视频帧里学身份保真度自然就上来了。为了让静态外观和动态运动两路信息更好地融合团队设计了两个模块Time-Align RoPE负责在时间维度上对齐去噪视频 token 和参考 tokenSparse-Ref Attention让模型选择性地关注参考特征中真正有用的部分而非全部塞进去。另外Wan-Animate-2 加入了文本驱动的视角控制。你用文字描述想要的机位角度输出画面的摄像机视角就和驱动视频解耦了。过去依赖显式运动表示的方法很难做到这一点因为骨架是绑死在特定空间坐标上的。实时离线生成做得再好遇到数字人直播、虚拟主播这类场景延迟就是硬伤。Wan-Animate-2-Lite 就是为这个问题准备的。它把推理延迟压到了实时阈值支持 24 fps 的流式角色动画直接从摄像头画面驱动动作和表情同步延迟极低。为降低多步扩散的推理成本Lite 版本采用因果 DiT 做分块自回归生成每块 8 帧。团队用 teacher forcing 预训练搭配 error buffer 机制让模型先学会基本的生成能力。然后 Self-Forcing 蒸馏配合 chunk-wise backpropagation分块反向传播把推理速度提上来。最终在 4 卡 H100 上以流水线并行部署时400 × 720 分辨率、3 步去噪可达到 24 fps超过实时阈值。开源Wan-Animate-2 的模型权重已面向公众开源。而且英特尔已完成 Wan-Animate-2 在锐炫 Pro B70 显卡上的端到端适配与模型开源同步提供 Day 0 支持。用英特尔显卡的开发者不用再等社区慢慢移植了。Wan-Animate-2 提出端到端方案解决中间表示带来的误差累积和身份漂移引入视角解耦能力并通过训练策略把推理速度拉到了实时。三方面的能力提升为角色动画创作打开了新的大门。过去受限于延迟和部署成本的数字人直播、虚拟主播、互动娱乐这些场景现在多了一个开源选项。参考资料https://humanaigc.github.io/wan-animate-2/https://github.com/Wan-Video/Wan-Animate-2https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14Bhttps://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B