莫刻机器人LJM登榜WorldArena第二!阿里云PAI提供全流程训练支撑

发布时间:2026/7/29 18:30:46
莫刻机器人LJM登榜WorldArena第二!阿里云PAI提供全流程训练支撑 当具身世界模型从「生成逼真视频」迈向「理解动作后果」强大的算力底座正是这场技术跃迁的隐形引擎近日具身世界模型权威评测 WorldArena 更新最新榜单由莫刻机器人Muka Robotics打造的具身世界模型 LJMLatent Joint-conditional Model以匿名代号 SisyphusWorld 提交EWMScore_P分数为73.06 位列公开榜单第二仅次于小米 UNIS73.64领先 BWM-Fast、SACWM、DexWorldEngine 等前列模型。这一成果的背后阿里云人工智能平台 PAI 提供高性能真武810E算力与全流程训练支撑助力莫刻机器人以仅 32 卡规模实现有竞争力的性能验证了云上高性能算力在世界模型训练场景的工程可靠性。榜单地址https://huggingface.co/spaces/WorldArena/WorldArenaLJM 登榜从「会生成视频」到「先理解动作再生成未来」当前主流动作条件世界模型常通过线性投影、FiLM/AdaLN、cross-attention 等接口把低维动作直接送入扩散骨干。这些方式可以提高可控性却仍把动作视为外部数值信号模型必须独自从视频损失中反推当前这串数字究竟意味着移动、接触、抓取还是放置。LJM 的核心突破在于不把机器人动作只当作一串附加到扩散模型中的低维数值而是先将语言、视觉历史与未来动作转换为可推理的交互 latent再用它约束后续视频生成。具体而言LJM 将视觉语言模型与视频扩散模型组织为两个协同工作的专家Latent Reasoning Expert推理专家使用 Qwen3-VL-2B 编码语言、历史视觉、当前锚点观察与未来动作输出一组连续 reasoning tokens。这里的「推理」并非生成自然语言思维链而是在连续潜空间中预测机器人将到达什么状态、场景会怎样变化、动作会引发怎样的运动。World Modeling Expert生成专家使用 Wan2.2-TI2V-5B Diffusion Transformer 作为视频世界模型在 VAE latent 空间中执行 flow matching将推理专家给出的交互约束还原为连续未来视频。两个专家通过 Mixture-of-TransformersMoT的 shared attention 逐层交换信息让「理解动作会造成什么」与「把未来渲染成视频」成为同一个联合建模过程。此外LJM 还引入 Value-Driven Temporal ConditioningVTC在固定预算内主动保留信息密度更高的历史状态有效解决了长时记忆漂移问题。WorldArena 公开榜单第二名截至 2026 年 7 月 16 日SisyphusWorldLJM以 73.06 EWMScore_P 位列第二仅与第一名 UNISXiaomi-Robotics-U073.64相差0.58 分。分项结果中LJM 在 3D Accuracy三维准确性取得 92.60 的高分在 Motion Quality运动质量取得 89.17在 Controllability可控性取得 85.93展现出强大的空间认知与动作控制能力。WorldArena 维度分数Visual Quality60.18Motion Quality89.17Content Consistency58.11Physics Adherence58.283D Accuracy92.60Controllability85.93LIBERO 基准四项指标全部最优除 WorldArena 外莫刻机器人进一步基于知名机器人操作基准 LIBERO 评估 LJM 在复杂具身交互场景中的世界建模能力。在 100 个未参与训练的测试 episode 上LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果全面超越 IRASim、Ctrl-World、WoVR 等对比方法。相较各指标上的最强非 LJM 基线LJM 将 PSNR 从 27.25 提升至 28.60SSIM 从 0.8820 提升至 0.9238同时将 FVD 从 77.09 降至 46.49下降约 39.7%LPIPS 从 0.0639 降至 0.0247下降约 61.3%。这表明 LJM 的收益不仅体现在逐帧重建质量也体现在长时视频的感知与时序一致性。阿里云人工智能平台 PAI32 张真武810E背后的算力底座具身世界模型的训练复杂度远超传统视频生成任务。LJM 需要同时处理语言、视觉、动作三模态的联合建模在 DROID 与 RoboTwin 两个数据集上分阶段训练每个样本由 8 帧历史上下文、1 帧当前锚点和 56 帧未来共 65 帧组成。这对底层计算平台的算力规模、分布式训练稳定性和多专家联合优化能力都提出了很高要求。在 LJM 的研发过程中阿里云人工智能平台 PAI 为莫刻机器人团队提供了全方位的计算服务保障真武810E 算力支撑全流程训练。LJM 的 DROID 预训练与 RoboTwin 继续训练均在 32 张真武810E 上完成全局批大小为 32使用 AdamW 优化器、BF16 混合精度与 ZeRO-3 并行策略。以 32 卡规模取得 73.06 EWMScore_P说明 LJM 并非单纯依赖扩大训练集群换取分数而是通过 latent joint conditioning 与分阶段训练提高了单位计算预算的有效产出也验证了真武810E在大规模具身世界模型训练场景中的工程可靠性。高效的分布式训练与通信优化。PAI 平台原生支持大规模异构算力集群的高效调度与通信优化能够在多节点间实现稳定的梯度同步与数据并行。对于 LJM 这类涉及双专家联合建模、MoT shared attention 逐层交互、大规模视频数据吞吐的复杂架构PAI 提供了坚实的训练底座显著缩短了从实验构想到结果验证的迭代周期。灵活的资源弹性与实验管理。从大规模多模态数据的预处理到 DROID 与 RoboTwin 两阶段训练的无缝衔接再到训练过程中的监控与断点恢复PAI 提供了贯穿模型研发全流程的工具链支持。这让莫刻机器人团队能够将更多精力聚焦于算法创新本身如何让世界模型在生成未来之前先「理解」动作而非基础设施的搭建与运维。面向 Physical AI 场景的深度适配。阿里云 PAI 与 NVIDIA Physical AI 软件栈全面集成提供覆盖数据采集、数据预处理、数据扩增/虚拟数据合成、模型训练、模仿学习/强化学习、仿真测试、闭环验证等全链路平台能力。PAI 在异构计算资源管理、大规模数据流水线编排、多任务训练调度等方面的长期积累为莫刻机器人这类世界模型创新企业提供了有力的工程支撑。从实验室到产业国产世界模型的加速时刻莫刻机器人Muka Robotics致力于打造面向真实物理世界的下一代通用机器人智能体系以视觉基础泛化模型为核心推动机器人突破封闭演示场景、走向开放环境实现真正的具身智能落地。公司由香港科技大学博士池晓威创立。他长期深耕机器人世界模型与多模态生成智能聚焦真实物理场景下机器人的通用感知、智能决策与自主执行等核心能力相关成果发表于 CVPR、ICML、ICRA、AAAI 等国际顶级会议。LJM 的登榜是前沿算法创新与云上高性能平台深度协同的成果。在 WorldArena 榜单前列来自中国团队的身影越来越多。这一趋势表明在全球世界模型竞赛中中国力量正在核心技术层面加速突破从感知到认知不再满足于「看懂画面」而是追求对物理世界的深度理解从仿真到落地切实将模型能力转化为工业制造、仓储物流、智能服务等场景中的实际生产力。随着 2026 年成为世界模型发展元年阿里云将持续深化与世界模型创新力量的合作以 PAI 平台和真武810E算力为核心为世界模型的技术探索与产业落地提供坚实的算力与工程支撑共同推动世界模型从实验室走向真实世界——让模型知道在当前状态下执行这组动作会对未来产生什么样的影响。