世界模型没有统考,HappyWorld-Bench 来了:W1-W6 六级能力,托盘到底抬没抬起来

发布时间:2026/9/24 1:16:59
世界模型没有统考,HappyWorld-Bench 来了:W1-W6 六级能力,托盘到底抬没抬起来 一个视频但不是现实先看一个场景机器人的机械夹爪伸向桌面夹住托盘向上抬起。动作流畅画面逼真你不会觉得有任何问题。但如果逐帧看托盘底部你会发现托盘根本没有离开桌面。夹爪抬起来了托盘也跟着移动了可两者之间该发生的物理结果没有发生。模型生成了一段视频却没有完成这个动作。这就是当前世界模型最真实的处境大家已经很会生成看起来像世界的东西但假的真不了。汽车撞上障碍物应该停下或者变形杯子被放进抽屉关上抽屉后不能凭空消失把一辆黑车改成红车旁边的楼不该跟着变色。现实世界里这些事不需要解释因为世界有因果世界是物理的。而在生成模型里每一件都可能出错每一件都可能是幻觉。更大的幻觉是现在人人都说自己在做世界模型。三类选手三种比赛三套规则目前宣称在做世界模型的玩家大致分三条路线视频世界模型Google DeepMind 的 Genie 3 在生成可探索的视频世界像一个导演空间重建World Labs 的 Marble 在尝试重建三维空间像一个建筑师具身智能机器人公司希望模型先在想象中推演动作后果再决定下一步怎么做像一个机器人教练。三条路线共享世界模型这一个概念但各考各的、各自排名、各自宣布领先。行业像一所没有统考的学校每个科目独立出题但能不能被真实应用录取需要的是综合成绩。今年云栖大会发布的HappyWorld-Bench就是想把这三种比赛放进同一套规则里。W1 到 W6世界模型的能力刻度HappyWorld-Bench 没有从什么技术路线才算世界模型这种定义之争入手而是换了个更工程化的问题一个模型至少要会做什么才说明它真的掌握了一部分世界规律答案拆成了三层底层能力和六级进阶表征——记住这个世界里有什么。桌上有个杯子、门后有把椅子、钥匙刚被放进抽屉。视角变了、物体被挡住了这些东西不能从模型的记忆里消失。预测——知道动作会带来什么后果。推箱子和抬箱子不一样向左转和向右转也不一样。模型不能只是让画面动起来而要让变化与动作对应。交互——事情发生之后更新状态。门已经打开后面的世界就要建立在门是开的这个事实上继续运行不能下一秒又假装什么都没发生。在此基础上能力分成六级等级考什么W1看得见语义不錯、空间不乱、短时连贯W2推得动动作发生后物体和环境给出合理反应W3记得住物体被遮挡、视角切换后状态仍在世界中长期保存W4改得了用户主动修改世界晴天变雨天、黑车变红车改动生效且不伤及无关内容W5扩得开世界可持续扩展多智能体在其中通信、协作、争夺资源W6终极题生成、仿真、交互、规划放进同一系统跨环境、跨任务、跨模态运行一句话概括看得见推得动记得住改得了扩得开最后才谈得上通用世界。值得注意的是这次公布的 1692 个评测案例主要覆盖 W1 到 W5。W6 已写进能力框架但还没有被数据充分测量——它更像试卷最后那道暂时没人能完整作答的题。看得爽说了不算判据怎么写给语言模型判卷很多时候还有标准答案。给世界模型判卷麻烦得多一段视频是否好看人很容易判断但它是否遵守物理规律、保存了历史状态、正确响应了操作看得爽说了不算。所以 HappyWorld-Bench 的关键设计在判据上。每个测试案例都要经过构造输入、匹配能力等级、人工复核和编写判据几步而判据不能只写机器人成功抬起托盘必须继续说明画面的哪个区域、哪个时间点应该出现什么结果。托盘离开桌面后底部应该出现间隙——这才是判据。再比如把黑车改成红车评测不只看车身颜色还要检查道路、背景建筑和其他车辆有没有被误改。模型如果完成了命令却顺手重建了半条街不能算成功。整套 Benchmark 设置了 29 个评测维度覆盖感知、状态保持、因果推演、可控交互和反事实等能力。同时它刻意没有把所有结果塞进一个总分一部分评测来自 HappyWorld-Arena 的匿名两两比较和 Elo 排名回答人更喜欢哪个另一部分是针对具体能力的自动化指标回答模型究竟在哪一步出了错。总体偏好与能力分数被分开呈现因为好看和可靠确实不是一回事。有些世界第一眼很惊艳住进去处处穿帮有些世界没那么华丽但门能打开、路可以走、刚放下的东西不会消失。后者也许更有用。榜单出来了没有全能冠军三条赛道的结果也印证了偏科这件事视频赛道HappyOyster 2.0 preview 整体领先Genie 3 紧随其后但在运动约束、镜像对应和开放交互等项目上表现突出重建赛道GPT-6-Astra 擅长编辑和扩展改色、变天且尽量不碰无关区域Marble 的基础场景构建更稳定桌面支撑、物体接触细节更好HYWorld-2.0 在物理连通性上领先导航网格覆盖率达 82.7%Marble 为 53.6%具身赛道MiniMax-H3 领先但它在 W4 成对反事实任务上的得分也只有 88.62。成对反事实值得单独说一下给模型相同的起点只改变一个动作——一次向上抬一次向左推模型需要生成两个不同的结果且差异必须准确来自那个被改变的动作。这比让物体动起来难得多因为模型不能靠生成一段合理运动蒙混过关它得知道为什么动以及换一种动法之后会怎样。选型启示也很直接只想搭一个可以看的空间Marble 可能更稳智能体需要在里面走动导航网格是否连通更重要需要频繁修改世界又是另一个选择。没有最强只有特质。绕不开的问题出题人也是考生和 HappyWorld-Bench 一起发布的还有 HappyOyster 2.0 preview。传统视频生成像点外卖写下 Prompt、提交、等待、拿到成片不好吃就重新点一次。HappyOyster 想把它改成现场做菜生成已经开始用户仍可以继续输入指令——人物换动作、物体被移动、场景被改变世界不在第一次生成后结束而是顺着新的操作继续发展。这要求模型记住前面发生过什么刚移动的物体不能自动归位已经打开的门不能莫名关上人物、动作、声音和场景不能各演各的。它需要维持一个不断更新的世界状态而不是连续生成几段彼此相似的视频。很期待但有两个稍等等一是HappyOyster 2.0 preview 目前没有面向 C 端开放外部用户无法独立上手现阶段能讨论的只有官方展示案例和 Benchmark 结果。二是利益相关问题阿里及合作团队参与发起 HappyWorld-Bench而阿里的 HappyOyster 又是参赛模型并拿到了视频赛道第一。出题人也是考生。这种情况下开放和复现变得尤为重要——数据构造、判据制定、其他模型的对照结果都需要放在阳光下。好消息是目前项目已公开代码仓库和技术报告HappyWorld-Arena 也已开放在线评估。Benchmark 能统一试卷吗HappyWorld-Bench 最有价值的地方是把原本各说各话的三类模型放进了一套能力坐标。但一套 Benchmark 要真正成为行业标准还需要被不同团队使用、质疑、复现、修改——发布只是第一步。还有一些更难的问题仍在试卷之外世界模型应该预测未来的画面还是预测画面背后的潜在状态模型把未来猜对了机器人就一定能更好地完成任务吗加入世界模型后任务成功率提高多少算力成本又增加多少自动驾驶里的安全、意外情况和失败恢复该怎样测所以更准确的定位是HappyWorld-Bench 没有定义世界模型行业标准它提供的是一种共同探讨世界模型的方法——不要只放 Demo也不要只报总分把状态、动作、后果一项项拆出来看。最后留一个问题机器人抬起托盘时托盘究竟有没有离开桌面参考链接代码仓库https://github.com/LivingFutureLab/HappyWorldBench在线评测https://skyeval.com/sla/arena/happyworld技术报告https://arxiv.org/abs/2609.24308