Dyna-2:世界-动作模型的百万小时规模化定律(上)

发布时间:2026/9/1 5:38:17
Dyna-2:世界-动作模型的百万小时规模化定律(上) 26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。1 引言人们对通用机器人的热情空前高涨,而扩展机器人基础模型被认为是实现这一目标最有希望的途径。然而,对于如何扩展数据和模型等最基本的问题,该领域尚未达成共识。或许,可以按以下顺序提出这些问题:机器人学习的最佳预训练数据来源是什么?扩展该数据源是否会产生机器人性能的规模化规律?为了使该规模化规律成立,需要选择哪些建模方法和目标函数?该领域已经探索了多种机器人学习的预训练数据来源,其中最值得注意的是远程操作和专用捕捉设备。两者都能产生有价值的、带有动作标签的数据,可以自行收集并进行训练。但是,这些数据的每一小时都必须人为生成,这限制了其自身能够进行的预训练的程度。从基本原理出发,答案就在于目标本身:通用机器人最终应该能够完成目前由人类完成的任何具有经济价值的任务。因此,合适的预训练数据来源应该是人类执行这些任务的传感器化记录(例如视频),这类数据已经以近乎无限的规模存在,并且包含了操作策略需要学习的所有信息:场景如何演变、物体如何响应接触以及手如何与物体交互。虽然目前从人类身上学习可能存在具身认知上的差距,但如果能够建立任何迁移规模化定律(即,人类数据的规模化定律蕴含机器人数据的规模化定律),那么未来的技术发展方向就可以相对明确:收集更多传感器化的人类数据,同时使机器人外形更接近人类。其推出 Dyna-2,全新的旗舰级世界-动作模型 (WAM) [4],它基于超过一百万小时的以自我为中心的人类视频进行预训练——相当于大约 170 年的连续清醒状态经验。Dyna-2 建立了几个新规模化定律,这些定律直接回答了上述问题。具体而言,有世界动作模型存在一个适用于一百万小时人类数据的规模化定律;首次发现存在人机迁移规模化定律,即预训练中更多的人类数据能够提升模型对从未见过的机器人数据的离线预测能力;最后,数据和目标函数对缩放定律都至关重要;视频数据的世界建模和规模化是实现跨具身规模化迁移的关键。此外,除了上述强调的离线规模化定律结果外,还发现该规模化定律趋势能够迁移到训练后的机器人上。仅需几个小时的机器人数据进行训练,且预训练期间未接触任何机器人数据,训练后的 Dyna-2 模型即可在双手动并联下颚机械臂、半人形机器人和灵巧手平台上执行任务,且其相对性能与离线机器人缩放定律相符。在一个引人注目的例子中,仅需10分钟的远程操作数据即可对Dyna-2进行微调,使其能够使用两只五指机械手完成开瓶盖的操作。除了与规模化定律相关的结果外,还展示Dyna-2的几项创新功能,包括更强的鲁棒性、更高的精度、更强的指令跟踪能力、零样本生产级性能以及一步视频生成能力。总而言之,Dyna-2相比其之前的模型有了显著的改进。同时,它也提供了一些强有力的实证证据,有助于解答该领域的一些未解之谜,并可为未来的研究提供重要的参考。2 模型架构和训练目标Dyna-2 是一个世界动作模型 [4]:它是一个单一的生成模型,可以联合或分别对未来视频和未来动作进行去噪,其构建基于视频扩散骨干网络。在架构上,它是 Transformer 的混合体 [2, 3, 28];每种输入模态(包括视频和动作)都被单独token化,并拥有一组不同的 DiT 层 [27],这些层可以通过注意力机