香港浸会大学研究团队教会AI“读懂“物理世界

发布时间:2026/8/6 23:58:46
香港浸会大学研究团队教会AI“读懂“物理世界 这项由香港浸会大学主导的研究以预印本形式发布于2026年7月28日论文编号为arXiv:2607.25236有兴趣深入钻研的读者可通过该编号查阅完整原文。研究团队提出了一套名为VisualPatchWorld简称VPW的新框架试图解决一个困扰机器人和人工智能研究者多年的老难题如何让机器自动学会这个世界是怎么运转的并利用这种理解来做出更好的行动决策。你有没有想过当一个机器人要把桌上的积木推到目标位置时它脑子里到底在想什么它需要知道自己的手推杆推上积木之后积木会如何移动力气大了会怎样角度不对又会怎样。这种对世界运转方式的内在理解研究人员称之为世界模型。有了准确的世界模型机器人就能在脑子里先演练各种方案挑出最好的那个再真正动手——就像一个棋手在落子之前先在脑中推演几步棋一样。在VPW出现之前研究者主要有两条路可走。一条路是用神经网络来学习世界模型喂给网络大量的视频和操作数据让它在自己内部的向量空间里建立起对世界的理解。这条路的好处是可以从数据中自动学习不需要人工编写规则坏处是学到的东西藏在几百万个数字参数里谁都看不懂出了问题也没法修。另一条路是人工编写物理引擎程序员直接把重力、摩擦力、碰撞规则等物理定律写成代码机器人就按照这些规则行事。这条路的模型清晰可读但每换一个新环境就得重新写一套费时费力根本无法大规模推广。VPW走的是第三条路让机器自动从观察数据中归纳出可执行的程序代码把这段代码作为世界模型。这段代码既能像物理引擎一样清晰可读、可编辑又能像神经网络一样从数据中自动生成。这个想法听起来有些神奇接下来就一步步拆解它的实现方式。一、世界模型究竟是什么为什么重要要理解VPW的价值先得弄清楚世界模型在整个智能体系中扮演的角色。香港浸会大学的研究团队在论文中引用了斯坦福大学李飞飞博士2026年提出的一个框架一个真正有用的世界模型应当承担三项职责——渲染能生成画面告诉你世界看起来是什么样子、模拟能追踪状态告诉你世界现在处于什么状态以及规划能评估行动告诉你下一步该做什么。把这三项职责想象成一位经验丰富的厨师的内心戏当他看到一锅汤渲染他能判断现在的火候和食材状态模拟然后决定是该加盐还是继续等规划。三者共用同一套对烹饪的理解只是在不同场合发挥不同作用。对于机器人来说这套内心戏就是世界模型。现有的神经网络世界模型比如谷歌DeepMind的Dreamer以及法国高等师范学院和Meta联合开发的LeWM在渲染和粗略规划方面表现不错但它们的内部逻辑完全不透明。一旦机器人做了一个糟糕的决定你无法打开它的大脑看看哪里出了问题只能重新收集数据、重新训练。另一边手工编写的物理引擎像教科书里的公式一样清晰改一行代码就能调整一个物理参数但每个新环境都要从头写成本极高。VPW就是在这两种极端之间架起一座桥自动生成的程序代码既有神经网络的数据驱动能力又有物理引擎的可读性和可编辑性。二、VPW的核心思路像侦探一样先判断案件类型再收集细节证据VPW的整个工作流程可以用一个侦探破案的比喻来理解。面对一起案件聪明的侦探不会一上来就漫无目的地收集所有线索。他会先根据现场情况判断这是哪种类型的案件——谋杀、盗窃还是意外然后才有针对性地深入调查。VPW做的事情与此如出一辙。整个流程分为四个阶段依次进行。第一阶段是视觉抽象把原始的像素画面变成结构化的文字描述记录每个物体的位置、角度、速度以及物体之间的距离和接触关系。第二阶段是轨迹导出把一段段的操作录像整理成动作前状态—动作—动作后状态的三元组记录为后续学习准备好材料。第三阶段是最关键的两级程序归纳这正是侦探破案的核心环节。第四阶段是规划验证用学到的程序来指导实际控制检验它是否真的好用。第三阶段的两级程序归纳细分为两个子步骤。第一级叫主动探测选结构第二级叫参数拟合定细节。把这两步放在一起理解第一级相当于侦探判断这是谋杀案还是事故第二级相当于确定嫌疑人之后收集指纹、足迹等具体证据。第一级的工作方式非常聪明。面对一个新环境VPW会主动向模拟器发出几个精心设计的探测性动作就像侦探在案发现场做几个小实验一样。比如给机器人施加一个短暂的力然后观察它是立刻停下说明没有惯性是无记忆的一阶系统还是缓慢减速说明有惯性是二阶PD控制系统再比如让机器人靠近一个积木观察积木是不是只有在接触时才会移动接触驱动型还是远距离也会有响应动作驱动型。通过这一系列短小精悍的探测实验VPW可以在一个预先定义的小型假设库中选出最符合当前环境物理规律的动力学草图。在论文展示的推箱子任务中这个假设库有三个相互独立的二元选择机器人遵循PD控制还是无记忆控制、积木是准静态还是有动量、运动是接触驱动还是动作驱动三者组合出八种可能的草图主动探测会挑出最合适的那一种。选定了草图之后第二级就开始填充具体数值。就像侦探锁定嫌疑人后去核查他在案发时间的行踪VPW把选定的草图实例化为一段带有未知常数的Python代码模板然后在大量的操作轨迹数据上进行优化找到让预测误差最小的那组参数。这里有一个重要细节优化的目标不是让单步预测尽量准而是让**多步连续预测**的累积误差尽量小。这个区别非常关键——就像一张地图单步误差小只能说明每一格画得准确但如果格与格之间有系统性的偏差沿着这张地图走个十步你可能已经偏离正确路径很远了。VPW专门针对长距离导航的需求来校准地图而不仅仅追求每一步的精度。三、把程序代码当作脑内演练场来规划行动有了这段可执行的Python程序机器人就可以用它来规划行动了。VPW采用的规划方法叫做滚动时域模型预测控制配合交叉熵方法论文中简称CEM-MPC。这个听起来复杂的名字背后的逻辑其实相当直观。考虑这样一个场景你站在一个迷宫的起点需要找到出口。你随机想出一百条不同的路线然后在脑子里分别推演每条路线会走到哪里挑出最接近出口的那些路线再以这些好路线为模板生成下一批更优化的路线候选如此迭代几轮之后你就能找到一条相当不错的路径。VPW的规划就是这么运作的只不过推演路线用的是刚才学到的程序代码而不是人的直觉。更妙的是VPW把当前状态的观察和未来行动的评分分成了两个独立的问题。观察当前状态时VPW可以从真实图像中提取场景描述工具路径或者直接读取模拟器的精确状态神谕路径而评分未来行动时用的是归纳出来的程序代码不需要额外调用昂贵的物理引擎。这种分离设计让研究团队可以精确地测量感知误差和动力学误差各自对最终规划效果的贡献有多大。论文还设计了一种混合评分机制来处理那些特别难搞的接触密集型任务。核心思路是用归纳出来的程序先对全部候选方案进行粗筛从中取出表现最好的前30%再调用真实的物理引擎对这30%进行精细验证最终从中选出最优方案。这样一来物理引擎的调用次数比全程使用引擎减少了70%但规划效果几乎没有损失。四、在四个不同任务上的表现哪里亮眼哪里还差一口气研究团队在LeWM基准测试的四个任务上对VPW进行了系统评估每个任务各有特点对世界模型的要求也各不相同。推箱子任务PushT是最复杂的一个要求机器人用圆形推杆把一个T形积木推到指定的位置和朝向。这个任务的难点在于接触力学推杆和积木的接触点、接触角度、接触时机都会影响积木的运动方式。VPW通过主动探测确认了这里适用接触驱动PD控制加准静态积木的物理草图然后拟合出PD增益KP约92、KV约26和缩放参数等具体数值。仅靠归纳出来的程序做评分时成功率达到22%而此前所有代码型基线方法的成功率几乎为零。加上混合评分之后成功率一跃升至88%到96%接近使用真实物理引擎的96%天花板。双房间导航任务Two-room要求机器人在有墙壁和门道的二维环境中导航到目标位置。VPW归纳出的是线性导航规律在归纳程序评分下就达到了96%的成功率与使用真实物理引擎的100%已经非常接近。混合评分进一步提升到100%。积木操作任务Cube要求机械臂抓取并移动一个三维空间中的方块到目标位置。VPW归纳出夹持触发型接触规律也就是只有在夹爪夹住积木的时候积木才会跟着移动否则保持静止。这个关键的开关逻辑让VPW的成功率达到86%而此前表现最好的代码型基线WorldCoder只有74%。机械臂到达任务Reacher要求控制一个双关节机械臂让指尖到达目标点。这个任务的关键在于运动学机械臂的运动是在关节角度空间里发生的而不是在指尖的笛卡尔坐标空间里。其他代码型方法普遍犯了一个错误它们把指尖当作一个可以自由移动的质点来建模忽略了关节运动的约束导致预测误差极大平均误差0.86规划成功率只有6%到30%。VPW通过主动探测识别出这里应该用关节空间动力学加正向运动学的草图拟合出关节角度更新矩阵和正向运动学参数将预测误差压低到0.04规划成功率提升到72%。把四个任务放在一起看VPW的平均成功率达到69%比此前最好的代码型基线POMDP-Coder45.5%高出23.5个百分点比PatchWorld43%高出26个百分点。从图表数据中可以明显看出在Reacher任务上VPW的开环预测误差曲线一路低平而其他所有方法的误差曲线在前几步之后就开始急剧攀升有些甚至出现几百像素级别的不稳定跳跃这直观地说明了为什么选对物理草图会如此关键。五、感知误差有多大影响从像素到计划的损耗一个自然而然的问题是如果机器人不是靠读取模拟器的精确状态而是靠识别真实图像来感知当前状态效果会打多少折扣VPW的设计专门为回答这个问题留了接口通过对比图像工具路径归纳评分和神谕路径归纳评分两种条件可以直接量化感知误差的代价。从实验数据来看图像工具路径在PushT任务上的位置误差仅为1.8像素与神谕路径的1.9像素几乎持平说明颜色分割加PCA方向估计这套计算机视觉管线对推箱子任务来说已经足够精确。在Reacher任务上指尖和目标点的定位误差只有0.12个归一化单位但整个手臂的关节角度估计误差较大2.65个单位因为从单张图像中恢复关节角度本就是个困难问题。在双房间导航任务中图像工具路径恢复出的智能体位置误差仅为0.19个归一化单位精度相当令人满意。相比之下如果用大型语言视觉模型VLM来提取场景信息效果就差很多。VLM能正确识别出画面中有哪些物体、它们的相对位置关系是什么比如智能体在积木的左边但它给出的数值坐标严重失准在PushT任务上的坐标误差高达236像素是图像工具路径的130倍以上。这说明语义理解和精确的空间定量描述是两码事至少在当前的VLM能力水平下前者不能替代后者。这个发现对实际应用有直接意义如果你想把VPW用在真实机器人上搭配适当的计算机视觉处理模块比如颜色分割、深度相机是可行路径但直接接一个通用VLM当作感知层还不够可靠。六、还差什么接触密集型任务的残差缺口尽管VPW在多个任务上表现亮眼研究团队在论文中也坦率地指出了它仍然不足的地方。核心问题集中在接触密集型任务也就是推箱子PushT。在这类任务中成败往往取决于极短暂的接触时刻推杆在正确的角度、正确的速度接触到积木积木才会按预期方向滚动稍有偏差积木可能朝完全相反的方向运动。这种高度依赖接触时刻的特性使得即使是相当准确的物理草图在评分时也容易犯差之毫厘谬以千里的错误——两个在归纳程序看来分数接近的候选方案在真实引擎中可能一个成功、一个完全失败。这是规划效果对单步预测精度不单调的典型情况提高预测精度并不总能线性地提升规划成功率因为在关键的接触时刻任何微小的预测误差都会被后续的动力学放大。论文中有一个图表清晰地呈现了这一点VPW归纳的积木运动预测累积位移约16.2像素真实值约140像素比所有基线方法好得多但相对于真实物理过程仍有明显差距。混合评分机制正是为此而设计的解决方案。通过把评分分成两步——先用归纳程序粗筛出有希望的候选方案再调用真实引擎精筛前30%——VPW把PushT任务的成功率从22%推到了88%图像输入条件或96%精确状态输入条件用30%的引擎调用次数换来了接近全程使用引擎的效果。这种以程序做海选、以引擎做复赛的策略在计算效率和规划质量之间找到了一个务实的平衡点。七、与其他方法的横向比较各自擅长什么各自缺少什么论文在比较部分对当前主流方法做了相当全面的梳理研究团队将其分为神经网络参考组和可执行代码比较组两个大类。神经网络参考组包括LeWM、DINO-WM、PLDM等方法它们在四个任务上的平均成功率在79.5%到85.8%之间整体高于VPW的69%。但这个比较并不是苹果对苹果的公平比较——神经网络方法使用了原始图像作为全程输入包括训练和评分而VPW的主要比较基线是可执行代码组两者的数据来源和使用方式不同。神经网络方法在已有大量标注数据的情况下表现优秀但它们的动力学知识藏在参数里无法检视和修改这是根本性的架构差异。可执行代码比较组才是VPW真正的竞争对手。这个组包括六种不同的方法PatchWorld通过反例引导搜索来合成Python代码WorldCoder通过与环境交互来学习单体Python模型POMDP-Coder用大语言模型归纳概率程序PoE-World把多个专家程序加权组合GIF-MCTS用蒙特卡洛树搜索在代码编辑空间中搜索CWM-Game合成带有树搜索的代码世界模型。这些方法在四个任务上的平均成功率分别为43%、35%、45.5%、27%、23%和25%。VPW在所有这些方法上都形成了优势而且这些方法使用的是完全相同的训练数据模拟器状态轨迹、相同的规划设置相同的起点终点、相同的CEM预算唯一的区别是归纳出来的程序质量不同。这就使得实验结论相当干净VPW的优势不来自于数据优势或计算预算优势而是来自于两级归纳流程对物理结构的更准确还原。最能说明问题的是Reacher任务上的失败案例分析。PatchWorld和WorldCoder把机械臂的运动建模为指尖在二维平面上自由移动完全没有考虑关节运动约束导致指尖的预测轨迹在几步之后就完全偏离真实轨迹。VPW通过主动探测识别出关节空间动力学的本质用关节角度更新矩阵加正向运动学的方式建模预测误差低了一个数量级规划成功率也从个位数跳升到72%。这个对比案例非常直观地说明了选对物理结构比代码写得多精巧重要得多。八、VPW的局限与未来方向研究团队在论文结尾部分没有回避这套方法的局限性。第一个局限是当前的假设库是人工预先设计的每个环境需要人类专家提前指定几种可能的物理动力学类型比如接触驱动还是动作驱动。这个假设库的设计需要对目标领域有一定的先验知识自动化程度还不够高。扩大假设库、让VPW能处理更广泛的物理现象是未来工作的重要方向。第二个局限是整个系统的动力学学习依赖于模拟器状态数据精确的位置、速度等而不是直接从原始图像端到端学习。当前的图像视觉工具路径是一个针对特定环境设计的专用感知模块而不是通用的视觉感知系统。论文提出未来工作的一个重要目标是实现从视觉场景图轨迹直接进行端到端的程序归纳进一步降低对专用感知模块的依赖。第三个局限是评估仅在模拟环境中进行尚未在真实机器人上部署测试。从模拟到现实的迁移通常会带来新的挑战比如传感器噪声、执行器延迟、物理参数偏差等这些都需要后续工作来解决。归根结底这项工作最大的贡献不仅仅是在四个基准任务上提升了几十个百分点的成功率更在于提出了一条有理论依据的路线图通过把选什么物理结构和确定具体参数分成两个清晰的步骤可以自动地从交互轨迹中生成既可读又可用的代码世界模型。这种方法的可解释性意味着当机器人做了一个错误决策时研究人员可以直接审查是哪一段代码出了问题然后有针对性地修正而不是面对一个黑盒子束手无策。说到底VPW想做的事情很朴素让机器人像人一样在动手之前先在脑子里把事情想清楚而且这个想清楚的过程是用人能读懂的语言写出来的而不是埋在几亿个浮点数里。这个目标听起来理所当然实现起来却并不简单——而VPW为此迈出了相当扎实的一步。感兴趣的读者可以通过arXiv编号2607.25236查阅完整论文或者访问论文中公开的代码仓库进行复现实验。QAQ1VisualPatchWorld与普通神经网络世界模型相比最核心的区别是什么AVisualPatchWorld把世界动力学表示为可执行的Python程序而不是藏在神经网络参数里的数字向量。这意味着当机器人预测出错时可以直接检查哪段代码有问题并加以修改而神经网络方法出错时只能重新收集数据重新训练无法直接定位和修复具体的逻辑错误。Q2VPW的主动探测是怎么工作的为什么不直接学习参数A主动探测是VPW先向模拟器发出几个精心设计的短小实验动作观察结果后判断当前环境属于哪种物理类型比如有没有惯性、接触是否触发运动等。直接学参数的问题在于如果一开始就选错了物理结构比如把有关节约束的机械臂当成自由质点来建模再怎么优化参数效果也很差。先确定对的结构类型再拟合具体数值这两步分开做比直接混在一起学要可靠得多。Q3混合评分机制的70%节省是怎么计算出来的A在标准的全引擎CEM规划中每一轮迭代需要对全部N个候选方案都调用一次真实物理引擎共需N次引擎调用。混合评分先用归纳程序对全部N个方案评分不调用引擎再只对评分前30%的方案调用引擎复核也就是只需0.3N次引擎调用。相比全程使用引擎的N次调用节省了70%的引擎调用次数但规划成功率几乎不受影响。