新加坡国立大学等研发的机器人大脑,如何让机械臂既“看懂“空间又“预见“未来?

发布时间:2026/8/12 9:48:40
新加坡国立大学等研发的机器人大脑,如何让机械臂既“看懂“空间又“预见“未来? 这项由新加坡国立大学高级机器人中心、香港大学多媒体实验室、南洋理工大学以及新加坡制造技术研究院联合开展的研究以预印本形式发布于2026年8月论文编号为arXiv:2608.01397有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。**一、机器人为什么总是手忙脚乱**教机器人做事远比看起来难得多。拿一个最简单的任务举例——把桌上的碗放进碟子里。对普通人来说这不过是伸手、拿起、放下整个过程不超过两秒。但对机器人而言它需要搞清楚碗在哪里、距离多远、用多大的力气抓、放下去的角度如何控制稍有偏差就可能把碗碰翻。目前让机器人学会做事的主流方法叫做模仿学习——给机器人看大量人类操作的视频或示范让它从中提炼规律形成自己的行动策略。这就好比一个厨艺学徒反复观看师傅炒菜然后自己上手练习。然而问题在于这种方法只是让机器人学会了看到这个情况就做这个动作却没有让它真正理解动作背后的逻辑——我这一刀切下去食材会变成什么形状锅里的油温度再高一点菜会不会焦换句话说机器人缺乏对自己行为后果的预判能力。正是为了解决这个问题研究人员提出了一类叫做世界行动模型World Action Models简称WAMs的新方法。这类方法的核心思路是让机器人在学习怎么动的同时也学习动了之后世界会变成什么样。就像一位老练的棋手走每一步棋之前脑子里已经预演了对方可能的应对而不只是机械地套用固定招式。然而现有的WAMs方法在实践中遇到了一个棘手的矛盾而这篇论文提出的SG-WAM框架正是为了从根本上化解这一矛盾。**二、预见未来有两种方式但两种都有缺陷**现有的世界行动模型大致分为两条路线可以用放电影和记笔记这两种方式来类比。放电影路线学名叫观测空间预测意思是直接预测未来的图像或视频画面。机器人在决定如何行动之前先在脑中播放一段假想的未来视频——如果我把手伸向左边未来的画面将会是这样如果我向右画面将会是那样。这种方式非常直观但代价极高。因为图像里包含了大量与任务无关的信息背景颜色、光线变化、桌布纹理……机器人要花费大量精力去学习这些与把碗放好根本没关系的视觉细节就像一个厨师在记忆食谱的同时还要记住厨房墙壁的颜色白白浪费脑力。记笔记路线学名叫潜在空间预测是一种更聪明的压缩策略。机器人不再预测完整的图像而是把场景压缩成一组抽象的数字向量——这些向量就像是场景的精华提炼去掉了无关的外观细节只保留关键信息。然而问题就出在关键信息的定义上。这些用来预测未来的抽象向量往往是由一套独立的未来编码器生成的而机器人真正用来决策行动的表示是由另一套系统生成的。两套系统各自为政就像一个人用左手记笔记、右手执行动作两只手的语言体系不一样配合起来自然容易出问题。这就是所谓的目标-策略不匹配预测未来用的信息和生成动作用的信息并不是同一种语言。更深层的问题还在于无论是哪条路线现有方法大多对空间几何信息的处理不够重视。机器人操作任务的成败往往取决于空间细节——碗离碟子的距离差了几毫米抓取角度偏了几度就可能全盘皆输。但现有的潜在空间表示往往是高度压缩的精细的空间几何信息在压缩过程中流失了。于是一个核心问题摆在研究团队面前如何构造一个既与动作生成紧密耦合、又富含空间几何信息的未来预测空间SG-WAM的答案是让机器人用自己的语言来预见未来同时用几何知识来磨砺这门语言的精准度。**三、SG-WAM的核心设计一个会自我预言的机器人大脑**SG-WAM这个名字SG代表Self-Guided即自我引导WAM代表World Action Model即世界行动模型。整个系统的运转逻辑可以用学徒培训这个场景来贯穿理解。把SG-WAM的机器人大脑想象成一家训练有素的厨艺学校。这所学校有一位主厨VLM主干网络基于Qwen3.5-0.8B语言视觉模型负责综合感知——看清楚眼前的食材视觉观测听懂任务要求语言指令并形成对当前局面的整体判断。与此同时学校里还有一批实习生这就是SG-WAM引入的可学习动态令牌Learnable Dynamics Tokens。这批实习生的特殊之处在于他们没有固定的岗位分工而是跟着主厨一起感知整个厨房的状态专门负责记录和归纳这道菜下一步会发生什么变化。他们不是预先设计好要关注什么而是在训练过程中自己摸索出最关键的信息该往哪里看。在具体实现上这8个动态令牌被拼接在视觉和语言输入之后与所有信息一起流经整个神经网络最终形成对当前场景动态状态的紧凑表示。**预测未来的方式向未来的自己学习**SG-WAM最独特的创新在于它预测未来的靶子从哪里来。传统方法会找一个外部老师——比如一个专门处理未来图像的独立编码器——来告诉机器人未来应该是什么样子。而SG-WAM做的事情是让机器人向未来的自己学习。具体操作是这样的训练时除了当前时刻的观测之外还会给系统提供几步动作之后的未来观测画面。然后用当前网络的一个慢更新副本指数移动平均拷贝或称EMA版本来处理这个未来画面得到未来动态令牌的状态——这就是预测的目标。所谓慢更新副本就像主网络的一个稳重版本主网络每次训练都在快速调整而这个副本的更新节奏要慢得多每一步只吸收一点点主网络的变化EMA动量系数设为0.999始终保持相对稳定。这种设计借鉴了自监督学习领域著名的BYOL方法用来防止预测目标不稳定导致训练崩溃。在这套机制下机器人用当前时刻的动态令牌状态加上即将执行的8步动作序列通过一个叫做自引导世界预测器SGWP的模块预测出未来时刻的动态令牌状态。预测的目标——未来动态令牌的样子——则由同一套网络结构的慢更新副本来产生。简而言之预测者和被预测目标说的是同一种语言用的是同一套符号体系只是一个看当下、一个看未来。这就从根本上消除了目标-策略不匹配的问题。**动作怎么被输入进去**预测时即将执行的8步动作序列每步动作是7维向量涵盖机械臂各关节的运动需要被编码成网络能理解的形式。研究团队用一个基于MLP的动作编码器将每步动作变成一个动作令牌并给每个令牌加上时序位置编码以保留动作发生的先后顺序——毕竟先抓后放和先放后抓是完全不同的故事。自引导世界预测器内部由两种注意力机制组成。首先当前动态令牌之间互相交流自注意力让每个令牌了解其他令牌在关注什么。然后这些令牌以提问者的身份去询问动作令牌序列交叉注意力从中选出与自己预测任务最相关的动作步骤来重点参考。经过这两步预测器输出的就是对未来动态令牌状态的预测训练时用均方误差损失函数来衡量预测与目标之间的差距并以此来优化网络。**四、空间几何感知给机器人大脑装上立体视觉**预见未来只是解了一半的题。另一半问题是即便机器人能用自己的语言预测未来这门语言是否足够精准能够区分碗差3毫米够不到碟子和碗正好放进碟子这样细微的空间差异这就是SG-WAM几何监督模块发挥作用的地方。研究团队引入了一个预训练的三维几何基础模型——VGGTVisual Geometry Grounded Transformer视觉几何基础Transformer作为空间感知老师。这个老师专门擅长从单张或多张图片中提取精细的三维空间结构信息包括物体的深度、形状和相对位置关系是在大量三维视觉数据上训练出来的专家系统。几何监督的运作方式是言传身教不亲自上阵。VGGT老师在训练时处理当前主视角的观测图像提取出一套包含精细空间结构的几何特征原始图像被缩放到518×518像素经过VGGT处理后得到1369个图像块的特征再通过自适应平均池化压缩到8×8个特征点最终形成几何目标向量。与此同时SG-WAM主网络处理同一张图像得到对应的图像令牌状态。然后用一个轻量级的几何投影器把主网络的图像令牌映射到与VGGT特征相同的维度再计算两者之间的余弦相似度损失——也就是让主网络的图像令牌在方向上尽量与VGGT的几何特征对齐。这里用余弦相似度而非直接的数值差距是有意为之的。余弦相似度只关心方向对不对不管数值大小。这样做的好处是主网络的图像令牌可以保持自身的数值尺度和分布不会被过度约束只是在朝哪个方向理解空间这件事上向几何专家看齐。这就像要求学徒理解空间关系的思路要和师傅一致而不是把师傅的笔记一字不差地背下来。重要的是VGGT在整个训练过程中是完全冻结的不参与梯度更新也不在推理时出现。它只是训练时的一位特邀辅导老师用来塑造主网络看图像的方式让主网络的图像令牌里自然蕴含更丰富的三维空间信息。而这些被几何知识塑造过的图像令牌会通过Transformer的注意力机制将空间信息传递给动态令牌使得动态令牌的状态既服务于未来预测又具备了空间几何感知能力。**五、整个系统是如何工作的从观测到动作的完整流程**把上述所有组件串联起来SG-WAM的完整工作流程如下。当前时刻机器人的主视角摄像头Kinect Azure拍摄场景全景图腕部摄像头RealSense D405拍摄近端操作图再加上任务语言指令比如把碗放进碟子三类输入经过各自的编码器变成令牌序列。与此同时8个可学习的动态令牌也加入这个序列一起流经VLM主干网络Qwen3.5-0.8B的所有层得到包含视觉令牌状态、语言令牌状态和动态令牌状态在内的完整上下文表示。这套上下文表示随后服务于两个并行的任务。其一送入流匹配动作专家Conditional Flow-Matching Action Expert生成接下来8步的动作序列。流匹配是一种近年兴起的生成建模技术可以理解为给定噪声和条件信息学习一个速度场使随机噪声沿着这个场的方向流动最终变成合理的动作序列。其二仅在训练时动态令牌状态被送入SGWP结合即将执行的动作序列预测未来时刻动态令牌的状态并与EMA副本产生的目标进行对比学习。训练时的总损失函数由三项加权求和动作模仿损失权重为1、未来状态预测损失权重为0.1以及几何对齐损失权重为0.1。三项损失共同优化同一套主网络参数使得网络在学会模仿动作的同时也把空间几何理解和未来状态预测的能力融入到它看世界的方式里。到了实际使用推理阶段VGGT老师、SGWP预测模块和EMA副本全部从系统中移除只剩下在线VLM主网络、动态令牌和动作专家。输入当前观测和语言指令直接输出动作序列。整个推理系统非常紧凑没有任何额外的计算负担。**六、实验结果从仿真到真实世界的全面检验**研究团队在两个仿真基准测试平台和一套真实机器人实验平台上对SG-WAM进行了全面评测。**仿真测试LIBERO基准**LIBERO是机器人操作领域广泛使用的标准评测平台包含四个子任务套件分别考察空间推理能力LIBERO-Spatial、面向特定物体的操作能力LIBERO-Object、目标导向的行为能力LIBERO-Goal以及长时序任务执行能力LIBERO-Long。SG-WAM在四个套件上的平均成功率达到98.5%与当前最强基线方法持平。这一成绩尤为值得关注的背景是SG-WAM使用的是仅有0.9B参数规模的基础模型且完全没有经过额外的机器人具身预训练数据加持。对比来看大多数高性能基线方法要么使用7B参数规模的大模型如OpenVLA-OFT、WorldVLA、Spatial Forcing等要么经过了大规模的机器人专用预训练如π0、π0.5、GR00T N1.6等。SG-WAM以更小的模型、更少的专用数据取得了旗鼓相当乃至更优的结果充分体现了其训练方法的高效性。具体到各个子套件SG-WAM在LIBERO-Spatial和LIBERO-Object上均达到99.4%和99.8%的成功率与最优基线并驾齐驱甚至略有超越在LIBERO-Goal和LIBERO-Long上分别达到98.6%和96.2%。其中LIBERO-Long历来是最具挑战性的子套件因为任务需要机器人连续完成多个步骤任何一步失误都会导致整体失败——SG-WAM在这一套件上优于大多数同等规模基线表明其时序建模能力确有提升。**零样本迁移测试LIBERO-Plus基准**更能检验泛化能力的是LIBERO-Plus基准。这个测试平台的特点是训练时只在标准LIBERO数据上学习测试时则引入训练中从未见过的各种扰动包括摄像机视角改变、机器人初始状态变化、语言指令措辞改变、光照条件变化、背景纹理变化、观测噪声增加以及场景物体布局改变共七种扰动维度。测试时完全不做任何微调或适应是真正意义上的零样本迁移。SG-WAM在LIBERO-Plus的总体成功率达到73.0%超越所有对比基线成为当前最佳。对比来看在标准LIBERO上表现出色的Spatial Forcing和Fast-WAM在LIBERO-Plus下成绩分别跌至29.1%和50.0%说明其学到的表示较为依赖训练域的视觉外观。VLA-JEPA2B模型达到62.9%OpenVLA-OFT7B模型达到69.6%均低于SG-WAM的73.0%。在各扰动维度的细分结果中SG-WAM在摄像机视角58.6%最佳、语言指令81.4%最佳、光照条件89.8%最佳和物体布局74.2%并列最佳四个维度上均排名第一在背景纹理80.7%和观测噪声74.2%维度上也保持竞争力仅在机器人初始状态维度48.9%略低于VLA-JEPA55.7%。这一全面的分布外鲁棒性表明SG-WAM学到的策略表示对浅层视觉变化和语言表达变化都具有较强的不变性。**真实世界测试三类物理操作任务**研究团队使用UR5e机械臂构建了真实世界实验平台设计了三个难度层次各异的操作任务。第一个任务是带障碍物的取放操作机器人需要从打开的抽屉里取出蓝色方块越过一个阻隔物放入碗中。这主要考察三维空间推理和避障轨迹规划能力。第二个任务是毛巾折叠机器人需要将平铺的毛巾连续折叠两次形成紧凑的叠放形状。每次折叠后布料的形态都会变化下一次抓取点也随之改变这主要考察对可变形物体状态的动态感知和几何感知能力。第三个任务是工具箱整理机器人需要依次把一把螺丝刀和两个齿轮放入工具箱最后关上盖子共分为五个子步骤主要考察长时序规划和多物体操作能力。每个任务收集了100条专家示范数据并在标准设置和三种分布外扰动设置背景变化、光照变化、新物体下分别测试。在分布内设置下SG-WAM在三个任务上的成功率分别为75%取放、45%折叠和50%工具箱全面超越对比基线VPP30%/35%/30%和VLA-JEPA35%/20%/20%。在分布外扰动下SG-WAM同样保持领先以取放任务为例背景变化时成功率55%VPP为15%VLA-JEPA为20%光照变化时成功率60%VPP为10%VLA-JEPA为25%新物体时成功率40%VPP为10%VLA-JEPA为20%。在工具箱整理任务的子步骤分解数据中可以看到更细腻的规律三个方法的成功率都随任务进展而下降因为前面步骤的失误会影响后续步骤但SG-WAM在后期步骤如拾取第二个齿轮、关闭盖子上的优势比早期步骤更明显从50%比VPP的40%和VLA-JEPA的20%。这一现象暗示SG-WAM的动作条件化潜在预测机制确实帮助系统在长时间执行过程中维持了更连贯的任务状态表示。**七、消融实验拆开来看哪个部件最重要**为了弄清楚SG-WAM各个设计要素的具体贡献研究团队在LIBERO基准上进行了系统的消融实验。当把几何监督和自引导世界建模两个模块都去掉时只剩下基本的视觉语言动作网络平均成功率为95.3%。单独加入几何监督后成功率提升到96.6%提升了1.3个百分点。单独加入自引导世界建模后成功率提升到97.6%提升了2.3个百分点。两者同时加入时达到最优的98.5%提升了3.2个百分点。这说明两个模块提供了互补的收益简单相加的效果略低于真正同时引入。世界建模模块对LIBERO-Long子套件的提升最为显著没有世界建模时该套件成功率为92.2%加入世界建模后提升到96.2%提升了足足4个百分点。这与直觉相符——长时序任务最需要对动作后果的预判能力。几何监督模块虽然对LIBERO-Long的提升从91.0%到92.2%看起来数字较小但它为世界建模提供了更有结构性的视觉上下文两者的协同效应在完整模型中充分体现。在动态令牌数量的消融实验中从1个令牌到8个令牌性能从96.1%稳步提升到98.5%其中LIBERO-Long从90.2%提升到96.2%改善幅度最大。然而将令牌数量进一步增加到16个时性能反而下降到97.2%LIBERO-Long更下滑到92.4%。这一非单调的趋势说明动态令牌承载的信息量有一个最优区间——8个令牌已经足以编码多样的交互动态更多的令牌不会带来额外益处甚至可能引入干扰。研究团队还测试了空动作null action消融变体将即将执行的动作序列替换为全零向量其他架构完全保持不变。结果显示空动作版本的平均成功率为97.6%低于完整版的98.5%。四个子套件均有不同程度的下降其中LIBERO-Long下降幅度最大1.6个百分点。这证明了动作序列本身确实携带了有用的信息帮助系统更准确地预测动作对应的未来状态变化——当然当前策略状态本身已经包含了大量预测信息所以空动作版本仍然相当有竞争力。**注意力图可视化几何监督让机器人看对了地方**研究团队还可视化了动态令牌对主视角图像令牌的注意力权重直观对比了有无几何监督时机器人在看哪里。有几何监督时8个动态令牌普遍将注意力集中在与机器人-物体交互最直接相关的区域机械臂末端执行器的位置、被操作物体碗的轮廓、目标放置位置碟子以及两者之间的空间关系。没有几何监督时部分令牌的注意力会被视觉上显眼但与任务无关的区域所吸引——比如桌上颜色鲜艳的包装盒——而对机器人-物体的交互区域关注相对不足。这一视觉证据表明几何监督确实将主网络的视觉表示重新组织为更以操作任务为中心的空间结构为动作条件化的动态令牌预测提供了更有指导价值的视觉上下文。**八、系统实现的完整技术细节**为了让感兴趣的读者有更清晰的认识这里补充一些关键的实现参数。SG-WAM的VLM主干网络为Qwen3.5-0.8B是一个视觉语言双模态模型。训练时使用全部四个LIBERO标准套件的联合数据训练40000步全局批大小为96。学习率采用余弦衰减调度有5000步线性热身VLM主干的峰值学习率为1e-5仅在训练时使用的辅助模块几何投影器、SGWP等为2.5e-5动作头为1e-4。VGGT老师使用的是VGGT-1B规模的预训练模型推理时完全去除。EMA动量系数固定为0.999。几何损失和预测损失的权重均为0.1。真实世界实验的训练设置与仿真实验基本一致所有三个真实任务联合训练40个epoch批大小96不对任何单独任务进行特殊微调同一个最终检查点用于分布内和分布外评测。说到底SG-WAM做到的事情可以用一句话来概括它让机器人用自己的眼光来理解未来而不是借用别人的眼睛同时它还让机器人的眼光变得更有深度——字面意义上的深度因为几何监督让它看图像的方式天然包含了三维空间感知。这两件事结合起来让一个只有0.9B参数、没有大规模机器人专用预训练的轻量模型在多项基准测试上与甚至超过了使用7B参数、经过大量专用预训练的竞争对手。当然每一项研究都有其局限性。SG-WAM目前仍在桌面操作场景下验证距离自由移动的服务机器人或复杂工业环境还有相当的距离。研究团队也明确指出未来的工作方向包括将这一自引导世界建模框架扩展到更大规模的策略主干和更广泛的跨具身形态数据集探索不同机器人平台之间的迁移能力。这条路还很长但SG-WAM迈出的这一步方向是清晰的不为了预测而预测而是让预测成为行动的有机组成部分——用同一套语言同时说清楚现在怎样和动完之后怎样再决定该怎么动。QAQ1SG-WAM与其他机器人操作模型相比最大的不同是什么ASG-WAM最大的不同在于它让机器人用自己的表示来预测未来而不是依赖外部独立的未来编码器。预测目标由同一套网络结构的慢更新副本EMA副本产生这样预测系统和动作生成系统说的是同一种语言避免了传统方法中预测目标和行动决策之间信息不对齐的问题。同时SG-WAM还引入VGGT几何老师来强化空间感知但只在训练时使用推理时完全去除不增加额外计算负担。Q2SG-WAM的几何监督是怎么工作的A训练时SG-WAM用一个预训练的三维视觉模型VGGT处理当前观测图像提取精细的空间几何特征作为目标。主网络的图像令牌通过一个轻量投影器映射后与这些几何目标计算余弦相似度损失让主网络学会用更具三维空间结构感的方式来理解图像。VGGT本身全程冻结不参与训练推理时也被完全移除只是充当训练时的空间感知老师。Q3SG-WAM用的模型参数量只有0.9B为什么能超过7B的模型ASG-WAM的核心优势不在于模型规模而在于训练方式。通过自引导世界建模网络在学习模仿动作的同时还被迫学会预测动作的后果这使得学到的表示更加丰富和结构化。几何监督进一步让视觉表示具备空间感知能力。两种额外的训练信号共同作用让较小的模型学到了更有泛化价值的策略表示在分布外测试中尤其明显——对视觉外观变化更不敏感对任务的核心空间关系理解更深。