心智世界建模:从物理世界到人类意图的AI新范式

发布时间:2026/8/30 14:19:22
心智世界建模:从物理世界到人类意图的AI新范式 世界模型World Model最近是 AI 圈最热的概念之一从自动驾驶到视频生成从具身智能到游戏智能体似乎没有哪条赛道不提到它。不过多数讨论里的“世界模型”其实都集中在物理层物体怎么动、光线怎么变、路面怎么走、视频下一帧长什么样。牛津大学和新加坡国立大学NUS研究团队近期提出的“心智世界建模”Mental World ModelingMWM把建模视角从“外部物理世界”延伸到了“内部心智世界”这个方向很值得单独展开聊一聊。这篇文章会围绕“世界模型”概念的边界、MWM 的核心含义、它与主流世界模型包括 YOLO 系列中的 World 模型的关系、以及这个方向可能的工程落地方式展开。如果你本身研究强化学习、多模态感知、具身智能或者对下一代 AI 智能体方向感兴趣这篇内容会比较适合带着一起思考。1. 背景为什么世界模型突然火了又为什么“不够用”1.1 世界模型的经典定义早些年世界模型并不是太大众的概念。最经典的定义来自强化学习领域智能体不仅要学会“看到一个状态后选一个动作”最好还能在内部学习一套环境动态模型从而在没有真实环境反馈时也能通过“想象”来规划行动。用数学一点的说法世界模型学习的是环境的状态转移概率p(s_{t1} | s_t, a_t)以及回报预测r_t ≈ f(s_t, a_t)这类模型的典型代表是 Dreamer 系列、MuZero 等基于模型强化学习算法。它们内部有一颗“世界模拟器”输入历史观测和动作输出对下一秒状态的预测再把这套预测用于规划。这套思路在游戏环境和机器人控制任务里表现很好因为环境规则清晰、物理过程一致。1.2 当前主流世界模型都在做什么今天大家讨论的世界模型已经泛化了很多方向。自动驾驶行业在构建“驾驶世界模型”输入一段路测视频后模型能够预测接下来其他车辆、行人、红绿灯的位置变化辅助规划模块做决策。视频生成领域比如 Sora、Genie 这类模型本质上是训练一个大规模的视频预测器输入文本或首帧生成符合物理规律的连续画面。很多人把它们也叫世界模型因为模型内部隐式学到了“苹果会往下掉”“水面会有反光”这类物理常识。具身智能方向也在用世界模型。机器人看到一个场景后先在大脑里推演一下“推动这个杯子杯子会倒水会洒出来”然后再决定要不要推这就是一种基于想象的运动规划。在这些场景里世界模型的对象始终是物理世界姿态、速度、碰撞、遮挡、重力、刚性形变。1.3 为什么越来越多人觉得物理世界模型不够当智能体从仿真走向真实世界尤其是进入人类社会时一个尴尬的问题出现了很多关键决策并不取决于物理状态而取决于“人脑里在想什么”。举一个开车的例子。现在自动驾驶模型可以很准确识别出“前方有行人”但它很难判断这个行人有没有看见我的车他是不是正打算闯红灯他是要过马路还是在路边等人这三种情况下完全相同的物理状态最优驾驶策略却差别很大。再比如家庭服务机器人。人类说“帮我把桌上的书拿过来”这句话本身是清楚的但机器人如果不知道用户当前正坐在沙发上、手边没有书、时间紧急那它在执行时很容易做出不合适的路径规划。这类问题不属于物理规律建模而属于心智状态推断。于是就有了一个很自然的想法能不能像建模物理世界那样给机器也建一套“心智世界模型”2. 心智世界建模 MWM 的核心概念2.1 一句话理解 MWMMWMMental World Modeling心智世界建模简单来说就是让机器不只建模“外部世界如何变化”还要建模“参与这个世界的智能体心里在想什么、知道什么、打算做什么”。这里的“智能体”可以是人也可以是与 AI 协作的另一个 AI甚至可以是机器人的未来自我。MWM 研究的是稳定的心智状态变量比如知识、信念、意图、期望、情绪并且用这些变量来预测行为、规划行动。对比传统世界模型对比维度传统世界模型心智世界建模MWM建模对象物体位置、速度、物理状态信念、意图、知识、注意力预测目标下一物理状态、下一帧画面他人下一步行为、信息需求训练信号视频帧、状态序列、奖励行为动作、语言表达、决策结果核心能力物理直觉心理理论Theory of Mind典型场景自动驾驶感知、视频生成、机器人控制人机协作、社交智能体、辅助决策2.2 MWM 要回答的核心问题从研究层面看MWM 最核心的问题是机器能否在真实环境中内部维护一组关于其他智能体心理状态的隐变量并用它完成预测与规划这本质上是一个反问题物理状态可以相对容易地通过传感器获取但心理状态无法直接观测。机器只能通过行为序列、语言、面部表情、生理信号等外部观测反推出对方内在状态。这里涉及“内隐变量推断”也就是贝叶斯式的后验推断问题。若能做好这件事AI 就不再是“看见什么算什么”而是“看见行为洞见意图”。2.3 MWM 是典型的认知科学与 AI 交叉方向MWM 不是纯工程概念它背后有很深的认知科学基础。心理理论Theory of Mind简称 ToM在心理学里研究了很多年指的是个体理解和推断他人心理状态的能力。正常发展的人类儿童大概在 4 岁左右就会获得基础心理理论比如能理解别人可以有“错误信念”。过去 ToM 研究主要靠实验心理学完成测试套路是“错误信念任务”一个小朋友看到玩具被放到 A 盒然后妈妈进来把玩具移到 B 盒之后问被试另一个没看到移动过程的人会去 A 盒找还是 B 盒找正确答案是 A 盒因为那个人不知道玩具被移动了。MWM 想做的就是把这种推理能力形式化、数字化、模型化让它成为神经网络的一部分。如果机器能够学会类似能力它就能处理大量需要理解他人误解、纠正认知偏差、帮助对方调整期望的交互场景。3. 心智世界建模的要素拆解3.1 信念、欲望与意图认知科学和智能体设计里有一个经典框架叫 BDI 模型也就是 Belief-Desire-Intention智能体持有对世界的信念Belief 有想要达成的目标Desire 并且会形成具体的行动计划Intention 意图是当前正在执行的欲望。传统智能体开发中BDI 模型用于帮助程序做决策根据内部信念选择合适意图。MWM 把它反转过来使用不只把自己的信念和意图建模还要在脑中为“其他智能体”建立一组 BDI 估计然后再用这组估计去做交互决策。举个例子。如果一个机器人和人类一起做饭正确的建模可能是Belief用户以为盐在左边柜子里。实际上盐在右边Desire用户希望尽快完成这顿饭。Intention用户可能正要去左边柜子取盐。如果机器人能建立并维护这个心智模型它可以在用户走过去之前就说“盐不在左边了我昨天放在右边。”这就是一个基于心智世界建模的干预行为物理世界模型永远学不出这种能力。3.2 递归建模我知道你知道交互场景绕不开递归认知。简单的递归层级至少包括第一层我知道环境状态。第二层我知道你知道环境状态。第三层我知道你知道我知道环境状态。真实的人机协作经常用到第二层和第三层。举个例子会议室里投影仪坏了人和机器人都知道这个事实但如果机器人不知道“用户知道投影仪坏了”它可能还要花时间检测投影仪然后给一个冗长的报错说明。而更高阶的心智建模能让机器人给出符合预期的简短回答因为它知道用户已经看到屏幕没亮了不需要再重复解释。递归建模带给机器的是“交互节奏感”它决定了信息要不要说、说到什么详细程度、用什么语气说。这正是一个初级智能助手和高级协作助手的关键差异。3.3 错误信念与反事实推理MWM 区别于传统信息检索式 AI 的地方在于它要处理“错误信念”和“反事实”。错误信念推断能力意味着机器不只用“事实正确”的方式看世界它还要理解别人心中可能有与事实不一致的模型。这就要求模型内部同时保留两条知识线事实模型真实世界状态。他者模型对方认为的世界状态。实验表明自动评估中表现很好的大模型在错误信念任务上仍然会倾向于“用自己的知识代替他人知识”把用户当成全知者。MWM 如果能把错误信念建模作为重点学习目标可以提高体感上的“人情味”。反事实推理则是问如果当初不是这样会怎样在纠正用户误解、解释历史决策、复盘错误原因等场景里反事实能力很重要。物理世界模型很难天然产生这种能力因为它预测的是既定状态的演化而不是未发生分支的推演。3.4 多智能体环境的非平稳性传统强化学习假设环境动力学是固定的但多智能体环境下其他智能体本身就在学习、在变化导致环境不平稳。MWM 可以缓解这个问题如果每个智能体都在内部建模其他智能体的动态而不只是环境动态策略就可以更快适应对方的变化。这个思路与博弈论中的 best response 建模有联系但 MWM 侧重的不是博弈均衡而是认知过程本身的学习与表征。它关心的是“对方看到信息后会不会改变想法”这类动态认知过程。4. 技术实现思路从表征到推理目前 MWM 相关内容的公开细节还比较有限不同团队可能有不同做法。下面给出的是工程上比较自然的一组实现思路帮助你理解这类系统大概怎么构建。要把它们当作概念拆解而不是某个论文的复现代码。4.1 第一步心智状态表征从工程角度看MWM 的第一步是把不可观测的心智状态变成一个“隐变量向量”。我们可以设计一个模块输入观测序列输出一个包含心智状态的向量。# 示意代码心智状态编码器 # 注意这是为帮助理解而写的最小示例并非 MWM 官方实现 import torch.nn as nn import torch class MentalStateEncoder(nn.Module): 输入智能体的一段历史观测例如行为序列、轨迹、文本 输出一个固定维度的向量用来表示该智能体当前的心智状态 def __init__(self, obs_dim64, hidden_dim128, mental_state_dim32): super().__init__() # 历史观测编码器可以先过 GRU 提取时序信息 self.gru nn.GRU(obs_dim, hidden_dim, batch_firstTrue) # 从隐藏状态映射到心智状态 self.fc_mu nn.Linear(hidden_dim, mental_state_dim) # 再加一层输出“信念/意图”读取头例如预测对方下一步动作 self.fc_action nn.Linear(mental_state_dim, obs_dim) def forward(self, obs_history): # obs_history: [batch, seq_len, obs_dim] _, h self.gru(obs_history) # h: [1, batch, hidden_dim]取最后一层 hidden h[-1] mental_state self.fc_mu(hidden) return mental_state这段代码里obs_history是观测到对方的历史行为轨迹。mental_state是模型推断出的对方的隐性心智状态。fc_action可以用于辅助预测对方下一步动作让隐变量学习到对预测有用的信息。这种思路和变分自编码器、Dreamer 里的隐状态建模很像区别在于训练目标不再是单纯预测物理状态而是同时预测对方行为、信息需求和意图变化。4.2 第二步用预测任务做自监督训练心智状态隐变量没有标签不能直接监督学习。实践中通常采用“以行为预测为主任务”的训练方式。让模型根据一段历史预测未来行为再把行为预测误差反向传播给心智状态编码器。# 示意代码训练循环核心逻辑伪代码风格 def train_step(model, batch): obs_history, future_action batch mental_state model.encode(obs_history) pred_action model.predict_action(mental_state) loss mse_loss(pred_action, future_action) loss.backward() return loss.item()这里的关键是模型预测的不是物理轨迹本身而是对方的意图性行为。比如用户的手伸向左边的柜子模型要预测的不仅是“手动坐标会变化”而是“用户想拿东西”“他以为东西在那里”“他可能会开口问”。在不同的应用里行为预测的形式不同。在自动驾驶里是预测车辆是否要让行在机器人协作里是预测用户下一步指令在对话系统里是预测用户是否会追问。4.3 第三步大模型作为先验知识库纯神经网络从头学习心智推断很困难因为它缺少人类对常识的巨大先验。一个合理路径是利用大语言模型做常识引导用大模型生成关于对方心智状态的假设作为候选解释。用视觉感知网络得到真实行为观测。由决策模块综合候选假设和观测生成最终交互策略。观测输入 → 感知编码 → 语义描述 ↓ 大模型先验 → 生成候选心智假设 ↓ 假设筛选 → 预测行为 → 规划交互动作这种方案比单一大模型直接端到端输出更可控也比纯小模型从零学习更容易落地。实际项目中大模型不需要实时参与每一步推理可以只离线段生成先验分布或者用蒸馏方式让小模型学会部分常识。4.4 四个关键模块一个完整的 MWM 工程化系统通常需要四个模块模块作用典型实现观测模型感知外界状态和他人行为多模态编码器、跟踪器心智推断模块估计他人信念、意图变分推断、GRU/Transformer 编码器预测模块预测行为、信息需求动作预测头、未来指令预测头规划模块结合预测决定下一步动作模型预测控制MPC、强化学习策略这种模块化设计的好处是即使心智推断误差较大也不影响整个系统的安全底线。预测错误时规划模块可以退回到保守策略。5. 容易混淆的概念辨析5.1 世界模型不等于视频生成模型这是当前最普遍的误解。视频生成模型学的是“像素动态”它预测的是一帧帧图像世界模型学的是“状态动态”预测的是底层状态变化例如位置、速度、事件。部分视频生成模型确实通过像素任务隐式学到了物理规则所以被很多人称为“世界模型”。但这不等于所有视频生成模型都具备世界模型能力。反过来MWM 连物理状态都不直接建模它建模的是更高层的认知状态。5.2 YOLO-World 的“World”指什么YOLO-World 是 YOLO 系列的开放词汇目标检测模型名字里的 World 更多指“开放世界词汇”意思是模型可以在没有预定义类别的情况下检测任意文本描述对应的目标物体。它和世界模型没有关系和 MWM 也没有关系。如果搜索“YOLO 世界模型”看到的很多内容其实是在讲目标检测不要被名字带偏。5.3 MWM 并不否定物理世界模型MWM 更像是物理世界模型之上的“辅助层”。一个完整的智能体既需要知道“石头砸下来会伤人”也需要知道“这个人站在那里是想躲雨不是想碰瓷”。两者互补而不是替代关系。概念核心能力输入输出混淆原因视频生成模型像素级预测文本、图片视频画面里隐含物理规律世界模型状态动态预测状态序列未来状态常与视频生成耦合YOLO-World开放词汇检测图片和文本目标框名称带 World心智世界建模 MWM心智状态推断行为、语言、轨迹意图、信念、预测行为属于广义世界模型上层6. 应用场景展望6.1 自动驾驶理解对方意图比识别物体更难自动驾驶现在已经可以识别行人、车辆、路牌但“识别”和“理解”之间还有很大距离。MWM 可以补充一件事把“预测轨迹”升级为“预测意图”。比如两辆车同时到达无信号灯路口传统预测模块会分别预测两条轨迹但这条轨迹无法回答“对方是否知道我看不见他”。MWM 让每辆车保留一个对“对方对自己的认知”的模型在博弈情景中做更安全的决策。这个方向的落地不需要一步到位。可以先在人机共驾的数据集上做离线的意图预测再逐步引入到决策模块中做负反馈也就是只在“对方可能误判我方意图”的时候启动额外干预。6.2 具身智能与家庭机器人机器人进入家庭服务场景最大的挑战不是物理环境复杂而是人太难猜。同一个“把杯子拿过来”指令对正在开会的人意味着轻轻放在手边对正在休息的人意味着不要去打扰。有 MWM 能力的机器人可以在三层粒度上理解用户动作层识别动作并执行。意图层理解用户为什么现在要这个杯子。协同层预判用户目前不便于接收机器人解释选择安静完成。这类能力对整体模型容错率要求很高初期更建议在低风险场景测试例如提醒、环境整理、备餐辅助。6.3 游戏与虚拟数字人游戏里最容易被 MWM 影响的环节是 NPC 与队友 AI。传统 NPC 的对话和行为由脚本触发缺乏对玩家心智状态的建模。如果 NPC 能感知玩家当前是否困惑、是否着急、是否有新的目标游戏体验会自然很多。对数字人行业同理。一个虚拟助手如果能判断“用户对上一句解释没有理解”它会主动换一种更直白的表达方式而不是继续把同样的内容换个语气再说一遍。6.4 个性化教育与辅助决策教育场景非常适合 MWM。学生答错题后正确的教学策略不是直接给答案而是先判断“学生错在哪一个知识点的误解上”。这本质上就是心智世界建模根据外部答题行为反推内部认知结构。辅助决策系统也可以用 MWM 解释战略建议“用户当前没有意识到风险因此需要先唤醒风险认知再推进下一步决策。”这种交互优化思路在商业决策系统中非常有价值。7. 关键技术挑战与开放问题7.1 心智状态不可直接观测物理世界建模有传感器数据、视频、激光雷达作为 ground truth而心智状态没有直接的观测设备。我们只能通过行为间接推断并且同一行为可能对应完全不同的心智状态。比如用户看了一眼冰箱可能是想喝水、想确认冰箱里有没有菜、或者只是路过扫一眼。仅从行为很难区分。这意味着 MWM 的输出天然带有不确定性系统必须学会表达“置信度”并在低置信度时主动询问而不是武断决策。7.2 数据获取与标注困境物理世界模型可以用海量无人机航拍、路测视频来训练而心智状态数据很难规模化标注。人工标注者只能通过外部行为主观推测标注对象的意图标签噪声会很大。可能的缓解方向包括设计交互性数据采集环境通过游戏或仿真收集有目标感的行为。利用大模型合成大量社会情境对话数据作为先验训练语料。设计主动学习流程只在不确定性高的时刻让人类参与修正。7.3 评估指标缺失现有的行为预测指标例如准确率、均方误差、交叉熵无法全面反映心智建模质量。一个模型可能预测行为很准但它内部使用的隐变量可能并不是真实的心智状态而是某种“表面行为模式”。这涉及表征语义对齐问题。该方向更需要引入“干预性评估”当模型有意改变对话表达方式后用户行为是否产生预期变化。只有通过干预实验才能证明模型内部维护的不是伪相关。7.4 幻觉与错误归因风险大模型加持下的心智推断模块容易出现幻觉它对用户意图给出了一个自信但错误的故事并且进一步基于这个错误故事调整交互策略。错误归因几乎没有自然纠错机制因为机器很难知道“我理解错了”。工程上需要引入回退策略当预测置信度低时回到通用保守策略。用户反馈闭环选项式确认让用户低成本修正。解释面板向用户展示“我推测你是这样想的”让错误假设暴露出来。7.5 安全与伦理边界MWM 能力越强越可能被滥用于操纵用户识别焦虑情绪后推送付费课程、识别用户认知弱势后隐瞒信息等。这要求相关模型在设计时就要考虑知情同意、透明化程度和可撤回机制。实际项目里应当遵循最小权限原则默认仅建必要的心智模型不存储长期用户画像不做心理状态微观画像避免触碰人格分析、政治倾向预测等高敏感区域。任何影响用户利益的决策都要经过合法性审查并保留用户申诉渠道。挑战具体现象可能的工程缓解不可观测同样行为不同意图输出不确定性区间必要时主动询问数据稀缺心智标签噪声大仿真环境、大模型先验、主动学习评估困难预测准但内部表征无意义干预实验、A/B 测试幻觉风险自信但错误的推断置信度门控、回退策略、解释伦理边界滥用心理信息最小权限、透明化、允许注销8. 开发者如何跟进 MWM 方向8.1 前置知识想真正理解 MWM而不是停留在概念层面建议具备以下基础概率图模型与贝叶斯推断理解后验推断、隐变量、不确定性估计。强化学习基础特别是基于模型的方法一两个世界模型的实现经验。认知心理学基础心理理论、错误信念任务、认知偏差。Transformer 与多模态模型基础能够微调大模型、理解多模态编码器。基础博弈论与递归推理了解 level-k reasoning 的基本思想。这些知识不要求全部精通但至少要能读懂论文里的数学模型和实验设计。8.2 推荐学习路线阶段一走通一个传统世界模型。先从 Dreamer 或类似的开源世界模型实现入手训练它在 gym 环境里做规划。这个阶段要掌握隐状态、动态模型、奖励预测的基本代码结构。阶段二给世界模型加入“智能体感知”。把原来的单一隐状态扩展为多隐状态每一个智能体维护一套隐状态模型在预测时分开读取。不需要大规模训练只需要利用已有底模做少量微调实验体会多智能体建模中的难度变化。阶段三做一个小型社交建模项目。选一个真实场景例如客服对话、教学系统或者机器人交互设计这样的闭环收集用户行为数据。构建心智状态标注方案。训练一个弱监督的心智推断模型。设计对应干预策略并做小范围测试。做完这个闭环对心智世界建模的实际难度就会有真实体感。8.3 工程落地建议企业项目落地 MWM 时更推荐渐进式策略。先做离线分析用历史对话数据分析“用户困惑时刻”与“用户满意率”的关系再做轻量在线模型仅在特定节点输出“用户可能没理解”不做主流程决策最后再扩展到生成式交互策略。整个过程中目标指标最好用“任务完成率”“二次追问率”“满意度”这类业务指标而不要只看模型内部误差。另外日志设计要加上“心智推断置信度”和“最终行为来源”这样出现问题时可以快速回溯定位到底是因为推断错了还是策略选错了。8.4 对概念的预期管理现阶段 MWM 更像一份研究蓝本而不是一个可以直接对标出来的成熟开源框架。不同团队的定义和实现路径可能差异很大。在跟进时不必纠结于哪个实现才是“官方”而应该抓住核心问题模型有没有在内部维护关于其他智能体心智状态的表征并且用这种表征改进预测和决策。如果一篇论文只是改了一个损失函数却没有说明中间隐变量的认知含义那它和传统行为预测模型没有本质区别如果一篇论文能让你在实验中清晰看到“机器改变了对用户心智的判断于是行为也系统性改变”那它就真正摸到了 MWM 的门槛。回到最初的问题世界模型的下一步是什么物理世界之后必然是被忽略已久的“人”。世界模型让我们学会预测石头的轨迹MWM 则想让我们学会预测人心的轨迹。物理规则写在每一个分子之间而心智规则藏在每一次行为选择里后者更难但也是机器走入真实人类生活时绕不开的一课。如果你正在做多模态 Agent 或机器人交互或许可以从一个很小的场景开始先让你的模型学会分辨用户“知道”与“不知道”。