从坐标到画图:Agentic空间认知评估如何重新定义大模型空间智能

发布时间:2026/8/30 3:49:19
从坐标到画图:Agentic空间认知评估如何重新定义大模型空间智能 最近浙大提出的 Agentic 空间认知评估框架让我重新想了一个问题为什么我们总是习惯让大模型用“坐标”来证明自己懂空间你给模型一张室内图片它精准地告诉你沙发在茶几的左边垃圾桶在门边。你觉得它的空间认知很强。可一旦换一个任务让它在房间里规划一条从沙发走到门口还避开垃圾桶的路线或者把房间布局“画”出来它可能就完全乱了。问题到底出在哪我更愿意把这个问题理解为我们一直在用一种很别扭的考法去测一种很底层的智能。而“让生成式模型画出来而不是让 LLM 报坐标”这个思路恰好点中了要害空间智能不能被压缩成一个数字坐标它更应该是一个可以在环境中操作、验证、可视化的过程。1. 让模型输出坐标真的测出了空间智能吗很多人做空间能力评测时第一反应都是让模型输出目标位置坐标或者让模型从几个选项里选出“A 在 B 的左边还是右边”。这类任务不是不行只是它太容易让你产生“模型已经懂了空间”的错觉。1.1 坐标评测为什么会让你“误以为很强”坐标本质上是一个符号系统。模型只要学会从输入图像映射到输出数值哪怕它内部并没有建立真正的空间关系也能在评测里拿到不错的分数。举个例子一张桌子上放着一个杯子你让模型输出杯子的中心坐标。模型可能输出了 (412, 387)而真实值是 (415, 390)。从数值上看非常接近可以算对。但模型真的理解“杯子在桌子偏左区域”吗不一定。它可能只是学了一种图像到数字的回归规律并不知道杯子和桌子的边界关系、前后遮挡关系、与周围物体的相对位置。更麻烦的是很多坐标评测任务只有“数值接近”一个评分维度。这样一来模型完全可以在一种模糊的、统计意义上做对而不需要构建一个稳定的空间表征。你看到的是“空间认知不错”实际上它可能是“数值回归练得不错”。1.2 语言化空间评测的三个天然缺陷如果评测任务再退一步变成“请描述物体的相对位置”又会出现新的问题。我归纳为三个天然缺陷。第一语言坐标是低维压缩。空间是连续的、有拓扑结构的一个物体的位置至少要包含方位、距离、朝向、遮挡关系、与其他物体的邻接关系。但一句“杯子在桌子左边”把所有这些信息压成了一个二元方向判断。模型说的左到底是视觉左还是屏幕左还是以观察者朝向为基准的左语言天然消除不掉这种歧义而评测还很难察觉。第二语言答案容易被上下文和共现知识带偏。大模型在训练时看过大量图文数据对于“杯子在桌子旁边”“门在墙边”“人在椅子前面”这类常见空间描述已经形成了很强的统计先验。你问它“椅子通常在哪里”它甚至不需要看图像都有可能答个大概。这样很多空间关系题根本测不出模型对当前图像的理解。第三缺少动作和反馈。语言评测是单向的模型给出答案评测者判断对错。但空间认知最大的特点在于可操作性。如果你知道物体在哪里你应该能走过去、够到它、避开它、把它放在正确的位置。而传统坐标题和方向题完全不涉及这种“行动闭环”。所以坐标评测更多是在测“模型能不能把空间信息翻译成一个符号答案”而不是“模型能不能在空间里完成一个目标”。这正好解释了为什么很多模型在 VQA 空间题上分数不低但一旦进入机器人控制、具身导航、场景布局生成这类真实任务就全线崩溃。2. Agentic 空间认知评估换掉“坐标”让模型把空间画出来浙大提出的这个 Agentic 空间认知评估框架之所以值得认真看是因为它换了一个评测范式不强迫模型输出坐标而是让模型作为一个智能体在空间环境中行动并用生成式的方式把空间认知外化出来。2.1 什么是“Agentic”在这个框架里的含义“Agentic”这个词最近在 AI 圈里被反复提从 Agentic RAG 到 Agentic AI核心意思都是让模型从“一次回答问题”变成“连续完成任务”。在这个空间认知评估框架里Agentic 的含义是模型不再是一个答题器而是一个处在空间环境里的行动者。它不是每轮都输出一个“坐标”而是要做出一系列决策。比如给你一个房间模型要先确认自己的位置再选择一个方向前进遇到障碍物要绕开最后到达指定目标。这个过程中模型是否具备空间认知会体现在它的动作序列、轨迹、最终结果里。这个思路很重要因为空间认知本来就不是一个静态的知识点。我们人类判断一个人认不认路不是让他背地图坐标而是让他从 A 走到 B。走不走到路上有没有绕远遇到岔路怎么选择这些才是真正可验证的认知结果。2.2 从“说坐标”到“画空间”到底改变了什么框架里的“画”字我理解并不是字面上的美术绘画而是广义的生成式表达。模型需要产出一段路径、一张地图、一个布局草图、一组遮挡关系可视化结果。只要这个输出是空间结构的完整外化而不是一个孤立的数字就可以算作“画”出来。这改变了三件事。第一空间关系的表达不再被压缩成方向词。模型要生成长序列就必须把全局空间信息和局部关系组织在一起。你画布局图时必须同时考虑桌子、椅子、门、窗户之间的相对位置任何一个冲突都会让结果失真。这样每一项输出都更接近真实的空间结构化表达。第二模型的每一步可以接受环境反馈。Agentic 意味着交互模型可以走一步、看一眼、再走一步。如果空间认知有偏差错误会在中途暴露出来。这是坐标评测难以做到的坐标题只给结果但 Agentic 评估能看到过程。第三自动评分变得有据可依。坐标题的评分只能看数字是否接近。而生成式空间表达可以用结构一致性、路径可达性、障碍碰撞率等指标来评分这些指标更贴近真实任务。所以我更愿意把这个框架的本质理解为不要用符号去套空间而要用任务去逼空间。让模型在一个微型环境里用行为证明它对空间的理解。维度传统坐标评测Agentic 空间认知评估输出形式数字坐标、方向词动作序列、生成轨迹、布局图核心能力要求图像到数值的回归多步决策、空间关系结构、生成能力评分方式坐标误差、方向正确率路径可行性、布局一致性、多步连贯性是否可交互通常无交互每步行动可获得反馈对模型的要求纯文本或基础多模态多模态理解 生成 行动规划这种对比不是为了贬低坐标评测而是想说明坐标评测适合做基础筛选但不足以支撑对空间智能的深度判断。3. 一个可参考的评估流程任务设计、模型输入、评分指标如果你也想尝试类似的空间认知评估可以沿用一套最小可运行的流程。它不需要一开始就搭一个复杂三维引擎2D 场景、网格环境、离散动作就足够了。3.1 任务类型怎么拆空间认知不是一个单一能力它至少可以拆成几个不同的子能力。评估框架要想有效应该分开测。路径规划任务是让模型从起点走到目标点中间有障碍物。模型需要理解地图、判断障碍物边界、规划可行路径。场景布局重建任务是输入一个房间的描述“沙发在床的左侧窗户在床的对面”让模型生成或摆放一个符合描述的 2D 布局图。模型必须把语言关系转化成空间关系。相对方位推理任务不只是让模型说“左/右”而是让模型在生成结果中体现这些关系。比如画一张俯视图标出多个物体的位置然后判断遮挡和邻接关系是否合理。多步导航任务更适合体现 Agentic 特点模型每次选择一个动作环境返回新的观测模型根据新观测继续决策直到到达目标。这类任务跟真实机器人的导航流程很接近。3.2 输入和环境怎么搭我这里给一个非常常见的示例结构不绑定具体实现。你可以用它作为自己搭建评测环境的起点。class SpatialEnv: def __init__(self, grid_map): self.grid_map grid_map self.agent_pos self._find_start() self.goal_pos self._find_goal() def reset(self): self.agent_pos self._find_start() return self._get_obs() def step(self, action): new_pos self._move(action) if self._is_collision(new_pos): reward -1 done False elif new_pos self.goal_pos: reward 1 done True else: reward 0 done False self.agent_pos new_pos return self._get_obs(), reward, done def _get_obs(self): # 返回包括当前位置、局部视野、目标方位等信息的表示 return self.grid_map, self.agent_pos, self.goal_pos这不代表任何一个具体项目的源码而是说明一个通用结构。实际使用时你需要根据评估目标来定义状态表示、动作空间和奖励函数。如果模型本身是文本生成模型你可能还需要把图像或地图转成文本描述如果是多模态生成模型可以直接输入视觉观测。动作空间可以很简单用离散动作就够了ACTIONS { up: (-1, 0), down: (1, 0), left: (0, -1), right: (0, 1) }这样的环境成本低、可控性强适合做第一轮模型能力扫描。3.3 评分指标建议怎么设计很多人习惯在评测结束后只算一个“任务成功率”但那样信息太粗。我更建议把指标拆成多层。第一层是任务级指标。比如路径规划任务是否到达目标点布局生成任务是否满足所有空间约束。这一层只能看最终结果适合快速排序。第二层是过程级指标。比如路径是否碰撞了障碍物、是否走回头路、动作序列是否存在无效重复。过程级指标能判断模型是不是“碰巧到达”还是真的有空间推理能力。第三层是一致性指标。同一场景变换初始位置、障碍物布置后模型的表现波动是否大。如果模型换一个开局就完全失败说明它并没有形成稳定的空间表征只是在记忆特定配置。我建议优先记录这三种指标而不是只盯成功率。只有把过程指标纳入评估才能区分“做对了”和“真懂了”。4. 真正落地时会遇到哪些麻烦这个评估思路听起来合理实际落地时并不是一帆风顺。如果你马上想复现一个类似的评测下面这些坑大概率会遇到。4.1 生成结果不确定性带来的判定难题生成式模型有一个特点同样的输入每次输出都可能有差异。如果你的任务要求模型画出布局图那两次生成之间的像素点不会完全一样。你拿什么标准来判定“对”或“错”我的建议是不要把评分锚定在像素级别。空间认知评估更关心的是结构关系而不是亮度、颜色、纹理。比如你让模型画一张俯视图你应该判断床是不是在沙发的左边而不是判断线条有多平滑。这意味着你需要一个“结构提取器”把生成结果转成空间关系描述然后再和标准答案比对。具体实现可以用规则检测可以先检测物体边界框再计算相对位置关系也可以用视觉语言模型辅助校验。无论哪种方式都要先定义清楚“哪些结构错误是致命的”。比如物体方向反了、相对方位错了这是严重错误线条稍微弯曲一点不算错误。注意不要一上来就做像素级比较。除非你明确测的是视觉质量否则空间认知评测的核心是结构不是画工。4.2 多步交互和多模态输入带来的稳定性问题Agentic 评估一旦引入多步交互错误就会累计。模型可能在第一步就走错之后所有步都无效。你会看到模型在同一个地方反复打转或者路径出现大幅绕行。排查这类问题时要按链路走先看现象是完全无法起步还是中途迷路还是最后一步偏离目标再看输入图像分辨率是否足够、周围环境信息是否完整再看动作空间上下左右是否和地图坐标方向对齐再看生成参数温度太高会导致动作随机性过大采样次数太少又可能让模型过于贪婪最后看评分逻辑失败的判定条件是不是过于敏感。如果你在做多模态输入还要检查图像和文本的对齐程度。有的模型对高分辨率图理解更好缩略图会丢失空间细节。这会影响最终的轨迹和布局生成能力。4.3 先跑通再扩大样本的工程化建议不管你要评估哪个模型我都建议遵循“小样本跑通、中样本调参、大样本统计”的顺序。先用 5 到 10 个场景人工肉眼检查模型输出。你知道正确路径和布局应该长什么样模型输出哪里有错一目了然。这个阶段不要追求自动化评分先把流程走通。然后扩到 50 个场景左右跑一批数据统计任务成功率、路径碰撞率、布局约束满足率。这个阶段的主要目的是发现评分逻辑里“误杀”和“漏判”的情况及时修正指标定义。最后再扩到几百个场景。这时才开始考虑并行跑任务、保存日志、记录每个场景的中间动作序列、生成图像和最终评分。真正长期使用这套评估流程时别忘了记录“每个任务失败在哪一步”。很多模型不是全错而是在某类障碍物或某种空间关系上系统性失败。只有把失败位置记录下来你才能定位到模型的能力短板。5. 空间智能评测的长期意义评测方式决定模型成长方向这个框架的表面价值是提供了一种新的空间认知评测方法但深层价值可能更大它改变了模型应该往哪个方向进化。5.1 评测不该是一张考卷而是一个交互环境传统评测像一张考卷模型面对一列问题逐个作答。空间智能却是在动态环境里展现的更像是在“生活”里被检验。你要求模型输出坐标模型就会去优化数字回归能力你让模型在环境里做决策、生成场景、规划路径模型才会去学习真正可用的空间表征。这也提示我们如果一个任务只测“说对”那模型就只会变得“能说”。如果评测任务包含“做对”模型才会被逼着发展“能做”的能力。Agentic 空间认知评估框架把“行动”和“生成”放进评测本质上就是在对模型提出更高要求别只是复述空间请使用空间。5.2 对普通开发者来说这个方向意味着什么即使你不研究空间智能这个思路也有参照意义。以后你接入多模态模型时可能会看到越来越多类似的空间能力体检报告。上面不再只有 OCR 准确率、VQA 分数还会有路径规划成功率、布局约束满足率、多步一致性等指标。你需要知道这些指标是如何测出来的才能判断模型是否适合自己的场景。比如你做的是室内设计工具那你关注的是布局生成和空间约束如果你做的是巡检机器人那你关注的是路径可行性和避障能力。同样都是“空间智能”不同任务的评测重心差别非常大。浙大这个框架的启发是与其相信一个笼统的模型总分不如自己做一个小型交互式评估把模型放进目标场景里看它到底会不会“用”空间。你可以从一个小实验开始找一个简单的二维网格场景让多模态大模型生成从起点到终点的路径或者生成一张满足几个相对位置约束的布局图。先不用做完整框架只需对比一下“模型口头描述空间”和“模型实际生成空间”之间的差距。多数时候你会发现这中间隔着的不止是一个坐标的输出格式而是一种真正的认知能力。空间智能的评测真正的难点不是让模型答对更多题而是设计出一个能逼出“真理解”的交互环境。让模型去画、去走、去布局、去试错再通过过程和结果判断它到底懂没懂这应该成为下一代模型能力评估的一个重要方向。