Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited

发布时间:2026/10/5 6:46:04
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited 文章主要内容总结本文聚焦于评估大型语言模型(LLMs)对基本方向(cardinal directions, CDs)的推理能力,是对作者此前在COSIT-24会议上发表工作的扩展。研究使用一个包含5760个问题的基准数据集(由6个模板生成),测试了28个LLM(包括最新的大型推理模型LRMs)的表现。研究背景:空间推理是人类在物理世界中行动的基础,而LLMs不具备实体性,其对现实世界场景的空间推理能力有待验证。基本方向推理在导航、地理理解、气候分析等领域至关重要,因此成为研究焦点。实验设计:通过模板自动生成问题,变量包括移动方式(如步行、骑行)、人称(第一/二/三人称单复数)、方向类型(基本方向如南北、中间方向如东北)等。采用零样本提示,要求模型仅输出方向答案。主要结果:所有模型准确率均高于随机猜测(0.125),但无模型能完全可靠推理;最佳模型为o1(准确率0.92),远高于早期模型(如GPT-3.5 Turbo的0.60)。大型推理模型(LRMs)表现优于传统LLMs,且推理token使用量与难度相关(中间方向需更多token)。模型表现受人称、移动方式、模板类型影响(如线性物体模板T4准确率最低),存在性别偏向和方向混淆(中间方向更易出错)。关键发现:部分模型(如GPT-4.5)可能因训练数据包含基准集而表现异常;LRMs推理token使用量与答案正确性存在关联(部分模型