
GeoReason让遥感大模型不仅“答对”还要“推得对”当前不少遥感视觉语言模型已经能够生成思维链但会写推理过程并不代表模型真的在推理。例如模型可能在分析中声称“停车区域已经接近饱和”最终却选择“停车区域较为空旷”这一正确答案。此时答案虽然正确但推理过程与答案明显矛盾。GeoReason 将这种现象称为逻辑幻觉或伪推理。因此GeoReason 关注的不只是答案准确率而是希望模型做到基于正确的视觉证据通过合理的推理过程得到最终答案。GeoReason-Bench从检测标注构造推理数据作者首先构建了 GeoReason-Bench其中包含 4,000 条遥感推理轨迹图像主要来自 DOTA 和 DIOR。与普通视觉问答数据不同GeoReason 会利用目标检测标注提取更加丰富的结构信息包括目标数量、尺度、方向、间距、密度和排列方式。例如飞机之间的距离和停放密度可以用于估计停机坪容量建筑物的排列结构则可以辅助判断住宅区、工业区或物流区域。随后作者将这些几何信息与视觉语言模型生成的全局场景描述结合再使用 GPT-4o 合成完整的推理过程和答案。数据被分为两部分1,000 条感知与逻辑数据用于监督微调3,000 条选择题形式的演绎推理数据用于强化学习。两阶段训练CoT-SFT GRPO第一阶段采用 CoT 监督微调让模型学习按照固定格式输出推理过程和最终答案。这一阶段可以让模型“学会写推理”但无法保证推理内容真的支持最终结论。因此作者在第二阶段引入 GRPO 强化学习并提出了一个关键奖励Logical Consistency Reward即逻辑一致性奖励。它的实现方式很直接随机打乱选择题的选项顺序。模型首先针对原始问题生成推理过程和答案。随后系统保持原来的推理过程不变只打乱选项再要求模型重新选择。如果模型真正依据自己的推理作答那么无论正确答案位于 A、B、C 还是 D它都应该选择语义相同的选项。反之如果模型只是依赖选项位置或统计捷径选项顺序变化后就可能出错。因此GeoReason 的奖励同时关注最终答案是否正确输出格式是否规范推理过程与答案是否保持一致。实验结果论文以 Qwen2.5-VL-7B 为基座模型并使用 LoRA 进行训练。方法推理准确率Qwen2.5-VL23.86% CoT-SFT31.93% 标准 GRPO36.49% 逻辑一致性奖励43.51%完整 GeoReason 的平均准确率达到 56.20%。消融结果表明普通 GRPO 可以提升模型“答对”的能力而逻辑一致性奖励进一步改善了推理过程与答案之间的对齐。总结GeoReason 最重要的启示是思维链的存在并不等于模型具备真实推理能力。它通过选项重排检查模型是否真正依据自己的推理作答为遥感多模态模型的可靠推理提供了一种简单且具有针对性的训练方法。不过这种方法主要适用于选择题并且更关注“推理—答案一致性”还不能完全保证推理过程与图像证据一致。未来更完整的研究方向应进一步实现视觉证据 → 推理过程 → 最终答案