Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models

发布时间:2026/7/25 2:44:44
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models 文章总结与翻译一、主要内容本文聚焦多模态大型语言模型(MLLMs)在空间推理能力上的不足,尤其是在捕捉跨视角一致性这一3D推理关键需求上的短板,提出了一套以“视角学习(Viewpoint Learning)”为核心的解决方案,旨在激活MLLMs的空间推理能力。核心问题:现有MLLMs主要基于2D连续性数据训练,难以理解3D一致性(即物体在空间中的稳定几何关系和空间关联),导致在复杂3D推理任务中表现不佳。关键数据集:构建了Viewpoint-100K数据集,包含10万组以物体为中心的真实世界图像对(视角差异20-100度)及对应的问答对,涵盖以相机为中心和以物体为中心的平移、旋转类问题。两阶段微调策略:第一阶段(基础知识注入):基于Viewpoint-100K数据集进行监督微调(SFT),结合混合冷启动初始化(融合思维链模板与伪思维链),让模型学习视角表示并保持连贯推理能力;第二阶段(泛化能力增强):在SAT空间推理数据集上采用分组相对策略优化(GRPO)算法进行强化学习(RL),将基础视角知识迁移到复杂空间推理任务。实验结果:该方法(命名为Actial)在3DSRBench、CV-Bench、BLINK等多个基准测试中显著优于基线模型,在域内和域外任务中均实现性能提升,验证了视角学习对激活空间推理能力的有效性。