Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
2026/7/25 2:44:33 网站建设 项目流程

文章总结与翻译

一、主要内容

本文聚焦多模态大型语言模型(MLLMs)在空间推理能力上的不足,尤其是在捕捉跨视角一致性这一3D推理关键需求上的短板,提出了一套以“视角学习(Viewpoint Learning)”为核心的解决方案,旨在激活MLLMs的空间推理能力。

  1. 核心问题:现有MLLMs主要基于2D连续性数据训练,难以理解3D一致性(即物体在空间中的稳定几何关系和空间关联),导致在复杂3D推理任务中表现不佳。
  2. 关键数据集:构建了Viewpoint-100K数据集,包含10万组以物体为中心的真实世界图像对(视角差异20-100度)及对应的问答对,涵盖以相机为中心和以物体为中心的平移、旋转类问题。
  3. 两阶段微调策略
    • 第一阶段(基础知识注入):基于Viewpoint-100K数据集进行监督微调(SFT),结合混合冷启动初始化(融合思维链模板与伪思维链),让模型学习视角表示并保持连贯推理能力;
    • 第二阶段(泛化能力增强):在SAT空间推理数据集上采用分组相对策略优化(GRPO)算法进行强化学习(RL),将基础视角知识迁移到复杂空间推理任务。
  4. 实验结果:该方法(命名为Actial)在3DSRBench、CV-Bench、BLINK等多个基准测试中显著优于基线模型,在域内和域外任务中均实现性能提升,验证了视角学习对激活空间推理能力的有效性。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询