定义篇:在评价大模型的空间能力之前,先说清什么是空间能力
2026/8/25 15:30:27 网站建设 项目流程

系列第 7 篇。整个系列都在问"现在的模型空间能力到底如何"——但如果说不清空间能力是什么,这个问题就没法严肃回答。本篇不给自创答案,只做一件事:把心理学、AI 学界、产业界三方的定义摆出来,找公约数,也指出分歧。

一、心理学的答案:一个有五十年积累的概念

"空间能力"不是 AI 圈的发明。加德纳(Howard Gardner)1983 年的多元智能理论就把"空间智能"列为人类八种智能之一:在脑中形成外部世界的模型并运用它的能力。

认知科学随后把它拆得更细。目前引用最广的是 Newcombe & Shipley (2014) 的 2×2 分类:

静态动态
物体内(intrinsic:物体自身的形状、部件关系)识别形状、部件结构心理旋转、折叠想象
物体间(extrinsic:物体之间、物体与参照系的关系)位置关系、地图理解视角采择、导航

这个分类有演化依据:人类的两大空间功能——使用工具(物体内关系)和导航(物体间关系)——有各自独立的演化与神经基础(Frontiers 综述)。记住这张 2×2 表,后面会发现 AI 的考卷惊人地落在同样的格子里。

二、AI 学界的答案:从操作性定义到宏大叙事

操作性定义来自李飞飞、谢赛宁团队的 VSI-Bench(“Thinking in Space”,CVPR 2025),一句话:

视觉空间智能是"感知一个空间、记住其布局、并按需检索这些空间信息来回答问题"的能力。

它落成 3 类 8 项任务:构型类(数物体、认相对位置)、测量类(估距离、尺寸、房间面积)、时空类(回忆物体出现顺序)。

宏观定义来自李飞飞 2025 年 11 月的长文 From Words to Worlds:

“空间智能是我们认知赖以构建的脚手架”;它是"语言之外的前沿——连接想象、感知与行动的能力"。

文中给出实现空间智能的载体——世界模型——的三项核心能力:生成(造出符合几何与物理的世界)、多模态(吃下图像/视频/深度/动作)、交互(预测行动之后世界怎么变)。注意:这个定义把"行动"正式纳入了空间智能的范畴,比 VSI-Bench 的"看-记-答"宽了一大圈。

CVPR 2026 不分论文中的空间智能基准,实际上是在这两层定义之间做细化。把它们的能力拆解对齐到 Newcombe 的 2×2 表上(对齐是本文的综合,各家拆法出自论文原文):

基准能力拆解落在 2×2 的哪里
SpatialScore (2505.17012)10 大类 30 任务:计数、深度、距离、相机位姿、心理动画等四格都有,重心在物体间-静态
SenseNova-SI (2511.13719) 的 EASI 分类度量测量、空间关系、心理重建、视角采择、综合推理"心理重建/视角采择"即物体内-动态、物体间-动态
OpenBench (2512.19683)三层级:关系推理→度量推理→运动学推理从静态到动态的难度阶梯
SpatialSky (2511.13269)无人机 13 子能力:高度感知、可降落判断等物体间两格的领域特化

收敛点很清晰:AI 的考卷没有发明新的空间能力概念,它在逐格填认知科学的表——而且填到"动态"两格(运动、视角变换)时,模型成绩最差。

三、产业界与常识的答案:一个应用台阶

李飞飞长文同时给出了产业视角的能力台阶(也是她创办的 World Labs 的路线图):

  1. 现阶段——创意工具:生成空间一致的 3D 世界(其 Marble 平台已面向创作者);
  2. 中期——机器人:感知-行动循环,对应自动驾驶、具身智能的现实需求;
  3. 长期——科学、医疗、教育:以空间精确性做仿真与推理。

常识层面的空间能力——认路、停车入位、看图组装家具、打包行李箱——恰好分布在这个台阶的底部,而它们对应的机器能力(导航、度量、操作规划)正是目前考卷上分数最低的部分。

四、综合:一个有出处的工作定义

三方对比之后,共同点与分歧如下。

共同点(三方都包含):

  • 感知空间结构(物体的形状与位置关系);
  • 在心中表征与变换它(记忆布局、心理旋转、换视角想象);
  • 依据它输出判断(定性关系与定量度量)。

分歧点(决定你怎么评价现状):

  • 要不要包含"行动"?VSI-Bench 式的操作定义不含,李飞飞的宏观定义和整个机器人产业含。
  • 要不要包含"生成"?世界模型定义把"造出一个物理一致的世界"算作空间智能的一部分;评测类论文几乎都不考这个。

所以本系列的贯穿问题,严格说要拆成三问,答案各不相同:

  1. 感知与表征层(2×2 的静态格):模型勉强及格,但掺着语言先验的水分(评测篇的盲测证据);
  2. 变换与度量层(2×2 的动态格 + 测量):普遍不行——原文的措辞是,最先进的多模态模型在估计距离、朝向、尺寸上"很少比瞎猜好"(“rarely perform better than chance”);
  3. 行动与生成层:模型几乎空白,靠外挂系统在补(Agent 篇),世界模型路线刚起步。

一句话版本:按最窄的定义,模型能答对多数定性判断题,但结果不稳定、定量估计大多失败;按李飞飞的完整定义(包含行动与生成),它还在起点附近。这也是为什么"空间智能是 AI 下一个前沿"这个判断,2025 年由李飞飞提出(TIME 也刊发了此文),2026 年就变成了 CVPR 上几百篇论文的集体行动。

五、延伸思考(个人观点,非文献结论)

把上文各家的能力拆解并排看,会发现它们都绕着同一组要素转,而这组要素恰好接近知识工程里"本体"(ontology)这个专有概念的构成:对象(物体)、属性(长宽高、形状、颜色)、关系(上下左右这类空间关系)、动作(移动、旋转、交互)。空间智能的考题,几乎都是在这四个要素上出的:认对象是感知,估属性是度量,判关系是空间推理,预测动作后果是交互。

照这个视角,"让模型获得空间智能"与"让模型内化一个关于物理世界的本体"可能是同一件事的两种说法——评测在检查本体的每个要素是否齐全,注入在把要素写进模型,世界模型在让整个本体能随动作演化。至于认知科学四格表里的"动态"格(心理旋转、导航)是否能严格对应到"动作+关系"的组合上,这一步推得比较远,可能是过度联想,仅记录为待检验的想法。


引用来源

  • Fei-Fei Li, From Words to Worlds: Spatial Intelligence is AI’s Next Frontier, 2025-11(TIME 版本;中文译介:量子位)
  • Yang et al., Thinking in Space: How MLLMs See, Remember, and Recall Spaces (VSI-Bench), CVPR 2025(代码开源)
  • Newcombe & Shipley, Thinking About Spatial Thinking: New Typology, New Assessments, 2014;2×2 分类实证检验
  • Gardner, Frames of Mind: The Theory of Multiple Intelligences, 1983
  • 本语料内:SpatialScore (2505.17012)、SenseNova-SI (2511.13719)、OpenBench (2512.19683)、SpatialSky-Bench (2511.13269)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询