这次我们来看一个比“新模型上线”更值得讨论的命题:DeepMind 创始人 Demis Hassabis 在公开场合多次提出,AI 正在从“记住数据”走向“理解世界”。这句话在国内 AI 社区和 CSDN 的讨论热度一直很高,因为它不只是一条新闻,更是一个技术路线判断:大模型是不是真的产生了对世界的内部表征?我们离 AGI 究竟还有多少关键环节没有打通?
这篇文章不打算做逐字访谈转写,而是把“AI 开始理解世界”这个判断拆成可讨论的技术问题:当前大模型具备哪些能力,和 AGI 还差在哪里,哪些能力已经有可验证的评测方法,哪些仍然属于研究假设。内容会保持工程视角,尽量把虚的讨论变成可以落地的评估思路和观察清单。如果你平时做 AI 应用开发、模型部署、AI Agent 相关工作,或者只是关心大模型和 AGI 进展,这篇文章可以直接收藏。
1. AGI 议题速览
先把讨论范围列成一张表,方便读者判断这篇文章是否值得继续读。
| 议题 | 说明 |
|---|---|
| 讨论对象 | “AI 开始理解世界”这一判断背后的技术依据,以及 AGI 距离的公开分歧 |
| 技术关注点 | 大模型推理能力、世界模型、多模态对齐、AI Agent 长程任务、评测体系 |
| 涉及模型类型 | 大语言模型、多模态大模型、强化学习智能体、AI 编程与图像视频生成模型 |
| 当前可观察现象 | 模型能完成复杂推理、跨任务迁移、多模态理解和 Agent 工具调用 |
| 主要瓶颈 | 训练数据墙、算力与能耗、评测体系不完善、模型可解释性不足 |
| 可落地验证方法 | 基准测试、能力涌现评测、隐空间表征分析、长程任务日志回放 |
| 适合读者 | 算法工程师、AI 应用开发者、技术决策者、关注 AGI 进展的从业者 |
需要先说明一个边界:本文不涉及具体未被确认的内部信息,只使用公开访谈、公开论文和通用技术经验。很多结论属于行业共识或研究推测,在正文中会用“从公开讨论看”“按当前技术趋势判断”这类表达区分事实与判断。
2. “理解世界”在技术层面到底指什么
Hassabis 所说的“理解世界”,在深度学习领域有一个对应的技术问题:模型在训练完成后,内部是否形成了对数据背后客观规律的表征,而不只是记住了输入输出的统计关联。
大语言模型的原理本身是“下一个 token 预测”,本质上是在海量文本上学习条件概率。但近几年的研究发现,模型虽然以统计方式训练,内部却会出现一些类似“线性表征”的结构。例如模型可以学会把词义映射到隐空间中的方向向量,某些方向对应性别、时态、情感等概念。更进一步的实验表明,模型在处理空间关系、物理常识、游戏环境时,能够在隐空间建立与真实环境较为一致的坐标映射。这就是“理解世界”这一说法的重要技术基础:模型内部可能不是为了死记硬背,而是为了更高效地建模数据生成过程,才发展出了世界模型式的表征。
这也是为什么 2024 年以来,很多实验室开始关注“模型隐藏表征”的研究,而不是只看最终任务得分。如果你在一个分类任务里只观察到模型输出正确,你无法判断它是记住了训练样本还是学到了规律;但如果你能进入模型的隐空间,观察它对不同测试样本的内部激活模式,就能更接近真相。
从这个角度看,“AI 开始理解世界”和“AI 具备意识”是两回事。前者是可检验的内部表征问题,后者涉及主观体验,目前还没有可靠的技术实验方法。我们在讨论 AGI 时,应该先把这两件事分开。
3. 当前大模型离 AGI 还有多远:从能力维度看
3.1 语言与逻辑推理
大语言模型在语言任务上已经非常接近人类水平。法律文本改写、代码生成、技术文档写作、数学竞赛题解答,这些能力在真实工作中已经具备实用价值。AI 编程工具甚至已经成为许多工程师的标准工作流,AI 智能体也开始承担自动写代码、自动跑测试、自动提 PR 的任务。
但语言能力接近人类不等于推理能力接近人类。模型在复杂多步推理、反事实推理、需要严格因果逻辑的任务上,仍然会出现系统性错误。尤其在信息不完整、需要主动澄清条件、需要区分相关性与因果性的场景下,模型很难稳定保持正确。推理能力的差距是 AGI 距离讨论中最难量化、也最影响实际应用的部分。
3.2 规划与长程任务执行
AGI 非常重要的一环是规划能力:面对一个需要多步骤执行、跨长时段、可能遇到环境反馈的任务,模型能否自己把目标拆解成子任务,并根据中途反馈调整计划。
当前基于大模型的 Agent 已经能完成简单的多步任务,例如让 AI Agent 访问网页、调用搜索、读取文档、生成回复。但在任务步数超过几十步、环境反馈稀疏、子任务之间需要严格依赖时,错误会累积,模型通常缺少“我走到哪一步了、哪些步骤已经失效、是否需要回退”的自我监控能力。
长程任务能力是当前从“大模型”走向“AGI”最明显的短板之一。很多团队发现,推理能力很强的模型放到真实 Agent 工作流里表现并不稳定,核心原因正是规划与错误恢复不足。
3.3 多模态感知与世界感知
多模态 AGI 是最近讨论非常密集的方向。现在的模型已经能同时处理文本、图像、音频、视频,用户可以直接上传一张截图让模型分析 UI 结构,上传一段语音让模型转写并总结。多模态对齐技术让模型在不同信息形式之间建立统一语义空间,这是“理解世界”的一个重要基础。
但需要区分的是:多模态输入不等于物理世界感知。模型能识别图片里的杯子,不等于它理解杯子在真实物理环境中的重量、材质、运动状态。业界对此有过不少实验:模型对静态图片描述表现很好,但在涉及物体数量、空间位置、连续动态变化的测试中会出现明显错误。所以更稳妥的判断是:模型建立了“跨越模态的符号理解”,但还缺少“与真实物理世界持续交互”的能力。
3.4 自主目标与数据获取
最后是数据和目标的问题。人类学习依靠与真实世界持续互动,可以用低样本快速学会新技能;当前大模型主要靠静态数据训练,无法在训练完成后主动向环境提问、设计实验、收集新数据来弥补知识盲区。
即使加入强化学习,模型的学习范围也限制在奖励函数设计的框架内。比如下棋 AI 可以在明确规则的空间里超越人类,但在开放、模糊、需要自己定义目标的真实任务中,模型并没有表现出很强的自主性。数据获取能力不足,会直接限制模型向 AGI 靠近的速度。
4. 验证一个模型是否具备“世界理解”的评估方法
与其争论“AI 是否理解世界”,不如直接设计一套可操作的验证流程。下面是适合开发者和算法工程师落地的评估思路。
4.1 任务设计思路
评估“世界理解”不能只看单一任务的准确率,至少应该覆盖四个维度:
- 泛化测试:模型在一个分布下训练,在另一个分布下测试,观察是否真的学到规律。
- 反事实测试:修改任务条件为不会出现在训练集中的情况,看模型能否正确推断。
- 长程稳定性:让模型执行多步任务,观察错误率是否随步数增长。
- 表征分析:提取模型内部激活,判断是否存在与任务结构一致的线性表征。
以一个二维房间导航任务为例,可以这样设计:先让模型阅读房间描述,再问它“从 A 点走到 B 点会不会经过 C 区域”。如果模型只背过训练语料,它会在新房间布局上表现明显下降;如果模型学到空间结构,则能泛化到从未见过的房间数据。
4.2 最小评估流程的代码示例
下面给出一段 Python 伪代码,用于搭建一个最小评估流程。实际使用时需要替换成目标模型的 API 或本地部署接口。
# 最小能力评估示例:泛化与反事实测试 import json tasks = [ { "type": "in_distribution", "context": "房间 A、B、C 按一字排列,A 在最左,C 在最右。", "question": "从 A 走到 C,会经过 B 吗?", "answer": "会" }, { "type": "counterfactual", "context": "房间 A、B、C 按环形排列,A 与 C 直接相邻。", "question": "从 A 走到 C,最短路径必须经过 B 吗?", "answer": "不必" } ] def evaluate_model(model_predict): results = [] for task in tasks: response = model_predict(task["context"], task["question"]) results.append({ "type": task["type"], "correct": response.strip() == task["answer"], "response": response.strip() }) return results # 使用方式:将 model_predict 替换为真实模型调用函数 # results = evaluate_model(my_model_predict)这段代码的核心思想是:把“理解”测试拆成分布内、反事实、长程三类样本,按类别统计准确率,而不是给一个笼统的分数。如果反事实样本准确率明显低于分布内样本,说明模型更多依赖统计捷径而非稳定规则。
4.3 隐空间表征的可视化分析
如果需要更接近研究层面的验证,可以分析模型内部激活。常见方法是用 PCA 或探针分类器检查模型隐向量中是否包含任务相关信息。
# 提取模型隐向量并做线性探针分析(示意) import numpy as np from sklearn.decomposition import PCA from sklearn.linear_model import LogisticRegression # hidden_states: 列表,每个元素是模型对一条样本的隐层输出 # labels: 对应该样本的目标标签 hidden_matrix = np.array(hidden_states) pca = PCA(n_components=2) projected = pca.fit_transform(hidden_matrix) probe = LogisticRegression() probe.fit(projected, labels) print("Probe Accuracy:", probe.score(projected, labels))如果探针准确率较高,说明模型隐空间里已经包含可分离的任务信息;如果探针准确率低但任务输出正确,说明模型可能用了其他路径解决任务,这种情况同样值得关注。
4.4 长程 Agent 任务的日志设计
对 AI Agent 类系统,建议在评估时记录完整轨迹回放数据。
{ "task_id": "task_001", "task": "在测试环境部署服务并返回健康检查地址", "steps": [ {"step": 1, "action": "read_docs", "duration_ms": 200}, {"step": 2, "action": "run_command", "output": "pytest passed"}, {"step": 3, "action": "deploy_service", "output": "http://127.0.0.1:8080/health"} ], "error_recovery": 1, "final_status": "success" }通过日志可以清楚看到模型在哪里出错、在哪里恢复、哪类任务需要人工干预。这样可以把“Agent 是否智能”的抽象问题转成具体的工程指标。
5. 算力与工程约束:AGI 不只是算法问题
即使算法路径正确,AGI 的实现还面临非常现实的算力和数据约束。
大模型的训练需要大规模 GPU 集群,训练一次前沿模型需要数万个加速卡级别的计算资源;推理侧的成本同样不低,支持长上下文、高并发、多模态推理的在线服务需要持续投入硬件。对绝大多数团队来说,真正的问题不是“模型能不能做到”,而是“在成本可控的前提下能不能稳定做到”。
数据也是关键瓶颈。高质量公开文本数据正接近耗尽,业界开始用合成数据、多模态数据和用户反馈数据来补充。但合成数据可能导致模型偏差累积,多模态数据来自真实世界采集,又涉及隐私和版权。2024 年以来,很多模型厂商的主要投入都集中在数据治理和版权合规上,这说明数据问题已经从研究问题变成了商业问题。
工程侧还需要关注模型部署的高可用性:分布式推理、容错调度、显存优化、批量任务队列、API 负载均衡。除非模型能直接在个人单卡上实时运行,否则任何 AGI 能力都依赖底层系统工程。这也是为什么“AI 模型部署”“AI 工程实践”成为当前行业热门岗位方向。
6. 不同观点的分歧:为什么有人说几年,有人说几十年
关于 AGI 距离的公开判断存在很大分歧,这些分歧本质上来自对不同能力的权重不同。
乐观派认为,当前模型已经在语言、图像、代码、推理等多个维度接近人类基线,只要继续扩大模型规模、增加交互数据和强化学习,AGI 可能在数年内出现。Hassabis 在多个公开访谈中给过“可能在一个十年内”这一量级的估计,DeepMind 团队的工作也一直在推进世界模型、多智能体、规划能力等方向。
中间派认为,当前模型只是“非常优秀的联想引擎”,在真实世界持续交互、自主目标设定、长期记忆、低样本适应等方面仍远未达到通用智能标准。即使某些单项能力超过人类,也不代表整体系统具备通用性。他们倾向认为 AGI 需要新的架构突破,而不是现有范式的简单放大。
怀疑派则认为,大语言模型本质上是在拟合文本分布,无法产生真正的世界理解;如果不变更底层建模方式,AGI 可能几十年内都无法实现。这种分歧不是谁对谁错的问题,而是对“什么才算 AGI”的定义不同。工程团队更应该关注的是可测量的能力项,而不是时间点预测。
7. 开发者应该怎么跟进 AGI 进展
对普通开发者和技术团队而言,与其争论 AGI 何时到来,不如建立一套可长期使用的跟进机制。
第一,持续跟踪权威评测基准。语言推理、多模态理解、Agent 任务、编程能力等方向都有公开榜单。不要只看模型宣传稿里的演示,要关注模型在第三方基准上的表现,尤其是长文本、多步推理、抗幻觉类任务。
第二,建立自己的业务能力基线。选择几个和业务最相关的任务,用固定测试集长期评测模型版本变化。模型升级时,先跑回归测试再决定是否切换,避免个别能力上升但整体稳定性下降。
第三,把 AI Agent 当成主线方向。AGI 的落地形态大概率不是“一个超大模型”,而是多个模型 + 工具调用 + 工作流编排的组合系统。多关注 AI 智能体框架、工具调用协议、任务规划与错误恢复机制,这些能力在未来比模型参数量更重要。
第四,关注 AI 应用开发的合规边界。生成模型可能复现版权内容、歪曲事实或泄露隐私。在真实项目中使用 AI 生成内容,必须建立人工审核机制,尤其是面向公开用户的文字、图像、音视频内容。
8. 常见误区与认知偏差
下面列出讨论 AGI 时最容易出现的误区,建议收藏备用。
| 误区 | 更接近事实的判断 |
|---|---|
| 模型考试分数高 = 已经理解世界 | 分数高只能说明完成任务表现好,内部机制是否造成真实理解需要额外实验验证 |
| 模型会答反事实问题 = 具备逻辑推理 | 部分模型可能通过训练语料中的相似表述绕过真实推理 |
| 模型输出自然 = 有意识 | 语言流畅度和主观意识没有已知的必然联系 |
| AGI 是单一时间点事件 | AGI 更可能是能力逐步补齐的过程,不同能力会有不同落地时间 |
| 算力无限增加就能实现 AGI | 数据、算法、评测、工程共同决定上限,算力只是其中一环 |
| 只要本地部署大模型就是安全可控 | 模型内部仍然可能产生不稳定输出,需要评测和审核兜底 |
9. 合规与使用边界提醒
讨论 AGI 的能力时,也需要同步讨论使用边界。无论模型能力多强,在真实系统中使用 AI 都必须考虑以下问题:
- 训练和输入数据是否获得合法授权,是否包含个人隐私或商业机密。
- 生成内容是否可能造成误导,例如伪造事实、生成虚假图片或音视频。
- 面向用户输出时是否加入标识,让用户知道内容来自 AI。
- 模型是否会被用于自动化骚扰、深度伪造、绕过安全机制等恶意用途。
- 在发布或商用前,是否完成效果复核和风险测试。
这些边界不是“限制创新”,而是让技术可以持续被信任的前提。AGI 如果真要进入真实社会,除了算法突破,还必须配套完善的负责任使用框架。
10. 总结与后续观察点
回到最初的问题:DeepMind 创始人说“AI 开始理解世界”,这个判断是否成立?从现有论文和实验结果看,模型内部确实出现了和真实世界结构对应对齐的表征,这比早期纯粹统计学习的判断更有说服力。但距离 AGI,仍然隔着长程规划、实时交互、自主数据获取和稳定评测这几道硬门槛。
最值得验证的能力,不是模型写诗或画图的能力,而是它在长程任务中能否稳定规划、自我纠错并迁移到新环境。最容易踩的坑,则是把基准分数当成智能水平,忽略模型在开放场景中的失效模式。建议有条件的技术团队搭建自己的小规模评测集,持续跟踪模型演进,而不是被阶段性演示冲昏头脑。
下一步可以重点观察几个方向:多模态模型的物理常识能力是否提升、AI Agent 长程任务成功率是否改善、推理模型是否会全面取代普通模型成为主流默认选项,以及世界模型是否从研究走向实际产品。这些点每有一个突破,AGI 距离就会被真实地拉近一步。