李飞飞那条关于人类学习不必全靠现实数据的访谈,在我看来是当前 AI 数据路线里最值得反复琢磨的一句话。很多人习惯把 AI 训练理解成“喂越多真实数据,模型越强”,但人类并不是这样学习的。我们会通过想象、推理、在环境里动作试错、把已有概念重新组合来获得能力。这句话真正指向的问题不是哲学问题,而是工程问题:当真实数据不够、太贵、太封闭时,AI 怎么继续变聪明。
我打算从三层展开:先说明为什么现实数据不是唯一学习来源,再讲模拟数据、合成数据和主动探索在工程里怎么落地,最后给一个仿照这种思路做最小实验的流程。适合正在做大模型微调、具身智能、视觉导航、3D 感知或数据策略的人看。
1. 这句话到底在说什么
1.1 人类学习不只有“真实数据”一种输入
如果把人类的学习过程拆开看,真正驱动能力增长的输入远不止“亲眼见过的真实案例”这一种。
第一种是亲身经历。这确实依赖现实世界,但数量很有限。一个人一辈子不可能把所有跌倒方式都体验一遍,也不会把所有对话场景都经历一遍,但还是能在遇到新情况时做出大致正确的反应。
第二种是观察和模仿。看别人操作、听别人讲解,能获得大量间接经验。这类数据虽然是现实发生的,但并不是学习者自己的真实体验,而是被语言、影像或动作转述之后的信息。
第三种是想象和假设。脑子里想做一件事,可以先在内部模拟一遍:伸手拿杯子抬高一点,杯子会不会滑落;绕过桌子走左边还是右边;这个句子换一种说法会不会更容易理解。这些过程没有对应的外部真实数据,模型却能从中推出结论。
第四种是抽象和类比。人类会把不同场景里的共同结构抽出来,比如“按住某个东西再推动”这个模式,可以用在门把手、抽屉、儿童积木上,不需要每种物品都专门教一遍。
所以“人也不全靠现实数据学习”并不是反科学,反而是对机器学习方法论的一个重要提醒。如果我们认可学习可以走多种路径,那 AI 的训练方式也不应该被限制在“收集尽可能多真实标注数据”这一条路上。
1.2 当前 AI 训练对真实数据的依赖为什么这么重
现在的大模型和视觉模型为什么如此依赖真实数据?原因很直接:目前的神经网络还没有足够强的因果推理和想象能力,主要靠海量数据里的统计规律来逼近目标函数。
文本模型靠互联网上的网页、书籍、对话记录训练。图像模型靠图片和人工标注训练。人类评价偏好靠真实用户反馈训练。这些都属于“现实数据”。问题在于,这种路线逐渐暴露出三个瓶颈。
第一个是成本。高质量标注数据很贵。给一张复杂街景做实例分割,比给一张简单物体打框贵很多;给一段医疗对话做行为评分,成本更高。很多团队不是不想用真实数据,而是用不起。
第二个是长尾覆盖不足。真实世界的分布非常不均匀。常见场景数据很多,低频危险场景、极端光照、罕见对象、特殊交互方式,都很难收集。模型如果只在头部数据上训练,遇到尾部场景就很容易失效。
第三个是更新慢。真实世界采集、清洗、标注、审核是一个长周期过程。当产品需求变化时,数据管线往往跟不上。这也是很多团队开始尝试“用模型生成数据来训练模型”的直接原因。
1.3 李飞飞把问题引向空间智能
李飞飞的研究路线里,空间智能是一个非常核心的概念。它并不只是“认出图片里有什么”,而是要理解物体在三维空间中的位置、尺寸、朝向、遮挡关系,以及物体与物体之间可能发生的物理运动。
如果认同人类学习不靠全部现实数据,那么空间智能就是一个特别好的验证场景。人类理解三维空间,不是靠把所有家庭、所有街景、所有桌面都真实走一遍才学会的。只要搭过积木、推过玩具、走过几间不同的房子,就能迁移到陌生环境里。
但当前很多视觉模型只在二维图像上做分类、检测、分割,没有真正建立三维空间模型。李飞飞在访谈里强调的方向,本质上是在说:下一步 AI 需要学会“在空间里推理”,而这件事不能只靠堆二维真实图片。
对工程师来说,这个信号值得注意。空间智能需要的数据类型和训练目标会发生变化:不再只有猫狗分类,而是深度估计、姿态估计、3D 重建、空间关系预测、运动规划。这些任务如果完全靠真实数据标注,成本极高。模拟环境生成的带标注三维数据,几乎是绕不开的选择。
2. 真实数据之外:模拟、合成、探索
2.1 合成数据不是“假数据”,是“可控数据”
很多人听到合成数据,第一反应是“这数据是不是假的,能用来训练吗”。我建议换个说法:合成数据不是假数据,而是可控数据。
合成数据通常由程序自动生成,来源很多。可以是计算机图形渲染,可以是扩散模型生成图像,也可以是大语言模型根据规则生成文本,还可以是自己在代码里随机生成表格和业务日志。关键不在于“是否来自真实世界”,而在于样本的生成过程是否可控、分布是否清晰、标注是否自动对齐。
举个例子。训练一个工业零件检测模型时,真实工厂里可能只有几百张缺陷样本,而且缺陷种类很有限。但通过 3D 建模和渲染,可以生成不同角度、不同光照、不同缺陷形态的上万张图片,而且每一张的标注框都由渲染管线自动得到,不需要人工标。
这类数据对视觉模型特别有用,原因在于视觉任务的底层规律是稳定可模拟的。比如一个螺丝在不同光照下投影成什么形状,物理关系是确定的。只要渲染器足够接近真实光学过程,模型就能从合成图里学到通用几何特征。
2.2 模拟环境让模型在动作中学习
比合成数据更进一步的是模拟环境。合成数据还是一批静态图片或文本,而模拟环境允许模型作为主体在环境里行动,并观察行动带来的结果。
机器人领域用得最多。一个抓取任务,如果用真实机械臂试错,成本高、周期长,还有安全隐患。但在仿真环境里,可以创建大量虚拟桌面、虚拟物体、虚拟机械臂,让策略随机尝试抓取位置,根据是否抓取成功来调整参数。一晚上可以跑几万次,真实环境根本做不到。
这种“在动作中学习”的模式,对应着人类通过身体经验来认识世界的过程。比如儿童学习推门,不需要被真实门夹到很多次,就能从几次推拉中建立“用力方向、门轴位置、开合角度”的关系。模拟环境就是给 AI 提供类似的高密度反馈。
实际操作中,学术界和工业界会用到 MuJoCo、Isaac Sim、Bullet 这类物理仿真工具。不同工具侧重不一样,但共同点是:能配置物体模型、物理规则、相机视角和任务奖励,然后输出状态、图像和动作结果。对于做视觉导航、机械臂操作、无人机控制和游戏 AI 的团队,这类环境是当前不可替代的训练场。
2.3 主动探索和自我博弈
人类学习还有一个特点:不会被动等着数据被塞进来,而是会主动选择看什么、试什么。这种机制在 AI 里对应的是主动探索和自我博弈。
AlphaGo 是一个很典型的例子。它的能力并不只是来自学习人类棋谱,而是在自我对弈中不断生成新棋局。这些棋局不是人类“真实数据”,但对模型训练极其有效。大语言模型领域也有类似思路:让模型自己生成多个推理步骤,再筛选出正确结果,重新作为训练数据。这就是一种自我探索式的数据生产。
所以“不靠现实数据学习”在工程上的意思其实是:数据和模型的迭代可以形成闭环。模型先出结果,系统自动验证结果好坏,把好的结果回收成训练样本,再继续训练下一版。数据不再是静态资源,而是动态生成物。
这个闭环一旦跑通,最大的收益是边际成本下降。真实数据每增加一批,都要重新采集和标注;而主动探索产生的数据,是在已有模型能力上滚动生成的,只要验证逻辑设计得好,成本可以保持稳定。
3. 不要急着全面转向合成数据
3.1 真实数据仍然不可替代的场景
说完合成数据和模拟环境的价值,也得说清楚边界。至少有三类场景,真实数据目前仍然不可替代。
第一类是安全关键系统。医疗诊断、自动驾驶、工业安全控制,这些场景里的风险极高,合成数据可以用于预训练,但最终验证和持续监控必须依赖真实环境数据。因为模拟环境再逼真,也无法完全覆盖真实世界里的物理异常、人体复杂性和社会规则。
第二类是人类偏好和主观判断。比如判断一句回复是否礼貌、一段翻译是否自然、一个推荐结果是否讨喜,这类问题本质上是“人觉得好不好”,很难通过图形渲染和程序规则生成。虽然可以用大模型模拟人工标注,但最终仍需要真实用户反馈来校准。
第三类是罕见但影响重大的长尾事件。真实场景里的极端事故发生概率低,但一旦发生就是关键问题。模拟数据可以构造类似场景,但真实样本仍然是检验模型是否真正泛化的金标准。可以把合成数据看成加速器,但不能把它当成安全证书。
3.2 合成数据常见的坑
合成数据不是没有坑。我在项目里见过最多的问题有这么几类。
分布偏移是最常见的。模拟环境里渲染出的物体太干净,光照太均匀,材质太标准。模型在合成测试集上分数很高,一到真实环境就掉点。这背后是训练分布和实际分布没有对齐。
第二个是重复模式。如果三维资产只有几个模型,程序随机摆放再多,模型也容易过拟合到这几个物体的纹理和形状。表面上数据量很大,实际上有效多样性很低。
第三个是标注捷径。程序自动标注确实省人力,但有些标签可能不是从正确的物理关系推导出来的。比如相机外参没对齐,导致 3D 框投影到 2D 时偏移,模型学到的位置关系和真实空间不一致。
第四个是目标泄漏。模拟场景里如果把“答案”暴露得太明显,模型会走捷径。比如物体总是位于画面正中间,检测网络就学会了只关注中心区域,而不是真正理解语义。
这些坑不是说合成的路走不通,而是要求团队增加验证环节,不能只看模拟测试集上的指标。
3.3 判断是否适合使用模拟或合成数据
判断一个任务适不适合用合成数据,可以从三个角度交叉看:真实数据成本、模拟可覆盖度、任务失败后的迭代成本。
如果真实数据标注昂贵,同时任务规律可以被程序模拟,那合成数据非常有价值。典型代表是工业视觉、三维重建、机器人控制。
如果真实数据本身已经充足,只是有一点脏,那更该做的是清洗和去重,而不是生成假数据。生成数据只会把噪声模式放大。
如果任务高度依赖用户主观反馈,那合成数据最多只能作为辅助增强,最终还是要靠真实反馈闭环。
下面给一个简单的判断参考。
| 任务类型 | 真实数据成本 | 模拟可覆盖程度 | 建议路线 |
|---|---|---|---|
| 工业缺陷检测 | 高,缺陷样本少 | 较高,可通过渲染生成大量缺陷形态 | 合成预训练 + 少量真实微调 |
| 三维物体位姿估计 | 高,人工标注难 | 很高,渲染可输出精确位姿 | 以合成数据为主,配合真实场景验证 |
| 机械臂抓取 | 非常高,试错有风险 | 较高,物理仿真的动作空间丰富 | 仿真预训练 + 真实环境在线微调 |
| 对话系统 | 高,依赖用户偏好 | 低,模拟难以覆盖真实意图 | 真实数据为主,合成增强为辅 |
| 内容安全审核 | 高,标注敏感 | 低,需要真实上下文 | 尽量用真实样本,合成数据只做扩充 |
这个表格不是绝对标准,但通常能把一个任务是否适合用模拟数据看得很清楚。
4. 从观点到工程:一个最小验证流程
4.1 先定义任务和评估指标
不管怎么理解观点,落地的第一步永远是定义任务。不要一上来就生成十万张合成图,也不要先选一个复杂的模型。先拿一张纸把任务写清楚。
输入是什么,是单张图片、多视角图片、深度图,还是文本指令?输出是什么,是分类标签、目标框、三维坐标,还是动作序列?环境变量有哪些,光照、角度、背景、物体种类有没有变化?失败怎么定义?如果模型输出接近目标但差了一两厘米,算对还是算错?
评估指标也要提前定。做视觉检测,可以用 mAP、F1;做位姿估计,可以用平均距离误差;做机器人抓取,可以用成功率。这些指标必须能在同一个测试集上重复计算,否则后面没法判断合成数据方案是否有效。
我建议先定义 10 条或者 20 条真实测试样本。样本数量不需要多,但必须是完全独立、贴近实际使用的数据。后面所有模型对比都在这同一批样本上做。
4.2 用一个最小模拟环境生成样例
任务清晰之后,就可以搭一个最小模拟环境。核心原则是“先让样本能生成,再谈逼真度”。
比如要在桌面场景里做物体位姿估计,可以这样开始:
- 创建一个简单平面,模拟桌面。
- 放入一个或几个待检测物体。
- 随机设置物体位置、旋转角度、不同相机高度和视角。
- 给渲染环境增加随机光照和材质颜色变化。
- 批量输出 RGB 图、深度图、实例分割图和位姿标注文件。
这种流程只需要几百行代码,甚至用现成的图形引擎和物理引擎几个小时就能搭起来。下面是一个示意流程,不绑定具体框架:
# 伪代码示例:生成合成训练样本 scene = create_scene(ground=True, lights=None) cup = load_asset("cup_model.ply") for i in range(1000): cup.set_pose(random_pose_on_table()) scene.set_random_lighting() scene.set_random_camera() rgb = render_rgb(scene) depth = render_depth(scene) label = compute_pose_label(cup) save_sample(rgb, depth, label)这里的关键不是代码本身,而是每一轮变化都必须是可控的。随机范围要记录下来,比如相机高度在 0.8 米到 1.2 米之间变化,光照强度在一定区间内变化,物体旋转角度覆盖 -30 到 30 度。这样后续才能分析模型到底在什么变化下表现不好。
先用小规模跑通,比如 1000 张生成图。不要贪多。如果流程还没跑稳,直接生成几百万张,后面发现问题时返工成本会非常高。
4.3 与真实数据基线对比
合成样本生成之后,不能只拿它训练一个模型自己看效果。正确做法是做一个对照组。
建议同时训练三个模型:
- 模型 A:只用 1000 张真实标注图。
- 模型 B:只用 1000 张合成图。
- 模型 C:900 张合成图 + 100 张真实图做微调。
然后把三个模型放在同一批真实测试集上评估。比较的时候看几个层面。
如果模型 B 比模型 A 差很多,说明当前模拟环境和真实场景的分布差距太大。先检查渲染相关的材质、光照和背景,也可以检查是否缺少关键真实噪声。
如果模型 C 接近甚至超过模型 A,说明合成数据已经能够提升数据多样性,真实数据微调可以把模拟分布拉回真实分布。
如果模型 B 在模拟测试集上很高,在真实测试集上很低,就是典型的分布偏移。这种情况不要急着换模型结构,先把模拟环境里变化范围扩大。
整个流程用一个小的数据量完成,成本很低,但能在这段观点和实际工程方案之间建立一条可验证的路径。
5. 如果往深走:空间智能、具身智能、世界模型
5.1 空间智能为什么可能是下一阶段重点
空间智能和普通视觉任务有一个本质区别:普通视觉任务多数是从二维图像提取语义标签,空间智能则要求模型在三维物理空间里理解物体之间的关系。
比如一张照片里有一个杯子放在桌子上。普通分类模型会输出“杯子”“桌子”。空间智能模型则要回答:杯子距离桌子边缘多远,它可能往哪个方向掉落,相机从另一侧看过来,杯子的轮廓会变成什么样。
这类能力不能通过给图片打上更多分类标签来获得,需要模型接触三维结构。而三维结构数据从哪来?纯靠人工标注非常低效,模拟环境重建却是高效路径。
在实际工程里,空间智能直接关联很多产品方向:增强现实里虚拟物体和真实场景的遮挡关系、机器人在家庭环境中的导航、自动驾驶里对动态障碍物的轨迹预测、三维内容生成中的物理合理性。这些方向的数据需求都和“想象空间”有关。
李飞飞把接下来关注点放在空间智能上,本质上是在推动 AI 从“二维识别”走向“三维理解”。这比单纯加大模型参数量更值得关注。
5.2 具身智能需要重新设计学习目标
具身智能可以理解成“AI 拥有身体,并在真实或虚拟环境里行动”。它的训练目标和传统 CV/NLP 任务区别很大。
传统视觉模型学习的是“它是什么”,具身智能模型学习的是“下一步动作是什么”。同样看到一个杯子,传统模型只需要输出类别和位置,具身智能模型需要输出机械臂怎么移动、需要施加多大力度、抓取后往哪个方向走。
这类模型不能只靠静态数据集训练。因为动作产生结果,结果又影响下一步动作,整个序列里天然存在反馈回路。真实环境里做强化学习,试错成本太高,所以仿真几乎成了必备条件。
具身智能的工程落地,通常会分成两个阶段。第一阶段是在丰富的仿真环境中预训练一个策略,第二阶段用少量真实数据做微调和对齐。第一阶段依靠模拟数据,第二阶段用真实数据校正偏差。这样做既能控制成本,又能保留真实物理世界中的安全边界。
5.3 世界模型给“想象”提供计算框架
如果要在算法层面给“人类不靠现实数据学习”找到一个对应物,世界模型是最接近的那个概念。
世界模型试图让模型学习环境的状态转移规律。给定当前状态和动作,模型预测下一个状态。它不需要真的执行动作,也不需要从外部获取这条轨迹的真实样本,而是在内部模拟可能发生的结果。
举个例子。机器人想伸手抓取杯子,世界模型可以预测:左右偏移 1 厘米,杯子可能会滑落;向下多按 2 厘米,夹爪会触碰桌面。这种预测不是来自一遍遍真实试错,而是来自对物理规律的学习。
世界模型的工程价值,是可以大幅降低强化学习的采样成本。智能体先在世界模型里想象很多条轨迹,筛选出有希望成功的路径,再在真实环境里执行。这和人类下棋时先算几步、再落子的过程很像。
但它也有明显挑战。短期预测很容易,长期预测会产生漂移。模型在第 5 步可能还很准,到第 30 步就开始偏离真实物理规律。所以现在很多方案会把世界模型和真实环境验证结合起来,用世界模型加速搜索,真实环境负责最终验证。
6. 给工程师的几个实操建议和排查方向
6.1 模型效果差时,先排查数据分布,不要急着换模型
我有一个很深的体会:很多合成数据项目跑完,效果不好,团队第一反应是换更大的模型或者调训练轮数。但在大多数情况下,问题不在模型结构,而在数据分布。
如果模型在训练集和真实测试集上差距过大,先做一个输入分布对比。统计两者在光照亮度、物体大小、目标数量、背景复杂度、遮挡比例上的差异。差异集中的地方,就是模拟环境最需要加强随机化的地方。
比如模拟图里杯子都在干净桌面上,真实场景里杯子旁边可能放着纸巾、笔、盘子,模型就没见过这种遮挡关系。这时加再大的模型也救不回来。先把模拟场景的物体数量、摆放范围、遮挡程度调丰富,指标才会上升。
6.2 合成数据效果不好,按顺序排查模拟和标签
如果你已经把合成数据跑进训练流程,但效果还是不稳定,我建议按下面的顺序排查。
第一,检查渲染是否太干净。固定地板、固定光照、固定相机角度是最常见的问题。把三样全部改成随机,很多时候效果立刻改善。
第二,检查物体资产是否重复。如果三维模型只有三五个,随机生成再多图像也只是在重复同样的几何和纹理。想办法扩资源,或者用程序化建模生成变体。
第三,检查标签是否对齐。程序自动标注并不保证永远正确,尤其要注意 3D 到 2D 投影时相机内外参是否能对齐。标签只要出现系统性偏移,模型学到的映射关系就是错的。
第四,检查是否存在捷径特征。比如物体总在画面中心,目标小样本永远只有一种颜色。可以把训练集做抽样可视化,看模型更容易依靠哪类特征做判断。
第五,如果以上都没问题,再考虑增加模拟复杂度,比如加入真实相机噪声、运动模糊、传感器抖动等。
6.3 优先级建议:先小步验证,再批量生产
最后给一个项目排期建议。
如果团队时间紧,不要一上来就规划百万级合成数据。先花两到三天生成 1000 到 5000 张样本,搭配少量真实数据微调,在固定测试集上出一版指标。看到指标有正向趋势,再扩大生成规模。
扩大规模的时候,优先提高多样性,不是单纯增加数量。同一物体固定摆放生成一万张,不如三百种物体随机组合生成一万张。多样性决定了模型能不能泛化,数量只决定训练稳定性。
同时,要考虑管线成本。合成数据虽然减少标注成本,但渲染需要 GPU、存储需要磁盘、标签校验需要人力。如果一个项目里合成数据和真实数据的成本已经接近,说明生成策略需要调整,而不是继续堆量。
回到李飞飞那句话,如果只能留一个结论,我记的是:AI 要接近人类,就不能永远把自己绑在“爬取更多现实数据”这条路上。数据获取方式、模型学习目标、环境交互方式,这三个环节必须一起变。真正落地时,别急着否定合成数据,也别无脑全量合成。先把模拟数据、真实数据、小规模验证的组合跑通,再看成本和收益是否合得来。