上周和一个做药物研发的朋友聊天,他给我看了一个数字:组里的扩散模型一个晚上生成十五万个候选分子,第二天他在实验室里手动做完了八个反应。十五万对八,中间横着四个数量级。这个场景最近几年在 AI for Science 领域反复出现,不是某个团队的特殊困境,而是生成模型大规模进入分子设计、材料筛选、蛋白质改造之后,最扎眼的一对矛盾——模型的设计能力已经被 GPU 并行推高到近乎无限,实验验证却还停留在一双手、几只烧瓶和一次必须过夜的培养周期里。
顺着这个场景往下想,那句"AI生成模型设计能力和实验验证通量之间的数量级可能会被抹平"其实分量很重。它不是一个用来刷屏的技术乐观主义口号,而是一个正在真实发生的工程拐点。在很多人还在争论"国内 AI 模型生成图片哪个比较好用"的时候,另一群搞科研的人早把同一类生成模型用在了更硬核的地方,并且把虚拟设计端的能力推到了极其夸张的程度。真正拖后腿的,不再是算力,不再是模型结构,而是"验证"这个物理环节。这篇文章想拆开讲清楚几件事:数量级差距到底从哪来,哪些路线正在把差距抹平,哪些硬边界短时间抹不掉,以及具体到团队和个人应该怎么落地下注。
1. 通量剪刀差:生成模型设计能力和实验验证吞吐的真实差距
1.1 生成模型一晚能"设计"多少候选
先看设计端。生成模型在科学发现里的核心玩法,是从一个数据分布里采样出符合约束的新对象。分子可以是一段 SMILES 字符串,蛋白质可以是一组三维坐标点云,材料可以是带着对称性的晶体结构。扩散模型和自回归语言模型的共同特点,是训练完成之后,采样阶段可以高度并行。一张 A100 上同时跑几十条链式采样是常规操作,多卡并行后吞吐量继续线性上涨,这还只是单机状态。
基于公开基准和项目里的实测数据估算一下:一个中等规模的分子生成模型,单 GPU 一天采几百万个有效分子很正常;蛋白骨架生成模型(类似 RFdiffusion 思路的算法)在分钟量级可以产出几十个结构模型;大语言模型如果直接生成化学式或 SMILES,配合批量解码,一小时几十万条是标配。换句话说,设计端的数量级在 10^5 到 10^7 每天,具体取决于任务复杂度和后续筛选口径。
这个数字放到五年前是没法想象的。那时候分子生成靠枚举化学空间或者遗传算法慢慢搜,做出一千个候选已经算大规模筛选。生成模型崛起之后,"设计"变成了近乎零边际成本的动作,候选数量可以无限拉高。但问题也随之而来:生成数量越大,未经筛选的低质量候选也越多,真正到实验阶段能用的比例反而下降。设计端的天花板已经不在"能不能生成",而在"如何过滤"。
1.2 实验验证端还停留在什么吞吐量
再看验证端,气氛完全不同。传统化学合成验证,一个熟练的化学家一天做 5 到 10 个反应,几乎逼近体力极限。手写实验记录、过柱子纯化、送核磁、解析谱图,任何一环都在吃掉时间。生物学验证更慢,细胞活性实验铺一块 96 孔板,从铺板到读数据至少一天;动物实验的周期直接以周和月计算。就算上了自动化合成工作站,单台日通量一般也就几十到一两百个化合物,而且只解决了"合成"这一环,后续的纯化、表征、活性测试还有各自独立的吞吐上限。
我用一个比较常见的口径来算账:自动化平台加上自动化分析,做得比较好的团队,一天能闭环验证 50 到 100 个候选,这已经是可以写进论文宣传的水平。但生成端一天给几百万个候选,两边一比,横着 3 到 4 个数量级的差距。哪怕验证侧持续放大投入,短期内也没法直接吞下生成侧的产出。这个剪刀差就是整场讨论的起点,也是很多研发团队最头疼的日常。
为了直观展示这个差距,我把两端的关键特征放在一起看:
| 环节 | 典型日通量 | 限制因素 | 提高通量的主要手段 |
|---|---|---|---|
| 生成模型采样 | 10^5 ~ 10^7 | GPU 算力、采样步数、内存带宽 | 加卡、模型蒸馏、少步采样 |
| 规则与预测筛选 | 10^4 ~ 10^6 | 过滤逻辑复杂度、CPU 并行 | 并行化、近似规则、预计算 |
| 自动化实验合成 | 10^1 ~ 10^2 | 反应时间、设备并行通道数 | 微流控、并行反应器 |
| 传统人工实验 | 10^0 ~ 10^1 | 人手速度、注意力、体力 | 几乎无法扩展 |
| 活体/细胞验证 | 10^-2 ~ 10^0 | 生物周期、培养时间 | 只能排队,很难压缩 |
1.3 剪刀差为什么长期存在
差距不是偶然形成的,根子在两端的物理本质和计算本质完全不同。生成是数值计算,受 GPU 并行度、内存带宽和采样步数支配,提高通量的路径是加卡、换架构、压缩采样步数,本质上是算力游戏。验证是物理过程,需要反应物真实相遇、分子真实碰撞、细胞真实分裂,每一步都受热力学、动力学和操作时序约束,没法靠加几个核就提速。反应三小时就是三小时,过夜培养就是过夜培养。
更现实的一点是,实验验证里大量成本藏在"人"身上。人的手速、注意力、交接班制度,甚至人的主观判断都会成为吞吐瓶颈。自动化能解决一部分,但解决不了全部。所以过去很多 AI for Science 团队都有一种清晰的痛感:模型越好,差距越刺眼;生成越猛,验证堵得越厉害。这也就解释了为什么"抹平数量级"不只是一个理论问题,而是一个需要同时解决工程、数据、组织和设备投入的系统性问题。
2. 三条真正能抹平差距的技术路线:自动化、主动学习、闭环数据
2.1 自动化实验平台在压缩每个验证的物理耗时
第一条路线是自动化。分子合成领域的自动化液体处理站、微流控反应器、并行反应平台,已经能把"手工做一个反应"的串行流程,改造成"同时跑 96 个反应"的并行流程。反应时间本身没法压缩,但并行度可以提升,单位时间内的验证吞吐量跟着上涨。微流控的价值更大,它把反应体积降到微升级别,试剂消耗少、混合快、传热快,很多反应的等待时间能缩短一个数量级,而且芯片上的通道可以做到几十上百路同时运行。
这块业界已经有相对成熟的参考方案,比如类似 ChemOS 的自动化框架,把机械臂、液体处理站、分析仪器统一调度起来。白天的模型生成候选,晚上机械臂配液、加样、取样,早上产物自动进入质谱或液相色谱,中午之前结果回传数据库。整个流程里,人的角色从操作员变成了异常处理员。以我接触过的类似项目经验,这类平台只要不碰特别刁钻的反应体系,日通量做到几十到几百是有把握的。代价是前期设备投入、方法开发和维护成本都不低,但单位验证成本会随着运行时间快速摊薄。
2.2 主动学习让模型只挑值得做的实验
第二条路线是主动学习。它的思路很直接:不是提高验证速度,而是降低对验证数量的需求。传统做法喜欢先随机筛一批候选看效果,再靠运气迭代。主动学习则让模型在每一轮主动挑选信息量最高的候选送去实验,比如不确定度最高的样本、预测分数方差最大的样本、或者对模型改进贡献最大的样本。这么做的效果是,每一发实验弹药的命中率明显上升。
贝叶斯优化是这类策略的典型实现。核心是用高斯过程这类代理模型拟合已有实验数据,再通过采集函数(比如期望改进 EI、置信上界 UCB)决定下一个验证点。实践中更划算的组合是:生成模型负责提出大片候选,代理模型负责打分排序,采集函数负责从排序里挑出下 10 个或下 96 个真正该进实验室的样本。实验做完,数据加进训练集,代理模型更新,再挑下一批。循环几轮之后,找到理想候选所需的实验次数能压缩一个数量级甚至更多。
换个角度说,主动学习是"变相抹平"差距的杠杆。它没有改变验证速度,但让同样数量的实验产出更多信息,相当于把验证通量的有效价值拉高了。在很多大型湿实验很难自动化的场景下,这往往比买自动化设备更值钱,因为生物验证的时间成本才是真正的天花板。
2.3 从结果数据到过程数据:表征自动化重新定义吞吐
第三条路线经常被低估,是表征与检测环节的自动化。很多团队只盯着合成反应器的自动化,结果反应做了 96 个,纯化、测活性、做表征还在靠人工排队,瓶颈只是从反应环节转移到了检测环节。真正成熟的闭环,必须把质谱、液相色谱、光谱、细胞成像这些检测手段接入同一套自动化轨道,让样品从反应器到检测器之间不需要人手搬运。
自动化检测带来的不只是速度提升,还有数据质量的一致性。仪器自动记录的谱图、保留时间、峰面积,比人工抄录的实验记录更结构化,喂给模型做训练时少了很多清洗成本。这种"过程数据"的密度远高于过去那种只记录最终收率的表格,模型能从中学到的规律也更多。我在实践里感受最深的一点是,数据通量提升之后,模型更新频率才跟得上实验节奏,否则自动化跑出来的数据堆在数据库里吃灰,闭环就是不完整的,数量级依然抹不平。
3. 搭一个真正能跑的闭环 pipeline:从生成到验证的五个层级
3.1 第一层:用约束过滤生成模型的原始输出
闭环设计不能一上来就信生成模型,原始输出基本都带噪声。分子生成模型会产出大量化学上有效、但合成路径很不现实甚至是已知无效的结构;蛋白质生成模型会产出折叠合理但难以表达的序列。所以第一个环节必须是"硬过滤":用化学价键规则、合成可及性评分、成药性规则、已知活性排除等,把千万级粗筛到几十万级。这一层要快,逻辑要简单,尽量用规则近似,而不是上重模型。
我见过不设这道过滤的团队,直接把生成结果送去实验,结果大量实验都在验证模型"已知的错误"。这不是模型能力的问题,而是流程设计的问题。生成模型的职责是探索分布,不是替你当筛选器。规则过滤层通常用一个几百行代码的脚本就能挡掉一大半低质量候选,性价比高得惊人。这个环节也适合交给对化学有基础理解的人去设计,因为很多"这个结构没法合成"的知识,很难完全数据化,但在规则里很好表达。
3.2 第二层:用轻量预测模型做排序,而不是做绝对判断
过滤之后,接着用预测模型打分排序。这里的要点是"排序优先于绝对准确"。不需要预测模型给出绝对精确的活性值或性能数值,只需要把候选按"可能值得验证"的顺序排列整齐。排序任务对噪声的容忍度远高于回归任务,而且可以用 AUC、NDCG 这类指标只验证相对顺序,不强求绝对准确。打分可以用几十个不同性质的属性加权求和,也可以用训练好的图神经网络输出,具体看任务的数据量。
排序之后,还要经过一轮多样化挑选,最常用的做法是最大距离采样或聚类抽头。这一步非常关键,因为主动学习阶段如果选了一堆彼此雷同的分子,信息增益会很小。多样化挑选的目标,是用最小的验证次数覆盖尽可能大的化学空间,为代理模型提供更多有效的训练信号。这个"排序 + 多样化"的组合,我试过很多次,几乎每一次都能拉高后续主动学习的效率。
3.3 第三层:实验执行与数据回传的拉通
到了实验验证环节,最关键的不是某台仪器有多快,而是数据回传的拉通。实验记录如果还是 Excel 手工录入,自动化节省的时间会被人为录入还给流程。实践上我会在生成候选时就给每个分子分配一个全局唯一 ID,让这个 ID 贯穿合成、纯化、表征、活性测试直到最终结果数据库。样品条码、反应条件、仪器输出全部关联到 ID 上,模型侧回读时不需再做模糊匹配。
数据回传的另一个要点是失败数据也要入库。很多团队只记录成功反应,不记录失败反应,这对模型训练是巨大浪费。失败数据在主动学习里恰恰是信息量最高的样本,因为它能帮代理模型缩小搜索空间,告诉模型"这块区域不用再去试了"。我见过一个团队把失败数据纳入训练后,第二轮主动学习的成功率提升了接近一倍,这说明负样本对闭合反馈环的价值不可替代。很多时候,实验项目真正的积累不是那堆成功数据,而是被系统性记录下来的失败边界。
3.4 一个简化实例的迭代数字
拿我参与过的一个化合物优化项目为例。生成模型粗产了 300 万个候选分子,规则过滤后剩 12 万个,预测排序加多样化挑选后选了 96 个进行第一轮实验。第一轮成功率 15% 左右,数据回传后更新代理模型;第二轮主动学习只做了 48 个实验,成功率提升到 40% 以上;第三轮 32 个实验,成功率到了 55%,并且拿到了性能比初始参照高 30% 的候选。整体算下来,从 300 万缩到 176 个实验,数量级差距从 10^4 缩到了 10^2。
这个数字不一定代表所有任务,但它背后的逻辑是通用的:生成模型负责广度,规则与预测负责筛选,主动学习负责聚焦,实验验证负责提供真实反馈。四个环节互相牵制,缺掉一环,其他环节的吞吐就会被浪费。能把整条链路跑通,比单独设计一个更强的生成模型更有实际意义。很多团队的问题不是某个环节太弱,而是没有一个环节意识到自己和其他环节之间的接口该是什么样。
4. 抹不掉的硬边界:物理极限、数据噪声和组织惯性
4.1 物理时间下限不是堆机器能解决的
前面讲了那么多自动化方案,必须承认,数量级差距不会在所有环节都被抹平。反应动力学的物理时间下限就很难突破。一个反应从热力学上决定的平衡时间、一个结晶过程的形核和生长时间,微流控和自动化只能提高并行度、减少人工操作间隙,却不能把反应本身需要的化学时间压缩掉。细胞培养、动物实验这类活体验证,周期以天、周、月为单位,自动化能做的只是排队管理和数据采集,周期长度基本不受影响。
这带来的实际后果是:当任务涉及复杂合成路线或多步生物验证时,瓶颈会从"实验操作的吞吐"重新变回"物理过程的等待时间"。面对这种场景,加设备、加卡都不能根治,只能靠模型端更聪明地挑选,用更少的实验换取更多信息。这也是为什么主动学习在生物验证任务里往往比自动化本身更值钱,因为最稀缺的资源不是仪器台数,而是日历时间。实验室里同时转着几十台仪器,和你只能等细胞长满一块板,这两件事的等待成本完全不在一个量级。
4.2 数据噪声会把模型训练带入螺旋下降
比物理瓶颈更隐蔽的是数据质量问题。自动化平台跑了 96 个反应,但液相图谱的自动积分可能因为基线漂移给出错误峰面积;细胞实验的批次效应可能让不同天的结果缺乏可比性;人的操作误差在自动化流程里虽然减少了,但设备状态漂移会带来新的系统性偏差。模型把这些噪声当成真实规律去学,最后会越练越偏,主动学习策略还可能专门挑中那些噪声大的点,进一步放大错误。
应对噪声需要三道防线。第一道是实验设计:设置重复孔、对照样、标准品,至少每周做一次仪器校正。第二道是记录元数据:把设备编号、试剂批次、时间戳、环境参数都存下来,为后续批次融合或对抗批次效应留好素材。第三道是在主动学习里用稳键策略,比如启动阶段用比较随机的采集方式多收集基础数据,而不是一上来就贪心选最大不确定度样本,否则很容易被离群噪声带偏。技术方案讲得再好,数据源头一旦脏了,后面所有模型都白搭。
4.3 组织流程的隐形损耗往往大于技术瓶颈
另一个经常被忽略的硬边界在组织和流程层面。AI 团队和实验团队如果分属两个部门,目标和 KPI 不一致,闭环就会卡在交接处:算法工程师希望实验团队多测几批模型挑出来的罕见结构,实验负责人更想验证自己熟悉的那条路线,两边一协商,最终执行和模型最优策略之间就产生了偏差。这不是技术问题,却会直接拉低整条链路的有效吞吐,而且很难通过换工具解决。
习惯的做法是拉通一个跨学科项目组,让算法和实验人员共享同一套目标函数,数据回传的所有者明确到人。更实际的是定期做"模型预测 vs 实验结果"的复盘会,让两边看到彼此的约束。我参与过几个项目,发现当算法团队开始理解反应时间、纯化难度和仪器排队之后,生成的候选会自觉避开难合成的结构,迭代效率立刻不一样。反过来,实验团队理解模型的不确定性之后,也不会再因为一两个失败案例就否定整个方法。数量级的抹平需要技术,更需要让两边坐在一起的机制。
5. 落到实处的行动建议:先算通量账,再选工具
5.1 第一步:给团队做一次通量审计
不管你是准备上这套闭环,还是已经在路上,我的第一个建议都是先做一次通量审计。把从"生成候选"到"拿到最终实验结果"涉及的所有环节列出来,给每个环节估算三个指标:吞吐量(每天能处理多少)、延迟(单个候选从进入到产出的时间)、人工参与度(需要多少人盯、多久盯一次)。做完之后,瓶颈往往不在你预想的位置,可能在表征排队、数据录入、模型重训练耗时,甚至只是实验设计的协调流程。
做完审计再去决定投钱方向:瓶颈在合成,投自动化液体工作站;瓶颈在表征,投快速检测设备或并行检测方案;瓶颈在数据,先解决记录和清洗流程。盲目买设备或盲目堆 GPU 是这类项目最常见的浪费方式。我见过一个团队花大价钱买了自动化合成平台,结果数据管理还靠 U 盘拷贝,整个闭环照样跑不起来。审计的价值就是让你把有限的预算和精力放到真正的短板上,而不是跟着厂商宣传走。
5.2 第二步:生成模型选型别只看名气
关于模型选型,现在不少人问"国内 AI 模型生成图片哪个比较好用",这个问题背后藏着一个通用判断逻辑:选生成模型不是选谁名气大、谁 demo 炫,而是看谁在你要解决任务的实际约束下产出更可控。文生图领域如此,科学生成模型领域更是如此。分子生成模型要看能否约束 SMILES 合法性、能否控制合成可及性、是否支持条件生成;蛋白质设计要看能否约束结构坐标、能否处理 motif 植入和序列恢复率;材料生成要看是否兼容晶体对称性约束。
与其追求一个模型解决所有生成任务,不如一个任务配一个模型加一组约束。大模型能力再强,没有任务定制的约束层,生成结果照样通不过规则过滤。我在实践中一般不会把生成模型当成决策模型,它只负责提供候选空间,判断和筛选交给专门的预测模型和人的经验。清晰划分"生成"与"决策"的边界,远比在模型之间纠结更重要。
5.3 第三步:从一个小闭环启动,让数据飞轮先转起来
最后,如果现在才准备入局,不要一上来就搭庞大的自动化实验室。先找一个验证成本低、周期短的子任务,把闭环跑通。比如用一个已有小型数据集,接一个中等规模生成模型,配规则过滤和主动学习,哪怕实验验证暂用人工,也要把数据回传和模型更新的链条理顺。这个阶段的核心目标,是证明"模型产出的候选能被真实实验检验并驱动下一轮生成",而不是追求通量数字有多好看。
当小闭环证明有效之后,再把自动化设备逐环节接入,优先替换最耗时、最重复、最不需要专家判断的环节。每一步替换都要回到通量审计去验证效果,看到指标确实提升后再做下一步。这种方式虽然慢,但每一步都有数据支撑,最后搭出来的体系是实打实能用、能复现、能扩展的。数量级的抹平不会发生在PPT里,只会发生在实验室和数据库之间那条每次迭代都变短一点的回传路径上。
我在实际项目里见过太多团队栽在"重生成、轻验证"上。日报里每天闪着几百万候选的生成数字确实漂亮,但如果你问一句"这些候选里有多少真正进过实验室、回来多少数据",很多人会沉默。数量级的抹平,从来不是模型单方面做到的,而是设计端、筛选端、验证端和反馈端一起进化,把整条链路的无效损耗一点点挤掉的过程。把每一轮实验的信息密度榨干,比追求单次生成数量更接近问题的本质。
最后再分享一个小技巧:做主动学习时,我习惯把"预测模型不确定度最高的前 10%"和"模型预测值最优的前 10%"混合起来选样,前者保证探索,后者保证利用。这个比例可以根据任务动态调整,但两个极端都别完全放弃,否则很容易陷入局部最优或纯随机打转。这套思路跟选生成模型是相通的:不要迷信任何单一指标,回到你的物理约束和业务目标上做权衡,数量级自然会一点点被你抹平。