微软研究院当地时间 9 月 29 日发布了一套实验性多模态 AI 研究系统,叫Project Quine,定位是面向生物学的"世界模型",合作方是哈佛大学和麻省理工学院博德研究所(Broad Institute)。一句话概括:把基因组、蛋白质、化学、细胞状态、生物成像这几类数据塞进一个统一的表征里,再配上一套能调度工具、查文献、连接实验室的系统,帮科研人员先算出"该做哪些实验"。
"世界模型"这个词到底指什么
这两年"世界模型"被用得很泛。微软在博客里给了自己的定义,我觉得是比较好懂的一版:
一个能表示某个生物系统当前状态、能预测这个状态在受到干预后如何演变、并且能推理干预后果的多步系统。
关键词是**“不替代实验,而是决定先做什么实验”**。实验室资源有限、周期漫长,很多组合空间大到根本没法穷举。Quine 的思路是先用计算把候选排个优先级,再把有限的实验资源砸到最值得验证的对象上。
和之前的做法比,变了什么、没变什么?
- 以前:不同任务用不同的"专家模型",单模态、单任务,跨领域数据是割裂的;再用一层编排把几个模型拼起来。
- 现在:训练时就让模型在序列、结构、功能、细胞状态、成像等多个模态上联合学习共享表征,用 A 模态的证据去帮 B 模态做预测。微软说这种跨模态训练不但没稀释效果,反而让泛化更强。
另一块常被忽略的是harness(编排层):它把世界模型、推理模型、科学工具、文献和"湿实验"(wet lab)串起来,形成一个闭环——科学家提问 → 计算生成候选 → 实验室验证 → 测量数据回流 → 修正下一个问题。
- 现在:训练时就让模型在序列、结构、功能、细胞状态、成像等多个模态上联合学习共享表征,用 A 模态的证据去帮 B 模态做预测。微软说这种跨模态训练不但没稀释效果,反而让泛化更强。
说白了,真正难的不是单个模型,而是把模型、工具、实验和人对齐成一圈能转起来的流程。这个判断对做工程的人其实挺有参考价值。
一个周末,筛出推动细胞状态转变的化合物
最实在的案例是胰腺导管腺癌(PDAC),这是胰腺癌里最常见、也最难治的一种。
团队长期验证的一个假设是:肿瘤的行为和耐药性不只取决于基因,还取决于转录层面的细胞状态。PDAC 肿瘤细胞可以处在不同的细胞状态,对治疗的反应也不同。
他们用 Quine 对数千个化合物做预测和优先级排序,看哪些最有可能把肿瘤细胞在"经典型"和"基底样型"这两个治疗相关的状态之间推动。结果(据报道):
- 在实验室湿实验里,Quine 排名最高的化合物产生了最大的预期状态转变;
- 整个过程——从缩小搜索空间到锁定少数几个候选——只用了一个周末,微软估计可能省下数月的实验工作和可观的研究成本;
- 一些效果最强的化合物来自意料之外的作用机制,作者认为这是 AI 发现药物重定位机会的早期证据。
反面结果也有意思:从基底样型往经典型反向转变更难,Quine 也预测了这一点。更意外的是,实验发现几个化合物会把细胞推向第三种表型——胰腺癌的细胞状态图景,比简单的"经典型—基底样型"一条轴要丰富。实验不只是验证了模型的假设,还反过来生成了新假设,这正是闭环想干的事。
- 一些效果最强的化合物来自意料之外的作用机制,作者认为这是 AI 发现药物重定位机会的早期证据。
对从业者来说,几点值得记
- 边界很清楚:仅供科研,不用于临床。微软反复强调 AI 仍会犯错,任何结果都必须经过严格的人工评估。这种把话说死的态度,反而是负责任的做法。
- 暂时不对外商用。想提前用的研究人员可以申请Quine Fellows项目;后续会通过Microsoft Discovery等产品逐步扩大开放。个人目前能接触的入口就是 Fellows。
- AI for Science 的范式在变。从"训一个模型解决一个任务",转向"建一个能跨模态推理、能接入真实实验闭环的系统"。对做数据、平台的开发者来说,这类"科研 harness"未来会是新的工程方向。
- 别被"一个周末"带节奏。这套系统背后是多年的生物医学研究积累、patient-derived 模型和大规模算力,不是一个周末从零跑出来的。短期能力是"排序和提出假设",不是"造出药"。
收个尾
Quine 现在还在很早期,微软自己也没把它当成品。但它代表的方向挺明确:让 AI 少一点"替代人"的叙事,多一点"帮人把实验做得更值"的定位。科研里最贵的从来不是算力,而是那些做错了的实验和浪费掉的时间。
AI 能不能真的加速药物发现,还是又一次"实验室里的漂亮数字"?你怎么看,评论区聊聊。