Anthropic自己的实验室挖出了一个类CRISPR新系统——这则消息最先不是从官网公告里看到的,而是在几个生信和基因编辑讨论群里传开的。和那种“AI又发布了一个新模型”的官宣完全不同,这次更像一份提前泄露的实验记录:没有炫目的Demo,没有API价格表,却让做基因编辑的人、做宏基因组数据挖掘的人、做合成生物学的朋友,都同时抬了一下头。
原因很简单:CRISPR过去十几年是生物技术最热闹的赛道,但真正能用的“新酶”依然稀缺。如果Anthropic真的靠内部实验室从海量基因组序列里捞出一个机制上游全新的核酸酶,那它就不是给AI圈子出的题,而是给整个基因编辑工具箱填的一件新武器。这篇文章就围绕这件事,把“类CRISPR”是什么、这类系统一般怎么被挖出来、如果消息属实意味着什么,以及目前阶段该怎么看,完整拆一遍。
1. 一个AI模型公司,为什么突然跟“基因剪刀”扯上了关系
1.1 Anthropic的实验室动作,其实早有信号
先说结论:AI公司下场做生物研究,已经不是跨界,而是趋势。AlphaFold系列把蛋白质结构预测从“月级”变成“分钟级”之后,蛋白质语言模型、结构生成模型也跟着起来了,AI在蛋白质设计、酶改造、基因编辑工具开发这些方向上,连续出现了好几篇让人没法忽视的工作。
Anthropic作为头部模型公司,过去被讨论得最多的是大模型安全和推理能力,但它的公开信号并不少。创始人Dario Amodei在公开文章里反复表达过一个观点:生物学是AI能带来巨大正面影响的领域之一,AI的最大价值不只是写代码,更在于帮助科学家理解生命系统的复杂度。顺着这个方向,Anthropic内部组建了面向生物安全的团队,做过关于AI加速病毒研究的风险评估,也在公开招聘页面里出现过生物工程师、计算生物学研究员、蛋白质设计相关岗位。这些动作单看都不算大,但放在一起,就是“实验室正在认真搞生物”的痕迹。
所以这次传出“Anthropic自己的实验室挖出了一个类CRISPR新系统”,我在群里的第一反应不是惊讶,而是“终于等到这一步了”。AI公司做新酶发现,技术路径上完全通:一边是语言模型擅长在大规模序列数据里找规律,一边是基因编辑领域正好缺新蛋白,两边一拍即合。
1.2 基因编辑行业恰恰缺“新酶”,AI公司正好补位
过去十几年,基因编辑工具的主流还是那几个名字:Cas9、Cas12、Cas13。每个工具都有经典场景,但也都有明确的短板。
Cas9是目前最普及的DNA剪刀,成熟度高、应用生态完善,但蛋白个头大,SpyCas9大约1368个氨基酸,做体内治疗时不好装进病毒载体;Cas12a体积小一些,偏好T-rich的PAM序列,适合某些AT含量高的基因组,但可用的PAM选择依然有限;Cas13转向了RNA靶向,做核酸检测很好,但真正要解决通用问题,它的切割特性和递送方式也还有不少坑。
更关键的是,自然界里的真实多样性远没有被挖干净。大多数针对环境样本的测序项目,拿到数据之后只做物种注释和功能基因统计,很少专门去搜索“第X类新的RNA引导核酸酶”。而这些数据里恰恰藏着大量Cas9/Cas12祖先、远亲、平行演化的未知系统。谁能更高效地把它们捞出来,谁就有机会定义下一代编辑工具的基础专利。
AI公司进入这个赛道,最大的优势是算法能力。传统团队通常用BLAST或HMMER做远程同源搜索,靠人工经验判定候选基因好不好;而语言模型可以把所有蛋白质序列放进一个高维语义空间,直接搜索“结构和功能意义相近、但序列差异极大”的远亲蛋白,然后快速用结构预测给每个候选打分。这种干湿结合的“AI找酶”模式,和Anthropic这类公司的技术栈几乎完美匹配。
2. “类CRISPR”不是碰瓷:先搞清CRISPR工具箱里的门道
2.1 CRISPR为什么是“可编程的”,这套机制到底怎么运转
要理解“类CRISPR”,得先把CRISPR本身怎么工作讲透。
我在给朋友科普时最喜欢用这个类比:CRISPR系统等于“GPS导航+剪刀”。GPS导航是那条guide RNA,它上面有一段和目标DNA互补的序列,负责带路;剪刀是Cas蛋白,负责在指定位置切断DNA双链。两者绑定在一起,只要改guide RNA的序列,剪刀就会被带到新的位置,这就是大家常说的“可编程”。
导航里还有一个关键校验点,叫PAM。PAM是目标DNA上靠近剪切口的一小段保守序列,Cas蛋白在切割前必须先确认PAM存在,才肯发动。这相当于GPS导航除了认路,还要检查“停车位”是否合法。PAM规则决定了这个工具能在基因组哪些位置“停车”,PAM越宽松、越多样,工具的适用范围就越广。
之所以有这么多Cas9、Cas12、Cas13变体,核心原因就是每个系统都有自己的PAM偏好、切割形式和体积大小。一个系统的PAM太严格,就意味着它在基因组上能找到的靶点变少。对新工具的需求,本质上是“更多、更小、更好用的剪刀型号”。
2.2 类CRISPR家族巡礼:从IscB到Fanzor
“类CRISPR”这个词严格来说不是PubMed里收录的标准分类名,但在行业里大家用它泛指一类结构上和CRISPR-Cas系统相似,但并非细菌经典CRISPR免疫系统的RNA引导核酸酶。它们大部分编码在转座子或移动遗传元件里,靠RNA引导执行DNA切割,功能上和CRISPR很像,但进化来源完全不同。
我把常见系统整理成了下面这张表,方便对照理解这类工具之间的差异:
| 系统名称 | 大小(氨基酸) | 靶标 | 主要特征 |
|---|---|---|---|
| Cas9(SpyCas9) | 约1368 | DNA双链 | 经典编辑器,双RNA引导,PAM为NGG,平末端切割 |
| Cas12a | 约1200 | DNA双链 | 单crRNA引导,PAM偏好T,产生粘性末端 |
| Cas13 | 约1100 | RNA单链 | 靶向RNA,切割RNA,碰撞后可非特异切割旁路RNA |
| IscB | 约400-500 | DNA双链 | 被认为是Cas9的祖先,体积小,编码于IS200/IS605转座子 |
| TnpB | 约400 | DNA双链 | 被认为与Cas12有进化关联,存在于转座子,需要ωRNA引导 |
| Fanzor | 约500-700 | DNA双链 | 真核生物里的OMEGA类系统,比细菌Cas更“轻量” |
IscB和TnpB是过去几年最受关注的“类CRISPR”明星。IscB几乎可以看成“小型化Cas9”,体积不到Cas9一半,但同样能在RNA引导下切断DNA;TnpB则被认为和Cas12共用同一个进化祖先。张锋团队把这堆来自转座子的RNA引导核酸酶统称为OMEGA系统,全称很有意思,叫“Obligate Mobile Element Guided Activity”——直译过来就是“移动遗传元件必然携带的RNA引导活性”。
Fanzor则是从真菌、藻类、原生生物里翻出来的真核版本,比细菌来源的Cas蛋白多了一层“真核细胞里工作”的潜力,天然更适合做动物和植物的基因编辑。如果一个新系统被描述为“类CRISPR”,最合理的推测就是它落在这个大家族里的某个新分支上。
2.3 一个新系统要称得上“新”,通常要过哪几道关
在AI圈,“新模型”的判定标准是benchmark分数;在基因编辑圈,“新系统”的门槛高得多。一个候选蛋白要撑起“类CRISPR新系统”这个称号,至少要过四道关。
第一关是序列新。它的序列不能跟已知Cas蛋白高度相似,至少主序列同一度要显著低于Cas9和Cas12这种“近亲”,否则只能说是一个新变体,不能说是新系统。
第二关是机制可编程。实验者必须能看到它依赖一条可设计的RNA来引导切割。只靠蛋白本身乱切,那不叫基因编辑工具,那叫棒状核酸酶。
第三关是靶向规则清晰。新系统得有明确的PAM偏好或PFS偏好,没有这个规则,研究者就没法预测它能编辑哪里,也就没法实际使用。
第四关是要能在异源宿主里工作。很多微生物来源的蛋白在原宿主里活性很高,一转到人类细胞或植物细胞里就失活,最常见的原因是表达量上不去、导向RNA不被正确加工、或者蛋白在真核环境里折叠异常。能发表论文的系统通常都得拿出至少一个真核细胞里的编辑数据。
如果消息属实,Anthropic实验室那个“新系统”至少已经走过了前两关,至于走到第几步,还是要看后续的实验数据。
3. 从海量基因组里“挖”出一个新系统,大致要经历什么
3.1 找矿:基因组数据库不是越大越好,先要“洗数据”
挖新酶的第一步跟挖矿很像,先把“矿区”圈出来。“矿区”就是公共基因组数据库,NCBI、EMBL、JGI、MGnify这些地方聚集了几万个完整基因组和上亿条宏基因组组装序列,尤其近年大量来自肠道、土壤、海洋、热泉的未培养微生物数据被拼了出来,里面藏着整个人类还没见识过的蛋白空间。
但数据库大不等于好挖。直接拉全库跑搜索是一个非常糟糕的做法,因为公共库里质量参差不齐。比较稳妥的流程是先用QC工具过滤低质量组装、剔除质粒和噬菌体污染的片段、去掉冗余重复序列,再把同一物种的多个基因组合并去重。实战中还有一个关键习惯:把已知的转座酶库(比如ISfinder)单独拿出来做一轮反向过滤。因为很多类CRISPR候选基因其实是从转座子上预测出来的,如果不去掉已知转座酶,你会莫名奇妙得到一大堆和Cas毫无关系的假阳性。
做完清洗,剩下的蛋白质序列集才有资格进入搜索阶段。这里的核心是老生常谈但总被忽略的道理:挖矿不是比谁数据多,而是比谁筛选逻辑好。
3.2 筛矿:远程同源搜索是第一步,AI模型在这里当辅助
有了候选蛋白集,接下来要做远程同源搜索。传统Cas蛋白之间序列差异极大,用普通BLAST很难捞出远亲,所以一般要用HMMER或HHpred这类基于隐马尔可夫模型的工具,构建已知Cas蛋白家族的profile,再对整个候选库跑一遍。
典型命令大概是这样:
hmmsearch --cut_tc --domtblout candidate.domtblout /path/to/Cas_RuvC.hmm /path/to/all_proteins.faa > candidate.hmmsearch这里的核心是选择结构域。Cas9、Cas12这类蛋白都含有一个叫RuvC的核酸酶结构域,就像所有“剪刀”共享的一个公共模块。只要针对RuvC-like结构域建profile,就能把散落在海量序列里的“疑似剪刀”捞出来。
但这一轮捞出来的还是太多,假阳性率很高,因为很多普通核酸内切酶、限制性内切酶也带类似RuvC滤布结构。这时候AI就派上用场了:对候选蛋白批量跑AlphaFold或ESMFold结构预测,再用Foldseek做结构相似度比对。蛋白质结构比氨基酸序列保守得多,很多序列同源性只有百分之十几的蛋白,结构上却能完美叠合。这一步等于把候选列表按“立体形状像不像剪刀”重新排序,比单看序列可靠得多。
如果算法团队是Anthropic这个级别的,我相信他们还会用蛋白质语言模型做语义搜索:把蛋白序列编码成embedding,用近似最近邻检索直接找“语义上的远亲”,而不是只等BLAST结果。这种搜索引擎式的新酶发现,是传统生信流程不具备的优势。
3.3 试矿:拿到候选蛋白后,细胞实验怎么快速验证
干实验筛出一批候选蛋白,只是万里长征第一步。真正的分水岭在湿实验验证。
对新发现的类CRISPR蛋白,验证流程通常是:先合成密码子优化后的基因,在体外无细胞系统或大肠杆菌里表达;然后设计几条候选guide RNA,检测蛋白能否在RNA引导下切断目标DNA;确认有切割活性后,再用PAM富集库测定它到底偏好什么PAM序列。
做得更完整的团队,会把候选蛋白直接转到人胚肾293T细胞或小鼠细胞里做编辑实验,用T7E1酶切检测或靶向NGS测序统计indel率。这里我得说一个经验:从微生物基因组挖出的蛋白,进真核细胞后最常见的死法不是没活性,而是“表达了但不稳”或者“导向RNA没被正确处理”。所以真正能落地的类CRISPR系统,背后都有一段漫长的蛋白工程改造过程,比如加核定位信号、突变去毒性、调整RNA骨架。干实验给出方向,但改造才是工具化的灵魂。
Anthropic如果只是“挖到了”一个系统性新蛋白,而没有配套的蛋白工程数据,那它目前的阶段就还在“实验室里刚看到亮光”,距离可交付的工具型产品还有相当一段路。
4. 如果这个类CRISPR系统真的稳定可用,改变的远不止实验室
4.1 基因治疗和细胞治疗:小体积酶带来的递送红利
基因治疗领域最卡脖子的环节之一就是递送。现在最常用的AAV病毒载体,包装容量大约是4.7kb,一个SpyCas9全长蛋白编码序列就占掉差不多4.2kb,剩下点空间连一个像样的启动子都塞不进去,更别说同时装guide RNA和调控元件。这就导致很多体内基因编辑方案不得不拆成两条AAV,分别装载蛋白和guide RNA,再靠体内重组拼起来,效率低、故障多。
如果Anthropic挖到的是IscB或TnpB风格的小型酶,蛋白编码只有400到600个氨基酸,那整个局面立刻不一样:一个AAV就能装下“启动子+小酶+guide RNA+附属元件”,单载体递送方案从不可能变为可能。对眼科、神经肌肉、肝脏代谢类疾病的体内编辑,这是质的差别。哪怕只多一个能用的新PAM,也意味着某些基因突变位点第一次有了可设计的编辑靶点。
4.2 快速诊断与田间场景:RNA切割活性的新想象力
类CRISPR系统里,如果新酶恰好具有Cas13那种“结合靶标RNA后触发非特异切割”的反式切割活性,它就是天然的核酸检测模块。
SHERLOCK诊断方案的核心逻辑就是把Cas13和报告RNA放进一个体系里:样本里有目标核酸,Cas13被激活,顺带把报告RNA切断,产生荧光信号或试纸条显色。这个方案最大的好处是不需要复杂仪器,适合基层检测和田间诊断。新系统的价值在于提供更多“酶的选择”,尤其是PAM/PFS偏好不同、工作温度更宽、体积更小的新酶,能让检测panel在开发时少做很多妥协。叠加Anthropic这类公司本来就擅长的数据分析,未来甚至可能出现“AI设计检测探针+新酶诊断”的完整闭环。
4.3 合成生物学和农业育种:把“编辑”做成模块化组件
合成生物学正在把生物细胞改造成微型工厂,产药物、产材料、产燃料。改造过程中,多基因编辑是高频需求。现有工具在植物里编辑时需要依赖富含GC或AT的区域选择合适的靶点,PAM限制直接决定了很多位点“有想法但没工具”。
类CRISPR系统如果能提供新的PAM偏好和不同切割末端,就等于给植物育种人员、微生物工程人员多塞了几把不同尺寸的螺丝刀。比如Cas12a偏好T-rich PAM,对很多高AT含量的基因组特别好用;但某些物种GC含量高,这时候一个偏好G-rich或C-rich的新系统就成了刚需。农业育种上,低脱靶、高特异性的新酶还能帮助更快地做性状筛选,不用一遍遍杂交回交。
当然,这些前景全部建立在“系统稳定可用”的前提上。一个新系统从论文到工具化,中间隔着稳定性、特异性、脱靶率、递送效率、免疫原性,每一环都是工程活。
5. 我的判断:这则消息现在处于什么阶段,未来该盯哪些信号
5.1 公开材料能支持到什么程度,不要高估也不要低估
先说我的判断:目前围绕“Anthropic挖出类CRISPR新系统”的公开信息,更像是实验室阶段的重要信号,而不是已经完成工具化的产品发布。我看了一下手头能接触到的公开材料,官方正式论文或演示Demo都还没有上线,讨论更多来自社群转述、招聘动向和一些会议摘要级别的片段。
这意味着两件事。第一,不应高估到“Anthropic马上要发布新基因编辑工具”的程度;第二,也不应低估,因为这类消息很少空穴来风。AI公司开始认真构建从序列挖掘到蛋白验证的内部闭环,这件事本身已经是行业里一个值得记录的转折信号。
判断这个消息的含金量,我习惯用一个三阶段框架:干实验发现新蛋白,是第一级信号;湿实验证明可编程切割并测定PAM,是第二级信号;完成真核细胞编辑、脱靶评估、蛋白工程改造,是第三级信号。标题里的“挖出了”大概率在第一级到第二级之间。对做基础研究的开发者来说,这已经足够启发一批新课题了。
5.2 后面值得跟踪的几个节点:预印本、专利、试验数据
接下来想跟进这件事,重点盯几个信号源。
第一是预印本平台,bioRxiv和arXiv上如果出现Anthropic实验室署名的核酸酶挖掘文章,那基本可以确认消息成真。第二是专利数据库,新酶发现通常会在论文之前先申请专利,去WIPO或美国专利商标局查“Anthropic”和“nuclease”“CRISPR-like”组合,经常能比新闻稿早几个月看到实质内容。第三是官方博客和招聘页面,如果实验室在招蛋白质工程、湿实验方向的岗位,说明管线已经过了纯计算阶段,正在补实验验证和产品化的人手。
我自己的习惯是每周用固定关键词扫一轮,关键词包括“OMEGA system”“RNA-guided nuclease”“TnpB”“IscB”“Fanzor”“metagenome mining”。这类领域如果真有大动作,早期论文和专利之间的时间差通常足够让有心人提前布局。
5.3 想跟进这个方向,可以先准备什么
如果你看完这些也对“AI挖新酶”感兴趣,我给三个可直接落地的建议。
第一步,把HMMER和HHpred的基础用法过一遍,找一份已知Cas蛋白的种子序列,跑通一个从数据库下载到候选输出的最小流程。这个流程不复杂,半天就能跑通,但能让你对“远亲搜索有多难”有真实的体感。
第二步,订阅几个关键数据库的更新:NCBI的GenBank每周更新、MGnify的宏基因组新数据集、JGI的IMG最新释放。新系统发现的第一现场往往是这些沉默的数据更新,而不是热闹的新闻稿。
第三步,有条件的话,在本地部署一个ESMFold或用免费的AlphaFold服务跑一批结构预测,理解“序列差异大但结构相似”是怎么一回事。真正看懂这个,就基本能读懂所有类CRISPR发现论文的核心逻辑了。
最后说点我的个人体会。在这个领域泡久了会发现,数据库里的蛋白质其实比论文多好几个数量级,缺的从来不是“矿”,而是能把矿捞出来并验证的方法。Anthropic这类公司如果真的把语言模型的检索能力用在新酶发现上,哪怕最后不是这一个系统,整个领域也会被这种“AI挖矿”的方式重塑。消息是真是假,时间会给出答案,但趋势已经摆在这里了。