过去这一年,我周围做抗体药的朋友几乎都在聊同一个话题:AI 到底能不能直接“写”出一段能用的 VHH 序列。纳米抗体分子量小、结构域相对简单,确实成了各种生成式模型最爱的试验田;EGFR 又是实体瘤里面研究得最透彻的靶点之一,所以“AI 设计 EGFR 纳米抗体”这种说法,隔三差五就能在行业群里刷到。但真落到做药、做诊断、做临床前评价的人手里,问题就变成另一副面孔了:AI 给出来的序列能不能表达、能不能结合、能不能在小鼠身上直接做药效实验,以及你拿到的到底是不是一个“正常人血清环境下不干活、到了肿瘤酸性微环境才开始工作”的 VHH。
换句话说,“人鼠通用”和“酸性开启”这八个字,才是 AI 设计 EGFR 纳米抗体这条路上真正的分水岭。结合我自己的实操经验和对现有工具链的理解,这篇文章把这件事拆开讲透:现在 AI 设计纳米抗体能做到什么程度、跨种属交叉和 pH 敏感开关分别卡在哪、以及做这类项目时最容易踩的坑在哪。
1. 先把四个关键词拆清楚:VHH、EGFR、人鼠通用、酸性开启
1.1 VHH 到底是个什么东西
VHH,全称是重链抗体的可变区,天然存在于骆驼科动物(羊驼、骆驼、美洲驼)体内。普通 IgG 抗体是两条重链加两条轻链组成的“Y”字形结构,而骆驼科动物天然有一种只有重链没有轻链的抗体,它的抗原结合区就是 VHH。单拎出来看,VHH 只有大约 15 kDa,比常规抗体的 Fab 片段(约 50 kDa)小了一大截,比全长的 IgG(约 150 kDa)更是小了接近一个数量级。
这个“小”带来了一系列连锁优势。第一,VHH 只有约 120 个氨基酸、由单个结构域组成,大肠杆菌、酵母都能轻松表达,纯化成本低,这对早期筛选来说极其重要——几百个候选序列同时表达筛选,用传统 IgG 那套哺乳动物细胞表达系统根本跑不起这个通量。第二,VHH 的 CDR3(第三个互补决定区)通常很长,很多能长到 20 个氨基酸以上,可以像一根手指一样伸进抗原表面的沟槽、裂缝里面,结合一些常规抗体够不着的隐蔽表位。第三,VHH 热稳定性普遍不错,很多能耐受 70-80 摄氏度处理而不失活。
它也有短板。一是分子量太小导致肾小球滤过快,血浆半衰期短则几十分钟、长也不过几小时,做治疗性药物通常要加 PEG、融合白蛋白或者做多价化来延长半衰期;二是作为异源蛋白,免疫原性风险是必须面对的问题,虽然在人类中有不少关于 VHH 免疫原性较低的讨论,但“人源化改造”依然是临床开发绕不开的步骤。理解这些特点,是后面所有设计决策的前提。
1.2 为什么偏偏盯上 EGFR
EGFR(表皮生长因子受体)是 ErbB 受体酪氨酸激酶家族的成员之一,在非小细胞肺癌、结直肠癌、头颈鳞癌等一大批实体瘤里都存在高表达或异常激活。它一旦被配体激活,会启动 RAS/MAPK、PI3K/AKT 等促增殖、抗凋亡信号通路,相当于给肿瘤细胞按下了“持续增殖”的按钮。阻断 EGFR 信号通路,是目前实体瘤靶向治疗里最经典的策略之一。
现有的 EGFR 靶向抗体,比如西妥昔单抗、帕尼单抗,都是全长 IgG,主要通过结合 EGFR 胞外结构域 III、阻断配体结合来发挥作用。后来又有小分子酪氨酸激酶抑制剂(TKI)比如奥希替尼等覆盖了突变型 EGFR 的临床需求。但抗体类药物的优势在于特异性高、可调控免疫效应功能,而且能结合胞外区域,对小分子耐药后仍然高表达或产生逃逸突变的情况,抗体仍有用武之地。
VHH 在这条赛道上的价值在于:它足够小,可以结合 EGFR 上一些更隐蔽的表位;它容易做多特异性和多价设计,比如把两个不同表位的 VHH 串联成双价分子;它还方便跟毒素、核素、细胞因子偶联做成精准递送系统。文献里已经有一批公开序列的 EGFR 纳米抗体,比如结合结构域 III 的 7D12 系列,在光热治疗、放射性核素偶联、CAR-T 等领域都有探索报道。所以对做抗体的团队来说,EGFR 是一个天然适合拿 VHH 练手的靶点——靶点机制清楚、表位信息多、公开结构数据充足,AI 模型训练起来也顺。
1.3 “人鼠通用”和“酸性开启”的实际含义
先说“人鼠通用”。这个需求来自临床前动物实验的痛点:做肿瘤药效评价,最常用的模型是免疫缺陷小鼠或者同系小鼠移植瘤模型,但你拿到一个只结合人 EGFR、不结合小鼠 EGFR 的抗体,在小鼠身上做出来的抑瘤数据就很难解释——药效到底是因为阻断 EGFR 产生的,还是因为其他脱靶机制?要回答这个问题,最稳妥的办法就是拿一个“人鼠双阳性”的分子,能同时结合人和小鼠的 EGFR,这样在小鼠模型上的数据才具备转化意义。这也是很多药企在立项时会明确写进 target product profile(TPP)里的一条硬指标。
“酸性开启”则有两层理解,做不同应用场景选的方向完全不同。第一种是肿瘤微环境酸性激活:肿瘤组织因为糖酵解旺盛,细胞外 pH 通常在 6.5-6.8 左右,而正常组织的 pH 在 7.4。如果设计一个在中性 pH 下不结合或弱结合、在肿瘤酸性 pH 下才强结合的 VHH,就能把“攻击”限定在肿瘤局部,减少对正常 EGFR 高表达组织的毒性风险。第二种是内体酸性释放:VHH 结合 EGFR 后会被内吞进入细胞内,内体早期的 pH 从 7.4 降到 5.5-6.0,如果 VHH 在这个 pH 下从抗原上解离,反而有利于受体循环、或者有利于 ADC 的 payload 在溶酶体里释放。这两种逻辑正好相反,一个想在胞外酸性区“增强结合”,一个想在胞内酸性区“松开手”,做设计的时候必须先把这个语义定清楚。
2. AI 设计 VHH:现在到底能干到哪一步
2.1 设计工具的主流派系
目前圈子里用来做抗体序列设计的 AI 工具,大致可以分成三派。第一派是结构预测派,以 AlphaFold2/AlphaFold3、ESMFold 为代表,输入抗体序列,预测它的三维结构甚至抗体-抗原复合物结构。AlphaFold3 支持直接预测纳米抗体和 EGFR 这类抗原的复合物构象,这给后续的“虚拟筛选”提供了基础。第二派是生成式设计派,包括基于扩散模型的 DiffAb、IgDiff,基于 Transformer 或者蛋白质语言模型的 ESM-2 微调模型、ProtGPT2,以及 RosettaAntibodyDesign 这样的物理能量函数驱动方法。它们可以从一个表位出发,生成一段全新的 CDR 序列,相当于让 AI 当“灵感生成器”。第三派是打分增强派,ABlooper、IgFold 专门做 CDR loop 的快速结构预测,DeepAb 可以预测抗体的稳定性和表达倾向,ESM 的 embedding 可以训练分类器去预测“能不能结合”,这些工具适合放在生成后面做过滤器。
对于 VHH 来说,一个有利条件是它的结构高度规则:框架区(framework region)在所有 VHH 里非常保守,只有 CDR 三个环在做变化。这意味着模型生成的时候,可以把框架区固定住,只生成 CDR1、CDR2、CDR3 的序列,搜索空间比全长抗体小很多,训练和验证的成本也低。这就是为什么 VHH 成了“AI 抗体设计”最容易出成果的载体。
2.2 一条可以落地的完整设计流程
拿一个典型任务举例:给定人 EGFR 的一个目标表位,让 AI 出一批 VHH 候选序列。我现在建议的流程大致是五步。
第一步,定义表位。从 PDB 数据库里找 EGFR 胞外区的晶体结构或冷冻电镜结构,结合已知抗体结合区域,确定你想让 VHH 去“贴”的那几个残基。比如想做配体阻断,就选结构域 III 上配体结合界面附近的一组残基;想做非阻断型内吞表位,就选结构域 II 或 IV 上更保守的区域。把表位残基的坐标从结构里抠出来,作为生成模型的约束条件。
第二步,选择骨架。从 SdAb 数据库或者文献里收集一批高表达、高稳定性的 VHH 天然骨架序列,作为生成模型的“底盘”。骨架选择直接影响后续的可开发性,这是我最看重的点——AI 生成一个结构新颖的 CDR3 并不难,难的是这个 CDR3 挂在任何一个骨架上都能稳定折叠。建议选 2-3 个来自不同种系(IGHV3 家族常见)的骨架平行跑,不要一开始就梭哈到一个骨架。
第三步,生成序列。把表位坐标和骨架分别输入扩散模型或者 Rosetta 流程,每个骨架生成 500-1000 条 CDR3 变体。这一步产出的是“候选海洋”,里面绝大多数不能用,没关系,接下来过滤。
第四步,计算打分过滤。我用的是一个多级漏斗:先用 AlphaFold3 或 HDock 把候选序列体和表位做对接,看复合物的几何互补性和界面能;再用 Rosetta 的能量函数算一遍结合自由能变化(ddG);最后用 ESM-2 的 embedding 做一个二分类器,把跟已知可表达 VHH 特征偏差太大的序列直接淘汰。每个步骤都会筛掉一批,最后留下 20-30 条序列做实验验证。
第五步,实验闭环。把候选序列合成基因,克隆到大肠杆菌周质表达载体里,做小量表达、纯化,然后分别用 ELISA、生物膜干涉(BLI)或表面等离子共振(SPR)测结合活性。这里有一个关键策略:千万不要只测亲和力,要把热稳定性(Tm)、表达量、单体和二聚体比例一起测了。因为后续要做“酸性开启”的组氨酸突变,母本的表达量和稳定性不好,后面再做几轮突变大概率直接崩溃。
2.3 AI 现在最大的短板:结合自由能预测仍然不可靠
必须泼一盆冷水:AI 设计 VHH 目前能稳定解决的,是“给出一个看起来合理、实验里有一定概率能结合的序列”;它还不能解决的是“精确预判亲和力能不能达到纳摩尔级”。原因在于,抗体-抗原结合本质上是一个高度动态的过程,涉及构象变化、水分子重排、盐桥形成和断裂,而当前的结构预测模型对“绝对结合自由能”的计算精度还没有本质突破。AlphaFold3 的 ipTM 分数能告诉你大概有没有接触,但它给出的复合物结构误差通常在 1-2 埃以上,这个级别的误差对判断一个盐桥能不能形成来说,基本等于开盲盒。
所以我的结论是:AI 是“候选生成器”和“实验假说来源”,但不是“最终答案”。谁要是跟你说 AI 设计的 VHH 能跳过实验直接成药,那大概率是在画饼。真正的价值在于,AI 让每一步实验的命中率从“筛十万个”提升到“筛几十个”,把项目周期从以年为单位压缩到以月为单位。
3. “人鼠通用”这条路上真正的坎
3.1 表位选择决定了天花板的80%
人 EGFR 和小鼠 EGFR 的胞外区序列同源性总体在八成以上,但不同结构域的差异差别很大。结构域 I 和 III 包含了配体结合核心区域,相对保守;结构域 IV 和部分连接区域在种属之间的差异明显更大。所以“人鼠通用”的第一步不是做 AI 设计,而是先做序列比对和结构比对,找到那些在种属之间完全保守、又暴露在分子表面的残基组合。
实际操作里,我会把人 EGFR 和小鼠 EGFR 的胞外结构域分别建模,然后把结合界面上每一个可能的接触残基做“保守性打分”,只保留那些在人和鼠序列里完全一致、且在空间位置上不因为糖基化修饰差异而导致遮挡的残基。EGFR 是高度糖基化的蛋白,人的 N-糖基化位点跟小鼠不是一一对应的,有些位点在结构上正好卡在你想要的表位旁边,糖链会形成巨大的立体位阻,这个问题很容易被 AI 模型忽略,因为大多数模型根本不知道糖链的存在。这一步没有捷径,只能靠人工看结构。
3.2 序列一致不等于结合一致:立体化学层面的坑
就算你选中的表位残基在人和鼠里面完全一样,也不能保证一个 VHH 能同时结合两个种属。原因在于,表位是“表面上的一个补丁”,而补丁周围的残基、补丁所在 loop 的柔性、补丁的凹凸形状,都可能因为少量序列差异而发生整体改变。这就好比同一个门把手,装在不同凹凸程度的墙面上,手要怎么伸过去握它,其实是不一样的。
具体到 EGFR 这个靶点,文献里很多针对结构域 III 的抗体都存在种属交叉不佳的问题,因为结构域 III 的几个 loop 区域在人鼠之间的构象存在细微差异。AI 在这里能帮的忙是“双受体协同设计”:把过滤模型改成同时对接人 EGFR 和小鼠 EGFR 两个结构,要求候选序列对两个受体预测的打分都超过阈值,而不是只按人 EGFR 打分。我试过这个方案,它不能保证所有序列都双阳性,但能明显提高双阳性的比例,把后期实验筛选的压力大大前移。
3.3 跨种属筛选的实验设计:别把双阳性留在最后一步
实验端的策略同样关键。很多团队的习惯是先用纯化的人 EGFR 蛋白把候选序列筛一遍,选出亲和力最好的,然后再去测小鼠 EGFR 的交叉反应性。这个顺序从效率上看是反的。更合理的做法是:从第一批 20-30 个候选序列开始,就同时用人 EGFR 和小鼠 EGFR 做平行 ELISA 和 BLI 测定,两边的信号都要过线才进入下一步。
我一般定的接受标准是:对人和小鼠 EGFR 的亲和力都优于 100 nM,且两者的差别不超过 5 倍。这个标准不是拍脑袋定的,而是考虑到后续做体内实验时,需要保证在小鼠肿瘤模型上的靶点占有率跟人体相当,差距太大,药效数据就失去了量效关系的可解释性。另外,早期筛选一定要用商品化或自制的重组人鼠 EGFR 胞外域蛋白做初筛,等候选序列缩小到 5-10 条之后,再换 EGFR 高表达细胞系(比如 A431 是人 EGFR 高表达、B16F10 或 CT26 是小鼠 EGFR 表达细胞)做流式验证,这一步是为了排除重组蛋白和细胞膜表面天然受体之间的构象差异。
4. “酸性开启”到底怎么设计出来
4.1 为什么所有 pH 敏感设计都绕不开组氨酸
生物分子里的 pH 敏感开关,十有八九是组氨酸(Histidine, His)在起作用。原因是组氨酸的咪唑基侧链 pKa 大约在 6.0,正好落在生理 pH(7.4)、肿瘤微环境 pH(6.5-6.8)、内体 pH(5.5-6.0)这三个关键值的区间之内。pH 7.4 的时候组氨酸大部分不带正电荷,pH 降到 6.0 以下之后,组氨酸开始被质子化带上正电荷,这一下就能改变它和周边残基的静电相互作用,从而改变结合亲和力。
所以“酸性开启”的设计说白了就是一句话:在 VHH 与 EGFR 的结合界面上,引入合适的组氨酸突变,制造一个“pH 依赖的静电开关”。当然这只是原理,真正做起来,要考虑的问题比想象中多得多。做这类设计,第一步是在候选 VHH 的 CDR 区里找出所有和 EGFR 表面残基距离较近(比如 4-6 埃)的氨基酸位置,对这些位置逐一做组氨酸定点突变扫描,也叫 His-scanning;然后通过计算预测,每个位置的组氨酸突变在 pH 7.4 下是否维持结合、在 pH 6.0 下是否因为质子化产生电荷排斥或新的电荷吸引。
4.2 两种“酸性开启”的设计方向:肿瘤激活和内体释放
前面说过,酸性开启的语义有两种,设计策略也完全不同。
如果你要的是肿瘤微环境激活型——也就是中性 pH 不结合、酸性 pH 强结合——可以在 VHH 和抗原界面引入这样的组氨酸:它在未质子化状态(pH 7.4)下与 EGFR 表面负电荷残基产生排斥或者形成不利的静电作用,导致结合太弱;一旦进入肿瘤酸性微环境(pH 6.5-6.8),组氨酸质子化带上正电,反而和 EGFR 表面负电区域形成新的盐桥,结合被“打开”。这个方案的难点在于“开关比”——就是酸性条件下的结合与中性条件下的结合之比。我见过很多设计在低 pH 下确实结合了,但中性 pH 下也还有个“关不掉”的残余结合,这个残余结合会导致正常组织里的持续靶点占用,毒性风险马上就会上来了。
如果你要的是内体释放型——也就是中性 pH 强结合、进入内体酸性环境就解离——设计反而更常见,很多 pH 依赖抗体走的都是这条路。做法类似,但是逻辑是反的:组氨酸在 pH 7.4 下不带电,不影响结合;进入内体后质子化带上正电,和 EGFR 表面同样带正电的残基排斥,迫使 VHH 脱落。这种设计的好处是,VHH 把一个“内吞货物”运进细胞后及时松手,货物可以在溶酶体里被释放,而 VHH 本身可能随受体循环回细胞表面,实现“一种类似催化剂”的多次递送。这类抗体已经有临床应用先例,比如针对 IL-6R 的 pH 依赖抗体,证明了整个策略在人体里是可行的。
4.3 计算设计与实验验证的闭环
做 pH 敏感设计,计算端我建议至少跑三层。第一层,用 PropKa 或者 MD 模拟里的 constant-pH 方法,预测每个组氨酸突变在目标 pH 下的质子化状态和 pKa 偏移。第二层,用分子动力学模拟(GROMACS 或 OpenMM 都行)分别跑 pH 7.4 和 pH 6.5 两个条件下的复合物轨迹,看界面上的关键相互作用是否稳定存在。第三层,把模拟结果里“pH 7.4 稳定、pH 6.5 不稳定”或者反过来“pH 7.4 不稳定、pH 6.5 稳定”的突变组合挑选出来,做一个 10-20 个突变体的中等规模实验验证库。
实验端的验证方法也要同步升级。常规的 BLI(比如 Octet)可以直接在 pH 7.4 和 pH 6.5 两个缓冲液体系下分别测结合和解离曲线,这是我最常用的手段;如果条件允许,再用差示扫描量热(DSC)或荧光热位移(nanoDSF)测一下 Tm,因为组氨酸突变经常把 VHH 的热稳定性拉低三五度,这对后续成药性来说是不小的隐患。注意一点:做 pH 对比实验时,缓冲液体系最好用同样的离子强度和成分,只改变 pH,否则你测出来的差异可能是盐浓度造成的假象,不是真正的 pH 效应。
5. 实操阶段踩过的那些坑
5.1 AI 预测高分手候选,实验里完全没信号
这是 AI 抗体设计里最让人沮丧的场景:AlphaFold3 给的复合物结构看起来严丝合缝,Rosetta 能量打分也很好看,结果表达纯化完一测,结合信号跟阴性对照一样。我复盘这类项目,原因通常有三个:第一,AI 模型的训练数据里抗体-抗原复合物结构太少,对于某些特殊表位(尤其是构象柔性的 loop 表位),它本质上是在“外推”,而不是在“推断”;第二,候选序列虽然在理论上能结合,但实际表达出来的蛋白折叠状态跟天然构象不符,说穿了是蛋白本身没折叠好;第三,BLI 或者 SPR 实验的缓冲液条件(去垢剂、盐浓度、pH)跟计算模拟用的环境不一致。
遇到这种情况,我的第一反应不是质疑 AI,而是回到实验本身。先把候选序列的 SEC(体积排阻色谱)跑出来,看看主峰是单体还是聚集峰,再跑一张圆二色谱或者非变性胶,确认蛋白有没有正确折叠。如果折叠没问题,那就换一个检测平台重新测,比如 ELISA 和 BLI 交叉验证。如果这些都做了还是阴性,直接放弃这个候选,不要恋战——AI 设计项目的核心逻辑是大数筛查,命中率 5%-10% 已经算很好,与其在一个候选上死磕,不如把预算花在扩大筛选规模上。
5.2 人鼠双阳性找到了,表达量却一落千丈
另一个高频坑是:经过双受体筛选出来的序列,确实人鼠都结合,但表达量从母本的每升几十毫克掉到每升不到一毫克。这种情况在引入组氨酸突变后尤其常见,因为组氨酸的咪唑基比很多疏水侧链更容易在折叠中间体阶段制造错误相互作用,导致包涵体比例猛增。我见过最夸张的一个突变体,Tm 从 76 度跌到 58 度,表达量直接掉了一个数量级。
这个问题基本没有取巧的办法,只能靠工程迭代。我的习惯是,在拿到一个 pH 响应好的突变体之后,立刻做一轮“稳定性回补”:要么在框架区引入已知的热稳定性增强突变(很多 VHH 在框架区某些位置有一个逐渐被验证出有益作用的突变组合),要么把出问题的 CDR 突变体跟一个高稳定性骨架做移植。要记住,pH 敏感设计从来不是一步到位的,它是“设计-验证-补稳定性-再验证”的循环。
5.3 酸性开启做出来了,特异性却变差了
还有一类问题藏得更深:做完组氨酸扫描之后,你确实得到了一个 pH 响应的 VHH,但它的非特异性结合明显上升,ELISA 背景高得离谱。这是因为组氨酸在带电状态下有一定假阳性的静电粘附倾向,它可能跟 BSA、跟其他无关蛋白产生弱相互作用。遇到这种情况,我的排查顺序是:先做一个 polyspecificity reagent(PSR)结合测试,如果 PSR 阳性,就把组氨酸突变的位置从 CDR 的末端挪到 CDR 的内部,或者调整突变位点使它更多参与和 EGFR 的直接相互作用。另外,可以在测试缓冲液里加一点温和的竞争性试剂(比如低浓度的肝素或高盐),观察非特异结合是否被抑制,这能帮你判断静电贡献到底占多大比重。
5.4 常见问题速查表
| 问题现象 | 可能原因 | 优先排查动作 |
|---|---|---|
| 计算高分但测不到结合 | 蛋白折叠错误、缓冲液不匹配、模型外推 | SEC/非变性胶查折叠;ELISA 与 BLI 交叉验证 |
| 双阳性但表达量低 | 组氨酸突变破坏折叠、CDR 过于疏水 | 换骨架、做稳定性回补突变、降低诱导温度 |
| 酸性结合有了,中性仍有残余 | 质子化不完全、存在其他静电贡献 | 考察双组氨酸协同突变、调整界面电荷配伍 |
| 特异变差、背景高 | 静电粘附、CDR 暴露面积大 | PSR 测试、高盐/肝素竞争分析、调整突变位置 |
| 体内半衰期不足 | VHH 分子量小被肾清除 | 融合白蛋白/抗体重链 Fc、PEG 化、多价化改造 |
这张表是我做这类项目时反复翻的清单,基本上能覆盖 80% 的早期开发问题。
6. 我自己的总体判断:距离目标还有多远
先说结论:如果“人鼠通用”指的是通过 AI 设计加一轮筛选,稳定拿到能同时结合人和小鼠 EGFR 的候选 VHH,我认为这个目标已经近在眼前,甚至在表位选择得当的情况下,现在就有团队能稳定复现。核心难点从“能不能做出来”变成了“能不能每一批都稳定做出来”,而这是流程和通量问题,不是科学原理问题。
“酸性开启”则要诚实地说,还处在一个“原理清晰、工程粗糙”的阶段。我们能预测组氨酸突变的位置,能做出一批 pH 响应明显的突变体,但要做到同时满足“高开关比、高亲和力、人鼠通用、高表达、高稳定性、低免疫原性”全项达标,目前还没看到哪一个公开案例完全做到。这里面的核心瓶颈在于,pH 敏感开关本质上是一个多物理因素的协同问题:静电、氢键、疏水效应、构象柔性全都搅在一起,而计算模型对这些因素的协同预测能力还没有达到可以闭眼信任的程度。
我个人在实际项目中的做法是,把 AI 当成一个“放大器”而不是“预言家”:用 AI 把候选库从几万条压缩到几十条,用实验把这几十条里真正能用的几条挖出来,再用工程化手段把这几条打磨成稳定的分子。对于想做这个方向的团队,我的建议很直接:一定要先把“实验筛选闭环”建好,再谈 AI 模型的高级玩法。没有高通量表达和结合检测的硬能力,AI 设计得再好,也会卡在验证这一环上,变成一堆永远躺在 Excel 表格里的序列。反过来,只要这个闭环转起来了,“AI 设计 EGFR 纳米抗体”就不再是新闻标题,而是实验室里每周都在发生的日常。