↩ 研究与项目/超级肽入门读本

第 11 章 AI 从头设计:从 RFdiffusion 到迷你蛋白

The Super-Peptide Primer · 13

本章回答:AI 现在真的能设计出什么样的多肽与蛋白,以及它还不能做什么。

11.1 三件不同的事:预测、生成、评分

公众讨论里的"AI 设计蛋白质"其实是三件独立的事,它们的成熟度差别很大,混为一谈是大部分误判的来源。

第一件是预测。给定一条氨基酸序列,算出它折叠成什么三维形状。这是 AlphaFold2 在 2020 年的 CASP14 竞赛上解决到接近实验精度的问题。第二件是生成。给定一个目标,例如"造一个能贴住这块蛋白表面的新分子",直接产出自然界不存在的序列与结构。这是 RFdiffusion 一类扩散模型在 2023 年之后做的事。第三件是评分。给定一个候选分子,预测它的亲和力、稳定性、溶解度、免疫原性、口服吸收和体内半衰期。这一件至今做得最差,而它恰恰是决定一个分子能不能成药的关键。

用一个类比:预测像是看懂一门语言,生成像是用这门语言写新句子,评分则是判断这句话在真实社交场合会不会被接受。前两件已经做得很好,第三件还停留在初级阶段。类比到此为止,回到机制:前两件之所以能被解决,是因为蛋白质数据银行(PDB)里有超过 20 万个实验解析的结构,加上数亿条序列,构成了足够大的监督信号;第三件之所以难,是因为亲和力、毒性、药代这些数据分散在各家药企内部,公开数据量小、口径不一、且大量阴性结果从未被记录。

把数据规模摆出来更清楚。蛋白质数据银行到 2026 年收录约 23 万个实验解析的结构,UniProt 的序列条目超过 2.5 亿条,宏基因组测序又贡献了数十亿条序列片段。相比之下,公开的蛋白质与配体结合亲和力数据库量级在百万条,且测定条件五花八门;公开的人体药代数据以千计;公开的免疫原性数据更少,而且几乎都是阴性样本缺失的。数据量差了三到五个数量级,能力差距就出现在那里。这条规律对本书的核心论点是直接支撑:智力的提升不能凭空造出不存在的数据,而缺数据的那几项恰好是决定药物成败的那几项。

11.2 预测层:AlphaFold 3 与它的商品化

AlphaFold 3 于 2024 年 5 月 8 日由 Google DeepMind 与 Isomorphic Labs 共同发布。相比只处理蛋白质单链与复合物的第二代,它能预测蛋白质与 DNA、RNA、配体、离子以及翻译后修饰的共同结构,官方宣称在蛋白质与其他分子的相互作用上比既有方法至少提高 50% 的准确度,在小分子结合姿态上优于传统对接程序。代码与权重在 2024 年 11 月按申请开放给非商业用途,2025 年 2 月进一步公开,商业使用限制保留。

AlphaFold2 的社会影响需要用数字记录,因为它是"设计趋近免费"最早也最彻底的一次演示。DeepMind 与欧洲生物信息研究所在 2021 到 2022 年间发布了覆盖超过 2 亿个蛋白的结构预测数据库,免费开放,使用者超过两百万。在此之前,解析一个蛋白结构平均需要数月到数年、花费数万到数十万美元。一项曾经构成博士学位主体工作量的任务,变成了一次网页查询。同时必须写下另一半事实:到 2026 年,没有任何一个药物因为 AlphaFold 而获批。结构预测缩短的是研究周期的前端,而药物开发的时间成本主要在后端。

限制同样清楚,而且在药物发现场景中很致命。第一,对与训练集相似度低的样本,准确度明显下降,而新药研发关心的恰恰是新颖靶点。第二,它只能处理有限的辅因子和修饰类型,人类蛋白质组中相当一部分结构因为缺少糖基化等修饰而不完整。第三,它给出的是一个静态构象,而蛋白质的功能往往取决于构象之间的切换,别构调节、隐藏口袋、无序区域这些最有药物开发价值的现象,静态预测看不到。第四,模型会自信地输出错误结构,置信度指标只是部分可靠的护栏。

结构预测的商品化速度是本章最值得注意的信号之一。2020 年 AlphaFold2 出现时,这被视为几十年一遇的成果;到 2026 年,能做结构预测的开源模型已经有一批,包括 OpenFold、ESMFold、Boltz 系列、Chai-1 等,其中多个以宽松许可发布,任何研究组都可以免费使用。Boltz-2 在 2025 年公布时宣称在结合亲和力预测上接近自由能微扰计算的精度,而速度快约 1,000 倍。一项能力从"世界级突破"到"开源标配"用了不到五年。

同期发生的组织变动值得记录:2026 年,Google 解散了 AlphaFold 团队,成员大部分调往 Gemini,一部分转入 Isomorphic Labs 或离职。Isomorphic Labs 在 2026 年据报道完成约 21 亿美元融资,并宣布新的药物设计引擎,称相对 AlphaFold 3 在设计准确度上提高约一倍。把这两件事放在一起读:预测本身不再是生意,作为药物公司的内部能力才是。

11.3 生成层:扩散模型与迷你蛋白

生成式蛋白设计的主流工作流由三个模块串成,2026 年几乎所有团队都在用它的变体。

第一步用扩散模型生成骨架。RFdiffusion 由华盛顿大学 David Baker 实验室在 2023 年发布,做法是把图像生成里的去噪扩散过程搬到蛋白质主链坐标上:从随机噪声出发,逐步去噪,最终得到一段物理上合理的三维骨架,并可以约束它必须贴合给定靶点的某个表位。第二步用 ProteinMPNN 之类的逆折叠模型,为这个骨架填上最可能折叠成它的氨基酸序列。第三步用 AlphaFold2 或同类模型对候选序列做正向预测,只保留预测结构与设计目标高度吻合、且置信度高的少数候选,再送去湿实验。

还有一类方法值得一提,叫幻觉法(hallucination)。做法是反过来用结构预测模型:给它一条随机序列,让它预测结构,再用梯度或蒙特卡洛的方式不断修改序列,直到预测出的结构满足设定目标。这条路线在扩散模型出现之前是主流,现在仍用于一些难以用骨架约束描述的任务。它的缺点是容易生成"模型自己相信、实验不认"的序列,也就是把预测模型的偏差当成了设计目标,这个失效模式在评估任何一家公司的输出时都应当被问到。

这条工作流最适合的产物是迷你蛋白(miniprotein),通常 50 到 80 个氨基酸,含两到三段 α 螺旋,结构刚性强、稳定性高、可以化学合成或微生物表达。它比抗体小 20 倍,能进入组织和肿瘤更深的位置;比传统多肽刚性强,亲和力可以做到纳摩尔甚至皮摩尔。AI Proteins 是这个方向的代表公司,完成 4,150 万美元 A 轮融资,与百时美施贵宝的合作总额最高 4 亿美元。

多肽和迷你蛋白在这条工作流上比抗体和小分子更占便宜,原因有三。其一,设计变量是离散的氨基酸序列,模型天然擅长离散序列生成,而小分子的化学空间是连续且受合成可行性约束的。其二,分子小,结构预测的置信度高,模型犯错的空间小。其三,从设计到实物只需要一次固相合成,几天就能拿到几十条肽做测试,而抗体需要构建表达载体、转染、纯化,周期以周计。设计与实验的循环越短,模型的价值越大。这是第 3 章"多肽是 AI 原生模态"这一判断在工程层面的具体含义。

2024 年的诺贝尔化学奖把这条线的地位固定下来:一半授予 David Baker 表彰计算蛋白设计,另一半授予 Demis Hassabis 与 John Jumper 表彰结构预测。这是一个关于智力端能力的明确信号。

对多肽而言更相关的进展是把生成模型用到大环上。Baker 实验室在 2025 年于《自然》发表的工作,用类似方法从头设计能高亲和力结合给定蛋白的大环肽,环大小在 7 到 14 个残基之间,通过化学合成验证,并用晶体结构确认设计与实测吻合。这件事的意义在于把第 9 章讲的展示技术与计算生成接到了一起:展示技术的库容量是 10 的 12 次方但化学空间受限于可翻译的砌块,计算生成的空间没有上限但受限于验证通量,两者互补。

11.4 湿实验验证率:最容易注水的数字

这个领域所有宣传的成色,都取决于一个问题:设计出来的分子,有多少比例在实验室里真的有活性。回答这个问题必须先厘清分母。

传统的定向进化或展示筛选,命中率通常用"筛了多少个分子得到多少个结合物"来算,分母是 10 的 10 次方量级,命中率的绝对值极低但绝对数量足够。生成式设计的命中率则是用"合成并测试了多少个设计得到多少个结合物"来算,分母通常是几十到几百。两种口径的数字不能直接比较,而公司宣传中经常混用。

公开可核查的几个数据点如下。RFdiffusion 最初发表时,从头设计的结合蛋白在不同靶点上的实验成功率差别很大,从不足 1% 到十几个百分点,且高成功率通常出现在表位明确、表面有疏水凹陷的"容易"靶点上。Chai Discovery 在 2025 年 6 月发布 Chai-2 时宣称,在从头抗体设计上达到约 16% 的命中率,相比此前普遍报道的千分之一量级提高约两个数量级,并在测试的靶点中有相当比例至少得到一个结合物。2026 年该公司在融资材料中提到"抗体设计效率提高 150 倍"的说法。这些数字大概率是真实的,但需要三层折扣。

第一层,"结合"不等于"有功能"。设计出一个能贴住靶点的分子,与设计出一个能阻断特定通路、或激动某个受体的分子,难度差一个数量级。多数公开的成功案例报告的是结合亲和力,而不是功能活性。第二层,"有功能"不等于"可开发"。溶解度、聚集倾向、化学稳定性、生产表达量、免疫原性,每一项都可能在后期把分子淘汰掉。行业经验是从苗头分子到临床候选的淘汰率超过 95%,AI 目前主要加速的是苗头阶段。第三层,"可开发"不等于"临床有效"。到 2026 年,至少有 15 个临床阶段的多肽由 AI 或机器学习方法识别或显著优化,但还没有任何一个完全由生成模型从头设计的分子获批上市。首个被广泛宣传的 AI 设计小分子在 2023 年进入二期后未能达到预期,这提醒人们设计环节的加速不会自动传导到临床成功率。

两个可以核查的成功案例值得记住。2020 年,Baker 实验室设计的迷你蛋白 LCB1 能以皮摩尔亲和力结合新冠病毒刺突蛋白的受体结合域,在小鼠实验中显示保护作用,从设计到验证不到几个月,这是从头设计蛋白第一次在真实公共卫生事件中给出有意义的答案。2025 年,同一实验室发表用生成模型设计的迷你蛋白,能中和眼镜蛇毒素中的三指毒素,在小鼠攻毒模型中提供保护。这两个案例的共同点是靶点表面清楚、需要的功能就是"结合并阻断"、且终点在动物层面可快速判定。它们准确地界定了当前能力的适用范围。

需要区分两种"AI 参与"。一种是识别或生成了全新的分子骨架,另一种是对已有分子做优化,例如把一条天然多肽的半衰期从 2 分钟延长到几十小时、或把亲和力提高十倍。共享事实表里那 15 个以上临床阶段多肽,绝大多数属于后一类。这不是贬低,优化恰恰是目前商业价值最确定的应用,礼来、诺和诺德、安进内部都有规模不小的团队在做。但在阅读公司材料时,把"AI 识别"与"AI 优化"区分开,能避免高估技术成熟度。

评估任何一家公司时应当问的是:测试了多少个设计,分母是多少,是不是前瞻性盲测,有没有第三方重复,功能活性如何,以及失败的项目是什么。能痛快回答这六个问题的公司,比宣传命中率的公司可信得多。

11.5 玩家地图与 2026 年的价格

公司核心资产2026 年关键事件金额
Isomorphic LabsAlphaFold 3 后继引擎据报道完成大额融资并推出新设计引擎约 21 亿美元
Generate BiomedicinesChroma 生成模型,GB-08952 月 27 日纳斯达克上市,代码 GENB募资 4 亿美元,估值约 22 亿美元
Chai DiscoveryChai-1、Chai-27 月完成新一轮融资,与礼来合作4 亿美元
ProfluentProGen3、OpenCRISPR4 月与礼来就 AI 设计重组酶达成合作最高 22.5 亿美元
Xaira Therapeutics虚拟细胞与蛋白设计推出 X-Cell 模型启动资金约 10 亿美元
AI Proteins迷你蛋白与百时美施贵宝合作A 轮 4,150 万美元,合作最高 4 亿美元
EvolutionaryScaleESM3、ESM Cambrian蛋白语言模型持续迭代未披露
Latent LabsLatent-X 网页版设计工具面向研究者开放使用未披露
Syneron BioAI 多肽平台4 月 B 轮1.5 亿美元
Galux(韩国)蛋白结构生成2 月 B 轮2,900 万美元,累计 4,700 万美元

读这张表要注意两件事。第一,除 Generate 之外,表中所有金额都是私募融资或合作的名义总额,其中合作金额的绝大部分是里程碑,只有在分子推进到特定阶段才会兑现,历史经验是此类合作总额的实际兑现比例常低于两成。第二,这些资金的用途结构在 2026 年发生了明显变化:越来越大的比例投向自动化湿实验室、蛋白表达与纯化产线、以及自有数据生产,而不是算力与模型研发。Xaira 把相当部分资金投入实验平台,Unnatural Products 强调大规模平行合成,这都是同一个方向。资本正在为数据和实验通量定价,而不是为模型定价。

Generate Biomedicines 的上市过程是这一年最有信息量的事件。公司由 Flagship 孵化,核心模型 Chroma 是一个蛋白生成扩散模型,主要资产 GB-0895 是一个针对 TSLP 的抗体,已进入重度哮喘三期。2026 年 2 月 4 日递交招股书,2 月 23 日定出约 22 亿美元的目标估值,2 月 26 日按每股 16 美元定价募资 4 亿美元,2 月 27 日挂牌首日破发。6 月英伟达参与投资。8 月约 1.03 亿股解禁,股价单日下跌约 20%。

这条曲线说明了一件事:公开市场对"AI 设计平台"这个故事本身给的溢价有限,定价锚定的是那个进入三期的抗体,而不是模型。这与本书核心论点一致,也与第 25 章要展开的推演一致。

中国的玩家不能略过。晶泰科技(XtalPi)以计算化学与自动化实验室为主业,2024 年在香港上市;百图生科(BioMap)由李彦宏与刘维发起,主打生命科学大模型并与多家跨国药企合作;深势科技在分子模拟方向有较强积累;华为、腾讯、字节跳动均发布过蛋白结构或分子生成模型。中国团队在算法上与国际前沿的差距不大,真正的差距在两处:一是自有的高质量实验数据积累,二是把设计结果推进到国际多中心临床的能力。这两处恰好又是本书认为不会被智力压掉的部分,因此对中国的 AI 制药公司而言,与有临床能力的药企长期绑定,比继续堆模型参数更重要。

蛋白语言模型是另一条技术路线。它不预测结构,而是把数亿条蛋白序列当作语言来训练,学习氨基酸之间的统计规律,代表是 Meta 的 ESM 系列与后续由原团队成立的 EvolutionaryScale 推出的 ESM3。ESM3 最有名的展示是生成了一个与已知绿色荧光蛋白序列相似度约 58% 的全新荧光蛋白,作者称这相当于跨越了自然演化数亿年的距离。这条路线的价值在于它不需要结构数据,可以直接在序列层面做生成和优化,对多肽这种以序列为主要设计变量的模态尤其合适。

11.6 能做与不能做

能力2026 年的真实水平判断
序列到结构预测高相似度样本接近实验精度已商品化
给定表位的结合物设计命中率百分之几到十几可用,需大量湿实验
亲和力成熟与稳定性优化可靠,是最成熟的工业应用可用
大环与非天然骨架生成2025 年起有验证案例早期可用
功能激动剂设计远难于结合物部分可做
膜穿透与口服吸收预测基本不可靠不能做
免疫原性预测只能排除明显风险不能做
体内半衰期与药代预测经验规则优于模型不能做
毒性与脱靶预测弱不能做
靶点选择与生物学假设模型无法验证因果不能做

免疫原性为什么特别难,值得解释一下,因为它是多肽药物失败的常见原因。人体免疫系统识别外来蛋白依赖 T 细胞表位的呈递,而呈递取决于个体的 HLA 基因型,人群中 HLA 有数千种变体。这意味着同一个分子在不同人身上的免疫反应可能完全不同,而任何模型能拿到的训练数据都来自有限人群的有限观察。更麻烦的是,抗药抗体往往在给药数月后才出现,等到发现时已经进入临床后期。非天然氨基酸和 D 型氨基酸可以降低风险,但无法消除。到目前为止,最可靠的做法仍然是做实验和长期随访,而不是预测。

三条最需要记住的边界。其一,AI 擅长的是"给定一个明确的物理目标,在巨大空间里搜索"。当目标能被写成几何与能量的形式,例如贴合一块指定表面,模型表现很好;当目标是"在人体里安全有效"这种无法形式化的东西,模型没有着力点。其二,数据决定边界。结构数据公开且量大,所以结构预测被解决;药代与毒性数据封闭且稀少,所以这两项落后。这意味着掌握人体数据的一方在长期竞争中位置更好,这正是本书四大不可压缩资产中"人体数据"一项的技术解释。其三,湿实验通量是真实瓶颈。生成一万个设计只要几小时,合成并测试一万个分子要几个月和数百万美元。这也是"大规模平行合成加直接到生物学"这套实验工程在 2026 年比模型本身更被看重的原因。

还有一个常被忽略的边界:模型无法告诉你该做哪个靶点。选靶点是一个因果生物学问题,需要人类遗传学证据、疾病机制理解和对既往失败的判断,而这些无法从序列与结构数据中推出。过去二十年里最昂贵的失败,例如阿尔茨海默病领域的一系列淀粉样蛋白项目,错的都不是分子设计而是靶点假设。生成模型只会让错误的靶点更快地拿到漂亮的分子。

11.7 设计免费之后

如果把上面的事实压缩成一句话:设计一个能结合给定靶点的多肽或迷你蛋白,成本正在快速趋近于零,而把它变成药的成本几乎没变。

把成本曲线量化一次。传统路径上,从靶点确认到得到一个可优化的苗头分子,行业经验值是 18 到 30 个月、500 万到 3,000 万美元,主要花在高通量筛选与后续化学优化上。2026 年用生成模型加大规模平行合成,同样的产出在顺利的情况下可以压到 3 到 9 个月、50 万到 300 万美元,其中绝大部分成本已经转移到合成与测定这些物理环节。再往前看,如果实验自动化继续降本,苗头发现的成本会继续下降,但三期临床的 2 亿到 10 亿美元与 4 到 8 年时间不会因此改变。整个研发成本结构里,被压缩的那一段本来就只占个位数百分比。这是本书杠铃策略的算术基础。

这对平台公司意味着两条活路,没有第三条。第一条是变成药企,用自己的模型产出管线,承担临床风险,用临床数据兑现价值。Generate Biomedicines 走的就是这条,它的估值锚在三期资产上。第二条是变成工具与数据的供应方,把模型能力打包卖给药企,收取首付与里程碑,Profluent 与礼来 22.5 亿美元的合作、Chai 与礼来的合作属于这一类。留在中间、既不承担临床风险又只提供已被开源追上的能力的公司,会被压缩掉。

开源的压力是真实的。RFdiffusion、ProteinMPNN、ESMFold、Boltz 系列都可以免费下载,一个有几十张显卡的研究组能在几周内搭起一条完整工作流。任何以"我们有更好的模型"为唯一卖点的估值,都在与开源社区的迭代速度赛跑,而后者过去五年的速度是每 12 到 18 个月把一项前沿能力变成公共品。

一个具体的时间刻度可以说明开源的速度。AlphaFold2 在 2021 年 7 月开源,OpenFold 的复现版本在约一年后发布;AlphaFold 3 在 2024 年 5 月发布且当时不开源,社区的对标模型 Boltz-1 在同年底就以宽松许可发布,Chai-1 也在几个月内开放权重。留给闭源模型的领先窗口,从 AlphaFold2 时代的约 12 个月压缩到 AlphaFold 3 时代的约 6 个月。任何一家公司如果把商业模式建立在模型领先之上,必须假设这个窗口还会继续缩短。

最后给一份尽职调查问题清单,适用于任何声称做 AI 药物设计的公司:模型是自研还是微调开源;湿实验的年通量是多少个分子;命中率的分母与定义;设计的分子有没有做过前瞻性盲测;有没有分子进入临床,处于哪一期;哪些项目失败了,为什么;公司持有的数据是公开数据还是自有的实验数据;如果模型明天被完全开源,公司还剩下什么。最后一个问题是全书的核心问题在这个领域的具体形式。

本章要点

与定位的关系

对资本而言,本章是核心论点的直接证据。设计层的能力正在以每 12 到 18 个月一轮的速度商品化,开源模型不断把前沿变成公共品,而公开市场已经开始按这个逻辑定价:Generate Biomedicines 的模型没有被质疑,被质疑的是模型能否变现。因此在这个领域配置资金的规则应当是,不为"我们有模型"付费,只为"我们有临床数据、有产能、有监管路径"付费。AI 生物公司里值得持有的,是那些已经把模型转化为进入后期临床的资产、或者已经把能力锁进大药企长期合约的少数。本书不构成投资建议。

对事业而言,本章给出了一个反直觉但可靠的结论:学会用这些模型的边际价值正在下降,因为工具越来越好用且免费;而能判断模型输出可信度、并把候选分子推过湿实验与放大生产的人,价值在上升。具体到多肽领域,最稀缺的组合是同时懂生成模型的失效模式、懂展示技术的实际产出、懂固相合成放大与纯化的人。这类人现在全球以百计,而每一家做 AI 多肽的公司都需要至少一个。第 30 章会把这条路径拆成可执行的步骤。

对个人而言,本章主要的用处是校准预期。AI 不会在可预见的时间里变出一个已经验证安全有效的长寿多肽,因为决定成败的环节是人体试验,而那部分没有被加速。当有人用"AI 设计"作为某个产品的可信度背书时,正确的反应是问它做过什么人体试验,而不是问它用了什么模型。设计一个分子在 2026 年已经很便宜,证明它对人有用依然很贵。

资料来源

← 第 10 章 口服多肽与递送技术
第 12 章 多肽与衰老生物学 →