本章回答:多肽的序列空间为什么特别适合机器学习,AI 在这个空间里已经做到了什么,还做不到什么。
3.1 20 的 n 次方:一个可以被计算机原生处理的空间
一条多肽是一串从 20 个字母里选出来的符号。长度为 n 的序列共有 20 的 n 次方种可能。这个数字增长得极快:
| 长度 | 可能序列数 | 参照 |
|---|---|---|
| 5 | 320 万 | 一台笔记本几秒钟穷举完 |
| 8 | 约 2.6 万亿 | 大型集群可穷举 |
| 10 | 约 1.0 乘以 10 的 13 次方 | 超出任何实验筛选能力 |
| 20 | 约 1.0 乘以 10 的 26 次方 | 超过地球上沙粒总数 |
| 31 | 约 2.1 乘以 10 的 40 次方 | 司美格鲁肽的骨架长度 |
| 50 | 约 1.1 乘以 10 的 65 次方 | 超过可观测宇宙的原子数 |
这些数字大到无法穷举,但这不是重点。重点在于这个空间具备三个别的药物模态不具备的数学性质。
性质一:离散。 每一个位点只能取 20 个值中的一个,没有中间状态。离散意味着可以用分类模型建模,可以用词元表示,可以用交叉熵损失训练,可以直接套用为自然语言开发的全部工具链。小分子的化学空间是连续和离散混合的:原子类型是离散的,键长键角是连续的,构象是连续的,而且"改一个原子"这个操作在化学上未必对应一个可合成的分子。多肽不同,把第 12 位从丙氨酸换成丝氨酸,一定对应一个可合成的分子。
性质二:一维且有序。 多肽有天然的线性坐标系,从 N 端到 C 端。这意味着它可以直接被序列模型处理,不需要图神经网络那样先设计一套图表示。位置信息是免费的。相比之下,小分子是图,图没有天然顺序,SMILES 字符串是人为强加的一维化,同一个分子可以有多种 SMILES 写法,这给模型训练带来额外的噪声。
性质三:有海量的天然标注数据。 进化在过去三十多亿年里跑了一个规模无法想象的实验:它生成了无数条序列,淘汰了不能折叠或不起作用的,留下了能用的。今天公开的蛋白序列数据库里有数十亿条序列,它们不是随机样本,是被自然选择筛过的正样本。对语言模型来说,这相当于一个天然的、免费的、覆盖全球生物圈的语料库。小分子没有对应物:人类合成过的分子总数在 10 的 8 次方量级,而且其中带有可靠活性标注的只占很小一部分。
把三条性质合在一起,得到的结论是:多肽是唯一一个可以被当作自然语言直接处理的药物模态。这不是比喻,是字面意义。ESM 系列模型就是把氨基酸当作词元,用掩码语言建模的目标函数训练出来的,架构与训练自然语言的模型没有本质差别。
再加上非天然氨基酸,字母表从 20 扩到数百,空间进一步膨胀,而且膨胀的方向正是天然进化没有探索过的区域。这对设计者是好消息也是坏消息:好消息是那里可能藏着天然序列达不到的性质,坏消息是那里没有训练数据,模型的先验在那里最不可靠。
需要立刻加一条限定。20 的 n 次方是理论空间,真实可用的空间要小得多,因为绝大多数随机序列既不折叠也不结合任何东西。有功能的序列在这个空间里是一片极稀疏的子集。AI 的价值不在于遍历这个空间,而在于学会那片稀疏子集的分布,从而在生成时直接落在里面。这是生成模型与随机筛选的根本区别。
3.2 蛋白语言模型:把进化当作语料
蛋白语言模型的训练方式与文本模型几乎一样:把序列里随机一部分残基遮住,让模型预测被遮住的是什么。训练完成后,模型在内部学到的表示里包含了大量它从未被明确教过的信息,包括二级结构、残基之间的空间接触、保守位点、结合位点,甚至突变对蛋白稳定性的影响方向。
EvolutionaryScale 在 2024 年发布的 ESM3 把这条路线推进了一步。它把序列、结构和功能标注三种模态全部离散化为词元:序列按残基切分,三维结构通过对每个残基周围的局部原子环境编码为离散词元,功能注释同样词元化。训练目标是跨模态的生成式掩码建模,因此模型可以从任意模态的任意组合生成其余模态。给它一段序列,它能给结构;给它一个结构约束加一句功能描述,它能给序列。公司在发布时把这个能力概括为在计算中模拟五亿年的进化。
对多肽而言,这类模型的实际用法已经相当具体。2026 年公开的两项工作分别用 ESM3 生成用于慢病毒载体和腺相关病毒载体亲和纯化的配体多肽,先由模型生成候选,再做计算筛选,最后湿实验验证亲和力成熟。另一项工作用 ESM3 优化一种抗植物病原菌的抗菌肽,生成的多个类似物在净电荷、疏水性和螺旋比例上都有提升。这些工作规模不大,但它们展示了一个可复制的流程:模型负责提出候选并把候选数量从数万压到数十,湿实验负责验证。有估计认为,这类流程使早期发现阶段需要实际合成和测试的多肽数量减少了约 10 倍。
蛋白语言模型还有一项对多肽工程特别实用的能力,叫零样本适应度预测。模型在没有见过任何针对某个特定蛋白的实验数据的情况下,仅凭它对序列分布的先验,就能给出"把第 i 位换成某个残基之后,这个蛋白更可能还是更不可能保持功能"的排序。原理很直白:如果模型认为某个位点在进化上高度保守,那么替换它大概率有害。这个能力把传统上需要做几百个点突变才能获得的信息,压缩成一次前向计算。对于 1.6 节讲的那类逐位工程化操作,这相当于一张免费的先验地图。
但零样本预测有一个结构性缺陷:它预测的是"进化上是否常见",不是"药效上是否更好"。药物需要的很多性质在进化里从来不是优化目标。脂肪酸酰化位点、抗蛋白酶降解的非天然残基、为了避免聚集而做的溶解度改造,这些在自然序列库里几乎没有对应的正样本,模型对它们没有先验。换句话说,语言模型擅长告诉你什么序列像天然蛋白,不擅长告诉你什么序列像好药。这条区分解释了为什么真正有价值的模型往往不是最大的开源模型,而是在某家公司内部用自有实验数据微调过的模型,而自有实验数据的积累速度受限于湿实验通量,也就是受限于物理世界。
这个"10 倍"是理解全书论点的关键数字之一。它不是 1,000 倍,也不是无穷倍。AI 减少的是早期候选合成的数量,而早期候选合成在一个药物的全生命周期成本里只占很小一部分。三期临床的费用、产能建设的资本开支、监管审评的时间,都没有被这 10 倍触及。第 22 章和第 25 章会把这个分解写成具体的成本表。
3.3 结构预测:约束从哪里来
生成一条序列容易,生成一条能结合特定靶点的序列难。难点在于结合是一个三维事件,需要知道分子长什么样。2020 年 AlphaFold2 在 CASP14 评测中把单链蛋白结构预测的精度提高到接近实验水平,这件事的后果是:结构不再是稀缺资源。此前一个蛋白结构需要几个月的晶体学或冷冻电镜工作,此后几分钟的计算就能给出一个通常够用的模型。
2024 年的 AlphaFold3 和同期的一批全原子共折叠模型把能力扩展到复合物:蛋白与蛋白、蛋白与小分子、蛋白与核酸、以及蛋白与多肽的复合物。对多肽设计而言,蛋白与多肽的共折叠是最关键的一项,因为它直接对应"这条肽会不会以这个姿势结合到那个受体上"这个问题。
这里有一个对多肽特别有利的技术细节。多肽结合到受体上时,往往采取伸展的或简单螺旋的构象,而不是复杂的多结构域折叠。预测一条 15 个残基的肽在受体口袋里的姿势,比预测一个 300 个残基蛋白的完整折叠要简单得多。同时,多肽的构象自由度虽然高,但一旦结合,可采样的构象范围有限。这使得多肽复合物预测的准确率在同类任务中相对较高。
多肽在结构预测上还有一个特殊的麻烦:内在无序。许多天然多肽在水溶液里没有稳定结构,只有在接触受体的瞬间才折叠成特定构象,这个现象叫结合诱导折叠。天然 GLP-1 在溶液里大部分时间是无序的,结合到受体上才形成螺旋。对于以预测稳定折叠为训练目标的模型来说,无序状态本身就是一种失败模式,模型往往给出低置信度的螺旋,而无法表达"它在自由状态下没有确定结构"这个事实。这意味着用结构预测工具评估多肽时,必须同时给出结合状态与自由状态两个问题,而模型只擅长回答前者。
另一个约束来自数据分布。结构预测模型的精度依赖同源序列的数量,对进化上孤立、没有同源家族的序列,精度明显下降。这对天然多肽不成问题,因为激素家族的同源序列很多;但对完全从头设计的新骨架恰恰是最差的情况,因为它们按定义就没有同源序列。设计者因此陷入一个循环:最需要精确验证的分子,正是模型最不擅长验证的分子。这个循环目前只能靠湿实验打破。
但结构预测有一个已知的系统性弱点:它擅长预测"这个结构长什么样",不擅长预测"这两个分子结合得多紧"。预测的置信度分数与真实的结合亲和力之间相关性有限。这是目前所有从头设计流程都要靠湿实验兜底的根本原因,也是下一节那些命中率数字为什么不是 100% 的原因。
3.4 生成式设计:真实的命中率
生成式设计是把结构预测反过来用:给定一个靶点和一个希望结合的位点,让模型生成一个能结合上去的新分子。2023 年发表的 RFdiffusion 是这条路线上影响最大的工作,它用扩散模型在三维空间里"雕刻"出一个骨架,再用另一个模型 ProteinMPNN 为这个骨架填上氨基酸序列。
公开数据里,这条路线的成绩需要分两面看。
正面:在 2023 年的原始工作里,针对若干靶点测试的 96 个设计中,55 个在 10 微摩尔浓度下能检测到结合,这个比例相对于此前的计算设计方法是数量级的提升。对 IL-7Rα、胰岛素受体、PD-L1 和 TrkA 等靶点,成功率比早先的设计活动高出约两个数量级。同期另一条工作把类似方法用于大环肽,实现了对蛋白靶点的高亲和力从头设计。2025 年有团队把从头设计的 PD-L1 高亲和力迷你蛋白推进到正电子发射断层显像的首次人体研究,用于观察其在活体内的分布与结合动力学。这是从头设计分子进入人体的早期案例之一。
反面:2025 年 2 月的一项独立评测对 6 个靶点各设计 5 个结合子,结果只有针对 Strep-Tag II 的两个设计表现良好,其余靶点的设计因表达量低、非特异结合或亲和力无法检测而失败。作者的结论是该方法在用于生化检测试剂这类实际应用时成功率有限。2026 年 1 月又有工作通过针对性改进 β 折叠配对提升了设计成功率,说明这个方向仍在快速迭代。
更新的成绩来自 Chai Discovery 在 2025 年发布的 Chai-2。该模型针对 52 个此前没有已知结合物的抗原,每个靶点只做不超过 20 个设计,在一块 24 孔板内完成湿实验,报告的全新抗体设计命中率为 16% 到 20%,对 52 个靶点中的 50% 至少找到了一个结合物,全流程从设计到验证在两周内完成。同一模型在迷你蛋白设计上的湿实验成功率报告为 68%。
16% 与 68% 这个对比,是本章最重要的一组数字。 同一个模型,同样的方法,设计抗体的成功率是设计迷你蛋白的四分之一不到。原因就在 3.1 节:抗体的可变区序列长、结构受免疫球蛋白骨架约束、结合依赖六段互补决定区的协同,而迷你蛋白短、折叠简单、结合界面单一。分子越小越简单,AI 的命中率越高。多肽比迷你蛋白还小,这条趋势对多肽是有利的。
把 2026 年主要的 AI 分子设计公司放在一张表里,可以看清资本在为什么付费。
| 公司 | 所在地 | 2025 到 2026 年关键事件 | 主要产出形态 |
|---|---|---|---|
| Generate Biomedicines | 美国 | 2026 年 3 月纳斯达克上市,发行价 16 美元,净募资约 3.693 亿美元 | 抗体与多肽,已有三期资产 |
| AI Proteins | 美国 | 4,150 万美元 A 轮,与百时美施贵宝合作总额最高 4 亿美元 | 从头设计迷你蛋白 |
| Chai Discovery | 美国 | 发布 Chai-2 全原子模型,迷你蛋白湿实验成功率 68% | 模型与设计服务 |
| EvolutionaryScale | 美国 | 发布 ESM3 多模态蛋白语言模型 | 基础模型 |
| Galux | 韩国 | 2026 年 2 月 B 轮 2,900 万美元,累计 4,700 万美元 | 蛋白设计平台 |
这张表有一个共同点值得注意:估值最高、募资最多的那家,恰恰是管线最靠后的那家,而不是模型最先进的那家。Generate Biomedicines 的 IPO 募资中约 3 亿美元明确用于完成一对三期哮喘试验,标的是一个抗胸腺基质淋巴细胞生成素的抗体。资本市场用真金白银给出了排序:临床阶段的资产比模型值钱。
需要诚实指出的是,命中率与药物性是两回事。一个在 24 孔板里检测到结合的分子,距离一个可以给人用的药还隔着选择性、稳定性、免疫原性、药代动力学、制剂可行性和可放大的工艺。截至 2026 年,进入临床阶段、由 AI 方法识别或显著优化的多肽至少有 15 个,但其中绝大多数是对已知骨架的优化,而不是完全从零生成的新序列。完全从头设计的多肽药物尚未有获批先例。
3.5 三种模态的 AI 可解性对比
把三种模态放在同一组维度下比较,可以看清楚为什么多肽的位置最好。
| 维度 | 小分子 | 多肽 | 抗体 |
|---|---|---|---|
| 空间结构 | 图,连续与离散混合 | 一维离散序列 | 一维离散序列但很长 |
| 可枚举性 | 无自然语法,难系统枚举 | 20 的 n 次方,语法明确 | 理论空间大,受骨架约束 |
| 天然训练数据 | 合成过的分子约 10 的 8 次方 | 公开序列数十亿条 | 抗体数据库规模中等 |
| 结构预测成熟度 | 构象与结合模式仍难 | 复合物预测相对可用 | 互补决定区环区预测仍难 |
| 从头设计命中率 | 低,需大量湿实验迭代 | 迷你蛋白可达约 68% | 全新设计约 16% 到 20% |
| 合成验证周期 | 数天到数周每个分子 | 数天,可平行数十条 | 数周,需表达纯化 |
| 设计到验证闭合速度 | 慢 | 最快 | 中等 |
最后一行是关键。机器学习的进步依赖反馈回路的速度,而多肽的反馈回路最短:模型生成 50 条序列,自动合成仪几天内做出来,结合实验几天内读出,数据回到模型。小分子每一个候选都需要一条独立的合成路线,路线设计本身就是一个难题。抗体需要构建表达载体、转染、培养、纯化,周期以周计。回路速度决定了迭代次数,迭代次数决定了模型改进速度。这是多肽在 AI 时代具有结构性优势的最实际的原因。
3.6 设计成本曲线
把上面的技术事实换算成钱,可以得到一条曲线。以下为估算,用于说明量级而非精确预测。
在 2015 年前后的传统流程里,从靶点确认到一个可进入临床前开发的多肽先导化合物,通常需要合成和测试数千到上万条序列,耗时 2 到 4 年,直接成本在数百万到数千万美元之间。在 2026 年的 AI 辅助流程里,同一阶段合成的序列数量可以压到数百条量级,时间压到半年到一年,直接成本降到数十万到数百万美元。有厂商宣称 AI 驱动方法能把整体开发周期压到约 2 年、成本压到约 1.5 亿美元、成功率提到约 30%,这类数字来自商业宣传,应当保守对待,但方向是一致的。
现在做一个推演。假设按照本书的思想实验,有效智力继续提高,到某个时点设计端的成本进一步下降 99%。那么:
在传统流程里,先导发现占一个多肽药物全周期成本的比例,粗略估计在 5% 到 15% 之间(三期临床、产能建设、商业化占了绝大部分)。若把这一段成本压到接近零,全周期成本下降的幅度也就是 5% 到 15%。换句话说,即便设计完全免费,一个多肽药物的总成本只下降一成左右。
下表把一个多肽药物从靶点到上市的成本按环节拆开,并标出 AI 对每个环节的压缩能力。数字为量级估算,用于说明结构而非精确核算。
| 环节 | 占全周期成本的粗略比例 | AI 的压缩能力 | 压缩的物理上限 |
|---|---|---|---|
| 靶点确认与先导发现 | 5% 到 15% | 强,可降一到两个数量级 | 湿实验验证通量 |
| 临床前安全与药代 | 5% 到 10% | 中,可减少动物用量 | 监管要求的活体数据 |
| 一期与二期临床 | 15% 到 25% | 弱,可优化入组与终点选择 | 受试者随访时间 |
| 三期临床 | 40% 到 60% | 极弱 | 事件累积与随访年限 |
| 工艺开发与产能建设 | 10% 到 20% | 弱,可辅助路线设计 | 设备交付与厂房建设 18 到 36 个月 |
这个算术是全书论点的数学核心。设计变成免费,不会让药变便宜多少,但会让"会设计"这件事不再值钱。当所有人都能在一周内拿到一批高质量候选分子时,候选分子本身的溢价消失,竞争回到谁能更快跑完三期、谁有产能把它造出来、谁有监管关系和医生信任。第 25 章和第 26 章会把这条推演做得更细。
反过来说,设计免费会产生一个明确的二阶效应:临床阶段的资产数量会暴增,从而使临床产能和制造产能更加紧张。2026 年初减重领域在研资产已超过 193 个,临床阶段多肽候选药物 150 个以上,临前 600 到 700 个。如果设计成本再降两个数量级,这些数字会继续膨胀,而全球能跑三期的临床中心数量、能做 GMP 供货的 CDMO 数量不会同步膨胀。稀缺性会向下游集中,而不是被缓解。
3.7 AI 做不到什么
本章到这里都在论证多肽对 AI 友好。为了不让这个论证变成一厢情愿,需要明确列出边界。
做不到预测人体反应。 模型可以预测一条肽是否结合某个受体,无法预测这个受体在一个 62 岁、有高血压和轻度肾功能不全的人身上被长期激动会发生什么。人体是一个有数万个相互作用的系统,训练数据只能来自真实的人,而真实的人只能按每年一岁的速度产生数据。
做不到跳过安全性。 免疫原性、脱靶效应、长期毒性都必须在活体上验证。AI 可以帮助排除一部分明显的风险,比如预测可能的免疫表位,但监管机构不接受计算结果替代动物与人体数据。
做不到设计工艺。 一条序列能不能在固相合成中高产率地做出来,取决于它有没有容易聚集的疏水片段、有没有难偶联的位点、有没有在切割条件下不稳定的残基。这类知识部分存在于文献里,大部分存在于工艺化学家的经验里,且高度依赖具体设备和批次。目前没有任何公开模型能可靠预测一条新序列的工业合成产率。
做不到缩短时间。 一个 72 周的减重试验就是 72 周。一个以事件驱动的心血管结局试验需要等到足够多的事件发生。SURMOUNT-MMO 计划入组约 15,000 人、覆盖 27 个国家 664 个中心,读出时间由事件累积决定。这是四大不可压缩资产里最硬的一项。
做不到建立信任。 一个医生决定给患者开一个新分子,依据的不只是数据,还有这个分子在同行中的使用经验、指南的措辞、药企医学团队多年的沟通。一个药监审评员批准一个新适应症,依据的是一套在几十年里逐渐形成的、有人承担责任的判断惯例。这些都是以人年为单位积累的社会资本,无法通过提高计算量获得。第 23 章与第 24 章会具体说明这套社会资本在监管与支付两端的形态。
做不到建工厂。 大规模固相合成产能的交付周期是 18 到 36 个月,受限于反应器制造、洁净厂房建设、公用工程、设备确认与工艺验证。Bachem 的 Building K 从规划到 2026 年 4 月落成、再到 2026 年下半年开始贡献商业化销售,走完了完整的周期。多家 CDMO 明确把工艺化学、冻干工程与质量体系人才而非资本列为扩产的主要约束。
把这五条放在一起,就是本书的四大不可压缩资产的雏形:临床时间、物理产能、工艺人才、人体数据与信任。第 4 章会把它们正式定义并逐一论证。
本章要点
- 多肽的序列空间是离散的、一维有序的、有数十亿条天然正样本的,这三条性质使它成为唯一可以被语言模型直接处理的药物模态。
- 20 的 n 次方只是理论空间,有功能的序列是其中极稀疏的子集,AI 的价值在于学会这个子集的分布而不是遍历空间。
- ESM3 把序列、结构与功能三种模态统一离散化,已被用于生成亲和纯化配体多肽与优化抗菌肽,早期发现阶段需实际合成的序列数量约减少 10 倍。
- 结构预测让结构不再稀缺,但对结合亲和力的预测能力仍然有限,所有从头设计流程仍需湿实验兜底。
- Chai-2 在全新抗体设计上的命中率为 16% 到 20%,在迷你蛋白上为 68%,分子越小越简单命中率越高,这条趋势对多肽有利。
- 多肽的设计到验证反馈回路是三种模态里最短的,这是它在 AI 时代具有结构性优势的最实际原因。
- 先导发现只占一个多肽药物全周期成本的 5% 到 15%,即便设计完全免费,总成本也只下降一成左右,价值必然迁移到下游。
- 蛋白语言模型擅长判断一条序列是否像天然蛋白,不擅长判断它是否像一个好药,因为药物所需的许多性质在进化中从未被优化过。
- 设计免费的二阶效应是临床阶段资产数量暴增,使临床与制造产能更紧张而非更宽松。
与定位的关系
对资本定位而言,本章给出一条反直觉的结论:AI 设计能力越强,纯设计型公司的护城河越浅。当一个能力从"少数团队掌握"变成"买得到算力就能做",它就从资产变成了成本。判断一家 AI 生物公司值不值钱,不应该看它的模型有多好,而应该看它是否同时持有下游的不可压缩资产:临床阶段的资产组合、独家的人体数据、与监管机构建立的路径、或者自有产能。Generate Biomedicines 在 2026 年 3 月完成 IPO,以每股 16 美元发行 2,500 万股,净募资约 3.693 亿美元,其中约 3 亿美元明确用于推进一对三期哮喘试验。这个资金用途本身就说明了价值在哪里:钱花在临床,不花在模型。本书不构成投资建议。
对事业定位而言,本章解释了为什么"会用生成模型设计多肽"这项技能的稀缺期很短。工具在快速开源和商品化,两年后一个本科生就能跑通全流程。真正长期稀缺的是 3.7 节列出的那几条 AI 做不到的事,其中最可学、最可交易的是"能预判一条序列在固相合成中会不会出问题"。同时懂生成模型与懂工艺放大的人,全球数量极少,这个交集正是第 30 章要展开的岗位。
对个人定位而言,本章提供了一个识别夸大宣传的标准。凡是宣称"AI 设计出的新型抗衰老多肽"的产品,可以直接问三个问题:它的结合数据是在什么体系里测的,它有没有进入过任何注册临床试验,它的生产工艺与质量标准是什么。在 2026 年,完全从头设计的多肽药物尚无获批先例,任何声称已经可用的说法都与公开事实不符。本书不构成医疗建议。
资料来源
- ESM3: Simulating 500 million years of evolution with a language model
- ESM3 - The Frontier of Protein Design?
- Protein language model-guided generative design of affinity peptides for chromatographic purification of lentiviral vectors
- Leveraging protein language model for maturation of high-affinity peptide ligand in the purification of an adeno-associated virus vector
- Protein Language Model-Driven Optimisation of Antimicrobial Peptide Pth-Ca1 Using ESMFold and ESM-3
- De novo design of protein structure and function with RFdiffusion
- RFdiffusion Exhibits Low Success Rate in De Novo Design of Functional Protein Binders for Biochemical Detection
- Improved protein binder design using β-pairing targeted RFdiffusion
- Accurate de novo design of high-affinity protein binding macrocycles using deep learning
- De novo design of peptide binders to conformationally diverse targets with contrastive language modeling
- Zero-shot antibody design in a 24-well plate
- Chai Discovery Releases All-Atom Foundation Model for Zero-Shot Antibody Design with 16-20% Hit Rates
- De Novo Design of Ultrahigh-Affinity Miniproteins Targeting PD-L1 for Non-Invasive Imaging: Preclinical Validation and First-in-Human Study
- Peptide-based drug design using generative AI, Chemical Communications
- Contemporary data-driven innovations in peptide-based therapeutic design
- Generate Biomedicines, Inc. Form 10-Q FY2026
- Tirzepatide for reduction of morbidity and mortality in adults with obesity: rationale and design of the SURMOUNT-MMO trial