↩ 研究与项目/超级肽入门读本

第 25 章 当设计免费:AI 设计层的商品化推演

The Super-Peptide Primer · 30

如果分子设计的边际成本趋近于零,谁还赚得到钱,谁的估值会被压掉一个数量级。

本章是全书第一章纯粹的推演。前面二十四章处理的是已经发生的事实:GLP-1 的生理学、固相合成的成本结构、双寡头的护城河、口服小分子的威胁。从本章开始,讨论的对象是尚未发生的事。所以从这里起,每一个结论都会挂上它的前提,前提不成立时结论就不成立,这一点会反复写明。

本章的基准线假设有三条。第一,到 2030 年前后,蛋白与多肽的从头设计能力继续按过去五年的速度提升,湿实验验证率从今天的个位数到两位数百分比提升到五成以上。第二,主要的设计模型继续以开放权重的形式发布,或者至少在发布后 12 到 24 个月内被开源复现。第三,临床试验的时间结构不变,监管对人体证据的要求不因模型能力提升而放松。第三条是最强的约束,第 26 章会专门论证它。如果第三条被打破,本章的结论要重写。

25.1 设计成本曲线:从一个分子一千万美元到一杯咖啡

先把"设计成本"定义清楚,否则讨论会滑向口号。这里的设计成本指的是:从确定一个靶点开始,到拿到一个在细胞或动物模型上确认有活性、可以进入正式临床前开发的分子,这一段所消耗的全部现金,包括人力、试剂、外包合成、动物实验和失败批次的沉没成本。它不包含临床前毒理、不包含工艺开发、不包含任何临床费用。

这个定义很重要,因为公开讨论里常把"药物研发成本 26 亿美元"和"设计成本"混为一谈。26 亿美元这个数字里,临床阶段占七成以上,失败项目的分摊占了另一大块。真正花在"想出这个分子"上的钱,历史上大约在总成本的 5% 到 10% 之间。AI 能压缩的,主要就是这 5% 到 10%。这句话本身就已经能解释后面三节要讲的估值现象。

下表是对多肽与迷你蛋白这一类模态的设计成本推演。2010 年和 2020 年的数字来自公开的项目经验区间,2026 年的数字来自当前可观察的外包报价与算力价格,2030 年是推演值,明确标注为估算。

年份主流方法每个先导分子的设计成本从靶点到先导的周期湿实验验证率
2010天然肽改构、丙氨酸扫描、噬菌体展示500 万到 1,500 万美元24 到 48 个月每 1,000 个候选出 1 到 5 个
2020计算辅助、定向进化、mRNA 展示100 万到 500 万美元12 到 24 个月每 100 个候选出 1 到 10 个
2026结构预测加扩散模型加亲和力打分,开源权重5 万到 50 万美元3 到 9 个月每 100 个设计出 5 到 30 个有结合活性
2030(推演)生成模型直接输出可合成序列,自动化湿实验回路验证2,000 美元到 5 万美元2 周到 3 个月每 100 个设计出 30 到 70 个

2030 年那一行是推演,不是预测,它的成立需要三个条件同时满足:开源模型继续迭代、自动化实验室的单次实验成本继续下降、非天然氨基酸与环化修饰的建模精度跟上。任何一条卡住,成本曲线就会在 2026 年的水平上横盘。

即便如此,方向是清楚的。把 2010 年的 1,000 万美元和 2030 年推演的 1 万美元放在一起,是三个数量级的下降。这个幅度在工业史上并不罕见,基因测序在 2001 年到 2020 年间的成本下降超过五个数量级。测序成本崩塌之后发生的事情值得记住:测序仪厂商 Illumina 赚到了钱,测序服务商的毛利被压到接近代工水平,而真正拿走大部分价值的是那些用测序数据做出临床决策的公司和拥有大规模人群队列的机构。设计成本崩塌后的分配结构,大概率与此同构。

还有一个容易被忽略的细节。设计成本下降的同时,设计的"数量"在暴涨。当一个先导分子的设计成本从 500 万美元降到 5 万美元,理性的做法不是省下 495 万美元,而是做 100 个先导分子。于是下游的压力成倍增加:更多的候选分子要合成,要做体外筛选,要做动物药代,要排队进入 GMP 车间。这就是所谓的瓶颈转移。上游变宽的直接后果是下游变得更窄,而下游正是本书主张的四大稀缺资产所在的位置。

25.2 开源的冲击:当最强的工具变成公共品

商品化不是靠成本自然下降完成的,是靠开源完成的。这是本章最硬的一节。

回顾时间线。2021 年 AlphaFold2 开源,结构预测这一环从"少数机构的能力"变成"任何一个研究生在一台显卡上能做的事"。2023 年 3 月,David Baker 实验室把 RFdiffusion 以开源形式放出,从头设计蛋白骨架的能力随之扩散。2024 年 AlphaFold3 发布后不久,社区做出了开源替代 Boltz-1。2025 年 6 月,MIT Jameel Clinic 与 Recursion 联合发布 Boltz-2,把结构预测与蛋白配体结合亲和力预测合到一个模型里,按发布方的说法,其精度接近自由能微扰这类原子级模拟,速度快一千倍以上,并且以 MIT 许可证开源,模型、权重、训练流程全部可商用。2026 年,Baker 实验室把 RFdiffusion3 开源,全原子层面直接设计与 DNA、小分子配体交互的蛋白,推理速度比上一代快 10 倍,同样是 MIT 许可证。

蛋白语言模型这一支的轨迹几乎相同。Meta 的 ESM 系列把自然语言处理的思路搬到氨基酸序列上,模型从数亿条天然序列里学到残基之间的共变关系,可以在没有结构信息的情况下给出突变的适应度打分。ESM-2 的权重公开之后,它迅速成为工业界做突变扫描、稳定性优化、免疫原性初筛的默认起点。后续的 ESM3 把序列、结构、功能标注放进同一个生成框架,虽然最强的版本采取了受限发布,但学术界与开源社区在一年内做出了能力相近的替代。这条线的教训与扩散模型那条线一样:受限发布最多买到 12 到 18 个月,买不到永久的差异化。

值得单独记一笔的是许可证的选择。RFdiffusion3 与 Boltz-2 都采用 MIT 许可证,这是限制最少的开源许可之一,允许商业使用、允许闭源再分发、不要求回馈修改。如果这些模型采用的是学术非商业许可,商业公司仍需付费获得授权,设计层至少还能维持一层收费闸门。MIT 许可证把这层闸门也拆掉了。对一家想靠模型收费的公司来说,竞争对手不是另一家公司,是一个可以免费下载、可以随意改造、还能用于闭源产品的公共品。

把这条时间线翻译成商业语言:过去五年,蛋白设计领域每一次最重要的能力跃迁,在 0 到 24 个月内都变成了公共品。这在药物研发史上没有先例。小分子领域的核心工具(Schrödinger 的力场、各家的对接软件)从来没有这样被系统性开源过,抗体发现的平台技术受专利保护长达二十年。蛋白与多肽设计这一层之所以不同,是因为它的核心成果是学术界产出的,作者的激励是引用数和诺贝尔奖,不是许可费。

对一家以"我们有更好的设计模型"为卖点的公司,这意味着什么?意味着它的技术领先窗口被压缩到 12 到 24 个月。窗口内,它必须把领先转化成某种不会被开源抹平的东西:专有的实验数据、已经签下的合作付款、已经进入临床的资产、已经建成的自动化产线。转化不成,下一次开源发布就会把它的差异化清零。

需要加一个反面论证,否则这一节会失之于简单。开源模型好用,不等于用开源模型的人都能做出药。三个真实的摩擦点:第一,模型的输出质量高度依赖输入的靶点结构与训练数据覆盖,对于膜蛋白、无序区、瞬态构象这些占据大量重要靶点的情形,公开数据稀薄,模型的表现远不如公开基准所显示的;第二,从"预测能结合"到"在人体里有用",中间隔着成药性、免疫原性、给药途径、组织分布这一整套问题,开源模型对这些的建模能力弱得多;第三,湿实验验证能力本身是资本密集的,一个能一周做 10,000 次结合实验的自动化平台仍然要花几千万美元建。所以开源抹平的是"设计",不是"研发"。这个区别是理解本章其余部分的钥匙。

25.3 公开市场的判决:三家公司的市值在说什么

理论推演可以吵,市场定价不会说谎太久。2026 年恰好给了三个可观察的样本。

Generate Biomedicines 是最干净的样本。这家由 Flagship Pioneering 在 2018 年孵化的公司,是"生成式生物学"这个说法的主要提出者之一,私募阶段的 C 轮(2023 年 9 月)融了 2.73 亿美元,累计私募融资约 7 亿美元。2026 年 2 月 26 日,它以每股 16 美元定价,发行 2,500 万股,募资 4 亿美元,2 月 27 日在纳斯达克挂牌,代码 GENB,是当年到那时为止规模最大的生物技术 IPO。到 2026 年 9 月中旬,股价在 16 到 17 美元一线,52 周区间是 11 美元到 22.67 美元。也就是说,上市半年多,股价回到了发行价附近,中间跌到过发行价的七折。

这个结果本身并不糟糕,放在 2026 年的生物技术市场里甚至算稳健。但它传达的信息很明确:市场没有给"生成式生物学平台"这个标签支付溢价。买方的定价锚是它的管线,尤其是已经进入大型临床研究的 GB-0895。换句话说,公开市场把 Generate 当成一家有 AI 工具的生物技术公司来定价,而不是当成一家技术平台公司。分析师目标价集中在 25 美元到 30 美元,给出这些目标价的理由也是临床数据预期,不是模型能力。

Recursion 是第二个样本,它展示的是平台叙事的退潮曲线。这家公司在 2021 年上市时的市值一度接近 60 亿美元,卖点是自动化细胞成像加机器学习的大规模表型筛选。2025 年它完成了对 Exscientia 的合并与重组。2026 年第二季度,它的收入是 770 万美元,同比下降 60.1%;管理层把全年现金运营支出指引下调 1,500 万美元到约 3.75 亿美元;手上现金约 5.45 亿美元。一个季度收入 770 万美元、一年花掉 3.75 亿美元的公司,本质上已经不是平台公司,而是一家用自有资金烧管线的生物技术公司。市场对它的重新定价发生在 2022 到 2024 年,2026 年它股价上涨的触发因素是 REC-4881 在家族性腺瘤性息肉病上的概念验证数据和成本控制,不是模型的新版本。值得记下的是,Boltz-2 这个把开源工具推到新水平的模型,正是 Recursion 参与发布的。一家平台公司把自己最好的技术开源,这个动作本身说明它已经判断出:模型不是它的护城河,数据和管线才是。

Absci 是第三个样本,它展示的是另一条路。这家公司做的是生成式 AI 设计抗体,2026 年 6 月公布了 ABS-201 的一期中期数据,这是一个靶向催乳素受体的抗体,用于雄激素性脱发,在 HEADLINE 试验里三个剂量队列的安全性、药代和免疫原性数据被公司描述为积极。它的叙事重点是速度与成本:从 AI 设计到进入临床约两年,花费只有行业常规的一小部分。2026 年它完成了 1 亿美元的增发,其中包括礼来的 4,000 万美元战略投资。这里的关键不是股价,而是商业模式的位置:Absci 把自己变成了一家持有临床资产的公司,并把大药企变成了股东与合作方。

三个样本放在一起,能读出一条共同的规律:市场在 2026 年已经不为"设计能力"付费,只为"设计能力已经转化成的东西"付费。转化的形式有三种,一是进入临床的自有资产,二是大药企支付的里程碑与股权,三是别人买不到的专有数据。没有完成任何一种转化的公司,估值会向现金加管线的清算价值靠拢。

下表把这个判断整理成一个粗略的估值框架,它不构成投资建议,只是拆解定价逻辑的工具。

公司类型2021 年市场给的定价逻辑2026 年市场实际使用的定价逻辑估值压缩幅度(推演)
纯设计平台,无自有临床资产平台期权,按合作数量与总里程碑金额估现金加少量技术溢价70% 到 90%
设计平台加自有临床资产平台期权加管线管线按风险调整净现值,平台给 0 到 1 倍市销率40% 到 70%
设计工具与软件软件市销率 10 到 20 倍开源替代压制定价权,市销率 3 到 8 倍50% 到 70%
自动化湿实验产能资本开支拖累,估值折价稀缺产能,估值改善无压缩,部分改善

25.4 为什么设计从来就不是瓶颈:80% 与 40% 之间的断崖

有一个数据把本章的论点钉死了。波士顿咨询在 2024 年发表的同行评议分析显示,AI 发现的分子在一期临床的成功率达到 80% 到 90%,远高于历史行业平均水平。同一批分子进入二期以后,成功率掉到约 40%,与历史平均值没有区别。2025 年《自然医学》的一篇论文得到了类似结论。

这两个数字的含义需要拆开讲。一期临床主要考察安全性和药代动力学,它检验的是"这个分子在人体里行为是否可预测、是否可耐受"。这恰好是计算方法擅长的部分:分子的物理化学性质、半衰期、脱靶结合,都可以从结构和序列上预测。AI 把这一段做得很好,是可信的,也是符合机制的。

二期临床检验的是"这个靶点在这个疾病里到底重不重要"。这是生物学问题,不是分子设计问题。如果靶点选错了,分子设计得再完美也没有用。当前所有的生成模型,无论是 RFdiffusion3 还是任何闭源同类,都不解决靶点验证问题,它们解决的是"给定靶点,造出一个能牢牢结合它的分子"。靶点是否驱动疾病,只能靠人类遗传学证据、功能基因组学和最终的人体试验来回答。

按波士顿咨询的合成计算,AI 把一个分子从进入临床到最终上市的总体概率从 5% 到 10% 提高到 9% 到 18%,大约翻了一倍。这是真实的进步,但它远不足以支撑 2021 年那一轮给平台公司的估值倍数。到 2026 年初,还没有任何一个由 AI 发现的分子获得监管批准。英矽智能的 rentosertib 在 2025 年 6 月发表于《自然医学》的 2a 期数据里显示出疗效信号,是这一类分子里走得最靠前的之一。

把这个断崖和上一节的市值曲线对照,逻辑就完整了:市场在 2021 年为设计付了钱,2022 到 2026 年逐步发现设计不是限制因素,于是把钱收了回来。这不是情绪,这是修正。

25.5 免费之后,价格在哪里重新形成

一个东西的边际成本趋近于零,不等于围绕它的产业不赚钱。软件行业早就演示过答案:代码的复制成本是零,但软件公司的利润池并没有消失,它迁移到了分发、数据、集成与合规上。设计层商品化之后,多肽领域的价格会在三个地方重新形成。

第一个地方是验证。设计免费之后,真正稀缺的是"告诉你哪个设计是对的"这件事。一次高质量的表面等离子共振结合动力学测定、一次真实的细胞功能实验、一次非人灵长类的药代研究,成本不会因为模型变强而下降,反而因为需求暴增而涨价。在基准线情景下,2026 到 2030 年间,临床前验证服务的单价保持平稳甚至上涨,而总量上升数倍。这是一个被低估的利润池,它的特点是资本密集、毛利中等、但收入可预测。

第二个地方是可制造性。多肽的设计与它的生产成本之间存在强耦合,这是多肽区别于抗体的关键。抗体的生产成本主要由细胞株表达量和纯化工艺决定,与具体序列的关系相对弱;多肽的生产成本几乎完全由序列本身决定。一条 39 个残基、含两个二硫键、带脂肪酸侧链修饰的序列,与一条 20 个残基的线性序列相比,固相合成的步骤数、纯化难度、总收率可能差出一个数量级。当设计免费而合成不免费,"设计出便宜的分子"这件事的经济价值就会超过"设计出更强的分子"。这一点在今天的行业话语里几乎没有被讨论,本书判断它会在 2028 年之后成为显性的竞争维度。

第三个地方是注册与信任。一个分子要变成可以卖的商品,需要一整套人类制度的背书:临床数据包、生产质量体系、DMF 备案、上市许可、医生的处方习惯、支付方的报销决定。这一整套东西的生产速度由人类机构的节奏决定,不由算力决定。第 26 章会把这一点量化。这里只给结论:当上游的分子供给从稀缺变成过剩,注册通道的价值会从"成本项"变成"资产项"。已经持有通道的公司(礼来、诺和诺德,以及在中国持有大品种批件与产能的公司)会发现,它们真正卖的不是分子,是让分子合法进入人体的权利。

把三者放在一起,可以画出一条价值曲线。横轴是从靶点到病人的全过程,纵轴是每个环节可获取的经济利润。2015 年,这条曲线在"发现"这一端有一个高峰。2026 年,那个高峰正在塌陷,曲线整体向右移动。到 2030 年的推演里,曲线的形状接近一条向右上倾斜的斜坡,最高点落在临床数据与商业化通道上,次高点落在物理产能上,起点的发现环节接近于零利润。这个形状与半导体产业的微笑曲线不同,它不是两端高中间低,而是单边向右抬升。原因很简单:在多肽这个行业里,右端有一道由监管与人体时间共同筑起的墙,而左端没有。

25.6 哪一类 AI 生物公司能活下来

在上述前提下,可以给出五类幸存者,并说明每一类的存活条件与失败模式。这是推演,不是名单推荐。

第一类是资产持有者。公司把自己变成生物技术公司,用 AI 做出分子,然后把分子推进临床,靠临床数据兑现价值。Absci 的 ABS-201、Generate 的 GB-0895 都属于这条路。存活条件是资本足够支撑到关键数据读出,并且至少有一个资产的靶点生物学是可靠的。失败模式是把 AI 的速度优势用在了错误的靶点上,做得快只是错得快。

第二类是数据所有者。公司拥有别人无法用公开数据复现的实验数据集,并且这个数据集与商业价值直接相关。Xaira 在 2026 年 3 月发布 X-Cell 虚拟细胞模型,训练数据来自它自建的 X-Atlas/Pisces 全基因组扰动数据集,走的就是这条路。存活条件是数据的生成速度快于公开数据集的追赶速度,且数据覆盖的是高价值的问题空间。失败模式是数据规模很大但信噪比低,或者被某个公共财团用更大规模的开放数据集覆盖。

第三类是产能所有者。公司把自动化湿实验能力本身作为产品,别人拿模型来,它提供每周几万次的真实测量。这一类在估值上反而受益于设计的商品化,因为设计变多之后验证需求成倍上升。存活条件是单次实验的成本持续下降且产能利用率高。失败模式是被大药企自建的同类设施挤出,或者陷入代工价格战。

第四类是监管路径的持有者。公司的核心资产不是分子也不是模型,而是与监管机构就某个新终点、新适应症达成的共识。在多肽与衰老这个交叉领域,谁先把"生物年龄改善"或者某个复合临床终点做成监管可接受的注册路径,谁就持有一个开源抹不平的资产。第 23 章讨论过这条路径的难度,这里只强调它在 AGI 情景下的相对价值上升:当分子唾手可得,稀缺的是把分子变成合法商品的通道。

第五类是把设计嵌进制造的公司。多肽在这里有独特性。一个由生成模型产出的序列,如果含有难以偶联的残基、易聚集的片段、需要多重二硫键的拓扑,它在固相合成上的成本可能是另一个等效序列的十倍。能在设计阶段就把可合成性、纯化收率、冻干稳定性作为约束条件放进目标函数的公司,交付的不是分子,是"可以按吨生产的分子"。这正是本书在第 30 章要展开的"AI 到 GMP 的翻译者"这个岗位在公司层面的对应物。

反过来,三类公司在基准线情景下很难活:只卖模型许可证而没有专有数据的公司,与开源正面竞争;只做虚拟筛选服务而没有湿实验能力的公司,交付物无法验证;靠融资叙事维持估值而管线里没有任何靶点生物学扎实的资产的公司,在下一轮数据读出时暴露。

25.7 推演:2030 年的设计层会是什么形态

在基准线情景下,给出四条对 2030 年的推演,每条都标注可证伪的观察点。

第一,设计层的毛利率向软件基础设施的水平收敛,但收入规模远小于 2021 年的预期。开源模型加云算力构成事实上的标准栈,商业模型只在垂直细分(非天然氨基酸、大环肽、偶联体系、免疫原性预测)上收得到溢价。可证伪的观察点是:如果到 2028 年仍有闭源模型在公开基准上保持两代以上的领先且不被复现,这条推演不成立。

第二,"AI 药物发现公司"这个类别会消失,取而代之的是"用 AI 的生物技术公司"。这不是措辞游戏,它意味着估值倍数、投资人类型、人才结构都会切换到生物技术的标准。观察点是:2027 到 2029 年的 IPO 招股书里,"平台"一词在风险因素之外的出现频率是否继续下降。

第三,价值向下游迁移的速度快于多数人的预期。设计成本下降 100 倍,会让临床前候选分子的数量上升 10 倍以上,而临床试验床位、GMP 产能、监管审评人力都不会同步扩张 10 倍。结果是这些环节的价格上涨。观察点是:多肽 CDMO 的产能预定周期与报价。2026 年全球多肽 CDMO 宣布的扩产投资已超过 24 亿美元,大规模固相合成产能的交付周期仍在 18 到 36 个月,这本身就是价格信号。

第四,多肽在设计层商品化中的受影响程度,大于抗体,小于小分子。原因在于多肽的序列空间离散且尺寸小,正是生成模型最擅长的区域,所以设计端被抹平得最快;但多肽的成药性瓶颈(半衰期、口服生物利用度、免疫原性、合成成本)恰恰是模型最难解决的部分,这些问题的答案在化学与制造里,不在算力里。观察点是:AI 设计的多肽或迷你蛋白中,有多少能在 2030 年前走到三期。截至 2026 年,至少 15 个临床阶段的多肽由 AI 或机器学习方法识别或显著优化,这个数字在 2030 年是 50 个还是 500 个,会直接检验本章的基准线。

最后要诚实地写下本章最可能错的地方。如果 AGI 的能力提升不是线性的,而是在某个时点同时解决了靶点验证、毒性预测和人体反应模拟,那么"设计不是瓶颈"这句话会失效,因为那时 AI 压缩的就不再是设计,而是临床前到临床早期的整段不确定性。本书判断这种情形在 2035 年之前的概率不高,理由在第 26 章:人体反应的模拟需要人体数据来训练和校验,而人体数据的生成速度受制于真实的时间与真实的人。但这是一个判断,不是一个定理。

本章要点

与定位的关系

对资本定位,本章给出的是一条减法规则。在设计层商品化的基准线情景下,任何以"我们的模型更好"为核心叙事、且尚未把这一优势转化为临床资产、专有数据或已收到的合作款项的公司,其估值中枢会持续下移。买这类公司,本质上是在买一个正在被开源侵蚀的期权。相反,本章的推演加强了本书杠铃策略防守端的理由:当候选分子的数量以 10 倍速增长而合成与灌装产能以 18 到 36 个月的节奏扩张,产能持有者的定价权上升。这不构成投资建议,但它是一个可以被未来数据检验的框架。

对事业定位,结论比资本端更明确。学会调用开源模型这件事,在 2026 年已经是一项几个月就能掌握的技能,它的稀缺性正在归零。真正稀缺的是能把模型输出和物理世界连起来的人:知道一个序列在树脂上偶联会不会出问题,知道哪些残基在放大到公斤级时会让纯化收率崩掉,知道一个设计在冻干后会不会聚集。第 30 章会给出这条路径的具体学习清单,本章提供的是它的经济学依据,即设计层的价值在流失,翻译层的价值在上升。

对个人定位,本章的提醒是防御性的。设计成本的崩塌意味着未来几年会有大量"AI 设计的新型多肽"进入市场话语,其中绝大部分没有任何人体证据。一个分子能被设计出来、能在细胞上有活性、能在小鼠上改善某个指标,与它能改善一个人的健康之间,隔着本章第 4 节讲的那道从 80% 到 40% 的断崖,以及后面几章讲的临床时间。判断标准不变:只跟随随机对照试验的证据。

资料来源

← 第五部 AGI 变量
第 26 章 什么不会被压缩:时间锁、原子、数据、信任 →