↩ 研究与项目/超级肽入门读本

第 1 章 什么是多肽:化学、尺寸与药物模态的边界

The Super-Peptide Primer · 02

本章回答:多肽到底是什么分子,它在药物世界里占据哪个尺寸档位,这个尺寸带来什么后果。

1.1 从氨基酸到肽键:一条可以逐位拼写的链

多肽是氨基酸串成的链。氨基酸是一类小分子,中心是一个碳原子,一头挂着氨基(化学式 NH2),另一头挂着羧基(COOH),侧面挂着一个叫"侧链"的可变部件。生命选用了 20 种标准氨基酸,它们的骨架完全一样,区别只在侧链:甘氨酸的侧链是一个氢原子,苯丙氨酸的侧链是一个苯环,赖氨酸的侧链末端带正电,天冬氨酸的侧链末端带负电。20 种侧链提供了从带电到疏水、从小到大、从柔软到刚硬的全套化学性质。

把一个氨基酸的羧基和另一个氨基酸的氨基接在一起,脱掉一分子水,形成的化学键叫肽键。肽键是一个酰胺键,键长比普通单键短,带有部分双键性质,因此它不能自由旋转,整个肽键平面是刚性的。这一点很重要:多肽链的柔性并不来自肽键本身,而来自肽键两侧的两个可旋转角度,蛋白质化学里称为 phi 和 psi 角。一条 30 个残基的链,理论上有约 60 个可旋转的自由度,构象空间巨大,但真实的多肽会在水溶液里塌缩成少数几种偏好构象。

这条链有方向。左端是自由氨基,称为 N 端;右端是自由羧基,称为 C 端。书写序列时按照从 N 端到 C 端的顺序,这是全世界的统一约定。人胰岛素的 B 链写作 FVNQHLCGSHLVEALYLVCGERGFFYTPKT,每个字母是一个氨基酸的单字母代号。这种写法意味着一件对本书极为关键的事:多肽是可以被完整拼写出来的药物。一个小分子药物的结构必须画图才能表达,一个抗体有上千个残基加上复杂的糖基化修饰,而一条 31 个残基的多肽可以写在一行里,可以被复制粘贴,可以被当作文本输入一个语言模型。第 3 章会说明这一点为什么决定了多肽的 AI 命运。

真实的药物多肽在这条基本骨架上还有修饰。司美格鲁肽(semaglutide)在 31 个残基的主链之外,第 26 位赖氨酸的侧链上挂了一条含 18 个碳的二酸脂肪链,中间用一段聚乙二醇样的间隔臂连接。这条脂肪尾巴不参与受体识别,它的功能是让分子可逆地黏附在血液里的白蛋白上,从而躲过肾脏过滤。替尔泊肽(tirzepatide)同样在第 20 位做了脂肪酸酰化。也就是说,现代多肽药物是"天然序列骨架加上工程化配件"的混合体,它既不是纯粹的天然产物,也不是纯粹的化学合成品。

1.2 尺寸的边界:为什么线画在 50 个残基

行业惯例是:2 到 50 个氨基酸残基的链称为多肽,50 个以上称为蛋白质。这条线是人为的,但不是任意的。50 个残基对应的分子量大约 5,000 道尔顿(Da,原子质量单位),而 5,000 Da 恰好接近几个物理和工业阈值的交汇处。

第一个阈值是合成。固相化学合成每接一个残基的产率即便高达 99.5%,接 50 个残基后的理论总产率也只剩约 78%,而实际工业操作中每步产率通常在 98% 到 99.5% 之间,长链的累积损失和杂质分离难度呈指数上升。50 个残基之上,化学合成的经济性迅速崩塌,重组表达(让细菌或酵母替你造)变得更划算。第 13 章和第 14 章会详细比较两条路线。

第二个阈值是肾脏。肾小球滤过膜对分子量的截留阈值大约在 30,000 到 50,000 Da 之间,但对于 5,000 Da 以下的分子,滤过几乎是自由的。这意味着一条未经修饰的短肽进入血液后,几分钟到几十分钟内就会被肾脏清走。天然 GLP-1(胰高血糖素样肽 1)的血浆半衰期只有 1.5 到 2 分钟,这既是因为肾脏,也是因为一种叫 DPP-4 的酶会在它的第二位残基后切断它。整个 GLP-1 类药物的工程史,本质上就是一部与这两个清除机制作斗争的历史。

第三个阈值是免疫。分子越大、结构越复杂,被免疫系统识别为异物并产生抗药抗体的概率越高。多肽尺寸小,通常不足以形成完整的抗原表位组合,免疫原性风险显著低于抗体和重组蛋白。这是多肽相对于大分子生物药的一个真实优势,尽管不是绝对豁免。

第四个阈值是口服。Lipinski 在 1997 年提出的"五规则"把口服活性小分子的经验上限定在分子量 500 Da、氢键供体 5 个、氢键受体 10 个。多肽在每一条上都严重超标:一条 10 个残基的肽分子量就超过 1,000 Da,主链上每个肽键都是一个氢键供体加一个受体。这是多肽长期被认为"只能打针"的化学根源。口服司美格鲁肽用 SNAC 促吸收剂把生物利用度从近乎 0 提到约 1%,代价是需要用掉几十倍的原料药,这一点在第 10 章展开。

所以"2 到 50 个残基"不是化学家的洁癖,而是四条物理曲线在同一区间交汇形成的工业现实。落在这个区间里的分子,享受化学合成的可控性,承受肾脏清除的短命,规避免疫原性的风险,放弃口服的便利。本书讨论的全部商业与资本问题,都长在这四个约束之上。

1.3 四种药物模态的对比

把药物按尺寸排成一条谱系,从小分子到大蛋白,多肽处在第二档。下表汇总关键属性。表中数字为典型区间,具体分子会有例外。

维度小分子多肽抗体大蛋白/酶
分子量150 到 500 Da500 到 5,000 Da约 150,000 Da5,000 到 200,000 Da
给药方式口服为主注射为主,少数口服静脉或皮下注射静脉注射
血浆半衰期数小时到 1 天天然 2 分钟,工程化后可达 7 天以上2 到 4 周数小时到数天
制造方式有机合成,可吨级固相合成或重组表达哺乳动物细胞培养微生物或细胞培养
单位成本每公斤数百到数千美元每公斤数万到数十万美元每克数百到数千美元每克数百美元以上
可设计性连续化学空间,难枚举离散序列空间,可枚举可生成序列长、结构复杂、依赖免疫系统或大模型极难从头设计
靶点范围口袋型靶点,可进细胞细胞表面受体与蛋白界面细胞外靶点与表面抗原补充或替代内源功能
免疫原性极低低中等,需人源化中到高

这张表里有三行值得停下来看。

半衰期那一行说明多肽的弱点是可以被工程化解决的。天然 GLP-1 是 2 分钟,利拉鲁肽(liraglutide)通过接一条 16 碳脂肪酸做到每天一次,司美格鲁肽换成 18 碳二酸加上骨架上的两处替换做到每周一次。从 2 分钟到 168 小时,跨越五个数量级,靠的是三十年积累的化学工程手艺,不是运气。抗体的长半衰期是免疫球蛋白 Fc 段与新生儿 Fc 受体循环回收机制的天然馈赠,多肽没有这个馈赠,只能自己造一个。

制造那一行是本书的核心。小分子的制造是化工,规模经济极强,产能扩张是买反应釜和管道。抗体的制造是细胞培养,产能扩张是建生物反应器,交付周期也长,但全球已有大量现成的哺乳动物细胞产能。多肽卡在中间:它需要专门的固相合成反应器、大量的有机溶剂处理能力、制备级高效液相色谱纯化线和冻干产能,这套装备既不是化工厂的标准配置,也不是生物药厂的标准配置。全球具备吨级 GMP 多肽产能的厂家不超过十家。2026 年至今全球多肽 CDMO 宣布的扩产投资超过 24 亿美元,交付周期仍在 18 到 36 个月。这是第三部的全部内容。

可设计性那一行是第 3 章的核心。小分子的搜索空间是"化学上可合成的有机分子",常被估计在 10 的 60 次方量级,但这个空间没有自然的坐标系,也没有一个简单的生成语法。多肽的空间是 20 的 n 次方,有天然的一维坐标系,有明确的生成规则,有海量的进化数据作为训练集。这是两种完全不同的机器学习问题。

表中"单位成本"一行需要额外说明口径,因为它是本书后续所有产能推算的基础。小分子原料药的价格常以每公斤数百到数千美元计,一个年销售额 10 亿美元的口服小分子,原料药需求可能只有几吨。多肽原料药的价格视序列长度、修饰复杂度和订单规模而定,简单短肽每公斤可低至数千美元,而 30 个残基以上、带脂肪酸修饰、需要多步纯化的 GLP-1 类分子,商业化规模下每公斤通常在数万到数十万美元区间,小批量研究级材料更高。这个价差直接决定了产业结构:小分子的原料药是化工品,多肽的原料药是专用制品,后者才养得起 Bachem、PolyPeptide 这样把多肽作为主业的上市公司。Bachem 在 2026 年上半年销售额 3.264 亿瑞郎,全年本币销售增长指引 35% 到 40%,同期资本开支约 1.5 亿瑞郎,资本开支占销售额的比例接近一半。这是一个用钢筋水泥换订单的行业,不是一个用算法换订单的行业。

还有一行没有写进表里,但同样关键:专利结构的差异。小分子的核心专利是化合物专利,边界清晰,到期就是到期。多肽的专利结构是分层的:序列专利、修饰基团专利、晶型与制剂专利、工艺专利、给药装置专利。司美格鲁肽的化合物专利在中国已于 2026 年 3 月 20 日到期,但注射笔装置、制剂配方和部分工艺路线的专利仍在,这使得"专利到期"在多肽领域从来不是一个干净的断崖,而是一段拉锯。第 18 章和第 19 章会把这个拉锯拆开。

1.4 中间尺寸的双重后果

多肽处在小分子与抗体之间的位置,同时带来一组优势和一组劣势,这组对偶关系值得逐条拆开。

优势一:能打的靶点不一样。 小分子靠钻进蛋白质表面的一个凹陷口袋起作用,因此它只对"有口袋"的靶点有效。人体内大量重要的调控发生在两个蛋白质的平坦界面上,界面面积常在 1,500 到 3,000 平方埃,小分子体积太小,无法覆盖。抗体能覆盖这类界面,但它太大,进不了细胞,也穿不过血脑屏障。多肽的接触面积通常在 400 到 1,000 平方埃之间,足以在平坦界面上获得纳摩尔级亲和力。GLP-1 受体属于 B 类 G 蛋白偶联受体,它的天然配体就是多肽,配体的整个 N 端要插进受体的跨膜区里才能激活信号,小分子长期做不到这件事,直到 orforglipron 这类分子出现才部分解决,而 orforglipron 也只对 GLP-1 受体成立,对 GIP 受体、胰高血糖素受体还没有同等成功的小分子。

优势二:代谢产物是氨基酸。 多肽在体内被肽酶降解,终产物是天然氨基酸,进入正常代谢池。小分子药物在肝脏经细胞色素 P450 酶系代谢,产生的中间体可能有毒性,也可能与其他药物竞争同一个酶造成相互作用。多肽极少有临床显著的 P450 相互作用。对于一个可能要吃几十年的代谢病药物,这是一个被低估的安全性优势。在一个寿命趋近 1000 岁的思想实验里,长期毒性和药物相互作用的权重会远高于今天。

优势三:可以逐位工程化。 想提高对某个受体的选择性,就换掉某一位的残基;想延长半衰期,就在某一位的侧链上挂脂肪酸;想防止被 DPP-4 切断,就把第二位的丙氨酸换成一种非天然氨基酸。每一步修改都是局部的、可解释的、可累加的。小分子的结构优化没有这种模块性,改一个取代基常常同时改变溶解度、代谢稳定性和靶点结合,牵一发动全身。

劣势一:口服困难。 已在 1.2 节说明。口服司美格鲁肽的生物利用度约 1%,意味着要让 1 mg 进入血液,需要在片剂里装约 100 mg 原料药。假设原料药成本每公斤 20 万美元,光是原料药部分,每片的成本就在 20 美元量级。这个数字直接决定了口服多肽在大众市场上打不过口服小分子。

劣势二:半衰期需要额外工程。 每一项长效化技术都是一层专利、一层工艺、一层监管审评风险。这也意味着它是一道护城河:把 GLP-1 做成每周一次的知识,不在论文里,在诺和诺德和礼来的工艺文件里。

劣势三:制造成本高一个数量级。 一条 39 个残基的多肽,固相合成需要约 39 轮偶联加 39 轮脱保护,每轮都要洗涤,每公斤成品要消耗数百升有机溶剂。成本结构里溶剂、保护氨基酸原料、纯化损失三项占主导。这是多肽产业存在大量专业代工厂的经济学根源,也是本书杠铃策略防守端的立足点。

1.5 天然多肽激素一览

人体本身就是一座多肽工厂。内分泌、神经、免疫、消化系统里有数百种内源性多肽在做信号传递。药物开发的主流路径,一直是"找到一个天然多肽,搞清它的受体,然后把它改造成一个能撑住的药"。下表列出几个在药物史上分量最重的天然多肽。

多肽残基数主要生理功能衍生药物举例
胰岛素51(A 链 21,B 链 30)降低血糖,促进合成代谢甘精胰岛素、德谷胰岛素
胰高血糖素29升高血糖,增加能量消耗瑞他鲁肽的三靶点之一
GLP-130 或 31促胰岛素分泌,抑制食欲,延缓胃排空利拉鲁肽、司美格鲁肽
GIP42促胰岛素分泌,调节脂肪组织替尔泊肽的靶点之一
胰淀素37与胰岛素共分泌,产生饱腹感cagrilintide、petrelintide
催产素9子宫收缩,泌乳,社会行为合成催产素
生长抑素14 或 28抑制生长激素与多种激素分泌奥曲肽、兰瑞肽
GnRH10调控性腺轴亮丙瑞林、地加瑞克

这张表透露了一条产业规律:成功的多肽药物几乎都是从天然配体出发的。这不是因为化学家缺乏想象力,而是因为几亿年的进化已经为每一个受体优化好了一把钥匙,从零开始设计一把新钥匙的难度远大于给现成钥匙加固。第 3 章讨论的 AI 从头设计,挑战的正是这条规律。到 2026 年为止,这条规律还没有被真正推翻:临床阶段的多肽药物里,至少 15 个由 AI 方法识别或显著优化,但其中绝大多数仍是对已知骨架的优化,而非完全从头生成的全新序列。

这些天然多肽之所以能成为药物起点,还有一个常被忽略的原因:它们的受体大多在细胞表面。GLP-1 受体、GIP 受体、胰高血糖素受体、胰淀素受体都属于 G 蛋白偶联受体家族,生长抑素受体和 GnRH 受体同样如此。细胞表面的靶点不要求药物穿过细胞膜,这恰好绕开了多肽最大的物理弱点。反过来说,凡是靶点在细胞内的疾病领域,多肽的天然优势就消失了,那里是小分子的地盘,也是大环肽试图攻入的领域,第 9 章会说明大环肽如何通过环化与 N 甲基化把跨膜能力找回来一部分。

按适应症看,已获批多肽药物的分布也说明了这个规律。代谢与内分泌(胰岛素类、GLP-1 类、生长激素相关)是最大的一块,肿瘤(GnRH 类似物、生长抑素类似物、放射性配体)是第二块,其后是产科、骨科、感染和罕见病。截至 2026 年,累计获 FDA 批准的多肽类药物约 100 个,其中相当一部分是同一骨架的不同剂型或改良型。2025 年 FDA 批准的 46 个新分子实体中,属于多肽与寡核苷酸这一大类的有 4 个。2026 年 3 月,强生与 Protagonist Therapeutics 合作的 icotrokinra 获批,成为第一个口服的白细胞介素 23 受体拮抗多肽,用于中重度斑块状银屑病。这个批准值得记住,因为它同时打破了"多肽只能注射"和"多肽只做代谢内分泌"两条成见。

还要说明一件容易被误解的事。"多肽"这个词在消费市场和灰色市场上被大量滥用。胸腺素、GHK-Cu、epitalon、BPC-157 之类的物质常被冠以"多肽"之名销售,它们在化学上确实是多肽,但在证据等级上与司美格鲁肽完全不是一回事。本书第 31 章会逐一给出证据分级。本书不构成医疗建议。

1.6 从 2 分钟到 7 天:工程化的四种手段

理解多肽药物的价值,必须理解它的半衰期是怎么被造出来的。这部分知识在公开论文里有,在工艺文件里更完整,它是双寡头护城河的化学基础。

手段一:脂肪酸酰化与白蛋白结合。 在多肽某一位赖氨酸的侧链上接一条长脂肪链。脂肪链会插进血液白蛋白的疏水口袋,白蛋白的分子量约 66,000 Da,远超肾小球滤过阈值,于是整个复合物被留在循环里。这个结合是可逆的,游离的药物分子持续被释放出来发挥作用。利拉鲁肽用 16 碳的棕榈酸,半衰期 13 小时;司美格鲁肽改用 18 碳的二羧酸并加入一段亲水间隔臂,同时把第 8 位的丙氨酸换成一种非天然的氨基异丁酸以抵抗 DPP-4,半衰期提高到约 165 小时。两个改动叠加,把每天一针变成每周一针。

手段二:抗酶切的残基替换。 DPP-4 这类酶识别的是特定位置的特定残基。把它要切的位点换成一个它不认识的非天然氨基酸,酶就失效了。这类改动往往只需要一个残基,成本极低,收益极高,是多肽工程里性价比最高的一类操作。

手段三:环化与订书。 把链的两端或两条侧链连起来,形成环。环化限制了构象自由度,既提高了对受体的亲和力(因为分子不必再花费熵去固定构象),也让肽酶更难下嘴。奥曲肽是一个八肽环状物,它把生长抑素的 14 个残基压缩到 8 个并环化,半衰期从几分钟提高到约 100 分钟。第 9 章会展开大环肽与订书肽。

手段四:与大分子融合。 把多肽接到抗体 Fc 段、白蛋白或聚乙二醇上。这条路能把半衰期推到两周以上,但分子变大,制造回到细胞培养路线,成本结构和多肽不一样了。度拉糖肽走的是 Fc 融合路线。

这四种手段之外,还有第五类正在成熟的方向:改变给药系统而不改变分子本身。可植入的渗透泵可以让一条半衰期只有几小时的多肽在皮下持续释放一年,exenatide 的微球缓释剂型和用于 HIV 预防的长效植入物都走这条路。微针贴片试图绕开注射的心理门槛。月制剂正在从概念走向临床。这类技术的商业意义在于它们把竞争从"谁的分子更好"转向"谁的给药体验更好",而给药体验的门槛往往是器械工程和生产装配,同样属于原子侧而非智力侧。第 10 章会展开。

这四种手段的共同点:它们都把"分子设计"的难度转移到了"工艺实现"的难度上。接一条脂肪链在纸上是一步反应,在工厂里是一个需要控制区域选择性、纯化副产物、验证杂质谱的独立工艺单元。一个分子的设计可以在一台服务器上完成,一条工艺的放大需要一个车间和一群人花两年。这个不对称是全书论证的起点。

1.7 边界正在模糊

"2 到 50 个残基"这条线在 2026 年已经被三个方向侵蚀。

向下侵蚀:小分子进入了多肽的靶点。 orforglipron 是一个非肽类小分子,分子量在 800 Da 量级,它能激活 GLP-1 受体,2026 年 4 月获 FDA 批准用于肥胖治疗,商品名 Foundayo。在 ATTAIN-1 三期试验中,36 mg 组 72 周平均减重 12.4%,低于司美格鲁肽和替尔泊肽,但它可口服、无进食和饮水限制、制造走标准有机合成路线。这是多肽制造产业面临的最大威胁,第 20 章专门处理。

向上侵蚀:迷你蛋白抹掉了多肽与蛋白的界线。 AI 从头设计出来的迷你蛋白通常在 50 到 100 个残基之间,有明确的三维折叠,亲和力可达皮摩尔级。它们在化学上属于小蛋白,但在功能定位和给药逻辑上更接近多肽。AI Proteins 在 2025 年完成 4,150 万美元 A 轮融资,与百时美施贵宝的合作总额最高 4 亿美元,做的就是这类分子。Chai Discovery 的模型在迷你蛋白设计上报告了 68% 的湿实验成功率,在全新抗体设计上的成功率是 16% 到 20%。两个数字的差距,本身就说明尺寸与 AI 可解性之间的关系。

横向侵蚀:非天然氨基酸把字母表从 20 扩到数百。 引入 D 型氨基酸、N 甲基化氨基酸、带有正交反应基团的氨基酸,序列空间从 20 的 n 次方扩张到几百的 n 次方。这既是机会(可及化学空间暴涨)也是成本(非天然保护氨基酸单价可达天然氨基酸的十倍以上,且供应商集中)。

对于要做定位判断的读者,这三条侵蚀线各自的含义不同。向下侵蚀威胁的是产能资产的需求端;向上侵蚀威胁的是设计资产的差异化;横向侵蚀则在上游原料环节创造了新的瓶颈点。三条线会在第四部和第五部反复出现。

把三条线放在一起看,可以得到一个对全书有用的推论:多肽作为一个"模态"的边界会越来越模糊,但作为一套"制造能力"的边界会越来越清晰。未来十年,一个分子到底叫多肽、叫迷你蛋白还是叫肽模拟物,在监管和科学上的意义会下降;而它到底需不需要固相合成反应器、需不需要制备级色谱、需不需要冻干线,在商业上的意义会上升。分类学会消融,产能不会。这个区分是本书第三部和第六部的立论基础,读者在读后面章节时可以一直带着它。

最后给出一个便于记忆的概括。小分子是"化学品",它的竞争发生在成本曲线上。抗体是"生物制品",它的竞争发生在细胞株和产能规模上。多肽同时具备两者的性质:它像小分子一样可以被化学合成,因而可以被精确定义和逐位改造;它又像生物药一样是信息编码的分子,因而可以被计算机读写。这种双重身份是多肽在 AI 时代具备特殊观察价值的根本原因,也是本书选它作为思想实验标本的理由。第 4 章会把这个理由正式展开。

本章要点

与定位的关系

对资本定位而言,本章确立了一条最基础的判断纪律:看一家公司做的到底是哪个尺寸档位的分子,因为尺寸决定成本结构、产能类型和竞争格局。一家做口服小分子的公司和一家做注射多肽的公司,即便针对同一个受体、同一个适应症,它们的固定资产、供应链和毛利曲线完全不同。同样,把"多肽概念"当作一个整体去买,会把大规模固相合成产能的稀缺性与灰色市场研究用肽的泡沫混为一谈。本书的杠铃策略要求的是对尺寸与工艺的辨识能力,而不是对概念的热情。本书不构成投资建议。

对事业定位而言,本章解释了为什么"翻译者"这个岗位存在。分子设计和工艺实现之间隔着一道真实的鸿沟:脂肪酸酰化在论文里是一个反应箭头,在车间里是一套需要控制区域选择性、界定杂质谱、验证工艺参数区间的独立工艺。懂序列也懂反应器的人,站在这道鸿沟上。从第 3 章开始,本书会反复论证这道鸿沟不会因为智力提高而消失,只会因为设计端变得廉价而显得更宽。

对个人定位而言,本章提供的是一把筛子。"多肽"在化学上是一个宽泛的类别,从司美格鲁肽到灰色市场上的研究用肽都算多肽,但它们在证据上相隔十万八千里。判断的第一步不是问"这是不是多肽",而是问它是哪一个受体的配体、有没有随机对照试验数据、是哪条工艺路线生产的、是否有可追溯的质量体系。第 31 章会把这套筛子写成一张清单。本书不构成医疗建议。

资料来源

← 第一部 底层逻辑
第 2 章 多肽药物百年史:从胰岛素到司美格鲁肽 →