↩ 研究与项目/超级肽入门读本

第 22 章 临床试验经济学:时间是唯一不能压缩的成本

The Super-Peptide Primer · 26

一项三期试验的钱花在哪里,为什么随访期不能用更聪明的人缩短,AGI 到底能把药物开发压到多快。

多肽领域的所有价值判断最终都绕不开一个问题:一个分子从进入人体到拿到批文,到底需要多长时间,需要多少钱,以及这两个数字里有多少是"智力可以压缩的",多少是"只能等的"。本章先把三期试验拆开,看钱和时间各花在哪里,用肥胖减重试验、心血管结局试验和衰老终点试验三类样本给出规模与成本表。然后回答核心问题:为什么随访期不能用智力压缩。最后逐个环节推演 AGI 能加速什么、不能加速什么,给出一条"智力 1000"情景下药物开发时间线的下限。这一章是全书主线中"临床时间"这项稀缺资产的机制解释。

22.1 一项三期试验的成本结构

先把概念说清楚。三期试验是药物上市前的最后一道人体试验,目的是在足够多的病人身上证明疗效并积累安全性数据,规模从几百人到几万人,通常需要 1 到 5 年。它的成本主要由五块构成:受试者相关费用(招募、检查、随访、给药,每人次访视都要付给研究中心)、研究中心费用(启动、监查、管理)、药物供应(试验药与安慰剂的生产、包装、配送,对多肽来说这本身是一笔可观的 GMP 生产成本)、数据与统计(数据管理、统计分析、监查)、以及监管与质量(伦理审批、注册、审计)。

公开数据给出的量级如下。对美国 2015 到 2016 年获批新药的支撑性关键试验做的系统分析(Moore 等,发表于《JAMA 内科学》)显示,一项关键试验的中位成本约 1,900 万美元,四分位区间 1,200 万到 3,300 万美元;这个数字看起来不大,因为多数关键试验只有几百人、几个月。按人头算,行业基准的三期每受试者成本中位数约 4.1 万美元,平均每人约 11 次访视。心血管结局试验是另一个量级:对 2000 年代心血管三期试验的分析给出急性冠脉综合征试验中位成本约 6,700 万美元,心衰试验中位约 1.35 亿美元;诺华 8,442 人的 PARADIGM-HF 试验估算成本约 3.47 亿美元。这些是十几年前的价格,按 2026 年的人工与研究中心费用,再乘 1.5 到 2 倍并不过分。

肥胖领域的试验有自己的特点。减重试验的主要终点是体重百分比变化,测量简单,但因为需要证明减重能维持,主要终点通常放在 68 到 78 周,还要加上剂量爬坡期与随访期,一项减重三期从首例入组到揭盲通常 2 到 2.5 年。样本量不大(1,000 到 4,700 人),但时间长、访视多,每人成本高。真正贵的是心血管结局试验(CVOT),这类试验不看体重,只看心梗、卒中、心血管死亡这些"硬事件"何时发生,需要上万人、3 到 5 年。

22.2 三类试验的规模与成本表

下表把 2026 年可核实的代表性试验按三类列出:减重三期、心血管与全因死亡结局三期、衰老终点试验。成本列中带"估算"的,是按每受试者 3 万到 6 万美元的行业区间乘以人数、再按试验年限与事件裁定复杂度调整得到的量级,不是公司披露值,请按数量级理解。

试验(药物)类别规模主要终点与时间点时长成本量级
SURMOUNT-1(替尔泊肽)减重三期2,539 人72 周体重变化约 2 年约 1 到 2 亿美元(估算)
STEP 1(司美格鲁肽)减重三期1,961 人68 周体重变化约 2 年约 1 亿美元(估算)
VANQUISH-1(VK2735)减重三期约 4,650 人78 周体重变化2025 年入组完成,2027 年读出约 2 到 3 亿美元(估算)
ACCOMPLISH-1(aleniglipron)减重三期最多 3,600 人72 周量级体重变化2026 年 8 月启动,2028 年下半年读出约 2 亿美元(估算)
SELECT(司美格鲁肽)心血管结局17,604 人,41 国主要不良心血管事件首次发生时间2018 年启动,平均随访约 40 个月,2023 年读出估算 5 到 10 亿美元
SURMOUNT-MMO(替尔泊肽)心血管与全因死亡结局约 15,000 人,664 个中心,27 国五项复合终点(非致死心梗、非致死卒中、冠脉血运重建、心衰事件、全因死亡)首次发生时间2022 年启动,预计 2027 年 10 月完成估算 5 到 10 亿美元
MARITIME-CV(MariTide)心血管结局未披露,预计上万人主要不良心血管事件2025 到 2026 年入组中估算数亿美元
TAME(二甲双胍)衰老复合终点3,000 人,65 到 79 岁,14 个中心心血管病、认知障碍、癌症或死亡的首次新发4 到 6 年随访约 7,500 万美元(AFAR 估算),至 2026 年尚未入组
VITAL-H(雷帕霉素、达格列净、司美格鲁肽)衰老与健康寿命726 人,60 到 65 岁,四臂年龄相关健康与功能衰退的延缓2027 年开始入组,2028 到 2031 年出结果ARPA-H 资助最高 3,800 万美元

表里有几个值得停下来看的对比。第一,SURMOUNT-MMO 是历史上第一个把全因死亡纳入主要复合终点的肥胖药物试验,15,000 人、664 个中心、5 年,礼来在 2022 年替尔泊肽减重适应症还没获批时就启动了它,等到 2027 年读出时,替尔泊肽已经卖了 5 年。这是大药企用资本换时间的典型做法:不等前一个问题回答完,就把下一个问题的时钟拨动。第二,衰老终点试验的规模并不比减重试验大,但时间更长,而且最贵的那一项(TAME)花了十年还没有找到 7,500 万美元的钱,因为二甲双胍是一个没有专利的老药,没有人能从结果中收回投资。第三,VITAL-H 是美国政府机构 ARPA-H 出钱做的,它测的三个药里有司美格鲁肽,这是政府在替行业做"衰老作为适应症"的探路试验,第 23 章会展开。

22.3 为什么随访期无法用智力压缩

这一节是全章的核心。先把结论说出来:随访期由三样东西决定,事件发生率、统计功效、生物学过程的时间常数,三样都不是智力变量。

事件驱动的算术

心血管结局试验是"事件驱动"的:试验不是跑到某个日期结束,而是跑到累积了预设数量的事件(心梗、卒中、死亡)才揭盲。所需事件数由统计功效决定。用最简化的推算:若想以 90% 的功效、5% 的显著性水平检出 15% 到 20% 的相对风险下降,通常需要 1,200 到 1,800 个主要终点事件。SELECT 试验实际累积了约 1,270 个主要终点事件,司美格鲁肽组的事件率 6.5%,安慰剂组 8.0%,相对风险下降 20%。

事件数等于人数乘以人均随访年数乘以年事件率。SELECT 入选的是已有心血管病的肥胖患者,年事件率约 2.4%,17,604 人随访约 3.3 年累积了 1,270 个事件。要把随访从 3.3 年压到 1 年,同等事件率下需要约 5.8 万人,招募 5.8 万有心血管病史的肥胖患者本身就要两三年,而且药品供应、研究中心数量都会成为约束。更根本的是,很多药物的效应有延迟:SELECT 的两条事件曲线在第一年内几乎重叠,之后才逐渐分开。如果只随访一年,即使有 5.8 万人也可能测不出差别,因为效应还没有产生。

第二个不可压缩的原因在事件率本身。要缩短随访,可以选事件率更高的人群,但事件率越高的人群病情越重、越不具代表性,试验结果推广到普通肥胖人群时监管机构会打折。SURMOUNT-MMO 选的是没有糖尿病、有或有心血管病风险的肥胖成人,事件率低于 SELECT 人群,所以需要更长时间和差不多的人数。低风险人群的预防性试验,天然就比高风险人群的治疗性试验更慢。

生物学的时间常数

减重试验不是事件驱动的,但同样有时间下限。GLP-1 类药物的减重曲线在 30 到 40 周开始变缓,60 到 72 周接近平台。监管机构要求看到的是"维持"而不是"下降":一个在 24 周减重 15% 但 52 周反弹的药,和一个 72 周稳定在 15% 的药是两种药。这就是为什么 FDA 与 EMA 的减重试验主要终点都放在 52 周以上,行业实践收敛在 68 到 78 周。第 21 章里众生 RAY1225 二期 24 周减重 21.18% 之所以需要三期验证,正因为 24 周看不到平台。

安全性同样有时间下限。国际人用药品注册技术协调会(ICH)E1 指南对长期用药的安全性数据库有最低要求:至少 1,500 名受试者暴露,其中 300 到 600 人暴露 6 个月以上,至少 100 人暴露 1 年以上。这是底线,实际减重药物的安全性数据库远大于此。有些不良反应只在长期暴露后出现,如胰腺、甲状腺、胆囊的问题,以及肌肉流失的累积效应,一年的暴露数据不能推断五年。

衰老终点的时间常数最长。65 到 79 岁人群一年内新发心血管病、认知障碍、癌症或死亡的复合事件率大约在 4% 到 7%(估算),要在 3,000 人里累积几百个事件并检出 20% 到 30% 的相对下降,4 到 6 年是算出来的,不是拍出来的。如果把主要终点换成表观遗传时钟这类生物年龄替代指标,试验可以缩到 1 到 2 年,但监管机构目前不接受这类替代终点作为获批依据(见第 23 章)。替代指标越快,离监管认可越远,这是一个精确的交换关系。

为什么"更聪明"不改变这些数字

一个常见的直觉是:智力提高 10 倍,试验设计就能聪明 10 倍,需要的人和时间就能少 10 倍。这个直觉错在混淆了两种不确定性。试验设计的聪明可以消除"认识论上的不确定性",也就是我们不知道但原则上可以知道的东西:哪个剂量最优、哪类患者受益最大、哪些混杂因素要控制。但事件发生率反映的是"本体论上的不确定性":一个具体的病人在明年是否发生心梗,是生物学过程本身的随机性,再聪明的设计者也只能等它发生或不发生,然后数。统计功效的公式里没有一项是"设计者的智力"。

另一个直觉是用机制推断替代观察:既然减重 15% 已经证明能降低心血管事件,那么减重 20% 的新药就不必再做结局试验。监管机构不接受这个推理,历史上有充分理由。降糖药罗格列酮降糖有效但增加心血管风险,导致 FDA 2008 年起要求所有降糖药做心血管安全性试验;降胆固醇的 CETP 抑制剂 torcetrapib 把高密度脂蛋白提高了 70%,结局试验却显示死亡率上升。替代指标与硬终点之间的关系必须在每一个新机制上重新验证,这不是保守,是被反复教训过的经验。

22.4 AGI 能压缩的环节

说完不能压缩的,再看能压缩的。一项三期试验从方案定稿到数据揭盲,时间上大致可以拆成:方案设计与监管沟通 6 到 12 个月,研究中心启动与伦理审批 6 到 9 个月,入组 12 到 24 个月,最后一名受试者入组后的随访期(由主要终点时间点决定)12 到 78 周不等,数据清洗、锁库与分析 3 到 6 个月,申报资料撰写 3 到 6 个月。其中除随访期以外的每一段,都有智力可以介入的空间。

环节当前典型耗时AGI 可压缩程度机制剩余约束
方案设计与模拟6 到 12 个月高,可压至 1 到 2 个月用历史试验与真实世界数据做数千次方案模拟,优化剂量、样本量、入排标准监管沟通会议的排期,FDA 二期结束会议按法定时限安排
研究中心选择与启动6 到 9 个月中,可压至 3 到 4 个月用中心历史入组速度与病人库预测产出,自动化合同与伦理文件各国伦理委员会与合同法律流程,人的签字
患者招募12 到 24 个月高,可压至 4 到 8 个月在电子病历中自动匹配入排标准,主动触达;已有工具将匹配时间从数小时压到分钟符合条件的病人总数有限,知情同意需要人对人完成,病人愿不愿意参加
试验执行与监查与随访同长中远程与基于风险的监查,可穿戴设备连续采集,减少访视给药、抽血、影像仍需病人到场或上门
数据清洗与锁库3 到 6 个月高,可压至数周实时数据核查,自动化质疑与解答最后一名受试者最后一次访视的日期
统计分析与申报撰写3 到 6 个月高,可压至数周预定义分析自动执行,临床研究报告自动生成法规要求的人工签核与质量审计
随访期12 到 78 周(减重);3 到 5 年(结局)接近零无生物学时间常数与事件发生率
监管审评标准 10 个月,优先 6 个月(FDA)低到中审评机构自身用 AI 辅助阅读,但法定时限与咨询委员会流程不变法律规定的审评时钟

把表里的数字加起来,可以做一个粗略推演。以一项 72 周终点的减重三期为例,当前从方案定稿到揭盲约 3.5 到 4 年(12 个月准备、18 个月入组、72 周随访、6 个月分析)。在"智力 1000"的基准线情景下,准备压到 3 个月,入组压到 6 个月,分析压到 1 个月,随访 72 周不变,总时长约 2.4 年。压缩了约 40%,其中随访期从占总时长的 35% 变成占 58%。以心血管结局试验为例,当前约 5 到 6 年,压缩后约 4 到 4.5 年,随访期占比从 60% 升到 80% 以上。结论是:AGI 把试验的"非随访部分"压得越薄,随访期在总成本与总时间中的占比就越高,时间作为稀缺资产的相对价格反而上升。

患者招募:最大的可压缩项

招募是当前最浪费时间的环节,约 80% 的临床试验不能按计划完成入组,约三分之一的研究中心一个病人也招不到。原因不是病人不存在,而是找不到:入排标准写在方案里,病人信息散在几十家医院的电子病历里,中间靠研究协调员人工筛。大语言模型已经能把非结构化病历与试验入排标准做匹配,公开评测中匹配速度比人工快一个数量级以上,准确率与经验丰富的协调员相当。在 AGI 情景下,招募的瓶颈会从"找到病人"转移到"病人同意"和"病人数量",后者在罕见病里是硬约束,在肥胖这种患病率 40% 的疾病里则不是。

模拟对照与外部对照

最激进的压缩设想是不再设安慰剂组,用历史数据或 AI 生成的"数字孪生"病人做对照,从而把样本量减半、把入组时间减半。这个设想在 2026 年的状态是:FDA 关于外部对照试验的指南仍是草案,明确要求试验人群与外部对照人群满足"可交换性",即两组在所有影响结局的因素上足够相似;由于没有任何统计方法能证明外部对照无偏,监管机构把敏感性分析作为主要保障。实践中外部对照只在罕见病、无法设安慰剂的伦理场景和单臂加速审批中被接受。肥胖与心血管这种病人充足、安慰剂可行的领域,随机对照仍是唯一被接受的金标准。AI 生成的合成病人是最新也最未经验证的变体,目前没有任何一项关键试验以它为主要对照获批。

比较现实的做法是用数字孪生做"预测性富集":在随机化之前用模型预测每个受试者的预后,以此分层或减少所需样本量,同时保留随机对照。FDA 已通过新方法资格认定程序接受过这类工具。这能把样本量减少 20% 到 30%,但不改变随访期。

监管审评:法定时钟

FDA 的标准审评时限是收到申请后 10 个月,优先审评 6 个月,这是《处方药使用者付费法》规定的绩效目标,不因审评员多聪明而缩短。FDA 自 2025 年起在内部使用生成式 AI 辅助审评员阅读申报资料,审评员能更快完成科学审评,但法定时钟、咨询委员会会议排期、标签谈判、生产现场检查都是流程时间。中国 NMPA 把创新药临床试验默示许可从 60 日压到 30 日(试点),是监管机构自己在压缩自己的时钟,这是可以做到的,因为审评时限是行政决定不是生物学决定。但上市审评的时限(中国标准 200 个工作日,优先审评 130 个工作日)同样是行政时钟,可以缩短,前提是审评能力够用。

22.5 一条"智力 1000"情景下的时间线下限

把前面的分析合并,可以给出一条推演。这是推演,不是预测,假设写在括号里。

阶段2026 年典型时长AGI 基准线情景下限来自何处
靶点确认与分子设计2 到 4 年1 到 6 个月湿实验验证与合成的物理周期
临前毒理12 到 18 个月6 到 9 个月动物长期毒理的观察期(若监管完全接受体外与计算模型替代,可更短)
一期12 到 18 个月6 到 9 个月单次与多次给药的药代观察,多肽长效化后洗脱期更长
二期18 到 30 个月12 到 18 个月剂量探索需要 24 到 36 周疗效观察
三期(减重)3.5 到 4 年约 2.4 年72 周随访
三期(心血管结局,可与减重三期并行)5 到 6 年4 到 4.5 年事件累积
监管审评10 到 12 个月6 到 10 个月法定时钟
首次进入人体到获批(减重)7 到 9 年约 4.5 到 5.5 年二期加三期随访

这条推演给出的结论是:即使把所有可压缩环节压到极限,一个减重多肽从进入人体到获批仍需 4.5 到 5.5 年,其中约 3 年是纯随访。如果要在标签上写心血管获益或全因死亡获益,再加 1 到 2 年。如果要"衰老"作为适应症,主要终点是多病复合事件,再加 2 到 4 年。智力 1000 把药物开发从 8 年压到 5 年,压缩的是前 3 年;后 5 年里有 4 年是等待。

有两种情况会让这条下限失效,需要诚实列出。第一,监管机构接受生物年龄替代终点作为获批依据。这需要多年的验证研究证明替代指标的变化可靠预测硬终点的变化,本身也是一个时间过程,第 23 章会分析它的可能时间表。第二,监管机构接受"机制类别效应",即同一靶点的新分子不必重做结局试验。这在降糖药领域部分发生过(FDA 2020 年撤销了对所有降糖药强制做心血管安全性试验的要求),但对多受体激动剂这类新机制不太可能,因为每加一个受体就是一个新的未知。

22.6 谁在临床时间上赚钱

临床时间不可压缩,意味着它有价格。谁在这个价格上赚钱,是定位问题。

第一类是大药企自身。礼来在 2022 年启动 SURMOUNT-MMO,2027 年读出,这 5 年里没有任何挑战者能拿到同等级别的全因死亡数据,即使挑战者 2027 年启动同样的试验,也要到 2032 年。时间被提前购买了,先发者的时间优势是复利的。第二类是合同研究组织(CRO),它们按访视、按病人、按中心收费,试验越长收得越多,AGI 会压缩它们的招募与数据业务,但随访期的执行仍然要人跑。第三类是研究中心网络与病人库,尤其是在中国这种病人多、成本低的地方,2026 年多家跨国公司把三期病人的相当比例放在中国。第四类是为长期随访提供工具的公司:可穿戴设备、家庭采血、远程影像。第五类,也是最容易被忽略的,是提供试验用药的 GMP 产能:一项 15,000 人、5 年的试验需要几十万支多肽注射剂,全部按商业化标准生产。

反过来,被临床时间伤害的是只有一个分子、现金按月倒数的独立公司。Viking 半年烧 2 亿美元等 2027 年的数据,MBX 等 2026 年四季度的一期数据决定能不能再融资。对它们而言,时间不是资产而是负债,每一天都有价格。这也是为什么 2025 到 2026 年的交易越来越多地用 CVR 结构:辉瑞给 Metsera 股东最高 23 亿美元的或有付款,兑付条件全部是时间事件(三期启动、获批),买卖双方在合同里承认,谁也不知道这几年会怎样。

中国与美国:同样的时间,不同的价格

临床时间在各国的价格并不相同。同一份 72 周减重三期方案,在中国的每受试者成本大约是美国的三分之一到二分之一,研究中心启动更快,入组速度常常是美国的两到三倍,因为中国的三甲医院单中心就能覆盖几十万门诊病人。恒瑞 HRS9531 的中国三期 567 人从首例入组到揭盲不到两年,礼来 SURMOUNT-1 的 2,539 人用了约两年半。但价格差不等于时间差:中国试验的随访期同样是 48 或 52 周,一年还是一年。中国公司节省的是每单位时间的成本,不是时间本身。

这带来两个后果。第一,跨国公司把越来越多的三期病人放在中国,用中国的低成本病人分摊全球试验的账单,同时把中国数据纳入全球申报,前提是中国研究中心的数据质量能通过 FDA 与 EMA 的现场核查,2026 年 9 月 1 日起施行的新版中国 GCP 与 ICH E6(R3) 对齐,正是为了保住这份"出海可用"的数据。第二,中国公司自己做的三期只在中国有效,要进入美欧还得补做当地人群的试验,第 21 章里恒瑞与 Kailera 的结构就是为了解决这个问题:中国的钱买中国的时间,美国的钱买美国的时间,两段时间并行而不是串行。并行是唯一真正能"缩短"总时间的手段,它不压缩任何一段随访期,只是让两段随访期同时走。

本章要点

与定位的关系

对资本定位而言,本章给出的是估值模型里最重要的一个参数:任何多肽分子的现金流起点,不会早于"首次进入人体加 4.5 到 5.5 年",带结局标签的不会早于加 6 到 7 年。这一参数在 AGI 情景下几乎不变,而分子的数量会因设计免费而暴增。同样多的临床时间,要分给多得多的分子,临床时间的"租金"上升。持有这种租金的资产是:先发的大药企(它们的时间优势是复利的)、大型 CRO、有病人库的研究中心网络、试验用药产能。本书不构成投资建议,但这个框架下"多一个分子"的边际价值在下降,"多一年领先"的边际价值在上升。

对事业定位而言,试验里被 AGI 压缩的岗位(数据管理、医学写作、招募协调)和不被压缩的岗位(临床运营、研究中心关系、监管策略、试验用药 CMC)分界清楚。前者的技能会迅速贬值,后者的价值上升,因为一个能把 15,000 人、664 个中心、27 个国家的试验按时跑完的临床运营负责人,做的事情本质上是管理时间,AGI 是他的工具而不是替代者。懂多肽 GMP 生产又懂临床供应链的人尤其稀缺,因为试验用药的产能与商业化产能是同一批反应器。

对个人生物学定位而言,本章解释了为什么"等待"是理性的。一个分子在 48 周数据出来时,它的 5 年安全性尚未被任何人观察过;它的心血管获益要等结局试验;它的长寿获益要等衰老终点试验。早期使用者本质上是在用自己的身体缩短公司的随访期,而公司不会为此付费。第 31 章的证据分级建立在本章的时间结构上。本书不构成医疗建议。

资料来源

← 第 21 章 挑战者名录
第 23 章 监管路径:衰老能否成为适应症 →