top of page

HHS AI 临床试验计划以自适应证据挑战固定分期

7天前
讀畢需時 11 分鐘

HHS 启动了一项为期五年的计划,旨在挑战传统药物试验中固化的阶段划分、重复建设的基础设施以及延迟决策的问题。HHS 的 AI 临床试验计划将在统一的研究框架下整合预测模型、持续分析和自动化运营。

该计划的核心是 SURPASS,全称为 Simulation-augmented, Real-time Platform Adaptive Seamless Trials。卫生高级研究计划局(ARPA-H)将负责运营该项目,同时开展另外三个配套项目,分别聚焦试验机构、健康数据和患者导航。

最直接的承诺是提速。更艰巨的任务则是证明,自适应软件能否产出与其所替代流程同样可靠的证据。这一矛盾同时给监管机构、药物申办方、临床研究组织、试验机构和统计团队带来压力。

HHS AI 临床试验超越固定分期

SURPASS 并非只是为现有试验增加一个 AI 助手。它提出了一种生成临床证据的不同运营模式。

HHS 于 2026 年 9 月 30 日宣布 SURPASS。根据该部门的临床试验项目,该计划将结合预测性计算模型、共享基础设施、共同对照组和实时分析。

该项目计划运行五年。预计将在秋季稍晚时候开始征集提案,面向涵盖统计学、AI、试验设计、运营和监管领域的团队。

HHS 在最初公告中未披露该项目的资金规模。据最早的SURPASS 报道称,HHS 也未说明成功参与者将获得哪些监管灵活性。

这些遗漏值得关注,因为 SURPASS 的范围超出了行政自动化。其三大技术领域涵盖试验设计、统计推断和运营。

第一部分是无阶段设计引擎。它将利用数字孪生及相关预测模型,在研究开始前模拟可能出现的临床和运营结果。数字孪生是患者或流程的计算表示,用于探索可能的结果。

“无阶段”并不意味着临床测试将失去安全关卡。它描述的是一种更连续的结构,可减少传统上彼此分隔的试验阶段之间僵化的交接。

第二部分是持续推断引擎。它将依据为多次审查期间仍保持有效而设计的统计规则,分析不断累积的数据。研究人员因而可以增加、停止或调整治疗组,而不必等待某个固定的分析日期。

第三部分是智能体运营层。在这里,智能体指的是能够在有限人工指导下完成一系列既定运营任务的软件。HHS 希望这些系统能够支持试验启动、数据清洗、治疗组纳入和数据集构建。

因此,SURPASS 整合了多项已确立的理念,而非依赖单一的新模型。自适应试验已允许根据累积证据作出预先设定的调整。平台试验可在共享方案下测试多种治疗方法。计算模型也已为部分药物开发决策提供参考。

拟议中的改变,是将这些要素纳入一个持续运行的统一系统。该系统将在试验过程中学习,而不是将设计、招募、分析和报告视为大多彼此分离的阶段。

HHS 表示,药物和生物制品开发通常持续十余年,平均成本最高可达 20 亿美元,且失败率超过 90%。这些数字来自该机构的公告,应被理解为其启动该计划的理由。

有意义的问题并不是当前流程是否缓慢。几乎没有参与者会否认这一点。问题在于,持续运行的平台能否消除延误,而不把不确定性转移到更难审计的模型中。

这一差异构成了本文的核心张力。更快的运营具有价值,但临床证据必须在试验改变方向后依然保持可解释性。

四个项目攻克四种不同瓶颈

HHS 将试验缓慢视为涉及设计、机构、数据和患者的系统性问题,而不仅仅是缺少更优算法。

SURPASS 覆盖试验设计和执行。三个互补的 ARPA-H 项目则针对决定自适应研究能否在全国范围运行的条件。

STACK 聚焦临床试验机构的能力。HHS 表示,该项目将利用 AI 加快机构启用,并帮助缺乏研究经验的医疗机构具备开展试验的能力。

机构启用包括合同、人员准备、技术配置、监管审查和申办方资格认定。如果参与医院需要数月才能开始招募患者,再快的统计设计也难以带来多少益处。

STACK 还承载着地域覆盖方面的诉求。更多合格机构可让患者在离家更近的地方参与研究,而不是反复前往大型学术医疗中心。

这种扩展带来了一项现实考验。新机构必须收集一致的数据、保护参与者,并遵循复杂的方案。自动化文书工作无法替代经验丰富的研究者、受过培训的协调员或可靠的临床系统。

COMMONS 处理数据基础设施问题。HHS 将其描述为一套以隐私保护为设计原则、支持知情同意和监管级数据访问的系统。

监管级数据必须可追溯、受控,并适合用于有关治疗安全性和有效性的决策。普通的数据汇总并不会自动达到这一标准。

COMMONS 旨在连接患者入组、预测建模和试验运营所需的信息。若实施得当,它可减少重复的数据请求,并更容易识别符合条件的患者。

它也可能暴露该计划最大的实施挑战之一。医院和研究网络以不同格式、不同治理规则存储信息,且数据质量参差不齐。

知情同意带来另一项挑战。当数据跨机构流动或支持新的计算分析时,患者授权其提供信息的许可必须始终清晰易懂。

CINCH 聚焦患者侧。该项目旨在帮助人们贡献真实世界数据、协调医疗服务,并识别符合自身情况的试验。

真实世界数据来自日常医疗和日常生活,而非严格受控的研究访视。它可包括电子健康记录、理赔数据、实验室结果、登记系统以及联网设备采集的信息。

这些来源可以拓宽对治疗效果的观察。但它们也可能包含缺失信息、不一致的测量结果,以及由医疗服务获取不平等造成的模式。

因此,CINCH 必须做到的不只是匹配患者记录中的关键词。一个有用的导航系统必须解释某项研究为何具有相关性,并让临床医生继续参与资格判定。

SURPASS、STACK、COMMONS 和 CINCH 共同构成一个分层项目。SURPASS 重新设计试验;STACK 扩展其可开展的地点;COMMONS 提供受治理的信息;CINCH 将患者与该系统连接起来。

这一结构使该公告区别于更狭义的临床 AI 项目。HHS 并未承诺某一个预测模型就能筛选出成功的药物。它试图为持续生成证据建立共享机制。

这一更广泛的雄心也提高了执行风险。四个项目相互依赖,但涉及不同的机构、技术标准和法律义务。

任何一层的失败都可能限制其他层的作用。更好的匹配无法弥补试验机构不可用的问题。更快启用的机构也无法补偿不可用的数据。强大的模型无法挽救治理不善的方案。

真正的较量是速度与可验证证据之间的平衡

主要矛盾并非 AI 与人类研究人员之间的对立,而是持续自适应的承诺与稳定、可复现结论的需求之间的冲突。

传统阶段边界会造成延误,但也明确了责任。申办方知道在推进前必须具备哪些证据。审查人员可以识别方案何时变更,以及哪一份数据集支撑了一项决定。

持续运行的平台削弱了这些熟悉的边界。这可以消除重复工作,却也使统计规划和可审计性变得更加重要。

自适应平台试验说明了这种权衡。它们可以在一项主方案下测试多种干预措施,剔除无效组别,增加新候选疗法,并共享对照组。

在 COVID-19 疫情期间,平台试验在传统项目受制于速度问题时产出了重要的治疗证据。它们的成功表明,可适应的基础设施能够高效回答紧迫的问题。

然而,必须在研究人员看到可能影响其选择的结果之前,就明确规定自适应调整。计划外变更可能引入偏差、提高假阳性风险,或使治疗效果更难解释。

一项重要的平台试验综述阐述了这些研究在设计、执行、监督和报告方面所需的要求。其核心教训是,灵活性需要更多规划,而不是更少。

共享对照组也需要类似的严谨性。共同对照组可减少被分配至标准治疗的参与者数量,并提高多项比较之间的效率。

当新的治疗组与更早入组的患者进行比较时,问题就会出现。医疗实践、疾病模式、诊断方法和患者特征都可能随时间变化。

研究人员将这些早期参与者称为非同期对照。使用它们可以提高统计效能,但也可能引入与时间相关的偏差。

SURPASS 提出使用始终有效的推断引擎,以应对重复分析和自适应调整。HHS 尚未公布该引擎的统计规范、验证基准或监管接受标准。

数字孪生同样面临证据负担。模型可以在入组前模拟可能的结果,帮助团队检验假设或识别方案选择中的薄弱环节。

模拟仍然只是一种估计。它反映的是其训练数据所代表的患者、变量和关系。

如果数字孪生对老年人、农村患者、孕妇或患有多种疾病的患者代表不足,最终试验可能会围绕一个不完整的人群实现高效运行。

因此,验证必须检视的不仅是平均预测准确率。申办方和监管机构需要了解模型在哪些情况下失效、不确定性如何校准,以及其表现是否会因试验机构而异。

他们还需要一套模型更新流程。持续改进的模型听起来很有吸引力,但在试验期间变更软件,可能会使追溯过去的决策变得复杂。

每一项具有实质影响的建议,都应关联到具体的模型版本、输入数据集、规则和人工批准记录。没有这些记录,速度可能削弱问责性。

HHS 已明确表示,AI 支持的生物医学研究应强调可重复性、方法透明和无偏见审查。其 AI strategy 还将由 AI 证据支持的监管申报确定为一项可衡量的成果。

SURPASS 将检验这些原则在实际运营平台中能否经受考验。公开文档将尤为重要,因为 HHS 希望由此产生的工具、标准和监管案例能够惠及更广泛的研究体系。

目标不应是让每一项试验都采用自适应设计。有些问题适合稳定、传统的设计;另一些问题涉及的结局无法足够快地测量,因而无法为实时调整提供指导。

长期生存率、延迟出现的不良反应以及缓慢发展的疾病,不会因为软件更快地分析传入数据就立刻变得可即时评估。

试验设计必须服从医学问题。否则,该计划可能会将适应性本身当作目标,而不是一种方法。

Operation TrialBlazer 提高竞争筹码

SURPASS 是联邦政府推动美国加快药物研发步伐的更大行动的一部分,尤其是在中国临床研究能力不断提升之际。

HHS 于 2026 年 6 月推出 Operation TrialBlazer,作为覆盖整个部门的临床研究倡议。该计划协调 ARPA-H、FDA、NIH、美国国家癌症研究所及联邦卫生技术官员之间的工作。

该倡议的政治论点很直接。HHS 表示,早期研究正在向海外转移,美国可能失去与之相关的投资、专业能力和药物开发活动。

中国是最显眼的参照对象。IQVIA 数据显示,中国企业在全球试验启动数量中的份额从 2009 年的 1% 上升至 2024 年的 30%。

美国仍拥有多项重要优势,包括庞大的医药市场、经验丰富的监管机构、领先的研究型医院,以及雄厚的生物技术融资能力。

然而,试验速度会影响企业选择在哪里测试产品,也会影响投资者将资本投向何处。即便制度体系仍受尊重,推进缓慢的科学计划也可能错失机会。

SURPASS 针对的是设计和运营层面的延误。TrialBlazer 的其他措施则聚焦监管审评及申报要求。

FDA 已启动针对首次人体研究的 Expedited Investigational New Drug 试点项目。获选申办方可与合格研究机构合作,并以滚动方式提交申请材料的各个部分。

滚动申报让监管机构能在整套材料准备完成前审查已完成的部分。FDA 还希望部分机构审查和研究中心启用工作能够与申请开发同步推进。

该机构表示,更清晰的、与研发阶段相适应的化学与生产要求,可为企业节省 6 至 12 个月。这些估计载于其 development roadmap,其中还涵盖定量剂量选择及后期主方案。

对于后期研发,FDA 已明确,在何种情况下,一项严谨的关键性研究加上确认性证据可支持获批。它还修订了针对篮子试验、伞式试验和平台试验的指导原则草案。

这些政策至关重要,因为 ARPA-H 无法仅凭自身创造监管认可。SURPASS 可以资助工具和示范项目,但最终决定相关证据能否支持医疗产品决策的是 FDA。

两家机构之间的关系将影响该计划的采用。若没有明确证据表明监管机构能够评估其产出,申办方将犹豫是否围绕新系统重构试验计划。

反向风险同样存在。推动加快国内研发的政策,可能会造成更宽松解读不确定性的压力。

最有力的防线是透明验证。更快的审评应意味着更早的协调、更清晰的要求和更少的重复工作,而不应意味着降低安全性或有效性标准。

TrialBlazer 的 federal initiative 明确表示,现代化应保持科学严谨性。这一原则如今需要得到可观察的落实。

因此,衡量该计划成功与否不应只看时间线是否缩短。HHS 还必须追踪方案偏离情况、代表性、不良事件检测、可重复性,以及模型预测与临床结局之间的一致性。

国内竞争力带来了紧迫感,但并未解决证据问题。若其他监管机构、临床医生或患者不信任试验结论,美国从更快的试验中获益有限。

HHS 接下来必须证明什么

接下来的里程碑必须表明,SURPASS 能够同时产出经验证的工具、可供监管审评的证据,以及更广泛的患者可及性。

第一个信号是 ARPA-H 征集文件的结构。申请者需要针对速度、成本、参与者负担、统计有效性和人群覆盖范围提出可衡量的目标。

如果征集文件主要围绕自动化功能展开,将削弱该计划的主张。一份有力的文件将要求与传统方法进行前瞻性验证,并设定明确的失败标准。

团队还应说明,将如何在不同人口群体和参与研究中心之间审计模型。对于决定谁能进入试验或哪种治疗得以继续的决策而言,汇总准确率并不够。

第二个信号是监管协同。FDA 的参与必须从对创新设计的普遍支持,推进到评估 SURPASS 产出的具体方法。

申办方需要有关可接受的数字孪生验证、模型变更、共享对照、持续分析和文档要求的指导。他们也需要知道何时仍有必要采用传统设计。

公开案例将有所帮助。一份经过监管机构审查的方案、模拟计划和分析框架,可使该计划的价值超越其获资助团队。

如果监管协同能在大型试验依赖这些标准之前产出清晰规范,将增强这一倡议。无论软件技术表现如何,持续的模糊性都会拖慢采用。

第三个信号是来自 STACK、COMMONS 和 CINCH 的运营证据。HHS 应报告新研究中心是否更快启用、是否招募到具有代表性的人群,以及患者是否能理解知情同意流程。

更多研究中心并不必然意味着更有意义。这些中心必须能够招募参与者、保持数据质量、留住员工并保护患者。

评估 COMMONS 应看其是否提供可追溯的监管级数据,而非连接了多少记录。评估 CINCH 应看匹配是否恰当、招募是否完成以及患者是否理解相关内容。

这些指标将揭示 HHS 的 AI 临床试验究竟是在扩大可及性,还是仅仅加速了原本就具备参与条件的机构的工作。

该计划还应公布负面发现。某个数字孪生在一种疾病领域表现不佳,仍可为该方法不应适用于哪些领域提供有价值的证据。

这种透明度将有助于区分科学基础设施与技术采购活动,也将支持 HHS 所称希望建立的可复用标准。

对于临床团队而言,近期任务是做好准备。考虑参与的机构现在就应梳理其数据来源、模型治理、知情同意措辞和决策日志。

统计学家、临床医生、数据工程师、监管专家和研究中心运营人员的知识必须在整个研究期间保持连通。团队可使用可检索的 knowledge base,在这些群体之间保留假设、决策和模型文档。

该倡议最重要的成果,不会是一句“AI 让试验更快”的宣称,而应是证据表明:研究人员以更少的不必要负担、更快的速度获得了可靠答案,同时没有任何隐性损失科学严谨性。

HHS 已定义这一雄心。ARPA-H 现在必须展示其方法,FDA 必须澄清证据路径,而获资助团队必须公布外部人士能够复现的结果。首批 SURPASS 项目会像宣传其速度那样,清晰公开其验证规则吗?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page