英国 AI 医疗器械监管面临全生命周期改革
在一个独立委员会听取了超过 12,000 人的证词后,英国提出对 AI 医疗器械监管进行重大调整。该提案不再将批准视为唯一的终点,而是要求在 AI 系统的整个运行生命周期内持续监测。
该计划来自“国家医疗健康领域 AI 监管委员会”(National Commission into the Regulation of AI in Healthcare),这是由英国药品和医疗保健产品监管局(MHRA)设立的专家小组。其核心结论直截了当:围绕相对静态的医疗器械设计的规则,难以适应会随部署地点、数据、更新和临床工作流程而变化的软件。
委员会希望英国以分阶段准入、真实世界证据、持续监督以及覆盖整个医疗系统的更清晰责任机制,取代一次性保障。这也构成了核心权衡:监管机构希望患者能更早获得有价值的技术,但早期准入必须配套可执行的限制和可靠的监测。
英国 AI 医疗器械监管将不再止于一次性批准
委员会希望监管批准成为监督的起点,而非终点。
委员会于 2026 年 9 月 10 日发布建议;MHRA 于 2025 年 9 月设立该委员会。该委员会是独立的非法定咨询机构,因此其报告本身并不会改变英国法律。
政府和 MHRA 将在正式回应前审议这些建议。这一区别很重要,因为该报告是一份蓝图,而非已经生效的监管框架。
尽管如此,该提案为官员提供了清晰的推进路径。其第一项建议要求系统审查《2002 年医疗器械法规》(UK Medical Devices Regulations 2002),目标是建立适用于软件和 AI 赋能产品的框架。
委员会表示,现有规则并未清晰界定每一类医疗健康 AI 产品。行政助理、健康应用和临床决策工具可能带来截然不同的风险;但当一款产品整合多项功能时,它们之间的界限可能变得难以划分。
根据提案,监管机构将更密切关注引发相关临床风险的医疗功能,同时考虑预期收益、产品生命周期,以及与国际监管路径的一致性。
报告尤其关注制造商有时可自行声明的低风险 I 类器械。报告建议,当软件带来的患者风险足以需要独立监督时,应弥补该模式的薄弱环节。
最引人注目的提案是分阶段授权。委员会框架将其定义为:在获得更广泛授权前,于有限范围内部署。
一款器械可能先在指定医院、临床环境或患者群体中运行。开发者将在约定条件下收集证据,同时由临床医生和监管机构追踪其表现。
是否扩大使用范围将取决于这些证据。表现安全的系统可逐步迈向更广泛使用;表现欠佳或不稳定的系统,则可能暂停部署。
政府官员将这一模式比作使用“L 牌”的学车司机。这一比喻体现了在真实环境经验与受限运行条件之间寻求平衡的意图。
但这一类比也揭示了一个棘手的政策问题。学车司机身旁有持证教练,而医疗算法的责任则可能横跨多个组织。
制造商开发并更新模型。医院决定在哪里部署。临床医生解读其输出,而技术供应商则可能负责管理在系统之间传输数据的基础设施。
MHRA 监管医疗器械,但其他机构负责医疗质量、专业行为、采购、研究和数据保护。除非这些责任在实践中能够衔接,否则分阶段授权无法保护患者。
因此,该提案的范围超出了产品审批。它呼吁采用覆盖全系统的方法,将监管机构、医疗服务提供者、专业人士、开发者、制造商、患者和公众连接起来。
这一更广泛的范围,使报告不只是对器械技术规则的更新。它试图界定:当 AI 系统进入临床护理后性能发生变化时,谁必须采取行动。
静态器械规则难以应对 AI 性能漂移
AI 系统即使通过评估,在当地患者、工作流程或数据发生变化时,仍可能表现不同。
传统医疗器械监管通常高度重视产品上市前收集的证据。当获批产品在部署后基本保持一致时,这种方法最为有效。
AI 赋能软件让这一假设变得复杂。其性能可能取决于周围的患者群体、医院、硬件、临床工作流程和数据管线。
使用某一地区数据开发的诊断模型,可能会在其他地区遇到不同的疾病模式。它也可能接收到来自不同扫描设备的图像,或在不同临床实践下记录的数据。
这些差异可能导致依赖使用环境的性能表现,也就是说,结果会随使用环境而变化。强有力的实验室评估无法涵盖全国医疗系统中出现的所有条件。
性能漂移带来了另一个问题。漂移是指模型在部署后行为出现可测量的下降或变化,通常由数据或临床条件的变化引起。
漂移并不需要开发者发布新模型。在底层软件保持不变的情况下,周围环境仍可能发生变化。
医院可能更换影像设备、调整转诊标准,或引入新的电子病历工作流程。患者群体也可能随时间变化。
随后,算法可能处理与其开发数据不同的输入。其准确性可能逐渐减弱,却不会出现某个显而易见的单一故障事件。
这种渐进模式很重要,因为传统警戒系统往往聚焦于事故。严重故障会触发报告、调查或纠正措施。
AI 性能退化可能更为隐蔽。一个系统可能对某一群体略微降低敏感度、产生更多误报,或在某个地点失去准确性。
任何单一输出都未必看似应报告的器械故障。然而,累积影响仍可能延误诊断或增加不必要的医疗程序。
委员会认为,这种风险意味着被动监测不足以应对。其首选替代方案是在产品整个生命周期内,采用定期性能测量和真实世界证据。
真实世界证据是指器械在实际医疗环境中运行时收集的信息,可能包括安全报告、临床结果、错误模式、亚群表现和运营数据。
重点不只是收集更多信息。监管机构需要预先设定阈值,以揭示性能何时超出可接受范围。
开发者还需要升级处置程序。这些程序应明确何时开展调查、限制使用、暂停更新或撤回器械。
委员会还建议在整个生命周期内开展健康公平性评估。模型的平均表现可能掩盖其对服务不足人群或较小人口群体的较弱结果。
在分阶段部署期间,这一问题可能更加严重。早期部署地点可能无法代表系统扩展后将接触到的完整人群。
因此,可信的授权路径必须明确哪些群体被纳入证据,也必须说明当不同群体间的表现存在差异时,监管机构将如何应对。
委员会的公众参与活动支持这一重点。一项由 Health Foundation 开展的研究于 2026 年 3 月和 4 月,在 Cardiff、Milton Keynes 和 York 与 78 人举行研讨会。
参与者制定了五项医疗健康 AI 监管原则。准确性是他们最优先关注的问题,而人工监督和防止不平等医疗服务同样是核心条件。
这些发现并不意味着公众拒绝医疗健康 AI。它们表明,接受程度取决于可见的控制措施,以及部署后仍具有意义的证据。
这正是持续监测处于拟议英国 AI 医疗器械监管核心的原因。它将早期准入与持续证明安全性和有效性的义务联系起来。
分阶段授权以确定性换取更优证据
分阶段授权接受早期有限的不确定性,随后要求在扩大使用范围前提供更有力的证据。
委员会的提案挑战了监管机构必须在产品接触患者前解决所有不确定性的观点。对于某些 AI 系统,受控部署可能比额外的实验室测试产生更好的证据。
当性能高度依赖当地工作流程时,这种方法可能有所帮助。它也能帮助开发者测试临床医生是否按预期使用输出结果。
例如,一个模型可能会在医学影像中标记疑似中风。其技术准确性很重要,但响应时间、人员配置、警报呈现方式和升级处置程序同样重要。
分阶段部署可以将该模型限定于配备受训人员的指定医院。授权可能要求频繁报告,并要求在服务不可用时设立备用路径。
制造商和医院随后可研究系统是否在这些条件下改善医疗服务。只有在达到预先设定的安全和性能要求后,才会扩大使用范围。
委员会的第 14 项建议指出,这些路径应考虑技术成熟度、临床需求和必要的风险控制措施,也指出其条件应当透明。
从分阶段授权转为全面授权的路径必须清晰界定。否则,医院可能依赖于始终处于临时状态的产品。
该提案还要求在授权时评估监测计划。制造商可能被要求开展上市后研究,并提交定期性能报告。
监管机构需要在可报告事故发生前进行干预的程序。可检测到的性能退化本身就可能触发升级处置。
这一设计改变了证据通常的分布方式。它并未取消上市前测试,但赋予上市后证据更大的作用。
这种权衡具有潜在益处。患者可能更早获得有前景的技术,监管机构也能够在最关键的使用环境中评估其表现。
但它同样带来严重的执行风险。有限部署仍涉及真实患者,而不充分的监测会将受控的不确定性转变为未受管理的暴露风险。
数据可获得性是其中一项限制。医院必须持续记录有关模型版本、输入、输出、临床行动、结果和患者群体的信息。
这些记录可能分散在不同系统中。制造商或许能看到技术日志,却无法获得解读这些日志所需的临床结果。
医院可能拥有患者结局数据,却缺少识别软件变更所需的模型遥测数据。监管机构因此只能面对由多个组织拼凑而成的不完整图景。
监测频率又带来另一项选择。按月报告或许会错过突发性的性能恶化,而实时监管则可能产生噪声和误报。
性能阈值也需要具备临床意义。轻微的统计波动可能不会影响患者护理,而不大的平均变化却可能掩盖对特定亚群造成的严重伤害。
因此,分阶段批准所需的不只是一个授权标签。它还需要数据标准、可追溯性、分析能力,以及用于处理相互矛盾证据的规则。
英国已通过 AI Airlock sandbox 试行了这一模式的部分内容。MHRA 于 2024 年启动该项目,以真实产品探索监管挑战。
其第二阶段考察了上市后监测、证据生成、人因因素以及变化中的算法。该项目发现,现有框架可能较为碎片化,且难以保持一致适用。
Airlock 还研究了预定变更控制计划。PCCP 用于说明计划中的软件修改、对其进行控制的流程,以及如何评估其影响。
此类计划可以让开发者对获准的变更类别进行调整,而无需为每次更新寻求新的审查。不过,计划必须界定清晰边界和验证要求。
2026 年 Airlock 报告指出,PCCP 尚未被正式纳入英国监管框架。报告还提到,其在实践中如何运作仍存在不确定性。
这一缺口至关重要,因为分阶段授权和受控更新都依赖监管可预测性。开发者需要了解哪些变更仍在现有批准范围内。
监管机构同样需要清楚哪些变更需要接受新的审查。医院必须知道正在运行哪个版本,以及其证据是否仍然适用。
当这些环节协同运作时,分阶段路径可以同时改善可及性和证据质量。缺少这些条件,它就可能沦为一条更宽松、却更难察觉失败的批准路径。
患者安全取决于共同问责
生命周期监管中最困难的部分,是明确由谁采取行动,而不只是发现 AI 系统已经发生变化。
该委员会否定了仅由制造商管理所有风险的观点。医疗 AI 运行于一个社会技术系统中,这意味着软件结果取决于人员、组织、流程和基础设施。
即使模型输出正确,若临床医生误读,也仍可能造成伤害。相反,只要工作人员了解系统的局限,有缺陷的结果也可能被及时发现。
自动化偏见使这种关系更加复杂。它指的是即使存在相反证据,人们仍倾向于采纳自动化建议的现象。
培训可以降低这一风险,但仅靠教育并不足够。界面、工作负荷、警报、本地政策和管理预期都会影响临床医生的行为。
该委员会表示,AI 应支持医疗专业人员,而不是取代他们的判断。它还呼吁让患者知晓 AI 何时实质性地参与了其诊疗。
并非所有后台使用都需要同等程度的披露。行政排班工具与影响诊断或治疗选择的软件,所引发的关切并不相同。
监管上的挑战在于界定适度的透明度。信息过少会让患者毫不知情,而不加区分的通知则可能变得毫无意义。
一旦出现问题,问责就变得更加重要。患者需要获得解释、调查、纠正和补救的途径。
制造商可能将责任归咎于本地实施。医院可能指向一款已获批准的设备,而临床医生则可能表示系统影响了决策。
该委员会希望在部署前明确责任。采购合同、临床治理和监管条件都需要支持同一套监测与响应计划。
英国此前的政策已认识到这一问题。在其早期监管回应中,政府支持制造商与医疗机构就安全性和性能监测达成协议。
该回应还支持在设备必须撤市时制定后备方案。不过,官员表示,某些责任应纳入采购要求,而非医疗器械法律。
新委员会采取了更广泛的视角。它认为,监管、采购、专业标准和医疗治理必须作为一个相互联结的系统运作。
该提案包括建立一个可检索的 AI 设备安全信息公开来源。患者可以查阅特定产品已知的事件及其他相关细节。
这建立在现有安全数据库所体现的原则之上。然而,有用的透明度不只是公布原始事件数量。
一款被使用数百万次的产品,自然会比很少部署的系统产生更多报告。报告实践的差异也可能扭曲比较结果。
因此,公开信息必须说明预期用途、设备版本、风险等级、部署规模以及现有证据的局限。否则,看似开放的信息可能具有误导性。
该委员会还建议加强 MHRA 的执法权。若监管机构无法获取数据或迅速依据证据采取行动,持续监测的保护作用就十分有限。
MHRA 需要具备足够的技术专长,以评估模型性能和软件变更。它还需要足够资源来监督不断增加的产品数量。
Health Foundation 首席执行官 Jennifer Dixon 在政府的委员会公告中指出了这一能力问题。她表示,落实方案取决于 NHS 的能力、技能和系统。
这是该提案中最有力的质疑角度。设计本身可信,但其保护价值取决于仍不均衡的运营基础设施。
医院已经承担大量临床安全、网络安全、采购和数据方面的义务。AI 生命周期监测在这些职能之间增加了专业化工作。
规模较小的服务提供者可能难以维持能够解读漂移、偏见、更新和真实世界性能的团队。小型开发者也可能面临类似限制。
中央支持可减少重复工作。共享监测基础设施和统一报告标准将使不同地点的证据更易于比较。
然而,集中化也会带来自身风险。国家级监测平台必须保护敏感健康信息,并保留有意义的本地背景。
该委员会的建议承认,实施需要获得适当资源支持的监管机构。但它们尚未确定预算、人员规模或技术架构。
这一遗漏在咨询报告中可以理解。但这也意味着,政府最终的实施计划将决定该提案是否能改变实践。
英国正加入转向生命周期监管的国际趋势
英国提案具有鲜明的国家特性,但其核心监管工具正日益接近其他主要监管机构采用的方法。
AI 医疗器械监管正在成为一个国际协调问题。开发者通常为多个市场设计同一产品,而监管机构仍需在各自辖区内承担责任。
不同的定义或报告要求可能提高合规成本。更重要的是,不一致的证据标准可能使安全信号难以比较。
该委员会建议,在有助于形成清晰且具韧性的监管时推进国际协调。它也认识到,英国必须继续对本国患者使用的产品承担责任。
一个共同工具是预定变更控制计划。MHRA 与美国食品药品监督管理局及加拿大卫生部共同制定了 PCCP 的国际原则。
美国框架进展更快。FDA 于 2025 年 8 月发布了针对 AI 赋能设备软件功能的最终版 PCCP guidance。
该指南涵盖计划中的修改、开发与验证方法、实施控制和影响评估。FDA 将该计划作为上市申请的一部分进行审查。
获得授权的开发者随后可以实施该计划涵盖的变更,而无需为每项修改单独提交申请。超出计划范围的变更仍需接受适当的监管审查。
这一模式并不允许软件不受限制地自行更新。它为可预见的变更界定了受控空间,并要求证明相关控制措施仍然有效。
英国委员会的生命周期方法与这一理念相辅相成。PCCP 管理已知类别的变更,而持续监测则寻找意料之外的性能问题。
分阶段授权针对生命周期中的另一个节点。它规定,当真实世界证据降低不确定性后,产品的初始适用范围如何可能扩大。
欧盟提供了另一项重要比较。其医疗器械框架已包含上市后监测和警戒要求。
《欧盟 AI 法案》则为某些高风险 AI 系统增加了要求。对于属于医疗器械的 AI 系统,关键的高风险条款计划自 2027 年 8 月 2 日起适用。
欧洲指南将上市后监测与技术的性质和风险相联系。这一方向与英国委员会提出的适度生命周期监管相似。
不过,法律结构并不完全相同。大不列颠在英国《医疗器械法规》框架下运作,而根据《温莎框架》,欧盟规则仍适用于北爱尔兰。
因此,面向英国市场的开发者可能会在同一国家内遇到不同的监管制度。协调可以减少摩擦,却无法消除这些法律差异。
该委员会还支持与可信赖的海外监管机构建立认可和依赖路径。此类路径可以考虑外国评估,同时不放弃英国的最终决定权。
这种方式可减少对在其他地区拥有强有力证据的产品进行重复审查。它也可能帮助患者更早获得有用设备。
如果主管机构仅交换批准决定、却不交换其背后的上下文,依赖机制就会带来风险。在另一套医疗体系中验证的模型,在 NHS 中的表现可能不同。
因此,数据标准和透明证据至关重要。监管机构需要足够细节,以判断国外发现能否迁移至本地人群和工作流程。
国际协调还可以改善批准后的监测。某一市场出现的安全信号,可能会在同样模式于其他市场显现之前就具有参考价值。
关于模型版本、变更、事件和性能指标的统一术语,将使这些信号更易于解读,也会让制造商的义务更具可预测性。
然而,协调不应演变为一场争相选择要求最低路径的竞赛。开发者自然会偏好审批清晰且及时的市场。
该委员会试图让安全与速度相互支持。可预测的条件可以鼓励投资,而持续积累的证据则保护患者。
这一承诺仍有待验证。英国必须证明,分阶段准入能够在不降低全面授权所需严谨性的前提下,产生更有力的证据。
如果成功,这一框架可能影响其他监管机构。如果实施缓慢或缺乏一致性,开发者可能面临又一层流程负担,却得不到相应的明确指引。
三个信号将揭示改革是否真正保护患者
接下来的考验在于,大臣们能否将咨询性蓝图转化为可执行的规则、有资金支持的监测机制,以及可供公众使用的信息。
第一个信号是政府的正式回应。官员必须决定采纳哪些建议,以及哪些建议需要通过立法、指导意见或运营调整来落实。
一份有力的回应应明确负责机构和目标日期,同时区分近期的 MHRA 指导意见与需要修订医疗器械法规的变更。
这一信号将揭示,分阶段授权会成为一条明确界定的路径,还是仍停留在政策愿景层面。清晰的推进和撤销规则将强化委员会的论证。
含糊的承诺则会削弱它。开发者和医院无法在缺乏详细监管条件的情况下,围绕一种授权概念设计证据计划。
第二个信号是上市后监测的设计。关键细节包括所需指标、报告频率、亚组分析以及升级处置阈值。
英国已通过于 2025 年生效的规则,加强了整体医疗器械监管。不过,Airlock findings 说明了为何 AI 需要更具针对性的监管方式。
现有系统可以假设变化是离散且可检测的。一些 AI 失效问题则会逐渐显现,或只在特定临床环境中出现。
可信的实施计划应将设备版本与部署地点及性能证据关联起来,还应明确由谁调查相互矛盾的信号。
公开报告需要审慎设计。监管机构必须在不泄露私人健康数据、也不鼓励误导性比较的前提下,提供有用的安全信息。
如果 MHRA 发布统一的证据和报告标准,全生命周期监管就将变得可衡量。如果每家医院和制造商各自制定方法,全国层面的可见性仍将有限。
第三个信号是 NHS 和 MHRA 的实施能力。只有当机构具备人员、工具和采取行动的权限时,监测要求才能发挥作用。
应关注资金投入、专业人才招聘、共享技术基础设施,以及为临床医生明确界定的职责。采购文件也应在部署开始前明确责任归属。
这一能力问题决定了持续监管是变得主动,还是仅仅产生更多文书工作。这也是患者安全与创新激励交汇之处。
当不同 NHS 站点的证据要求保持一致时,开发者将从中受益。医院则可复用经过验证的监测方法,避免重复开展技术工作。
为适应这一环境做准备的团队,应在可搜索的知识库中保留决策记录、模型文档、性能报告和监管沟通记录。可追溯性将成为日常运营的一部分,而非最终合规环节。
英国 AI 医疗器械监管提案,为一次性审批的真实弱点提供了连贯的回应。它认识到,软件不断变化,就需要不断调整监管方式。
其成功与否不会以有多少 AI 产品进入 NHS 来衡量。真正有意义的指标是:问题是否能更早出现,责任是否保持清晰,以及患者是否获得更安全的照护。
因此,眼下的问题很现实:政府是否会为实现全生命周期监管所需的基础设施提供资金并加以执行?



