top of page

HHS 召开闭门临床 AI 会议,引发透明度质疑

8月10日
讀畢需時 15 分鐘

HHS 于 7 月邀请临床 AI 开发商参加闭门会议,由此引发的争议如今已登上 Google News。联邦官员希望亲自观摩 AI 医疗服务的演示。然而,私下准入使受邀公司得以对监管机构如何理解市场施加不同寻常的影响。

据 STAT 报道,参与者包括 Counsel Health、K Health、Hippocratic AI 和 Ellipsis Health。来自 Stanford、MIT、Brown 和 NYU 的研究人员也收到邀请。游说人士及其他行业代表同样加入了讨论。

这些会议是联邦层面更广泛努力的一部分,旨在通过监管、报销、研究和技术标准加快临床 AI 的应用。这一目标本身并无争议。监管机构需要直接接触产品,因为其界面、风险和运营模式与传统医疗设备存在显著差异。

核心问题在于官员如何获取这些知识。私下演示可以促进坦率的技术讨论,并保护敏感信息;但它也可能掩盖谁获得了准入、哪些说法受到质疑,以及被排除的群体是否得到同等考虑。

这一取舍至关重要,因为 HHS 监管着决定哪些临床 AI 产品能够触达患者的多项杠杆。FDA 监管符合条件的医疗软件,而 CMS 则通过支付政策影响其应用。联邦健康 IT 规则同样会影响算法如何嵌入医院系统。

因此,这一事件不只是几场利益相关方会议。它考验的是联邦官员能否在加快临床 AI 应用的同时,避免让准入本身变成一种监管优势。

Google News 揭示了一场经过精心筛选的临床 AI 对话

这些会议将产品演示与政策影响力置于同一私下流程之中。

据报道,闭门会议于 7 月举行,目的是让联邦卫生官员直接体验已经在市场中运行的临床 AI 产品。

STAT 采访了四家参会公司:Counsel Health、K Health、Hippocratic AI 和 Ellipsis Health。它们的产品代表了 AI 辅助医疗的不同形态,而非一个同质化类别。

一些服务直接与患者沟通;另一些则帮助临床医生收集信息、监测健康指标或决定如何应对。这种多样性使建立统一监管框架的尝试更加复杂。

临床 AI 是一个宽泛术语,指支持或执行与患者护理相关任务的软件。它包括预测模型、对话系统、诊断支持、远程监测和临床文档工具。

这一类别涵盖风险特征截然不同的产品。预约助手带来的风险不同于推荐治疗方案的软件。自主与患者交谈的系统,也会引发不同于仅向医生可见的算法的问题。

私下演示可以帮助官员理解这些差异。一份书面材料可能描述 AI 代理的安全措施,却无法展示它在模糊的患者交流中如何表现。

现场演示让监管机构能够追问。官员可以测试升级处置程序,查看系统如何表达不确定性,并观察它是否会将紧急病例引导至人工医疗服务。

这种体验确有价值。评估对话式医疗系统的监管者需要了解的不只是基准测试分数或产品示意图;他们必须看到患者和临床医生实际面对的内容。

然而,据报道的参会者构成也赋予会议第二项功能。这些并非按照公开流程开展的纯技术测试会议;它们还将监管者与企业、研究人员、游说人士和政策倡导者联系起来。

这种组合可能模糊教育与影响之间的界限。公司在展示产品时,自然会控制其分配时段内可呈现的场景、解释和证据。

官员可以质疑这些说法,但外部观察者无法评估质询过程。竞争开发商无法判断其产品是否获得了同等对待。患者团体也无法了解其关切是否影响了讨论。

同样的不确定性也适用于学术参与。研究人员可以提供独立专业知识,但机构背景本身并不保证独立性。咨询工作、资助、投资和行业合作关系都可能影响参与者的视角。

这些情况都不能证明会议导致了不当决定。现有报道并未表明 HHS 承诺了政策让步,或偏袒某一家特定公司。

担忧在于程序。当准入具有选择性、记录又不公开时,公众无法区分中立的事实调查与早期政策谈判。

Google News 放大了这一事件,因为这种区别的重要性超出了健康技术领域。各国政府日益依赖私营企业来解释复杂的 AI 系统,因此这些企业也在帮助界定未来监管将要处理的问题。

最初的框架设定会塑造后续每一步。如果官员主要听到的是应用延迟问题,他们可能优先考虑速度和报销;如果他们主要听取患者意见,则可能优先考虑同意、救济渠道和可衡量的结果。

这些会议并非只是收集信息。它们也帮助决定了联邦官员最先接触到的是哪一种临床 AI 问题。

HHS 希望临床 AI 的应用速度快于现有政策机制

在临床 AI 尚未在缺乏统一国家路径的情况下深度嵌入之前,联邦官员正面临协调碎片化规则的压力。

这些会议紧随数月前启动的公共政策程序。2025 年 12 月,HHS 发布了一项关于加快 AI 在临床护理中应用的信息征询。

这项临床 AI 征询询问监管、报销和研究资助应如何推动应用。它还涉及患者安全、隐私、公众信心、政策清晰度和实施证据。

这一范围揭示了该部门面临的问题:临床 AI 并不归属单一机构,也不属于某个既有产品类别。

当软件的预期用途和功能符合医疗设备要求时,FDA 可能对其进行监管。然而,许多行政、信息类或面向临床医生的工具可能不受设备监管范围约束。

CMS 会影响医疗服务提供者能否获得与新技术相关服务的支付。即使另一机构尚未制定详细的性能标准,其决定也可能加快应用。

联邦健康 IT 政策影响许多算法获取数据和交付建议所依赖的电子系统。研究机构可以资助评估,而民权机构则处理歧视性影响。

这些职责相互交叉,却不会自动形成统一一致的政策。一个产品可能满足某个机构的技术要求,却无法为医院采购方提供足够证据。

它也可能带来运营节省,却无法改善患者结果。反过来,一款具有临床价值的产品也可能因报销不足以支持其使用所需的人员和基础设施而在商业上失败。

HHS 已将监管、报销和研究描述为相互协调的应用杠杆。私下会议似乎是为理解这些杠杆如何围绕真实产品相互作用所作的一次尝试。

另一项计划更明确地体现了制定标准的雄心。7 月,白宫、FDA 和联邦健康 IT 官员邀请专家参与一项为期一个月、有关临床 AI 评估的工作。

据报道,这项评估冲刺包括书面工作和后续讨论。其既定目标是就临床 AI 的基准测试与评估形成一套共识性原则。

基准测试是指依据定义明确的任务、数据集或性能标准来衡量系统。它可以揭示模型之间的差异,但其价值取决于测试所代表的实际情况。

一个模型可能在回顾性医疗问题上表现良好,却在真实对话中举步维艰。它也可能取得很强的平均结果,却在特定人口群体或罕见病例上失效。

因此,联邦官员面临来自两个方向的压力。开发者希望获得可预期的要求,同时避免产品在部署前就被固化;医疗系统则希望证据能够适用于自身的患者群体和工作流程。

当这些预期落空时,患者将承担后果。不可靠的医疗回应可能延误治疗、强化错误假设,或令脆弱群体相信缺乏依据的建议。

政府也希望美国企业保持竞争力。HHS 已将其临床 AI 议程与提高生产率、降低成本、减轻负担和改善结果联系起来。

这些目标并不能相互替代。一个缩短患者互动时间的系统或许可以降低成本,却可能削弱沟通;另一个系统可能减少临床医生的文档工作,却不改变临床结果。

政策挑战在于决定哪些说法值得监管关注,哪些则需要市场证据。不同公司采用不同的质量定义,会使这一决定更加困难。

有些公司强调在精心筛选的评估中的准确率,另一些则提到临床医生采用率、患者参与度、升级率或行政工作减少。每项指标都突出了不同的价值理论。

这正是直接演示对监管者具有吸引力的原因。它将复杂产品压缩为可观察的互动,官员可以迅速理解供应商认为什么最重要。

然而,同样的便利也给未获邀请的各方带来压力。较小的开发商、独立评估者、医院安全团队和患者倡导者,必须与官员已经看过的演示竞争。

私下演示会成为政府内部的共同参照点。后续公开意见可能会依据会议期间形成的假设来评判。

由此产生的要求十分明确:HHS 必须说明其听取意见的流程如何与公开规则、已发布原则和可审查证据相衔接。

缺少这座桥梁,更快的协调看上去就可能像特权准入;有了它,私下技术讨论便能成为更广泛、也更具问责性的流程中的一项输入。

私下准入带来坦率交流,却削弱监管合法性

首要冲突并非创新与监管之间的矛盾,而是坦率的技术准入与外界能够审查并信任的流程之间的矛盾。

闭门会议在联邦监管中很常见。各机构通常会与受监管企业举行保密讨论,尤其是在产品涉及专有信息时。

FDA 与赞助方的会议可能涉及未公开的研究数据、生产细节、产品计划以及尚未解决的安全问题。保密机制让企业能够披露那些不会在公开场合展示的信息。

临床 AI 又为隐私保护增添了一层理由。演示可能暴露提示词、系统指令、升级处理逻辑、安全控制措施,以及开发者视为商业敏感信息的模型行为。

官员同样能从坦诚交流中受益。企业可能会私下承认某些失效模式,却不会在网络直播中作出同样的表态。

这种坦诚有助于改善政策。如果每位参与者只发表经过润色的公开声明,监管机构就无法制定合理的要求。

问题始于保密范围超出受保护的技术材料。与会人员、宽泛议程、所代表的利益群体和总体结果,并不总是需要保密。

公开这些细节不会暴露模型的内部架构。它可以显示 HHS 是否听取了患者、临床医生、安全研究人员、医院采购方、小型开发者和民权专家的意见。

代表性之所以重要,是因为每个群体都会发现不同的风险。开发者了解产品局限和运营约束。临床医生则了解实验室评估中不会显现的工作流程故障。

患者能够识别容易引起误解的披露内容和有害的对话行为。医院管理者了解采购、集成、责任承担和持续监测。

独立研究人员可以在不同数据集和医疗场景中测试相关主张。民权专家则可审查性能差距是否造成不平等的获取机会或治疗结果。

游说人士在传达行业关切时发挥着正当作用。不过,由于专业倡导本身旨在推动政策结果,他们的参与也更凸显了信息披露的必要性。

这一核心权衡是可控的。HHS 无须在完全公开的产品演示与完全不透明的沟通之间二选一。

该部门可以公布参与者名单、遴选标准、讨论主题和非保密摘要。它还可以向首轮未参与的群体开放后续会议。

官员也可以将演示与政策讨论分开。一支团队可以在保密条件下审查产品,另一个公开程序则讨论由此产生的监管问题。

另一种选择是公布一套通用演示协议。企业可面对涉及不确定性、紧急升级、偏见、隐私和缺乏依据的患者请求等同等情境。

该协议将削弱精心编排展示所带来的优势,也有助于独立评估者复现监管机构认为重要的问题。

联邦健康 IT 政策已经表明透明度为何重要。HTI-1 rule 为通过认证的健康技术中可用的预测算法设定了信息要求。

该规则涉及来源属性,即描述某项干预措施的目的、开发、验证、性能和监测的信息。这些细节有助于临床使用者评估某个模型是否适合其场景。

联邦官员表示,经过认证的健康 IT 支持超过 96% 医院提供的医疗服务,也支持 78% 的门诊执业医生。

这些数字说明了通过健康 IT 认证作出的决定覆盖范围之广。但这并不意味着这些服务提供者使用的每一种算法都接受了完整的联邦评估。

HTI-1 的部分重点是让使用者看得见相关信息,而不是由政府批准每一个模型。这一区别很重要。

透明度可以帮助临床医生评估工具,但信息披露并不能证明临床获益。对训练数据的详尽描述,并不能证明系统能够改善患者结局。

同样的原则也适用于 HHS 会议。公布出席者可提升问责性,但无法验证会议内部提出的主张。

可信的流程既需要透明度,也需要证据。它应披露哪些观点塑造了议程,同时要求相关主张经受独立测试。

由于临床 AI 可能在不易察觉的情况下影响人们,保密问题变得更加尖锐。患者可能直接与模型互动,或临床医生可能在现有软件中收到算法建议。

过去的报道表明,患者并不总会被告知算法正在支持其医疗服务。对话式系统的发展令这一披露问题更加迫切。

即使回答来自统计预测,AI 医疗代理也可能让人感觉像是在与真人交流。患者可能基于语气而非经过验证的性能赋予其权威性。

因此,监管机构需要关于沟通方式的证据,而不只是诊断准确率。他们必须考虑系统是否表达不确定性、尊重同意权,并为用户提供有实质意义的人工复核途径。

企业可以就这些机制提供有价值的信息,但不应成为界定可接受行为的唯一一方。

当私下接触能揭示公开场合仍会隐藏的弱点时,它是可以辩护的。当政府从不公开其所获知的内容,或从不说明谁未获席位时,这种做法就更难辩护。

演示不能替代独立的临床证据

一场有说服力的 AI 互动可以展示可用性,但无法证明安全性、有效性、公平性或更好的患者结局。

临床 AI 公司往往围绕难以通过传统设备测试捕捉的体验来构建产品。对话式系统会随着患者补充信息而改变回答。

这种灵活性正是产品吸引力的一部分。但它也使评估变得困难,因为两名用户面对几乎相同的提示词,可能获得不同输出。

演示通常只展示有限数量的互动。演示者选择初始条件,并可挑选突出系统最佳表现的场景。

即使是非脚本化演示,所提供的证据也很薄弱。一次成功回答对于系统在数千次互动、不同语言、专科和患者群体中的表现,说明不了太多。

独立测试必须考察失效分布,而非令人印象深刻的个例。关键问题不在于模型能否正确回答,而在于它何时、如何以及对哪些人会出错。

临床风险还取决于部署方式。由专科医生复核的建议,与直接提供给患者的建议,带来的风险并不相同。

周边工作流程可以拦截错误,也可以放大错误。人员配置、提醒设计、升级规则和响应时间都会影响最终结果。

这为 FDA 划出了一条困难的边界。该机构依据法律定义、预期用途、功能和风险对产品进行监管,而非仅仅因为软件包含 AI。

在具备资质的专业人员能够独立审查建议依据时,某些临床决策支持功能可能不属于医疗器械监管范围。自主性更强或更不透明的功能则可能面临更严格的审查。

software guidance 解释了这条边界,但生成式系统对传统假设构成挑战。它们的输出可能变化,其推理过程也可能无法以具有临床意义的方式接受独立审查。

与回答一同生成的引文并不必然解决问题。被引用的材料可能并不支持结论,系统也可能遗漏相关证据。

对话式产品带来了额外问题。监管机构必须判断系统是在提供一般信息、支持临床医生,还是通过个性化建议实际行医。

营销语言可能模糊这些界线。企业可能将服务描述为导航,而患者体验到的却是医疗判断。

这正是私下会议带来验证风险的地方。官员可能听到自信的解释,却无法获得评估这些解释所需的数据。

STAT 的报道概述了参与企业称其展示的内容。这些说法具有参考价值,但不构成独立验证。

对成本主张也应保持同样谨慎。AI 可以减少某些任务的人工投入,但部署也会带来集成、监督、安全、监测和事件响应方面的成本。

一次更短的互动并不自动意味着更好的互动。减少临床医生时间可能代表效率提升,也可能只是将工作和风险转移给患者。

报销政策可能放大薄弱证据。一旦 Medicare 付款支持某项工作流程,供应商和服务提供者就会收到强烈的采用信号。

之后要移除无效工具可能很困难。医院可能已将其整合进病历、人员配置、采购合同和患者沟通中。

因此,HHS 需要将技术测量与临床结局相连的标准。准确率、回答质量和升级处理表现都很重要,但单独任何一项都无法全面反映患者获益。

评估还应在部署后持续进行。当开发者更新底层系统、提示词、检索来源或安全控制措施时,模型行为可能发生变化。

通过一次评估的产品,在这些变化后可能不再保持等同性。静态审批模式难以应对频繁演变的软件。

监测应记录事件、亚群体表现、人工覆盖、患者投诉和非预期使用,还应区分轻微错误与造成临床伤害的失效。

这些信息必须传达给能够采取行动的人。医院需要足够细节来暂停有问题的功能,而监管机构需要可在不同供应商间比较的报告。

企业可能因事件报告会泄露专有信息或带来声誉风险而抵制广泛披露。然而,隐藏的失效会阻碍其他机构从中学习。

联邦原则需要界定哪些内容应保密,哪些内容服务于公共利益。汇总后的安全报告可以保护部分专有细节,同时暴露反复出现的风险。

获邀参与 HHS 流程的研究人员可以协助设计这些评估。他们的价值取决于方法学独立性以及获取具有代表性数据的能力。

学术声望不能替代透明的协议。研究团队需要拥有发表不利发现的权力,并披露财务关系。

这种怀疑应保持相称。已报道的会议并未表明 HHS 接受了缺乏依据的主张。它们表明,供应商获得了直接塑造其产品叙事的机会。

下一步将决定这种接触是否会转化为证据。HHS 可以在演示影响长期政策之前,要求采用通用测试、独立复现和公开报告。

如果缺少这些保障措施,临床 AI 监管就可能奖励展示质量。会议中最有说服力的产品,未必是诊所中最安全的产品。

三个信号将显示 HHS 选择了速度还是问责

下一阶段必须将私下意见转化为公开标准、更广泛的代表性和可衡量的临床验证。

第一个信号是 HHS 是否公布其评估工作形成的原则。这些原则应明确联邦官员认定为关键的结局、风险和部署场景。

一份有用的文件应超越安全与信任等宽泛价值观,具体说明对亚群体测试、人工升级、患者披露、监测和重大产品更新的预期。

它还应说明哪些临床 AI 类别需要采用不同标准。文档工具、诊断模型和面向患者的代理不应面对完全相同的评估要求。

公开原则将强化这样一种论点:闭门会议服务于技术准备。沉默则会加剧担忧,即受邀参与者塑造了一个难以触及的政策制定过程。

第二个信号是,HHS 是否扩大参与范围,并披露受邀者的遴选方式。公布的名单应列明所代表的公司、研究人员、患者团体、专业协会和倡议组织。

HHS 还应说明后续会议是否会解决现有缺口。小型开发者、农村医疗服务提供者、医疗安全网机构、护士、照护者和残障人士权益倡导者,可能会遇到公司演示中未呈现的问题。

患者代表性尤其值得关注。临床 AI 政策会影响知情同意、隐私、可及性、申诉途径,以及人们如何理解自动化医疗沟通。

一个系统在技术测试中可能表现合格,却会让本应信任它的人感到困惑。这种体验应被纳入评估,而不是等到部署后才考虑。

遴选透明度不会消除影响力,但会让观察者能够评估该过程是否在商业专业知识与承担临床风险的人群之间取得平衡。

第三个信号是,政策文件是否要求独立且持续的验证。通用基准很有用,但真实世界证据必须伴随产品进入不同的医疗环境。

监管机构应考察跨机构、患者群体和工作流程的评估情况。他们还应询问,一次更新是否足以改变系统行为,从而需要重新评估。

有意义的监测不应只追踪总体准确率。升级处置失败、医疗延误、临床医生覆盖系统建议、患者投诉和亚群体差异,都可能揭示平均指标所掩盖的风险。

如果 HHS 将报销或监管灵活性与这些证据挂钩,其推动采用的议程将更具可信度。如果演示和自愿原则仍是主要产出,问责缺口将持续存在。

行业回应同样重要。参与企业可以自愿公布评估方法、局限性、利益冲突,以及其展示内容的摘要。

这样做无需披露敏感的模型细节,却能表明,对监管清晰度的要求伴随着支持外部审查的意愿。

医院和企业采购方应密切关注这些信号。联邦层面的积极态度并不能免除它们在本地人群和工作流程中验证工具的责任。

开发者应关注是否形成一套通用的评估术语。更清晰的定义可以减少重复测试,并使采购讨论更加具体。

通过 Google News 关注临床 AI 的知识工作者,不应将获得接触机会视为背书。受邀意味着联邦官员希望从某位参与者那里获取信息,并不意味着获得批准、安全性得到确认,或具备临床获益。

更大的政策实验关乎制度信任。HHS 希望比传统规则制定通常允许的速度更快地行动,而临床 AI 的变化速度又快于传统监管。

当速度消除不必要的延误时,它可以惠及患者;当证据、代表性和救济途径沦为次要考量时,它也可能伤害患者。

闭门技术讨论可以为负责任的政策制定作出贡献,但前提是这一过程最终会公开其推理过程。公开标准必须显示官员如何处理他们听到的主张。

未来三个月,请关注已公布的评估原则、更广泛的参与者记录,以及独立验证要求。这些信号将共同揭示这些会议产生了什么。

每当下一项临床 AI 政策出现在 Google News 上时,读者都应提出一个简单的问题:公众能否将其追溯到证据,还是只能追溯到接触机会?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page