URAC 授予首批医疗保健 AI 认证,但治理并不等于安全保证
- Sophie Larsen

- 8月10日
- 讀畢需時 13 分鐘
URAC 授予了首批三项医疗保健 AI 认证,使 Guidehealth、RediMinds 和 SandsRx 凭借独立监督这一重要主张登上 Google News。这一里程碑为医疗保健采购方在评估开发或使用人工智能的机构时提供了新的参考信号。
关键在于“治理”,而不是“安全”。URAC 评估的是机构如何通过明确职责、监测、风险控制、透明度和质量改进来管理 AI。它并不认证每个模型都具备临床有效性、法律合规性,或对所有患者群体都安全。
这一差异构成了核心张力。医疗系统希望有可信的方法,将严谨的 AI 项目与仅持有精美政策文件的供应商区分开来。然而,机构层面的认证无法取代产品验证、监管审查或部署后收集的证据。
URAC 实际授予了什么
首批奖项认可的是机构监督实践,而非对三家公司算法的一揽子认可。
URAC 将 Guidehealth MSO、RediMinds 和 SandsRx 列为首批获得其新医疗保健 AI 认证的机构。该认证机构在于 2025 年 9 月推出该项目后,于 8 月初的一则社交媒体帖子中公布了获奖者。
这三家获认证机构代表了医疗保健市场的不同环节。它们的入选表明,URAC 希望其框架覆盖技术供应商、照护管理机构和药房,而非聚焦于单一产品类别。
RediMinds 将其业务描述为面向独立医疗审查、仲裁、事前授权、伤残认定和工伤赔偿的 AI 驱动决策基础设施。即使软件并不作出最终决定,这些工作流程仍可能影响服务可及性、支付和申诉。
SandsRx 是一家专注于免疫学及其他专科患者需求的药房。药房运营涉及用药数据、处方工作流程、沟通以及各类决策;当自动化介入流程时,这些环节都需要明确的问责机制。
Guidehealth MSO 从事照护赋能和价值导向型医疗保健业务。其工作使技术贴近照护协调、运营决策以及医疗服务提供者与患者之间的关系。
URAC 的 AI accreditation 面向使用 AI 的机构及开发相关支持技术的公司。该项目考察 AI 全生命周期中的治理、明确的 AI 使用场景、监督、风险管理、质量改进、透明度和问责机制。
AI 生命周期涵盖从选择或开发系统,到部署、监测、修改和退役的各个阶段。任何阶段都可能出现问题,尤其是在数据或临床工作流程发生变化时。
该项目为使用 AI 的机构和提供 AI 系统的开发者设置了不同路径。这一区分十分重要,因为两类主体控制的风险并不相同。
开发者可以记录模型设计、训练数据、测试流程、已知局限性和更新政策。部署机构则负责本地访问控制、员工培训、工作流程集成、升级处置规则以及持续的性能评估。
任何一方都无法单独治理医疗保健 AI。经过充分测试的模型可能在设计不佳的工作流程中失效;管理严谨的医院也可能继承供应商因证据不完整而隐藏的局限性。
URAC 表示,其审查提供独立验证,确认治理和监督实践符合公认标准。该认证机构也将此项目定位为降低采购方顾虑并支持采购决策的一种方式。
不应忽视其中的商业价值。当多家供应商都对安全性、准确性、透明度和人工监督作出类似主张时,认证可能成为差异化因素。
不过,URAC 在项目页面中直接说明了一项限制:认证确认符合流程和治理标准,但并不认证法律合规性,也不认证系统的安全性和有效性。
这一免责声明界定了改变的内容。获认证机构现在拥有经过外部审查的治理资质,但并未获得对每一项 AI 输出、每个模型版本、每种临床场景或未来部署的普遍认可。
原始标题之所以通过 Google News 传播,是因为“首批”奖项形成了清晰的里程碑。对采购方而言,更有价值的故事始于这一里程碑之后——即审视该资质究竟覆盖了什么。
为什么医疗保健 AI 治理正成为采购要求
认证正在将 AI 治理从自愿性的政策实践,转变为可能影响合同、合作关系和部署审批的因素。
医疗保健机构面临棘手的采购问题。供应商可能描述类似的保障措施,却采用不同的定义、测试方法、升级阈值和报告实践。
采购团队可能收到有关负责任 AI 的笼统保证,却看不到谁有权暂停系统。他们也可能不知道哪些性能变化会触发审查,或受影响患者如何对自动化建议提出异议。
医疗保健 AI 治理为回答这些问题提供了结构。它分配决策权限,记录获准的使用场景,设定监测责任,并建立处理事件的流程。
URAC 围绕风险管理、运营与基础设施,以及性能监测和改进来组织其标准。这些领域将关注点从单次上线前测试转向持续的机构责任。
这种转变反映了 AI 在实施后的实际行为。模型会遇到新的患者群体、文档模式、软件依赖关系和运营压力。即使模型本身稳定,当人们改变使用方式时,它也可能产生不同后果。
以事前授权工作流程为例。系统可能汇总记录或识别缺失文件,而不作出最终的保险覆盖决定。但其错误仍可能延误治疗、增加行政工作量,或引导审查人员依据不完整证据作出判断。
因此,治理必须涵盖最终决策者之外的环节。它应涉及数据输入、界面设计、人工审查、审计日志、例外情况、投诉以及暂停自动化的权限。
同样的原则也适用于药房运营。用于组织沟通或标记处方问题的 AI 系统可能影响处理时效和员工注意力。即使药剂师保留法定权限,误导性的摘要仍可能带来影响。
对于照护协调,风险可能通过优先级排序出现。软件可能决定哪些患者优先接到外联电话。这种排序无需作出诊断或治疗建议,也可能影响服务可及性。
这些间接影响解释了为何医疗保健采购方越来越要求供应商提供准确率数据之外的文件。他们希望看到有关数据治理、变更管理、网络安全、偏见评估和部署后监测的证据。
其他认证机构也在回应同样的压力。Joint Commission 于 2026 年 6 月推出了自愿性的 Responsible Use of AI in Healthcare 认证。
该项目聚焦于实施 AI 的医疗保健机构。其五大领域包括治理、数据管理、风险与偏见降低、性能验证、透明度、教育和培训。
Joint Commission 表示,其认证并不验证单个 AI 产品。这一限制与 URAC 对机构治理和产品层面保证所作的区分相似。
CARF International 则采取了另一种路径。其 AI standard 要求,获得认证的健康与人类服务项目在服务交付中使用 AI 时,必须制定书面政策。
CARF 要求提供人工监督、治理审查、披露、隐私保护、事件定义、员工培训,以及至少每年一次的政策审查。该标准于 2026 年 7 月 1 日生效。
这些项目并非完全相同的竞争者。URAC 为 AI 使用者和开发者都提供专门的认证路径。Joint Commission 的认证以医疗保健机构为核心,而 CARF 则将 AI 要求嵌入更广泛的项目认证中。
综合来看,它们显示出一个围绕第三方治理保证形成中的市场。采购方将有更多资质可供比较,但也需要理解不同资质的覆盖范围。
这给缺乏公认框架的机构带来压力。没有独立审查的供应商必须说明,为何其内部控制能够提供可比的保证。
这也要求获得认证的机构在获奖后持续保留证据。认证可以降低最初的怀疑,但一次处理不当的事件就可能暴露书面治理与实际运营控制之间的差距。
Google News 的曝光可能会让更广泛的受众注意到这项认证。不过,采购团队应将这一标题视为尽职调查的起点,而非终点。
真正的较量是认证与证据之间的较量
URAC 的资质可以验证治理体系的存在,但采购方仍需要证据证明该体系能在临床和运营压力下发挥作用。
这个故事中的主要对立面并不是一家认证机构与另一家认证机构之间的竞争,而是独立治理的承诺与在具体使用场景中证明安全性和有效性的现实之间的差距。
机构认证具有价值,因为许多 AI 失误始于责任归属不清。团队部署工具时,往往没有完整清单、性能阈值、升级路径,或批准模型更新的规则。
结构化审查可以暴露这些缺口。它可以要求管理者识别责任人、获准使用场景、监测流程和记录在案的风险应对措施。
然而,成熟的流程并不会自动使模型准确。它也无法证明系统能够改善结果、在不同患者群体间公平运行,或在更新后保持可靠。
这些问题需要针对产品和具体情境的证据。用于行政分类的模型,与影响诊断、用药或治疗可及性的模型,需要不同的验证方式。
FDA framework 涵盖某些 AI 驱动的医疗器械,但许多行政和运营系统并不属于该监管路径。认证可以弥补治理缺口,却不能成为监管机构的替代品。
这一区分对 RediMinds 尤为重要,因为其宣称的使用场景包括高风险行政决策。独立医疗审查和事前授权需要可辩护的证据、可靠的记录以及有实际意义的人工判断。
RediMinds 表示,其系统旨在增强而非取代人类判断。采购方应将这一主张转化为可检验的问题。
谁来审查 AI 输出,这个人有多少时间?审查人员能否看到原始证据?界面是否便于提出不同意见,且是否会分析人工覆盖决定以发现反复出现的错误?
流程中出现人工并不保证能实现有效监督。自动化偏见可能导致审核人员接受系统输出,尤其是在工作负荷高或解释看起来很有把握时。
对于 SandsRx,采购方应询问哪些职能被纳入了认证范围。他们应区分临床决策与行政自动化、数据处理、通信和工作流支持。
他们还应询问药房如何识别事件。定义过窄的事件政策可能会捕捉安全漏洞,却遗漏反复出现、会造成患者延误的低级错误。
Guidehealth 则呈现了另一种情境。护理管理系统通常会结合来自理赔、临床记录、排班工具和患者沟通的信息。治理必须考虑数据不完整,以及患者排序不当所带来的后果。
采购方应审查监测是否仅覆盖技术表现,还是也涵盖运营结果。一个系统可能按设计运行,却造成不公平的工作负荷、漏掉外联机会,或给出令人困惑的建议。
URAC 的标准强调质量改进,这为应对此类证据提供了机制。决定性问题在于,组织是否公开了足够细节,让外部人士能够判断这一机制。
有关这三项奖项的公开信息并未说明具体审查了哪些系统、复核了哪些性能指标,或各获奖者之间的认证结论有何不同。
这种信息缺失并不使该资质失效。认证审查通常涉及不公开的运营证据。不过,有限的披露限制了客户和患者能够推断的内容。
一项有用的认证标志应帮助采购方提出更好的问题。当它被视为一张简单的通行证、从而终止进一步调查时,其价值就会降低。
这正是 NIST 的 AI risk framework 提供有益对照的地方。该框架围绕治理、映射、测量和管理风险来组织 AI 风险工作。
这些活动是持续进行的。它们要求组织理解具体情境、选择相关衡量指标、回应发现,并随着系统变化重新审视假设。
URAC 的项目在医疗保健领域遵循类似的生命周期逻辑。其优势在于由成熟认证机构进行行业特定审查;其局限则在于,组织层面的保证仍比产品层面的证据更为宽泛。
因此,首批获认证者向市场传递了两层信息:它们已完成一项有意义的外部治理审查,同时仍有责任证明每一项重要部署的可靠性。
Google News 将这种细微差别压缩成有关首批认证的标题。医疗保健采购方无法在合同或审查委员会中承受同样的简化。
认证并不能证明什么
这些奖项并不能证明临床有效性、监管合规性、模型公平性,或在所有环境下的安全表现。
URAC 明确说明了这一限制。其认证并不证明法律或监管合规,也不证明 AI 系统的安全性或有效性。
任何负责任地介绍这些奖项的内容都应说明这一边界。否则,读者可能会把治理资质误认为是对某一算法或临床结果的认可。
第一项不确定性涉及范围。公开公告列出了获认证组织的名称,但对审查过的系统、业务部门、地点和使用场景提供的细节有限。
范围决定意义。一个组织可能在多个工作流中运行许多模型,而认证审查可能只覆盖特定的治理流程或选定的组织边界。
采购方应索取正式的范围声明。他们应询问纳入其中的实体、运营活动、AI 清单和部署阶段。
第二项不确定性涉及性能证据。治理标准可以要求组织监测系统,但采购方仍需要实际的指标和阈值。
对于临床支持系统,这些指标可能包括敏感性、特异性、校准度,以及在不同人口群体中的表现。行政系统则需要与错误、延误、人工覆盖、投诉和下游工作负荷相关的指标。
没有阈值的指标几乎无法提供保护。组织应定义性能恶化达到何种程度时,需要启动调查、限制使用、回滚或暂停。
第三项不确定性涉及认证后的变化。AI 系统可能因模型更新、新的数据管道、修改后的提示词、集成变动和用户行为变化而发生改变。
组织需要明确规则,以决定何时变更需要重新验证。采购方还应了解重大变更是否必须向认证机构报告。
第四项不确定性是透明度。认证可以审查保密证据,但患者和客户仍需要易于理解的说明,了解 AI 在何处运行。
CARF 的标准明确涉及向服务接受者披露信息。URAC 也将透明度纳入 AI 生命周期,尽管具体实施细节取决于获认证组织。
有意义的披露应在不以技术语言压倒患者的前提下,说明系统的作用。它还应提供提出问题、纠正错误、投诉或请求人工重新审议的途径。
第五项不确定性涉及获奖后的独立性。认证是定期评估,而运营风险每天都在发展。
内部监测人员可能面临避免延迟上线或升级问题的激励。有效治理需要受保护的报告渠道,以及愿意叫停未达到既定标准系统的领导者。
外部审计可以支持这种结构,但无法观察每一项输出。组织仍需要能够识别失败、且可免受惩罚地报告问题的一线员工。
第六项不确定性是认证是否改善结果。这些奖项证明的是符合治理标准,而不是与更优护理、更少错误或更公平决策之间的因果联系。
随着时间推移,URAC 可以通过报告汇总发现来强化市场。例如,常见的治理缺口、事件类别、监测改进,或认证过程中作出的调整。
此类报告无需披露患者信息或专有模型。它将帮助采购方理解审查能够发现什么,以及获认证组织如何改进。
审慎的解读也应避免走向另一种错误。缺乏公开的模型指标,并不能证明这些获认证者缺少证据或有效控制措施。
更恰当的结论更为有限:公开信息支持“治理实践经过审查”的说法,而产品性能和部署结果则需要单独的证据。
当一项资质成为营销的一部分时,这一点尤其重要。销售材料可能会不断缩短谨慎的认证表述,直到“受治理的 AI”听起来像“安全的 AI”。
采购文件应保留这种区分。合同可以要求性能报告、事件通知、审计权、变更控制,以及在患者投诉期间的配合。
合同还可以明确责任:当供应商提供模型、而医疗保健组织控制工作流设计时,各方应承担何种责任。共同责任不能演变为责任分散。
医疗保健 AI 治理只有在有人能够对整个链条负责时才能发挥作用。数据来源、模型行为、界面设计、用户培训和下游决策都属于这一链条。
这三家获认证者如今有机会展示这种问责机制的实际样貌。详细案例研究会让这些奖项比单靠 Google News 标题更具信息价值。
将显示 URAC 模式是否重要的三个信号
只有当认证改变采购方行为、产生可见的监督证据,并能适应获认证系统的变化时,它才会获得持久价值。
第一个信号是采购采用。医疗系统、健康计划、药房和技术合作伙伴应开始要求 URAC 认证或同等的治理证据。
这一发展将强化本文的核心判断:独立治理审查能在供应商选择过程中减少不确定性。
这一信号应当具体。采购方可能在招标书中加入认证要求,为获认证供应商缩短治理审查流程,或要求未获得该资质的公司提供可比的控制措施。
采购采用还将检验不同保证项目之间的互操作性。采购方必须决定 URAC、Joint Commission、CARF、基于 ISO 的审查和内部评估,是否能够满足重叠的要求。
如果每个采购方仍从头开始进行同样广泛的审查,认证就没有减少摩擦。它或许仍然有用,但其商业影响力将受到限制。
第二个信号是 Guidehealth、RediMinds 和 SandsRx 提供的公开证据。每个组织都应澄清获认证范围,并说明治理如何影响一项真实工作流。
一份有价值的案例研究应说明 AI 的用途、负责的人工角色、监测的风险、响应阈值,以及通过监督作出的一项改进。
它无需暴露患者数据或专有代码,但必须提供足够细节,以表明该资质的作用不止于政策文件。
对于 RediMinds,这可能涉及可供审计的医疗审核工作流及记录在案的人工覆盖。对于 SandsRx,这可能涉及具有明确事件升级机制的药房自动化。
对于 Guidehealth,有用的证据可能涉及护理优先级排序、数据质量或员工审查。这些是所需细节的示例,并非对未披露系统的主张。
可见证据将增强人们对 URAC AI 认证的信心。持续的模糊性则会削弱客户比较获认证者与未获认证组织的能力。
第三个信号是认证如何处理系统变化和事件。当组织遇到重大更新、性能下降、投诉模式或意外使用时,AI 治理才会变得可信。
观察者应关注获认证公司是否披露重大变化并展示重新验证。他们还应关注 URAC 是否基于一线经验更新标准或发布指南。
首批奖项只是一个开始,而不是成熟的证据基础。其重要性取决于庆祝性公告之后发生的事情。
一个强有力的模式将创造持续义务。组织将维护清单、审查变更、监测结果、调查事件,并记录纠正措施。
一个薄弱的模式则会变成出现在销售材料中的静态徽章。两者的差异将通过采购要求、案例研究和对真实运营压力的响应显现出来。
因此,通过 Google News 发现这则报道的读者应适度看待标题。URAC 已建立了一个可信的新治理信号,并公布了首批三家获认证者。
这些奖项并不能判定某个特定 AI 系统是否准确、公平、合法合规或具有临床益处。它们证明的是,组织流程已根据 URAC 的标准接受独立审查。
这是有意义的进展,因为医疗保健 AI 需要负责任的机构,而不只是更好的模型。它同样仍不完整,因为患者体验的是具体系统、具体决策和具体错误,而不是抽象的治理框架。
下一个问题将由采购方、临床医生、监管机构以及获认证的组织自身来回答:他们会利用这一资质要求提供可衡量的证据,还是任由它成为回避更尖锐问题的替代品?


