top of page

UPMC 发现医院 AI 采用速度已超过测试与监管能力

UPMC 发现,医院采用 AI 的过程中存在明显矛盾:超过 90% 的受访医疗系统在使用第三方工具,但仅有 44% 配备专用测试环境。

MedCity News 于 2026 年 8 月 30 日报道后,这些发现通过 Google News 获得了更广泛关注。然而,核心问题并不是 AI 采用的又一里程碑,而是部署速度已经超过了医院验证其采购工具的能力。

医院正将 AI 引入文档记录、计费、排班和临床决策支持。许多医院仍缺乏可重复的方法,来根据本地患者、工作流程和数据测试这些系统。这使得医院管理者、临床医生、供应商和监管机构不得不在技术已进入诊疗环节后,才协商责任归属。

核心矛盾在于部署速度与机构控制力之间。传统的软件上线会关注产品是否按设计运行。临床 AI 监管还必须追问:它是否适用于这类患者群体、能否长期保持准确、是否公平对待不同群体,以及能否在不引入新风险的前提下改善医疗服务。

采用数据掩盖了基础设施缺口

医院 AI 已进入日常运营,但用于验证它的系统仍参差不齐。

UPMC 调查结果来自 UPMC Connected Medicine Center 与 KLAS Research 开展的研究。两家机构就 AI 战略、测试、治理和部署情况调查了二十多位医疗系统负责人。

超过 90% 的受访者表示,其所在机构已部署第三方 AI 解决方案。临床文档记录是最常被提及的部署领域,占受访者的 52%。收入周期、编码和计费紧随其后,占 36%。

这些数字表明,医院 AI 已不再局限于孤立的研究项目。它如今正在起草临床记录、支持行政决策,并影响患者和员工相关的工作流程。

乍看之下,测试似乎也已十分普及。调查发现,92% 的机构会在部署前评估第三方 AI 工具。不过,这一数字涵盖的方法范围很广,从正式验证协议到有限试点和非正式审查均包括在内。

仅有 44% 的受访者表示拥有专用数据平台或测试环境。缺少这类环境时,医院在将模型接入实时工作流程前,就更难利用自身数据审查其表现。

这一差别十分重要,因为完成试点并不等同于验证临床系统。试点可能确认软件能够与电子健康记录整合,却未必能揭示模型在年龄、种族、语言、残障或保险类别不同的人群中是否表现不同。

短期试点对罕见事件所能提供的证据也有限。这类情况可能带来最严重的临床后果,尤其是在算法预测病情恶化、再入院风险或治疗需求时。

战略成熟度并未以同样速度提升。报告发现,63% 的受访机构将其 AI 方法描述为仍在发展中或临时性的。受访者还表示,对于应以哪些指标定义成功,并不存在强烈共识。

这种不确定性不止涉及安全。医院可能衡量节省的时间、临床医生接受度、财务回报、诊断表现、患者结局,或同时衡量这五项。没有达成一致目标时,成功实施对管理层和临床医生可能意味着截然不同的结果。

这项调查规模较小,不应被视为美国医院的普查。它的价值在于揭示了这种错配:部署已很常见,但结构化测试、战略成熟度和一致性衡量仍不普遍。

Google News 的关注映照出更广泛的医院趋势

UPMC 的发现反映了美国数千家医院中已可见的采用模式。

联邦数据提供了比这项新行业调查更广泛的基线。美国国家卫生信息技术协调办公室的一项分析发现,2024 年,71% 的非联邦急症护理医院使用了与电子健康记录整合的预测型 AI,较 2023 年的 66% 上升。

预测型 AI 利用统计模型估计某项结果,例如再入院风险或患者病情恶化。它不同于生成式 AI;后者会根据提示生成新的文本、图像或其他内容。

这份联邦医院数据涵盖了 2024 年 2,080 份有效医院回复。数据发现,采用情况因医院规模、所在地、系统隶属关系和技术环境而存在明显差异。

2024 年,病床数超过 400 张的医院中,96% 表示使用预测型 AI;病床数少于 100 张的医院中,这一比例为 59%。

系统隶属关系也造成了另一道明显鸿沟。多医院系统成员中,预测型 AI 采用率达到 86%,而独立医院仅为 37%。城市医院报告的采用率为 81%,农村医院则为 56%。

这些差距使任何关于医院都在全面投入 AI 的说法变得复杂。大型系统可以在多家机构之间分摊数据工程、法律审查、网络安全和临床专业能力。小型独立医院可能没有任何可与之相比的团队。

技术供应商也在塑造市场。联邦分析发现,使用市场领先电子健康记录供应商的医院中,90% 配备了预测型 AI;使用其他供应商的医院中,报告采用相同技术的仅为 50%。

医院往往将 AI 作为现有软件中的一项功能购入。这降低了采购和整合门槛,但也可能让算法变得不那么显眼。员工可能会看到某个评分或建议,却不知道其所在机构对其进行了多大程度的评估。

增长最快的是行政应用。2023 年至 2024 年间,用于计费的预测型 AI 使用率上升了 25 个百分点;排班上升了 16 个百分点,而识别高风险门诊患者上升了 9 个百分点。

行政部署仍可能影响患者护理。排班模型可以影响等待时间、专科就诊机会和爽约情况。计费系统则可能影响事先授权、编码争议以及患者承担的经济负担。

联邦结果也包含一个更令人鼓舞的信号。2024 年,使用预测型 AI 的医院中,82% 表示会评估模型准确性。74% 报告进行了偏差评估,79% 开展了某种形式的实施后监测。

不过,将这些做法应用于全部或大多数模型的医院较少。被问及准确性评估、偏差测试或监测时,15% 至 21% 的受访者回答“不知道”。

这一差别印证了 UPMC 报告背后的担忧。医院可以制定评估政策,却可能无法在不断扩大的模型组合中始终如一地执行它。

Google News 的曝光可能让这项最新调查看起来像是一次突如其来的警告。全国性证据反而表明,这是一个更长期的结构性问题。AI 正在不同资源、治理模式和技术能力差异巨大的机构中不断扩展。

采购 AI 比证明其在本地有效更容易

供应商提供的证据无法回答 AI 工具在某一家特定医院内会如何运行的所有问题。

算法表现取决于周围的人群、数据、设备、工作流程和决策环境。在城市学术中心开发的模型,未必能顺利迁移至农村医院或社区诊所。

患者群体在疾病患病率、语言、医疗可及性和文档记录模式方面存在差异。电子健康记录对信息的编码方式也不同。在一种环境中,字段缺失可能意味着“未测量”,在另一种环境中则可能意味着“不存在”。

这些差异会造成数据集偏移,即真实世界的输入数据不再类似于开发阶段所使用的信息。它们也会造成模型漂移,即部署后性能下降或发生变化。

本地验证会使用计划采用该模型的机构自身数据和条件进行测试。它能够揭示供应商报告的表现,是否能经受医院患者群体和工作流程的实际检验。

UPMC 表示,它使用真实世界数据平台 Ahavi,在部署前利用去标识化患者数据测试第三方 AI。“in silico”测试指在不让患者接触系统建议的情况下,通过计算方式评估系统。

这种方法可以将预测结果与已知结局进行比较。它还可以评估不同子群体的表现、识别意料之外的数据问题,并估计拟议模型是否能在现有实践之外提供额外价值。

UPMC 首席医疗信息官 Rob Bart 告诉 MedCity News,该机构还会定期监测已部署的临床算法,例如预测住院时长或再入院风险的模型。

原始医院报道称,UPMC 已维持正式的 AI 治理架构超过两年。其流程体现了一项关键原则:验证并不是一次性的采购事件。

模型可能通过本地测试后又出现性能恶化。临床实践会变化,人群构成会改变,供应商也会更新软件。医院同样会更改数据管道、编码标准和电子健康记录配置。

生成式 AI 带来了额外不确定性,因为其输出具有概率性。相似提示可能让同一模型生成不同措辞,而供应商更新可能在医院工作流程未变的情况下改变其行为。

环境式文档系统提供了一个具体例子。它会监听临床就诊过程,并起草供医生审核的记录。其直接好处是减少打字,但风险范围远不止转录准确性。

系统可能遗漏不确定性、混淆说话者、插入缺乏依据的细节,或将暂定讨论转化为明确诊断。临床医生审核可形成保障,但前提是用户有足够时间和注意力检查每一项生成内容。

自动化偏差带来了另一个问题。人们可能因为建议来自计算机,就更倾向于接受它。当工作负荷促使人们快速批准时,名义上的人工审核要求能提供的保护十分有限。

因此,医院测试需要检视人类与技术结合的整体系统。即使模型在基准测试中表现优异,若警报过于频繁、解释让用户困惑,或员工误解其预期角色,它仍可能失效。

这正是传统信息技术实施方式不足之处。它关注正常运行时间、访问权限、安全性和整合。临床验证还必须处理有效性、公平性、可用性和患者结局。

治理是医院尚未完成构建的产品

临床 AI 最困难的部分,是在算法造成重大错误之前明确责任归属。

联邦医院分析发现,74% 的医院将预测型 AI 评估分配给多个实体。66% 的医院提到专门委员会或工作组,60% 提到部门负责人。

共同责任能够带来宝贵的视角。临床医生了解患者护理,数据科学家评估模型,安全团队审查技术风险,法务团队则解读隐私与责任义务。

然而,共同责任也可能演变为责任分散。如果四个团队都参与其中,却没有任何一方拥有最终决策权,关键问题就可能长期得不到解决。

每个已部署的模型都需要一位承担问责责任的负责人。该个人或团队应清楚了解模型的预期用途、获准使用者、性能阈值、更新历史以及暂停使用的条件。

治理还必须区分不同风险等级。用于总结内部会议的工具,不应与为急诊患者确定优先级的模型接受同等审查。不过,行政管理类标签也不应自动意味着低风险。

人员配置模型可能影响护士的工作负荷。排班算法可能改变患者获得医疗服务的机会。收入周期工具则可能影响一项索赔是获得支付还是受到质疑。

国际研究人员提出了一种全生命周期方法。FUTURE-AI guidelines呼吁开展本地验证、持续质量控制、可追溯性、明确治理角色,以及持续风险管理。

可追溯性意味着保存模型如何开发、验证、部署、使用和监测的记录。当模型性能发生变化,或患者对受 AI 影响的决定提出异议时,医院需要这些历史记录。

采购合同也是这份记录的一部分。医院需要获得模型更新通知、有意义的性能信息访问权、事件报告流程,以及关于谁可以调查故障的明确规定。

供应商可能不愿披露专有细节。并非始终需要完全访问源代码,但医院仍需获得足够的信息,以评估模型的局限性和变更情况。

治理还需要一套退役流程。组织通常专注于批准新工具,却忽视了移除那些不再具备性能、无法吸引用户或不能产生可衡量价值的工具所需的标准。

资源限制仍是核心障碍。UPMC 调查指出,时间有限、资源不足以及专业人才短缺是主要障碍。

UPMC Enterprises 的 Ken Howard 清楚地描述了运营压力。医院往往发现一个问题后便直接推进实施,因为它们没有能力先建立结构化的测试环境。

这种选择可能造成虚假的节约。MedCity News 报道称,传统实施流程可能耗费六个月甚至更长时间,医院才发现某款产品未能提供预期价值。

规模较大的医疗系统可以投资建设共享验证平台。较小的医院则可能需要区域合作伙伴关系、独立测试服务、通用评估协议,或公共机构的支持。

如果缺乏共享基础设施,技术资源最少的医院将面临艰难选择:要么延后采用有用工具,要么接受无法充分代表其患者群体的供应商证据。

监管仍让医院承担风险

监管批准并不能替代本地证据,而且许多医院 AI 工具并未接受针对产品的联邦审查。

当软件符合医疗器械的法律定义时,食品药品监督管理局会对其进行监管。部分临床决策支持功能可能不属于这一定义,具体取决于其使用者、用途以及建议的呈现方式。

行政工具和许多生成式 AI 应用也可以在未获得 FDA 批准的情况下进入医院。其供应商仍必须遵守适用法律、合同、隐私规则和消费者保护要求,但没有任何单一监管机构会评估每一次部署。

即便是获得 FDA 授权的设备,也并不附带在本地有效的保证。授权针对的是已定义的产品和预期用途,并不会重现每家医院的人群、工作流程、人员配置模式或数据环境。

2025 年 JAMA 的一篇特别通讯认为,健康与医疗保健 AI 需要能够在衡量实际收益的同时保护患者的治理机制。文章还警告称,现有监管分散在各机构和组织之间。

JAMA assessment指出了一项结构性挑战:AI 工具可能持续演进、在不同环境中表现不同,并且在进入临床实践前难以得到全面评估。

该报告引用了前 FDA 局长 Robert Califf 的担忧:美国没有任何一家医疗系统具备验证其部署的每一种临床 AI 算法的能力。他的说法有意保持宽泛,但反映了这项任务的规模。

医院并非只是在安装一个静态模型。它们管理的是由供应商系统、电子健康记录功能、内部开发模型和通用 AI 服务组成的产品组合。

每种产品都可能因新数据、软件更新、工作流程调整或用户行为变化而改变。因此,监管必须在整个产品组合中持续运行。

安全只是其中一个维度。医院还必须判断一项工具是否改善结果、节省时间、降低成本,或在其他环节制造负担。

文档辅助工具或许能缩短撰写病历的时间,却增加纠正错误所需的时间。再入院预测模型或许能识别高风险患者,却可能让护理管理团队面对超出其处理能力的病例数量。

偏差测试也不能只比较总体准确率。一个模型可能整体表现良好,却对某一群体产生更多假阴性,或对另一群体产生更多假阳性。

后果取决于具体使用场景。病情恶化模型中的假阴性可能延误干预;假阳性则可能引发不必要的检查、警报疲劳或资源分流。

对 UPMC 研究结果持审慎态度的解读是,这项调查反映的是一个有限群体的自我报告实践。专门的测试平台同样不能保证领导者会选择恰当的终点指标,或会根据不利结果采取行动。

正式治理可能沦为文书工作。委员会可能在未取得充分证据的情况下批准工具,而仪表盘可能监测便利指标,而非患者结果。

因此,UPMC 的方法是一个有用示例,而非治理问题已经解决的证据。其方法仍需证明,本地测试能够改变部署决策并改善结果。

三个信号将表明监管是否正在跟上

医院 AI 的下一阶段将由证据、问责机制,以及停止失效系统的能力来评判。

第一个信号是,医院是否公布针对具体模型的评估实践。关于负责任 AI 的笼统声明透露的信息很少。有用的披露应说明预期用途、本地测试人群、性能阈值、亚组结果、监测计划和问责负责人。

标准化报告能够在不迫使医院披露可识别患者数据的情况下,使比较更加容易。它也能帮助董事会区分技术上已经完成的上线与经过临床验证的部署。

Nature Health 的研究发现,医院 AI 的实施具有地域聚集性,并且高度依赖本地条件。implementation analysis涵盖了 3,560 家美国医院,并呼吁采用标准化、针对具体模型的指标。

如果模型层面的报告成为常规做法,这将增强治理正在成熟的判断。如果医院继续只报告已部署工具的数量,那么采用情况仍将比安全性或价值更容易衡量。

第二个信号是供应商如何处理更新和外部审查。医院需要可靠的变更通知、版本历史、事件沟通渠道,以及在上线使用前测试新版本的机会。

供应商对底层模型的修改可能改变准确性、偏差、语气或失效模式。如果医院不知道产品何时发生了实质性变化,就无法维持经过验证的状态。

独立评估对于广泛部署的系统最为重要。通用基准不能替代本地验证,但能够揭示反复出现的弱点,并减少重复工作。

第三个信号是,组织是否建立可执行的停止规则。如果没有任何阈值会触发调查、暂停或退役,监测计划的价值就十分有限。

停止规则可以涵盖准确率下降、亚组差异、异常人工覆盖率、反复出现的幻觉、安全事件,或未能实现预期临床价值等情况。

医院还应追踪临床医生是否确实按预期使用系统。采用率低可能表明培训不足、设计欠佳,或产品没有解决真实需求。

UPMC 和 KLAS 的发现为基础设施缺口提供了可衡量的数据,但并未说明医院将以多快速度弥合这一缺口。建设数据环境只是第一步。

医疗系统必须为多学科团队提供资金,明确证据标准,协商更有力的供应商条款,监测实时性能,并赋予某人干预的权力。

这则报道通过 Google News 浮现,警示医院推进速度过快。它更持久的教训在于,AI 治理必须成为一种运营能力,而非一份政策文件。

医院领导者应当就每个已经投入使用的模型提出一个直接问题:什么证据会说服我们将其关闭?

这个问题迫使组织在故障替其作出决定之前,先界定性能、问责和可接受风险。关注临床 AI 的读者应留意公开验证标准、透明的更新控制,以及医院实际撤下表现不佳工具的案例。这些信号将揭示监管是否终于与采用速度相匹配,还是行业仍在统计部署数量,却让患者和临床医生承担不确定性。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page