top of page

医疗保健 AI 即使遵循指令,仍可能造成伤害

8月12日
讀畢需時 13 分鐘

Google News 推出了一则严峻的医疗保健 AI 警示:一个系统即使完全遵循指令,仍可能促成错误的临床结果。

这篇以“Your AI Did Exactly What It Was Told. That’s the Problem”为题发表的文章,将关注点从人们熟悉的幻觉问题转移开来。其重点在于 AI 系统周围的运行结构。当没有人负责决策、记录人工干预,或监测后续结果时,正确的预测或建议也会变得危险。

这一差别至关重要,因为医院正从零散试验走向更广泛的应用。预测模型如今已进入电子健康记录、临床工作流程、排班系统和出院流程。核心冲突不再只是人类与不准确机器之间的较量,而是 AI 的快速部署与界定权力、责任和可接受使用方式这一较慢进程之间的矛盾。

Google News 标题实际改变了什么

这一警示重新定义了 AI 成功:当医院衡量输出结果,却忽视围绕该结果作出的决策时,AI 的成功会成为运营风险。

通过 Google News 强调的文章,以一个假设的临床决策支持系统为开篇:该系统建议让患者提前出院。算法遵循了既定逻辑,但患者在 48 小时内再次入院。未必有人忽视警告,也未必有人违反书面规定。

失败之处在于组织从未明确规定的事项。工作人员没有一套有据可查的流程来质疑该建议。当临床判断与算法输出发生冲突时,也没有人被明确赋予决策权。组织同样缺少可靠记录,说明最终决定为何如此作出。

这个例子仅用于说明,并非已记录在案的患者案例。不应将其视为某家医院伤害患者的证据。它的价值在于揭示技术表现与临床责任之间可能存在的缺口。

预测模型根据可用数据估算某一明确结果。它并不能决定这一结果是否代表医院的完整目标。例如,再入院风险评分无法自行平衡床位容量、患者稳定性、家庭支持、后续护理可及性,以及错误出院带来的后果。

这一缺口很容易被忽视,因为软件团队自然会测试系统是否完成被分配的任务。他们会衡量准确率、敏感性、特异性、处理时间或其他技术指标。这些衡量方式很重要,但并不能决定谁应当根据结果采取行动。

因此,医院可能在不安全的工作流程中部署准确的模型。当临床医生理解模型边界并保留实质性控制权时,医院也可以安全地部署能力有限的模型。

同样的区别也适用于生成式 AI。系统可以生成与提供记录相符、语言流畅的摘要,却遗漏临床医生所需的关键信息。它也可以生成遵循模板、措辞礼貌的患者消息,但表达出超出证据支持范围的确定性。

从狭义上说,这些并不总是模型失败。它们是未能将组织意图转化为规则、权限、审核步骤和可衡量结果的失败。

这正是该标题引起关注的原因。它向医院董事会和技术领导者提出了一个比“AI 是否有效?”更严苛的问题:当输出进入真实的临床流程后,“有效”究竟意味着什么?

相关的结果并不是模型是否完成任务,而是整个人类与技术系统是否提供了安全、有效且可问责的护理。

医疗保健 AI 的采用速度正超过治理能力

医院面临压力,因为 AI 的采用已变得普遍,而成熟的监督机制仍不均衡。

美国国家卫生信息技术协调办公室的一项分析发现,2024 年,71% 的非联邦急性护理医院使用了与电子健康记录整合的预测性 AI。根据政府的医院 AI 数据,这一比例高于 2023 年的 66%。

该定义包括对患者进行分类或生成风险评分的统计和机器学习系统。示例包括疾病早期检测、治疗建议、预约爽约预测和再入院风险预测。

这种增长之所以重要,是因为整合改变了风险边界。临床工作流程之外的模型可以作为独立工具进行评估。嵌入电子健康记录的模型,则会成为员工识别风险、确定工作优先级和记录决策方式的一部分。

整合也可能造成自动化偏见,即使存在相反证据,人们仍倾向于采纳机器建议。临床医生可能不愿偏离看似客观的评分,尤其是在工作负荷较高或当地政策不清晰时。

问题不在于临床医生停止思考。周围的系统可能使提出异议变得困难。界面可能突出 AI 结果,同时隐藏不确定性。医院可能衡量对警报的遵从情况,却从不审视员工是否觉得自己能够提出质疑。

Premier 发布的 2026 年行业展望引用了同样的 71% 采用率,同时指出 80% 的卫生系统缺乏未来采用 AI 的内部治理标准。这份医疗保健展望将这些数据描述为不断扩大的实施缺口。

这两项统计衡量的是不同群体,不应合并为单一的精确估计。不过,它们共同反映了医院领导者面临的压力。AI 使用已相当广泛,但用于选择、监测和淘汰系统的正式结构并未以同样速度成熟。

这种压力波及多个群体。

医院董事会必须监督战略和临床风险,同时不能将每一种 AI 工具视作相同。高管必须决定哪些决策可以授权,哪些需要批准。临床医生必须了解何时输出仅供参考、何时会触发行动,以及如何记录异议。

技术团队必须控制数据访问、模型更新、整合和审计日志。合规与法务团队必须解读相互重叠的隐私、医疗器械、歧视和职业责任义务。供应商必须说明其系统在部署后的表现,而不只是验证期间的表现。

患者要承担这些群体之间缺口带来的后果。他们可能永远不会知道,某个算法影响了出院、优先级评分、消息或转诊。即使有披露,也未必能说明最终由谁承担责任。

被迫作出的回应是组织层面的,而不仅仅是技术层面的。医院需要为每个使用场景指定负责人,制定书面升级路径,并将部署后的监测与患者和工作流程结果挂钩。

这项工作比启用一项新功能更慢。它要求职责和风险承受能力不同的人达成一致。然而,回避这项工作实际上等于默认让软件界面来界定权力。

真正的对手是缺乏权责的部署

主要冲突并非 AI 与临床医生之间的冲突,而是自动化影响力与可问责的人类权力之间的冲突。

人工监督常被描述为应对 AI 风险的通用答案。这一说法听起来令人安心,但只有当组织明确谁采取行动、何时进行审核,以及审核者拥有何种权力时,它才不再模糊。

能够在技术上忽略警报的临床医生,仍可能缺乏实际权力。医院可能将接受警报的比例作为绩效指标。界面可能要求经过多个步骤才能推翻建议。临床医生也可能没有时间重建模型的输入信息。

有意义的监督不只是让某个人待在流程附近。审核者需要获得相关证据、有足够时间评估证据,并拥有一条既定路径来停止或改变行动。

权力也必须与后果相匹配。用于起草内部备注的工具,与会更改药物医嘱或直接向患者发送消息的软件,带来的风险不同。审批流程应当反映这种差异。

医院可以先区分四种经常被混淆的角色。

供应商开发或提供系统。技术负责人维护整合和访问控制。临床负责人确定该系统在护理中的适当用途。高管或治理机构接受剩余的组织风险。

在较小的组织中,一个人可能兼任多个角色。但这些职责仍需分别界定。否则,每个群体都可能以为另一方已经评估过同一风险。

采购尤其是薄弱环节。供应商可能记录了模型相对于验证数据集的表现。但这些证据并不能证明医院的用户、患者群体、界面或后续流程会产生相同结果。

本地验证必须测试实际使用场景。为预测某一结果而开发的模型,不应悄然变成更广泛决策的替代指标。医院还必须确定缺失数据、工作流程延迟或人群差异是否会改变模型表现。

部署后的系统还需要持续审核。数据分布会变化,临床实践会改变,软件更新也会改变行为。安全上线并不保证第二年仍然安全。

美国食品药品监督管理局围绕 AI 赋能医疗器械开展的工作体现了这种生命周期视角。该机构的设备软件指南涵盖生命周期管理、网络安全、变更控制和临床决策支持文件。

并非所有医院 AI 工具都是受 FDA 监管的医疗器械。行政系统、通用型生成式工具和部分临床支持功能,可能不适用于特定医疗器械路径。这使内部治理更加重要,而非更不重要。

监管许可所回答的问题也比本地部署治理更狭窄。FDA 表示,其公开列表列出了满足适用上市前要求的 AI 赋能设备。该机构还警告称,该列表并不全面。

医院仍须决定谁可以使用获授权设备、结果如何进入护理流程,以及哪些变更需要重新评估。监管机构可以界定边界,但无法为每家医院制定运营程序。

因此,Google News 强调的文章挑战了一种常见心智模型。人类判断并不是只在明显的软件失败后才启动的备用功能。即使面对技术上正确的输出,它也是治理控制结构的一部分。

准确输出仍可能优化错误目标

AI 系统可以满足其被衡量的目标,却损害组织真正重视的结果。

这是一个规格定义问题,也就是说,形式化目标并不能完整代表人类目标。只要组织以易于衡量的代理指标替代复杂结果,这种问题就会出现。

医院可能会因住院时长可量化而优化出院时机。其真正目标是实现安全康复、提供恰当照护并负责任地使用资源。这些目标彼此重叠,但并不完全相同。

预约排程模型可能通过优先安排预测会到诊的患者来减少爽约。这可能改善某项运营指标,却会让面临交通、残障、照护或工作限制的患者更难获得服务。

文档助手可能会尽量缩短临床医生撰写病历的时间。如果它生成的文本更长、需要仔细核验,表面上的时间节省可能只是被转移,而非真正消失。它还可能将复制而来的错误写入病历,供后续系统当作事实处理。

患者消息生成器可能会优化快速回复。医院的实际目标还包括准确性、恰当的安抚、隐私保护,以及明确获得专业医疗服务的路径。回复速度只是这一结果的一部分。

解决方案不是拒绝可量化的目标。组织需要指标来评估系统,但必须将技术指标与运营和临床结果结合起来,以判断代理指标是否仍与目标保持一致。

这意味着既要监测流程,也要监测后果。

流程指标可以显示临床医生接受、拒绝或忽略输出的频率。它们能够揭示延迟、覆盖建议时的阻力以及异常使用模式。结果指标则可检验部署后患者安全、质量、可及性或工作负荷是否发生变化。

比较还必须考虑此前的流程。纯人工系统同样存在错误、偏见和不一致。AI 治理不应假定现有实践天然安全或公平。

负责任的评估会问:这一组合系统是否优于相关替代方案。它会考察不同患者群体的收益与伤害,也会记录不确定性,而不是把决策简化为单一成功率。

独立研究人员指出,医疗 AI 需要覆盖采购、部署、监测和退役全流程的治理。一篇发表于 2025 年《npj Digital Medicine》的观点文章警告称,大语言模型可能带来不透明的数据使用、问责问题,以及不足的患者结局验证。其医疗 AI 分析呼吁提高透明度,并对现实世界中的使用实施控制。

担忧不止于幻觉。模型可以生成事实看似合理的文本,却掩盖信息来源。它还可能因环境或用户提示不同而表现不同,却不会形成传统意义上的软件错误。

生成式系统又增加了一层复杂性,因为用户可以迅速改变其用途。获准用于起草内部材料的工具,可能开始影响患者沟通或临床推理。技术本身未必发生变化,但风险变了。

因此,医院需要依据数据和行动划定使用场景边界。“AI 助手”这类笼统标签几乎无法说明风险。管理者需要知道系统接收什么信息、生成什么内容、谁能看到输出,以及它是否能够触发外部行动。

这一原则同样适用于日常知识工作。团队在使用AI knowledge base时,若生成的答案会影响决策,就需要明确的来源背景和审查实践。

医疗提高了后果的严重性,但其机制并不陌生。AI 系统优化的是它能够观察到的任务。人类仍然负责判断这一任务是否涵盖了组织真正需要的内容。

治理必须经得起临床工作的考验

如果一份治理文件中的控制措施无法在繁忙班次、紧急决策和意外系统故障期间保持可用,它就没有多少价值。

正式审查委员会提供了起点。它们可以对拟议系统进行分类、评估证据、设定条件并分配责任。随后,其决定必须在工作流程中变得可见。

临床医生不应为了理解一项警报,而必须查找遥远的政策文件。界面应明确输出的目的、重要限制和所需回应,也应允许用户提出异议,而不会造成不合理的阻力。

覆盖设计尤其值得关注。完全不受限制的覆盖机制,可能使必要的保障措施沦为可选建议。覆盖机制过于繁琐,则可能推动临床医生自动接受建议。

适当的平衡取决于风险。后果较轻的建议可能只需要轻量控制。后果严重的行动则应要求更强的证据、批准和文档记录。

可审计性同样重要。审计日志会记录哪些数据、模型版本、用户和行动共同影响了决策。没有这段历史,调查人员可能难以判断伤害究竟源于模型、集成、数据还是运行政策。

记录应捕捉足够的背景,以便重建决策过程,同时避免收集不必要的敏感数据。更多日志并不必然更好。过度留存可能带来隐私和安全风险。

医院还需要一种接收一线反馈的机制。临床医生通常会在汇总指标变化前发现令人困惑的输出或工作流程冲突。报告渠道必须区分可用性投诉与安全事件,同时将二者都关联到系统负责人。

反馈不能消失在普通服务台中。组织应定义调查、限制、回滚和退役的阈值,也应告知用户提交关切后发生了什么。

培训应聚焦实际系统,而非仅进行泛泛的 AI 素养教育。用户需要了解获准用途、预期的失效模式和升级路径,也需要看到依赖系统何时变得不恰当的示例。

技术控制必须支持这些预期。访问权限应遵循最小权限原则,即仅授予完成任务所需的权限。起草内容的系统不应自动获得发送、删除、下单或修改记录的权限。

随着供应商增加智能体功能,这一区别变得更加重要。AI 智能体能够规划步骤,并使用软件工具来追求目标。一旦它能够采取行动,一个看似合理但错误的结论就可能立即造成运营后果。

因此,行动权限应与对话能力分离。医院可以要求对敏感步骤进行确认、限制交易规模、在只读模式下测试,并维持可靠的回滚流程。

美国国家标准与技术研究院围绕治理、映射、测量和管理来组织 AI 风险管理。其AI 风险框架虽属自愿采用,但为将领导层决策与技术评估联系起来提供了实用的共同语言。

框架仍需要本地化解读。一家小型乡村医院无法建立与全国性医疗系统相同的监督办公室,但仍可以维护资产清单、指定负责人、分类风险并界定审批边界。

持怀疑态度的人会指出,治理可能变成仪式化流程。委员会可能在缺乏监测资源的情况下批准政策。供应商提供的文档可能无法反映本地使用情况。当获批系统造成过多阻力时,员工可能转向未经授权的工具。

这有时被称为影子 AI,即发生在组织批准或可见范围之外的 AI 使用。彻底阻止每一种未经批准的工具或许并不现实,尤其是在消费者服务轻易可得的情况下。

医院需要好用的获批选择、明确的数据规则和可信的执行机制。它们还需要理解员工为何寻求变通办法。忽视工作流程压力的政策,可能会把高风险行为推入地下。

没有任何治理模型能够消除医疗中的不确定性。人类判断仍不完美,过度控制也可能延迟有益技术的应用。目标并非零风险。

目标是明确且可审查的风险。医院应能够说明为何部署系统、由谁控制、如何衡量性能,以及什么证据会促使其停止使用。

Google News 争议之后需关注的三个信号

下一阶段将由现实世界监测、可执行的权力以及证明 AI 能够在技术基准之外改善结果的证据所定义。

第一个信号是医院是否公布或披露部署后的性能指标。模型上线前的准确率对日常使用的说明有限。采购方应关注包含覆盖操作、亚组表现、工作流程影响和患者结局的监测。

FDA 已强调,需要在部署后评估 AI 赋能医疗器械。其现实世界性能倡议征集能够评估持续安全性、有效性和可靠性的方法。

如果医疗系统开始持续报告这些指标,文章关于治理的论点将获得支持。这将表明采购方和监管机构日益将部署视为评估的开始,而非终点。

如果披露仍仅限于上市前基准和供应商声明,不确定性就会持续存在。医院可能知道模型在测试中表现良好,却不知道它会如何改变自身环境中的决策。

第二个信号是审批和覆盖权限是否在产品中变得可见。供应商越来越多地描述保障措施,但采购方应审视具体控制机制。

管理员能否将系统限制在获批任务内?临床医生能否看到相关证据和不确定性?高风险行动是否需要确认?医院能否重建究竟是哪一模型版本影响了某项决策?

可见的控制措施将强化这样一种判断:市场正在从宽泛的伦理原则转向运营问责。若产品获得对病历、消息、医嘱或排程系统的访问权限,关于负责任 AI 的笼统承诺将削弱这一判断。

第三个信号是医疗系统是否评估结果,而不是庆祝使用量。采用数据揭示的是覆盖范围,而非价值。医院可以增加使用 AI 的员工数量,却不改善照护、可及性或工作负荷。

管理者应关注那些将 AI 支持的工作流程与可信替代方案进行比较的受控评估。有用的证据会明确患者群体、运行条件、限制因素以及随时间推移发生的变化。

更好结果的证据不会消除对治理的需求。它将表明,控制措施和临床整合能够将模型能力转化为可衡量的收益。

中性或有害结果的证据则会迫使人们作出不同回应。医院可能缩小使用场景、重新设计界面、重新培训用户,或让那些达到技术基准却在运营层面失败的系统退役。

Google News 的标题以令人难忘的一句话抓住了问题,但持久的问题属于制度层面:谁来决定 AI 实际被要求完成什么,以及当这一目标被证明不完整时,谁能够介入?

医院管理者应绘制一条正在运行的 AI 工作流程,从数据输入到最终行动。他们应识别负责人、审批点、覆盖路径、审计记录、结果指标和停用条件。

如果其中任何要素缺失,模型的准确率就不是最紧迫的问题。该组织尚未定义成功意味着什么。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page