top of page

AI 能诊断,但仍无法真正照护患者

Google News 重新推送了一篇 TIME 文章,其核心存在尖锐冲突:医疗 AI 持续进步,却仍无法真正关怀患者。这篇文章质疑了一个常见预测——更聪明的机器终将直接取代医生。越来越多的临床证据表明,未来将更加复杂。

AI 可以识别模式、总结病历、推荐检查,并协助临床医生审阅复杂病例。有些系统甚至能够生成让患者感到富有同理心的语言。然而,令人信服地表达关切,并不必然意味着真正的关切。

这一差异至关重要,因为医学不只是选择统计上最有力的答案。患者需要有人承担责任、理解他们的优先事项,并在没有任何理想选项时仍陪伴在侧。因此,核心竞争并非医生与算法之间的对抗,而是模拟共情与可问责的人类照护之间的较量。

Google News 的报道究竟改变了什么

这篇报道将医疗 AI 的讨论重新聚焦于照护的边界,而非计算能力的边界。

经由 Google News 传播的这篇文章,最初是 William Warr 为 TIME Ideas 撰写的评论文章。TIME 目前以标题 Healthcare Is AI’s Hardest Test 发布该文。文章引用了对计算机科学家 Geoffrey Hinton 和心脏病学家 Eric Topol 的采访。

它最重要的贡献并不是推出了一种新的医疗产品或监管决定,而是将几项通常被分开讨论的发展联系在一起。其中包括更强大的诊断模型、持续存在的临床错误、预防性监测、法律不确定性,以及共情的人文意义。

Hinton 曾预测,医院应停止培训放射科医生,因为 AI 很快就会超越他们。近十年后,放射学成为医学中 AI 应用最密集的领域之一,但放射科医生并未消失。

TIME 援引的一项综述发现,1995 年至 2024 年间获批的 AI 或机器学习医疗设备共有 950 款,其中 723 款与放射学相关。更出色的图像分析扩大了可用工具的范围,却没有取代负责解读结果和治疗患者的专业人员。

这一结果削弱了最简单的自动化叙事。机器可以在某项任务上表现得更好,却不意味着它会接管围绕该任务的整份职业工作。医疗工作还包括收集背景信息、管理不确定性、沟通、体格检查、升级处理以及承担责任。

Hinton 给出了一种经济学解释。当服务能力增长时,医疗需求也会随之扩大,因为未被满足的需求仍极其庞大。更快地解读扫描结果,会为更多筛查、随访和预防性照护创造空间,而非必然减少临床医生的数量。

这一解读值得重视。然而,经济因素无法解释预测与现实之间的全部差距。医疗 AI 还进入了一个高度互联的环境,在那里,技术上正确的输出仍可能造成伤害。

一项建议必须在恰当的时间送达正确的人。临床医生必须理解其相关性与局限性。患者必须同意由此产生的照护,而医疗系统则必须记录最终由谁作出决定。

因此,最具影响力的改变是概念层面的。“替代”这一问题已失去大部分实际意义。更好的问题是:哪些责任可以安全地交给机器,哪些又必须继续由可问责的人承担。

这一变化也澄清了围绕医疗 AI 共情能力的争论。算法可以生成富有同情心的措辞,却无法独立承担赋予这些话语分量的道德与法律义务。

一名终末期患者需要的不只是对概率经过精心润色的解释。他们可能还需要帮助,以在继续治疗与争取更多居家时光之间作出选择。这一选择取决于仅凭临床平均值无法还原的价值观。

TIME 的文章将这种张力与 AI 有时能够胜过医生的证据并置。这种安排避免了对该技术的轻易否定。人类的优势并不在于普遍优于 AI 的诊断能力。

相反,持久的人类角色始于技术预测与真实生活后果相遇之处。医学需要有人能够听出犹豫、识别未说出口的恐惧,并在一项决定改变人生后继续承担责任。

更好的医疗答案并不等于更好的医疗

AI 可以改善临床评估,但作为独立决策者仍可能并不安全。

一项 2026 年随机研究同时说明了这一判断的两面。研究人员在复杂心脏病病例中评估了 AMIE——一款基于 Gemini 2.0 Flash 的实验性医疗大语言模型。

9 名普通心脏病医生评估了 107 名疑似遗传性心肌病患者的回顾性数据。病例包含心电图、超声心动图、心脏影像、运动测试和基因检测的报告与原始数据。

每个病例都会获得两份评估:一份来自使用 AMIE 的心脏病医生,另一份来自未使用 AMIE 的医生。随后,3 名不知情的亚专科医生对结果进行了比较。

这项心脏病学试验显示,AI 辅助评估在 46.7% 的比较中更受青睐;未获辅助的评估在 32.7% 的比较中更受青睐,20.6% 的比较结果为平局。

AI 辅助回答中出现具有临床重要性错误的比例为 13.1%,未获辅助回答则为 24.3%。辅助评估遗漏重要内容的比例为 17.8%,未获辅助评估则为 37.4%。

这些结果为将医疗 AI 作为临床辅助工具提供了有意义的支持。普通心脏病医生还表示,在 50.5% 的病例中节省了时间;他们称该系统改善了其评估的比例为 57%。

不过,AMIE 在 6.5% 的病例中生成了很可能具有临床重要性的幻觉内容。所谓幻觉,是指没有现有证据支持、却被表述得仿佛有事实依据的内容。

案例包括虚构的影像学发现、对患者特征的臆测,以及混淆不同条件下获得的测量结果。这些并非只是措辞生硬的问题,而是可能改变诊断推理或治疗管理的错误。

人类监督改变了结果。心脏病医生有时会针对可疑陈述质疑模型,促使其自行纠正。该纠正并非源自系统内部对错误的认识。

临床医生提供了怀疑、背景与重新审查该主张的理由。这种互动体现了医疗 AI 最具成效的形态:系统扩展临床医生的检索空间,而临床医生控制决策边界。

这也暴露了以基准测试为导向的说法所存在的弱点。模型可以获得很高的平均分,却仍可能针对某位特定患者提出不可接受的建议。医学既评估总体表现,也评估个体伤害。

因此,恰当的比较不应是理想机器与易出错医生之间的对比。人类医疗本就会产生严重失误,包括延迟诊断和漏诊。医疗 AI 的边界必须相对于这个并不完美的基线来判断。

同时,人类会犯错并不能为机器失败开脱。软件可能将一种有缺陷的模式扩散到数千次接触中。自动化还会让薄弱的建议呈现出一致性与权威性的表象。

最有用的设计模式,是将 AI 置于审查系统之中。模型检索证据、识别遗漏并提出替代方案;持证临床医生核实记录、检查患者,并对最终选择负责。

这种分工也解释了为何文档工具比自主诊断更快获得应用。起草一次就诊记录,与决定胸痛是否需要紧急治疗,承担的风险截然不同。

输出可在写入病历前接受审查。其价值显而易见,错误通常也仍可纠正。AI 越接近不可逆的行动,就越需要更强的证据与监督。

因此,医疗 AI 的部署应遵循针对具体任务的证据。心肌病评估中的成功,并不能证明它在急诊分诊、肿瘤学、儿科或心理健康领域同样安全可靠。

这正是有关 AI 医疗的宽泛论断背后反复出现的错误。“医疗推理”并非一项稳定、单一的活动,而是一系列拥有不同数据、后果与可接受错误率的任务集合。

真正的竞争在于模拟共情与可问责照护之间

模型可以复现共情的语言,却无法分担患者的脆弱处境,也不能为结果承担责任。

Hinton 和 Topol 在 TIME 的文章中提出了相反立场。Hinton 认为,AI 系统可以真正拥有共情;Topol 则认为,它们能够传递共情,却无法理解共情的含义。

这一差异听起来或许偏哲学,但会立刻影响产品决策。开发者可以针对温暖感、认可与支持性措辞优化模型。这些行为能够改善令人紧张的互动。

患者可能更偏好冷静的聊天机器人回复,而不是仓促或敷衍的临床信息。医疗专业人员并不会天然富有同情心,沉重的工作负荷也常常限制了进行细致沟通的时间。

研究人员还发现,患者有时会将聊天机器人的回答评为比临床医生书面回复更具同理心。这类比较揭示了医疗服务中的不足,却不能证明机器会体验关切。

表达出来的共情是一种可观察的沟通行为。感受到的共情则涉及识别他人的经历,并因那段经历本身重要而作出回应。临床照护还增加了一层含义:对后续结果负责。

模型不会在让患者回家后感到担忧。它不会在深夜反复回想一场艰难的谈话。它无法承受职业处分、道德悔恨,或可避免死亡后的悲痛。

这些事实并不意味着富有同理心的语言毫无用处。它们界定了其边界。当这种语言帮助负责任的人更清晰地沟通,或为患者提供更安全的途径获得人类支持时,它便具有临床价值。

当情感上的流畅被当作理解的证据时,问题便会出现。大语言模型预测的是在语境中合适的词序列。它们自信的语气可能掩盖底层信息的不确定性。

经历抑郁、癌症、慢性疼痛或令人恐惧的妊娠并发症的患者,可能会向一个看似始终耐心的系统披露更多信息。这种开放带来了有关隐私、升级处理和连续性照护的义务。

如果系统误解了对自我伤害的间接提及,必须有人准备好介入。如果它淡化了某种症状,必须有人保持可联系状态。一句富有同情心的结束语并不能提供这样的安全结构。

世界卫生组织将人类自主权视为医疗 AI 的核心原则。其伦理指南指出,人们应保留对医疗决定的控制权,并获得有关 AI 系统的有意义信息。

这一原则区分了辅助与替代。患者应知道软件何时影响了一项建议。他们还需要一种切实可行的方法,用以质疑输出、拒绝其使用,或联系合格的专业人员。

真正的关怀需要关注患者所重视的事情。两名诊断相同的患者,可能因家庭责任、宗教信仰、对不确定性的容忍度或既往医疗创伤,而做出不同选择。

AI 系统可以询问这些因素并总结回答,但无法决定这些价值观对某个人应当意味着什么。这种判断源于共同决策,而非模式补全。

同样的局限也体现在身体在场上。临床医生可能会注意到,一名患者口头称一切都好,却回避眼神接触,或呼吸困难。家属也可能透露从未被记录在案的困惑。

传感器和多模态模型可以捕捉更多信号,但捕捉不等于关怀。更多数据可以提升检测能力,却无法形成关系。关系依赖于相互理解与持续承担责任。

因此,主要的对立并非 AI 与医生之间的竞争。许多最强的临床结果恰恰来自两者结合。真正的冲突在于,医疗机构是否会将流畅的交互界面误认为照护关系。

这种误判迎合了一个诱人的商业目标。自动化对话可以持续运行,服务的用户数量也可超过临床团队。它还可能让服务缩减显得不那么明显。

医疗系统既可以利用 AI 生成的同理心改善照护,也可以借此掩饰人类服务可及性的下降。两种情况下,界面看起来可能相似;人员配置模式、升级规则和问责结构,才会揭示差异。

更好的路径是利用 AI 为人们腾出更多照护时间。自动化文档记录、病历综合和常规随访可以减少行政工作。节省下来的时间应当回归患者,而不是消失在更高的工作配额中。

采用这些系统的团队也需要可靠的知识实践。可搜索的 AI knowledge base 可以保留来源背景、政策和决策信息,但无法替代临床治理或专业判断。

AI 医疗的局限始于证据与问责

最难的问题并非 AI 的回答听起来是否专业,而是是否有人能验证它,并为其后果负责。

美国已通过现有医疗器械审批路径监管许多 AI 赋能的医疗器械。FDA 维护了一份公开的 medical device list,但其表示该清单并不完整。

监管批准很重要,但并不能解决部署中的所有问题。系统表现可能因医院、患者群体、工作流程和软件版本而变化。

在精心筛选数据上训练的模型,可能会在日常照护中遇到缺失病历或陌生设备。当地患病率也可能不同于开发环境。临床医生还可能以原始评估从未测试过的方式使用模型输出。

这些差异使部署后监测不可或缺。医院需要跟踪错误、人工覆盖、不同亚群表现和患者结局;当系统性能恶化时,也需要具备暂停使用的流程。

生成式系统带来了额外挑战,因为其输出比固定计算结果更难预测。措辞或上下文的微小变化,都可能产生不同建议。

在机构完成评估后,模型更新也可能改变其行为。因此,医疗采购方需要版本控制、审计追踪,以及供应商变更底层系统时的明确通知。

当多方共同导致错误时,问责尤其困难。模型开发者提供软件,医疗系统对其进行配置,临床医生则解释其输出。

患者可能永远不知道究竟哪个环节失效。合同可以分摊经济责任,却未必能为患者提供易于理解的救济途径。因此,透明的责任划分必须伴随技术部署。

WHO 曾警告,面向医疗健康的语言模型可能生成看似合理但严重错误的答案。其 AI safety warning 也强调了偏见、隐私、错误信息和过早采用等风险。

偏见仍是实际问题,因为医疗数据集反映了获得医疗服务和接受治疗方面的不平等。算法可能从这些模式中学习,并以中立的表象将其复制出来。

整体平均表现可能掩盖这些失败。一个系统总体表现良好,却可能更频繁地漏诊代表性不足群体中的疾病。只要样本量允许进行有意义的分析,临床评估就必须报告各亚群结果。

隐私也构成另一处压力点。患者在寻求医疗建议时,往往会分享私密细节。面向消费者的聊天界面,可能无法提供与受监管临床系统相同的保护、同意程序或数据保留控制。

医疗机构不能因为对话界面看似熟悉,就假定它适合处理受保护信息。它们必须明确哪些数据进入系统、数据流向何处,以及这些数据是否会用于训练未来模型。

这种审慎观点同样适用于同理心主张。患者认为某个回答比另一个更温暖,并不能证明长期照护更好。即使医疗内容错误,安慰性的回答也可能增加信任。

这种交互形成了危险的组合:流畅性会提升信心,而有限的透明度会使验证更加困难。最具说服力的模型未必是最安全的模型。

因此,临床机构应分别衡量不同结果。医疗正确性、不确定性校准、患者理解程度、升级质量和情感恰当性彼此相关,但并不相同。

AI 系统可能改善一项指标,却削弱另一项。简洁回答可以减少困惑,但可能遗漏不确定性;全面回答可以覆盖更多可能性,却也可能让患者不堪重负。

人工审查也并非天然充分。临床医生可能过度依赖反复出现的建议,尤其是在时间压力之下。自动化偏见是指人们即使面对相冲突的证据,仍接受系统建议的现象。

心脏病学研究展现了更具建设性的互动,因为医生能够审问模型。有效监督需要时间、专业能力,以及提出异议的权限。当工作量鼓励自动批准时,名义上的人工检查点几乎无济于事。

医疗采购方应审查整个工作流程,而不只是模型演示。他们应询问谁审查输出、不确定性如何呈现、什么情况会触发升级,以及患者如何报告伤害。

他们还应询问,自动化是减少行政负担,还是仅仅提高吞吐量预期。答案决定了 AI 是创造更多人际照护,还是减少它。

最站得住脚的部署从边界明确的任务和可衡量的结果开始。系统失效时,它们保留替代流程;当 AI 对照护产生实质影响时,也会告知患者。

医疗 AI 通过证据、纠正和问责赢得信任。友善的声音可以支持这些品质,却无法取代它们。

Google News 读者接下来应关注什么

下一阶段将由临床试验、运行规则,以及节省下来的时间是否真正惠及患者来决定。

第一个信号,是来自前瞻性临床研究的任务特异性证据。回顾性病例和受控情景测试很有用,但日常医疗中充满中断、缺失数据和无法预料的患者行为。

研究人员必须在真实工作流程中测试系统,并报告收益与伤害。有价值的研究会比较单独使用 AI、单独由临床医生处理,以及人机联合团队的表现;也应识别哪些故障需要立即升级至人工处理。

更多类似 AMIE 试验的随机化证据,将加强受监督临床辅助的理由。若分诊或自主治疗中出现高错误率,则会削弱扩大授权的依据。

读者应警惕将单一结果夸大为对所有医疗 AI 的结论。一种帮助心脏病专家管理罕见疾病的模型,并未证明其在整个医学领域都具备能力。

第二个信号,是可执行的问责机制。监管机构和医疗系统需要针对模型更新、审计记录、患者告知和伤害发生后的责任,制定更清晰的规则。

有意义的政策将明确谁拥有最终决策权,也会为患者提供清晰的途径,以质疑受 AI 影响的建议。

薄弱的治理将依赖关于人工监督的笼统表述;强有力的治理会明确审查门槛、升级程序、监测周期和暂停标准。

这一信号之所以重要,是因为法律不确定性既可能拖慢有益的采用,也可能让治理不善的试验持续进行。清晰规则能够保护患者,并为负责任的开发者提供更可预测的路径。

第三个信号,是医疗机构如何使用 AI 节省下来的时间。效率并不自动等同于患者受益。

如果环境式文档记录和病历综合减少了文书工作,临床医生就能花更多时间倾听并解释选择。这一结果将支持 AI 能够强化医学人文核心的观点。

如果机构反而在未改善可及性或沟通的情况下增加预约量,AI 将加剧那些已使照护显得缺乏人情味的条件。模拟同理心随后可能成为替代可用工作人员的手段。

患者和临床医生可以关注实际指标:就诊是否更少被屏幕主导?后续问题是否获得更快答复?自动化系统失效时,患者能否联系到真人?

这些结果比聊天机器人是否能写出安慰性文字更重要。AI 医疗同理心的核心承诺,并不是软件会发展出情感,而是自动化能为人们实践关怀腾出空间。

Google News 让一个将超越当前模型周期的问题获得了新的关注。医学将继续采用那些比人类更快发现模式、比任何个人记忆更多信息的系统。

负责任的目标不是保留每一项现有任务,而是将每项任务交给最适合安全完成它的参与者。

机器可以计算、搜索、监测和起草。临床医生可以质询、检查、解释并承担责任。患者必须保留表达自身关切、质疑影响其身体决策的权力。

最困难的部分,将是抵制一种便利的幻觉:在其保障措施尚未完善之前,富有同理心的语言就可能让自动化服务显得已经完整。

请关注每个使用场景背后的证据,而非医疗 AI 所附带的宏大承诺。要问:谁验证建议?系统失效时谁来回应?自动化是否将有意义的时间还给了照护?

这些问题比询问机器是否听起来像人类更能检验其价值。医学的未来取决于如何运用 AI 不断扩展的能力,同时不把令人信服的对话误认为人类关怀。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page