top of page

Anthropic OpenEvidence 合作扩大医疗 AI 覆盖范围,但本地化语境才是考验

2天前
讀畢需時 15 分鐘

Anthropic 和 OpenEvidence 正将临床 AI 推向约 100 个国家,但仅有访问权限并不能让医疗建议在当地变得可靠。Anthropic OpenEvidence 合作面向缺乏订阅服务、专科支持或稳定获取最新医学文献渠道的临床医生。

该计划于 9 月 22 日宣布,将向符合条件的医疗服务提供者免费提供专业版 OpenEvidence。推广范围包括安哥拉、海地、蒙古、苏丹和乌干达等中低收入国家。双方未披露财务条款。

OpenEvidence 将针对区域疾病模式、可用治疗手段、诊断资源和医疗基础设施调整其面向医生的系统。Anthropic 将提供底层模型技术。这样的分工带来了核心考验:通用 AI 模型与专业医疗平台能否在差异巨大的临床环境中提供有用的答案。

这不只是一次地域扩张。OpenEvidence 已与成熟的临床参考服务,以及 OpenAI、Google 和 Anthropic 自身推出的新产品竞争。这项合作让这些表面上的竞争对手在一次全球部署中成为协作者,而在该部署中,本地化证据与原始模型性能同等重要。

Anthropic OpenEvidence 合作瞄准约 100 个国家

眼下最直接的变化是访问权限:数十个服务不足市场的临床医生将无需为平台付费,即可获得专业医疗 AI 服务。

OpenEvidence 是一项临床决策支持服务,即帮助医疗专业人员评估证据,同时将决策权保留给临床医生。医生可以提交问题,并获得基于医学研究和治疗指南综合生成的答案。

两家公司向 Reuters 表示,新项目将覆盖约 100 个国家。一份全球推广报道将安哥拉、海地、蒙古、苏丹和乌干达列为覆盖市场。

该服务旨在弥补一个具体的信息缺口。许多临床医生难以便捷获取昂贵的期刊订阅、专科会诊或继续医学教育。当患者在诊疗过程中需要答案时,这些限制可能拖慢证据审查。

OpenEvidence 创始人 Daniel Nadler 直接概括了这一前提:“获取医学知识不应取决于地理位置。”这句话指出了获取信息的问题,但并未解决更难的临床适配问题。

可检索的医学资料库,只有在其答案反映临床医生实际能够采取的措施时才有用。一项指南可能建议使用农村医疗机构并不具备的影像检查,也可能优先推荐当地供应链很少有库存的药物。

不同地区的疾病患病率也不同。针对美国医院优化的答案,可能会错误评估其他地区常见传染病的重要性。语言、转诊路径和本地临床规程还会带来更多差异。

OpenEvidence 表示,将通过根据区域条件定制服务来应对这一问题。Anthropic 将支持后端,而 OpenEvidence 将调整面向用户的临床系统及其证据流程。

该公司此前曾与卢旺达和博茨瓦纳的医疗机构合作。这些工作聚焦于疾病模式、可用治疗手段和诊断资源与富裕市场不同的环境。

Nadler 向 Reuters 表示,为这些地区开发的一切都将“具备情境自适应性”。这句话描述了该项目最具影响力的承诺,也界定了医生、研究人员和卫生部门应据以评估此次推广的标准。

这项部署并不会让 AI 的回答成为诊断或治疗指令。该系统被定位为面向经过验证的医疗专业人员的参考工具。临床医生仍应负责解读证据,并将其应用于每一位患者。

这一差别很重要,因为医疗 AI 产品在不同国家属于不同的监管类别。文献助手与能够自主分析图像或开具治疗方案的软件,带来的风险并不相同。

该计划还依赖一个重要的现实假设:即使没有持续供电的医疗机构,也可能有医生携带智能手机。因此,移动访问可以让最新医学证据更接近诊疗现场。

不过,各国国内的网络连接、设备可用性和稳定供电情况仍存在差异。覆盖一个全国市场,并不意味着覆盖该市场中的每一位临床医生。实际活跃使用情况将比发布时列出的国家数量更具参考意义。

这项合作在地域覆盖范围上作出了重大承诺。其真正的重要性将取决于这些部署能否成为持久的临床工具,而非名义上的访问项目。

医疗 AI 访问为何已成为竞争焦点

这项合作给医学出版商和 AI 公司带来压力,因为它将广泛使用的临床界面与前沿模型基础设施结合在一起。

OpenEvidence 表示,美国医生在 2026 年 8 月期间使用其平台进行了 4,200 万次查询。这是公司自行提供的使用数据,并非经过独立审计的临床结果指标。

不过,据称的活跃度说明了该公司的重要性。当临床医生将医疗 AI 产品融入日常工作,而不只是它在考试基准中取得好成绩时,这类产品便具备战略价值。

OpenEvidence 通过证据检索和医生验证来推动这一工作流。其答案基于同行评审研究和治疗指南,产品会呈现引文,以便临床医生查阅底层资料。

这种做法对长期存在的医学参考服务构成压力。它也与能够回答健康问题、但缺乏同等专业界面或授权证据关系的通用 AI 服务竞争。

OpenEvidence 并非以一个小型实验项目的身份进入此次扩张。2026 年 1 月,该公司宣布了一轮融资,估值达 120 亿美元。该公司称,平台在 2025 年 12 月处理了 1,800 万次临床咨询。

这些数字表明投资者的信心以及临床医生的大量参与,但并不能证明该系统能够改善不同环境下的患者结果。使用量与临床获益仍是两个不同的问题。

Anthropic 也有自己的医疗战略。今年 1 月,该公司推出了 Claude for Healthcare,这是一套面向医疗服务提供者、付款方、健康技术公司和个人用户的工具。

这项产品扩张使 Anthropic 成为专业医疗平台的潜在竞争者。然而,OpenEvidence 协议展示了另一条路径:通过已具备临床医生覆盖能力和行业特定工作流的合作伙伴提供模型能力。

对 Anthropic 而言,这一安排使其无需让 Claude 成为主要临床界面,也能进入高价值专业市场。对 OpenEvidence 而言,Anthropic 提供先进的模型基础设施,而医疗平台则掌控本地化和医生体验。

因此,这项合作挑战了关于 AI 市场的一项简单假设:更好的通用模型并不会自动淘汰专业应用。行业平台可通过证据授权、专业验证、工作流设计和区域适配保留价值。

OpenAI 和 Google 则代表这一竞争格局的另一面。两家公司都投资于健康相关模型、评估和用户产品。医院也可以使用多家供应商的模型来构建内部系统。

竞争不仅在于哪种模型能回答最多的基准问题,还关乎谁掌控与临床医生的关系、答案中呈现哪些证据,以及系统如何适应机构政策。

医学出版商也面临相关挑战。传统参考服务拥有深厚的编辑资源和既有声誉。AI 界面可以减少检索这些资料所需的时间,从而改变用户对订阅价值的认知。

OpenEvidence 还曾与医疗系统合作,实现更深入的工作流整合。一项 Cedars-Sinai 部署将医学文献与患者电子病历中的相关信息连接起来。

9 月介绍的国际项目则有所不同。许多参与机构不会拥有大型美国医疗系统所具备的电子健康记录基础设施、集成人员或治理资源。

这一差异解释了为何全球推广具有更高的战略风险。若取得成功,将表明医疗 AI 的访问可以扩展到资金充裕的机构之外,而不必复制其技术环境。

若失败,则会强化相反的观点:临床 AI 可能仍然只在医院已经具备强大数字病历、合规团队、可靠网络连接和广泛专科支持的地方最为有效。

本地临床现实才是产品,而非应用场景

核心机制不只是 Anthropic 的模型质量,而是 OpenEvidence 将全球研究转化为本地可用临床指导的能力。

模型可以检索到受尊敬的指南,却仍给出不切实际的答案。建议的实验室检测可能在当地并不存在,推荐的药物也可能无法获得、价格无法承受,或不适合当地的耐药模式。

因此,本地化必须在多个层面发挥作用。系统需要相关医学证据、对本地资源的准确了解、恰当的语言支持,以及对不确定性的清晰处理。

区域疾病患病率会改变哪些诊断应被优先考虑。同一症状模式在波士顿、哈博罗内、太子港或乌兰巴托可能意味着不同风险。安全的系统必须考虑这些差异,同时不能依赖粗糙的地域刻板印象。

医疗基础设施带来另一层影响。适用于三级医院的建议,可能无法在地区诊所实施。答案应指出可行的替代方案,而不是仅仅重复高资源环境下的指南。

治疗手段的可用性同样会改变决策树。模型在推荐药物时,不应忽略其是否已获批准、是否有库存,或是否被纳入国家规程。本地药品目录的重要性可能不亚于期刊证据。

语言带来的风险不止于翻译。医学术语、缩写和患者描述因地区而异。字面翻译可能丢失临床含义,或造成虚假的确定感。

OpenEvidence 表示,其系统将考虑基础设施和区域条件。然而,两家公司尚未公开详细说明每个国家版本在部署后将如何进行验证、更新或监测。

这些流程之所以重要,是因为医疗知识持续变化。新研究可能改变建议,而药品短缺或公共卫生紧急事件可能在数日内改变可行方案。

本地化系统需要明确的权威层级。它必须确定:当国际研究、国家指南、医院规范与最新证据相互矛盾时,应如何处理它们之间的关系。

它还需要可见的溯源信息。临床医生应了解哪些来源支持某项回答、这些来源何时更新,以及该建议是否假设其所在机构具备实际上并不具备的资源。

世界卫生组织曾警告,主要基于高收入人群训练的 AI 系统,可能在其他地区表现不佳。其健康 AI 原则强调人的自主性、透明度、问责制、包容性以及持续评估。

即使 AI 服务能够检索同行评议文献,这一警告依然适用。已发表的医学研究并未平等代表所有人群。证据缺口可能贯穿整个系统,最终以看似自信的回答呈现出来。

检索增强生成(通常称为 RAG)允许模型在组织回答时使用选定的外部文档。它可以提升引用质量,但无法凭空创造从未被收集过的证据。

模型或许能够准确总结一项基于富裕城市医院患者开展的研究。但这一总结仍可能与合并症、检测可及性或治疗选择不同的农村人群并不匹配。

这正是本地医疗机构不可或缺的地方。区域临床医生必须协助定义评估案例、识别不切实际的建议,并判断系统是否反映真实临床实践。

这一过程不能止于上线前测试。用户需要能够报告不安全、不相关或过时回答的渠道。随后,开发者还需要一套可审计的方法来审查这些报告并调整系统。

全球化产品还需要抵制一种具有误导性的“一致性”。给每位临床医生相同的答案或许看起来公平,但完全一致的输出可能忽视具有重要意义的临床差异。

更好的目标是,让用户能够稳定获得符合具体情境的证据。这需要比在 100 个国家简单开放账户投入更多本地化工作。

基础设施同样是产品的一部分。智能手机界面固然有帮助,但带宽需求、登录要求、延迟和服务中断,都可能决定医生是否会在诊疗过程中使用它。

Anthropic 与 OpenEvidence 的合作能否建立可信度,取决于本地化是否变得可观察、可验证。国家覆盖范围只是起跑线。公开的验证方法、区域反馈以及临床医生的持续使用,将显示该系统是否真正实现了适应。

基准测试青睐通用模型,但部署改变了竞争格局

独立测试令专业化叙事变得更复杂:领先的通用模型已在多项受控基准测试中超过临床工具。

2026 年发表于 Nature Medicine 的一项研究,将 OpenEvidence 和 UpToDate Expert AI 与 Anthropic、OpenAI 和 Google 的模型进行了比较。研究人员评估了医学知识问答、与临床医生意见一致性的任务,以及真实临床查询。

这项临床 AI 研究包括 500 道 MedQA 问题、500 个 HealthBench 条目,以及 100 条来自临床使用场景的查询。12 名美国临床医生对真实查询的回答进行了盲法评审。

通用模型在该研究的各项基准类别中均优于专业工具。Claude Opus 4.6 是接受测试的通用系统之一。

这一结果让这项合作呈现出不同寻常的竞争格局。Anthropic 向专业平台提供技术,而与此同时,Claude 模型在独立评估中已对该平台表现出强劲优势。

人们很容易把这项基准测试视为专业产品不再重要的证据。但现有证据并不支持如此宽泛的结论。

基准测试衡量的是受控条件下定义明确的任务。临床部署还取决于证据使用权、引用设计、身份验证、机构控制、可用性和用户习惯。

医生可能偏好能够呈现相关来源、并契合既有工作流程的界面。医院可能会比起基准表现上的微小差距,更重视审计追踪和账户控制。

OpenEvidence 服务的用户群也更为狭窄。验证机制可以围绕专业需求塑造产品设计。通用消费级助手则必须处理更广泛的使用意图和健康素养水平。

不过,工作流程优势不应成为回避比较测试的盾牌。如果通用模型提供了更准确或更完整的回答,专业平台就必须说明其额外层级创造了什么价值。

Nature Medicine 的研究结果让这个问题尤为重要。OpenEvidence 和 Anthropic 现在可以将前沿模型能力与临床检索和本地化结合起来。这项合作应当优于两个层级各自运作不佳时的表现。

两家公司尚未公布针对国家特定系统的比较结果。它们也未详细说明,本地版本是否会针对语言、专科或资源水平采用独立评估。

这些缺失并不能证明存在弱点。它们指出了仍需具备的证据,才能负责任地评估医疗 AI 的可及性。

外部有效性是核心问题。美国的基准测试无法证明系统在乌干达或海地的表现。反过来,在一个区域试点中取得成功,也无法验证一个系统能够适用于约 100 个国家。

恰当的评估必须纳入源自本地实践的案例。评审者应检查推荐的检测是否实际存在、引用的指南是否适用,以及回答是否承认资源限制。

平均表现也可能掩盖严重失败。具有临床实用价值的评估应区分轻微遗漏,与延误紧急救治或推荐无法获得治疗的建议。

模型在不确定情况下的行为,与其平均准确率同样重要。它应披露何时证据薄弱、相互冲突,或与患者人群不够匹配。

与本地临床医生的比较必须谨慎处理。参考工具的目的不一定是独立超越医生。它可能是帮助医生更快找到相关证据,并注意到原本可能忽略的选项。

患者结局将提供最有力的证据,但很难归因。问诊时间、转诊质量、对本地指南的遵循情况以及已纠正的错误,可以提供更早的运营信号。

因此,Anthropic 与 OpenEvidence 的合作汇集了两场争论。一场关乎专业软件是否比通用模型更具价值;另一场则关乎任何模型能否在多样化的医疗体系之间安全迁移。

其最有力的论据不会来自一份授权公告或单一基准测试,而会来自透明的区域评估:展示组合系统在哪些地方有帮助、在哪些地方失效,以及这些失效如何被纠正。

免费临床决策支持仍伴随治理成本

取消订阅费用降低了一项门槛,但并未消除验证、培训、监督、隐私和问责所需的成本。

卫生部或医院必须决定临床医生应如何使用该系统。它们可能需要制定有关患者信息、可接受查询、核实义务、事件报告和升级处置的政策。

这些责任需要人员时间和专业知识。信息缺口最大的机构,也可能拥有最少的 AI 治理资源。

各国的隐私规则不同。为临床问题设计的系统必须清楚说明,用户是否应输入可识别患者身份的信息,以及提交的数据将如何处理。

这项国际计划似乎专注于医学知识支持,而非自主患者管理。即便如此,医生在提问时仍可能包含详细的病例信息。

产品设计可通过警示、数据最小化和技术控制来降低这一风险。培训应强化:易于使用的界面,并不意味着每一类输入都合适。

问责是另一个尚未解决的问题。当临床医生遵循了有缺陷的回答时,责任可能涉及用户、医院、平台提供商、模型开发者或当地主管部门。

责任如何分配,取决于产品声明、当地法律以及系统呈现输出的方式。强有力的引用有助于临床医生审查回答,但忙碌的专业人士未必会逐一核查每个来源。

仅有引用并不足够。来源可能真实存在,却未必支持生成的结论。最有用的系统应让人们能够轻松核查主张与证据之间的联系。

世界卫生组织的治理指导建议,在开发和部署的整个过程中吸纳医疗服务提供者、患者、政府、科技公司和公民社会的参与。

这对资源匮乏地区尤其重要。由开发者和外部专家优化的模型,可能会忽略本地护士、医生和患者能够立即识别的实际风险。

因此,该计划应避免仅将本地临床医生视为用户。他们需要在产品测试、治理以及决定哪些来源获得优先权等方面发挥实质性作用。

围绕商业激励的透明度同样重要。该项目对符合资格的临床医生免费,但 Anthropic 和 OpenEvidence 未披露其财务安排。

免费访问既可以支持公共卫生,也可以推动产品采用和市场定位。这两件事可以同时成立。机构应基于证据和治理来评估服务,而不是基于对动机的假设。

监管将带来更多复杂性。一些国家可能会根据软件是检索证据、推荐治疗,还是分析患者特定数据,对其功能作出不同分类。

在美国,FDA 将某些临床决策支持功能与受监管的医疗器械加以区分。其软件指导部分关注专业人员能否独立审查建议的依据。

其他司法管辖区采用不同的法律框架,并且可能缺乏针对 AI 的专门规则。缺少明确监管并不意味着临床风险会消失。

跨国项目需要采用高于最弱本地要求的标准。否则,监管能力有限国家的患者,可能从同一项底层技术中获得较少保护。

偏见仍是另一项担忧。医学文献往往不足以代表低收入和中等收入国家的人群。本地化无法完全纠正这种结构性的证据缺口。

当相关的本地研究稀缺时,系统应明确说明。用流畅的语言掩盖不确定性,会扩大可及性,却削弱知情的临床判断。

对系统的过度依赖同样值得关注。尤其在无法获得专科会诊时,有用的工具可能变成默认权威。这会提高细微错误或不完整回答的代价。

培训应将该服务定位为决策支持,而非临床责任的替代品。它还应说明,用户何时需要寻求专科医生、公共卫生主管部门,或采用不同的诊断流程。

免费临床决策支持可以减少获取医学知识方面的不平等。它也可能将新的监督职责转移给本已在压力下运作的机构。

决定性问题不在于这项服务是否向临床医生收费,而在于参与的医疗系统能否获得安全使用所需的验证证据、治理工具和支持。

三个信号将显示此次扩展是否奏效

下一阶段的评判应基于区域验证、临床医生的持续使用,以及有关失败情况的透明证据,而不是新增覆盖国家的公告。

第一个信号是发布针对具体国家或地区的评估。这些评估应测试真实的临床问题、当地治疗资源的可及性、主要语言以及资源限制。

此类评估将强化该合作关系的核心主张。它们将证明“context adaptive”描述的是可衡量的系统行为,而非笼统的产品目标。

缺少这些结果并不能立即证明项目失败。然而,在缺乏透明验证的情况下持续扩展,将削弱外界信心,尤其是在高风险临床领域。

第二个信号是持续且有意义的采用情况。账号注册量和国家覆盖情况反映了触达范围,但几乎无法说明临床医生是否认为答案可用。

有价值的衡量指标可以包括经验证专业人士的重复使用率、打开来源的行为、报告的纠正情况、响应延迟,以及在城市和农村环境中的采用情况。

两家公司应将使用情况与结果主张区分开来。较高的查询量说明存在需求,但并不能证明诊断更准确、治疗更安全或患者健康状况得到改善。

相比全球总量,本地留存率能提供更有力的早期指标。如果临床医生在最初推广之后仍持续使用该服务,产品就更可能契合其工作流程。

第三个信号是合作伙伴如何报告并修复失败。医疗 AI 必然会产生不完整、本地化不足或错误的回答。其可信度取决于这些问题能否被看见并得到处理。

OpenEvidence 应提供清晰的报告渠道,并公开有关反复出现的失败类别的有意义信息。当模型更新影响临床行为时,Anthropic 在其中所扮演的角色也应清晰易懂。

一项有效的监测计划将追踪错误是否集中于特定语言、专科、国家或资源假设,然后将这些发现与具体的产品改进相联系。

竞争对手的回应将提供更多背景。医疗出版商、OpenAI、Google 以及健康技术供应商,可以通过本地化循证服务或机构合作来挑战这一倡议。

然而,竞争对手的公告不应取代对实际项目的评估。核心竞争在于广泛可及与本地可靠可及之间,而不只是公司品牌之间的较量。

Anthropic 与 OpenEvidence 的合作选择了一个影响深远的测试环境。它正将先进 AI 带到更接近临床医生的地方,而这些医生往往面临最严重的信息限制和最少的技术保障。

这一决定可能带来真正的价值。一名拥有智能手机的医生,或许能够获得过去需要机构订阅或远程专科医生才能获取的相关证据。

它也可能暴露围绕富裕医疗系统构建的模型、医学文献和部署实践的局限。这些局限将出现在日常临床细节中,而不仅仅是在引人注目的失败案例里。

随着服务上线,医生和医疗卫生领导者应提出三个问题:该版本是否针对本地病例进行了测试?它是否承认某些资源无法获得?用户能否报告有害或无关的回答,并看到相应处理?

这些问题为医疗 AI 的可及性提供了一个实用标准。更广泛的可用性固然重要,但临床实用性取决于证据、语境以及可问责的人类判断。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page