top of page

OpenAI Verge 报道:ChatGPT Health 无处不在,但其最大主张仍未经验证

7月26日
讀畢需時 15 分鐘

OpenAI 于 7 月 23 日在全美扩大推出 ChatGPT Health,但一项令人震惊的说法如今盖过了此次更广泛发布的风头。在 OpenAI Verge 报道所涵盖的一场媒体简报会上,健康产品副总裁 Ashley Alexander 表示,其模型的推理能力“优于临床医生水平”。

这一表述听起来远超 OpenAI 对该产品的官方定位。ChatGPT Health 原本旨在帮助成年人理解医疗记录、发现趋势,并为就诊做好准备。OpenAI 一再强调,它不会诊断疾病、提供治疗或取代医疗专业人员。

这两种表述之间的落差,定义了此次发布。OpenAI 希望消费者将极为敏感的信息托付给 ChatGPT,同时将其医疗结论视为辅助而非权威。当一位高管将该系统与临床医生相比并给出正面评价时,这一区分就更难维系。

Anthropic、Google 和其他科技公司也在推进各自的医疗保健 AI 战略。然而,OpenAI 正在同一个熟悉的界面中结合面向大众的聊天机器人、互联医疗记录、消费者健康数据与医疗推理能力。其分发能力意味着每一个模糊的产品主张都会立即带来影响。

ChatGPT Health 已不再局限于独立标签页

最重要的变化并非推出新的聊天机器人模型,而是消除了日常对话与互联健康信息之间的摩擦。

OpenAI 于 2026 年 1 月向有限用户群体推出 ChatGPT Health。早期用户必须进入专属的 Health 区域,才能获得基于已连接医疗记录和健康数据的回复。

这种分隔为敏感信息划出了清晰边界。但当用户在规划饮食、讨论运动或其他日常对话中产生健康问题时,也意味着需要多一个操作步骤。

OpenAI 表示,早期用户超过 70% 的健康对话发生在专属体验之外。对此,该公司允许成年人在常规 ChatGPT 对话中使用已连接的健康上下文,但需遵循其权限设置。

此次推出面向美国境内已登录、年满 18 岁的用户,涵盖 ChatGPT 的 Free、Go、Plus 和 Pro 套餐,可通过网页和 iOS 访问。

用户可以连接支持的医疗记录、Apple Health、One Medical 和 Function Health。记录可包括用药信息、化验结果、临床病史、就诊摘要及参与医疗系统提供的其他信息。

OpenAI 表示,ChatGPT 可以将当前检查结果与早期数值进行比较,总结某次就诊以来的变化,并解释临床术语。它还可以在回答更广泛的生活方式问题时,结合活动、睡眠或受伤信息。

例如,计划去餐厅的人可以要求 ChatGPT 将记录在案的食物过敏情况纳入考虑。正在从伤病中恢复的人,则可以根据 Health 中存储的信息请求推荐冲击较小的活动。

这些示例与组织型助手的角色相契合。它们类似于 个人知识库 中的文档整合和上下文检索能力。

然而,健康数据的风险更高。一份错误的项目摘要或许只会浪费一个下午;对症状、药物或紧急程度的误导性解释,则可能影响一个人是否寻求医疗服务。

OpenAI 承认,已连接的信息可能并不完整或已经过时。例如,已停用的药物仍可能留在医疗记录中。该公司建议用户更正过时信息,并根据原始来源核查重要细节。

这一警告指出了一个核心限制。模型可以整理其接收的信息,但无法独立判断底层记录是否反映现实。

官方健康功能发布公告还称,每周有超过 3 亿人向 ChatGPT 提出与健康相关的问题。1 月的公告中,这一数字为超过 2.3 亿。

这些数字来自 OpenAI 自身分析,而非独立的受众测量。即便如此,它们仍说明了该公司为何现在要减少摩擦:人们已经将通用 ChatGPT 当作非正式的健康助手。

连接医疗记录会让这些对话更具个性化,也可能更有价值。但这也增加了用户将个性化误认为医疗可靠性的可能性。

OpenAI Verge 所报道的主张超出了产品免责声明

OpenAI 在其文档中倡导克制,却在发布简报中暗示自身更优。

Alexander 所称“优于临床医生水平”的说法极为宽泛。它没有明确具体专科、任务、患者群体、结果指标或受控评估。

据报道,OpenAI 健康负责人 Karan Singhal 在同一场简报会上对这一说法作了限定。他表示,该比较基于独立研究,并不意味着 ChatGPT 应取代临床医生。

这一限定很重要,因为医疗推理并非单一、可量化的能力。总结就诊记录不同于诊断罕见疾病;识别紧急情况不同于解释化验参考范围。

临床医生所做的也不只是生成一份润色良好的书面回复。他们会采集病史、检查患者、评估相互矛盾的证据、开具检查、修正假设,并为决策承担专业责任。

文本基准测试只能捕捉其中一部分工作。出色表现可以支持有关受测任务的主张,却不能证明其具备普遍的临床能力。

OpenAI 的证据主要围绕 HealthBench 和 HealthBench Professional。HealthBench 使用逼真的对话和由医生编写的标准,评估准确性、安全性、完整性、沟通、上下文感知与升级处置能力。

原始基准包含 5,000 段对话和 48,562 项评分标准。OpenAI 与曾在 60 个国家执业的 262 名医生共同开发了该基准。

这些细节让 HealthBench 比传统医学考试更具意义。其提示涵盖多轮对话、多种语言、不同专科,以及面向消费者和专业人士的场景。

不过,该基准仍是在评估针对预设对话生成的书面回答。它通过基于模型的评分器,判断回复是否满足医生编写的标准。

OpenAI 报告称,在受测示例中,较新的模型表现优于专家撰写的回复。在一项实验中,医生可以改进 2024 年 9 月模型的输出;但他们无法改进某些 2025 年 4 月模型的回复。

这证明了快速进步,但并不等同于证明其改善了患者结果、实现了更安全的自主分诊,或在临床实践中具备更出色的表现。

这种评估形式还可能奖励完整性。模型可以生成一长串考量因素,而无需面对真实医疗服务中存在的时间、信息和工作流程限制。

OpenAI 的 7 月发布采用了更克制的措辞。它称 GPT-5.6 Sol 是公司最强的健康模型,在需要审慎判断的复杂问题上表现良好。

该公司还表示,医生在发布前对 ChatGPT Health 进行了广泛测试。但它没有公布足够细节,供外界独立评估这些测试涉及的每一种真实世界场景。

这些证据支持一个更狭窄的结论:在结构化评估条件下,OpenAI 的模型已变得擅长生成与健康相关的回复。

它并不能证明 ChatGPT 总体上优于临床医生。OpenAI Verge 的报道之所以重要,是因为它揭示了一个有边界的基准测试结果如何轻易演变成宽泛的公开主张。

一旦用户听到“优于临床医生水平”,免责声明就必须与一种更强势的认知框架竞争。即使界面另有说明,自信的回复也可能显得获得了医疗背书。

这种表述还将责任转移给消费者。用户必须判断 ChatGPT 何时只是在翻译信息,何时已跨入不可靠的临床判断领域。

这条边界往往要等到出问题后才会显现。

更好的医疗回答并不保证更安全的决策

医疗保健 AI 只有在人们提供有用信息、正确理解不确定性,并能根据回复采取安全行动时,才能成功。

一项由牛津大学主导、发表在 Nature Medicine 的研究考察了医疗知识与真实互动之间的差距。研究人员发现,模型的强劲表现并不能可靠地转化为求医者更好的决策。

问题在两个方向上都存在。用户往往提供不完整或结构不佳的症状描述;模型有时未能提出恢复缺失信息所需的问题。

人们也难以解读模型输出。一些人即使在建议错误时仍会依赖它,这使回答质量问题演变为行为风险。

这很重要,因为消费者健康对话很少像基准测试提示那样规范。一个焦虑的人可能遗漏某种药物、误解一种症状,或淡化严重变化。

临床医生可以察觉到犹豫、外观、动作、呼吸或其他文本中无法获取的信号。ChatGPT 则必须依赖用户输入的内容,或已连接记录中恰好包含的信息。

另一项分诊评估通过 60 个临床情景测试了 ChatGPT Health。这些场景涵盖 21 个医疗领域,并包括主观和客观信息。

研究人员警告称,尽管有免责声明,面向消费者的聊天机器人实际上仍充当了分诊工具。建议等待、寻求常规医疗服务,或前往急诊科,本质上都是临床决策。

这一观察直接挑战了“辅助而非替代”这一清晰区分。一个系统即使不正式作出诊断,也能影响治疗时机。

问题不在于每一个健康回答都会出错。更棘手的问题是,当模型能流畅地同时给出正确和错误建议时,人们该如何辨别哪一个值得信任。

助手可能准确总结十项化验结果,随后却低估一个紧急症状。此前的成功表现会让后续错误更具说服力。

已连接的医疗记录可以减少一部分上下文缺失,但无法消除上次更新后发生的变化、未记录的症状或源记录中的错误。

OpenAI 建议用户核实重要信息,并咨询合格的专业人士。这一建议依然合理,但它也限制了“临床医生水平推理”的实际含义。

如果每一项重要结论都需要专业人士验证,那么聊天机器人最适合扮演准备和翻译工具的角色,而非独立的医疗权威。

因此,最强的应用场景出现在就诊前及就诊过程中。ChatGPT 可以整理时间线、解释术语、起草问题,并帮助患者清晰描述担忧。

它也可以帮助用户比较多次就诊的指示。这些任务减少了信息摩擦,却不要求模型作出最终临床决策。

当用户询问症状是否危险、是否需要治疗,或专业医疗服务能否等待时,风险便会增加。这些问题要求系统能在不确定性下可靠地升级处置。

OpenAI 表示,GPT-5.5 Instant 提升了识别紧急情况和请求缺失背景信息的能力。但性能提升并不等同于故障率已足够低。

规模会让即使不常见的失误也变得重要。将极小的错误比例应用于每周数亿健康用户,仍意味着大量值得质疑的互动。

该公司的雄心还带来另一个行为层面的问题。更相关的答案可能变得更具说服力,即使事实可靠性仅有小幅提升。

基于个人记录生成的回复会提及用户的用药、检查历史和既往就诊情况。这种具体性可能营造出一种超出模型实际能力的理解印象。

个性化很有价值,但不等于验证。医疗 AI 必须通过结果、漏判的紧急情况、不当升级,以及用户行为变化来评估。

这些指标比基准测试分数更难公开。它们也更接近患者和临床医生真正需要了解的内容。

医疗记录将推理之争变成信任考验

ChatGPT Health 要求用户评估两类独立风险:其答案是否可靠,以及最敏感的数据是否仍能得到保护。

OpenAI 表示,Health 信息获得额外加密保护。ChatGPT 对话在系统间传输时和存储时均经过加密。

已连接的医疗记录、Apple Health 信息以及使用这些数据进行的对话,不会用于训练基础模型。OpenAI 还表示,不会将其用于定向广告。

默认情况下,ChatGPT 会在回复中使用已连接的健康信息前请求许可。用户可以一次性授予访问权限,或允许持续访问。

断开账户连接后,OpenAI 会在 30 天内从其系统中删除同步信息。已纳入对话历史的信息则会保留,直到用户删除这些对话。

健康记忆需要单独关注。OpenAI 表示,记忆不会直接从医疗记录或 Apple Health 数据中创建,但健康相关对话可能产生已保存的记忆。

用户可以关闭记忆功能,或使用 Temporary Chat。他们必须理解分散在 Health、Plugins、Memory、Personalization 和账户设置中的多项控制选项。

隐私声明还补充了一项重要细节。除非用户选择退出,否则数量有限的获授权员工和受信任服务提供商可为提升安全性而访问 Health 数据。

该声明还允许向履行运营职能的供应商和服务提供商披露信息,并说明在法律义务、安全、欺诈预防和商业交易相关情形下可能进行披露。

这些做法并不自动意味着滥用。它们说明,“不用于模型训练”只是隐私问题的一部分。

消费者还必须考虑访问权限、保留期限、删除机制、法律披露、供应商处理、账户安全和意外分享。仅凭训练政策无法概括完整的数据生命周期。

医疗服务提供者承担既定的专业和法律义务。消费科技服务即使处理同样敏感的信息,也可能处于不同的监管关系中。

OpenAI 的声明承认华盛顿州和内华达州的消费者健康数据法律。每位用户可获得的确切保护,可能取决于所在地以及数据进入服务的方式。

该公司围绕 Health 设计了技术隔离机制。但 7 月更新允许用户在许可后,将健康背景信息带入普通对话。

这一变化提升了便利性,同时弱化了可见的产品边界。超过 70% 的早期健康对话发生在其他场景中,表明用户已在抗拒严格的分区。

一个膳食规划问题可能突然涉及过敏、用药或代谢信息。通过另一项已连接服务执行的操作,也可能泄露源自健康数据的偏好。

OpenAI 表示,额外保障机制会检查可能披露敏感 Health 信息的操作。某些操作在继续前可能需要确认。

这些控制措施将面临棘手的边缘案例。人们会将日历、电子邮件、健身工具、购物服务和工作场所系统连接到 AI 助手。

问题不仅在于 OpenAI 是否保护静态存储的医疗记录,还在于更广泛的助手是否能可靠避免暴露从该记录中推断出的信息。

设想一名用户要求 ChatGPT 向朋友发送跑步计划。该计划可能间接暴露伤病、怀孕、药物影响或慢性疾病。

即使回复准确,如果助手将敏感背景放入错误的渠道,也会造成隐私问题。

因此,用户应将 Health 权限视为持续需要做出的选择,而非一次性设置任务。他们应检查已连接的数据源、对话历史、记忆和持续访问设置。

他们也不应把熟悉的聊天界面视为熟悉风险等级的证明。暴露健康数据的后果,与分享旅行偏好并不相同。

这种隐私负担并未抹去产品的潜在价值。许多患者确实需要帮助整合碎片化记录,并理解临床语言。

但这意味着 OpenAI 必须通过透明的控制措施和可衡量的安全表现来赢得信任。将自身与临床医生进行宣传性比较,可能让这项工作更加困难。

OpenAI 正在向医疗 AI 对手和临床医生施压

ChatGPT Health 最大的竞争优势是分发能力,而最大的弱点则是同样规模带来的不确定性。

Anthropic 于 1 月推出 Claude for Healthcare。其最初定位强调医疗服务提供者、付款方、生命科学公司,以及具备 HIPAA 就绪基础设施的机构。

这种路径更贴近机构工作流程。组织可以在部署模型前建立政策、合同、审查流程和专业监督。

OpenAI 也通过 ChatGPT for Healthcare 服务机构,并通过 ChatGPT for Clinicians 支持个人专业人士。ChatGPT Health 则为这一战略增加了直接面向消费者的一层。

这形成了一条从患者提问到专业研究和企业部署的广泛路径。鲜有竞争对手能匹敌 OpenAI 现有的消费者覆盖面。

Google 则通过 SymptomAI 等研究系统走另一条路线。其近期随机研究涉及 13,917 名参与者,他们使用了基于 Gemini 2.0 Flash 构建的对话式症状评估智能体。

Google 明确将生成的诊断描述为研究输出,而非经确认的医疗评估。该研究考察了主动追问是否能改善症状评估。

SymptomAI 研究凸显了一项重要差异。安全的医疗推理依赖于信息收集,而不只是给出最终答案。

ChatGPT Health 可以提出追问,但 OpenAI 的大规模发布将这种行为置于不受控制的对话中。用户自行决定披露什么、何时停止,以及是否采取行动。

该产品也给临床医生带来压力。患者将越来越多地带着 AI 生成的摘要、拟议解释和根据自身记录整理的问题清单前来就诊。

当材料有条理且准确时,这可以改善问诊。当专业人士必须纠正误导性结论时,它也可能消耗稀缺的临床时间。

医疗系统可能需要新的工作流程来审查患者生成的 AI 材料。它们还需要制定政策,记录聊天机器人建议何时影响了照护决策。

医疗专业人士不能以否定一切使用方式来回应。患者已经转向 ChatGPT,因为医疗信息支离破碎,获得服务依然困难。

OpenAI 的数据表明,在两次就诊之间,人们对信息转译、就诊准备和安抚有巨大需求。临床医生无法亲自回答每一个常规随访问题。

因此,真正的竞争并非 ChatGPT 对阵医生,而是 AI 支持的导航方式,对阵一个常常让人们独自面对门户、病历记录和延迟预约的既有系统。

当 OpenAI 将其模型描述为优于临床医生时,它削弱了这一更有力的论点。这种比较引来了对诊断、分诊、问责和患者结果的审视。

竞争对手可以利用这种过度延伸。Anthropic 可以强调机构控制,而 Google 可以突出受控研究和主动信息收集。

监管机构和法院也可能关注产品行为,而非免责声明。如果聊天机器人反复影响治疗决策,其正式标签的说服力可能有限。

发布前后提起的一起诉讼说明了这种可能性。佛罗里达州居民 Scott Winters 指控,较早版本的 ChatGPT 阻碍其及时接受医疗护理,并提供了不安全建议。

根据起诉书,这些对话发生在其因肺栓塞接受治疗之前。OpenAI 曾表示,ChatGPT 绝不应替代医疗护理、诊断或治疗。

这些指控尚未得到证实,争议涉及的也是较早的产品体验。不过,这一时间点加剧了此次发布周围的矛盾。

OpenAI 一方面告诉消费者 ChatGPT 可能出错,另一方面有高管援引其推理能力优于临床医生。两种信息不可能同等塑造用户预期。

该公司的竞争对手、医疗合作伙伴和用户如今都有理由要求更严格的主张。他们需要针对具体任务的性能、已知失效模式和现实世界结果证据。

OpenAI 与 Verge 的报道告诉我们接下来该关注什么

下一阶段的评判将取决于安全信号、用户行为和监管对待,而不是又一个亮眼的基准测试分数。

第一个信号是 OpenAI 的公开证据。该公司应明确界定哪些任务支持其“临床医生水平”的比较,并公布相关评估条件。

有价值的披露应区分记录摘要、医疗解释、诊断推理和紧急情况升级。每项任务都需要不同的证据,并带来不同后果。

独立医生评分将增强这些发现的可信度。外部复现应测试多个患者群体、不完整记录、模糊症状,以及随时间推进的对话。

较窄的主张或许能经受这种审查。关于推理能力高于临床医生水平的宽泛说法,则需要远超单一综合分数的证据。

第二个信号是全国发布后的现实行为。OpenAI 应报告 ChatGPT 请求缺失背景信息、建议紧急就医或拒绝缺乏依据的结论的频率。

它还应监测用户在获得安抚后是否延迟寻求专业护理。汇总错误报告将帮助研究人员理解产品在实际中的安全状况。

仅凭采用数据几乎说明不了什么。高频使用可能反映未被满足的需求、便利性、好奇心,或不当信任。

更有意义的问题是,Health 是否改善了用户与医疗专业人士的沟通。就诊准备和病历理解提供了可衡量的起点。

OpenAI 可以研究用户是否带着更准确的用药清单前来、提出更相关的问题,或更好地理解随访指示。这些结果符合该产品所宣称的辅助角色。

第三个信号是监管机构、法院和医疗机构的反应。法律争议将检验免责声明是否足以应对个性化医疗指导。

各州监管机构已在审查那些似乎提供无证医疗或心理健康服务的聊天机器人。接入病历与个性化回应将加剧这场争论。

医疗机构必须决定:是推荐 ChatGPT Health、对此予以容忍,还是提醒患者避免将其用于特定用途。相比产品营销,它们的政策将更深刻地影响公众信任。

竞争对手的动向同样重要。Anthropic 可能会进一步面向消费者,而 Google 可能会将健康研究系统转化为更易获取的产品。

如果竞争者采用更审慎的表述,并发布更清晰的验证结果,OpenAI 将面临压力,需要展现同等的严谨性。若所有公司都采用宽泛的优越性宣传,监管很可能会趋于更严厉。

对用户而言,最安全的理解依然应当务实且有限。ChatGPT Health 可以整理病历、解释陌生术语,并帮助准备向专业人士咨询的问题。

它不应判断严重症状是否可以等待,也不应自行调整用药、替代检查或确定诊断。

The Verge 关于 OpenAI 的报道描绘了一家公司:它在解决其最大主张背后的证据问题之前,就已跨越了一个重要的分发门槛。如今,数百万人可以将高度私密的信息接入一个仍可能自信出错的系统。

OpenAI 为碎片化的健康知识打造了一个颇具吸引力的界面,但尚未建立临床责任的数字等价物。

关注用户将 ChatGPT 总结带入真实就诊时会发生什么。临床医生会看到更清晰的病史和更好的问题,还是要花更多时间纠正错误的自信?

这一答案将比又一个排行榜更能说明问题。在此之前,应将 ChatGPT Health 视为一项知情准备工具,核实具有重要后果的建议,并让具备资质的医疗专业人士继续对医疗决策负责。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page