top of page

Blue Cross AI 医院编码申索引发 9.42 亿美元争议

9月26日
讀畢需時 15 分鐘

Blue Cross 的 AI 医院编码申索如今将 9.42 亿美元的额外支出置于医院与保险公司日益扩大的争执核心。Blue Cross Blue Shield Association 表示,即使申索记录未显示医疗服务发生相应变化,更详尽的文档记录仍在 2024 年和 2025 年推高了赔付款项。

这场争议并不只是围绕某个收费代码是否正确。它关乎谁掌控对患者病情的数字化描述、这份描述价值多少,以及申索数据能否区分更完善的文档记录与机会主义收费。

医院表示,自动化编码工具帮助临床医生记录过去容易遗漏的病情。保险公司则认为,同样的工具可能将孤立的检测结果和次要诊断转化为赔付更高的申索。双方也都在部署 AI 来质疑对方的决定,围绕每一次医疗就诊形成一场行政军备竞赛。

Blue Cross AI 医院编码申索聚焦 9.42 亿美元

Blue Cross 表示,成本上升源于文档记录模式的变化,而非申索记录中可见的治疗变化。

该协会于 2026 年 9 月 24 日发布了最新的申索分析。分析审查了来自 Blue Cross Blue Shield 各公司的去标识化申索数据,并将 2024 年和 2025 年的医院编码与 2023 年基准进行了比较。

该分析估计,更高的编码强度为参与其中的 Blue 公司增加了 9.42 亿美元支出。编码强度描述的是,医疗服务提供方将患者或服务归入更复杂、赔付更高类别的频率。

在这一总额中,该协会将 6.53 亿美元归因于次要病症记录更频繁。这些诊断与导致患者住院的主要病症一并记录。

Blue Cross 表示,被归类为医学复杂病例的住院病例占比,从 2023 年初的 37% 升至 2025 年末的 40%。约 70% 的增长涉及超过 5.5 万个额外病例,其中次要诊断改变了赔付类别。

这些赔付类别是诊断相关组,通常称为 DRG。DRG 根据诊断、手术、并发症和预期资源使用情况,为住院治疗设定固定赔付款项。

加入符合条件的并发症或合并症,可能会使一次住院进入严重程度更高的 DRG。即使主要手术未发生变化,医院也可能因此获得更多报销。

这并不自动意味着次要诊断是虚假的。患者可能确有代谢异常、血液疾病或其他病症,只是此前的文档记录未能捕捉到。

Blue Cross 的论点更为狭窄。其分析称,复杂编码的增加并未伴随申索中可观察到的治疗增加。

根据独立报道,医院可以使用扫描既有记录的软件来发现被忽略的诊断。环境式记录助手也可以在就诊过程中监听,并生成临床笔记草稿。

这些工具共同创造了更多可搜索的临床文本。编码软件随后可以识别支持额外诊断代码的实验室数值、症状和医生陈述。

即使申索中列出的手术、药物或治疗程序没有变化,其财务影响也可能十分显著。更多数据进入病历,文档中的患者看起来更为复杂,申索便进入赔付更高的组别。

Blue Cross 以肠道手术为例强调了这一点。报道称,从 2023 年第一季度到 2025 年第四季度,部分肠梗阻的编码增加了 55%,酸中毒编码增加了 33%。

该协会并未声称每一项新增诊断都不准确。相反,它质疑这些文档变化是否代表了具有可比意义的临床复杂性增长。

这种区别很重要。这 9.42 亿美元是保险行业组织得出的估算,并非认定医院实施欺诈或提供了不必要治疗的结论。

该分析也无法直接确定每家医院的软件提出了什么建议。申索记录了为获得付款而提交的代码和服务,但不会披露每个模型的输出或临床医生的推理过程。

因此,这些证据支持存在可衡量的收费转变。它并不能独立证明 AI 导致了每一次转变、诊断是被编造的,或医院获得了不当赔付。

不过,这一时间点使 AI 很难被忽视。随着复杂编码增加,医院迅速扩大了自动化收费和文档记录的使用。Blue Cross 现在希望将这种相关性视为一项重大的可负担性问题。

医院收费 AI 为何能发现更多可赔付病症

AI 通过以低成本检索每一个可用细节来寻找可收费诊断,从而改变了文档记录的经济逻辑。

传统医疗编码依赖临床医生、文档记录专家和专业编码人员审阅患者病历。时间压力可能使合理的病症未被记录,或缺乏充分支持。

AI 辅助系统能够检查更多材料。它们可在医生笔记、实验室结果、用药史、影像报告和既往就诊记录中,搜索与公认诊断代码相关的证据。

环境式记录助手又增加了一层功能。它将临床医生与患者的对话转化为笔记草稿,可能保留那些不会出现在较短手写记录中的细节。

随后,文档系统可以提示临床医生澄清某项观察是否构成诊断。编码工具则可以推荐由完整笔记支持的代码。

医院将此描述为准确性。患者的健康状况不会仅仅因为忙碌的临床医生在原始记录中遗漏了某项病症,就变得更简单。

保险公司看到了另一种可能性。软件可以识别每一种看似合理的并发症,即使该病症并未实质影响患者在那次住院期间获得的医疗服务。

支付体系赋予这种分歧以金钱上的力量。许多医院赔付款项反映的是记录在案的复杂程度,而不是对每一项实际行动逐项开具发票。

假设两名患者接受相同的主要治疗程序。一份申索仅列出主要病症。另一份则包含通过实验室数据发现、并在病历中得到澄清的符合条件并发症。

第二份申索可能获得更高赔付,因为编码后的患者看起来需要更多资源。然而,两份申索可能显示相似的治疗程序和疗法。

这正是 Blue Cross AI 医院编码指控背后的机制。AI 无需虚构一项服务,也无需改变支付规则;它只需发现能让病例跨越现有报销边界的文档记录。

这项技术进入的是一个原本就充满此类边界的体系。早在现代机器学习出现之前,医院就有记录复杂病情的财务激励。

有关早期收费模式的研究支持这一历史。一项覆盖五个州的研究发现,最高强度的医院分类在 2011 年至 2019 年间增加了 41%,而研究人员估计预期增幅应为 13%。

该研究将编码变化与 2019 年较 2011 年做法增加的 146 亿美元医院赔付款项联系起来。研究人员提醒,仍需开展更多工作,以区分准确记录与不当升码。

因此,AI 加速了一种既有激励,而非创造了完全新的激励。它降低了发现支持更具体或更严重代码证据的成本。

采用数据显示了该问题为何变得紧迫。一项联邦医院调查发现,2024 年,71% 的受访医院使用了与电子健康记录整合的预测性 AI。

2023 年这一比例为 66%。在已经使用预测性 AI 的医院中,收费自动化是增长最快的应用之一。

使用预测性 AI 简化或自动化收费的比例,从 2023 年的 36% 上升至 2024 年的 61%。这 25 个百分点的增长高于治疗建议所报告的增长。

大型医院和隶属医疗系统的医院采用这些技术的频率高于较小的独立机构。2024 年,86% 的多医院系统成员报告使用预测性 AI,而独立医院的比例为 37%。

这种差距可能使节省成本和财务影响都集中在能够跨多个地点部署 AI 的机构中。在系统层面采用的编码工作流程可能影响数千份申索。

不过,这项联邦调查广泛涵盖预测性 AI。它并不能证明某家特定医院曾在某一项存在争议的 Blue Cross 申索中使用 AI 编码工具。

调查和申索分析回答的是不同的问题。前者记录了快速采用,后者衡量了编码和支出的变化。

将二者联系起来可形成一种合理解释,但并非完整的因果审计。要确立因果关系,需要有关软件部署日期、模型建议、医疗病历、临床医生批准以及实际使用资源的信息。

这些缺失的证据正是争议的核心。保险公司拥有庞大的申索数据集,而医院拥有能够验证每项诊断的临床记录。

任一方都不掌握完整图景。AI 使这种信息不平衡变得更具影响力,因为它能够以极大规模处理病历中可获得的一方信息。

医院和保险公司正在自动化申索的相反两端

主要冲突并非 AI 对阵人工判断,而是医院收入优化对阵保险公司支付控制。

医院是在经历多年拒赔、文档请求、延迟付款和事先授权要求之后进入这场竞争的。其软件供应商承诺减少手工工作,并收回有临床记录支持的收入。

保险公司则拥有自己的系统,用于申索裁决、支付完整性、欺诈检测、利用审查和支付后审计。这些工具会搜索缺乏支持的代码、收费异常以及不符合保障规则的服务。

医院模型可以推荐一项次要诊断。保险公司模型则可以标记该诊断以供审查,或取消其赔付影响。医院软件随后可以利用同一份医疗记录起草申诉。

结果形成一个 AI 循环。一个系统扩大申索,另一个系统提出质疑,第三个系统可能负责整理回应。

一项针对 16 个州 93 家大型保险公司的 2025 年调查发现,84% 的保险公司将 AI 用于至少一种运营目的。报告中的应用包括申索裁决、事先授权和利用管理。

一项针对这场AI 军备竞赛的详细分析发现,市场上同时存在面向付款方和医疗服务提供方的工具。保险公司产品筛查请求和申索,而医疗服务提供方产品则收集记录并准备授权或申诉。

这种对称性使保险公司的批评更加复杂。医保计划很难主张自动化本身不恰当,因为它们同样使用算法来管理支付决策。

医院无需先解决 Blue Cross 的调查发现,也可以提出同样的观点。保险公司对自动化的争议性使用,并不能证明医院新增的每一项诊断都合理。

各方都将自己的 AI 描述为对抗低效的手段,同时往往将对方的 AI 说成攫取财务利益的工具。

患者夹在这两种立场之间。一项存在争议的编码可能影响自付费用、保费、医院财务以及结算理赔所需的行政工作量。

雇主同样承担部分风险,因为许多雇主为员工提供健康福利。获准赔付金额上升会增加计划成本,而激进的支付削减则可能给医疗服务提供者网络带来压力。

眼前的压力首先落在保险公司身上。如果理赔中经常出现更多次要诊断,历史定价假设可能会低估未来的医疗支出。

保险公司可以通过加强审查、修改合同、索取更多文件或扩大支付审计来应对。这些措施可能为医院带来更多行政工作。

医院面临的是另一种压力。它们必须记录足够详细的信息,才能获得复杂医疗服务的相应报酬,同时又要避免给人造成软件夸大临床记录的印象。

人工审核本应充当保障措施。无论 AI 工具作出何种建议,医院仍须对以其名义提交的编码负责。

但人工批准并非完整答案。审核人员可能过于轻易地接受建议,尤其当软件根据真实病历数据生成条理完整的说明时。

软件还可能发现与住院期间所使用资源关联不大的真实诊断。这就在临床记录的完整性与支付相关性之间造成冲突。

因此,医院可以主张其理赔准确,而保险公司则可以认为较高的报销在经济上缺乏正当性。在同一支付架构下,这两种说法都可能成立。

Blue Cross 将未增加额外治疗视为更高复杂度并未创造价值的证据。医院则可以回应,理赔记录无法涵盖住院期间的每项临床判断、监测要求或风险管理。

这种分歧不能仅靠统计医疗程序数量来解决。一些并发症需要更密切的监测,却不会产生一项独立计费的干预。

反过来,实验室指标异常也并不总意味着患者需要显著更多的医疗服务。自动化系统可以让临界发现更容易被转化为正式诊断。

这项技术暴露出一个尚未解决的政策问题:即便可观察到的治疗基本不变,当文档记录更完整时,支付是否应当增加?

现行 DRG 规则通常会在新增病情符合编码要求时给出肯定答案。保险公司则日益希望根据临床影响或资源使用情况增加第二重检验。

这将使争议从编码有效性转向相关性证据,也将要求比任何一方目前提供的规则都更透明的标准。

9.42 亿美元估算无法证明什么

保险公司的分析识别出一种严重模式,但其公开证据不足以证明每项新增诊断都是由 AI 生成的高码行为。

第一个局限在于归因。Blue Cross 观察到,在医院采用 AI 的范围不断扩大的时期,编码强度也在上升。

这种关联很重要,但多种因素可能同时变化。患者病情可能更重,文档规则可能调整,复杂程度较低的医疗服务也可能转移至医院外。

当常规病例转往门诊环境时,仍需住院的患者可能代表病情更复杂的人群。这种变化可能提高平均编码严重程度,而并不存在任何操纵行为。

美国医院协会在其医院回应中提出了这一论点。该协会称,人口老龄化、慢性病、医疗场景变化以及编码指南调整,同样会影响记录在案的病情严重程度。

该协会认为,AI 可以提高文档记录的准确性,而临床医生仍负责验证编码。它还指出,保险公司自身也存在财务激励和有争议的编码做法。

这一回应并未推翻 Blue Cross 的数据。它表明,仅基于理赔的分析无法最终确定软件就是原因。

第二个局限在于临床记录。对该分析的公开描述强调理赔、编码类别和治疗模式。

理赔的设计目的是支付管理。它们并非完整病历,也可能遗漏能够解释某项次要病情为何重要的临床推理。

公平的审计应将编码与完整记录进行比对。它应当询问诊断标准是否满足、临床医生是否批准该诊断,以及该病情是否影响医疗服务。

第三个局限在于基准。9.42 亿美元的估算将 2024 年和 2025 年的模式与 2023 年进行比较。

这种方法量化了变化,但 2023 年并不自动代表正确的记录水平。早期记录可能因人工工作流程遗漏而漏记了有效诊断。

如果 AI 纠正了系统性的文档记录不足,那么部分较高支付反映的是迟来的准确性,而不是新增浪费。经济成本会增加,但理赔记录也会更完整。

第四个局限涉及“不变治疗”的含义。相同的医疗程序并不保证临床工作量相同。

一名患者可能需要额外监测、专科意见或护理关注,却不会产生明显的新理赔项目。另一名患者即使带有技术上有效的新增诊断,也可能接受相同的医疗服务。

有力的结论需要患者层面的证据。汇总支出和编码趋势无法清晰区分这些情况。

第五个局限是选择偏差。Blue Cross 早期研究发现,编码复杂度的大部分增长由相对较少的一组医院推动。

这种集中性可以支持有针对性的调查,但也警示不应将系统性标签套用于每一家使用 AI 文档工具的医院。

最具信息价值的比较应考察医疗机构在采用特定工具前后的情况。研究人员可以将这些医院与未部署相同技术的类似机构进行匹配。

他们还需要考虑患者构成、当地疾病趋势、编码规则变化以及住院和门诊医疗之间的流动。

独立审查应评估假阳性以及漏诊。一套能捕捉更多真实病情的系统会增加成本,同时可能改善记录质量。

供应商的透明度同样重要。医院和保险公司应了解是什么证据触发了一项建议、哪个模型版本生成了该建议,以及是否有人修改输出结果。

审计轨迹可以将 AI 建议与最终经临床医生批准的文档记录区分开来。它们还可以揭示,某些提示是否持续将理赔推入支付更高的分组。

模型表现应以支付结果衡量,而不仅是编码准确性。某种工具可以符合编码指南,却系统性地增加临床影响有限病情的报销。

保险公司的算法同样应接受审查。一个支付系统可以正确识别统计异常值,却错误惩罚治疗异常复杂患者群体的医院。

这种不确定性并不意味着 9.42 亿美元无关紧要。它界定了这个数字实际代表的含义。

它是与更高编码强度相关的 Blue Cross 新增支出估算,而非已核实的欺诈、不必要治疗或伪造诊断总额。

这种审慎的表述很重要,因为仓促结论可能固化为自动化政策。在独立证据确定哪些理赔缺乏支持之前,保险公司可能实施广泛削减。

同样,医院也可能利用这种模糊性,避免调查那些持续最大化报销的编码系统。两种反应都将保护机构利益,而非患者利益。

最有力的解读介于这两个极端之间。AI 使临床文档记录更加详尽,而支付系统也为这些新增细节赋予了可观价值。

其中一部分价值反映了真实的复杂性,一部分可能反映此前未申报的诊断,还有一部分可能来自财务影响超过其临床重要性的编码。

尚未解决的问题是,每一类各占多少。公开证据尚未提供这种划分。

三个信号将揭示 AI 编码是否在未改善医疗服务的情况下推高成本

下一阶段应以可审计的证据取代相互对立的汇总主张,将每项诊断、AI 建议和支付变化联系起来。

第一个信号是,保险公司是否会在充分保护隐私的前提下公布患者层面的验证研究。这些研究应将理赔与病历对比,并记录新增病情是否影响治疗、监测或资源使用。

仅靠理赔趋势将使辩论持续两极分化。经病历审核的样本可以估算 AI 支持的编码有多少有效、无效或临床影响有限。

如果独立审核人员确认存在广泛的支付增加,却没有相应的临床证据支持,Blue Cross 关于医院 AI 编码的论点将大大增强。如果大多数诊断满足明确标准并影响医疗服务,医院的立场则会获得支持。

第二个信号是合同和支付政策如何变化。保险公司可能引入有针对性的审计、要求为次要诊断提供更有力的证据,或修订主要基于孤立实验室数值识别出的病情的报销方式。

医院很可能会挑战自动折减 AI 辅助文档记录的规则。编码不应仅因软件协助找到支持其证据而失效。

最可信的政策将聚焦文档质量和临床影响。对使用特定工具的机构施加一刀切处罚,会混淆方法与结果的准确性。

应关注付款方是否披露哪些病情会触发审查,以及服务提供者是否收到易于理解的解释。不透明的削减将重现保险公司在医院自动化中指出的同类问责问题。

拒赔、申诉和支付延迟的增加,将表明 AI 军备竞赛正在加剧。有争议理赔的减少,则意味着更清晰的标准正在形成。

第三个信号是,监管机构是否为付款方和服务提供者算法建立共享审计要求。双方都应保留模型版本、建议、人工批准以及推翻输出结果的理由。

监管机构无需认定 AI 辅助编码本身可疑。它们需要的是证据,证明自动化建议仍可追溯并接受有意义的审查。

共享标准也有助于比较供应商表现。医院可以衡量某个产品提出缺乏支持的诊断的频率,而保险公司则可以衡量其自身系统的不当降码行为。

公开报告应区分若干结果,包括更准确的文档记录、更高的报销、额外的临床工作、被推翻的拒赔决定以及已确认的编码错误。

将这些结果合并为单一效率评分会掩盖其中的权衡。一种工具可以减少文书工作,却增加支出或争议。

医院还应监测 AI 建议是否集中在会带来大额支付变化的编码上。以完整性为优化目标的模型,不应表现得像一台收入最大化引擎。

保险公司则应审查其审核是否针对真正的异常情况,还是仅仅在逆转已有记录支持的复杂性。高拒赔量并不等同于高支付准确性。

患者和雇主需要更清楚地了解成本究竟流向何处。保险公司支出的增加,可能会转化为保费、自付费用、雇主预算或合同谈判中的压力。

医院付款下降也可能影响人员配置、服务和就医可及性。任何一方都不能声称,自己偏好的财务结果必然会让患者受益。

核心教训是,AI 已将医疗文档转变为一种积极发挥作用的经济工具。它能够比人工团队更快地从病历中提取更多信息,并将这些信息与支付后果挂钩。

Blue Cross 的估算为这场冲突提供了一个醒目的数字,但长期问题在于治理:谁来核实新增诊断,谁来衡量其临床相关性,又有谁能够对机器辅助决策提出申诉?

读者应关注能够回答这些问题的证据,而不是又一轮仅基于汇总索赔数据的相互指控。决定性检验在于,医院和保险公司能否在不再增加一层不透明自动化审核机制的前提下,将更高付款与有据可查的患者需求联系起来。

在这些证据出现之前,应将 9.42 亿美元视为一个可信的警示信号,而非最终裁决。请关注新的病历验证研究、合同变化以及联邦审计规则。这些发展将表明,AI 究竟是在纠正不完整的记录、放大收费激励,还是同时在做这两件事。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page