top of page

Blue Cross 的 AI 医院计费主张为自动化标出 9.42 亿美元代价

9月27日
讀畢需時 14 分鐘

Blue Cross Blue Shield 表示,AI 医院计费在 2024 年和 2025 年为其会员增加了 9.42 亿美元医疗支出。该保险集团将这笔增长归因于理赔中更多患者被描述为医疗情况复杂,尽管其发现相应治疗的变化很小。

这与医疗行业对 AI 的核心承诺形成鲜明反转。自动化本应减少文书工作和行政浪费,如今同样的技术却帮助医疗服务提供方发现更多诊断,而保险公司则构建自动化系统来质疑由此产生的理赔。

医院强烈反对保险集团的解读。它们表示,患者年龄更大、病情更重,复杂程度较低的医疗服务已转移至医院外,而更完善的记录则捕捉到了临床医生过去漏掉的合理病情。

现有证据无法平息这一分歧。Blue Cross Blue Shield Association(BCBSA)分析的是理赔数据,而非完整病历。其发现确立了一种成本高昂的模式,但并不能证明 AI 导致了每一项诊断,或由此产生的账单存在不当之处。

更重要的故事在于软件背后的激励机制。即使记录中的治疗几乎没有变化,一项次要诊断也可能将一次住院划入报销更高的类别。

这造成了一场自动化竞赛,而患者、雇主、纳税人、医院和保险公司都在为结果买单。

Blue Cross 在 AI 医院计费中发现了什么

BCBSA 表示,医院理赔的复杂程度上升速度远快于同时记录的医疗服务。

该协会审查了从 2023 年初至 2025 年底提交给 Blue Cross 和 Blue Shield 公司的住院理赔。其计费分析比较了诊断编码变化与记录治疗变化之间的关系。

按医疗情况复杂计费的住院病例占比,从 2023 年初约 37% 上升至 2025 年末的 40%。按百分比看,这一变化似乎不大,但其支付影响会在数千次住院中累积。

BCBSA 估计,编码强度上升使其成员公司在 2024 年和 2025 年多支付了 9.42 亿美元。该比较以 2023 年的编码模式为基准。

编码强度指的是一份理赔中出现多少诊断,以及这些诊断使患者看起来有多严重。更高的强度可能将一次住院归入更昂贵的报销类别。

估计增额中约 6.53 亿美元来自次要诊断。这些是在患者住院主要原因之外一并记录的病情。

由于这些次要病情,超过 55,000 个额外病例被归入更高严重程度类别。据详细的理赔报道,每个额外复杂病例的平均新增报销额约为 11,800 美元。

这一支付机制称为诊断相关组,通常简称 DRG。它对住院病程进行分类,并部分根据预期临床复杂程度确定报销金额。

重大并发症可将理赔转入更高的 DRG 层级。该更高层级假定患者需要更多资源、监测或治疗。

AI 编码系统可以扫描化验结果、医师记录和电子病历,寻找支持更复杂分类的病情。环境记录助手也可以捕捉临床对话中的细节,并将其转化为结构化记录。

BCBSA 表示,超过 60% 的医院系统如今使用 AI 赋能技术处理包括记录和编码在内的任务。这种采用使医院能够更快找出病历中每一项可能计费的病情。

该保险集团关注的是,高严重度编码是否对应不同的医疗服务。它表示,预期中的治疗变化往往并未出现。

BCBSA 产品与数据科学高级副总裁 Luke Chalker 围绕这一差距阐述了问题。他认为,如果患者确实病情更重,数据应显示出额外治疗。

一个例子涉及大型肠道手术。研究期间,最高复杂程度理赔的占比从 10.2% 上升至 22.7%。

与此同时,非复杂病例的占比从 36.6% 降至 32.8%。BCBSA 将这些变化与近 6,100 万美元的增量支出联系起来。

贫血、部分肠梗阻和酸中毒等病情更频繁地作为次要诊断出现。其中一些可通过单项化验数值识别,因此很容易成为自动化病历审查的目标。

然而,BCBSA 没有发现被编码为贫血的患者在输血等干预措施上有相应增长。这种不匹配支持其主张,即记录的变化超过了治疗的变化。

这一结论仍是保险公司对自身支付数据的分析。尽管如此,它为此前大多停留在轶闻层面的担忧给出了一个异常具体的数字。

为什么多一项诊断就能改变账单

AI 无需虚构疾病即可提高报销金额。它只需发现一项会改变支付类别的病情。

这一区别很重要,因为“AI 过度编码”一词可能让人以为诊断是捏造的。实际机制更为微妙,也更难评估。

一份医院病历所含信息远多于最终理赔。它可能包括化验结果、用药、临床医生观察、病史以及多个科室的细节。

人工编码员必须决定哪些病情符合编码规则并影响报销。遗漏一项有依据的诊断,可能让本应获得的合理支付未被申报。

AI 工具扩大了这一搜索范围。它们可以一致地审阅大量病历,标记相关数值,并在理赔送达保险公司前建议编码。

设想一名因肠道手术住院的患者。手术是此次住院的主要原因,但病历中可能还显示其钠水平偏低。

如果该结果根据编码规则支持一项次要诊断,该诊断就可能提高病例的记录严重程度,并将住院归入报销更高的 DRG。

手术本身没有改变。患者的住院时长也可能没有改变。改变的是财务分类。

这并不自动意味着诊断为假。一项病情即使在住院期间不需要重大干预,也可能在临床上真实存在。

这正是争议的核心。BCBSA 将稳定的治疗模式视为证据,认为记录的复杂程度已超过具有实际意义的临床变化。

医院则回应称,报销应反映临床医生所管理、监测或考虑的全部病情。单凭治疗量未必能反映这项工作。

这场争论也延伸至自主医疗编码之外。环境记录系统会在临床接诊期间监听,并生成供临床医生审核的记录草稿。

这些系统承诺减少打字和下班后的工作量。它们也会捕捉更多临床医生所说的内容,包括较旧、较简短的记录可能遗漏的病情。

因此,更完整的记录可以提高准确性,同时增加支出。这两种结果并不相互排斥。

较早前由 BCBSA 和 Blue Health Intelligence 发布的一项编码研究审查了产科住院中的类似模式。该研究发现,急性失血后贫血的诊断增加,但输血量并未按比例增长。

该分析估计,在其研究期间产科支出增加了 2,200 万美元。它还预测,更密集的编码将带来更广泛的住院和门诊成本风险。

9 月的分析将这种模式延伸至另一个临床类别和更晚的理赔期间。这种重复强化了 BCBSA 的担忧,但仍不能证明个别账单存在违规。

准确捕捉与不当过度编码之间的区别,取决于患者层面的证据。理赔数据可以显示医院申报了什么,以及保险公司记录了哪些程序。

理赔数据并不总能显示临床医生为何监测某项病情、它是否影响决策,或每一项编码是否符合适用标准。

要得出确切审计结论,需要完整病历、编码指导、临床医生的判断过程以及人工审核。BCBSA 尚未公开提供这种逐案验证层面的材料。

对于 AI 医院计费而言,这一验证缺口至关重要。自动化可以揭示被忽视的临床细节,但也可能围绕报销规则优化病历。

同一推荐引擎可以在一家医院内同时做到这两件事。其财务影响取决于员工如何验证建议,以及支付公式如何奖励这些建议。

医院称 Blue Cross 的 AI 主张忽视了病情更重的患者

医院认为,理赔复杂程度上升反映了患者、医疗场景和记录质量的真实变化。

American Hospital Association(AHA)否认有关医疗服务提供方 AI 工具不当地推动编码强度的指控。其立场早于最新的 9.42 亿美元估算。

在 2026 年 8 月发布的一份编码情况说明中,该协会称此类指控缺乏依据,并列举了复杂理赔增加的若干替代解释。

首先,住院患者群体已发生变化。人口老龄化和慢性病患病率上升,可能使医院治疗同时患有更多疾病的患者。

其次,许多较简单的手术已转移至门诊中心或医师诊所。因此,留在医院的患者构成了更复杂的群体。

第三,编码指南和记录实践仍在不断演变。即使基础人群只是逐步变化,更具体的记录也可能提高所衡量的病情严重度。

AHA 表示,医院使用 AI 时,人工验证仍必不可少。它还强调,医疗服务提供方仍负有提交准确编码的法律、伦理和合同责任。

其数据显示,2019 年至 2024 年间,医院支出增长的 19% 可归因于治疗病情更重、更复杂的患者。AHA 和 Vizient 的一项分析发现,医院病例组合指数在此期间上升约 5%。

病例组合指数衡量医院患者的相对临床复杂程度和预期资源使用量。较高的指数通常支持住院患者群体需要更密集医疗服务的说法。

这些数字并未直接反驳 BCBSA 关于肠道手术的发现。它们说明,复杂程度上升不能自动归因于软件。

BCBSA 的治疗比较也存在局限性。一些次要病情可能影响监测、临床判断、用药选择或出院规划,却不会产生一项重大的可计费程序。

贫血是一个有用的例子。输血是应对严重失血的一种方式,但并非每项贫血诊断都需要输血。

因此,稳定的输血率提出了一个合理问题,却无法给出最终答案。病历审核需要检验每项诊断是否符合编码要求。

医院也认为,更完善的文档记录纠正了历史上的编码不足。从他们的角度看,自动化有助于捕捉原本已发生、却未能在理赔申报中得到一致体现的工作。

这一说法本身也存在不确定性。旨在发现报销机会的工具,在财务上有动机偏向于会提高支付金额的诊断。

医院合规项目本应控制这一风险。然而,公开证据并未显示工作人员拒绝 AI 生成编码建议的频率。

因此,这场冲突不能被简化为诚信医院与防御性保险公司之间的对立。双方都处在会奖励有利分类的支付体系中。

医院从被归类为复杂的病例中获得更多报销。保险公司则会在拒绝、下调或延迟这些分类时保留更多资金。

双方都可以将自身的自动化描述为提升准确性的工具,也都可以把对方的系统刻画为优化引擎。

这种对称性并不意味着应忽视 9.42 亿美元的估算。它意味着,在将该估算作为判断医院行为的结论之前,需要进行独立验证。

真正的冲突是医疗服务提供方 AI 对阵保险公司 AI

医疗 AI 成本问题正演变为一场财务目标相互对立的自动化系统之间的较量。

医院利用软件捕捉诊断信息、完善文档记录并维护报销权益。保险公司则使用算法审核理赔、识别异常、索取记录并减少支付。

技术并未创造这一根本冲突。数十年来,医院与保险公司一直围绕编码、医疗必要性和报销问题发生争议。

AI 改变的是这场冲突的速度、规模和经济性。一个系统可以生成更详细的理赔申报,另一个系统则可以在数百万份记录中对其提出质疑。

这解释了 Abridge 创始人 Shiv Rao 在讨论该争议时为何警告称会出现“机器人对抗机器人”。Abridge 向医疗机构销售环境式临床文档软件。

Rao 还认为,如果医疗服务提供方和保险公司能在开具账单前就证据达成一致,技术可以减少摩擦。这一乐观情景需要共同的规则和可互操作的记录。

现行体系提供的恰恰是相反的激励。医院会在文档支持更高严重程度理赔时获益;保险公司则会在自动化审核找到少付理由时获益。

AHA 指责商业保险公司进行自动化降码,即降低已提交理赔所对应的严重程度或支付金额。医院随后必须提出申诉,才能追回原有金额。

保险公司自身也因算法化保险覆盖决策而受到审查。患者和医疗服务提供方曾对被指建议拒赔或限制急性期后护理的系统提出质疑。

UnitedHealthcare 表示,其 AI 工具用于指导医疗服务,而非作出最终理赔决定。然而,公开争议表明,公众对保险公司自动化审核的信任极其有限。

BCBSA 9 月的表态进一步强化了这种分歧。Chalker 拒绝将其描述为势均力敌的战争,并称保险公司正在承受单方面的财务损失。

医院则会将同样的资金流动描述为针对已记录患者复杂性的适当报销。这是对同一批理赔申报无法兼容的两种解读。

无论哪一方占上风,行政负担都会加重。更详细的编码会招致更多付款方审查,进而带来更多文档请求和申诉。

每一项新的管控措施都可能引发另一种自动化应对。医院采用系统预测拒赔,保险公司部署系统识别激进编码,供应商则围绕双方进行优化。

患者很少看到这套机制,但他们为其埋单。保险公司支出的增加可能会转化为保费、雇主成本、税收和自付义务。

当激进审核延迟支付或延误获得医疗服务时,患者也可能受到伤害。如果削减阻碍了适当治疗,一份更便宜的理赔申报并不代表更好的结果。

这也是为什么不应将 9.42 亿美元这一数字解读为 AI 的总成本。它衡量的是某个保险公司团体对编码强度变化所导致住院支出增加的估算。

它不包括付款方审核系统、医疗服务提供方申诉、软件合同、合规团队或报销延迟的成本,也未计入减少文档工作可能带来的节省。

净经济影响仍然未知。AI 可能减少文书劳动,却同时增加通过报销体系争议的资金规模。

对于医疗机构而言,治理必须超越模型准确性。管理者需要记录哪个系统建议了某个编码、哪些证据支持该编码,以及由谁批准。

一个可搜索的知识库可以帮助技术团队保存政策、评估和审计决策。医疗系统还需要专门为受保护临床信息设计的管控措施。

如果没有可追溯的决策,医疗服务提供方和保险公司都无法区分自动化错误与蓄意优化。这会使每一场争议都更缓慢、成本更高。

9.42 亿美元估算未能证明什么

该分析揭示了一项重要关联,但并不能证明 AI 导致了每一笔新增成本,或医院存在欺诈性收费。

BCBSA 将三项趋势联系起来:更广泛的 AI 采用、更高的编码强度,以及部分选定治疗指标变化有限。这些因素共同构成了 AI 辅助计费增长的一种合理解释。

然而,在快速采用期间观察到的相关性并不是直接的因果证据。在同一时期,医院还改变了人员配置、工作流程、编码指导、患者构成和护理场景。

该分析还使用了理赔数据。这些记录是为支付而设计的,并非用于还原患者住院期间作出的每一项临床判断。

BCBSA 可以看到诊断、操作和承保服务,但可能看不到影响观察、风险管理、用药或出院计划的每一项细节。

与治疗的比较仍然具有价值。当明显相关的干预措施保持不变或下降时,严重诊断的大幅增加应当引发审查。

但没有任何单一治疗能够完全验证一项诊断。仅凭输血率,无法判断每一项贫血编码是否正确。

9.42 亿美元是相对于基线的估算,而不是已确认多付款项的账本。它代表的是在较早编码模式下,支出可能处于的水平。

该基线同样包含一项假设:它将 2023 年的编码强度视为恰当的参照点,而非一个存在遗漏或文档记录不完整的时期。

如果较早的理赔申报遗漏了有效病情,后续增长可能部分反映了准确性的提升。如果 AI 鼓励了证据薄弱的诊断,同样的增长则可能反映了过度编码。

两种效应可能同时发生。公开数据尚未将它们区分开来。

该分析还聚焦于包括重大肠道手术在内的若干选定案例。读者不应假定同样的模式会同等适用于每一种医院服务。

医院在患者群体、编码实践、软件部署和人工审核方面存在差异。平均值既可能掩盖负责任的采用,也可能掩盖激进的异常值。

BCBSA 此前的产科分析发现,复杂性增长最快的医院推动了所观察到增长中的很大部分。这种集中性表明,监管应针对特定模式,而不应将所有 AI 使用一概而论。

独立研究人员需要获得与理赔申报和模型建议相连的去标识化患者病历。他们还需要一致的标准,以判断次要诊断是否影响了护理。

医院和付款方应披露对 AI 生成建议的拒绝率和修正率。一个建议经常被删除的系统,与一个很少受到质疑的系统呈现出不同的风险。

他们还应报告,采用这些系统是否改变了申诉率、支付延迟、临床医生工作量和行政总支出。一个部门的节省可能会成为其他部门的成本。

医生的采用使这项工作愈发紧迫。这项2026 年医生调查发现,专业人员已在文档记录、研究及其他工作流程中广泛使用 AI。

随着生成式笔记成为常态,文档记录将变得更加结构化和完整。围绕诊断细节建立的支付体系将对这些新增信息作出反应。

悬而未决的问题是,报销规则能否区分具有临床意义的复杂性与机器发现的编码机会。现有证据表明,这一区分仍然困难。

三个信号将显示 AI 医院计费是否持续推高成本

下一阶段取决于独立病历验证、保险公司的反制措施,以及决定额外文档价值的支付规则。

第一个信号是对理赔申报、完整临床记录和 AI 建议进行患者层面审计。这将检验新增诊断是否有临床依据,以及是否与护理相关。

如果独立审查人员确认存在广泛的无依据编码,BCBSA 的论点将显著加强。医院将面临收紧验证流程和披露供应商表现的压力。

如果大部分诊断被证实有效,争议将转向报销设计。届时,保险公司面对的将是更完整的文档记录,而非系统性的过度计费。

第二个信号是保险公司的回应。BCBSA 表示,其正在利用数据识别高码模式,并为部署 AI 工具的医院制定预期要求。

更多自动化审计、文档请求或付款削减,将显示保险公司正在升级这场较量。申诉量上升则表明,自动化正在增加行政摩擦。

更具建设性的回应将涉及共同证据标准。医疗服务提供方和付款方可以在理赔进入申诉流程前,就哪些临床信号支持特定次要诊断达成一致。

第三个信号是 DRG 和编码政策的变化。现行报销公式可能使一项额外诊断在财务上具有决定性作用。

监管机构和标准制定组织可以针对将病例划入更高严重程度组别的病情,要求更有力的文档记录。他们也可以研究对增量编码敏感度更低的支付模式。

将更高报销与可衡量资源使用相联系的政策变化,将削弱最大化诊断捕捉的激励。仅着眼于限制编码的规则,则可能导致对合法的复杂护理支付不足。

这些信号的走向将比又一次供应商公告更重要。核心问题已不再是医院和保险公司是否会使用 AI。

它们已经在使用。问题在于,它们的系统是改善共享的护理记录,还是围绕彼此的支付逻辑进行优化。

BCBSA 提出了一个意义重大的警示,而非最终裁决。其 AI 医院计费分析表明,即使可见治疗保持稳定,自动化也可能推高支出。

医院提出了另一种可信解释,包括住院患者病情更重、文档记录改善以及护理场景变化。这一解释同样需要独立验证。

对于患者和雇主而言,结果不能以哪一方赢得更多理赔为衡量标准。一个有用的系统必须在为必要护理准确付费的同时,降低总体行政成本。

眼下的检验是透明度。医疗机构应要求 AI 建议可追溯、人工审核有记录,并能衡量其对理赔和结果的影响。

如果缺少这些控制措施,机器人彼此对抗将成为默认的业务流程。届时,9.42 亿美元的估算看起来就不再像一场孤立的计费纠纷,而更像是一张早期账单。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page