Blue CrossのAI病院コーディング請求、9億4,200万ドルをめぐる論争に
Blue CrossのAI病院コーディング請求は現在、病院と保険会社の対立が広がるなかで、9億4,200万ドルの追加支出を争点の中心に据えている。Blue Cross Blue Shield Associationは、請求データに診療内容の対応する変化が見られない場合でも、より詳細な記録によって2024年と2025年の支払い額が増加したとしている。
この論争は、単に請求コードが正しいかどうかをめぐるものではない。患者の状態に関するデジタル記録を誰が管理するのか、その記録にどれほどの価値があるのか、そして請求データで記録の改善と便乗的な請求を区別できるのかが問われている。
病院側は、自動コーディングツールが従来見落とされていた病態を臨床医が記録する助けになると述べる。保険会社側は、同じツールが単発の検査結果や副次診断を高額な請求へと変換しかねないと主張する。双方は相手の判断に異議を唱えるためにもAIを導入しており、あらゆる診療行為をめぐる管理業務の軍拡競争を生み出している。
Blue CrossのAI病院コーディング請求、9億4,200万ドルに焦点
Blue Crossは、コスト増は請求に記録された治療の目に見える変化ではなく、記録パターンの変化によるものだとしている。
同協会は9月24日、最新の請求分析を公表した。Blue Cross Blue Shield各社の匿名化済み請求データを調べ、2024年および2025年の病院コーディングを2023年の基準値と比較した。
この分析では、コーディング強度の上昇により、参加するBlue Cross各社の支出が9億4,200万ドル増加したと推計している。コーディング強度とは、提供者が患者やサービスを、より複雑で支払い額の高い区分に分類する頻度を指す。
この総額のうち、同協会は6億5,300万ドルを副次的な病態の記録頻度の増加によるものとした。これは、入院の主因となった主診断と併せて記録される診断である。
Blue Crossによると、医学的に複雑と分類された入院症例の割合は、2023年初頭の37%から2025年末までに40%へ上昇した。増加分の約70%は、副次診断によって支払い区分が変更された5万5,000件超の追加症例に関係していた。
こうした支払い区分は、一般にDRGと呼ばれる診断関連群である。DRGは、診断、処置、合併症、予想される資源使用量に基づき、入院1件に対する定額の支払いを割り当てる。
対象となる合併症や併存疾患を追加すると、入院がより重症度の高いDRGへ移る場合がある。主な処置が変わらなくても、病院はより多くの償還を受けられる可能性がある。
これは、副次診断が自動的に虚偽となることを意味しない。患者には、以前の記録で捉えられていなかった正当な代謝異常、血液疾患、その他の病態がある場合がある。
Blue Crossの主張はより限定的だ。同社の分析では、複雑なコーディングの増加は、請求上で観察可能な治療の増加と一致していなかったとしている。
独立系報道によると、病院は既存の記録をスキャンし、見落とされた診断を探すソフトウェアを利用できる。アンビエント・スクライブは診療中の会話を聞き取り、臨床ノートの下書きを作成することもできる。
こうしたツールを組み合わせることで、検索可能な臨床テキストが増える。コーディングソフトウェアは、追加の診断コードを裏付ける検査値、症状、医師の記述を特定できるようになる。
請求書に記載された手術、投薬、処置を変更しなくても、その影響は財務面で大きくなり得る。より多くのデータが記録に加わり、記録上の患者はより複雑に見え、請求はより高額な支払い区分に移る。
Blue Crossは例の一つとして腸管手術を取り上げた。2023年第1四半期から2025年第4四半期にかけて、部分的腸閉塞のコーディングは報告上55%増加した。アシドーシスのコーディングは33%増加した。
同協会は、追加されたすべての診断が不正確だったとは主張していない。むしろ、記録上の変化が、臨床的に意味のある複雑性の同程度の増加を表しているのか疑問視している。
この区別は重要だ。9億4,200万ドルは保険業界団体による推計であり、病院が不正を行った、あるいは不要な治療を提供したという認定ではない。
この分析もまた、各病院のソフトウェアが何を推奨したかを直接確立することはできない。請求データには支払いのために提出されたコードとサービスが記録されるが、各モデルの出力や臨床医の判断過程は示されない。
したがって、この証拠は測定可能な請求の変化を裏付ける。ただし、AIがすべての変化を引き起こしたこと、診断が捏造されたこと、あるいは病院が不適切な支払いを受けたことを独立に証明するものではない。
それでも、この時期を踏まえるとAIを無視するのは難しい。病院は複雑なコーディングが増加する一方で、自動化された請求・記録業務を急速に拡大した。Blue Crossは現在、この相関を医療費負担に関する重大な問題として扱うよう求めている。
病院請求AIが支払い対象となる病態をより多く見つける理由
AIは、利用可能なあらゆる詳細から請求可能な診断を探すコストを低減することで、記録作成の経済性を変える。
従来の医療コーディングは、臨床医、記録作成の専門家、専門コーダーが患者記録を確認することに依存している。時間的制約のため、正当な病態が記録されなかったり、裏付けが不十分だったりする場合がある。
AI支援システムは、はるかに多くの資料を検査できる。医師のノート、検査結果、投薬歴、画像診断レポート、過去の受診記録から、認定済みの診断コードに関連する証拠を検索できる。
アンビエント・スクライブはもう一つの層を加える。臨床医と患者の会話をノートの下書きへ変換し、短い手書きの記録には残らない可能性のある詳細を保持できる。
その後、記録システムは、ある所見が診断に当たるかを臨床医に明確化するよう促せる。コーディングツールは、その完成したノートに裏付けられたコードを推奨できる。
病院はこれを正確性の向上と説明する。多忙な臨床医が当初の記録から病態を省いたとしても、患者の健康状態そのものが単純になるわけではない。
保険会社は別の可能性を見ている。ソフトウェアは、ある病態がその入院中に提供された診療に実質的な影響を与えなかった場合でも、考え得るあらゆる合併症を特定できる。
支払い制度は、その意見の相違に金銭的な力を与える。多くの病院への支払いは、実施された各行為の明細請求ではなく、記録された複雑性を反映する。
同じ主たる処置を受けた患者が2人いるとする。一方の請求には主診断だけが記載される。もう一方には、検査データを通じて見つかり、記録で明確化された対象となる合併症が含まれる。
コード化された患者がより多くの資源を必要とするように見えるため、2件目の請求はより高い支払いを受ける可能性がある。それでも請求には、類似した処置と治療が示されることがある。
これがBlue CrossによるAI病院コーディングの主張の仕組みだ。AIはサービスを捏造したり、支払いルールを変更したりする必要はない。既存の償還区分の境界を越える症例記録を見つければよい。
この技術は、すでにそのような境界で満ちた制度に導入された。病院には、現代的な機械学習が登場するずっと前から、複雑性を記録する金銭的な動機があった。
過去の請求パターンに関する研究は、その歴史を裏付けている。5州を対象とした研究では、最も高い強度の病院分類は2011年から2019年にかけて41%増加し、研究者らは予想される増加率を13%と推計した。
その研究は、コーディングの変化を、2011年の慣行と比較して146億ドルの2019年の病院支払い増加と関連付けた。研究者らは、正確な記録と不適切なアップコーディングを区別するには、さらなる研究が必要だと注意を促した。
したがってAIは、まったく新しい動機を生み出すのではなく、既存の動機を加速させる。より具体的または重症度の高いコードを裏付ける証拠を見つけるコストを下げるのである。
導入データは、この問題が急を要するものとなった理由を示している。連邦病院調査では、回答した病院の71%が、2024年に電子健康記録と統合された予測AIを使用していた。
2023年の割合は66%だった。すでに予測AIを使っていた病院では、請求の自動化が最も急速に拡大した用途の一つだった。
請求を簡素化または自動化するための予測AI利用は、2023年の36%から2024年には61%へ増加した。この25ポイントの増加は、治療推奨で報告された伸びを上回った。
大規模病院および病院システムに属する病院は、小規模な独立施設よりもこれらの技術を導入する頻度が高かった。2024年には、複数病院システムの加盟病院の86%が予測AIの利用を報告したのに対し、独立病院では37%だった。
この格差により、AIを多くの拠点に展開できる組織に、コスト削減と財務上の影響の双方が集中する可能性がある。システム全体で導入されたコーディングのワークフローは、数千件の請求に影響を及ぼし得る。
ただし、この連邦調査は予測AIを広く対象としている。特定の病院が、争点となっている特定のBlue Cross請求にAIコーディングツールを使ったことを証明するものではない。
調査と請求分析は異なる問いに答えている。一方は急速な導入を記録し、もう一方はコーディングと支出の変化を測定する。
両者を結び付ければもっともらしい説明になるが、完全な因果監査にはならない。因果関係を確立するには、ソフトウェアの導入日、モデルの推奨、診療記録、臨床医の承認、実際に使用された資源に関する情報が必要となる。
この欠けている証拠こそが、対立の中心にある。保険会社は膨大な請求データセットを保有する一方、病院は各診断を検証できる臨床記録を保有している。
どちらか一方だけでは、全体像を持っていない。AIは、記録の利用可能な側面を巨大な規模で処理できるため、この情報の非対称性をより重大なものにしている。
病院と保険会社は請求の対立する側面を自動化している
主要な対立はAI対人間の判断ではない。病院の収益最適化と保険会社の支払い管理の対立である。
病院は、支払い拒否、記録提出の要求、支払い遅延、事前承認の要件に何年も対応してきた後、この競争に参入した。ソフトウェアベンダーは、手作業を減らし、臨床記録に裏付けられた収益を回収すると約束している。
保険会社には、請求査定、支払いの適正性確認、不正検知、利用審査、支払い後監査のための独自システムがある。これらのツールは、裏付けのないコード、請求上の異常、補償ルールを満たさないサービスを探す。
病院のモデルは副次診断を推奨できる。保険会社のモデルは、その診断を審査対象としてフラグ付けしたり、支払いへの影響を除外したりできる。その後、病院のソフトウェアは同じ診療記録を使って異議申し立てを下書きできる。
その結果としてAIの循環が生じる。一つのシステムが請求を拡大し、別のシステムがそれに異議を唱え、第三のシステムが回答を組み立てる場合もある。
16州の大手保険会社93社を対象にした2025年の調査では、84%が少なくとも一つの業務目的でAIを利用していることが分かった。報告された用途には、請求査定、事前承認、利用管理が含まれる。
このAI軍拡競争の詳細な分析では、支払者と提供者の双方に向けて販売されるツールが確認された。保険会社向け製品は申請と請求を審査し、提供者向け製品は記録を集め、承認申請や異議申し立てを準備する。
この対称性は、保険会社による批判を複雑にする。保険会社自身も支払い判断の管理にアルゴリズムを使用している以上、自動化そのものが本質的に不適切だと簡単に主張することはできない。
病院側も、Blue Crossの調査結果を解決せずとも同じ指摘ができる。保険会社による自動化の物議を醸す利用が、病院で追加されたすべての診断を正当化するわけではない。
双方はそれぞれ、自らのAIを非効率性への対抗策として提示する。一方で、相手側のAIは財務上の利益を引き出すための手段として描かれがちだ。
患者はその両者の立場の間に置かれる。争点となるコードは、自己負担、保険料、病院の財務、そして請求の決着に必要な事務作業に影響し得る。
多くの雇用主が従業員向け医療給付の費用を負担しているため、彼らもリスクの一部を負う。認定される請求額が増えればプランのコストは上昇し、積極的な支払い削減は医療提供者ネットワークを圧迫しかねない。
当面の圧力は保険会社にかかる。請求に二次診断が恒常的に多く含まれるようになれば、過去の価格設定の前提は将来の医療支出を過小評価する可能性がある。
保険会社は、審査を厳格化し、契約を変更し、より多くの文書を求め、支払い監査を拡大することで対応できる。こうした措置は病院の事務負担を増やし得る。
病院が直面する圧力は異なる。複雑な医療に対する支払いを受けるために十分な詳細を記録しなければならない一方、ソフトウェアによって臨床記録を水増ししているように見えることは避けなければならない。
人によるレビューは安全策として機能するはずだ。AIツールが何を推奨したかにかかわらず、病院は自らの名義で提出されるコードについて責任を負い続ける。
しかし、人間の承認だけでは完全な答えにはならない。特にソフトウェアが実際のカルテデータに紐づいた洗練された説明を生成する場合、審査者は提案を容易に受け入れすぎる可能性がある。
ソフトウェアは、入院中に使用された資源との関係がほとんどない真の診断を抽出することもある。これは、臨床上の完全性と支払い上の関連性の間に対立を生む。
したがって病院は請求が正確だと主張できる一方で、保険会社はより高い償還額が経済的に正当化されないと主張できる。同じ支払い体系の下で、両方の主張がもっともらしく成立し得る。
Blue Crossは、追加治療がないことを、より高い複雑性が価値を加えなかった証拠として位置づけている。病院側は、請求データでは入院中のすべての臨床判断、監視要件、管理されたリスクを捉えられないと反論できる。
この不一致は、処置件数だけを数えても解決できない。一部の合併症は、個別に請求される介入を伴わずとも、より綿密な監視を必要とする。
逆に、検査値の異常があるからといって、患者に実質的により多くのケアが必要だったとは限らない。自動化システムは、境界的な所見を正式な診断へ転換することをはるかに容易にし得る。
この技術は、未解決の政策課題を浮き彫りにした。観察可能な治療がほぼ同じでも、記録がより完全になれば支払いは増えるべきなのか。
現行のDRGルールは、追加の状態がコーディング要件を満たす場合、しばしば「増えるべきだ」と答える。保険会社は、臨床的影響や資源使用に基づく第二の判定基準をますます求めている。
そうなれば、争点はコードの有効性から関連性の証拠へ移る。また、双方が現在提示しているものより透明性の高いルールも必要になる。
9億4,200万ドルの推計が証明していないこと
保険会社の分析は深刻なパターンを示しているが、その公開された証拠だけでは、追加されたすべての診断をAI生成のアップコーディングと見なすことは正当化できない。
第一の限界は帰属に関するものだ。Blue Crossは、病院におけるAI導入が拡大した期間にコーディング強度が上昇したことを確認した。
この関連性は重要だが、複数の要因が同時に動く可能性がある。患者の重症化、記録ルールの変更、比較的軽度な医療の病院外への移行などだ。
日常的な症例が外来へ移ると、入院患者はより医学的に複雑な集団になる可能性がある。この変化は、操作がなくても平均的なコーディング重症度を高め得る。
American Hospital Associationは、その病院側の回答でこの主張を展開している。高齢化、慢性疾患、医療提供場所の変化、コーディングガイドラインの変更も、記録される重症度に影響するとしている。
同団体は、臨床医がコードの検証責任を負い続ける一方で、AIは記録の精度を高め得ると主張している。また、保険会社自身の財務上のインセンティブと、物議を醸すコーディング慣行にも言及している。
この反論はBlue Crossのデータを無効にするものではない。請求データだけの分析では、原因としてのソフトウェアを決定的に切り分けられない理由を示している。
第二の限界は臨床記録に関するものだ。分析について公表された説明は、請求、コーディング分類、治療パターンを重視している。
請求は支払い事務のために設計されている。完全な患者カルテではなく、二次的な状態がなぜ重要だったのかを説明する臨床的判断が欠ける場合がある。
公正な監査では、コードを完全な記録と照合する必要がある。診断基準が満たされたか、臨床医が診断を承認したか、その状態がケアに影響したかを問うべきだ。
第三の限界は基準値に関するものだ。9億4,200万ドルの推計は、2024年と2025年のパターンを2023年と比較している。
この手法は変化を定量化するが、2023年が自動的に正しい記録水準を表すわけではない。従来の記録では、手作業のワークフローで見落とされた有効な診断が記載されていなかった可能性がある。
AIが体系的な記録不足を修正するなら、一部の支払い増加は新たな無駄ではなく、遅れて実現した正確性を表す。経済的コストは増えるが、請求はより完全になる。
第四の限界は、治療が変わらないことの意味に関するものだ。同じ処置であっても、臨床上の作業負荷が同じとは限らない。
ある患者は、明白な新たな請求項目を発生させずとも、追加の監視、専門医の関与、看護上の注意を必要とする場合がある。別の患者は、技術的には有効な追加診断を伴いながらも、同じケアを受けることがある。
強い結論には患者レベルの証拠が必要だ。集計された支出とコーディングの傾向だけでは、こうした状況を明確に区別できない。
第五の限界は選択性だ。Blue Crossによる先行研究では、比較的少数の病院が複雑なコーディング増加の大部分を牽引していたことが判明した。
この集中は、対象を絞った調査を支持し得る。同時に、AI記録ツールを使用するすべての病院にシステム全体のレッテルを貼ることへの警告でもある。
最も有益な比較は、特定ツールの導入前後で施設を調べることだろう。研究者は、それらの病院を同じ技術を導入していない類似施設と比較できる。
また、患者構成、地域の疾病傾向、コーディングルールの変更、入院医療と外来医療の間の移行も考慮する必要がある。
独立したレビューでは、見落とされた診断だけでなく偽陽性も評価すべきだ。より多くの実在する状態を捉えるシステムは、費用を増やしながら記録品質を改善する可能性がある。
ベンダーの透明性も同様に重要だ。病院と保険会社は、どの証拠が推奨を引き起こしたのか、どのモデルバージョンがそれを生成したのか、人が出力を変更したかを把握すべきである。
監査証跡によって、AIの提案と最終的に臨床医が承認した記録を分けられる。特定のプロンプトが一貫して請求をより高額な支払いグループへ誘導しているかも明らかにできる。
モデル性能は、コーディング精度だけでなく支払いの観点でも測定すべきだ。あるツールはコーディングガイドラインに適合しながら、臨床的影響が限定的な状態について償還額を体系的に増やす可能性がある。
保険会社のアルゴリズムも同じ精査に値する。支払いシステムは統計的な外れ値を正しく検知できても、異例に複雑な患者集団を治療する病院を誤って不利益に扱う可能性がある。
この不確実性は、9億4,200万ドルという数字を無意味にするものではない。それは、その数字が実際に何を表しているかを定義する。
これは、より高いコーディング強度に関連するBlue Crossの追加支出の推計である。不正、不必要な治療、または捏造された診断の検証済み総額ではない。
この慎重な位置づけは重要だ。早すぎる結論は自動化された政策として固定化される可能性がある。保険会社は、独立した証拠がどの請求に裏付けがないかを特定する前に、広範な減額を適用するかもしれない。
同様に病院は、この曖昧さを利用して、償還額を一貫して最大化するコーディングシステムの調査を避ける可能性がある。どちらの対応も、患者ではなく組織の利益を守ることになる。
最も妥当な解釈は、その両極端の間にある。AIは臨床記録をより網羅的にし、支払いシステムはその新たな詳細に大きな価値を割り当てている。
その価値の一部は真の複雑性を反映する。一部はこれまで請求されなかった診断を反映している可能性が高く、また一部は財務上の影響が臨床的重要性を上回るコードを反映している可能性がある。
未解決の問題は、それぞれがどれほどの割合を占めるのかだ。公開されている証拠は、まだその内訳を示していない。
AIコーディングがケアの改善なしにコストを押し上げているかを示す3つのシグナル
次の段階では、競合する集計上の主張に代えて、各診断、AIの推奨、支払い変更を結びつける監査可能な証拠が必要となる。
第一のシグナルは、保険会社が適切なプライバシー保護を備えた患者レベルの検証研究を公表するかどうかだ。こうした研究では、請求を医療カルテと比較し、追加された状態が治療、監視、または資源使用に影響したかを記録すべきである。
請求傾向だけでは、議論は分断されたままだろう。カルテをレビューした標本なら、AI支援コードが有効、無効、または臨床的に周辺的である頻度を推定できる。
独立した審査者が、裏付けとなる臨床的証拠なしに支払いが広範に増加していることを確認すれば、Blue CrossによるAI病院コーディングの主張は大幅に強まる。大半の診断が明確な基準を満たし、ケアに影響しているなら、病院側の立場が支持される。
第二のシグナルは、契約と支払い方針がどのように変化するかだ。保険会社は、対象を絞った監査を導入し、二次診断についてより強い証拠を求め、主に単独の検査値を通じて特定された状態の償還を見直す可能性がある。
病院は、AI支援による記録を自動的に割り引くルールに異議を唱える可能性が高い。ソフトウェアが裏付けとなる証拠の発見を支援したというだけで、コードが無効になるべきではない。
最も信頼できる方針は、記録の質と臨床的影響に焦点を置くものだ。特定ツールを使用する施設に対する一律の罰則は、手法と結果の正確性を混同することになる。
支払者がどの状態でレビューが始まるかを開示するか、医療提供者が理解可能な説明を受け取るかに注目すべきだ。不透明な減額は、保険会社が病院の自動化に見いだしているのと同じ説明責任の問題を再現する。
却下、異議申し立て、支払い遅延の増加は、AIの軍拡競争が激化していることを示す。争点となる請求が減少すれば、より明確な基準が定着していることを示唆する。
第三のシグナルは、規制当局が支払者と医療提供者のアルゴリズムに共通の監査要件を設けるかどうかだ。双方は、モデルバージョン、推奨、人による承認、出力を上書きした理由を保存すべきである。
規制当局が、AI支援コーディングは本質的に疑わしいと判断する必要はない。自動化された推奨が追跡可能であり、有意義なレビューに開かれている証拠が必要なのだ。
共通基準はベンダー性能の比較にも役立つ。病院は製品が裏付けのない診断を提案する頻度を測定でき、保険会社は自社システムによる不適切なダウンコーディングを測定できる。
公開報告では、複数の結果を区別すべきである。より正確な記録、より高い償還、追加の臨床作業、覆された却下、確認されたコーディングエラーなどが含まれる。
これらの結果を一つの効率性スコアにまとめれば、トレードオフが隠れてしまう。ツールは事務作業を減らす一方で、支出や争議を増やす可能性がある。
病院は、AIの推奨が支払い額を大きく変動させるコードに集中していないかも監視すべきだ。完全性を重視して調整されたモデルが、収益最大化エンジンのように振る舞うべきではない。
保険会社は、自らの審査が真の異常を対象としているのか、それとも文書化された複雑性を単に覆しているだけなのかを検証すべきだ。否認件数の多さは、支払いの正確性が高いことの証拠ではない。
患者や雇用主には、コストがどこへ移るのかについて、より明確な説明が必要だ。保険会社の支出増は、保険料、自己負担、雇用主の予算、あるいは契約交渉に波及し得る。
病院への支払い減少は、人員配置、提供サービス、医療へのアクセスにも影響し得る。どちらの側も、自らに都合のよい財務上の結果が自動的に患者の利益になるとは主張できない。
中心的な教訓は、AIが医療文書を能動的な経済的手段へと変えたことだ。AIは人間のチームより速く診療記録から多くの情報を抽出し、その情報に支払い上の影響を結び付けることができる。
Blue Crossの推計はこの対立に見出しとなる数字を与えたが、長期的な論点はガバナンスにある。追加された診断を誰が検証するのか、その臨床的な関連性を誰が測定するのか、そして機械支援による判断に誰が異議を申し立てられるのか。
読者が注目すべきなのは、集計ベースの請求に依拠した新たな非難の応酬ではなく、こうした問いに答える証拠だ。決定的な試金石は、病院と保険会社が、自動化された審査という不透明な層をさらに生み出すことなく、支払い増を文書化された患者ニーズに結び付けられるかどうかである。
その証拠が示されるまでは、9億4,200万ドルを最終判断ではなく、信頼できる警告シグナルとして扱うべきだ。新たな診療記録検証研究、契約変更、連邦監査ルールを追う必要がある。そうした展開が、AIが不完全な記録を是正しているのか、請求インセンティブを増幅しているのか、あるいはその両方を同時に行っているのかを示すだろう。



