top of page

Blue Cross、AI病院請求で自動化コスト9億4,200万ドルと主張

9月27日
読了時間: 19分

Blue Cross Blue Shieldは、AIを使った病院請求により、2024年から2025年にかけて加入者の医療費が9億4,200万ドル増加したと述べている。同保険グループは、治療内容にほとんど対応する変化が見られないにもかかわらず、より多くの患者が医学的に複雑であると記載された請求が増えたことを、その要因としている。

これは、ヘルスケア業界におけるAIの中核的な約束を鮮やかに覆すものだ。自動化は、書類業務と管理上の無駄を減らすはずだった。ところが現在、同じ技術が医療提供者による追加診断の発見を支援し、その結果生じた請求に異議を唱えるため、保険会社は自動化システムを構築している。

病院側は、保険グループの解釈に強く異議を唱えている。患者は高齢化・重症化しており、比較的複雑でない医療は病院外へ移行し、より良い文書化によって従来は臨床医が見落としていた正当な病態を把握できるようになった、と病院側は主張する。

証拠だけでは、この対立に決着はつかない。Blue Cross Blue Shield Association(BCBSA)は完全な患者カルテではなく、請求データを分析した。その調査結果はコストの大きい傾向を示しているが、AIがすべての診断を引き起こしたことや、その請求が不適切だったことを証明するものではない。

より重要なのは、このソフトウェアを取り巻くインセンティブ構造だ。治療内容の記録がほとんど変わらなくても、二次診断が1件加わるだけで、入院がより高額な支払い区分に移る可能性がある。

その結果、患者、雇用主、納税者、病院、保険会社がその帰結を負担する、自動化をめぐる競争が生まれている。

Blue CrossがAI病院請求で見つけたこと

BCBSAによると、病院の請求は、そこに記録された医療内容よりもはるかに速いペースで複雑化している。

同協会は、2023年初頭から2025年末までにBlue CrossおよびBlue Shield各社へ提出された入院請求を調査した。請求分析では、診断コーディングの変化と、記録された治療の変化を比較した。

医学的に複雑として請求された入院症例の割合は、2023年初頭の約37%から2025年後半には40%へ上昇した。割合としては小さく見えるが、支払いへの影響は数千件の入院にわたって積み重なる。

BCBSAは、コーディング強度の上昇により、加盟各社が2024年と2025年に支払った額が9億4,200万ドル増加したと推定した。この比較では、2023年のコーディング傾向を基準としている。

コーディング強度とは、請求に含まれる診断数と、それらの診断が患者をどれほど重症に見せるかを指す。強度が高まると、入院がより高額な償還区分に入る場合がある。

推定された増加額のうち約6億5,300万ドルは、二次診断に由来する。これは、入院の主たる理由と併せて記録される病態だ。

こうした二次病態により、5万5,000件超の追加症例がより重症度の高い区分へ移った。詳細な請求報道によると、過剰に複雑とされた症例1件当たりの平均追加償還額は約1万1,800ドルだった。

支払いの仕組みは、一般にDRGと呼ばれる診断関連群だ。これは入院を分類し、予想される臨床的複雑性などに基づいて償還額を決める。

重大な合併症があると、請求はより高いDRG区分へ移る可能性がある。この上位区分は、患者により多くの資源、モニタリング、または治療が必要だったことを前提としている。

AIコーディングシステムは、検査結果、医師の記録、電子カルテを走査し、より複雑な分類を裏付ける病態を探すことができる。アンビエント・スクライブも、診療中の会話から詳細を記録し、構造化されたノートへ変換できる。

BCBSAによると、病院システムの60%以上が、文書化やコーディングを含む業務でAI対応技術を利用している。この普及により、病院は記録内の請求対象となり得るすべての病態を、より迅速に見つけられるようになる。

保険グループは、重症度の高いコーディングが異なる医療内容に対応しているかどうかに着目した。予想される治療上の変化は、しばしば確認できなかったという。

BCBSAの製品・データサイエンス担当上級副社長であるLuke Chalkerは、この隔たりを問題の中心として位置付けた。患者が本当により重症だったなら、データには追加治療が示されるはずだと同氏は主張した。

一例は主要な腸管手術である。調査期間中、最高複雑度の請求は10.2%から22.7%へ増加した。

その一方で、複雑ではない症例の割合は36.6%から32.8%へ低下した。BCBSAは、こうした変化を約6,100万ドルの追加支出と結び付けた。

貧血、部分的腸閉塞、アシドーシスなどの病態は、二次診断としてより頻繁に現れた。一部は単一の検査値から特定できるため、自動化されたカルテレビューの格好の対象となる。

しかしBCBSAは、貧血としてコーディングされた患者で、輸血などの介入が対応して増加したことを確認できなかった。この不一致は、治療よりも文書化のほうが変化したという同団体の主張を支えている。

この結論は、あくまで保険会社による自社の支払いデータの分析だ。それでも、これまで大半が逸話的に語られてきた懸念に、異例なほど具体的な数字を与えている。

診断が1件増えるだけで請求額が変わる理由

AIは償還額を増やすために病気を捏造する必要はない。支払い区分を変える病態を見つけ出せばよい。

「AIによるアップコーディング」という言葉は、診断が捏造されたことを示唆し得るため、この違いは重要である。実際の仕組みはより微妙で、評価も難しい。

病院の記録には、最終的な請求よりはるかに多くの情報が含まれる。検査結果、投薬、臨床医の所見、病歴、複数部門の詳細などが含まれ得る。

人間のコーダーは、どの病態がコーディング規則を満たし、償還に影響するかを判断しなければならない。裏付けのある診断を見落とせば、正当な支払いを請求し損ねる可能性がある。

AIツールはその探索を拡張する。大規模な記録を一貫して確認し、関連する値に印を付け、請求が保険会社へ届く前にコードを提案できる。

腸管手術のために入院した患者を想像してみよう。手術が入院の主な理由だが、記録にはナトリウム値の低下も含まれているかもしれない。

その結果がコーディング規則上の二次診断を裏付けるなら、その診断は症例の記録上の重症度を高める可能性がある。その後、入院はより高額なDRGに移るかもしれない。

手術自体は変わらない。患者の入院期間も変わらない可能性がある。変わるのは財務上の分類だ。

それだけで、その診断が誤りになるわけではない。入院中に大きな介入を必要としなくても、病態は臨床的に実在し得る。

この点が対立の中心にある。BCBSAは、治療パターンが安定していることを、記録された複雑性が意味のある臨床的変化を上回った証拠と捉えている。

病院側は、償還額には、臨床医が管理、監視、または考慮したすべての病態が反映されるべきだと反論する。治療量だけでは、その業務を捉えきれない場合がある。

この議論は、自律的な医療コーディングにとどまらない。アンビエント文書化システムは診療時の会話を聞き取り、臨床医が確認するための下書きノートを生成する。

これらのシステムは、入力作業や勤務時間外の業務を減らすことを約束している。同時に、従来の短い記録では省略され得た病態を含め、臨床医の発言をより多く記録する。

したがって、より完全な文書化は、支出を増やしながら正確性も向上させ得る。両者は相反する結果ではない。

以前のBCBSAとBlue Health Intelligenceによるコーディング調査は、産科入院における類似の傾向を調査した。同調査では、急性出血後貧血の診断が増加した一方、輸血は比例して増加していないことが判明した。

その分析は、調査期間における産科支出の増加額を2,200万ドルと推定した。また、より集中的なコーディングによる入院・外来双方への広範な影響も予測した。

9月の分析は、この傾向を別の臨床カテゴリーと、より後の請求期間へと広げている。この繰り返しはBCBSAの懸念を強めるが、個別の請求違反を立証するものではない。

正確な把握と不適切なアップコーディングの違いは、患者レベルの証拠に左右される。請求データは、病院が何を請求し、保険会社がどの処置を記録したかを示せる。

請求データだけでは、臨床医がなぜ病態を監視したのか、それが意思決定に影響したのか、すべてのコードが該当する基準を満たしたのかを、常に示せるわけではない。

決定的な監査には、完全なカルテ、コーディング指針、臨床医の判断、人によるレビューが必要になる。BCBSAは、症例ごとの検証をそのレベルで公表していない。

AI病院請求において、この検証の空白は極めて重要だ。自動化は見落とされていた臨床上の詳細を明らかにできる一方、償還規則に沿って記録を最適化することもできる。

同じレコメンデーションエンジンが、1つの病院内で両方の役割を果たすこともあり得る。その財務上の影響は、スタッフが提案をどのように検証するか、また支払い計算式がそれをどのように報いるかに左右される。

病院側、「Blue CrossのAI主張は重症化した患者を見落としている」と反論

病院側は、請求の複雑性上昇は、患者、医療提供の場、文書化の質における実際の変化を反映していると主張している。

American Hospital Association(AHA)は、医療提供者向けAIツールが不適切にコーディング強度を押し上げているという主張を退けた。この立場は、最新の9億4,200万ドルという推定額より前から示されている。

2026年8月のコーディング・ファクトシートで、同協会はこうした非難を裏付けのないものとした。より複雑な請求について、複数の代替的な説明を示している。

第一に、入院患者集団が変化している。人口の高齢化と慢性疾患の増加により、病院では同時に複数の病態を抱える患者を治療することが多くなり得る。

第二に、より単純な処置の多くが外来センターや診療所へ移っている。そのため、病院に残る患者は、より複雑な集団となる。

第三に、コーディング指針と文書化の実務は継続的に変化している。より具体的な記録は、基礎となる患者集団が緩やかにしか変わらなくても、測定上の重症度を高め得る。

AHAは、病院がAIを利用する際にも人による検証が不可欠だとしている。また、正確なコードを提出する法的、倫理的、契約上の責務は医療提供者に残ることも強調している。

同団体のデータによれば、2019年から2024年にかけた病院費用の増加のうち19%は、より重症で複雑な患者の治療に起因する。AHAとVizientの分析では、この期間に病院のケースミックス指数が約5%上昇した。

ケースミックス指数は、病院患者の相対的な臨床的複雑性と、予想される資源使用量を測る。指数の上昇は一般に、入院患者集団がより集中的な医療を必要としているという主張を支える。

これらの数値は、BCBSAによる腸管手術の調査結果を直接反証するものではない。複雑性率の上昇を自動的にソフトウェアへ帰することができない理由を示している。

BCBSAの治療比較にも限界がある。一部の二次病態は、大きな請求対象の処置を伴わずに、モニタリング、臨床判断、投薬の選択、退院計画へ影響を及ぼす。

貧血は有用な例である。輸血は重度の失血への対応の一つだが、すべての貧血診断で輸血が必要になるわけではない。

したがって、輸血率が安定していることは妥当な疑問を提起するが、それだけで問題は解決しない。各診断がコーディング要件を満たしていたかを検証するには、カルテレビューが必要となる。

病院側も、より適切な文書化によって、これまでの過少コーディングを是正できると主張している。病院の視点では、自動化は、すでに行われていたにもかかわらず保険請求に一貫して反映されてこなかった業務を適切に捉える助けとなる。

この主張自体にも不確実性がある。償還の機会を見つけるために設計されたツールには、支払い額を増やす診断を優先する金銭的インセンティブがある。

病院のコンプライアンスプログラムは、本来そのリスクを抑制する役割を担う。しかし、公開されている証拠からは、スタッフがAI生成のコーディング提案をどの程度の頻度で却下しているのかは分からない。

したがって、この対立を、誠実な病院と身構える保険会社の構図に単純化することはできない。双方とも、有利な分類を報いる支払い制度の中で活動している。

病院は、症例が複雑と分類されるほど多くの支払いを受ける。保険会社は、そうした分類を却下、減額、または遅延させるほど多くを保持できる。

双方は自らの自動化を精度向上のツールとして説明できる。そして双方は、相手側のシステムを最適化エンジンと位置づけることができる。

この対称性は、9億4200万ドルという推計を無視すべきだという意味ではない。その推計を病院の行為に対する判断へと発展させる前に、独立した検証が必要だという意味である。

本当の対立は、医療提供者のAI対保険会社のAI

医療AIのコスト問題は、相反する財務目標を持つ自動化システム同士の競争になりつつある。

病院は、診断の記録、文書化の強化、償還の防衛のためにソフトウェアを利用する。保険会社は、保険請求の審査、異常の検出、記録の要求、支払いの削減にアルゴリズムを用いる。

この技術が対立そのものを生み出したわけではない。病院と保険会社は何十年にもわたり、コーディング、医療上の必要性、償還を巡って争ってきた。

AIは、この対立の速度、規模、経済性を変える。一方のシステムはより詳細な請求を生成でき、もう一方は数百万件の記録にわたってそれに異議を唱えられる。

この力学は、Abridgeの創業者であるShiv Raoが、この論争について語る際に「ボット同士が戦う」と警告した理由を説明している。Abridgeは、医療機関向けにアンビエント臨床文書化ソフトウェアを販売している。

Raoはまた、請求前に医療提供者と保険会社が証拠について合意すれば、技術は摩擦を減らせると主張した。この楽観的なシナリオには、共通のルールと相互運用可能な記録が必要となる。

現在の制度は、その逆のインセンティブを提供している。病院は、文書化がより重症度の高い請求を裏付ける場合に利益を得る。保険会社は、自動審査がより少ない支払いの根拠を見つけた場合に利益を得る。

AHAは、民間保険会社が提出済みの請求に付随する重症度または支払額を引き下げる自動ダウンコーディングを行っていると非難している。その後、病院は当初の金額を回収するために異議申し立てをしなければならない。

保険会社も、アルゴリズムによる補償判断を巡る独自の監視に直面している。患者と医療提供者は、却下を推奨したり急性期後ケアを制限したりするとされるシステムに異議を唱えてきた。

UnitedHealthcareは、自社のAIツールは最終的な請求判断を下すのではなく、ケアを導くものだとしている。しかし、公開された論争は、保険会社の自動審査を巡る信頼がいかに乏しいかを示している。

BCBSAの9月のメッセージは、この分断をより鮮明にしている。Chalkerは、拮抗した戦いという見方を退け、保険会社が一方的な財務損失を吸収していると述べた。

病院は同じ資金の流れを、記録された患者の複雑性に対する適切な償還だと説明するだろう。これは同じ請求に対する相容れない解釈である。

どちらの側が優勢になっても、事務負担は増大する。より詳細なコーディングは支払者の監視を強め、それが文書提出要求や異議申し立ての増加を生む。

新たな統制が導入されるたび、別の自動化対応が促されうる。病院は却下を予測するシステムを採用し、保険会社は積極的なコーディングを検出するシステムを展開し、ベンダーは両方を前提に最適化を進める。

患者はこの仕組みを目にすることはほとんどないが、その費用を負担している。保険会社の支出増は、保険料、雇用主のコスト、税金、自己負担へと波及しうる。

積極的な審査が支払いまたは医療へのアクセスを遅らせる場合、患者も不利益を被りうる。減額によって適切な治療が妨げられるなら、より安い請求がより良い結果を意味するわけではない。

これが、9億4200万ドルという数字をAIの総コストとして読むべきではない理由である。これは、コーディング強度の変化による入院支出の増加について、ある保険会社グループが示した推計を測定したものだ。

そこには、支払者の審査システム、医療提供者の異議申し立て、ソフトウェア契約、コンプライアンスチーム、償還の遅延にかかるコストは含まれない。また、文書化作業の削減による潜在的な節約も除外されている。

純粋な経済効果は依然として不明である。AIは事務作業を減らす一方で、償還制度を通じて争われる金額を増やす可能性がある。

医療機関にとって、ガバナンスはモデルの精度を超えて拡張されなければならない。リーダーは、どのシステムがコードを提案したか、どの証拠がそれを裏付けたか、誰が承認したかを記録する必要がある。

検索可能なナレッジベースは、技術チームがポリシー、評価、監査判断を保持する助けとなる。医療システムには、保護対象の臨床情報に特化して設計された統制も必要だ。

追跡可能な判断がなければ、医療提供者も保険会社も、自動化のエラーと意図的な最適化を区別できない。そのため、あらゆる紛争はより遅く、より高コストになる。

9億4200万ドルの推計が証明していないこと

この分析は重要な関連性を示しているが、AIが追加コストのすべてを引き起こしたことや、病院が不正請求を行ったことを立証するものではない。

BCBSAは、AI導入の拡大、コーディング強度の上昇、選定された治療指標の変化の限定性という3つの傾向を結びつけている。これらを合わせると、AI支援による請求の増加についてもっともらしい説明となる。

しかし、急速な導入期における相関は、直接的な因果関係の証拠ではない。病院は同じ期間に、人員配置、ワークフロー、コーディング指針、患者構成、ケアの場を変化させていた。

この分析は請求データも用いている。これらの記録は支払いのために設計されたものであり、入院中に行われたあらゆる臨床判断を再構築するものではない。

BCBSAは診断、処置、補償対象サービスを確認できる。しかし、観察、リスク管理、投薬、退院計画に影響したすべての詳細を確認できるとは限らない。

治療との比較には依然として価値がある。明白に関連する介入が横ばいまたは減少しているにもかかわらず、重症診断が大幅に増加しているなら、精査を促すべきである。

ただし、単一の治療だけで診断を完全に検証することはできない。輸血率だけで、すべての貧血コードが正しかったかどうかを判断することはできない。

9億4200万ドルという数字は、確認済みの過払いの台帳ではなく、基準値に対する推計である。これは、以前のコーディングパターンの下で支出がどの程度だった可能性があるかを示している。

その基準値にも仮定が含まれる。2023年のコーディング強度を、見落としや不完全な文書化を含む期間ではなく、適切な参照点として扱っている。

以前の請求で有効な病態が省略されていた場合、その後の増加は一部、精度の向上を反映している可能性がある。AIが根拠の弱い診断を促した場合、同じ増加は過剰コーディングを反映している可能性がある。

両方の効果は同時に起こりうる。公開データは、まだそれらを切り分けていない。

分析はまた、大腸の主要手術を含む選定された例に集中している。読者は、同じパターンがすべての病院サービスに等しく当てはまると考えるべきではない。

病院ごとに、患者集団、コーディング慣行、ソフトウェアの導入、人による審査は異なる。平均値は、責任ある導入と積極的な外れ値の両方を隠しうる。

BCBSAの以前の産科分析では、複雑性の伸びが最も速い病院が、観察された増加の大部分を牽引していた。この集中は、すべてのAI利用を一律に扱うのではなく、特定のパターンを対象とした監督が必要であることを示唆している。

独立した研究者には、請求とモデルの推奨に紐づけられた匿名化済みの患者カルテが必要となる。また、二次診断がケアに影響したかどうかを判断するための一貫した基準も必要だ。

病院と支払者は、AI生成の推奨に対する却下率と修正率を開示すべきである。提案が頻繁に削除されるシステムは、ほとんど疑問視されないシステムとは異なるリスクをもたらす。

また、導入が異議申し立て率、支払い遅延、臨床医の業務負荷、総管理支出をどう変えるかも報告すべきだ。ある部門での節約が、別の部門のコストになる可能性がある。

医師による導入は、この作業の緊急性を高めている。2026年の医師調査では、文書化、研究、その他のワークフローにわたる専門職の幅広い利用が確認された。

生成された記録が当たり前になるにつれ、文書化はより構造化され、完全なものになる。診断の詳細を中心に構築された支払い制度は、その追加情報に反応するだろう。

未解決の問題は、償還ルールが臨床的に意味のある複雑性と、機械が発見したコーディング機会を区別できるかどうかである。現在の証拠は、その区別が依然として難しいことを示している。

AIによる病院請求がコストを引き上げ続けるかを示す3つのシグナル

次の段階は、独立したカルテ検証、保険会社の対抗策、追加文書化の価値を決める支払いルールに左右される。

第1のシグナルは、請求、完全な臨床記録、AIの推奨を比較する患者レベルの監査である。これにより、追加された診断が臨床的に裏付けられ、ケアに関連していたかを検証できる。

独立した審査者が根拠のないコーディングが広範に行われていたことを確認すれば、BCBSAの主張は大幅に強まる。病院は、検証を厳格化し、ベンダーのパフォーマンスを開示するよう圧力を受けるだろう。

診断の大半が有効だと証明されれば、争点は償還設計へと移る。その場合、保険会社が対峙しているのは組織的な過大請求ではなく、より完全な文書化ということになる。

第2のシグナルは、保険会社の対応である。BCBSAは、アップコーディングのパターンを特定し、AIツールを導入する病院への期待値を定めるためにデータを利用しているとしている。

自動監査、文書提出要求、支払い削減の増加は、保険会社が競争を激化させていることを示す。異議申し立て件数の増加は、自動化が事務上の摩擦を高めていることを示すだろう。

より建設的な対応には、共通の証拠基準が含まれる。医療提供者と支払者は、請求が異議申し立てのサイクルに入る前に、どの臨床シグナルが特定の二次診断を裏付けるかについて合意できる。

第3のシグナルは、DRGとコーディングポリシーの変更である。現在の償還計算式では、診断を1つ追加するだけで財務面で決定的な差が生じることがある。

規制当局や標準化団体は、症例をより高い重症度グループへ移す病態について、より強い文書化を求めることができる。また、追加コードへの感応度が低い支払いモデルを検討することもできる。

より高い償還を測定可能な資源利用と結び付ける政策変更は、診断の捕捉を最大化するインセンティブを弱めるだろう。コードの制限だけに焦点を当てるルールは、正当な複雑ケアへの支払い不足を招くおそれがある。

こうしたシグナルの方向性は、次のベンダー発表よりも重要になる。中心的な問題は、もはや病院と保険会社がAIを使うかどうかではない。

両者はすでに利用している。問題は、そのシステムが共有されたケア記録を改善するのか、それとも互いの支払いロジックに対して最適化するのかである。

BCBSAは、最終判断ではなく、重大な警告を示した。同団体のAI病院請求分析は、目に見える治療が安定していても、自動化が支出を増やしうることを示唆している。

病院側は、より重症の入院患者、より良い文書化、変化するケア環境に関する、もっともらしい代替説明を提示している。この説明にも独立した検証が必要である。

患者と雇用主にとって、結果はどちらがより多くの請求で勝つかによって測ることはできない。有用な制度は、必要なケアに正確に支払いながら、総管理コストを削減しなければならない。

当面の試金石は透明性である。医療機関は、追跡可能なAIの推奨、記録された人による審査、請求とアウトカムに対する測定可能な効果を求めるべきだ。

こうした管理策がなければ、ボット同士の争いが標準的な業務プロセスになってしまう。その場合、9億4,200万ドルという推計は、孤立した請求トラブルというより、早期に届いた請求書のように見えてくる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page