Trump Medicare AI 파일럿은 더 빠른 심사를 약속했다. 그러나 WISeR의 거부 사례는 다른 이야기를 들려준다
Trump Medicare AI 파일럿은 2026년 1월부터 6개 주에서 일부 서비스 심사를 시작하며 더 신속한 결정과 낭비 감소를 약속했다. 9개월이 지난 지금, WISeR는 더 어려운 질문에 직면해 있다. 소프트웨어가 재정 절감을 진료 지연이나 거부로 바꾸지 않으면서 Medicare를 보호하는 데 도움이 될 수 있을까?
WISeR로 알려진 Wasteful and Inappropriate Service Reduction Model은 민간 기술 공급업체를 Original Medicare의 승인 절차에 참여시킨다. 이들 기업은 인공지능과 기타 기술을 활용해 요청이 기존 Medicare 보장 규정을 충족하는지 검토한다.
이 프로그램은 알고리즘이 단독으로 최종 거부 결정을 내리는 것을 허용하지 않는다. CMS는 거부된 승인 요청을 가리키는 용어인 모든 비확인(non-affirmation)에 대해 면허를 보유한 임상 검토자가 확인하도록 요구한다. 그러나 새로 공개된 기록은 적체, 기술 장애, 느린 응답, 주별 상당한 차이를 보여준다.
핵심 갈등은 특정 알고리즘의 작동 여부보다 더 크다. CMS는 특정 요청이나 청구가 거부된 뒤 절감된 지출의 일부를 참여 기업에 지급한다. 비판론자들은 이 구조가 거부 건수를 늘릴 유인을 제공한다고 주장하는 반면, CMS는 감사와 품질 조정이 부적절한 결정을 억제한다고 말한다.
이 충돌은 WISeR를 익숙한 두 문제 사이에 놓는다. Medicare에는 불필요한 서비스와 사기를 탐지할 도구가 필요하다. 환자에게도 행정 오류를 더 빠르고 이의를 제기하기 어렵게 만들 수 있는 자동화 시스템으로부터의 보호가 필요하다.
Trump Medicare AI 파일럿은 6개 주에 사전승인 제도를 도입했다
WISeR는 Medicare 보장 결정을 전국적으로 대체하는 제도는 아니지만, Original Medicare 내에서 기술 지원 사전승인을 시험하는 중요한 실험이다.
CMS는 2026년 1월 1일 이 모델을 시작했다. 참여 기관들은 1월 15일 이후 제공되는 서비스에 대해 1월 5일부터 승인 요청을 접수하기 시작했다.
이 프로그램은 Arizona, New Jersey, Ohio, Oklahoma, Texas, Washington에서 운영된다. CMS는 각 주마다 하나의 기술 기업을 선정했다. Zyter, Genzeon, Innovaccer, Humata Health, Cohere Health, Virtix Health가 그 대상이다.
WISeR는 2031년 12월 31일까지 계속될 예정이다. CMS는 공급업체가 포함 대상 서비스를 제공하기 전에 승인을 요청할지 선택할 수 있기 때문에 이를 자발적 모델이라고 설명한다.
이 설명에는 맥락이 필요하다. 사전승인을 생략하는 공급업체가 심사를 피하는 것은 아니다. 이후 청구는 지급 전 의료 심사 대상이 되며, Medicare는 지급 전에 이를 검토할 수 있다.
따라서 공급업체가 실질적으로 선택하는 것은 두 가지 심사 경로다. 하나는 치료 전에 이뤄지고, 다른 하나는 치료 후이지만 보상 전에 이뤄진다.
이 모델은 CMS가 의심스러운 이용, 환자 안전 우려 또는 문서화된 사기와 연관 짓는 좁은 범주의 서비스를 초기 대상으로 삼는다. 예로 피부 및 조직 대체재, 경막외 스테로이드 주사, 전기 신경 자극기 이식, 골관절염에 대한 무릎 관절경 수술이 있다.
또한 일부 요실금 기기와 발기부전 진단 또는 치료와 관련된 서비스도 포함된다. CMS는 심부 뇌 자극술과 경피적 영상 유도 요추 감압술의 포함을 이후 성과 연도로 미뤘다.
공식 WISeR model은 이 프로그램이 Medicare의 보장 또는 지급 정책을 변경하지 않는다고 설명한다. 대신 참여 기업은 기존의 전국 또는 지역 보장 요건을 청구 절차의 더 이른 단계에서 적용해야 한다.
AI의 정확한 역할은 참여 기관마다 다를 수 있다. 이 기술은 임상 기록을 정리하고, 문서를 보장 기준과 비교하며, 누락된 정보를 식별하고, 심사 사례의 우선순위를 정하는 데 도움을 줄 수 있다.
CMS는 기술이 적격 요청을 확인할 수는 있지만 거부를 독립적으로 최종 확정할 수는 없다고 말한다. 모든 비확인 결정에는 적절한 면허를 보유한 임상의의 검토가 필요하다.
“AI가 Medicare 진료를 거부한다”와 같은 표현은 완전히 자율적인 절차라는 인상을 줄 수 있기 때문에 이 구분은 중요하다. WISeR는 공식적으로 인간의 의사결정 단계를 유지하지만, 그 검토의 품질과 독립성은 여전히 중요한 질문으로 남아 있다.
이 프로그램은 제도 설계에 대한 시험이기도 하다. CMS는 외부 기술 기업이 전통적인 행정 절차보다 더 빠르고 일관되게 심사를 수행할 수 있는지 평가하고 있다.
WISeR가 성공한다면 기술 지원 이용 관리 확대의 틀을 제공할 수 있다. 실패한다면 소프트웨어, 분절된 운영, 재정적 인센티브가 서로를 어떻게 증폭시키는지 보여줄 수 있다.
첫 몇 달은 이미 이 구분이 중요한 이유를 보여줬다. 논란은 단순히 AI의 정확도에 관한 것이 아니다. 권고가 치료 지연, 요청 거부, 재제출 또는 이의 제기로 이어지는 전체 과정과 관련돼 있다.
CMS가 이 Medicare 서비스를 겨냥한 이유
WISeR는 실질적인 지출 문제를 다루지만, 해당 지출의 집중도는 파일럿 자체가 절감할 수 있는 금액에 관한 주장들을 복잡하게 만든다.
CMS는 비정상적으로 높은 지출 증가세를 보이거나 부적절한 청구에 취약하다는 기록이 있는 서비스를 확인한 뒤 이 모델을 만들었다. 피부 대체재가 가장 분명한 사례다.
이 제품들은 상처 치료에 사용되며 의학적으로 필요할 수 있다. 그러나 평균 가격과 이용량이 늘면서 Medicare의 관련 지출도 급증했다.
완전한 traditional Medicare 청구 데이터를 분석한 KFF는 WISeR 대상 서비스가 2024년 Part B 지출에서 123억 달러를 차지했다고 밝혔다. 이는 전체 traditional Medicare Part B 지출의 5.3%에 해당한다.
같은 서비스는 2019년 Part B 지출에서 24억 달러, 즉 1.1%를 차지했다. 따라서 5년간 지출은 약 400% 증가했다.
피부 대체재가 증가분 대부분을 이끌었다. 이들은 2024년 WISeR 서비스 지출의 103억 달러, 즉 83.4%를 차지했다.
서비스당 평균 가격은 2019년 약 2,300달러에서 2024년 21,200달러로 상승했다. 이는 820% 증가한 수치다.
이러한 증가는 CMS가 개입할 강력한 이유를 제공한다. 제출된 청구에 적시 심사 없이 지급하는 시스템은 악의적인 청구의 매력적인 표적이 될 수 있다.
사전승인은 특정 환자의 상태에 대해 근거가 부족한 시술을 받는 일을 막을 수도 있다. 불필요한 치료에는 감염, 합병증, 피할 수 있는 회복 기간 등 의학적 위험이 따른다.
CMS는 표적 승인 절차가 지출을 줄일 수 있다는 이전 증거도 갖고 있다. 신청 자료는 일부 외래 시술의 Medicare 지출이 2019년 하반기 5,100만 달러에서 2023년 같은 기간 3,500만 달러로 감소했다고 인용한다.
그러나 더 광범위한 수치는 중요한 반대 관점을 제시한다. KFF의 청구 분석에 따르면, 2024년 6개 파일럿 주에서 WISeR 서비스를 이용한 수혜자는 약 207,500명에 불과했다.
이는 전국에서 포함 대상 서비스를 받은 약 110만 명의 traditional Medicare 수혜자 중 19.7%에 해당한다. 또한 전체 Medicare 수혜자 중에서는 작은 비중이다.
더 중요한 점은 CMS가 2026년 초 피부 대체재에 대해 별도의 전국 지급 변경을 도입했다는 것이다. 기관은 이 정책이 해당 제품 지출을 거의 90% 줄일 것으로 추산한다.
따라서 사전승인보다 가격 개혁이 프로그램 최대 지출 항목에서 단기 절감의 대부분을 만들어낼 수 있다. 이는 WISeR의 독자적인 재정 효과를 분리해 파악하기 어렵게 한다.
피부 대체재 지출 감소가 승인 기술의 유효성을 자동으로 입증하는 것은 아니다. 평가자들은 낮아진 가격으로 인한 절감과 부적절한 서비스 감소에 따른 절감을 구분해야 한다.
같은 문제는 거부 통계에도 영향을 미친다. 높은 거부율은 계약업체가 광범위한 규정 미준수를 발견했다는 의미일 수 있다. 그러나 혼란스러운 문서 요건, 공격적인 심사 기준 또는 부실한 구현을 나타낼 수도 있다.
원시 승인 비율만으로는 이러한 가능성을 판별할 수 없다. 신뢰할 수 있는 평가는 최초 결정, 재제출, 번복, 이의 제기, 환자 결과, 서비스별 차이에 대한 정보를 필요로 한다.
CMS에는 공적 자금을 보호할 정당한 의무가 있다. 비판론자들이 WISeR의 설계가 환자를 동등하게 잘 보호하는지 의문을 제기하기 위해 그 책임을 부정할 필요는 없다.
압박은 임상의와 수혜자에게 가장 크게 가해진다. 계약업체는 요청을 하나의 기록으로 처리할 수 있지만, 지연된 기록은 열린 상처나 지속적인 통증을 안고 기다리는 환자를 의미할 수 있다.
지급 공식은 절감을 핵심 갈등으로 만든다
WISeR의 가장 논란이 되는 특징은 AI 사용 자체가 아니다. 공급업체 보상을 회피된 Medicare 지출에 직접 연결한 결정이다.
참여 기업은 요청을 처리하는 대가로 일반적인 고정 지급을 받지 않는다. 적격 비확인 결정과 거부된 청구로 인해 방지된 것으로 추정되는 지출의 일부를 받을 수 있다.
사전승인의 경우 CMS는 서비스에 대한 지역 기준액을 계산한다. 이후 할인율, 참여자 지급률, 품질 승수를 적용한다.
거부된 요청은 고유한 요청이며 재제출 또는 이의 제기 이후에도 거부 상태가 유지될 때에만 지급 대상이 된다. 참여자는 보고 및 성과 요건도 충족해야 한다.
지급 전 심사도 유사한 구조를 따른다. 공급업체의 심사로 기존 Medicare 보장 기준을 충족하지 못한 청구가 거부되면 보상을 받을 수 있다.
CMS는 이의 제기가 성공할 경우 해당 지급을 보류하거나 환수할 수 있다. 기업은 무제한 재제출을 처리하는 비용도 부담하며, 요청당 수혜자 1명에 대해서는 한 번만 지급을 받는다.
이 조항들은 의미 있는 안전장치를 만든다. 공급업체가 쉽게 번복될 수 있는 취약한 거부 결정을 내릴 유인을 줄인다.
모든 제안된 거부 결정에는 인간 임상의의 검토도 필요하다. CMS는 결정을 감사하고, 시정 조치를 요구하며, 보상을 보류하거나, 성과가 부진한 참여자를 제외할 수 있다.
그러나 payment methodology는 여전히 회피된 지출에서 출발한다. 승인을 받은 요청은 같은 방식의 절감 기반 보상을 만들지 않는다.
이 비대칭성은 의사, 병원, 입법자, 디지털 권리 옹호자들의 비판을 불러일으킨다. 이들은 사업 모델이 계약업체를 더 많은 요청을 거부할 이유를 찾는 방향으로 이끈다고 주장한다.
품질 승수가 이 우려를 완전히 없애지는 못한다. CMS 지침은 종합 품질 점수가 85~100%인 참여자에게 100% 승수를 적용한다.
60~84%의 점수에는 95% 승수가 적용된다. 60% 미만의 점수에는 90% 승수가 적용된다.
다시 말해, 낮은 종합 성과는 지급액을 줄일 수는 있어도 반드시 지급 자체를 없애지는 않는다. CMS는 더 강력한 집행 수단을 보유하지만, 통상적인 공식은 제한적인 재정 감액을 적용한다.
이 구조는 전형적인 주인-대리인 문제를 만든다. Medicare는 공급업체가 확립된 보장 기준을 충족하지 못하는 서비스만 식별하기를 원한다. 공급업체는 심사로 적격 회피 지출이 발생할 때 수익을 얻는다.
요청이 명백히 부적절할 때는 목표가 일치한다. 그러나 문서가 불완전하거나, 보장 기준이 모호하거나, 환자의 상황에 판단이 필요한 경우에는 목표가 갈린다.
기술은 이러한 격차를 더욱 심화시킬 수 있다. 의심스러운 요청을 찾아내도록 최적화된 시스템은 자율적으로 거부 결정을 내리지 않더라도 경계선에 있는 사례에 대한 심사자의 주의를 높일 수 있다.
최종 결정의 책임은 기술적으로 여전히 임상의에게 있다. 그러나 소프트웨어는 어떤 근거가 먼저 제시되는지, 어떤 사례가 집중 검토를 받는지, 불확실성이 어떻게 구성되는지를 결정할 수 있다.
따라서 인간의 감독만으로는 완전한 해답이 되지 않는다. 심사자는 자동화 편향을 물려받을 수 있으며, 이는 컴퓨터가 생성한 권고를 지나치게 신뢰하는 것을 의미한다.
시간 압박은 또 다른 위험을 더한다. 요청량이 늘어나면 심사자는 복잡한 임상 사례를 독립적으로 재구성할 충분한 시간을 확보하지 못할 수 있다.
CMS는 자사의 안전장치가 계약업체의 행동을 정확성과 일치시키도록 설계됐다고 주장한다. 비판론자들은 진료가 승인되지 않을 때 근본적인 인센티브가 가장 강하게 작동한다고 반박한다.
양측 모두 검증 가능한 주장을 제기하고 있다. CMS는 모든 참여자에 대해 결정 정확도, 번복률, 처리 적시성 및 서비스별 결과를 공개할 수 있어야 한다.
이 정보가 없다면 관찰자들은 지급 공식이 신중한 심사를 보상하는지, 아니면 오류를 단순히 사업 비용으로 용인하는지 판단할 수 없다.
초기 거부율과 지연, WISeR의 효율성 주장에 의문 제기
초기 운영 기록은 기술이 6개 주 시범사업 전반에서 일관되게 빠르고 예측 가능한 결정을 만들어내지 못했음을 보여준다.
Electronic Frontier Foundation은 CMS를 상대로 정보공개법 소송을 제기한 뒤 약 1,000페이지에 달하는 WISeR 기록을 확보했다. 문서에는 공급업체 계약, 보고 규정, 운영 업데이트 및 의료 제공자 피드백이 포함돼 있다.
공개된 CMS 기록은 프로그램 개시 후 첫 몇 달의 일부 기간을 다룬다. 최종 평가 전체를 제공하지는 않지만, 상위 수준의 설명에 가려진 문제를 드러낸다.
해당 문서를 바탕으로 한 보도에 따르면, 수천 건의 승인 요청이 프로그램의 3일 처리 목표를 초과했다. 수백 건은 3월 말까지도 답변을 받지 못한 상태였다.
보도에 따르면 한 계류 중인 요청은 접수 후 83일이 지났다. 기록에는 시스템 장애, 잘못 분류된 제출 건, 그리고 공급업체와 Medicare Administrative Contractors 간의 소통 실패도 담겼다.
Ohio의 의료 제공자들은 Innovaccer의 시스템에 특히 큰 불만을 나타냈다. 서신에는 회사가 출시 전 계획된 구현을 마치기 위해 더 많은 시간이 필요하다고 CMS에 경고했음이 드러났다.
디지털 포털이 안정적으로 작동하지 않자 일부 제공자는 종이 기반 절차로 돌아갔다. 이는 기술을 통해 행정 업무를 줄이겠다는 WISeR의 약속과 정면으로 충돌한다.
의료 제공자 피드백은 지연에 임상적 차원을 부여했다. 일부 진료기관은 고통스러운 시술이 승인 절차에 묶여 있는 탓에 환자들이 울었다고 설명했다.
이러한 보고가 모든 계류 요청이 승인됐어야 한다는 점을 입증하는 것은 아니다. 다만 처리 속도가 단순한 공급업체 성과 지표가 아니라 환자 안전 문제임을 보여준다.
Washington의 병원들은 그해 초 비슷한 영향을 기록했다. 16개 병원의 데이터는 일부 시술 일정이 약 2주에서 4~8주로 늘어났음을 시사했다.
University of Washington Medical System에서는 과거 하루가 걸리던 긴급 승인이 15~20일을 필요로 했다고 전해진다. 일반 요청은 이전에 약 3일이 걸렸다.
이 시스템은 또한 거의 100명의 환자가 경막외 스테로이드 주사를 기다리고 있다고 보고했다. 이러한 시술은 응급 개입이 아닐 수는 있어도 심한 통증을 완화할 수 있다.
Washington 병원 조사 결과는 초기 구현 단계와 제한된 기관 집단을 다뤘다. 이를 모든 공급업체나 주에 자동으로 일반화해서는 안 된다.
그럼에도 변동성 자체가 중요하다. 연방 시범사업은 비교할 수 없는 결과를 낳는 6개의 무관한 구현이 아니라 재현 가능한 운영 모델을 시험해야 한다.
높은 초기 거부율 역시 신중한 해석이 필요하다. 공개된 데이터를 토대로 한 보도는 프로그램 초기 몇 달 동안 Washington에서 상당한 비승인 비율이 나타났다고 설명했다.
Texas 데이터는 의사 심사 전 초기 승인율이 약 62%였으며, 심사 후 약 84%로 상승했다고 전해진다. 사실이라면 이 변화는 인간 개입의 중요성을 보여준다.
동시에 더 어려운 질문도 제기한다. 지나치게 많은 정당한 요청을 표시하는 시스템은 인간 심사가 결국 권고를 바로잡더라도 임상의에게 부담을 줄 수 있다.
거짓 양성은 무해하지 않다. 각각의 사례는 문서 확보, 전화 통화, 동료 심사, 일정 재조정 또는 치료 결정 지연을 초래할 수 있다.
CMS는 초기 문제 이후 처리 시간이 개선됐다고 밝혔다. 이후 보고된 평균 처리 시간은 사전 승인에서 약 1.7일, 사전 지급 심사에서는 3일을 약간 넘는 수준으로 낮아졌다.
개선은 일부 실패가 영구적인 설계 결함이 아니라 출시 단계의 문제였음을 보여줄 수 있다. 그러나 평균은 이상치와 서비스, 공급업체, 환자 집단 간 차이를 가릴 수 있다.
의미 있는 지표는 단순히 평균이 3일 아래로 내려가는지 여부가 아니다. CMS는 목표를 넘기는 요청이 몇 건인지, 가장 느린 사례가 얼마나 오래 미해결 상태로 남는지를 밝혀야 한다.
또한 지연과 거부를 구분해야 한다. 계류 상태로 남은 요청은 공식적인 거부만큼 효과적으로 진료를 막을 수 있지만, 이의제기 기회는 더 적게 제공한다.
인간 심사로도 투명성 문제는 해결되지 않는다
WISeR의 안전장치는 민간 시스템이 환자 기록을 분석한 뒤 작동하지만, 대중은 여전히 해당 시스템을 평가할 충분한 정보를 갖고 있지 않다.
CMS는 모든 비승인 결정이 인간의 임상 심사를 받는다고 말한다. 제출된 청구가 거부될 경우 수혜자와 제공자는 기존의 이의제기 권리도 유지한다.
의료 제공자는 횟수 제한 없이 승인 요청을 다시 제출할 수 있다. 재제출 과정에서 의료진 간 임상 심사도 요청할 수 있다.
이러한 안전장치는 WISeR를 완전 자동화된 거부 엔진과 구분한다. 임상 보장 결정에는 규칙 기반 시스템이 포착하지 못하는 맥락이 필요한 경우가 많기 때문에 중요하다.
그러나 형식적인 인간 개입은 해당 심사 이전에 무슨 일이 일어나는지를 보여주지 않는다. CMS는 각 공급업체의 모델, 데이터 출처, 검증 절차 또는 오류 임계값에 대한 표준화된 공개 설명을 제공하지 않았다.
6개 기업은 “AI”를 매우 다른 방식으로 사용할 수 있다. 한 기업은 임상 기록에서 정보를 추출할 수 있고, 다른 기업은 사례를 분류하거나 권장 보장 결정을 생성할 수 있다.
이러한 기능은 서로 다른 위험을 수반한다. 문서 추출은 핵심 진술을 놓칠 수 있다. 분류는 과거 결정에 담긴 편향을 재현할 수 있다. 생성형 시스템은 근거 없는 정보를 도입할 수 있다.
공개 기록은 하위 집단 성과에 관한 증거도 제한적으로만 제공한다. Medicare 수혜자는 연령, 장애, 언어, 지역, 인종 및 전문의 접근성 측면에서 다양하다.
시스템은 전체 정확도가 수용 가능한 수준이더라도 더 작은 집단에서는 부진할 수 있다. 따라서 오류율은 의미 있는 환자 및 의료 제공자 범주별로 보고돼야 한다.
개인정보 보호 역시 답이 나오지 않은 문제다. 공급업체는 심사를 수행하기 위해 민감한 의료 정보를 받으며, 이로 인해 추가적인 접근 지점과 운영상 의존성이 생긴다.
Business associate agreements는 법적 의무를 정할 수 있지만 공개 보안 테스트를 대체하지는 못한다. 침해의 영향은 청구 기록을 넘어선다.
EFF의 소송은 정확도 테스트, 편향, 환각, 개인정보 보호 및 감사 절차에 관한 기록을 요구했다. 그 핵심 우려는 소프트웨어 사용 자체가 본질적으로 용납될 수 없다는 것이 아니다.
우려는 불투명한 시스템이 외부인이 신뢰성을 평가할 충분한 증거 없이 정부 혜택에 대한 접근에 영향을 줄 수 있다는 데 있다.
이 투명성 격차는 책임 추궁도 어렵게 만든다. 환자가 지연을 겪을 때 책임은 의료 제공자, 공급업체, 계약업체, CMS 부서 및 임상 심사자 사이에 분산될 수 있다.
각 당사자는 업무 흐름의 다른 부분을 지목할 수 있다. 그러나 수혜자는 여전히 이 시스템을 하나의 장벽으로 경험한다.
Medicare Advantage는 관련된 경고를 제공한다. 이 프로그램에서는 사전 승인이 일반적이며, 연방 조사기관은 과거 플랜이 Medicare 보장 규정을 충족한 요청을 거부한 사례를 발견한 바 있다.
WISeR는 Medicare Advantage를 그대로 복제하지는 않는다. CMS는 보장 기준을 통제하고, 임상적 확인을 요구하며, 참여자에 대한 직접 감독을 유지한다.
그럼에도 이는 친숙한 이용 관리 도구를 Original Medicare에 도입한다. 따라서 과거의 문제는 안전장치를 평가하는 데 적절한 기준이 된다.
그러므로 WISeR에 대한 가장 강력한 방어는 “human in the loop”라는 표현이 아니다. 인간 심사가 환자가 피해를 겪기 전에 오류를 포착한다는 측정 가능한 증거가 되어야 한다.
CMS는 기술이 거부를 권고하는 빈도, 임상의가 이에 동의하지 않는 빈도, 재제출 후 초기 결정이 얼마나 많이 바뀌는지를 보고해야 한다. 이의제기 결과는 개별 공급업체와 서비스에 연결돼야 한다.
적시성 데이터에는 평균뿐 아니라 분포도 포함돼야 한다. 정확도 감사는 표본 추출 방식을 설명하고 독립적인 분석에 충분한 결과를 공개해야 한다.
기관은 누락 문서 사례와 실질적인 의학적 필요성 결정을 구분해야 한다. 이들 범주는 서로 다른 부담을 부과하며 서로 다른 해결책을 요구한다.
문서 문제는 더 나은 양식이나 전자 의료 기록 통합으로 해결될 수 있다. 임상적 이견에는 더 강력한 심사 및 이의제기 보호가 필요하다.
투명성이 모든 분쟁을 없애지는 못한다. 그러나 환자, 의료 제공자 및 정책 입안자가 평가할 수 있을 만큼 이견을 구체화할 수 있다.
WISeR의 다음 시험이 모델 확대 여부를 결정할 것이다
다음 단계는 세 가지 신호로 평가돼야 한다. 공급업체별 결과, 집행 조치, 그리고 원래 서비스 목록을 넘어선 확대의 증거다.
첫 번째 신호는 각 참여자에 대한 완전한 성과 데이터세트다. CMS는 승인, 비승인, 재제출, 번복, 이의제기 및 처리 시간 결과를 공개해야 한다.
이 수치는 서비스와 주별로 세분화돼야 한다. 전국 단위 집계는 특정 계약업체나 임상 범주가 문제 대부분을 유발하는지 감출 수 있다.
CMS는 인간 심사자가 변경한 기술 권고의 비율도 포함해야 한다. 이 지표는 자동화가 일상 업무를 걸러내는지, 아니면 과도한 거짓 양성을 만들어내는지를 보여줄 것이다.
낮은 불일치율이 자동으로 안심할 근거가 되는 것은 아니다. 심사자는 소프트웨어에 너무 쉽게 의존할 수 있으므로, 독립 감사는 최종 결정을 Medicare의 보장 규정과 비교해 평가해야 한다.
환자 영향도 데이터세트에 포함돼야 한다. 평가자는 처리 지연과 연관된 치료 포기, 일정 변경, 상태 악화 및 민원을 추적해야 한다.
CMS가 상세한 증거를 제공하고 결과가 개선된다면 WISeR의 근거는 더 강해진다. 데이터가 계속 불완전하다면 이 모델의 효율성 주장은 여전히 검증하기 어려울 것이다.
두 번째 신호는 집행이다. CMS에는 시정 조치 계획, 지급 보류, 환수 및 계약 종료를 포함한 여러 구제 수단이 있다.
CMS가 이를 사용할 의지가 있는지는 품질 요건이 실제로 공급업체를 제약하는지 보여줄 것이다. 저조한 성과가 소폭의 지급 삭감만 초래한다면 규정의 의미는 줄어든다.
집행도 시의적절해야 한다. CMS가 연례 정산을 기다리는 동안 계약업체가 수개월간 적체를 계속 만들어서는 안 된다.
공개된 시정 조치는 의료 제공자가 무엇이 실패했고 절차가 바뀌었는지를 이해하는 데 도움이 될 수 있다. 기밀 감독만으로는 연방 혜택 접근에 영향을 미치는 프로그램에 대한 신뢰를 구축할 수 없다.
세 번째 신호는 확대다. CMS는 이후 성과 연도에 서비스, 지역 또는 참여자를 추가할 수 있다고 밝혔다.
공개된 기록은 항공 구급 이송, MRI 검사, 일부 고비용 Part B 약물 등 향후 포함될 수 있는 범주가 논의됐다고 전한다. 적용 범위가 넓어지면 더 많은 수혜자가 이 모델의 영향을 받게 된다.
신뢰할 만한 평가 전에 확대한다면 WISeR가 통제된 실험이라는 CMS의 주장은 약화될 것이다. 시범사업은 하나의 표준이 되기 전에 근거를 만들어내야 한다.
의회 역시 그 결정에 계속 관여할 것이다. 의원들은 이미 자금 지원 제한을 제안했으며, 의사 및 병원 단체들은 더 강력한 안전장치나 프로그램 종료를 요구했다.
정치적 반대만으로 이 모델이 작동할 수 없다는 사실이 입증되지는 않는다. 사기 방지와 부적절한 서비스 제공의 축소는 여전히 정당한 공공 목표다.
그러나 CMS는 선택한 메커니즘이 기존 심사 시스템보다 낫다는 점을 입증해야 할 책임이 있다. 이 절차가 의료 서비스 접근을 통제하는 상황에서 비용 절감만으로는 충분하지 않다.
따라서 Trump Medicare AI pilot은 다른 공공 부문 AI 프로그램을 위한 거버넌스 시험대가 된다. 정부 기관들은 점점 더 민간 기술을 활용해 사례를 분류하고, 결정을 권고하며, 집행 대상을 선정하고 있다.
이러한 시스템은 흔히 공식적인 인간의 결정이 내려지기 전에 작동한다. 가장 큰 영향은 어떤 사례가 의심스러운 것으로 보이는지, 어떤 증거가 주목받는지를 규정하는 데서 나올 수 있다.
개발자에게 주는 교훈은 모델 정확도가 배포 품질의 한 부분일 뿐이라는 점이다. 대기열 설계, 장애 복구, 로깅, 에스컬레이션 경로, 사용자 커뮤니케이션이 실제 결과를 좌우할 수 있다.
기업 구매자에게 WISeR는 인센티브 설계가 기술 조달에 포함돼야 하는 이유를 보여준다. 모델이 벤치마크를 충족하더라도, 주변 계약 구조가 잘못된 운영 행태에 보상할 수 있다.
환자와 임상의에게 당면한 과제는 더 실용적이다. WISeR 서비스가 관련된 경우 제출 날짜, 응답 시간, 재제출, 커뮤니케이션을 기록해야 한다.
또한 사전 승인 비확정과 청구 거절을 구분해야 한다. 이용 가능한 대응 및 이의 제기 절차는 해당 사례가 지급 절차의 어느 단계에 있는지에 따라 달라진다.
WISeR는 아직 AI 지원 심사가 본질적으로 해롭거나 본질적으로 효율적이라는 점을 입증하지 못했다. 다만 이 기술의 도입이 지연, 문서화, 재정적 위험을 누가 통제하는지를 바꾼다는 점은 보여줬다.
결정적인 근거는 AI에 대한 포괄적인 약속이 아니라 정정된 결정, 환자 결과, CMS 집행에서 나올 것이다. 그 결과가 공개되기 전까지 확대는 면밀한 검토를 받아야 한다.
Trump Medicare AI pilot을 추적하는 독자들은 단일 거절 비율이 아니라 근거가 되는 기록을 살펴봐야 한다. CMS가 비교 가능한 공급업체 데이터를 공개하는지, 기준이 충족되지 않을 때 조치하는지, WISeR를 확대하기 전에 근거를 기다리는지 물어야 한다. 이러한 선택은 이 프로그램이 제한된 실험으로 남을지, 더 광범위한 자동화 심사의 기반이 될지를 보여줄 것이다. 핵심 질문은 간단하다. Medicare는 검증되지 않은 행정 시스템의 비용을 고령자와 장애 미국인이 떠안게 하지 않으면서 절감 효과를 검증할 수 있는가?



