top of page

特朗普 Medicare AI 试点承诺加快审核。WISeR 的拒绝案例却呈现不同故事

52分钟前
讀畢需時 15 分鐘

特朗普 Medicare AI 试点于 2026 年 1 月开始审核六个州的部分服务,承诺更快作出决定并减少浪费。九个月后,WISeR 面临着更棘手的问题:软件能否在保护 Medicare 的同时,避免将资金节省转化为延误或拒绝医疗服务?

“减少浪费和不当服务模型”(Wasteful and Inappropriate Service Reduction Model,简称 WISeR)将私营技术供应商引入 Original Medicare 的授权流程。这些公司利用人工智能及其他技术,审查请求是否符合现有 Medicare 承保规则。

该项目不允许算法自行作出最终拒绝决定。CMS 要求由持证临床审核人员确认每一项不予确认决定——这是其对被拒绝授权请求的称谓。不过,新近公布的记录显示,系统存在积压、技术故障、响应缓慢,以及各州之间的显著差异。

核心冲突并不止于某个算法是否有效。CMS 会向参与企业支付部分因特定请求或理赔被拒而避免的支出。批评人士认为,这一结构会激励更多拒绝;而 CMS 表示,审计和质量调整机制能够抑制不当决定。

这一矛盾令 WISeR 夹在两个熟悉的问题之间。Medicare 需要工具来识别不必要的服务和欺诈行为。患者同样需要得到保护,免受可能让行政错误更快发生、也更难申诉的自动化系统影响。

特朗普 Medicare AI 试点将事前授权引入六个州

WISeR 并非取代 Medicare 承保决定的全国性方案,但它是 Original Medicare 内部一次具有重要影响的技术辅助事前授权测试。

CMS 于 2026 年 1 月 1 日启动该模型。参与机构从 1 月 5 日起开始接收授权请求,适用于自 1 月 15 日起提供的服务。

该项目在 Arizona、New Jersey、Ohio、Oklahoma、Texas 和 Washington 开展。CMS 为每个州选定了一家技术公司:Zyter、Genzeon、Innovaccer、Humata Health、Cohere Health 和 Virtix Health。

WISeR 计划持续至 2031 年 12 月 31 日。CMS 将其描述为自愿性模型,因为医疗服务提供者可以选择是否在提供纳入范围的服务前申请授权。

这一说法需要结合背景理解。未申请事前授权的服务提供者并不能免于审核。其后续理赔将接受付款前医疗审核,这意味着 Medicare 可在付款前进行审查。

因此,对服务提供者而言,实际选择是在两条审核路径之间作出决定:一条在治疗前进行,另一条则在治疗后、报销前进行。

该模型最初涵盖一组范围较窄的服务,CMS 认为这些服务与可疑使用、患者安全担忧或已有记录的欺诈有关。例如,皮肤和组织替代物、硬膜外类固醇注射、电神经刺激器植入,以及用于骨关节炎的膝关节镜手术。

它还包括部分失禁装置,以及与诊断或治疗阳痿相关的服务。CMS 将深部脑刺激和经皮影像引导腰椎减压术的纳入时间推迟至后续绩效年度。

官方 WISeR model 表示,该项目不会改变 Medicare 的承保或支付政策。相反,参与企业必须在理赔流程更早阶段执行现有的全国性或地方性承保要求。

AI 的具体作用可能因参与方而异。这项技术可以整理临床记录、将文件与承保标准比对、识别缺失信息,并帮助确定案件审核的优先顺序。

CMS 表示,技术可以确认符合条件的请求,但不能独立最终确定拒绝。每一项不予确认决定都需要由具备相应资质的持证临床人员审核。

这一区别很重要,因为“AI 拒绝 Medicare 医疗服务”之类的说法可能暗示了一个完全自主的流程。WISeR 在制度上保留了人工决策环节,尽管该审核的质量和独立性仍是重要问题。

该项目也是对制度设计的一次测试。CMS 正在评估,外部技术公司能否比传统行政流程更快速、更一致地开展审核。

如果 WISeR 成功,它可以为扩大技术辅助利用管理提供模板。如果失败,它则可能说明软件、碎片化运营和财务激励如何相互叠加、加剧问题。

最初几个月已经表明,为何这一差别至关重要。争议并不仅仅关乎 AI 的准确性,而是涉及一项建议如何经过整个链条,最终变成延误治疗、请求被拒、重新提交或申诉。

CMS 为何将这些 Medicare 服务列为目标

WISeR 针对的是一个真实的支出问题,但这些支出的集中程度使人们难以断言试点本身能够节省多少资金。

CMS 在发现某些服务的支出增长异常高,或存在已记录的不当计费风险后,创建了这一模型。皮肤替代物是最清楚的例子。

这些产品用于伤口护理,且可能具有医疗必要性。然而,随着平均价格和使用量上升,Medicare 在这类产品上的支出大幅增长。

KFF 对完整传统 Medicare 理赔数据的分析发现,2024 年 WISeR 覆盖服务在 Part B 支出中占 123 亿美元,相当于传统 Medicare Part B 总支出的 5.3%。

2019 年,同类服务占 Part B 支出的 24 亿美元,即 1.1%。因此,五年间支出大约增长了 400%。

皮肤替代物推动了大部分增长。2024 年,它们占 WISeR 服务支出的 103 亿美元,即 83.4%。

其每项服务的平均价格从 2019 年约 2,300 美元升至 2024 年的 21,200 美元,增幅达 820%。

这一增长为 CMS 干预提供了充分理由。一个对已提交理赔缺乏及时审查的系统,可能成为滥用计费的诱人目标。

事前授权也能防止患者接受缺乏针对其具体病情证据支持的程序。不必要的治疗会带来医疗风险,包括感染、并发症和本可避免的恢复时间。

CMS 有先前证据表明,针对性授权能够减少支出。其申请材料引用了部分门诊程序:Medicare 对这些程序的支出从 2019 年下半年的 5,100 万美元降至 2023 年同期的 3,500 万美元。

但更广泛的数据带来了一个重要的反向观点。根据 KFF’s claims analysis,2024 年,六个试点州内只有约 207,500 名受益人使用了 WISeR 服务。

这一数字约占全国接受纳入服务的约 110 万名传统 Medicare 受益人的 19.7%,也只占所有 Medicare 受益人的一小部分。

更重要的是,CMS 在 2026 年初针对皮肤替代物推出了另一项全国性支付调整。该机构估计,这项政策将使此类产品的支出减少近 90%。

因此,价格改革而非事前授权,可能将在该项目最大支出类别中带来大部分短期节省。这使 WISeR 独立产生的财务影响难以分离评估。

皮肤替代物支出的下降,并不能自动证明授权技术有效。评估人员必须区分由更低价格带来的节省,与因减少不当服务而产生的节省。

同一问题也会影响拒绝统计数据。较高的拒绝率可能表明承包商发现了广泛的不合规行为,也可能意味着文件规则令人困惑、审核门槛过于激进,或实施不佳。

单纯的批准百分比无法解决这些可能性。可靠的评估需要有关初始决定、重新提交、决定撤销、申诉、患者结果和不同服务之间差异的信息。

CMS 确实有责任保护公共资金。批评人士无需否认这一责任,也可以质疑 WISeR 的设计是否同样充分地保护了患者。

压力最沉重地落在临床医生和受益人身上。承包商可以将请求作为一份记录来处理,但一份被延误的记录,可能代表着一位带着开放性伤口或持续疼痛等待的患者。

支付公式将节省资金变成核心冲突

WISeR 最具争议的特征不是使用 AI,而是将供应商报酬直接与避免的 Medicare 支出挂钩。

参与企业并非因处理请求而获得普通的固定报酬。对于符合条件的不予确认决定和被拒理赔,它们可以获得部分估算的避免支出。

对于事前授权,CMS 会计算该服务的区域基准,随后适用折扣、参与方支付比例和质量乘数。

一项被拒绝的请求只有在具备唯一性,并且在重新提交或申诉后仍维持拒绝时,才有资格获得支付。参与方还必须遵守报告和绩效要求。

付款前审核采用类似结构。当供应商的审核导致不符合 Medicare 现有承保标准的理赔被拒时,供应商可能获得报酬。

当申诉成功时,CMS 可以暂扣或追回这笔款项。公司还需承担处理无限次重新提交的成本,并且每位受益人的请求只能获得一次支付。

这些规定形成了有意义的保障措施。它们降低了作出可被服务提供者轻易推翻的薄弱拒绝决定的价值。

每一项拟议拒绝也都需要人工临床审核。CMS 可以审计决定、要求纠正措施、暂扣报酬,或移除表现不佳的参与方。

然而,payment methodology 仍以避免支出为起点。一项获得批准的请求不会产生同样基于节省资金的奖励。

这种不对称引发了医生、医院、立法者和数字权利倡导者的批评。他们认为,该商业模式会促使承包商寻找更多拒绝请求的理由。

质量乘数并未完全消除这一担忧。CMS 指引规定,综合质量得分在 85% 至 100% 的参与方适用 100% 乘数。

得分在 60% 至 84% 的参与方适用 95% 乘数。得分低于 60% 的参与方适用 90% 乘数。

换言之,较差的综合表现可以降低支付额,但未必会完全取消支付。CMS 保留了更强的执法选项,但常规公式只施加有限的财务减幅。

这种结构形成了典型的委托—代理问题。Medicare 希望供应商只识别那些不符合既定承保标准的服务。供应商则在审核产生符合条件的避免支出时获利。

当一项请求明显不当时,这些目标是一致的。但当文件不完整、承保标准存在歧义,或患者情况需要作出专业判断时,它们便会出现分歧。

技术可能会加剧这种分化。即使不自主作出拒绝决定,一个经过优化、专门识别可疑申请的系统,也可能让审核人员更加关注边缘案例。

从技术上说,临床医生仍对最终决定负责。但软件可以决定哪些证据优先呈现、哪些案例会受到审查,以及不确定性如何被表述。

因此,人工监督并非完整答案。审核人员可能受到自动化偏见影响,即对计算机生成的建议给予过高信任。

时间压力又带来另一项风险。当申请量上升时,审核人员可能没有足够时间独立还原复杂的临床案例。

CMS认为,其保障措施能让承包商的行为与准确性目标保持一致。批评者则回应称,只有在医疗服务未获批准时,底层激励才最为强烈。

双方的主张都可以检验。CMS应能够公布每位参与者的决策准确性、撤销率、时效性以及按服务类别划分的结果。

如果缺少这些信息,观察者便无法判断支付公式是在奖励审慎审核,还是仅仅将错误视作一项经营成本。

早期拒绝率和延误挑战 WISeR 的效率主张

首批运营记录显示,在这项覆盖六个州的试点中,技术并未带来持续快速或可预测的决策。

电子前哨基金会(Electronic Frontier Foundation)在对CMS提起《信息自由法》诉讼后,获得了约1,000页WISeR记录。这些文件涵盖供应商协议、报告规则、运营更新和服务提供方反馈。

已公开的CMS记录涵盖了该项目启动头几个月的部分情况。它们并未提供完整的最终评估,但揭示了高层描述所掩盖的问题。

根据基于这些文件的报道,数千项授权申请超过了该项目三天的处理目标。截至3月底,仍有数百项申请未获答复。

据报道,其中一项待处理申请已积压83天。记录还提到系统中断、提交材料分类错误,以及供应商与Medicare Administrative Contractors之间的沟通失误。

俄亥俄州的服务提供方尤其对Innovaccer的系统感到沮丧。通信记录显示,该公司在项目启动前曾警告CMS,自己需要更多时间完成计划中的实施工作。

当数字门户无法稳定运行时,一些服务提供方重新使用纸质流程。这一结果直接违背了WISeR通过技术减少行政工作的承诺。

服务提供方的反馈赋予这些延误以临床层面的意义。一些诊所表示,患者因疼痛治疗程序卡在授权流程中而哭泣。

这类报告并不能证明每一项待处理申请都应获得批准。但它们表明,处理速度是患者安全问题,而不仅仅是一项供应商绩效指标。

华盛顿州的医院在年初也记录了类似影响。来自16家医院的数据表明,部分程序的时间线从约两周延长至四到八周。

据报道,在华盛顿大学医疗系统,此前只需一天的紧急授权如今需要15至20天。常规申请此前约需三天。

该系统还报告称,近100名患者正在等待硬膜外类固醇注射。这些治疗可缓解严重疼痛,尽管并非紧急干预措施。

这项华盛顿州医院调查结果涵盖了早期实施阶段及数量有限的机构。不应将其自动推广至每一家供应商或每个州。

不过,这种差异本身就具有重要意义。联邦示范项目应检验一种可复制的运营模式,而不是六套彼此无关、结果无法比较的实施方案。

早期高拒绝率也需要谨慎解读。基于公开数据的报道显示,在项目启动最初几个月,华盛顿州存在较高的未确认率。

据报道,得州数据显示,初始批准率约为62%,经医生审核后升至约84%。如果这一数据准确,这种变化说明人工干预的重要性。

但这也引出了一个更棘手的问题:即使人工审核最终纠正了建议,若系统标记了过多合理申请,仍会给临床医生带来负担。

误报并非无害。每一次误报都可能引发文件调取、电话沟通、同行审核、重新排期,或治疗决定延后。

CMS表示,早期问题过后,周转时间已有改善。后续报告的平均处理时间降至事先授权约1.7天,付款前审核略高于三天。

这种改善将表明,部分故障属于启动阶段问题,而非永久性的设计缺陷。然而,平均值可能掩盖异常案例,以及不同服务、供应商和患者群体之间的差异。

有意义的指标不只是平均值是否低于三天。CMS必须说明有多少申请未达到目标,以及最慢的案例会在未解决状态中停留多久。

它还应将延误与拒绝区分开来。待处理申请可以像正式拒绝一样阻碍医疗服务,同时为申诉提供的机会更少。

人工审核无法解决透明度问题

WISeR的保障措施是在私有系统分析患者记录之后才发挥作用,但公众仍缺乏足够信息来评估这些系统。

CMS表示,每一项未确认决定都会接受人工临床审核。当提交的索赔被拒绝时,受益人和服务提供方也保留现有的申诉权利。

服务提供方可以不限次数地重新提交授权申请。在重新提交过程中,他们还可寻求临床同行对同行审核。

这些保障措施使WISeR不同于完全自动化的拒绝引擎。它们之所以重要,是因为临床覆盖决定往往需要规则型系统无法捕捉的背景信息。

但正式的人工参与并不能揭示审核前发生了什么。CMS尚未针对每家供应商的模型、数据来源、验证程序或错误阈值提供标准化的公开说明。

这六家公司对“AI”的使用方式可能截然不同。一家公司可能从临床记录中提取信息,另一家公司则可能对案例分类,或生成建议的覆盖决定。

这些功能承载着不同风险。文件提取可能遗漏关键陈述;分类可能复制历史决策中的偏见;生成式系统可能引入缺乏依据的信息。

公开记录也几乎没有提供有关不同群体表现的证据。Medicare受益人在年龄、残障状况、语言、地域、种族以及获得专科医生服务的机会方面各不相同。

一个系统的总体准确率可能可以接受,却在较小的人群中表现不佳。因此,错误率应按有意义的患者和服务提供方类别进行报告。

隐私构成另一个未解问题。供应商需要接收敏感医疗信息以完成审核,这会增加额外的访问节点和运营依赖。

商业伙伴协议可以确立法律义务,但不能替代公开的安全测试。数据泄露的后果不止涉及账单记录。

EFF的诉讼寻求获取有关准确性测试、偏见、幻觉、隐私和审计程序的记录。其核心担忧并非任何软件使用本身都不可接受。

其担忧在于,一个不透明的系统可能影响人们获得政府福利的机会,却没有足够证据让外部人士评估其可靠性。

这种透明度缺口也让问责更加困难。当患者遭遇延误时,责任可能分散在服务提供方、供应商、承包商、CMS办公室和临床审核人员之间。

各方都可以将问题指向工作流程的另一环节。但受益人仍会将该系统体验为一道单一障碍。

Medicare Advantage提供了相关警示。事先授权在该项目中很常见,联邦调查人员此前发现,部分计划曾拒绝符合Medicare覆盖规则的申请。

WISeR并不等同于Medicare Advantage。CMS控制其覆盖标准,要求临床确认,并对参与者保持直接监督。

不过,它将熟悉的利用管理工具引入了传统Medicare。这使得过去的问题成为评估保障措施的适当基准。

因此,WISeR最有力的辩护并不是“人工参与”这句话,而应是可衡量的证据:人工审核会在患者受到伤害前发现错误。

CMS应报告技术系统建议拒绝的频率、临床医生不同意的频率,以及初始决定在重新提交后发生改变的数量。申诉结果应与具体供应商和服务项目相对应。

时效性数据应包括分布情况,而不仅是平均值。准确性审计应说明其抽样方法,并公布足够多的结果以供独立分析。

该机构还应将缺失文件的案例与实质性的医疗必要性决定分开。这两类情况带来的负担不同,需要的补救措施也不同。

文件问题可能通过改进表单或电子病历整合来解决。临床分歧则需要更强有力的审核和申诉保护。

透明度不会消除所有争议。但它会让争议变得足够具体,使患者、服务提供方和政策制定者能够加以评估。

WISeR 的下一轮考验将决定该模式是否扩展

下一阶段应通过三个信号来评判:供应商层面的结果、执法行动,以及扩展至原始服务清单之外的证据。

第一个信号是每位参与者的完整绩效数据集。CMS需要公布批准、未确认、重新提交、撤销、申诉和处理时间结果。

这些数字应按服务类别和州进行拆分。全国汇总数据会掩盖某一家承包商或某一临床类别是否造成了大部分问题。

CMS应纳入人工审核人员修改技术建议的比例。这项指标将显示,自动化是在筛选常规工作,还是产生了过多误报。

较低的分歧率并不必然令人安心。审核人员可能过于轻易地服从软件,因此独立审计必须依据Medicare覆盖规则评估最终决定。

患者影响也应纳入数据集。评估人员应追踪与处理延误相关的治疗放弃、重新排期、病情恶化和投诉。

如果CMS提供详尽证据且结果得到改善,支持WISeR的理由将更加有力。如果数据仍不完整,该模式的效率主张将依然难以验证。

第二个信号是执法。CMS可采取多种补救措施,包括纠正行动计划、暂扣付款、追缴和终止资格。

该机构是否愿意使用这些措施,将显示质量要求是否在实践中约束供应商。当不佳表现仅导致有限的付款削减时,规则的重要性就会降低。

执法也应及时。CMS不应等待年度对账期间,任由承包商连续数月制造积压。

公开的纠正行动可以帮助服务提供方了解哪些环节出了问题,以及程序是否已经改变。保密监管无法为一个影响联邦福利获得机会的项目建立信任。

第三个信号是扩展。CMS表示,它可能在后续绩效年度增加服务、地区或参与者。

据称,已公开的记录讨论了未来可能纳入的类别,例如空中救护运输、MRI 扫描以及部分高价 Part B 药物。扩大覆盖范围将使更多受益人纳入该模式。

在获得可信评估之前扩张,会削弱 CMS 关于 WISeR 是一项受控实验的说法。试点项目应先产生证据,再成为可复制的模板。

国会仍将参与这一决策。立法者已提出限制资金的建议,而医生和医院团体则要求加强保障措施,或终止该项目。

政治反对本身并不能证明该模式无法运作。防范欺诈和减少不适当服务,依然是正当的公共目标。

不过,CMS 有责任证明其选择的机制优于现有审核系统。当流程控制着医疗服务的可及性时,成本节约不能成为唯一依据。

因此,特朗普 Medicare AI 试点项目也为其他公共部门 AI 项目带来了一项治理考验。政府机构正越来越多地利用私营技术来筛选案件、提出决策建议并确定执法重点。

这些系统往往在正式人工决策之前就开始运作。它们最大的影响力,可能来自于界定哪些案件看似可疑,以及哪些证据会获得关注。

对开发者而言,教训在于,模型准确率只是部署质量的一部分。队列设计、故障恢复、日志记录、升级路径和用户沟通,都可能决定现实世界的结果。

对企业采购方而言,WISeR 表明,激励机制设计应成为技术采购的一部分。一个模型可以达到基准要求,但其周边合同可能奖励了错误的运营行为。

对患者和临床医生而言,眼下的任务更为实际。当涉及 WISeR 服务时,他们应记录提交日期、响应时间、重新提交情况以及沟通记录。

他们还应区分事前授权未获确认与理赔被拒。可采取的应对方式和申诉路径,取决于案件在支付流程中的具体阶段。

WISeR 尚未证明 AI 辅助审核天生有害,也尚未证明其天生高效。它表明,部署这项技术会改变由谁掌控延误、文件要求和财务风险。

决定性证据将来自更正后的决定、患者结局以及 CMS 的执法行动,而不是关于 AI 的宽泛承诺。在这些结果公开之前,任何扩张都值得受到严格审视。

关注特朗普 Medicare AI 试点项目的读者,应留意底层记录,而非某一个拒绝比例。应关注 CMS 是否公布可比的供应商数据、是否在标准失效时采取行动,以及是否在扩大 WISeR 之前等待证据。这些选择将揭示,该项目究竟仍是一项边界明确的实验,还是会成为更广泛自动化审核的基础。核心问题很直接:Medicare 能否在不让美国老年人和残障人士承担未经验证的行政系统成本的前提下,核实节省效果?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page