Databricks 将实时欺诈防范引入福利发放,难点才刚刚开始
- Aisha Washington

- 7月30日
- 讀畢需時 15 分鐘
Databricks 将实时欺诈防范引入联邦福利,是对政府高成本“先发放、后追回”模式的直接挑战。该公司表示,机构可以在资金发放前为申领进行风险评分,同时由人工审核人员保留对重大决定的裁量权。这一承诺之所以重要,是因为联邦机构报告称,2025 财年不当支付估计达到 1,860 亿美元。
拟议中的转变听起来很直接:将欺诈核查从事后调查移入交易流程。然而,联邦福利并非银行卡消费。一笔延迟发放的失业金、医疗理赔款或灾害补助,可能让合法受助者失去必要支持。
这构成了核心矛盾。Databricks 希望机构更早干预,但政府必须避免将可疑模式直接转化为自动拒付。真正的考验在于,共享数据和机器学习能否在不拖慢援助、也不产生不可接受的误报的情况下减少损失。
Databricks 将什么带入支付流程
该方案将欺诈分析从调查工具,移入机构决定是否拨付资金的关键时刻。
在 7 月 29 日的一篇博客文章中,Databricks 描述了一套用于实时筛查联邦福利交易的分层系统。它结合了固定规则、机器学习风险评分、实体解析、图分析以及生成式 AI 辅助。
规则引擎会对传入交易应用明确条件。它可能识别重复申领、与已故人员有关的付款,或同一银行账户为多个身份接收福利的情况。
机器学习则增加了一层概率判断。模型不会只寻找已知违规行为,而是将每笔交易与从既往活动中学习到的模式进行比较。它生成的是风险评分,而非最终的法律判断。
实体解析会将看似描述同一人员、服务提供者、企业、账户或地址的记录关联起来。随后,图分析会绘制这些实体之间的关系。两者结合,可以揭示隐藏在表面独立申请背后的网络。
Databricks 表示,其商业欺诈系统每年已评估数十亿笔交易,通常可在数十毫秒内完成。该公司将这一经验作为证据,说明筛查可以在不造成明显支付延迟的情况下进行。
其联邦方案不止于评分。根据该公司的欺诈防范计划,被标记的交易可能触发付款冻结、人工审核,或为调查人员生成证据包。
Databricks 还描述了自动化案件准备流程。该平台将收集相关记录,将疑似违规行为与法规条款关联,汇总证据,并保留带有数字签名的审计历史。
这些功能并不会使系统成为自主裁决者。Databricks 表示,在转介或执法行动推进前,指定人员将确认案件。人工授权仍将记录在审计轨迹中。
这一区别至关重要。风险评分可以帮助调查人员确定案件优先级,但本身不能证明欺诈。欺诈涉及故意虚假陈述,而不当支付可能源于错误、文件不完整或金额不正确。
这些类别存在重叠,但不能互换。政府问责局一再警告,报告中的不当支付估计不仅包括故意欺诈。
因此,文章标题中的主张需要谨慎界定。Databricks 提出的是一套机构可以实施的技术架构。它尚未公布来自全国性联邦福利部署的结果,以证明该架构能在不伤害合法受助者的情况下阻止欺诈。
变化之处在于检测流程的部署位置。该平台不再要求调查人员在资金发放后重建欺诈方案,而是在申领仍待处理时计算风险。
这种部署为机构提供了更多选择。它们可以批准低风险申领,将模糊案件转交审核,并暂停符合强欺诈指标的交易。不过,每增加一种选择,也都需要有可辩护的政策来规范其使用。
“先发放、后追回”模式为何面临压力
联邦机构面临压力,因为在欺诈性付款发生后追回的资金,很少能等同于在发放前避免的损失。
规模解释了紧迫性。政府问责局估计,2018 至 2022 财年期间,联邦欺诈造成的直接损失每年介于 2,330 亿至 5,210 亿美元之间。
该估计涵盖不同的风险环境,包括疫情救助。政府问责局表示,这一区间相当于同期联邦年度平均支出的 3% 至 7%。
这一估计并不等同于政府的不当支付总额。欺诈需要故意虚假陈述,而不当支付则包括多付、少付、不符合资格的受款人以及支持信息不足等情况。
根据政府问责局的支付分析,2025 财年,联邦机构报告的不当支付约为 1,860 亿美元,比 2024 财年估计高出约 240 亿美元。
自 2003 财年以来,累计不当支付估计已接近 3 万亿美元。这些数字并不意味着每一美元都被盗走,而是表明支付完整性仍是一个长期存在的运营问题。
传统调查通常在机构发现异常、收到举报或审查样本后才开始。调查人员随后收集记录、确定意图、与其他组织协调,并寻求行政或刑事补救措施。
这一过程可能耗时数月甚至数年。届时,资金可能已流经多个账户、空壳企业或中介机构。欺诈团伙可以解散一项操作,再以不同身份重新出现。
紧急项目使问题更加困难。机构必须迅速发放援助,往往只能使用不完整的数据和临时流程。冗长的付款前审核可能违背项目本身的宗旨。
Databricks 将此描述为在速度与审查之间做出的不必要选择。该公司认为,流式数据和自动化评分使机构能够审查交易,而无需对每位申请人实施全面人工审核。
政府已有证据表明,更早的数据核查能够带来可衡量的收益。财政部的 Do Not Pay 系统会在付款前或付款后,将申请人和受款人与政府数据集进行匹配。
最近的一项试点让该系统能够访问更完整的社会保障死亡档案。财政部报告称,该试点第一年识别并阻止或追回了 1.135 亿美元的不当支付。
根据死亡数据审查,政府问责局在计入支出后计算得出,这约为试点成本的 23 倍。财政部预计,三年内净收益将超过 3.37 亿美元。
该试点支持了更早验证的理由,但并未验证 Databricks 将基于 AI 的分析引入福利决策的每一个要素。
将受款人与死亡记录匹配,涉及的是相对容易理解的条件。机器学习模型根据许多相关变量推断可疑行为,则带来了更复杂的证据问题。
尽管如此,机构所面临的压力十分明确。国会和监督机构期待更好的预防措施,而有组织的欺诈团伙则利用项目、州政府和联邦部门之间的漏洞。
机构必须作出回应,同时不能将每一份申请都变成调查。这一要求更适合能够将庞大交易流缩小为一组较小、可审核的高风险案件的系统。
Databricks 联通机构才是真正的机制
Databricks 这一策略中最具影响力的部分并非生成式 AI,而是试图跨越机构边界连接欺诈信号。
当每个机构只能看到一笔交易时,欺诈者可能看起来合法。当分析人员将多个项目中的同一地址、设备、银行账户、服务提供者或企业联系起来时,模式就会改变。
Databricks 表示,超过 80% 的联邦行政部门已经使用其平台。这是公司自行报告的数据,并未披露这些部门运行的是哪些工作负载。
现有采用情况仍可能降低实施阻力。已在该平台上部署数据管道和治理控制措施的机构,无需从零开始构建每一个技术组件。
该方案使用 OpenSharing 交换实时数据,而无需制作传统副本。Clean Rooms 则创建受控环境,使参与者能够在不直接暴露底层原始数据集的情况下分析受保护记录。
这些功能针对的是政府欺诈检测中的结构性问题。数据所有权、不兼容的系统、隐私要求以及项目专属法律,往往限制一个组织能够访问的内容。
共享平台无法消除这些限制。一旦机构确立法律授权和治理条款,它可以提供技术控制措施来执行相关协议。
这一区别很重要,因为“数据孤岛”并不总是意外的技术故障。有些孤岛存在,是因为国会限制了信息披露,机构为不同目的收集信息,或个人获得了特定的隐私承诺。
因此,跨机构分析需要的不只是连接数据库。官员必须明确哪些字段可以使用、谁可以查询、结果保留多久,以及个人如何对错误提出异议。
共享信号的质量也决定模型的质量。重复姓名、过时地址、缺失标识符和不一致的项目定义,都可能造成误导性的关联。
政府问责局在联邦资助的医疗保障中发现了这一问题的具体表现。2023 财年,六个州和联邦政府在潜在重复保障或福利上至少支付了 16 亿美元。
审查结论认为,更强的州际数据匹配可能有所帮助。正如政府问责局的保障匹配审查所详述,该审查还发现联邦官员可获得的政策层面数据存在局限。
该案例展现了 Databricks 论点的两面。跨项目数据可以揭示单一系统遗漏的损失,不完整的信息也可能使分析人员无法确定表面重叠是否确属不当。
Databricks 提出多层分析,是因为没有任何一种技术能够覆盖所有欺诈方案。规则捕捉已知且明确的条件,模型对陌生组合进行排序,图谱揭示协同网络。
生成式 AI 的作用则更为有限,主要提供支持。它可以汇总文件,将结构化记录与叙述性证据关联,并帮助调查人员理解案件为何受到关注。
这一角色比让语言模型决定资格更具可辩护性。生成式系统可能产生流畅却缺乏支持的结论,尤其是在记录相互矛盾或缺乏背景时。
一种有用的实施方式应当让底层证据保持可见。调查人员应能够审查每项建议背后的记录、规则、模型因素和图谱关联。
同样的要求也适用于起诉材料包。生成的摘要可以节省时间,但调查人员和律师必须核实每一项事实陈述和法定关联。
因此,该机制是一条链条,而非单一模型。数据进入系统,身份得到核验,规则和模型对事件评分,人工审查证据,再由获授权的官员决定后续处置。
每个环节都需要监控。如果陈旧的资格数据导致误报,低延迟模型的价值就微乎其微。如果案件队列数周无人处理,再精准的警报也意义有限。
Databricks 将实时筛查引入福利领域的最强版本,应当是务实的,而非表演性的。它为机构提供从可靠信号更快走向可审查行动的路径。
最棘手的欺诈问题,是看起来可疑的合法申领
一套旨在付款前阻止损失的系统,也获得了延误无辜人员的能力。
商业银行卡网络也面临类似的权衡,但福利项目的后果不同。银行客户在解决被拦截的消费时,通常还可以使用另一张卡;福利领取者可能没有替代选择。
欺诈模型也会从历史记录中学习。如果过去的调查过度聚焦于特定地点、职业、服务提供者或人口统计代理变量,模型就可能复现这种模式。
随后可能形成反馈循环。模型将某一群体的更多案件送交调查人员。调查人员因审查了更多案件而在该群体中发现更多违规。这些结果又会反过来强化模型。
数据漂移带来另一项风险。欺诈手法会变化,项目规则会演进,经济状况也会改变申请人的正常行为。一个在某段时期训练的模型,可能在另一时期将合法行为错误分类。
GAO 在 2026 年 1 月的评估中强调,AI 的效益取决于数据质量和具备技能的劳动力。其 AI fraud testimony 将治理、可靠数据、技术专长和持续监督列为实际要求。
这个问题无法仅靠增加一个人工审批框来解决。审查人员可能会在没有仔细检查的情况下接受自动化建议,尤其是在工作负荷很高或模型评分看似具有权威性时。
有意义的监督需要时间、培训和获取证据的权限。审查人员需要清晰了解警报的理由,而不是一个脱离背景的风险数字。
机构还需要针对不同操作设定不同阈值。足以要求补交一份文件的信号,未必足以扣留医疗付款;扣留付款也未必足以将某人列入政府观察名单。
设计应按项目、申请人群体、交易类型和处置措施衡量误报。一项平均准确率评分可能掩盖集中性的伤害。
申诉提供了另一项重要信号。如果领取者提交补充信息后,审查人员经常撤销警报,系统或其运营阈值就需要调整。
NIST 的 AI risk framework 将可靠性、透明度、可解释性、隐私、安全性和受控偏差视为相互关联的特征。机构不能将其视为部署后才添加的可选功能。
保护隐私的工具也存在局限。数据洁净室可以限制原始数据的暴露,但分析结果仍可能泄露敏感信息,或支持有害推断。
访问控制必须覆盖人员、服务账户、模型、导出结果和下游案件系统。审计日志应显示谁访问了数据、其记录的用途,以及随后采取了何种行动。
安全性也带来并行的担忧。全国性反欺诈网络会成为有吸引力的目标,因为它连接了敏感的身份、付款、服务提供者和调查信息。
攻击者可能试图获取数据,也可能操纵系统。被污染的记录可能掩盖一个欺诈团伙、牵连合法领取者,或让模型学习到可疑活动看起来属于正常行为。
因此,必须针对对抗性行为测试模型表现。机构应假定,成熟的团伙会试探阈值并调整交易,以保持在阈值之下。
Databricks 表示,人工始终参与其中,且决策保留永久审计历史。这些控制措施是必要的,但该公开提案未提供有关错误率的部署级证据。
它也未公布检测提升幅度、误报率、申诉结果、审查时长,或不同福利人群之间的性能差异。在具体试点启动前,这些缺失可以理解,但它们限制了有关准备就绪程度的主张。
“经大规模验证”这一表述尤其值得谨慎对待。Databricks 指出其技术每年筛查 1,600 亿笔银行卡付款,但政府资格认定涉及不同的记录、法律和损害。
交易吞吐量证明基础设施能够快速处理事件,但并不能证明一个为联邦福利训练的模型会作出准确、公平且在法律上可持续的建议。
试点应从可逆的干预措施开始。机构可以利用警报优先安排人工审查,再允许系统启动更长期的冻结或更广泛的转介。
它们还应将模型与现有控制措施进行比较。相关问题不是 AI 是否能发现欺诈,而是该系统在计入误报、审查成本、延误和申诉后,是否改善了净结果。
这种评估需要独立组成部分。供应商的技术指标不能替代机构的项目完整性分析或外部审计。
政府数据共享是一场政策博弈,而非一项软件设置
Databricks 可以提供共同平台,但机构仍掌控着使共享欺诈信号发挥作用的权限、定义和后果。
联邦政府数十年来一直在推进跨数据库匹配。Do Not Pay 系统本身就表明,进展取决于法定访问权限和数据完整性。
GAO 在 2016 年报告称,Do Not Pay 对法律要求的多个数据库只有部分访问权限,或根本无法访问。当时,其版本的社会保障死亡数据并未包含各州上报的记录。
后续的死亡数据试点改善了这一覆盖范围,并产生了可衡量的结果。漫长的间隔表明,即使技术应用场景显而易见,也可能持续受到法律、合同、成本和组织责任的制约。
Databricks Clean Rooms 可以减少传输原始数据的需要。OpenSharing 可以帮助参与者基于当前信息开展工作。但这两项功能都不会赋予机构将信息用于新目的的权限。
这使得机构法律顾问、隐私官员、监察长、项目负责人、安全团队和数据所有者直接进入实施路径。
州级管理又增加了一层复杂性。Medicaid、失业保险和其他项目结合了联邦资金与州级资格认定或付款运营。
GAO 报告称,联邦政府在 2025 财年向州和地方政府提供了估计 1.2 万亿美元的拨款。分布式决策既提高覆盖范围,也增加协调复杂性。
全国性信号网络必须考虑不同系统和项目规则。在一个州被视为不可能发生的事件,可能在另一个州的流程下是有效的。
共享标识符也可能并不可靠。姓名会变更,地址可供多个家庭共用,银行账户也可以合法地为多个家庭成员接收付款。
实体解析应表达不确定性,而不是将相似记录合并为同一个人。调查人员必须看到记录为何被关联,以及哪些属性存在冲突。
机构需要为已确认欺诈、疑似欺诈、不当付款、行政错误和已排除的误报建立共同词汇。混用这些标签会污染共享数据。
被一个项目错误标记的人,不应在其他所有地方悄然变成高风险对象。已确认认定和初步警报需要不同的分发规则。
这正是 Databricks 该提案中的主要对立:一体化、付款前检测,与碎片化、事后执法之间的对立。
一体化路径承诺更早干预和更广泛的可见性。碎片化路径保护组织边界,却让重复作案者在每个项目中都像是新出现的对象。
没有治理,这两条路径都不可接受。完全碎片化会浪费证据,而不受限制的一体化则可能比任何单一机构更快地传播错误。
可行的折中方案是有限用途共享、记录在案的授权、分层置信度和项目特定的行动阈值。
机构还应定义到期规则。调查人员结案后,微弱信号不应无限期地跟随领取者。
采购将影响结果。合同应要求提供可导出的审计记录、记录在案的模型变更、性能报告,以及机构获取建议背后证据的权限。
供应商集中度同样值得关注。如果许多部门依赖同一平台,停机、配置错误或组件遭到入侵都可能影响多个项目。
这并不意味着不应使用共享平台,而是意味着需要应急计划、独立日志、经过测试的恢复程序,以及共享基础设施与机构决策之间的清晰边界。
公共透明度至关重要,因为福利领取者无法评估他们看不见的系统。机构不必披露犯罪分子可能利用的检测阈值。
它们仍可披露哪些数据类别支持筛查、自动化可以建议哪些行动、人工如何审查警报,以及领取者如何质疑不利决定。
没有这些承诺,实时预防可能成为公众与依法授权福利之间一层不透明的屏障。
三项信号将显示实时预防是否有效
下一阶段应依据试点证据、运营保障措施和跨机构采用情况来评判,而不是又一次平台演示。
第一项信号是一个具名的联邦试点,并公布性能指标。Databricks 已描述了可随时实施的架构,但尚未在其公告中指出一项全国性生产部署。
可信的试点应报告已阻止或追回的付款、精确率、误报率、平均审查时间、付款延误和申诉结果。
结果应区分已知规则匹配与机器学习警报。否则,观察者无法判断先进模型是否比既有数据匹配带来额外价值。
试点还应公布基线比较。与不进行筛查相比的表现,提供的信息少于与该机构当前规则、调查和 Do Not Pay 核查相比的表现。
强劲的结果将支持这样一种主张:实时评分在不增加合法申请人负担的情况下改善项目完整性。较高的撤销率或延误率则会削弱这一主张。
第二项信号是针对具有重大后果的警报制定正式治理方案。该方案应界定人工权限、证据标准、保留期限、访问控制、测试和领取者救济途径。
它应说明模型可以建议哪些行动,以及不能启动哪些行动。付款冻结、转介、加入观察名单和起诉不应共用一个通用阈值。
机构应在保护隐私的前提下公布偏差和漂移监控情况。它们还应明确模型审查频率,以及触发暂停的条件。
明确的保障措施将表明,Databricks 将欺诈分析引入支付流程并不只是一个提速项目。对人工监督的模糊承诺,无法解决这一核心风险。
第三个信号是真正的跨机构数据共享协议。正如 Databricks 在其示例中所承认的那样,技术演示通常使用合成数据或经过精心准备的记录。
一份面向生产环境的协议必须明确参与项目、允许使用的数据字段、法律授权、匹配标准以及响应责任。
其价值将取决于各机构是否提供有用且及时的信号。记录不完整的网络可能制造信心,却无法提供完整视野。
更广泛的参与将强化 Databricks 的论点:共享分析能够发现单个机构难以察觉的欺诈方案。长期的法律和运营延误则会表明,软件从来不是最大的障碍。
这些信号应当按这个顺序出现。各机构首先需要证据证明检测方法有效,其次需要规范其使用方式的保障措施,最后才是跨越机构边界的扩展。
这一顺序可降低扩大弱模型或不公平流程规模的风险,也能让监督机构获得明确的介入节点。
实时欺诈防范并非技术与谨慎之间的较量。有效的防范需要两者兼具,因为一个不准确的系统可能在声称保护项目完整性的同时,反而损害这种完整性。
Databricks 已提出一套看似可行的架构。它结合了经过验证的分析方法、更低延迟的处理、受控的数据共享以及人工审核。
尚未得到验证的是围绕该技术建立的运营体系。政府项目必须在保护依赖及时付款人群的同时,将评分转化为合法的决策。
在接受有关全国准备就绪的广泛说法之前,读者应关注公开的试点指标。他们还应追问,各机构是否披露申诉结果、数据共享边界和模型变更。
如果这些细节浮出水面,Databricks 为福利项目引入实时控制措施,可能标志着对“先付款、后追查”模式的重大转变。若这些细节仍被隐藏,这项公告就只是在描述基础设施,而未能证明其公共价值。


