top of page

Affirm Transformer 承保模型提升批准率,但可解释性设定边界

1天前
讀畢需時 14 分鐘

Affirm 在一项实验使符合条件的新用户完成购买量增加 3.4% 后,部署了一套新的 transformer 承保模型。该系统批准了其现有模型原本会拒绝的申请,其中包括部分没有 FICO 评分的消费者。核心矛盾显而易见:Affirm 希望扩大批准范围,同时不承担更高的信贷损失。

该模型并非是接入借贷流程的通用聊天机器人。它会分析消费者信用历史中各类事件的顺序与时间节点。随后,Affirm 将这种学习得到的表征与其既有的承保特征和决策系统相结合。

这一架构挑战了许多信用模型采用的特征工程方法。然而,仅凭更好的预测能力并不足以说明问题。Affirm 还必须解释个别拒绝决定、控制结账延迟、防止不公平结果,并证明新增贷款能够顺利经历完整还款周期。

Affirm Transformer 承保模型已在作出决策

Affirm 已将其 transformer 系统从研究阶段推进至美国实时结账决策。

该公司于 2026 年 9 月 17 日宣布推出这一 transformer 承保 系统。该系统最初聚焦于尚未在 Affirm 完成还款历史的消费者。

这一群体带来了棘手的承保难题。对于新申请人,Affirm 几乎没有或完全没有内部还款历史可供参考。因此,它必须从征信机构记录、所申请购买的商品以及相关商户中提取更多信息。

传统承保模型往往会将信用报告归纳为经工程化处理的变量。这些变量可能包括余额、信用额度使用率、账户数量、查询记录和逾期付款总次数。每项指标都能捕捉有用信息,但也会将不断变化的历史压缩为固定摘要。

Affirm 的 transformer 则处理来自信用报告的结构化记录。transformer 是一种神经网络架构,能够学习有序序列中各元素之间的关系。在这里,这些元素代表的是信用账户、征信查询和每月还款历史,而不是词语。

当两名消费者具有完全相同的汇总统计数据时,这种差异便显得重要。例如,两人都可能有两个月的账户逾期记录。但近期分散在多个账户中的逾期付款,可能意味着与集中于单一账户的较早问题不同的风险模式。

如果工程师设计出恰当变量,传统模型也可以捕捉这种区别。例如,他们可以计算逾期的新近程度、集中度或使用率变化。不过,每一个新变量都需要提出假设、重建历史数据、进行测试并维护生产环境。

transformer 可以学习额外的交互关系,而无需工程师预先定义每一种模式。它会生成嵌入向量,即对底层信用记录进行紧凑数值化表达。这些嵌入向量能够保留简单计数或平均值可能丢失的信号。

Affirm 并未用一个神经网络取代其整套承保技术栈。其 混合架构 分为两个阶段。

首先,transformer 从详细的信用报告信息中学习表征。其次,加速失效时间 XGBoost 模型将这些表征与既有的信用、商户和消费者特征结合。XGBoost 是一种基于树的机器学习方法,广泛用于结构化商业数据。

这一区别避免了一个看似简单却不准确的标题。Affirm 并未证明单独使用 transformer 就能胜过其成熟的承保系统。该公司表示,其仅使用 transformer 的候选模型从未达到足以投入生产的表现水平。

所披露的改进来自于将学习得到的表征与现有模型结合。换言之,新系统扩展了 Affirm 的既有方法,而非将其抛弃。

它的首个生产角色也经过刻意限定。transformer 会对既有系统本会拒绝的符合条件申请进行二次评估。它可以带来额外批准,但最初不能将既有批准改判为拒绝。

Affirm 表示,该模型如今已为新用户处理完整承保流程,包括批准和拒绝。公司还计划将下一代模型扩展至新用户和回访用户。

这一扩展提高了风险影响。仅挽救特定申请的模型,影响范围小于同时控制信贷决策两端的模型。全面部署使准确性、稳定性和解释性对每一位受影响申请人都更为关键。

为什么序列数据会改变信贷决策

真正重要的进展并非 transformer 这一标签,而是 Affirm 试图在信用报告中保留时间与关系信息。

信用报告包含嵌套的历史记录。每个账户都有开户日期、余额、额度、状态和还款记录。这些账户还会与查询记录、使用率变化及其他借贷活动相互作用。

汇总特征可能掩盖这些事件发生的先后顺序。逾期付款总次数无法揭示问题是近期发生还是正在消退。汇总使用率也可能遗漏某一账户余额的突然上升。

Affirm 将信用账户记录和查询记录转换为 token。信用账户记录是单个信用账户的记录。每个 token 都结合了数值字段、分类字段以及经编码的付款序列。

随后,该模型使用注意力机制,对不同记录之间的关系进行权重评估。这使一个账户的历史能够影响系统对另一个账户或近期查询的解读。时间编码也帮助模型区分较早信息与近期变化。

Affirm 使用实际还款结果来训练这些表征。其目标并非复现信用评分或生成文字解释,而是识别与还款风险相关的模式。

transformer 的输出会成为第二阶段 XGBoost 模型的输入。该模型还会接收既有承保变量,包括交易和商户信息。最终评分会进入 Affirm 更广泛的决策系统。

这种设置反映了结账借贷的性质。消费者并非孤立地申请一笔永久性信用额度。Affirm 评估的是一个特定的人、一笔特定购买、一个商户、一个金额和一个时点。

旅行消费说明了交易背景为何可能重要。预订与出发之间的时间间隔会影响风险和还款行为。仅基于静态消费者评分的模型会错过这种购买层面的差异。

这一方法也面向信用档案较薄的消费者。信用档案较薄的消费者拥有部分信用报告信息,但历史不足以生成标准 FICO 评分。缺少该汇总评分,并不意味着底层记录没有有用信号。

Affirm 报告称,在信用档案较薄的消费者中,混合模型带来的改进是其下一代 XGBoost 候选模型的 2.1 倍。这一比较涉及相对于同一生产基线的风险排序改进。

在更广泛的评估人群中,该公司报告称,其增益是下一代 XGBoost 迭代版本实现增益的 1.8 倍。其技术分析通过首次付款逾期的排序来表达这些增益。

首次付款逾期衡量的是首笔计划付款是否会在规定阈值后逾期。Affirm 评估的一个版本采用 60 天阈值,称为 FPDQ60。更好的排序意味着该模型能更有效地区分高风险贷款与低风险贷款。

Affirm 还报告了受试者工作特征曲线下面积,即 ROC-AUC 的相对改善。这项指标评估模型在不同分类阈值下的排序质量。混合模型相较生产环境提升了 3.83%,而下一代 XGBoost 候选模型提升了 2.16%。

这些数字需要谨慎解读。相对 AUC 增益并不等于违约率下降 3.83%,也不等于批准率提高 3.83%。

最具体的商业结果来自在线实验。Affirm 表示,增量批准使端到端转化率提高了 1.2 个百分点,相当于相对增长 3.4%。

这一结果将模型质量直接与商户表现联系起来。更多获批的购物者可能意味着更多完成的购买。但这一价值只有在还款表现仍受控时才能成立。

真正的较量是更好的风险排序与更宽松的信贷之间

Affirm 必须证明,其额外批准来自更精准的风险筛选,而非暂时放宽放贷标准。

每种信用模型都面临批准与损失之间的权衡。降低决策阈值通常会批准更多申请人,但也会引入更多风险。更强的模型应当改善这一边界。

Affirm 表示,与其先前机器学习模型下的可比扩张相比,获得增量批准的贷款表现更好。这正是此次发布背后的核心主张。

该公司并非只报告转化率有所提高。它表示,通过 transformer 产生的额外贷款,相较于早期 XGBoost 模型下等规模的批准扩张,带来了更好的还款表现。

这一比较比单纯的批准率增长更有参考价值。几乎任何贷款机构都可以通过接受更多预期损失来批准更多借款人。更困难的任务,是找到此前被误判风险的申请人。

信用档案较薄的消费者提供了最清晰的检验。一些人没有 FICO 评分,是因为历史有限,而不一定是因为其行为表明高风险。一个能够从其底层账户中提取更多信息的系统,可以识别出被传统摘要信息遮蔽的借款人。

不过,公开证据仍来自 Affirm。该公司提供了相对模型比较、在线实验和初步贷款表现观察,但并未公布外部研究人员可以复现的贷款级数据。

“表现更好”这一表述也留下了重要细节未予披露。Affirm 未提供增量群体的绝对逾期率,也未公布实验样本量或人口统计分布。

这些缺失并不会使结果失效,但会限制外部观察者能够据此得出的结论。

Affirm 的规模使得即便转化率小幅改善也具有商业意义。其 2026 年运营规模 显示,截至 2026 年 6 月 30 日,其活跃消费者达到 2,780 万,较上一年增长 21%。

该公司在 2026 财年处理了 502 亿美元的商品交易总额,同比增长 37%。每位活跃消费者的交易次数达到 7.0 次,高于一年前的 5.8 次。

Affirm 还报告称,消费者交易量在该财年增长了 45%。更高的活跃度提供了更多训练样本和还款结果,同时也放大了系统性模型错误的后果。

这一反馈循环是 Affirm 竞争逻辑的核心。更多交易会产生更多表现数据。更好的数据可支持改进承保,从而提高审批率和商户转化率。

这一循环给其他结账贷款机构带来压力,包括 Klarna、Afterpay、PayPal、Sezzle 和 Zip。它们不必采用与 Affirm 完全相同的架构,但必须保持审批质量、转化率和资金经济效益方面的竞争力。

因此,竞争并非“transformers 对阵无 AI”。信贷提供商多年来一直在使用统计模型和机器学习。真正的竞争在于,谁能安全识别出竞争系统会拒绝、但实际上具备还款能力的交易。

传统银行也面临相关压力。它们的模型通常在账户层面对消费者进行评估,而 Affirm 则对每笔购买单独承保。交易级决策使 Affirm 能够调整条款,或拒绝某一笔购买,而不必对消费者今后的每次申请作出永久性判断。

这种灵活性可以提高精准度,但也可能让消费者更难预判决策。昨天获批的购物者,今天仍可能因另一笔交易被拒。

该模型的成效将取决于,改进后的排序能力能否在不同商户、产品、经济环境和消费者群体中保持稳定。结账实验是一个重要信号,但并非最终答案。

可解释性是 Affirm 无法绕开的约束

信贷模型不仅要准确预测,因为美国贷款机构必须为不利决定提供具体理由。

Transformers 带来了可解释性挑战。它们的预测源于大量记录与学习表征之间的互动。这些表征并不会自动转化为消费者能够理解的理由。

Affirm 表示,其为混合模型开发了专有归因算法。归因方法用于估计哪些输入对某一特定输出影响最大。该公司称,这一方法与其成熟的 XGBoost 解释机制具有同等严谨性。

Affirm 还表示,会验证并持续监控这些解释。不过,该公司尚未公开归因算法,也未发布对其准确性的独立评估。

这一验证缺口很重要,因为看似合理的解释未必忠实反映模型。一种事后解释方法可能给出易读的理由,却无法识别真正驱动模型决策的因素。

消费者金融保护局已明确相关标准。其不利行动规则要求债权人在采取不利行动时提供具体的主要理由。

复杂性并不构成豁免。贷款机构不能以模型过于不透明、难以解释为由,为不清晰的通知辩护。

后续 CFPB 指导强调,泛泛的类别同样可能不充分。如果行为数据驱动了决策,那么“购买历史”这样宽泛的表述可能无法指出相关行为。

Affirm 面临的挑战尤其严峻,因为其 transformer 会捕捉跨时间和跨账户的互动。实际决策可能同时取决于近期性、账户分布、还款模式和交易背景。

将这些互动归纳为一个或数个准确理由,需要谨慎处理。解释必须反映真实模型、保持可理解性,并能在运营通知系统中有效运行。

公平放贷风险构成第二项考验。信贷记录可能反映历史不平等、获取金融服务机会不均、报告错误以及不同的借贷模式。即便排除受保护特征,模型仍可能学习到这些模式。

更强的风险预测器并不必然是更公平的预测器。Affirm 必须测试不同相关群体的结果,并调查无法由合法信贷风险解释的差异。

薄档案消费者的审批使这一问题尤为重要。更好地利用有限记录,能够扩大传统评分体系服务不足的消费者获得信贷的机会;但若学习到的模式成为受保护特征的代理变量,也可能造成新的不利影响。

该公司的公开材料未提供按人口群体划分的审批率或错误率,也没有披露当征信机构记录包含缺失、过期或存在争议的信息时,模型会如何表现。

数据一致性带来另一项风险。历史训练样本必须只反映每次原始决策当时可获得的信息。否则,未来信息可能泄漏到训练中,造成误导性的评估结果。

Affirm 表示,其会在相关历史时点重建输入,并根据开发阶段的行为验证生产工件。该公司还对类别值、缺失字段、填充和时间计算进行了标准化。

这些控制至关重要,因为细微的处理差异都可能改变评分。当系统同时结合 transformer 推理、数据准备和下游树模型时,这些问题会更加复杂。

该系统的专有性质使监管机构、借款人和外部研究人员不得不依赖 Affirm 的披露。独立验证将增强该公司的论据,特别是在解释和群体层面结果方面。

在此之前,相关表现应被视为有前景的公司证据,而非证明每一项决策都更加准确、公平或易于理解。

实时贷款决策几乎不给模型复杂性留下空间

Affirm 的生产成就在一定程度上是基础设施成果,因为模型必须在不足一秒的结账时间预算内完成计算。

结账时的信贷决策要与购物者的耐心竞争。一个能改善风险预测、却增加明显延迟的模型,可能在批准任何人之前就降低转化率。

Affirm 表示,完整计算路径必须控制在不足一秒的延迟预算内。该路径包括准备结构化输入、运行 transformer 推理、生成嵌入,以及评估 XGBoost 模型。

该公司将 transformer 的参数量保持在相对较小的规模,并优化了 CPU 和 GPU 的服务路径。这与需要在数秒内生成文本的大型语言模型有着不同的设计目标。

该模型的规模尚未披露,Affirm 也未公布部署后的中位延迟或尾部延迟。尾部延迟衡量的是较慢请求;即使平均表现看似可以接受,它们也可能损害用户体验。

可靠性与速度同样重要。信用报告的长度和结构各不相同。有些包含大量账户、查询记录和长期还款历史,另一些则字段稀少或缺失。

Affirm 对数值进行归一化、分配一致的类别编码,并对填充位置进行掩码处理。填充让不同长度的记录能够进入标准化计算批次,而不会将空位视为信息。

训练系统使用分布式 GPU、混合精度计算和流式数据。混合精度会在适当场景使用较低数值精度,以降低内存需求。梯度累积则有助于模拟更大的训练批次,而无需同时存储每一个样本。

这些技术让实验更高效,但生产环境带来了另一项问题:导出的模型必须复现开发阶段测试过的行为。预处理或数值执行方面的差异都可能改变风险评分。

Affirm 表示,会在导出过程中验证模型输出。随后,服务系统将在线数据处理、transformer 推理和既有承保栈连接起来。

这种混合设计降低了部分实施风险,因为公司保留了成熟的特征和决策基础设施;但它也增加了依赖关系。任一阶段出现故障,都可能影响最终风险评分。

因此,模型监控不能只覆盖整体逾期率。工程团队还需要关注输入分布、缺失值、嵌入行为、解释稳定性、延迟和下游审批模式。

经济变化又增加了一层复杂性。基于历史还款模式训练的模型,在利率、就业状况、消费者行为或商户结构发生变化时,可能表现减弱。

序列建模并不能消除这一问题。它或许能够发现更丰富的模式,但这些模式仍来自历史数据。在一种信贷环境中学习到的关系,未必能在另一种环境中保持稳定。

Affirm 不断变化的产品组合进一步增加了评估难度。有息分期贷款占其 2026 财年商品交易总额的 70%。Pay-in-X 占 16%,零利息月度分期占 14%。

每种产品的期限、消费者画像、商户经济效益和还款行为都可能不同。一个在某个细分领域表现良好的模型,可能需要在其他领域重新校准。

该公司计划从征信机构记录和 Affirm 内部活动中学习共享表征。这类表征可支持多项信贷任务,而无需为每个用例单独重建特征。

这一策略可能加快未来模型开发,但也可能将存在缺陷的表征影响扩展至多项决策。共享基础需要更严格的验证,因为错误不再局限于单一模型之内。

因此,这项基础设施成就是真实的,但尚不完整。Affirm 已证明,源自 transformer 的特征可以纳入实时结账承保流程。长期运营将决定该方法能否在大规模应用中保持快速、稳定和可审计。

三个信号将决定该模型是否兑现承诺

下一阶段证据应来自还款表现、完整决策部署和透明验证,而不是又一次模型基准测试。

第一个信号是增量审批带来的成熟信贷表现。“成熟”贷款是指已存续足够长时间,以便出现有意义还款结果的贷款。在后续分期到期前,早期表现可能看起来较为有利。

观察人士应在未来几个报告期关注 Affirm 的逾期率、净核销和拨备趋势,也应将这些指标与审批增长和产品组合进行比较。

该公司 2026 财年的信贷损失拨备增长了 29%,而平均持有至投资贷款增长了 27%。这些数据覆盖更广泛的贷款组合,且早于对此次部署进行全面评估。

整体损失的小幅变动,并不能证明模型失败。贷款增长、经济状况和产品结构都可能影响这些数字。更有力的证据,应是在完整还款周期内,将模型驱动的贷款群组与可比对照组联系起来。

稳定的群组表现将支持 Affirm 的核心主张。若增量审批中集中出现损失上升,即便结账转化率仍然更高,也会削弱这一主张。

第二个信号是,该模型在同时获得审批和拒绝决定权之后的表现。最初的二次审核实验只测试了它能否挽回部分被筛选出的申请。

全面承保更加困难。模型现在可以拒绝此前系统可能会批准的申请人。这使假阴性、解释和消费者体验变得更加显眼。

Affirm 还计划为回访用户部署下一次迭代。这些消费者拥有内部还款历史,而这些信息在最初目标人群中大多并不存在。

若在回访用户中取得成功,将表明该架构能够泛化至薄档案和首次申请者之外。若结果疲弱,则可能意味着当 Affirm 已掌握详细内部数据时,学习到的征信记录表征所带来的额外价值较小。

第三个信号涉及解释性与公平性的证据。Affirm 表示,其专有方法的严谨性可媲美现有的 XGBoost 解释。独立测试、监管审查或详尽的方法论说明,将使这一说法更具可信度。

问题不止于合规文书。消费者需要准确的理由,以便纠正错误或改善自身信用状况。商家和资金合作伙伴同样需要确信,扩大的批准范围不会引入隐蔽的法律风险。

更广泛的行业背景提高了这一问题的重要性。CFPB 的 BNPL 市场数据显示,六家接受调查的贷款机构在 2023 年发放了 3.358 亿笔贷款,合计金额达到 452 亿美元。

这一市场持续从短期“分四期付款”产品,延伸至更长期的分期信贷和类似信用卡的服务。随着贷款结构不断扩展,承保决策带来的财务后果也更加重大。

因此,Affirm 的发布不只是一次试图将流行架构应用于借贷业务的尝试。它展示了在受监管、对延迟敏感的决策系统中使用序列模型的一条可行路径。

这一架构也为企业 AI 团队带来了一项有益启示。transformer 是作为成熟技术栈中的一个组件取得成功的。Affirm 保留了结构化特征、XGBoost、受控实验、监控机制以及运营约束。

读者接下来应关注什么?应留意更成熟的还款数据、完整承保流程的结果,以及解释是否真正反映模型实际决策的证据。如果这些信号得到验证,Affirm 的 transformer 承保模型将代表信贷筛选领域的一项重要进步。否则,转化率提升所衡量的或许只是风险周期的开端。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page