top of page

TabPFN-3.5 发布登顶两项基准测试,但真实世界验证才刚刚开始

9月17日
讀畢需時 14 分鐘

Prior Labs 表示,TabPFN-3.5 在两项重要基准测试中位居第一,同时支持 100 万行和最多 20,000 个特征。这一消息值得关注,因为表格基础模型历来在规模较小、更加干净的数据集上表现最佳。TabPFN-3.5 面向的是更大、更宽、也更杂乱的表格数据——这类数据往往会让从业者重新选择梯度提升树。

这一新系列包括开放权重的基础模型、处于 alpha 阶段的 Fast 检查点,以及通过 API 提供的 Plus 和 Thinking 选项。Prior Labs 称,Fast 的运行速度最高可达基础模型的六倍。Thinking 则会投入额外的推理计算资源,以提升预测准确性。

这些说法有一个有价值的外部参照。BeyondArena 基准测试此前发现,传统的树模型和深度学习方法在许多大型、高维及非 IID 任务中仍占据主导地位。非 IID 数据意味着训练记录和测试记录并不遵循相同的分布。TabPFN-3.5 如今声称在这一更广泛的基准测试中领先,对此前的结论提出了挑战。

因此,这场竞争不只是 Prior Labs 与另一家模型厂商之间的较量,而是预训练、通用型表格模型与以调优任务专属树集成为核心的既有工作流之间的竞争。基准测试领先为基础模型路线提供了更有力的证据,但并不能就此确定其在生产环境中的可靠性。

TabPFN-3.5 发布扩展了可实际应用的数据集范围

核心变化并非又一次小幅准确率提升。Prior Labs 扩大了其将 TabPFN 视为可信默认方案的适用范围。

表格基础模型是一种预训练模型,可依据作为上下文提供的带标签表格行进行预测。与传统监督学习不同,它无需为每个数据集都从头训练一个新模型。TabPFN 将这一方法用于分类和回归任务。

开源软件包现已将 TabPFN-3.5 设为默认检查点。根据项目的模型文档,基础版和 Fast 版最多可接受 100 万行及 20,000 个特征。Prior Labs 建议日常使用时采用更低的特征数量,因此这一上限应被视为受支持的边界,而非理想目标。

这一特征上限值得注意,因为宽度带来的问题不同于行数。企业表格可能包含数千个产品标识符、诊断指标、交易字段或衍生变量。许多早期表格基础模型在达到这一规模前便已受限。

基础版 TabPFN-3.5 检查点同样支持分类和回归,这将两类常见预测任务整合进一个模型制品中。用户接受模型许可证后,即可通过 Python 软件包获取权重。

Fast 检查点提供了最明确的速度优先替代方案。Prior Labs 将 TabPFN-3.5-Fast 描述为一个 alpha 模型,运行速度最高可达基础版的六倍。代价是基准测试准确率较低,因此它更适合快速实验或对延迟敏感的工作负载。

TabPFN-3.5-Plus 位于这一产品系列的托管服务端。它新增了对文本和日期的处理能力,这些数据可能与数值列和分类列并存。例如,产品描述、客户备注、保险评估和支持摘要等。

Thinking 在 Plus 工作流中加入更多推理时计算。该技术并不意味着模型像人一样进行推理,而是指 Prior Labs 采用了计算密集度更高的预测过程,以寻求更高的准确率。

Prior Labs 称,Thinking 相较基础模型在 TabArena 上增加了 44 个 Elo 分,在 BeyondArena 上增加了 20 个 Elo 分。Elo 是基于两两对比表现的相对排名指标,并不代表预测准确率直接提升了相应百分比。更大的 Elo 差距意味着在基准测试中获得更稳定的胜利,但其实际意义取决于所评估的数据集。

这一区别很重要。在欺诈检测、医疗筛查或需求规划中,几个准确率百分点的提升可能很有价值。但如果额外延迟或运营限制超过了更优预测所带来的价值,同样的改进也可能无关紧要。

因此,此次发布为团队提供了多个运行取舍点,而非单一检查点。他们可以优先考虑本地控制、更快推理、增强的文本处理,或更多测试时计算。这一选项组合也让评估变得更复杂,因为“TabPFN-3.5”已不再描述一种统一的部署配置。

为什么 BeyondArena 的领先比又一次 TabArena 胜出更重要

TabPFN-3.5 的意义在于,其报告的最大提升似乎出现在早期基础模型处理不佳的数据上。

TabArena 在经过筛选的独立同分布数据集上评估预测系统。IID 评估假设训练样本和测试样本来自相似的统计条件。这种设置有助于进行受控比较,但无法涵盖生产环境中的所有变化。

该基准测试的公开框架目前涵盖数十个数据集、多个数据划分和二十多种方法。它支持调优模型、交叉验证、集成、早停和资源追踪。这些控制措施让 TabArena 比一组人工挑选的演示更具参考价值。

BeyondArena 则有意扩大测试范围。它包括时间划分、分组数据、文本字段、高基数类别、更大的表格和高维特征。时间划分可以用较早的记录训练,并用较新的记录测试,从而反映市场或用户行为的变化。

最初的BeyondArena 研究在 142 个经过筛选的数据集上评估了 11 个模型。研究人员得出的结论是,现有表格基础模型在极小型、小型和传统 IID 数据上表现出色;传统树模型和深度学习系统则仍在许多非 IID、大规模、高维和高基数任务中领先。

这一发现界定了 Prior Labs 需要解决的弱点。一个只能在干净、中等规模基准测试上获胜的模型,无法取代更广泛的数据科学工具链。真实业务表格经常包含漂移、分组实体、不一致字段,以及具有数千种可能取值的标识符。

Prior Labs 表示,TabPFN-3.5 现已在 TabArena 和 BeyondArena 上均位居第一。该公司称,其相较此前 BeyondArena 总榜领先者的优势约为 150 个 Elo 分;在文本丰富、高基数和高维子集上的差距最高达到 250 分。

在独立研究人员复现提交的配置并检验其失败案例之前,这些仍属于发布声明。不过,基准测试目标本身具有相关性。BeyondArena 的设计目的正是暴露标准 IID 排行榜可能掩盖的弱点。

这一声称的领先也改变了竞争参照系。TabPFN 不再只被定位为与其他基础模型竞争,而是在共享评估规则下,与经过调优的梯度提升树、多层感知器和自动化机器学习系统进行比较。

这种比较加大了对 XGBoost、LightGBM、CatBoost、RealMLP 和 AutoGluon 等工具的压力。这些系统依然为人熟知、可配置且部署广泛。它们的优势往往来自强大的任务专属调优,而不是通用预训练。

TabPFN 提供的是另一种取舍。模型在预训练期间吸收了很大一部分学习策略,随后将表格中的带标签行用作上下文。用户有可能减少构建搜索空间、转换列以及组合大量已拟合模型的时间。

仅凭基准排名无法决定这种取舍是否有效。团队还必须比较内存使用、延迟、校准、可复现性、许可证,以及在分布漂移下的行为。BeyondArena 让准确率声明更具意义,但部署仍需要一套更全面的评分标准。

新编码策略瞄准杂乱且宽度更大的表格

TabPFN-3.5 试图通过改变读取单个单元格的方式,并在更困难的合成表格结构上训练,来提升泛化能力。

TabPFN 模型在部署前从生成的合成数据集中学习。推理时,模型会同时接收带标签示例和新行,然后预测目标值。这个过程被称为上下文学习,因为提供的表格构成了即时预测上下文。

这种方法不同于将表格作为文本读取的大语言模型。TabPFN 专为结构化特征和预测目标设计,无需将每一行序列化为自然语言 token。

根据 Prior Labs 的技术报告,新模型引入了学习式 Fourier 特征和经验累积分布排名,用于单元格编码。Fourier 特征通过学习得到的周期函数映射数值,使网络能够以多种方式表示数值关系。

排名部分描述了一个值在其所在列观测分布中的位置。这种表示在单调变换下保持稳定。例如,应用对数变换可以改变数值之间的距离,却不会改变它们的顺序。

这种稳定性降低了模型对手动缩放选择的依赖。此前版本依赖更多预处理组件,包括分位数变换、稳健缩放和奇异值分解特征。TabPFN-3.5 从默认管线中移除了其中若干元素。

更简单的预处理除了便利性外,还具有实际价值。每次转换都会引入配置选择、存储状态,以及训练数据与生产数据之间可能存在的差异。减少这些步骤可以让实验更易于复现。

Prior Labs 还调整了合成预训练分布。生成的任务如今更强调高基数、分组和宽表数据。原则上,这会让模型接触到更多 BeyondArena 为测试而设计的结构。

这一技术带来了一个无法回避的问题:只有当生成的结构能迁移到真实数据时,合成预训练才有帮助。生成器可以覆盖许多统计模式,却仍可能遗漏特定领域中存在的因果关系、组织特性或测量误差。

尽管如此,TabPFN 的早期研究已表明,合成预训练可以实现出人意料的良好迁移。经过同行评审的TabPFN 研究显示,在合成任务上训练的 Transformer 无需传统的任务专属训练,便能在未见过的表格上做出有竞争力的预测。

TabPFN-3.5 扩展了这一思路,而非取而代之。模型规模更大,支持更宽的输入,并采用旨在提升不变性的编码方式。其训练分布也瞄准了早期版本较弱的场景。

模型以单一检查点同时支持分类和回归,也是另一项架构简化。这两类任务如今共享同一个预训练基础,并采用适当的输出行为。对于运行多种预测工作负载的团队而言,这可以减少模型管理开销。

扩展仍然需要围绕模型进行工程优化。开源文档建议使用 GPU,并警告大型数据集在 CPU 上可能运行缓慢。它还建议对预测进行批处理,因为单独调用会反复处理训练上下文。

按行分块和缓存表示有助于控制内存使用。缓存会存储已标注行的内部表示,使多个预测批次能够复用这些工作。这些优化让处理大型输入成为可能,但并不意味着计算不再需要成本。

这一机制解释了此次发布的核心张力。Prior Labs 正在减少任务特定训练,同时更加依赖复杂的预训练模型和优化后的推理路径。工作从重复的模型开发转移到了预训练、上下文推理和托管基础设施。

Thinking 和 Fast 将准确率与速度的取舍变为明确的计算选择

TabPFN-3.5 系列将准确率与计算成本之间的决策明确呈现出来,而不是将其隐藏在单一基准分数之中。

传统表格数据工作流早已显露出这种取舍。数据科学家可以增加超参数试验次数、训练更多交叉验证折,或构建更大的集成模型。这些选择通常能改善结果,但也会消耗更多计算资源和工程时间。

TabPFN-3.5-Thinking 将类似理念带入推理阶段。Prior Labs 在接收到任务后投入额外计算,以期在不重新训练基础模型的情况下获得更强预测。该公司表示,这一过程既不使用互联网搜索,也不使用外部语言模型。

这一设计类似于 AI 其他领域的测试时计算扩展,尽管其实现方式和预测任务有所不同。模型系列可以在预期收益足够高时,为困难表格投入更多计算工作。常规任务则可以使用基础版或 Fast 路径。

根据 Prior Labs 的说法,Thinking 在两个具名基准上均优于基础模型。其报告的 TabArena 提升为 44 分,高于在 BeyondArena 上的 20 分增幅。这种差异表明,额外计算并不会在不同评估条件下带来完全相同的收益。

用户必须判断这种提升是否值得相应的运营成本。一次性的科学分析可以容忍较慢的推理速度。持续处理交易的欺诈筛查服务则可能更看重延迟和可预测的吞吐量。

Fast 则满足相反的需求。其更小的检查点和更低的默认工作负载旨在实现更快预测。Prior Labs 表示,其速度可达到基础模型的六倍,但实际增益取决于硬件、行数、特征数和批处理方式。

基础模型位于两者之间。它在非商业许可证下提供本地开放权重访问,同时保留主要的准确率提升。研究人员和评估者可以检查该软件包、进行受控比较,并复现部分基准工作流。

许可证差异值得关注。开放权重并不自动允许不受限制的商业使用。该仓库指出,近期 TabPFN 权重采用非商业许可证,而商业部署需要 API 安排或其他许可证。

Plus 和 Thinking 通过 Prior Labs 的托管服务和企业渠道交付。这使该公司能够控制其最强能力配置。同时,这也意味着独立评审者无法像检查可下载基础检查点那样,直接检查每一个生产组件。

对于企业买家而言,托管交付带来不同的优势。他们可获得受支持的基础设施、原生文本处理和部署集成。SAP 表示,在收购 Prior Labs 后,TabPFN-3.5 Plus 已可通过 SAP AI Core 使用。

SAP 部署将现金流预测、付款延迟预测、供应商风险、追加销售机会和客户流失列为目标场景。这些都是合理的应用,因为每种场景都可以表示为对结构化业务记录的预测。

然而,企业平台中的可用性并不能验证每一个应用场景。供应商风险模型可能面临罕见事件、不断变化的经济状况、区域差异和不完整标签。基准准确率无法解决这些治理和监控问题。

因此,这四种配置的作用不止于营销细分。它们揭示了 Prior Labs 预计部署决策将发生在哪些方面。团队必须在本地访问、托管文本处理、更高准确率和更低延迟之间做出选择。

这一选择应在固定验证协议下完成评估后再作出。团队可以将 TabPFN-3.5 与现有的梯度提升基线进行比较,然后仅在结果证明合理时测试 Fast 和 Thinking。否则,对基准的热情可能演变为不必要的基础设施复杂性。

基准数字仍未展示的内容

最有力的怀疑论观点并不是基准结果毫无意义,而是汇总排名无法揭示生产环境特定的失效模式。

Elo 将许多数据集层面的结果压缩为一个相对分数。这使排行榜易于阅读,但掩盖了单项错误的规模和位置。一个模型可以总体排名第一,却在某个对特定买家至关重要的狭窄领域失利。

数据集构成也会影响结果。BeyondArena 将评估扩展到标准 IID 任务之外,但其 142 个数据集无法代表每一种工业流程。制造传感器、健康记录、信贷组合和广告系统会产生不同形式的漂移和缺失。

可复现性是第一个开放问题。TabArena 发布了其框架和缓存产物,为研究人员提供了检查提交结果的路径。独立团队仍需在不同硬件、软件包版本和工作负载设置下复现新分数。

托管变体带来了额外的验证缺口。研究人员可以检查并运行开放检查点,但 Plus 和 Thinking 依赖由 Prior Labs 控制的服务。其确切的生产行为可能发生变化,而可下载产物无法捕捉每一个组件。

速度声明也需要同样谨慎。“最高快六倍”描述的是有利的测量条件,而不是通用倍数。小型表格、超宽表格、大型预测批次和不同加速器都可能产生不同的瓶颈。

100 万行和 20,000 个特征的限制也描述的是分别支持的维度。它们不应被理解为承诺:每一张同时达到两个最大值的表格都能在普通硬件上高效运行。内存使用取决于数据形状、估计器数量、缓存设置和预测批次大小。

CPU 性能仍是另一项限制。官方软件包建议使用 GPU 加速,并对更大的 CPU 工作负载设置了保护措施。无法分配合适加速器的团队,可能会发现传统树模型更易于运维。

校准值得直接测试。分类系统必须输出与实际结果频率相对应的概率,尤其是在风险敏感型应用中。区分度指标上的更高排名,并不能保证在本地条件下获得良好校准的概率。

可解释性同样取决于领域。TabPFN 支持解释工具,但预训练神经模型的审计特征不同于紧凑型决策树或受监管的评分卡。特征归因并不会自动确立因果关系或政策合规性。

数据泄漏带来更微妙的风险。基础模型在用户提供数据集之前就已完成预训练,从而减少了某些形式的任务特定过拟合。然而,基准设计者仍必须调查公共数据集是否影响了设计决策或迭代式模型选择。

合成预训练也带来了自身的边界问题。该方法避免直接基于私有业务记录训练,这一点很有价值。但它仍可能编码来自合成生成器的假设,这些假设对某些领域的适配程度可能高于其他领域。

因此,此次发布应改变团队的候选模型清单,而不是终结模型选择。当问题包含带标签的表格数据时,TabPFN-3.5 现在值得纳入比较。它并未消除进行时间验证、子群体分析、漂移测试和运营监控的必要性。

稳健的评估应保留当前生产基线。团队应为每个候选方案使用相同的训练测试划分、泄漏控制、指标和推理预算。还应记录预处理时间和人工调优工作量,因为减少配置正是 TabPFN 价值主张的一部分。

对于文本丰富的表格,评估者应隔离文本列的贡献。他们可以比较基础检查点、Plus,以及一个单独嵌入文本的传统管线。这能够揭示原生文本处理究竟增加了信号,还是仅仅增加了成本。

对于高基数表格,团队应测试未见类别和变化中的标识符。产品代码和客户标识符常常会在部署后演变。当新类别出现时,强劲的静态基准结果可能会减弱。

决定性标准并不是 TabPFN-3.5 是否赢得每一个数据集,而是该模型能否在组织的真实约束下提供足够的准确率和工作流节省。这个结论需要发布公告无法提供的证据。

三个信号将决定 TabPFN-3.5 是否改变默认选择

下一阶段关注的是复现、持续部署表现和竞争性回应,而不是又一项发布声明。

第一个信号是独立复现基准结果。研究人员应通过已发布的 TabArena 和 BeyondArena 管线重新运行开放检查点。数据集层面的结果、资源测量和配置文件,相比另一张汇总图表更能强化这一主张。

成功复现将确认基础模型的排名并不依赖于私有评估路径。若结果出现实质差异,则会削弱这一论点,并将注意力转向软件包版本、硬件假设或提交设置。

第二个信号是来自长期生产使用的证据。SAP 客户现可通过 AI Core 使用 Plus,这为评估付款延迟、供应商风险、客户流失和其他结构化业务预测创造了机会。有价值的报告应包括漂移、校准、延迟和维护工作量。

在不断变化的业务周期中保持稳定表现,将支持基础模型方法。频繁重新训练、昂贵监控或无法解释的子群体失效,则会保留任务特定模型的优势。

第三个信号是成熟表格数据系统如何回应。AutoML 框架和梯度提升库可以集成更强的预训练模型、改进自身默认设置,或结合两种方法。最可能的结果将是混合系统之间的竞争,而不是树模型的消失。

强大的混合系统可以将更小或更混乱的数据集路由至 TabPFN,同时为其他工作负载保留梯度提升。AutoML 平台也可以将 TabPFN 纳入集成模型,让今天的对手成为明天的组件。

对于开发者而言,眼下的行动很直接。使用完全相同的数据划分,将基础和 Fast 检查点与可信基线进行比较。仅当增量准确率的预期价值超过其计算和服务要求时,才测试 Thinking。

像记录代码一样认真记录比较过程。可搜索的工程知识库可以跨团队保存数据集假设、失败实验、模型版本和部署决策。

TabPFN-3.5 的发布令人信服地表明,预训练表格模型已不再局限于规模小、数据干净的数据集。其在双项基准测试中的领先表现,是这一转变迄今最有力的证据。悬而未决的问题是:当真实约束取代排行榜规则后,独立测试和生产环境中的实际表现能否维持这一优势。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page