top of page

Google TimesFM-3 现可读取天气与促销信息,但部署仍受限制

9月13日
讀畢需時 12 分鐘

Google TimesFM-3 现可在单一预测模型中处理多条相关数据流、已知的未来事件以及 3.3 亿个参数。这项改变解决了 Google 先前方法的一项主要局限:早期版本主要依据单一序列自身的历史数据进行预测。

如今,零售商可以将销售额与客流量、相关产品、天气预报、节假日和预定促销活动结合起来。Google 表示,该模型无需针对具体任务进行微调,即可利用这些关联。其示例预计,促销日的销售额将提升约 20%。

更广泛的竞争已不再只是根据过去数值生成一条看似合理的曲线。Google、Amazon、Datadog、Salesforce 及其他开发者正在竞相构建可复用的预测模型,以应对杂乱的运营数据。Google TimesFM-3 凭借亮眼的基准测试主张加入这场竞争,但其预训练权重仍限于非商业和非生产用途。

Google TimesFM-3 不再一次只处理单一序列

核心变化在于原生多变量预测,使一个模型能够在预测未来前,将目标变量与相关信号联系起来。

Google Research 于 2026 年 8 月 31 日发布了 TimesFM-3。该公司将其描述为一款零样本时间序列基础模型。零样本意味着,它可以在未先接受该数据集专项训练的情况下,处理新的预测数据集。

时间序列就是按时间排列的一连串测量值。每日门店销售额、每小时服务器负载、月度营收和血糖读数都是常见示例。预测模型研究此前的测量数据,并估计接下来会发生什么。

此前的 TimesFM 版本通过为多种时间数据提供预训练模型,简化了这一过程。不过,其主模型仍将每个目标序列视为彼此独立。它对问题的直接观察仅限于该序列自身的历史记录。

TimesFM-2.5 可以通过单独的 XReg 回归路径添加协变量。协变量是有助于解释目标变量变化的外部变量。这项补充很有价值,但 Google 并未将 TimesFM-2.5 预训练为原生多变量预测器。

TimesFM-3 改变了基础本身。根据这篇模型公告,Google 对其进行了预训练,使其能够同时处理目标变量和辅助变量。该模型可以在考察变量间关联的同时,预测多个相关目标。

Google 将这些输入划分为三类实用分组。多个目标变量涵盖正在预测的相关测量值,例如多个冰淇淋品牌的销售额。历史协变量包括仅适用于此前时期的信号,例如已记录的门店客流量。

历史-未来协变量则横跨历史时期和预测区间。这些输入包括未来数值已知的事件。促销日历、节假日安排、计划折扣或外部天气预报都属于这一类别。

这一区分很重要,因为商业预测很少只依赖历史。每周模式无法知道零售商下周二安排了折扣。除非有另一个输入来表示它,否则模型也无法推断即将到来的热浪。

Google 的说明性零售示例展示了这种差异。单变量预测由于只能看到此前销售额,便会重复每周销售模式。TimesFM-3 的预测还会接收未来促销安排,因此其输出会在预定日期上升。

Google 表示,该示例在每个促销日都显示销售额预计增长约 20%。这一数字说明的是其机制,而非证明普遍适用的零售效果。实际销售反应将取决于产品、门店、折扣、季节和消费者行为。

因此,此次发布不仅仅是为预测请求增加额外列。Google 在模型接触特定客户数据集前,就训练其识别跨列关系。这正是零样本形式下 Google 多变量预测的承诺。

为什么预测模型需要已知未来事件

当预测能够区分重复出现的历史规律与管理者已计划好的未来干预时,它会更有价值。

许多运营决策会改变被预测的结果。零售商调整价格,营销人员安排活动,工厂计划维护,医院调整排班。忽略这些行动的模型或许能给出技术上一致的预测,却可能与实际运营无关。

以一家计划冷冻甜点库存的连锁杂货店为例。历史冰淇淋销售额可以揭示季节性、工作日模式和长期增长趋势。相关的蛋筒和糖浆销售额则能够暴露单一产品序列遗漏的需求关联。

已记录的客流量为早期门店活动提供了额外证据。天气预报提供预测期内环境条件的信息。促销安排则准确告知模型零售商预计何时实施干预。

TimesFM-3 可以一并考察这些数据流。它无需将计划中的促销假定为意料之外的未来事件。它可以比较以往促销期与未来预定日期,并相应调整预测。

同样的结构也适用于零售之外的领域。云服务运营商可以利用工作负载历史、发布日历和维护计划来预测需求。能源规划人员则可以将负载测量值与温度预报和已知的工业停工结合起来。

制造商可将传感器读数与生产计划一同预测。医疗分析人员可将多台设备的测量数据与已知治疗事件关联起来。财务团队则可以研究相关运营指标,而非外推单一会计科目。

这些情境并不相同,而可复用模型必须应对规模上的巨大差异。网站流量可能达到数百万,而设备传感器可能记录很小的小数值。TimesFM-3 会对每个序列进行归一化,从而避免这些尺度主导模型的内部比较。

Google 表示,其在来自真实和合成来源的超过一万亿个时间点上预训练了该系统。列出的来源包括 GIFT-Eval 预训练数据、Wikipedia 页面浏览量、Google Trends 查询以及增强型合成序列。

该模型包含 3.3 亿个参数。它比使用 2 亿参数的 TimesFM-2.5 更大,但仍小于许多通用语言模型。参数数量本身并不能决定预测准确性或部署成本。

更重要的区别在于模型在预训练期间学到了什么。Google 多变量预测要求网络迁移变量关系模式,而不只是迁移单一序列内部的形态。这为在拥有大量关联变量的数据集上更快开展实验带来了可能性。

这也改变了团队必须准备的内容。模型无法从没人准确记录的促销安排中获益。天气数据必须与正确的地点和时间区间对齐。目标变量和协变量需要一致的时间戳。

未来协变量还引入了另一项依赖。输出的可靠程度只能与这些未来输入一样高。基于不准确天气预报或已取消促销计划的预测,也会继承这些误差。

团队还必须避免提供在作出预测时本不应获得的信息。这个问题称为数据泄漏。数据泄漏会让历史评估结果看起来更好,因为它让模型看到了来自未来的证据。

因此,最强的使用场景并非基于每一列可用数据进行自动预测,而是采用具有清晰含义和可用性规则的变量进行受控预测。TimesFM-3 减少了建模工作,但并未消除数据治理需求。

TimesFM-3 如何在一次前向计算中完成预测

Google 重新设计了预测路径,使时间关系与跨序列关系在同一个 transformer 内交替运作。

模型首先将连续 32 个时间点分组为一个 patch。分块会将长数值序列转换为更短的 token 序列。这类似于一些视觉 transformer 处理图像 patch 而非单个像素的方式。

每个目标变量或仅历史协变量都会接收由其历史 patch 构成的 token。历史-未来协变量则采用前瞻构造。它们的 token 包含当前 patch 以及含有已知信号的未来 patch。

这些 token 会进入一个仅解码器 transformer,该模型具有 20 层、1,280 的模型维度和 16 个注意力头。这些规格载于官方模型卡。其架构交替使用两种注意力机制。

因果时间注意力在单个序列内沿时间轴横向移动。因果意味着每个 token 可以查看此前信息,但不能查看未知的未来目标变量。这一限制有助于防止未来目标值泄漏到预测中。

全变量注意力则在同一时间位置的不同序列之间纵向移动。它允许销售 token 考察促销、天气、客流量或相关产品信号。模型在其 transformer 堆栈中交替执行这些时间和跨序列操作。

这种交替模式定义了 TimesFM-3 预测的核心机制。一次操作学习随时间发生了什么变化,下一次则考察变量如何共同变化。

Google 还改变了模型生成预测区间的方式。早期 TimesFM 版本会预测一个输出 patch,然后在生成下一个 patch 时使用该结果。该自回归循环可能累积误差,并在长预测区间内增加延迟。

TimesFM-3 则在所请求的未来预测区间内放置掩码 token。掩码 token 相当于网络必须填补的空位。模型通过一次前向计算生成完整预测,而非逐个输出循环生成。

未知的未来目标变量和仅历史协变量保持掩码状态。包括预定促销和节假日在内的已知未来信号则保持可见。这种安排使模型能够在参考规划者已知事件的同时,填补目标预测区间。

该方法借鉴了连续 patch 掩码,这是一种隐藏序列连续片段的训练方法。模型学习根据周围上下文重建这些片段。Google 将这一原则应用于整个预测区间。

单一点估计会掩盖大量不确定性。因此,TimesFM-3 会在每个未来步骤生成九个分位数,覆盖第 10 至第 90 百分位。分位数描述的是一系列可能结果,而非一个确定答案。

零售商可以将中位数估计用于基础库存计划。较低和较高的分位数可支持保守和激进情景。它们之间的差距也揭示了模型在哪些地方表达出更大的不确定性。

这些区间只有在本地数据上保持校准时才有用。名义上的第 90 百分位在反复进行的真实预测中应表现得与其含义相符。团队需要通过回测确定报告的不确定性是否符合其运营环境。

Google 通过公开的 TimesFM repository 提供代码。该项目支持单变量输入、多个目标、仅历史协变量,以及历史-未来协变量。PyTorch 权重可通过 Hugging Face 单独获取。

该代码库还包含面向 Apple silicon 的 MLX 后端。其文档示例支持多变量目标和两类协变量。该选项降低了本地实验的门槛,但预训练权重仍受限制性许可证约束。

这种架构并不会以人类的方式推理商业因果关系。如果折扣和销售额在历史上同步变动,模型可以利用这种关系。它并不能证明某项特定折扣导致了增长。

在商业环境变化后,相关性也可能失效。促销活动可能因竞争对手降价或库存耗尽而表现不佳。预测使用者仍需要任何输入序列都无法完整捕捉的运营背景信息。

强劲的基准测试并不能解决部署问题

Google 公布的排名使 TimesFM-3 成为一个严肃的基线方案,但并不保证它能在每个私有数据集上提供更好的预测。

Google 在 GIFT-Eval、FEV-Bench 和 TIME 上评估了该模型。这些公开测试套件针对不同的数据集、频率、预测跨度和指标检验预测能力。该公司称,TimesFM-3 在三项测试中均取得了最佳平均排名。

比较对象包括 Amazon 的 Chronos-2、Datadog 的 Toto 2.0 系列,以及 Google 的 TimesFM-2.5。Google 表示,TimesFM-3 即使在单变量模式下也表现强劲。加入跨序列信息和协变量后,其平均排名进一步提升。

代码库将 FEV-Bench 描述为包含 100 项真实世界预测任务。它将 TIME 描述为涵盖 50 个领域数据集和 98 项评估任务。GIFT-Eval 则提供了基础模型之间另一项广泛的跨领域比较。

广度有助于降低对单一有利数据集的依赖。点预测指标和概率预测指标也检验不同维度的质量。点预测指标衡量中心预测,而概率预测指标考察预测分布的质量。

不过,公开汇总的结果采用平均排名,而非某个通用的改进百分比。排名反映各项任务中的相对位置。它无法告诉买方,准确率会在特定销售目录或服务器集群上提升多少。

Google 也公布了结果本身。独立复现将十分重要,尤其是针对多变量输入和已知未来协变量。团队需要基于自身预测跨度、缺失数据模式和决策成本得出结果。

预训练带来了另一项不确定性。该模型接触过超过一万亿个时间点,其中包括公开网络信号和合成数据。这种广度可以改善迁移能力,但预训练数据与下游数据集之间的相似性会影响零样本表现。

一项关于预测泛化的 2025 年研究发现,早期时间序列基础模型在某些分布偏移下表现减弱。其测试对象是 TimesFM 2.0,而非 TimesFM-3,因此并不能推翻 Google 的新结果。

这项研究仍指出了一项相关的部署风险。在一个小型电力数据集上,一个拥有 49,500 个参数的专用模型在适配后优于规模大得多的早期 TimesFM 模型。更大规模的预训练并未抹去本地专门化的价值。

由于架构和训练方式已经改变,TimesFM-3 或许能更好地处理此类情况。Google 表示,其单变量模式已优于早期版本。尽管如此,新的基准领先地位并不能消除领域偏移问题。

零售数据说明了这一挑战。一个在广泛时间模式上训练的模型,可能能够很好地处理正常季节性。但在门店搬迁、商品组合全面调整、竞争对手进入、供应中断或客户行为突变后,它仍可能面临困难。

当协变量能够代表这种变化时,它们会有所帮助。当相关事件未被记录时,它们提供的保护有限。当历史关系不再成立时,它们也可能误导模型。

因此,与任务专用预测方案的比较仍是主要竞争。基础模型承诺更快的部署和更广泛的复用。专用模型则承诺更贴近某家公司的需求模式、约束条件和损失函数。

准确率只是这一决策的一部分。团队还必须衡量推理延迟、基础设施要求、故障行为、校准能力和监控工作量。他们还必须判断,预测是否能够得到足够清晰的解释,以支持库存或财务审批。

TimesFM-3 提供概率输出,但分位数并不是解释。分析师仍需要判断模型为何会对天气或促销作出反应。通过移除某项输入并测量变化,受控消融测试可以提供帮助。

回测应重现每个历史截点当时可获得的信息。未来天气输入应来自当时发布的预测,而不是之后记录的观测值。促销计划应反映其早期版本,包括后来的取消情况。

团队还应与简单基线进行比较。季节性朴素预测、线性回归、梯度提升树和成熟的专用模型仍可能具有竞争力。基础模型只有在改善运营结果时,才真正值得采用。

非商业许可证构成了当前最直接的压力点

开发者今天就可以检查 TimesFM-3,但大多数公司无法将其默认预训练权重纳入生产工作流。

Google 在 Apache 2.0 许可下发布了代码库的源代码。然而,TimesFM-3 的预训练权重采用独立的 TimesFM Non-Commercial License v1.0。代码库称,这些权重仅限非商业和非生产用途。

这种区分至关重要。源代码开放让研究人员能够检查实现并运行实验。但这并不授予零售商将默认权重用于实时补货或营收规划的许可。

截至 2.5 版本的早期 TimesFM 权重仍采用 Apache 2.0。团队因此可能在同一项目中遇到不同的权利条件。他们需要检查计划使用的确切 checkpoint 所附带的许可证。

这种限制也塑造了竞争压力。Amazon、Datadog、Salesforce、Nixtla、IBM 和其他组织都在开发可复用的预测系统。可用性、集成、支持和许可条件可能比微弱的基准领先更重要。

Google 表示,BigQuery 集成将在未来几周内推出。这一发布是首个值得关注的重要信号。它应能澄清客户如何访问 TimesFM-3,以及托管使用适用哪些商业条款。

BigQuery 已通过 AI.FORECAST 函数提供基于 TimesFM 的单变量预测。原生多变量版本可能让新模型更贴近现有企业数据。SQL 访问也将减少预测团队所需的集成工作。

第二个信号是独立基准复现。研究人员应确认三套评估中的结果,并测试困难的分布偏移情形。公开比较也应在平均排名之外报告实际指标差异。

第三个信号是生产证据。案例研究应展示协变量是否改善了库存分配、人员配置、容量规划或异常准备等决策。有价值的报告将包含基线比较和误差成本,而不只是模型准确率。

生产服务将强化 Google 关于通用预测器能够超越研究实验的主张。若许可证限制持续存在而没有商业路径,这一结论将被削弱。开发者可以研究该模型,却会在部署时选择其他系统。

独立结果也可能改变竞争格局。在未见过的商业数据集上持续取得收益,将支持 Google 的零样本策略。结果若参差不齐,则会强化这样一种观点:应将 TimesFM-3 视为起始基线,而非最终预测系统。

该模型的发布仍标志着一项有意义的技术进步。Google 的前一代基础模型无法原生结合多个目标、历史信号和已知未来信号。TimesFM-3 将这些关系纳入预训练和推理过程。

这一能力让基础预测更接近实际规划问题。企业不会将销售、天气、流量、折扣和节假日视为彼此孤立的时间线。其预测系统也不应被迫忽略这些联系。

然而,未来仍不受模型控制。天气预报会变化,促销会被取消,客户行为也会转变。九个分位数可以表达不确定性,但无法将不完整的输入转化为确定性。

对开发者而言,合理的下一步是进行受控的离线评估。将 Google TimesFM-3 与当前生产基线进行比较,保留历史信息边界,并测试预测校准情况。随后关注 BigQuery,以了解可下载权重目前尚未提供的商业路径。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page