Google TimesFM-3、天気と販促情報を読み取るも、導入にはなお制約
Google TimesFM-3は現在、複数の関連データストリーム、将来が既知のイベント、そして3億3,000万のパラメータを、単一の予測モデルで処理する。この変更は、Googleの従来アプローチが抱えていた大きな制約に対応するものだ。以前のバージョンは、主に各系列をその過去の履歴から予測していた。
小売業者は今や、売上を来店客数、関連商品の動向、天気予報、祝日、予定済みの販促施策と組み合わせられる。Googleによれば、このモデルはタスク固有のファインチューニングなしに、こうした関係性を利用できる。同社の例では、販促実施日に売上が推定20%増加すると見込んでいる。
競争の焦点はもはや、過去の値からもっともらしい線を生成することだけではない。Google、Amazon、Datadog、Salesforceなどの開発者は、複雑な業務データ向けに再利用可能な予測モデルを構築しようと競っている。Google TimesFM-3は強力なベンチマーク結果を掲げてこの競争に参入したが、学習済み重みの利用は依然として非商用・非本番用途に制限されている。
Google TimesFM-3、単一系列の予測を超える
中心的な変更はネイティブな多変量予測であり、1つのモデルが将来を予測する前に、対象と関連シグナルを結び付けられるようになったことだ。
Google Researchは2026年8月31日にTimesFM-3を発表した。同社はこれをゼロショット時系列基盤モデルと説明している。ゼロショットとは、新しい予測データセットに対し、そのデータセットでタスク固有の学習を事前に行わずに対応できることを意味する。
時系列とは、時間順に並べられた測定値の列にすぎない。日次の店舗売上、時間ごとのサーバー負荷、月次収益、血糖値などが一般的な例だ。予測モデルは過去の測定値を分析し、次に起こることを推定する。
従来のTimesFMリリースでは、多様な時系列データに対応する学習済みモデルを提供することで、このプロセスを容易にしていた。しかし主力モデルはなお、各対象系列を独立して扱っていた。問題を直接捉える範囲は、その系列自身の履歴にとどまっていた。
TimesFM-2.5では、別個のXReg回帰パスを通じて共変量を追加できた。共変量とは、対象の変動を説明する助けとなる外部変数である。この追加は有用だったが、GoogleはTimesFM-2.5をネイティブな多変量予測器として事前学習してはいなかった。
TimesFM-3は、その基盤自体を変えている。モデル発表によると、Googleは対象と補助変数をまとめて処理するように事前学習した。このモデルは、複数の関連対象を同時に予測しながら、それらのつながりを調べられる。
Googleはこれらの入力を、実用上3つのグループに分けている。複数ターゲットは、複数のアイスクリームブランドの売上のように、予測対象となる関連測定値を指す。過去共変量には、記録済みの店舗来客数のように、過去の期間でしか利用できないシグナルが含まれる。
過去・将来共変量は、履歴期間と予測ホライズンの両方にまたがる。これらの入力には、将来の値がすでに分かっているイベントが含まれる。販促カレンダー、祝日予定、計画済みの値引き、外部の天気予報などがこのカテゴリに当てはまる。
この区別は重要だ。業務予測が履歴だけに依存することはほとんどない。週次パターンだけでは、小売業者が次の火曜日に値引きを予定していることは分からない。また、別の入力で表現されなければ、接近する熱波を推測することもできない。
Googleが示した小売の例は、この違いを表している。単変量予測は過去の売上しか見ないため、週ごとの売上パターンを繰り返す。TimesFM-3の予測には将来の販促スケジュールも与えられるため、予定された日に出力が上昇する。
Googleによると、この例では各販促日におよそ20%の売上増加が見込まれる。この数字は普遍的な小売効果を証明するものではなく、仕組みを示すためのものだ。実際の売上反応は、商品、店舗、値引き、季節、顧客行動に左右される。
したがって今回のリリースは、予測リクエストに列を追加するだけの話ではない。Googleは、特定の顧客データセットを見る前に、列をまたぐ関係性を認識するようモデルを学習させた。これが、ゼロショット形式におけるGoogleの多変量予測が掲げる可能性だ。
予測モデルが既知の将来イベントを必要とする理由
予測は、繰り返される履歴と、管理者がすでに計画した将来の介入を区別できるとき、より実用的になる。
多くの業務上の意思決定は、予測対象となる結果そのものを変える。小売業者は価格を変更し、マーケターはキャンペーンを組み、工場は保守を計画し、病院は人員配置を変更する。こうした行動を無視するモデルは、技術的には整合的でも、業務上は無関係な予測を生みかねない。
冷凍デザートの在庫を計画する食料品チェーンを考えてみよう。過去のアイスクリーム売上からは、季節性、曜日パターン、長期的な成長を把握できる。関連するコーンやシロップの売上は、単一商品の系列では見落とす需要関係を示せる。
記録済みの来店客数は、過去の店舗活動に関する根拠を加える。天気予報は予測期間中の状況に関する情報を提供する。販促スケジュールは、小売業者がいつ介入を予定しているかをモデルに正確に伝える。
TimesFM-3は、これらのストリームをまとめて検討できる。計画済みの販促を予期せぬ将来の出来事として扱う必要はない。過去の販促期間と将来の予定日を比較し、それに応じて予測を調整できる。
同じ構造は小売以外にも当てはまる。クラウド事業者は、ワークロード履歴、リリースカレンダー、保守スケジュールを用いて需要を予測できる。エネルギー計画担当者は、負荷測定値を気温予報や既知の産業停止予定と組み合わせられる。
メーカーは、生産スケジュールとともにセンサー値を予測できる。医療分析担当者は、複数のデバイスからの測定値を既知の治療イベントと結び付けられる。財務チームは、1つの会計項目を外挿する代わりに、関連する業務指標を分析できる。
これらのケースは同一ではなく、再利用可能なモデルには規模の大きな違いを処理する能力が求められる。ウェブサイトのトラフィックは数百万に達する一方、デバイスセンサーは小さな小数値を記録することがある。TimesFM-3は各系列を正規化し、こうした規模の差がモデル内部の比較を支配しないようにする。
Googleによると、同システムは実データと合成データによる1兆超の時点で事前学習された。挙げられたデータソースには、GIFT-Evalの事前学習データ、Wikipediaのページビュー、Google Trendsのクエリ、拡張された合成系列が含まれる。
このモデルは3億3,000万のパラメータを持つ。2億パラメータを使用したTimesFM-2.5より大きいが、多くの汎用言語モデルよりは小さい。パラメータ数だけで予測精度や導入コストが決まるわけではない。
より重要なのは、モデルが事前学習で何を学んだかだ。Googleの多変量予測では、ネットワークに単一系列内の形状だけでなく、関係性のパターンを転移させることを求める。これは、多数の接続された変数を持つデータセットで、より迅速な実験につながる可能性がある。
一方で、チームが準備すべきものも変わる。誰も正確に記録していない販促スケジュールから、モデルが恩恵を受けることはできない。気象データは適切な場所と時間間隔に合わせなければならない。ターゲットと共変量には一貫したタイムスタンプが必要だ。
将来共変量は別の依存関係も生む。出力の信頼性は、その将来入力の信頼性を超えられない。不正確な天気予測や中止された販促計画に基づく予測は、その誤りを引き継ぐ。
チームは、予測時点で利用できなかった情報を入力しないようにも注意する必要がある。この問題はデータリークと呼ばれる。データリークは、モデルが将来の根拠を見られるようにすることで、過去の評価を実際より良く見せてしまう。
したがって最も強力なユースケースは、利用可能なすべての列から自動的に予測することではない。明確な意味と利用可能性のルールを持つ変数による、制御された予測である。TimesFM-3はモデリング作業を減らすが、データガバナンスを不要にするわけではない。
TimesFM-3が1回のパスで予測する仕組み
Googleは予測経路を再設計し、時間的な関係と系列間の関係が同じトランスフォーマー内で交互に処理されるようにした。
モデルはまず、連続する32の時点を1つのパッチにまとめる。パッチ化は、長い数値系列をより短いトークン列へ変換する処理だ。個々のピクセルではなく画像パッチを処理する一部のVision Transformerに似ている。
各ターゲットまたは過去のみの共変量は、履歴パッチから作られたトークンを受け取る。過去・将来共変量にはルックアヘッド構造が用いられる。そのトークンには、現在のパッチと、すでに分かっているシグナルを含む将来パッチが含まれる。
これらのトークンは、20層、モデル次元1,280、16個のアテンションヘッドを持つデコーダー専用トランスフォーマーに入力される。これらの仕様は公式のモデルカードに記載されている。アーキテクチャでは2種類のアテンションが交互に使われる。
因果的時間アテンションは、1つの系列内で時間方向に横断的に移動する。因果的とは、各トークンが過去の情報は参照できる一方、未知の将来ターゲットは参照できないことを意味する。この制約は、将来のターゲット値が予測に漏れ込むのを防ぐのに役立つ。
完全変量アテンションは、同じ時点における異なる系列を縦方向に横断する。これにより売上トークンは、販促、天気、来店客数、関連商品のシグナルを参照できる。モデルは、この時間方向と系列間の処理をトランスフォーマースタック全体で交互に行う。
この交互パターンが、TimesFM-3の予測メカニズムの中核を成す。一方の処理で時間とともに何が変化したかを学び、次の処理で変数がどのように連動するかを調べる。
Googleはモデルによるホライズンの生成方法も変更した。以前のTimesFMバージョンでは、1つの出力パッチを予測し、その結果を次のパッチ生成に使用していた。この自己回帰ループは誤差を蓄積し、長いホライズンではレイテンシーを増やす可能性がある。
TimesFM-3は代わりに、要求された将来ホライズン全体にマスクトークンを配置する。マスクトークンは、ネットワークが埋めるべき空の位置として機能する。モデルは出力ごとのループではなく、1回の順伝播で完全な予測を生成する。
未知の将来ターゲットと過去のみの共変量はマスクされたままとなる。予定済みの販促や祝日を含む既知の将来シグナルは可視のまま残る。この構成により、モデルは計画担当者がすでに把握しているイベントを参照しながら、ターゲットのホライズンを埋められる。
このアプローチは、連続した系列の区間を隠す学習手法である連続パッチマスキングを活用している。モデルは、その周囲の文脈から隠された区間を復元することを学ぶ。Googleはこの原理を予測ホライズン全体に適用している。
単一の点推定では、大きな不確実性が隠れてしまう。そのためTimesFM-3は、将来の各ステップで10パーセンタイルから90パーセンタイルをカバーする9つの分位点を出力する。分位点は、確実な1つの答えではなく、もっともらしい結果の範囲を示す。
小売業者は、中央値の推定値を基本在庫計画に使用できる。下側と上側の分位点は、保守的なシナリオと積極的なシナリオを支えられる。それらの差は、モデルがより大きな不確実性を示している箇所も明らかにする。
こうした区間が有用なのは、ローカルデータに対して較正された状態を維持できる場合に限られる。名目上の90パーセンタイルは、実際の予測を繰り返す中でも90パーセンタイルとして振る舞うべきだ。チームは、報告された不確実性が自社の運用環境と一致するかを確認するために、バックテストを行う必要がある。
Googleは公開されているTimesFM repositoryを通じてコードを提供している。このプロジェクトは、単変量入力、複数ターゲット、過去のみの共変量、過去・将来の共変量をサポートする。PyTorchの重みはHugging Faceで別途提供されている。
リポジトリには、Apple silicon向けのMLXバックエンドも含まれる。文書化された例では、多変量ターゲットと両方の共変量タイプをサポートしている。この選択肢によりローカルでの実験のハードルは下がるが、事前学習済みの重みには依然として制限的なライセンスが適用される。
このアーキテクチャは、人間が理解する意味でのビジネス上の因果関係を推論するものではない。割引と売上が過去に連動していれば、モデルはその関係を利用できる。しかし、特定の割引が売上増加を引き起こしたことを立証するわけではない。
ビジネス環境が変化した後には、相関関係が成り立たなくなることもある。競合他社の値下げや在庫切れにより、プロモーションが期待を下回る可能性がある。予測の利用者には、どの入力系列でも完全には捉えられない業務上の文脈がなお必要だ。
強力なベンチマークでも導入判断は決着しない
Googleが報告したランキングによりTimesFM-3は有力なベースラインとなるが、あらゆる非公開データセットでより良い予測を保証するものではない。
GoogleはこのモデルをGIFT-Eval、FEV-Bench、TIMEで評価した。これらの公開スイートは、異なるデータセット、頻度、予測期間、指標にまたがる予測をテストする。同社は、TimesFM-3が3つすべてで最高の平均順位を達成したと報告している。
比較にはAmazonのChronos-2、DatadogのToto 2.0ファミリー、GoogleのTimesFM-2.5が含まれた。Googleによれば、TimesFM-3は単変量モードでも高い性能を示した。系列間情報と共変量を追加すると、平均順位はさらに改善した。
リポジトリでは、FEV-Benchを100件の実世界予測タスクとして説明している。TIMEは50のドメインデータセットと98の評価タスクで構成されるという。GIFT-Evalは、基盤モデル間の幅広いクロスドメイン比較をさらに提供する。
幅広い評価は、特定の有利なデータセットへの依存を抑えるのに役立つ。点予測と確率予測の指標も、異なる性質を検証する。点予測の指標は中心的な予測値を採点し、確率的指標は予測分布の品質を調べる。
ただし、公開された要約結果は、普遍的な改善率ではなく平均順位を用いている。順位はタスク全体における相対的な位置を示す。特定の販売カタログやサーバーフリートで精度がどの程度向上するかを、購入検討者に示すものではない。
Googleは結果そのものも公開した。特に多変量入力と既知の将来共変量については、独立した再現検証が重要になる。チームには、自社の予測期間、欠損データのパターン、意思決定コストに基づく結果が必要だ。
事前学習には別の不確実性もある。このモデルは、公開Webのシグナルや合成データを含む1兆を超える時点を見ている。この広さは転移性能を改善し得る一方、事前学習データと下流データセットの類似性がゼロショット性能に影響する可能性がある。
forecasting generalizationに関する2025年の研究では、以前の時系列基盤モデルが一部の分布シフト下で性能を落とすことが示された。そのテストで使われたのはTimesFM 2.0であり、TimesFM-3ではないため、Googleの新たな結果を無効にするものではない。
それでも、この研究は導入に関連するリスクを示している。ある小規模な電力データセットでは、49,500パラメータの特化モデルが、適応後に大幅に大きい以前のTimesFMモデルを上回った。大規模な事前学習によっても、ローカルな特化の価値は失われなかった。
TimesFM-3は、アーキテクチャと学習が変更されているため、そのようなケースをより良く扱える可能性がある。Googleは、その単変量モードがすでに以前のリリースを上回っているとしている。それでも、新たなベンチマーク首位がドメインシフトの問題を解消するわけではない。
小売データはその課題をよく示す。幅広い時間的パターンで学習したモデルは、通常の季節性をうまく処理できるかもしれない。しかし、店舗移転、品ぞろえの大幅変更、競合の参入、供給障害、顧客行動の急変後には、なお苦戦する可能性がある。
共変量は、それがシフトを表現している場合に役立つ。関連する事象が記録されていなければ、保護効果はほとんどない。過去の関係が成り立たなくなった場合には、モデルを誤った方向へ導くこともある。
したがって、タスク特化型予測との比較が引き続き主な競争となる。基盤モデルは、より迅速な導入と幅広い再利用を約束する。特化モデルは、1社の需要パターン、制約、損失関数へのより密接な適応を約束する。
精度はその判断の一部にすぎない。チームは推論レイテンシ、インフラ要件、障害時の挙動、キャリブレーション、監視の負荷も測定しなければならない。また、在庫や財務の承認に十分なほど予測を説明できるかどうかも判断する必要がある。
TimesFM-3は確率的出力を提供するが、分位点は説明ではない。分析担当者は、モデルが天候やプロモーションに反応した理由をなお特定する必要がある。ある入力を取り除き、変化を測定する統制されたアブレーションテストが役立つ。
バックテストでは、各過去の時点において利用可能だった情報を再現すべきだ。将来の天候入力には、その時点で発行されていた予報を使い、後から記録された観測値を使ってはならない。プロモーション計画も、その後のキャンセルを含め、当時の版を反映すべきである。
チームは単純なベースラインとも比較すべきだ。季節ナイーブ予測、線形回帰、勾配ブースト木、確立された特化モデルも競争力を保ち得る。基盤モデルが導入に値するのは、業務上の成果を改善する場合に限られる。
非商用ライセンスが当面の焦点となる
開発者は今日からTimesFM-3を調査できるが、ほとんどの企業は標準の事前学習済み重みを本番ワークフローに組み込めない。
GoogleはリポジトリのソースコードをApache 2.0で公開した。しかし、TimesFM-3の事前学習済み重みには、別途TimesFM Non-Commercial License v1.0が適用される。リポジトリによれば、これらの重みは非商用かつ非本番用途に制限されている。
この分離は重要だ。ソースが利用可能であれば、研究者は実装を調べ、実験を行える。しかし、小売事業者に対して、標準の重みをライブの補充や収益計画に使う許可を与えるものではない。
バージョン2.5までの以前のTimesFM重みはApache 2.0のままである。そのため、チームは同じプロジェクト内で異なる権利条件に出会う可能性がある。使用予定の正確なチェックポイントに付与されたライセンスを確認する必要がある。
この制限は競争圧力にも影響する。Amazon、Datadog、Salesforce、Nixtla、IBMなどの組織が、再利用可能な予測システムを開発している。利用可能性、統合性、サポート、ライセンスは、わずかなベンチマーク上の優位性を上回り得る。
Googleは、BigQuery統合が今後数週間で提供されるとしている。この展開は、最初に注目すべき重要なシグナルだ。顧客がTimesFM-3へどのようにアクセスするのか、ホスト型利用にはどの商用条件が適用されるのかが明確になるはずだ。
BigQueryはすでに、TimesFMベースの単変量予測向けにAI.FORECAST関数を提供している。ネイティブな多変量版が登場すれば、新モデルは既存のエンタープライズデータにより近づく可能性がある。SQLでのアクセスにより、予測チームに必要な統合作業も削減される。
2つ目のシグナルは、独立したベンチマーク再現だ。研究者は3つすべての評価スイートで結果を確認し、困難な分布シフトをテストすべきである。公開比較では、平均順位に加えて実際の指標差も報告すべきだ。
3つ目のシグナルは、本番での証拠である。ケーススタディでは、共変量が在庫配分、人員配置、キャパシティ計画、異常への備えといった意思決定を改善するかを示すべきだ。有用な報告には、モデル精度だけでなく、ベースラインとの比較と誤差コストも含まれる。
本番サービスが提供されれば、汎用予測器が研究実験を超えて活用できるというGoogleの主張は強まる。商用経路がないままライセンス制限が続けば、その結論は弱まる。開発者はモデルを研究できても、導入には別のシステムを選ぶことになるだろう。
独立した結果は競争状況も変え得る。未知のビジネスデータセットで一貫した改善が得られれば、Googleのゼロショット戦略を支持することになる。結果がまちまちなら、TimesFM-3を最終的な予測システムではなく、出発点となるベースラインとして扱う根拠が強まる。
それでも、このモデルの公開は意味のある技術的前進を示す。Googleの以前の基盤モデルは、複数のターゲットを履歴シグナルと既知の将来シグナルにネイティブに組み合わせることができなかった。TimesFM-3は、こうした関係を事前学習と推論の一部に組み込んでいる。
この能力により、基盤予測は実際の計画問題に近づく。企業は売上、天候、トラフィック、割引、祝日を孤立した時間軸として経験しているわけではない。予測システムも、これらのつながりを無視する必要はないはずだ。
それでも未来はモデルの制御の外にある。天気予報は変わり、プロモーションは中止され、顧客行動は変化する。9つの分位点は不確実性を表現できるが、不完全な入力を確実性へ変えることはできない。
開発者にとって、次に取るべき合理的な行動は、統制されたオフライン評価である。Google TimesFM-3を現行の本番ベースラインと比較し、過去時点の情報境界を保ち、予測のキャリブレーションをテストする。その後、ダウンロード可能な重みが現在提供していない商用経路について、BigQueryの動向を注視すべきだ。



