top of page

Google TimesFM-3 Agora Lê Clima e Promoções, mas Implantação Continua Restrita

13 de set.
13 min de leitura

O Google TimesFM-3 agora processa múltiplos fluxos de dados relacionados, eventos futuros conhecidos e 330 milhões de parâmetros em um único modelo de previsão. A mudança aborda uma grande limitação da abordagem anterior do Google. As versões anteriores projetavam principalmente uma série a partir de seu próprio histórico.

Agora, um varejista pode combinar vendas com fluxo de clientes, produtos relacionados, previsões do tempo, feriados e promoções programadas. O Google afirma que o modelo pode usar essas relações sem ajuste fino específico para cada tarefa. Seu exemplo prevê um aumento estimado de 20% nas vendas em dias de promoção.

A disputa mais ampla já não se resume a gerar uma linha plausível a partir de valores passados. Google, Amazon, Datadog, Salesforce e outros desenvolvedores competem para criar modelos de previsão reutilizáveis para dados operacionais desorganizados. O Google TimesFM-3 entra nessa disputa com fortes alegações de desempenho em benchmarks, mas seus pesos pré-treinados continuam restritos ao uso não comercial e não produtivo.

Google TimesFM-3 Vai Além de Uma Série por Vez

A mudança central é a previsão multivariada nativa, que permite que um modelo conecte um alvo a sinais relacionados antes de projetar seu futuro.

O Google Research anunciou o TimesFM-3 em 31 de agosto de 2026. A empresa o descreve como um modelo fundacional zero-shot para séries temporais. Zero-shot significa que ele pode lidar com um novo conjunto de dados de previsão sem antes receber treinamento específico para aquela tarefa nesse conjunto.

Uma série temporal é simplesmente uma sequência de medições organizadas pelo tempo. Vendas diárias de lojas, carga horária de servidores, receita mensal e leituras de glicose são exemplos comuns. Modelos de previsão estudam medições anteriores e estimam o que virá em seguida.

As versões anteriores do TimesFM facilitaram esse processo ao fornecer um modelo pré-treinado para muitos tipos de dados temporais. No entanto, o modelo principal ainda tratava cada série-alvo de forma independente. Sua visão direta do problema se limitava ao histórico da própria série.

O TimesFM-2.5 podia adicionar covariáveis por meio de um caminho separado de regressão XReg. Covariáveis são variáveis externas que ajudam a explicar o movimento de um alvo. Essa adição foi útil, mas o Google não pré-treinou o TimesFM-2.5 como um previsor multivariado nativo.

O TimesFM-3 muda a própria base. Segundo o anúncio do modelo, o Google o pré-treinou para processar alvos e variáveis de apoio em conjunto. O modelo pode prever vários alvos relacionados simultaneamente enquanto examina as conexões entre eles.

O Google divide essas entradas em três grupos úteis. Múltiplos alvos abrangem as medições relacionadas que estão sendo previstas, como vendas de várias marcas de sorvete. Covariáveis passadas incluem sinais disponíveis apenas em períodos anteriores, como o fluxo registrado de clientes nas lojas.

Covariáveis de passado-futuro se estendem tanto pelo período histórico quanto pelo horizonte de previsão. Essas entradas incluem eventos cujos valores futuros já são conhecidos. Um calendário de promoções, cronograma de feriados, desconto planejado ou previsão meteorológica externa pode se enquadrar nessa categoria.

Essa distinção importa porque previsões empresariais raramente dependem apenas do histórico. Um padrão semanal não pode saber que um varejista agendou um desconto para a próxima terça-feira. Também não pode inferir uma onda de calor iminente, a menos que outra entrada a represente.

O exemplo ilustrativo de varejo do Google mostra a diferença. Uma projeção univariada repete um padrão semanal de vendas porque vê apenas vendas anteriores. A previsão do TimesFM-3 também recebe o cronograma futuro de promoções, de modo que sua saída sobe nos dias programados.

O Google afirma que o exemplo produz um aumento previsto nas vendas de aproximadamente 20% em cada dia de promoção. Esse número ilustra o mecanismo, em vez de provar um efeito universal no varejo. As respostas reais das vendas dependerão do produto, da loja, do desconto, da estação e do comportamento dos clientes.

Portanto, o lançamento envolve mais do que adicionar colunas extras a uma solicitação de previsão. O Google treinou o modelo para reconhecer relações entre colunas antes de ver o conjunto de dados de um cliente específico. Essa é a promessa por trás da previsão multivariada do Google em formato zero-shot.

Por que Modelos de Previsão Precisam de Eventos Futuros Conhecidos

Uma previsão se torna mais útil quando consegue distinguir o histórico recorrente de uma intervenção futura que os gestores já planejaram.

Muitas decisões operacionais alteram o resultado que está sendo previsto. Varejistas mudam preços, profissionais de marketing programam campanhas, fábricas planejam manutenção e hospitais alteram equipes. Um modelo que ignora essas ações pode produzir uma previsão tecnicamente consistente, mas operacionalmente irrelevante.

Considere uma rede de supermercados planejando o estoque de sobremesas congeladas. As vendas históricas de sorvete podem revelar sazonalidade, padrões por dia da semana e crescimento de longo prazo. Vendas relacionadas de casquinhas e caldas podem expor relações de demanda que uma série de produtos isolada não capta.

O fluxo registrado de clientes adiciona evidências sobre a atividade anterior nas lojas. Previsões meteorológicas oferecem informações sobre as condições durante o período de previsão. Os cronogramas de promoção dizem ao modelo exatamente quando o varejista espera uma intervenção.

O TimesFM-3 pode examinar esses fluxos em conjunto. Ele não precisa fingir que a promoção planejada é uma surpresa futura inesperada. Pode comparar períodos promocionais anteriores com datas futuras agendadas e ajustar a previsão de acordo.

A mesma estrutura se aplica fora do varejo. Um operador de nuvem pode prever a demanda usando histórico de cargas de trabalho, calendários de lançamentos e cronogramas de manutenção. Um planejador de energia poderia combinar medições de carga com previsões de temperatura e paralisações industriais conhecidas.

Fabricantes podem projetar leituras de sensores junto com cronogramas de produção. Analistas de saúde poderiam conectar medições de vários dispositivos a eventos de tratamento conhecidos. Equipes financeiras poderiam examinar métricas operacionais relacionadas em vez de extrapolar uma única linha contábil.

Esses casos não são idênticos, e um modelo reutilizável precisa lidar com grandes diferenças de escala. O tráfego de um site pode chegar a milhões, enquanto um sensor de dispositivo registra pequenos valores decimais. O TimesFM-3 normaliza cada série para que essas escalas não dominem as comparações internas do modelo.

O Google afirma que pré-treinou o sistema com mais de um trilhão de pontos temporais provenientes de fontes reais e sintéticas. As fontes listadas incluem dados de pré-treinamento do GIFT-Eval, visualizações de páginas da Wikipedia, consultas do Google Trends e sequências sintéticas aumentadas.

O modelo contém 330 milhões de parâmetros. Isso o torna maior que o TimesFM-2.5, que usava 200 milhões de parâmetros, mas menor que muitos modelos de linguagem de uso geral. A contagem de parâmetros por si só não determina a precisão da previsão nem o custo de implantação.

A distinção mais importante é o que o modelo aprendeu durante o pré-treinamento. A previsão multivariada do Google pede que a rede transfira padrões de relacionamento, e não apenas formas dentro de uma única série. Isso cria a possibilidade de experimentos mais rápidos em conjuntos de dados com muitas variáveis conectadas.

Também muda o que as equipes precisam preparar. Um modelo não pode se beneficiar de um cronograma de promoções que ninguém registrou com precisão. Os dados meteorológicos precisam corresponder aos locais e intervalos de tempo corretos. Alvos e covariáveis precisam ter timestamps consistentes.

As covariáveis futuras introduzem outra dependência. A saída só pode ser tão confiável quanto essas entradas futuras. Uma previsão baseada em uma projeção meteorológica imprecisa ou em um plano promocional abandonado herda esse erro.

As equipes também devem evitar fornecer informações que não estariam disponíveis quando a previsão foi feita. Esse problema é chamado de vazamento de dados. O vazamento faz com que avaliações históricas pareçam melhores ao permitir que um modelo veja evidências do futuro.

Portanto, o caso de uso mais forte não é a previsão automática a partir de todas as colunas disponíveis. É uma previsão controlada, com variáveis que têm significados claros e regras de disponibilidade. O TimesFM-3 reduz o trabalho de modelagem, mas não elimina a governança de dados.

Como a Previsão do TimesFM-3 Funciona em Uma Única Passagem

O Google redesenhou o caminho de previsão para que relações temporais e relações entre séries se alternem dentro do mesmo transformer.

O modelo começa agrupando 32 pontos temporais consecutivos em um patch. O patching converte uma longa sequência numérica em uma série menor de tokens. Ele se assemelha à maneira como alguns vision transformers processam patches de imagem em vez de pixels individuais.

Cada alvo ou covariável apenas histórica recebe tokens formados a partir de seus patches históricos. Covariáveis de passado-futuro usam uma construção com antecipação. Seus tokens incluem o patch atual e patches futuros que contêm sinais já conhecidos.

Esses tokens entram em um transformer somente decodificador com 20 camadas, dimensão de modelo de 1.280 e 16 cabeças de atenção. Essas especificações aparecem no cartão oficial do modelo. A arquitetura alterna duas formas de atenção.

A atenção temporal causal se move horizontalmente ao longo do tempo dentro de uma série. Causal significa que cada token pode inspecionar informações anteriores, mas não alvos futuros desconhecidos. Essa restrição ajuda a impedir que valores futuros do alvo vazem para a previsão.

A atenção completa entre variáveis se move verticalmente entre diferentes séries na mesma posição temporal. Ela permite que tokens de vendas examinem sinais de promoção, clima, tráfego ou produtos relacionados. O modelo alterna essas operações temporais e entre séries em sua pilha de transformers.

Esse padrão alternado define o mecanismo central de previsão do TimesFM-3. Uma operação aprende o que mudou ao longo do tempo. A seguinte examina como as variáveis se movem em conjunto.

O Google também mudou como o modelo gera o horizonte. As versões anteriores do TimesFM previam um patch de saída e então usavam esse resultado ao gerar o próximo. Esse ciclo autorregressivo pode acumular erros e adicionar latência em horizontes longos.

Em vez disso, o TimesFM-3 posiciona tokens mascarados ao longo do horizonte futuro solicitado. Tokens mascarados atuam como posições vazias que a rede precisa preencher. O modelo gera a previsão completa em uma única passagem direta, em vez de um ciclo saída por saída.

Alvos futuros desconhecidos e covariáveis apenas históricas permanecem mascarados. Sinais futuros conhecidos, incluindo promoções e feriados programados, permanecem visíveis. Esse arranjo permite que o modelo preencha o horizonte-alvo enquanto consulta eventos que os planejadores já conhecem.

A abordagem se baseia no mascaramento de patches contíguos, um método de treinamento que oculta seções consecutivas de uma sequência. O modelo aprende a reconstruir essas seções a partir do contexto ao redor. O Google aplica esse princípio a um horizonte inteiro de previsão.

Uma única estimativa pontual esconderia uma incerteza substancial. Por isso, o TimesFM-3 produz nove quantis em cada etapa futura, abrangendo os percentis de 10 a 90. Os quantis descrevem uma faixa de resultados plausíveis, em vez de uma única resposta certa.

Um varejista poderia usar a estimativa mediana para um plano básico de estoque. Quantis inferiores e superiores podem apoiar cenários conservadores e agressivos. A diferença entre eles também revela onde o modelo expressa maior incerteza.

Esses intervalos só são úteis quando permanecem calibrados em dados locais. Um percentil 90 nominal deve se comportar como tal durante previsões reais repetidas. As equipes precisam de backtesting para determinar se a incerteza relatada corresponde ao seu ambiente operacional.

O Google disponibiliza código por meio do repositório público TimesFM. O projeto oferece suporte a entradas univariadas, múltiplos alvos, covariáveis apenas do passado e covariáveis de passado e futuro. Os pesos em PyTorch estão disponíveis separadamente pelo Hugging Face.

O repositório também inclui um backend MLX para Apple silicon. Seus exemplos documentados oferecem suporte a alvos multivariados e aos dois tipos de covariáveis. Essa opção reduz a barreira para experimentação local, embora os pesos pré-treinados ainda tenham uma licença restritiva.

Essa arquitetura não raciocina sobre causalidade empresarial no sentido humano. Se descontos e vendas historicamente se movem juntos, o modelo pode usar essa relação. Ele não estabelece que um desconto específico causou o aumento.

A correlação também pode falhar depois que as condições de negócio mudam. Uma promoção pode ter desempenho inferior porque um concorrente reduz preços ou porque o estoque se esgota. Os usuários de previsões ainda precisam de contexto operacional que nenhuma série de entrada captura completamente.

Benchmarks Fortes Não Resolvem a Questão da Implantação

As classificações reportadas pelo Google tornam o TimesFM-3 uma referência séria, mas não garantem previsões melhores em todos os conjuntos de dados privados.

O Google avaliou o modelo no GIFT-Eval, FEV-Bench e TIME. Essas suítes públicas testam previsões em diferentes conjuntos de dados, frequências, horizontes e métricas. A empresa afirma que o TimesFM-3 alcançou a melhor classificação média nos três.

As comparações incluíram o Chronos-2 da Amazon, a família Toto 2.0 da Datadog e o TimesFM-2.5 do Google. O Google afirma que o TimesFM-3 teve bom desempenho mesmo no modo univariado. A adição de informações entre séries e covariáveis melhorou ainda mais sua classificação média.

O repositório descreve o FEV-Bench como composto por 100 tarefas de previsão do mundo real. Ele descreve o TIME como 50 conjuntos de dados de domínios e 98 tarefas de avaliação. O GIFT-Eval oferece outra ampla comparação entre domínios entre modelos fundacionais.

A abrangência ajuda a reduzir a dependência de um único conjunto de dados favorável. Métricas pontuais e probabilísticas também testam qualidades diferentes. As métricas pontuais avaliam previsões centrais, enquanto as métricas probabilísticas examinam a qualidade das distribuições de previsão.

No entanto, os resultados resumidos publicamente usam classificações médias, em vez de uma porcentagem universal de melhoria. A classificação mostra a posição relativa entre as tarefas. Ela não informa a um comprador quanto a precisão melhorará em um catálogo de vendas ou frota de servidores específicos.

O Google também publicou o próprio resultado. A reprodução independente será importante, especialmente para entradas multivariadas e covariáveis futuras conhecidas. As equipes precisam de resultados baseados em seus próprios horizontes de previsão, padrões de dados ausentes e custos de decisão.

O pré-treinamento introduz outra incerteza. O modelo analisou mais de um trilhão de pontos temporais, incluindo sinais públicos da web e dados sintéticos. Essa abrangência pode melhorar a transferência, mas a similaridade entre os dados de pré-treinamento e um conjunto de dados posterior pode influenciar o desempenho zero-shot.

Um estudo de 2025 sobre generalização de previsões constatou que modelos fundacionais anteriores de séries temporais enfraqueceram sob algumas mudanças de distribuição. Seus testes usaram o TimesFM 2.0, não o TimesFM-3, portanto não invalidam os novos resultados do Google.

Ainda assim, o estudo identifica um risco relevante para a implantação. Em um pequeno conjunto de dados de eletricidade, um modelo especializado com 49.500 parâmetros superou o modelo TimesFM anterior, muito maior, após adaptação. Um pré-treinamento maior não eliminou o valor da especialização local.

O TimesFM-3 pode lidar melhor com esses casos porque sua arquitetura e seu treinamento mudaram. O Google afirma que seu modo univariado já melhora em relação a versões anteriores. Ainda assim, uma nova liderança em benchmarks não elimina o problema da mudança de domínio.

Os dados do varejo ilustram esse desafio. Um modelo treinado em padrões temporais amplos pode lidar bem com a sazonalidade normal. Ainda assim, ele pode ter dificuldades após uma mudança de loja, reformulação de sortimento, entrada de concorrente, interrupção no fornecimento ou alteração repentina no comportamento do cliente.

As covariáveis ajudam quando representam a mudança. Elas oferecem pouca proteção quando o evento relevante permanece sem registro. Também podem induzir o modelo ao erro quando relações históricas deixam de se manter.

A comparação com previsões específicas para cada tarefa, portanto, continua sendo a principal disputa. Modelos fundacionais prometem implantação mais rápida e reutilização mais ampla. Modelos especializados prometem adaptação mais próxima aos padrões de demanda, restrições e função de perda de uma empresa.

A precisão é apenas uma parte dessa decisão. As equipes precisam medir latência de inferência, requisitos de infraestrutura, comportamento em falhas, calibração e esforço de monitoramento. Também precisam decidir se uma previsão pode ser explicada bem o suficiente para aprovações de estoque ou financeiras.

O TimesFM-3 fornece saídas probabilísticas, mas quantis não são explicações. Um analista ainda precisa determinar por que o modelo reagiu ao clima ou a uma promoção. Testes de ablação controlados podem ajudar, removendo uma entrada e medindo a mudança.

O backtesting deve reproduzir as informações disponíveis em cada ponto de corte histórico. As entradas futuras de clima devem vir das previsões emitidas naquele momento, e não de observações registradas posteriormente. Os calendários promocionais devem refletir suas versões anteriores, incluindo cancelamentos posteriores.

As equipes também devem comparar contra referências simples. Previsões sazonais ingênuas, regressões lineares, árvores com gradient boosting e modelos especializados estabelecidos podem continuar competitivos. Um modelo fundacional só conquista seu lugar quando melhora o resultado operacional.

A Licença Não Comercial Cria o Ponto de Pressão Imediato

Os desenvolvedores podem inspecionar o TimesFM-3 hoje, mas a maioria das empresas não pode colocar seus pesos pré-treinados padrão em um fluxo de produção.

O Google lançou o código-fonte do repositório sob a licença Apache 2.0. No entanto, os pesos pré-treinados do TimesFM-3 usam a licença separada TimesFM Non-Commercial License v1.0. O repositório afirma que esses pesos são restritos a uso não comercial e não produtivo.

Essa divisão importa. A disponibilidade do código permite que pesquisadores inspecionem a implementação e executem experimentos. Ela não concede a um varejista permissão para usar os pesos padrão em reposição ao vivo ou planejamento de receita.

Os pesos anteriores do TimesFM, até a versão 2.5, permanecem sob Apache 2.0. Portanto, as equipes podem encontrar direitos diferentes dentro do mesmo projeto. Elas precisam verificar a licença vinculada ao checkpoint exato que pretendem usar.

A restrição também molda a pressão competitiva. Amazon, Datadog, Salesforce, Nixtla, IBM e outras organizações estão desenvolvendo sistemas de previsão reutilizáveis. Disponibilidade, integração, suporte e licenciamento podem pesar mais do que uma estreita liderança em benchmarks.

O Google afirma que a integração com BigQuery chegará nas próximas semanas. Essa implementação é o primeiro sinal importante a acompanhar. Ela deve esclarecer como os clientes acessam o TimesFM-3 e quais termos comerciais regem o uso hospedado.

O BigQuery já disponibiliza a função AI.FORECAST para previsões univariadas baseadas em TimesFM. Uma versão multivariada nativa poderia aproximar o novo modelo dos dados empresariais existentes. O acesso por SQL também reduziria o trabalho de integração necessário para equipes de previsão.

O segundo sinal é a reprodução independente dos benchmarks. Pesquisadores devem confirmar os resultados nas três suítes de avaliação e testar mudanças de distribuição difíceis. Comparações públicas também devem informar diferenças reais nas métricas, além das classificações médias.

O terceiro sinal é evidência de produção. Estudos de caso devem mostrar se as covariáveis melhoram decisões como alocação de estoque, escala de pessoal, planejamento de capacidade ou preparação para anomalias. Relatórios úteis incluirão comparações com referências e custos de erro, não apenas precisão do modelo.

Um serviço de produção reforçaria a afirmação do Google de que um previsor geral pode ir além de experimentos de pesquisa. Restrições contínuas de licença sem uma rota comercial enfraqueceriam essa conclusão. Os desenvolvedores poderiam estudar o modelo enquanto escolhem outro sistema para implantação.

Resultados independentes também poderiam mudar o cenário competitivo. Ganhos consistentes em conjuntos de dados empresariais inéditos sustentariam a estratégia zero-shot do Google. Resultados mistos reforçariam a ideia de tratar o TimesFM-3 como uma referência inicial, e não como um sistema final de previsão.

O lançamento do modelo ainda representa um passo técnico significativo. O modelo fundacional anterior do Google não conseguia combinar nativamente vários alvos com sinais históricos e futuros conhecidos. O TimesFM-3 torna essas relações parte do pré-treinamento e da inferência.

Essa capacidade aproxima a previsão fundacional de problemas reais de planejamento. As empresas não vivenciam vendas, clima, tráfego, descontos e feriados como linhas do tempo isoladas. Seus sistemas de previsão não deveriam precisar ignorar essas conexões.

Ainda assim, o futuro permanece fora do controle do modelo. As previsões meteorológicas mudam, promoções são canceladas e o comportamento do cliente se altera. Nove quantis podem expressar incerteza, mas não podem transformar entradas incompletas em certeza.

Para os desenvolvedores, a próxima ação sensata é uma avaliação offline controlada. Compare o Google TimesFM-3 com a referência de produção atual, preserve os limites históricos de informação e teste a calibração das previsões. Em seguida, acompanhe o BigQuery em busca da rota comercial que os pesos baixáveis não fornecem atualmente.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page