Google TimesFM-3 ahora interpreta el clima y las promociones, pero su implementación sigue restringida
Google TimesFM-3 procesa ahora múltiples flujos de datos relacionados, eventos futuros conocidos y 330 millones de parámetros en un único modelo de pronóstico. Este cambio aborda una limitación importante del enfoque anterior de Google. Las versiones previas proyectaban principalmente una serie a partir de su propio historial.
Ahora, un minorista puede combinar las ventas con el tráfico de clientes, productos relacionados, pronósticos meteorológicos, festivos y promociones programadas. Google afirma que el modelo puede utilizar estas relaciones sin ajuste fino específico para cada tarea. Su ejemplo anticipa un aumento estimado del 20 por ciento en las ventas durante los días de promoción.
La competencia ya no consiste únicamente en generar una línea plausible a partir de valores pasados. Google, Amazon, Datadog, Salesforce y otros desarrolladores compiten por crear modelos de pronóstico reutilizables para datos operativos complejos. Google TimesFM-3 entra en esta competencia con sólidas afirmaciones de rendimiento en benchmarks, aunque sus pesos preentrenados siguen restringidos a usos no comerciales y no productivos.
Google TimesFM-3 va más allá de una serie a la vez
El cambio central es el pronóstico multivariante nativo, que permite a un modelo conectar un objetivo con señales relacionadas antes de proyectar su futuro.
Google Research anunció TimesFM-3 el 31 de agosto de 2026. La compañía lo describe como un modelo fundacional zero-shot para series temporales. Zero-shot significa que puede abordar un nuevo conjunto de datos de pronóstico sin recibir antes entrenamiento específico para esa tarea en dicho conjunto.
Una serie temporal es simplemente una secuencia de mediciones ordenadas en el tiempo. Las ventas diarias de una tienda, la carga horaria de un servidor, los ingresos mensuales y las lecturas de glucosa son ejemplos habituales. Los modelos de pronóstico estudian mediciones anteriores y estiman lo que ocurrirá después.
Las versiones anteriores de TimesFM facilitaron ese proceso al ofrecer un modelo preentrenado para muchos tipos de datos temporales. Sin embargo, el modelo principal seguía tratando cada serie objetivo de forma independiente. Su visión directa del problema se detenía en el historial de esa propia serie.
TimesFM-2.5 podía añadir covariables mediante una ruta de regresión XReg independiente. Las covariables son variables externas que ayudan a explicar el movimiento de un objetivo. Esa incorporación resultó útil, pero Google no preentrenó TimesFM-2.5 como un predictor multivariante nativo.
TimesFM-3 modifica la propia base. Según el anuncio del modelo, Google lo preentrenó para procesar conjuntamente objetivos y variables de apoyo. El modelo puede pronosticar varios objetivos relacionados de forma simultánea mientras examina las conexiones entre ellos.
Google divide estas entradas en tres grupos útiles. Los múltiples objetivos abarcan las mediciones relacionadas que se pronostican, como las ventas de varias marcas de helado. Las covariables pasadas incluyen señales disponibles solo para períodos anteriores, como el tráfico registrado en tienda.
Las covariables de pasado-futuro se extienden tanto por el período histórico como por el horizonte de pronóstico. Estas entradas incluyen eventos cuyos valores futuros ya se conocen. Un calendario de promociones, un calendario de festivos, un descuento planificado o un pronóstico meteorológico externo pueden encajar en esta categoría.
Esta distinción importa porque los pronósticos empresariales rara vez dependen solo del historial. Un patrón semanal no puede saber que un minorista programó un descuento para el próximo martes. Tampoco puede inferir una ola de calor inminente a menos que otra entrada la represente.
El ejemplo ilustrativo de Google para comercio minorista muestra la diferencia. Una proyección univariante repite un patrón semanal de ventas porque solo observa ventas anteriores. El pronóstico de TimesFM-3 también recibe el calendario futuro de promociones, por lo que su resultado aumenta en los días programados.
Google afirma que el ejemplo produce un incremento esperado de ventas de aproximadamente el 20 por ciento en cada día de promoción. Esa cifra ilustra el mecanismo, más que demostrar un efecto universal en el comercio minorista. Las respuestas reales de ventas dependerán del producto, la tienda, el descuento, la temporada y el comportamiento de los clientes.
Por tanto, el lanzamiento implica más que añadir columnas adicionales a una solicitud de predicción. Google entrenó el modelo para reconocer relaciones entre columnas antes de ver el conjunto de datos de un cliente concreto. Esa es la promesa detrás del pronóstico multivariante de Google en formato zero-shot.
Por qué los modelos de pronóstico necesitan eventos futuros conocidos
Un pronóstico se vuelve más útil cuando puede distinguir entre un historial recurrente y una intervención futura que los gestores ya han planificado.
Muchas decisiones operativas cambian el resultado que se intenta predecir. Los minoristas modifican precios, los especialistas en marketing programan campañas, las fábricas planifican mantenimiento y los hospitales cambian la dotación de personal. Un modelo que ignore estas acciones puede producir un pronóstico técnicamente coherente, pero irrelevante desde el punto de vista operativo.
Pensemos en una cadena de supermercados que planifica inventario para postres congelados. Las ventas históricas de helado pueden revelar estacionalidad, patrones por día de la semana y crecimiento a largo plazo. Las ventas relacionadas de conos y siropes pueden exponer relaciones de demanda que una serie de producto individual no detecta.
El tráfico registrado en tienda aporta evidencia sobre la actividad previa. Los pronósticos meteorológicos ofrecen información sobre las condiciones durante el período de pronóstico. Los calendarios de promociones indican al modelo exactamente cuándo el minorista espera una intervención.
TimesFM-3 puede examinar estos flujos conjuntamente. No necesita fingir que la promoción planificada es una sorpresa futura inesperada. Puede comparar períodos anteriores de promoción con fechas futuras programadas y ajustar el pronóstico en consecuencia.
La misma estructura se aplica fuera del comercio minorista. Un operador de nube podría pronosticar la demanda utilizando el historial de cargas de trabajo, calendarios de lanzamientos y programas de mantenimiento. Un planificador energético podría combinar mediciones de carga con pronósticos de temperatura y paradas industriales conocidas.
Los fabricantes podrían proyectar lecturas de sensores junto con calendarios de producción. Los analistas sanitarios podrían conectar mediciones de varios dispositivos con eventos de tratamiento conocidos. Los equipos financieros podrían examinar métricas operativas relacionadas en lugar de extrapolar una única línea contable.
Estos casos no son idénticos, y un modelo reutilizable debe manejar grandes diferencias de escala. El tráfico web puede alcanzar millones, mientras que un sensor de dispositivo registra valores decimales pequeños. TimesFM-3 normaliza cada serie para evitar que esas escalas dominen las comparaciones internas del modelo.
Google afirma que preentrenó el sistema con más de un billón de puntos temporales procedentes de fuentes reales y sintéticas. Las fuentes enumeradas incluyen datos de preentrenamiento de GIFT-Eval, visualizaciones de páginas de Wikipedia, consultas de Google Trends y secuencias sintéticas aumentadas.
El modelo contiene 330 millones de parámetros. Esto lo hace más grande que TimesFM-2.5, que utilizaba 200 millones de parámetros, pero más pequeño que muchos modelos de lenguaje de propósito general. El número de parámetros por sí solo no determina la precisión del pronóstico ni el coste de implementación.
La distinción más importante es lo que el modelo aprendió durante el preentrenamiento. El pronóstico multivariante de Google pide a la red que transfiera patrones de relación, no solo formas dentro de una única serie. Esto abre la posibilidad de realizar experimentos más rápidos con conjuntos de datos que contienen muchas variables conectadas.
También cambia lo que los equipos deben preparar. Un modelo no puede beneficiarse de un calendario de promociones que nadie registró con precisión. Los datos meteorológicos deben alinearse con las ubicaciones e intervalos temporales correctos. Los objetivos y las covariables necesitan marcas de tiempo coherentes.
Las covariables futuras introducen otra dependencia. El resultado solo puede ser tan fiable como esas entradas futuras. Un pronóstico basado en una proyección meteorológica inexacta o en un plan de promoción abandonado hereda ese error.
Los equipos también deben evitar proporcionar información que no habría estado disponible cuando se realizó el pronóstico. Este problema se denomina filtración de datos. La filtración hace que las evaluaciones históricas parezcan mejores al permitir que un modelo vea evidencia del futuro.
Por lo tanto, el caso de uso más sólido no es la predicción automática a partir de todas las columnas disponibles. Es el pronóstico controlado con variables que tienen significados claros y reglas de disponibilidad. TimesFM-3 reduce el trabajo de modelado, pero no elimina la gobernanza de datos.
Cómo funciona el pronóstico de TimesFM-3 en una sola pasada
Google rediseñó la ruta de pronóstico para que las relaciones temporales y las relaciones entre series se alternen dentro del mismo transformer.
El modelo comienza agrupando 32 puntos temporales consecutivos en un parche. El uso de parches convierte una secuencia numérica larga en una serie más corta de tokens. Se parece a la forma en que algunos transformers de visión procesan parches de imagen en lugar de píxeles individuales.
Cada objetivo o covariable solo pasada recibe tokens creados a partir de sus parches históricos. Las covariables de pasado-futuro utilizan una construcción con anticipación. Sus tokens incluyen el parche actual y parches futuros que contienen señales ya conocidas.
Estos tokens entran en un transformer solo decodificador con 20 capas, una dimensión de modelo de 1.280 y 16 cabezas de atención. Estas especificaciones aparecen en la tarjeta oficial del modelo. La arquitectura alterna dos formas de atención.
La atención temporal causal se desplaza horizontalmente a través del tiempo dentro de una serie. Causal significa que cada token puede examinar información anterior, pero no objetivos futuros desconocidos. Esta restricción ayuda a evitar que los valores futuros del objetivo se filtren en la predicción.
La atención completa entre variables se desplaza verticalmente entre distintas series en la misma posición temporal. Permite que los tokens de ventas examinen señales de promociones, clima, tráfico o productos relacionados. El modelo alterna estas operaciones temporales y entre series a través de su pila de transformers.
Este patrón alternado define el mecanismo central de pronóstico de TimesFM-3. Una operación aprende qué cambió a lo largo del tiempo. La siguiente examina cómo se mueven juntas las variables.
Google también cambió la forma en que el modelo genera el horizonte. Las versiones anteriores de TimesFM predecían un parche de salida y luego utilizaban ese resultado mientras generaban el siguiente. Ese bucle autorregresivo puede acumular errores y añadir latencia en horizontes largos.
En su lugar, TimesFM-3 coloca tokens enmascarados a lo largo del horizonte futuro solicitado. Los tokens enmascarados actúan como posiciones vacías que la red debe completar. El modelo genera el pronóstico completo mediante una sola pasada hacia adelante, en lugar de un bucle salida por salida.
Los objetivos futuros desconocidos y las covariables solo pasadas permanecen enmascarados. Las señales futuras conocidas, incluidas las promociones programadas y los festivos, siguen visibles. Esta disposición permite al modelo completar el horizonte objetivo mientras consulta eventos que los planificadores ya conocen.
El enfoque se basa en el enmascaramiento de parches contiguos, un método de entrenamiento que oculta secciones consecutivas de una secuencia. El modelo aprende a reconstruir esas secciones a partir de su contexto circundante. Google aplica ese principio a un horizonte completo de pronóstico.
Una única estimación puntual ocultaría una incertidumbre considerable. Por ello, TimesFM-3 produce nueve cuantiles en cada paso futuro, que cubren del percentil 10 al 90. Los cuantiles describen un rango de resultados plausibles, en lugar de una respuesta cierta.
Un minorista podría utilizar la estimación mediana para un plan básico de inventario. Los cuantiles inferior y superior pueden respaldar escenarios conservadores y agresivos. La brecha entre ellos también revela dónde el modelo expresa una mayor incertidumbre.
Estos intervalos solo son útiles cuando permanecen calibrados con datos locales. Un percentil 90 nominal debería comportarse como tal durante pronósticos reales repetidos. Los equipos necesitan pruebas retrospectivas para determinar si la incertidumbre reportada coincide con su entorno operativo.
Google proporciona código a través del repositorio público de TimesFM. El proyecto admite entradas univariantes, múltiples objetivos, covariables solo históricas y covariables de pasado y futuro. Los pesos de PyTorch están disponibles por separado a través de Hugging Face.
El repositorio también incluye un backend MLX para Apple silicon. Sus ejemplos documentados admiten objetivos multivariantes y ambos tipos de covariables. Esa opción reduce la barrera para la experimentación local, aunque los pesos preentrenados siguen sujetos a una licencia restrictiva.
Esta arquitectura no razona sobre causalidad empresarial en el sentido humano. Si los descuentos y las ventas se han movido históricamente en conjunto, el modelo puede utilizar esa relación. No establece que un descuento concreto haya causado el aumento.
La correlación también puede fallar cuando cambian las condiciones empresariales. Una promoción puede rendir por debajo de lo esperado porque un competidor reduce precios o se agota el inventario. Los usuarios de pronósticos aún necesitan contexto operativo que ninguna serie de entrada captura por completo.
Los sólidos benchmarks no resuelven la cuestión del despliegue
Las clasificaciones reportadas por Google convierten a TimesFM-3 en una referencia seria, pero no garantizan mejores pronósticos en todos los conjuntos de datos privados.
Google evaluó el modelo en GIFT-Eval, FEV-Bench y TIME. Estas suites públicas prueban la predicción en distintos conjuntos de datos, frecuencias, horizontes y métricas. La empresa informa que TimesFM-3 logró el mejor rango promedio en los tres.
Las comparaciones incluyeron Chronos-2 de Amazon, la familia Toto 2.0 de Datadog y TimesFM-2.5 de Google. Google informa que TimesFM-3 tuvo un desempeño sólido incluso en modo univariante. Añadir información entre series y covariables mejoró aún más su rango promedio.
El repositorio describe FEV-Bench como un conjunto de 100 tareas de predicción del mundo real. Describe TIME como 50 conjuntos de datos de distintos dominios y 98 tareas de evaluación. GIFT-Eval aporta otra amplia comparación multidominio entre modelos fundacionales.
La amplitud ayuda a reducir la dependencia de un único conjunto de datos favorable. Las métricas puntuales y probabilísticas también prueban cualidades diferentes. Las métricas puntuales evalúan predicciones centrales, mientras que las métricas probabilísticas examinan la calidad de las distribuciones de pronóstico.
Sin embargo, los resultados resumidos públicamente utilizan rangos promedio en lugar de un porcentaje de mejora universal. El rango muestra la posición relativa entre tareas. No indica a un comprador cuánto mejorará la precisión en un catálogo de ventas o una flota de servidores concretos.
Google también publicó los propios resultados. La replicación independiente será importante, especialmente para entradas multivariantes y covariables futuras conocidas. Los equipos necesitan resultados basados en sus propios horizontes de pronóstico, patrones de datos faltantes y costes de decisión.
El preentrenamiento introduce otra incertidumbre. El modelo procesó más de un billón de puntos temporales, incluidas señales de la web pública y datos sintéticos. Esa amplitud puede mejorar la transferencia, pero la similitud entre los datos de preentrenamiento y un conjunto de datos posterior puede influir en el rendimiento zero-shot.
Un estudio de 2025 sobre la generalización en predicción determinó que modelos fundacionales de series temporales anteriores se debilitaban bajo algunos cambios de distribución. Sus pruebas utilizaron TimesFM 2.0, no TimesFM-3, por lo que no invalidan los nuevos resultados de Google.
El estudio aún identifica un riesgo relevante para el despliegue. En un pequeño conjunto de datos de electricidad, un modelo especializado con 49.500 parámetros superó al modelo TimesFM anterior, mucho mayor, tras su adaptación. Un preentrenamiento más amplio no eliminó el valor de la especialización local.
TimesFM-3 podría manejar mejor esos casos porque su arquitectura y entrenamiento han cambiado. Google afirma que su modo univariante ya mejora las versiones anteriores. Aun así, un nuevo liderazgo en benchmarks no elimina el problema del cambio de dominio.
Los datos minoristas ilustran ese desafío. Un modelo entrenado con patrones temporales amplios puede manejar bien la estacionalidad normal. Aun así, puede tener dificultades tras el traslado de una tienda, una renovación del surtido, la entrada de un competidor, una interrupción del suministro o un cambio repentino en el comportamiento de los clientes.
Las covariables ayudan cuando representan el cambio. Ofrecen poca protección cuando el evento relevante no queda registrado. También pueden inducir al modelo a error cuando dejan de mantenerse las relaciones históricas.
Por tanto, la comparación con la predicción específica para cada tarea sigue siendo la principal competencia. Los modelos fundacionales prometen un despliegue más rápido y una reutilización más amplia. Los modelos especializados prometen una adaptación más estrecha a los patrones de demanda, las restricciones y la función de pérdida de una empresa.
La precisión es solo una parte de esa decisión. Los equipos deben medir la latencia de inferencia, los requisitos de infraestructura, el comportamiento ante fallos, la calibración y el esfuerzo de monitorización. También deben decidir si un pronóstico puede explicarse lo bastante bien para obtener aprobaciones de inventario o financieras.
TimesFM-3 proporciona salidas probabilísticas, pero los cuantiles no son explicaciones. Un analista aún debe determinar por qué el modelo reaccionó al clima o a una promoción. Las pruebas de ablación controladas pueden ayudar al eliminar una entrada y medir el cambio.
El backtesting debe reproducir la información disponible en cada corte histórico. Las entradas meteorológicas futuras deben proceder de pronósticos emitidos en ese momento, no de observaciones registradas después. Los calendarios de promociones deben reflejar sus versiones anteriores, incluidas las cancelaciones posteriores.
Los equipos también deben compararlo con referencias simples. Los pronósticos ingenuos estacionales, las regresiones lineales, los árboles con gradient boosting y los modelos especializados consolidados pueden seguir siendo competitivos. Un modelo fundacional solo se gana su lugar cuando mejora el resultado operativo.
La licencia no comercial crea el punto de presión inmediato
Los desarrolladores pueden inspeccionar TimesFM-3 hoy, pero la mayoría de las empresas no puede incorporar sus pesos preentrenados predeterminados a un flujo de trabajo de producción.
Google publicó el código fuente del repositorio bajo Apache 2.0. Sin embargo, los pesos preentrenados de TimesFM-3 utilizan la licencia independiente TimesFM Non-Commercial License v1.0. El repositorio indica que esos pesos están restringidos a usos no comerciales y no productivos.
Esa división importa. La disponibilidad del código fuente permite a los investigadores inspeccionar la implementación y realizar experimentos. No concede a un minorista permiso para usar los pesos predeterminados en reposición en tiempo real o planificación de ingresos.
Los pesos anteriores de TimesFM hasta la versión 2.5 permanecen bajo Apache 2.0. Por tanto, los equipos pueden encontrar distintos derechos dentro del mismo proyecto. Deben comprobar la licencia asociada al checkpoint exacto que planean utilizar.
La restricción también configura la presión competitiva. Amazon, Datadog, Salesforce, Nixtla, IBM y otras organizaciones están desarrollando sistemas de predicción reutilizables. La disponibilidad, la integración, el soporte y las licencias pueden pesar más que una estrecha ventaja en benchmarks.
Google afirma que la integración con BigQuery llegará en las próximas semanas. Ese despliegue es la primera señal importante que conviene vigilar. Debería aclarar cómo acceden los clientes a TimesFM-3 y qué términos comerciales rigen el uso alojado.
BigQuery ya expone la función AI.FORECAST para predicción univariante basada en TimesFM. Una versión multivariante nativa podría acercar el nuevo modelo a los datos empresariales existentes. El acceso mediante SQL también reduciría el trabajo de integración requerido para los equipos de predicción.
La segunda señal es la replicación independiente de los benchmarks. Los investigadores deberían confirmar los resultados en las tres suites de evaluación y probar cambios de distribución difíciles. Las comparaciones públicas también deberían informar diferencias reales de métricas junto con los rangos promedio.
La tercera señal es la evidencia de producción. Los estudios de caso deberían mostrar si las covariables mejoran decisiones como la asignación de inventario, la dotación de personal, la planificación de capacidad o la preparación para anomalías. Los informes útiles incluirán comparaciones con referencias y costes de error, no solo precisión del modelo.
Un servicio de producción reforzaría la afirmación de Google de que un predictor general puede ir más allá de los experimentos de investigación. Las restricciones de licencia continuadas sin una vía comercial debilitarían esa conclusión. Los desarrolladores podrían estudiar el modelo mientras eligen otro sistema para el despliegue.
Los resultados independientes también podrían cambiar el panorama competitivo. Las mejoras consistentes en conjuntos de datos empresariales no vistos respaldarían la estrategia zero-shot de Google. Los resultados mixtos reforzarían el argumento de tratar TimesFM-3 como una referencia inicial y no como un sistema de predicción definitivo.
El lanzamiento del modelo sigue representando un avance técnico significativo. El modelo fundacional anterior de Google no podía combinar de forma nativa varios objetivos con señales históricas y futuras conocidas. TimesFM-3 incorpora esas relaciones al preentrenamiento y la inferencia.
Esa capacidad acerca la predicción fundacional a problemas reales de planificación. Las empresas no experimentan las ventas, el clima, el tráfico, los descuentos y los festivos como cronologías aisladas. Sus sistemas de predicción tampoco deberían tener que ignorar esas conexiones.
Sin embargo, el futuro permanece fuera del control del modelo. Los pronósticos meteorológicos cambian, las promociones se cancelan y el comportamiento de los clientes se modifica. Nueve cuantiles pueden expresar incertidumbre, pero no pueden convertir entradas incompletas en certeza.
Para los desarrolladores, la siguiente acción sensata es una evaluación offline controlada. Comparen Google TimesFM-3 con la referencia de producción actual, preserven los límites de la información histórica y prueben la calibración de los pronósticos. Después, sigan BigQuery para conocer la vía comercial que los pesos descargables no proporcionan actualmente.



