top of page

El uso de tokens por agentes en OpenRouter es 5 veces mayor que el tráfico humano, pero la ventaja procede principalmente de contexto en caché

hace 5 días
19 min de lectura

El uso de tokens por agentes en OpenRouter alcanzó los 7,3 billones de tokens en agosto, más de cinco veces los 1,4 billones atribuidos a humanos en la plataforma. Sin embargo, según los informes, más del 85 % de esos tokens de agentes procedía de prompts en caché, no de instrucciones recién procesadas ni de respuestas generadas.

Esa distinción complica la afirmación de que la IA utiliza ahora más IA que las personas. Está claro que los agentes generan mucho más tráfico de modelos por tarea. Sin embargo, el gráfico mide los tokens enrutados a través de una plataforma, no la adopción global de IA, el gasto, el trabajo productivo ni el valor económico.

Daniel Newman, CEO de Futurum Group, amplificó las cifras en una publicación en X del 30 de septiembre. Predijo que la proporción pasaría de cinco a 10 veces y seguiría aumentando. La cifra de cinco veces procede del tráfico observado en OpenRouter. La cifra de 10 veces sigue siendo una previsión sin un calendario declarado ni un modelo de respaldo.

Por tanto, la verdadera competencia no es entre agentes y humanos. Es entre volumen bruto de tokens y trabajo útil. La distinción importa para los desarrolladores que gestionan bucles de agentes, las empresas que evalúan retornos y los proveedores de infraestructura que planifican capacidad de memoria.

El uso de tokens por agentes en OpenRouter superó un umbral claro

Los datos de agosto muestran un cambio importante en el tráfico de modelos, pero solo dentro del entorno medido por OpenRouter.

OpenRouter opera una pasarela que enruta solicitudes entre modelos y proveedores de inferencia. Su posición proporciona a la empresa visibilidad sobre tráfico de aplicaciones diverso, incluidas conversaciones directas, herramientas de programación y flujos de trabajo autónomos.

El gráfico reportado presenta el uso medio de tokens durante siete días hasta el 10 de agosto de 2026. El tráfico de agentes alcanzó aproximadamente 7,3 billones de tokens, frente a 1,4 billones del tráfico humano.

La proporción resultante es de aproximadamente 5,2 a uno. Respaldaría la afirmación más acotada de que los agentes generaron cinco veces más tráfico de tokens que los humanos en OpenRouter durante ese periodo de medición.

No establece la misma proporción en ChatGPT, Claude, Gemini, implementaciones privadas en la nube ni modelos alojados localmente. Esos sistemas representan un tráfico considerable que OpenRouter no puede observar.

OpenRouter también informó de que el uso de agentes había crecido unas catorce veces desde el 6 de febrero. El uso humano de tokens aumentó unas 2,8 veces durante el mismo periodo. El tráfico mixto, que combina comportamiento humano y similar al de agentes, habría crecido aproximadamente 4,7 veces.

El 6 de febrero fue la última fecha observada en la que el tráfico humano se mantuvo por encima del tráfico de agentes en el conjunto de datos. Eso hace que el resultado de agosto sea más relevante que un único pico diario. Los agentes habían mantenido y ampliado su ventaja durante aproximadamente seis meses.

OpenRouter clasificó cada clave API como de agente, humana o mixta. Según los informes, el sistema utilizó siete señales ponderadas, incluidas las tasas de llamadas a herramientas, los recuentos de turnos y los intervalos temporales entre respuestas.

Este enfoque es más informativo que basarse únicamente en los nombres de las aplicaciones. Un cliente API genérico puede ejecutar un bucle autónomo, mientras que una aplicación comercializada como agente puede seguir bajo control humano directo.

Sin embargo, la clasificación conductual introduce incertidumbre. Las claves API pueden servir a varios productos, equipos o casos de uso. Una carga de trabajo también puede alternar entre comportamientos liderados por humanos y automatizados sin cambiar las credenciales.

La categoría mixta reconoce esta ambigüedad, pero no la elimina. Reasignar una parte de ese tráfico cambiaría la proporción entre agentes y personas.

Hay otra cuestión semántica importante. Los agentes no son clientes independientes en el sentido económico habitual. Humanos y organizaciones los implementan, definen objetivos, financian sus solicitudes y deciden si sus resultados tienen valor.

Es mejor entender a los agentes como intermediarios automatizados. Una solicitud humana puede iniciar planificación, recuperación de información, ejecución de herramientas, validación, corrección y llamadas repetidas al modelo.

Ese efecto multiplicador es el evento central. La demanda de IA ya no viene determinada únicamente por cuántas personas abren una ventana de chat. Depende cada vez más de cuánta actividad de máquinas desencadena cada solicitud humana.

El anterior estudio de 100 billones de tokens de OpenRouter identificó el mismo cambio estructural. Describió la inferencia de agentes como una secuencia extendida que implica planificación, herramientas, revisiones e interacción repetida con el modelo.

El estudio concluyó que la programación se había convertido en una fuente destacada de crecimiento de prompts. Los prompts de programación también promediaban varias veces la longitud de los prompts de uso general a finales de 2025.

Estos patrones ayudan a explicar por qué los agentes superaron el umbral. Una persona puede enviar una única solicitud de programación. Un agente puede inspeccionar archivos repetidamente, llamar a herramientas, revisar resultados de pruebas y reenviar su contexto de trabajo.

El gráfico de agosto captura esa amplificación a escala de plataforma. No demuestra que el software autónomo haya reemplazado la demanda humana. Muestra que la demanda humana llega cada vez más a través de sistemas que crean muchas solicitudes posteriores.

Una instrucción humana puede desencadenar miles de operaciones de modelo

Los agentes consumen más tokens porque convierten una sola solicitud en un proceso computacional continuo.

Una interacción convencional con un chatbot suele seguir un ritmo visible. Una persona escribe un prompt, recibe una respuesta y decide si continúa. Cada nuevo turno depende de otra acción humana.

Un agente puede continuar sin esa pausa. Interpreta un objetivo, crea pasos, elige herramientas, evalúa resultados y decide si es necesario otro intento.

Pensemos en una migración de software. Un desarrollador puede pedir a un agente que traslade una aplicación de un servicio en la nube a otro.

La primera llamada al modelo puede examinar la solicitud y formular un plan. Las llamadas posteriores podrían inspeccionar archivos de configuración, buscar documentación, editar código, ejecutar pruebas, diagnosticar fallos y revisar la implementación.

Cada llamada suele incluir más que la instrucción más reciente. Puede transportar reglas del sistema, definiciones de herramientas, detalles del repositorio, mensajes anteriores, salida de comandos y decisiones previas del agente.

Este material acumulado es la ventana de contexto, es decir, el texto y los datos estructurados disponibles para el modelo durante una solicitud. A medida que continúa la tarea, ese contexto puede volverse mucho mayor que el prompt humano original.

El uso de herramientas aumenta aún más el tráfico. Un modelo podría generar una consulta de base de datos, inspeccionar el resultado y volver a llamar al modelo para decidir qué sigue.

Los agentes paralelos pueden multiplicar el proceso de nuevo. Un coordinador podría delegar investigación, programación, pruebas y revisión a trabajadores separados. Cada trabajador mantiene sus propias instrucciones e historial de tareas.

Esto explica por qué el volumen de tokens puede crecer mucho más rápido que el número de usuarios. La unidad básica ha pasado de un turno de conversación a un paso de flujo de trabajo.

Los datos de OpenRouter también reflejan el crecimiento de cargas de trabajo de razonamiento y programación. Estas tareas propician naturalmente interacciones más largas porque implican estado intermedio, herramientas externas y validación repetida.

La evidencia académica sugiere que la amplificación puede volverse extrema. Un estudio de 2026 sobre programación mediante agentes halló que las tareas de agentes consumían aproximadamente 1.000 veces más tokens que el chat de código en su entorno experimental.

La investigación sobre costes de agentes también encontró grandes variaciones entre ejecuciones repetidas. El uso de tokens para la misma tarea difirió hasta treinta veces en las pruebas de los investigadores.

Es fundamental señalar que más tokens no produjeron resultados mejores de forma consistente. El rendimiento a menudo alcanzaba su máximo en un nivel intermedio antes de que el consumo adicional dejara de ofrecer ganancias proporcionales.

Ese hallazgo refuerza la principal tensión detrás del uso de tokens por agentes en OpenRouter. Un recuento creciente puede representar automatización productiva, repetición innecesaria o una mezcla de ambas.

Por ello, los creadores de agentes se enfrentan a presión para medir el trabajo completado, no solo la actividad generada. Entre los indicadores útiles se incluyen cambios de código aceptados, casos de soporte resueltos, transacciones exitosas y tareas completadas sin reparación humana.

Un token es solo una unidad de procesamiento de texto. No incorpora ninguna medida de precisión, dificultad, novedad o valor empresarial.

Dos flujos de trabajo pueden consumir el mismo número de tokens y producir resultados muy diferentes. Uno puede resolver un problema complejo de ingeniería. El otro puede repetir un plan fallido hasta que un límite lo detenga.

El diseño del sistema circundante determina cuál de los dos resultados es más probable. Las pruebas claras de finalización ayudan a un agente a reconocer el éxito. Las políticas de reintentos acotadas evitan que una tarea fallida se ejecute indefinidamente.

Las buenas herramientas también reducen la necesidad de un razonamiento textual extenso. Una API estructurada puede devolver un resultado preciso que, de otro modo, requeriría navegación e interpretación repetidas.

La arquitectura de memoria importa por la misma razón. Un agente no necesita todos los detalles antiguos en cada paso. Necesita el subconjunto que sigue siendo relevante para la decisión actual.

Aquí es donde una base de conocimiento personal con capacidad de búsqueda puede respaldar flujos de trabajo liderados por humanos. La evidencia recuperada puede sustituir al historial indiscriminado cuando el sistema selecciona cuidadosamente el contexto.

La presión va más allá de los desarrolladores. Los compradores empresariales ahora deben evaluar cómo los productos controlan los bucles, recuperan contexto e informan el consumo.

Un producto puede parecer eficiente durante una demostración breve, pero comportarse de manera diferente en cargas de trabajo de larga duración. Las tareas de producción encuentran permisos ausentes, objetivos ambiguos, datos cambiantes y respuestas inesperadas de herramientas.

Esas condiciones generan reintentos. También revelan si el agente cuenta con reglas de detención fiables o si simplemente sigue produciendo pasos siguientes plausibles.

La adopción humana sigue importando, pero ya no predice por sí sola la demanda de inferencia. La fórmula más útil incluye usuarios, tareas delegadas, llamadas al modelo por tarea y tokens por llamada.

Esa fórmula hace plausible, en principio, una proporción de diez veces. No convierte en inevitable la previsión de Newman. La proporción también dependerá de la optimización, el comportamiento de los modelos, el diseño de las aplicaciones y el tráfico fuera de OpenRouter.

Los prompts en caché explican la mayor parte de la explosión de tokens

La mayor parte de la ventaja de los agentes parece ser contexto repetido, no razonamiento o resultados completamente nuevos.

Según los informes, más del 85 % de los tokens de agentes en la presentación de a16z procedía de prompts en caché. Los prompts en caché son segmentos de entrada procesados anteriormente que un proveedor puede reutilizar cuando una solicitud posterior comienza con contenido coincidente.

Un agente suele reenviar material estable. Ese material puede incluir instrucciones del sistema, descripciones de herramientas, archivos de proyecto, políticas e historial anterior de conversaciones.

Procesar el mismo prefijo desde cero en cada llamada desperdiciaría cómputo. El almacenamiento en caché de prompts permite al proveedor reutilizar resultados intermedios asociados con ese prefijo.

La telemetría de caché de OpenRouter separa los tokens en caché de los tokens de prompts recién procesados. También puede identificar tokens escritos en una caché para su reutilización futura.

Esto significa que 7,3 billones de tokens no deben interpretarse como 7,3 billones de unidades de trabajo fresco del modelo. Una gran parte representa información que el sistema ya ha encontrado antes.

La distinción afecta al coste. Los proveedores generalmente cobran menos por una lectura de caché que por procesar una entrada nueva, porque gran parte del cómputo anterior ya se ha realizado.

Sin embargo, estar en caché no significa ser gratuito. El sistema debe identificar la entrada de caché, recuperar sus datos y poner a disposición el estado de modelo asociado durante la inferencia.

El estado de modelo relevante suele denominarse caché clave-valor, o caché KV. Almacena información de atención derivada de tokens anteriores para que el modelo pueda continuar sin recalcular cada posición precedente.

Los prompts más largos generan cachés KV más grandes. Más sesiones de agentes simultáneas generan más de ellas. Los flujos de trabajo de larga duración también pueden requerir acceso repetido a un contexto almacenado considerable.

Eso desplaza el cuello de botella de infraestructura. El cómputo sigue siendo importante, pero la capacidad de memoria, el ancho de banda de memoria y el movimiento de datos adquieren una importancia cada vez mayor.

Por eso la proporción en caché no vuelve irrelevantes los datos de OpenRouter. Cambia lo que esos datos significan.

El gráfico es una evidencia más débil de demanda de razonamiento nuevo. Es una evidencia más sólida de que los sistemas de agentes transportan repetidamente grandes historiales a través de muchas llamadas al modelo.

La diferencia se parece a consultar repetidamente la misma carpeta grande de proyecto. Volver a leer páginas conocidas requiere menos preparación que analizar páginas nuevas, pero la carpeta debe seguir disponible.

El almacenamiento en caché también puede hacer que un diseño ineficiente de agentes sea financieramente tolerable. Un flujo de trabajo podría reenviar un enorme prompt de sistema porque la lectura de caché con descuento oculta parte del coste.

Ese diseño sigue consumiendo capacidad. Puede aumentar la latencia, complicar el enrutamiento y generar dependencia de prefijos de prompt estables.

Los aciertos de caché no están garantizados en todas las configuraciones. Modificar una parte inicial del prompt puede invalidar material almacenado posteriormente en caché. Enrutar solicitudes entre proveedores también puede afectar la reutilización.

Los datos dinámicos presentan otro desafío. Si aparecen marcas de tiempo, documentos recuperados, resultados de herramientas o detalles específicos del usuario cerca del principio, pueden reducir la estabilidad del prefijo.

Por tanto, los desarrolladores de agentes necesitan una estructura de contexto deliberada. Las instrucciones estables deben situarse cerca del comienzo, mientras que la información cambiante debe aparecer después de las secciones reutilizables cuando el comportamiento del proveedor lo permita.

La afinidad de sesión también puede importar. Las solicitudes que permanecen asociadas a un proveedor compatible tienen más probabilidades de reutilizar contexto previo que las solicitudes enrutadas de manera impredecible.

La cifra del 85 % también merece una atribución cuidadosa. Según el informe fuente, apareció en el encuadre de a16z sobre los datos de OpenRouter. El análisis original de OpenRouter también ha sido descrito como una proporción menor bajo otro cálculo.

Distintos denominadores pueden producir porcentajes diferentes. Un método puede agregar todo el volumen de tokens, mientras que otro promedia la proporción en caché entre solicitudes.

Unos pocos flujos de trabajo enormes pueden dominar el volumen total sin representar la solicitud típica. A la inversa, un porcentaje medio por solicitud puede subestimar la influencia de las mayores cargas de trabajo.

Ambas mediciones pueden ser precisas y responder preguntas distintas. El gráfico público no ofrece suficiente detalle metodológico para conciliar de forma independiente todos los porcentajes de caché reportados.

Por tanto, la conclusión más segura es direccional. El contexto en caché constituye la clara mayoría del tráfico de tokens de agentes, mientras que la proporción exacta depende de cómo la plataforma agregue las solicitudes.

Esto también cuestiona la frase “la IA está usando IA”. Los agentes no están realizando necesariamente billones de actos independientes de razonamiento. Gran parte de su tráfico consiste en restaurar el contexto necesario para continuar el trabajo delegado.

Ese comportamiento aún puede generar valor real. Un agente de programación necesita el estado del repositorio y las decisiones previas para evitar empezar desde cero después de cada llamada a una herramienta.

La cuestión de la eficiencia se refiere a la selección. ¿El agente recarga el contexto útil mínimo o reenvía repetidamente todo porque ese enfoque es más fácil de implementar?

A medida que crece el volumen de tokens, esa diferencia se convierte en una decisión de ingeniería relevante. Una gestión eficiente del contexto puede reducir la demanda de memoria sin debilitar el rendimiento de las tareas.

Cinco Veces Más Tokens No Significa Cinco Veces Más ROI

El volumen de tokens mide la utilización, mientras que el retorno de la inversión depende de resultados exitosos y del coste operativo total.

Newman sostuvo que las empresas se centran demasiado en la adopción humana al evaluar los retornos de la IA. Su planteamiento más amplio tiene mérito porque un usuario ahora puede iniciar mucha más inferencia de la que revela una métrica de adopción basada en chat.

Los usuarios activos mensuales pueden subestimar la demanda de infraestructura. El número de licencias también puede pasar por alto el trabajo automatizado que se ejecuta continuamente después de que los empleados se alejan de sus escritorios.

Sin embargo, reemplazar el número de usuarios por el número de tokens crea otra medida incompleta. Los tokens revelan actividad, pero no muestran si esa actividad generó ingresos, redujo trabajo, mejoró la calidad o incrementó el riesgo.

La proporción de cinco veces también compara dos categorías de tráfico, no dos actores económicos. Las solicitudes de agentes siguen siendo consecuencia de decisiones humanas u organizativas.

Una empresa no obtiene un retorno porque un agente consuma más tokens. Obtiene un retorno cuando el agente completa trabajo valioso con un nivel aceptable de coste y riesgo.

Una evaluación útil comienza con el éxito de la tarea. Los equipos deben preguntarse si el flujo de trabajo completó la acción prevista y si una persona aceptó el resultado.

La siguiente pregunta se refiere a la intervención. Un agente que termina sin supervisión tiene un perfil operativo distinto de uno que requiere correcciones repetidas.

La latencia también importa. Un flujo de trabajo que finalmente tiene éxito aún puede fracasar comercialmente si los clientes deben esperar demasiado o si las colas de infraestructura crecen bajo carga máxima.

Luego viene el coste total. Los cargos por tokens son solo un componente. Las llamadas a herramientas, los servicios de búsqueda, las bases de datos, los entornos aislados, la observabilidad, las revisiones de seguridad y la corrección humana pueden añadir gastos considerables.

Los resultados ajustados al riesgo también importan. Un agente que modifica sistemas de producción necesita controles más sólidos que un agente que resume documentos públicos.

El gráfico de OpenRouter no puede responder ninguna de esas preguntas. Fue diseñado para describir tráfico, no retornos empresariales.

La misma limitación se aplica a la predicción de Newman de 10 veces. Extrapolar la proporción supone que el tráfico de agentes seguirá creciendo más rápido que el tráfico humano sin una corrección de eficiencia comparable.

Esa suposición puede fallar por varias razones. Las aplicaciones pueden comprimir el contexto, usar modelos más pequeños para pasos rutinarios, sustituir el razonamiento repetido por software determinista y detener los bucles antes.

Las mejoras de los modelos pueden reducir los reintentos. Mejores interfaces de herramientas también pueden devolver información más limpia, reduciendo el número de llamadas necesarias para completar una tarea.

La presión económica fomentará esos cambios. Las empresas tienen un incentivo para eliminar llamadas que no mejoran los resultados, incluso cuando las lecturas en caché son relativamente económicas.

El debate de a16z sobre la convergencia de bucles pone de relieve el mismo problema. Un agente puede seguir produciendo trabajo adicional después de que ya haya aparecido la mayor parte del valor disponible.

Un bucle sin una prueba externa de finalización puede confundir la actividad continua con el progreso. Podría editar repetidamente un documento, volver a ejecutar un comando que falla o refinar una respuesta ya aceptable.

Este comportamiento es especialmente difícil de detectar cuando cada llamada individual parece razonable. El desperdicio surge a lo largo de toda la trayectoria, no dentro de una sola respuesta.

Por tanto, la observabilidad debe operar a nivel de tarea. Los desarrolladores necesitan trazas que conecten cada llamada al modelo con el uso de herramientas, los cambios de estado, los errores y los resultados finales.

Los presupuestos también deben reflejar el valor de la tarea. Una investigación de alto riesgo puede justificar más iteraciones que una solicitud rutinaria de formato.

Las reglas de escalación crean otro límite. Cuando el agente encuentra fallos repetidos o permisos inciertos, ceder el control a una persona puede ser más barato y seguro.

También existe un efecto de selección en el tráfico de OpenRouter. La plataforma atiende a desarrolladores que utilizan deliberadamente una pasarela de modelos, lo que puede producir una combinación de cargas de trabajo más técnica que la de las aplicaciones de consumo.

Por tanto, la programación y los marcos de agentes pueden ocupar una proporción mayor en OpenRouter que en el mercado total de IA.

La escala de OpenRouter sigue haciendo importante la tendencia. Sus datos cubren un tráfico real considerable entre muchos modelos y proveedores. Los resultados simplemente deben mantenerse vinculados a ese alcance.

Las relaciones de la plataforma introducen otra consideración. Andreessen Horowitz ha invertido en OpenRouter, lo que da a a16z interés en el crecimiento de la infraestructura de enrutamiento de tokens.

Eso no invalida las cifras. Hace más importante una metodología transparente y una replicación independiente, especialmente cuando los datos respaldan afirmaciones amplias sobre la economía de la IA.

La interpretación más sólida evita ambos extremos. El gráfico no es ni una prueba de que las máquinas autónomas se hayan convertido en los principales clientes de la IA ni un artefacto vacío del almacenamiento en caché.

Es evidencia de que las arquitecturas de agentes amplifican la demanda de inferencia. También muestra que esta amplificación depende actualmente en gran medida de transportar y recuperar contexto antiguo.

Para los compradores, la pregunta central no es si un agente usa muchos tokens. Es si cada ronda adicional aumenta la probabilidad de un resultado exitoso y valioso.

Los Proveedores de Memoria y las Plataformas de Agentes Enfrentan la Presión Inmediata

El cambio en el tráfico recompensa a los sistemas que gestionan el contexto de forma eficiente y presiona a los productos que tratan el consumo de tokens como un indicador de progreso.

Los proveedores de modelos enfrentan una carga de trabajo más compleja que el chat ordinario de solicitud-respuesta. Las sesiones de agentes pueden permanecer activas más tiempo, llamar repetidamente a herramientas y mantener historiales crecientes.

Esa carga de trabajo presiona a los planificadores y sistemas de enrutamiento. Los proveedores deben equilibrar la localidad de caché, la disponibilidad de modelos, la latencia y la fiabilidad ante una demanda cambiante.

Las plataformas de pasarela como OpenRouter ganan importancia estratégica porque las aplicaciones utilizan cada vez más varios modelos. Un flujo de trabajo puede enrutar la planificación, la programación, la validación y el resumen a distintos puntos de acceso.

El enrutamiento dinámico puede reducir costes o mejorar el rendimiento, pero también puede interferir con el almacenamiento en caché. Una solicitud enviada a un proveedor diferente podría perder acceso a una caché establecida previamente.

Los proveedores que expongan métricas claras de caché tendrán ventaja con compradores sofisticados. Los equipos necesitan saber cuántos tokens fueron nuevos, almacenados en caché, generados o escritos en almacenamiento.

Los fabricantes de memoria también enfrentan demanda por contextos más grandes y más sesiones simultáneas. La memoria de alto ancho de banda alimenta los aceleradores de modelos, mientras que la memoria y el almacenamiento convencionales respaldan los sistemas circundantes.

Sin embargo, el gráfico no cuantifica futuras compras de memoria. Muestra tráfico de tokens, no una correspondencia exacta entre cada token y nueva capacidad de hardware.

La demanda de hardware depende de la arquitectura del modelo, los tipos de datos, el procesamiento por lotes, la expulsión de caché, la compresión y el número de sesiones simultáneas. Las mejoras de software pueden cambiar cada relación.

Las plataformas de agentes enfrentan presión desde otra dirección. Los clientes compararán cada vez más el trabajo útil por token, no solo el acceso a modelos capaces.

Los productos que ocultan el consumo tras afirmaciones amplias de uso pueden tener dificultades cuando los equipos financieros empresariales exijan una economía a nivel de tarea. Los compradores querrán evidencia repetible en sus propias cargas de trabajo.

Los agentes de programación ofrecen una prueba temprana porque sus resultados pueden evaluarse mediante compilaciones, pruebas, revisiones y resultados de despliegue. Estas señales crean condiciones de parada medibles.

Otros ámbitos siguen siendo más difíciles. La investigación, la estrategia y la redacción a menudo carecen de una única prueba objetiva. Los agentes pueden seguir refinando resultados sin un momento claro de finalización.

Esa incertidumbre hace más importante la revisión humana, incluso cuando los agentes realizan la mayor parte del trabajo intermedio. También hace más difícil comparar la eficiencia de tokens entre proveedores.

Los proveedores de infraestructura pueden responder con compresión de contexto, almacenamiento en caché de prefijos, sesiones con estado y sistemas de recuperación. Cada enfoque intenta evitar reenviar historiales innecesarios.

Los desarrolladores de aplicaciones pueden separar la memoria duradera del contexto de trabajo. La memoria duradera almacena información potencialmente útil, mientras que el contexto de trabajo contiene únicamente lo que requiere el paso actual.

Esta separación reduce el texto repetido y limita la información irrelevante. También puede mejorar la precisión del modelo al mantener las distracciones fuera del prompt activo.

El software determinista debe encargarse del trabajo determinista. Un agente no necesita razonar una operación de cálculo, validación de esqumas o control de acceso cuando un código fiable puede ejecutarlo directamente.

Los sistemas más eficientes probablemente combinarán modelos con software convencional. Los modelos gestionan la ambigüedad y la planificación, mientras que el código aplica reglas y realiza operaciones estables.

Este diseño híbrido debilita la suposición de que el tráfico de agentes debe crecer sin límite. Los sistemas mejores pueden completar más tareas reduciendo a la vez los tokens por tarea.

Al mismo tiempo, la caída de los costes unitarios puede aumentar la demanda total. Cuando cada flujo de trabajo se abarata, los desarrolladores pueden implementar agentes en más lugares y ejecutarlos con mayor frecuencia.

El efecto rebote resultante puede mantener el crecimiento de la infraestructura incluso cuando las tareas individuales se vuelven más eficientes. Esa posibilidad respalda la dirección de la previsión de Newman, aunque no su proporción exacta.

El tráfico humano también puede crecer. Mejores productos de consumo, nuevas interfaces y una adopción empresarial más amplia podrían aumentar el uso directo junto con el tráfico de agentes.

La proporción futura depende de qué curva crezca más rápido. No es únicamente una función de la mejora de los agentes.

La competencia entre OpenAI, Anthropic, Google, los desarrolladores de modelos de pesos abiertos y los proveedores especializados de inferencia dará forma a esa curva. Sus reglas de caché y capacidades de herramientas difieren.

La elección de modelo también puede cambiar durante un flujo de trabajo. Un modelo pequeño podría clasificar una solicitud, mientras que uno más grande gestiona una decisión difícil.

Esa arquitectura reduce la relevancia de un único recuento agregado de tokens. Un token procesado por un modelo compacto tiene un perfil de recursos distinto al de uno procesado por un modelo de frontera.

Las empresas necesitarán métricas normalizadas que combinen la elección de modelo, el tipo de token, la latencia, la energía y el éxito de la tarea. Actualmente no existe un estándar ampliamente aceptado que capture el panorama completo.

Hasta que surja uno, el uso de tokens de agentes de OpenRouter sigue siendo un indicador adelantado útil. Revela la forma de la demanda antes de que los informes financieros puedan explicar su valor.

Tres señales pondrán a prueba la predicción de 10x

La próxima fase debe evaluarse según la estabilidad de la clasificación, el crecimiento de los tokens nuevos y el trabajo completado por unidad de inferencia.

La primera señal es si la proporción de agentes frente a humanos de OpenRouter continúa aumentando después de agosto. Un incremento sostenido respaldaría la idea de que los flujos de trabajo autónomos se expanden más rápido que la interacción directa.

La comparación debe utilizar el mismo método de clasificación y la misma ventana de medición. Los cambios metodológicos podrían generar un crecimiento aparente sin un cambio equivalente en el comportamiento.

El tráfico mixto merece especial atención. Si crece más rápido que ambas categorías, el límite entre el uso humano y el de agentes se volverá menos fiable.

La segunda señal es la composición de los tokens de agentes. Una proporción creciente de tokens en caché indicaría que la repetición de contexto, y no el procesamiento nuevo del modelo, sigue siendo el principal motor de crecimiento.

Una proporción decreciente de caché junto con un volumen total creciente contaría una historia distinta. Sugeriría que los agentes están realizando más inferencia nueva, en lugar de limitarse principalmente a reproducir contexto ya establecido.

Los informes públicos deberían diferenciar entre entradas nuevas, lecturas de caché, escrituras de caché, tokens de razonamiento y salidas. Combinarlos en una sola cifra oculta diferencias importantes en costes y demanda de infraestructura.

La tercera señal es la eficiencia de las tareas. Los proveedores de agentes y los usuarios empresariales deberían informar del trabajo completado por llamada al modelo, los tokens por tarea realizada con éxito y las intervenciones humanas por finalización.

Si esas métricas mejoran mientras el tráfico total de agentes aumenta, el argumento a favor del crecimiento se fortalece. Indicaría que la adopción y la automatización exitosa se están expandiendo juntas.

Si el uso de tokens aumenta mientras el éxito se mantiene estable, el gráfico describiría cada vez más desperdicio operativo. Una proporción mayor debilitaría entonces, en vez de reforzar, el argumento de ROI.

Los conjuntos de datos independientes también mejorarían la confianza. El tráfico procedente de API directas de modelos, plataformas en la nube e implementaciones privadas podría mostrar si OpenRouter refleja el mercado en general.

Por ahora, la evidencia respalda una conclusión más acotada que la afirmación viral. Los agentes generaron más de cinco veces el tráfico de tokens humanos observado en OpenRouter durante agosto de 2026.

La mayor parte de ese tráfico parece involucrar contexto en caché. Ese contexto sigue requiriendo memoria, enrutamiento y una gestión cuidadosa, pero no debe confundirse con una cantidad equivalente de razonamiento nuevo.

El avance hacia 10 veces es una previsión, no un resultado establecido. Su importancia dependerá de lo que consigan los tokens adicionales.

Los desarrolladores deberían examinar si cada bucle tiene un propósito, un presupuesto y una condición de parada claros. Los compradores empresariales deberían exigir evidencia a nivel de tarea antes de considerar el consumo como adopción.

La pregunta útil ya no es si los agentes generarán más tráfico que las personas. Los datos de OpenRouter sugieren que ya lo hacen. La cuestión es si el próximo billón de tokens completará más trabajo o simplemente releerá más del pasado.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page