top of page

El informe de costes de Epoch AI revela que los precios de la IA caen más rápido que la ley de Moore

hace 6 días
14 min de lectura

Epoch AI afirma que el coste de alcanzar un nivel fijo de rendimiento de IA ha caído un 47 % por trimestre desde 2023. El nuevo informe de costes de Epoch AI traduce ese ritmo en una reducción anual de 13 veces, muy por encima de las mejoras históricas en el hardware informático.

Este hallazgo no significa que todas las facturas de IA disminuyan en la misma proporción. Mide la forma más barata disponible de alcanzar una puntuación definida en cinco benchmarks que abarcan matemáticas, ciencia y juegos. La distinción importa porque los modelos más nuevos pueden ofrecer resultados comparables consumiendo menos recursos o utilizando infraestructura más económica.

La comparación con la ley de Moore sigue siendo llamativa. La computación se abarató de forma constante durante décadas, ayudando a hacer posibles los ordenadores personales, los smartphones y los servicios en la nube. Epoch AI sostiene que los precios de la IA ajustados al rendimiento están cayendo ahora seis veces más rápido que la tasa histórica de la computación.

Los beneficiarios inmediatos son los desarrolladores y las organizaciones que pueden trasladar cargas de trabajo entre modelos. La presión recae sobre OpenAI, Anthropic, Google y los servicios de IA de terceros que necesitan ingresos recurrentes. Un modelo prémium puede tomar la delantera, pero su ventaja económica puede desaparecer en cuestión de meses.

Eso genera la tensión central. Una inteligencia más barata favorece una adopción más amplia, pero esa misma caída debilita la fidelidad basada en el precio y reduce el valor del acceso bruto a los modelos. El negocio duradero puede situarse por encima de la capa de modelos, donde los productos conservan contexto, integración en los flujos de trabajo, confianza y datos propietarios.

Qué midió realmente el informe de costes de Epoch AI

Epoch AI midió el coste de un resultado, no simplemente el precio anunciado de un token de IA.

La organización de investigación publicó su análisis de costes el 22 de septiembre de 2026. Los investigadores Luke Emberson y David Roodman examinaron el rendimiento y el coste de los modelos en cinco benchmarks desde 2023.

Los benchmarks abarcan preguntas difíciles de matemáticas, ciencia de nivel de posgrado, ajedrez y otros juegos de habilidad. A continuación, Epoch AI estimó la ruta disponible más barata para cada nivel de rendimiento alcanzable en distintas fechas.

Este límite se denomina frontera de Pareto. Representa los modelos que proporcionan el mejor rendimiento disponible para un coste determinado. Un modelo fuera de esa frontera cuesta más sin ofrecer un resultado mejor.

El método también tiene en cuenta los presupuestos de razonamiento. Un modelo de razonamiento puede dedicar más tokens de salida a considerar un problema, aumentando su probabilidad de responder correctamente. Por tanto, un precio simple por token no revela el coste total de completar una tarea.

Epoch AI utilizó transcripciones de evaluaciones para estimar cómo cambia el rendimiento bajo distintos límites presupuestarios. El enfoque sigue trabajos del Center for AI Standards and Innovation federal, o CAISI. Produce una curva de coste-rendimiento para cada modelo, en lugar de reducirlo a una única tarifa anunciada.

Esta distinción cobra importancia cuando dos modelos utilizan los tokens de manera diferente. Un modelo con tokens más baratos puede generar muchos más antes de completar una tarea. Su aparente ventaja de precio puede desaparecer al medirse desde la pregunta hasta la respuesta correcta.

En los cinco benchmarks, Epoch AI calculó una caída media ajustada al rendimiento del 47 % por trimestre. Eso equivale aproximadamente a una reducción de 13 veces en un año si la tendencia se compone.

El ritmo varió según el ámbito. Los precios cayeron aproximadamente entre un 39 % y un 43 % por trimestre en los acertijos basados en juegos. Los benchmarks de matemáticas mostraron descensos más rápidos, de aproximadamente entre un 50 % y un 52 % por trimestre.

Un ejemplo ilustra la escala sin recurrir a los precios de lista de los tokens. Epoch AI comparó dos modelos de OpenAI lanzados con menos de 18 meses de diferencia. Según se informa, el modelo posterior alcanzó la misma puntuación en GPQA Diamond con aproximadamente una setecientas veinticincoava parte del coste del modelo anterior.

GPQA Diamond es un benchmark de opción múltiple diseñado en torno a preguntas de nivel de posgrado en física, química y biología. Captura un tipo exigente de razonamiento, pero no toda la gama de trabajo útil.

Por tanto, la cifra principal se interpreta mejor como un índice de precios de capacidad medida. No describe los costes de entrenamiento, el gasto corporativo ni la factura de cada cliente. Registra cuán barato puede adquirirse un resultado de benchmark del modelo disponible más rentable.

Ese resultado también coincide con evidencias anteriores. El AI Index de Stanford halló una reducción de más de 280 veces en el coste de un rendimiento de nivel GPT-3.5 entre noviembre de 2022 y octubre de 2024.

El hallazgo de Stanford utilizó MMLU, un benchmark amplio de conocimientos, en lugar del conjunto completo de curvas de coste-rendimiento de Epoch AI. Métodos distintos producen tasas diferentes, pero ambos apuntan a un descenso inusualmente pronunciado.

La convergencia importa más que cualquier estimación individual. Los conjuntos de datos independientes muestran cada vez más que la capacidad útil de IA se está abaratando mucho más rápido que el hardware que la sustenta.

Por qué los precios del rendimiento de IA están cayendo tan rápido

El descenso combina mejores algoritmos, modelos pequeños y capaces, hardware mejorado y una competencia agresiva entre proveedores.

La ley de Moore describe la tendencia histórica de la densidad de transistores a aumentar con el tiempo. La expresión también se asocia con la reducción de los costes de computación, aunque el número de transistores y los precios para clientes no son medidas idénticas.

Epoch AI estima que los precios de computación cayeron a una tasa compuesta de aproximadamente 1,51 veces al año entre 1940 y 2001. Su descenso estimado en el precio del rendimiento de IA desde 2023 es de aproximadamente 13 veces al año.

La diferencia existe porque la IA se beneficia de más cosas que el progreso de los semiconductores. Los desarrolladores de modelos mejoran simultáneamente arquitecturas, métodos de entrenamiento, selección de datos, cuantización, software de inferencia y utilización del hardware.

La cuantización reduce la precisión numérica utilizada para almacenar y ejecutar un modelo. Aplicada cuidadosamente, reduce los requisitos de memoria y computación mientras preserva gran parte del rendimiento útil del modelo.

Los sistemas de mezcla de expertos ofrecen otra vía. Activan solo partes seleccionadas de un modelo para cada entrada, en lugar de usar todos los parámetros. Ese diseño puede aumentar la capacidad sin requerir toda la red para cada solicitud.

La destilación transfiere comportamientos útiles de un modelo grande a uno más pequeño. El modelo más pequeño puede entonces gestionar tareas rutinarias con menor latencia y consumo de recursos. Las organizaciones pueden reservar los modelos grandes para problemas en los que su capacidad adicional cambie el resultado.

La competencia amplifica estas ganancias de ingeniería. Los proveedores lanzan repetidamente modelos más pequeños diseñados para aproximarse al rendimiento de los buques insignia anteriores. Los modelos de pesos abiertos también permiten a hosts independientes competir en eficiencia de servicio.

Un artículo de investigación de 2026 titulado The Price of Progress llegó a una conclusión más conservadora utilizando datos de Epoch AI y Artificial Analysis. Estimó descensos anuales de entre cinco y diez veces para un rendimiento comparable en benchmarks.

Los autores atribuyeron el descenso a la eficiencia del hardware, las mejoras algorítmicas y la competencia económica. Tras intentar separar los efectos del hardware y del mercado, estimaron aproximadamente un progreso anual de tres veces derivado de la eficiencia algorítmica.

Esa estimación está por debajo de la tasa principal de 13 veces de Epoch AI. La diferencia no vuelve inútil a ninguno de los análisis. Muestra hasta qué punto el resultado depende de los benchmarks, los umbrales de rendimiento, los conjuntos de modelos y las definiciones de frontera.

La métrica de Epoch AI favorece el modelo disponible más barato en cada nivel de capacidad. Ese marco presupone un comprador muy activo que reevalúa regularmente el mercado y cambia al líder actual en costes.

Las organizaciones reales se comportan de otra manera. Dedican tiempo a probar modelos, reescribir prompts, comprobar la seguridad, actualizar evaluaciones y renegociar contratos. Esos costes de cambio impiden que muchos usuarios aprovechen todo el descenso teórico.

El estudio también concluye que los precios caen más rápido inmediatamente después de que aparece por primera vez un nivel de rendimiento. En sus cinco benchmarks principales, el rendimiento cercano a la frontera se abarató inicialmente un 66 % por trimestre.

Dos años después del debut de un nivel de rendimiento, el descenso trimestral estimado se ralentizó al 32 %. Sigue representando una rápida reducción anual, pero es menos espectacular que la carrera inicial.

Epoch AI sugiere que una capacidad nueva obtiene brevemente una prima. Después, los competidores la reproducen o se aproximan a ella, mientras el proveedor original optimiza los costes de servicio. La prima se reduce a medida que la capacidad se vuelve común.

Este patrón explica por qué el descenso agregado puede superar a la ley de Moore. El mercado no espera a una nueva generación de chips. Superpone mejoras de software, modelos, infraestructura y competencia sobre las continuas ganancias de hardware.

También explica por qué la tendencia puede persistir mientras las empresas de IA gastan más en centros de datos. Entrenar el modelo más potente y ofrecer una capacidad consolidada son actividades económicas distintas.

Los laboratorios de frontera pueden destinar recursos crecientes a la investigación mientras los clientes pagan menos por el rendimiento de ayer. La industria está haciendo simultáneamente que la frontera sea más cara de crear y que la capacidad existente sea más barata de consumir.

Una inteligencia más barata presiona a los proveedores de modelos

Las rápidas caídas de precios convierten la capacidad bruta de los modelos en un producto depreciable, con una ventana cada vez más corta para obtener rendimientos prémium.

OpenAI, Anthropic, Google y otros desarrolladores de modelos compiten por establecer la frontera de rendimiento. Esa posición atrae atención, pruebas empresariales y desarrolladores que buscan el sistema más potente disponible.

Los hallazgos de Epoch AI sugieren que esta ventaja pierde valor económico con rapidez. En los cinco benchmarks, los descensos más rápidos aparecieron alrededor de niveles de rendimiento recién alcanzados. La prima asociada a un resultado líder se debilitó después a medida que los competidores se ponían al día.

Esto crea un difícil problema de ingresos. Un laboratorio necesita una inversión sustancial para entrenar, evaluar, asegurar y operar un modelo de frontera. Sin embargo, el precio que los clientes aceptan por una capacidad fija puede caer antes de que ese modelo haya disfrutado de una larga vida comercial.

El análisis periodístico original destacó el desafío resultante para la fidelidad de los clientes. Si un modelo comparable se vuelve más barato en pocos meses, los compradores tienen un motivo para mantener alternativas disponibles.

Los servicios de IA de terceros enfrentan una versión todavía más aguda de este problema. Un producto que simplemente revende acceso a un modelo puede verse superado en precio por otro servicio que use un modelo más nuevo.

Los clientes también podrían cuestionar un compromiso prolongado con cualquier proveedor individual. El modelo preferido de hoy podría perder su ventaja tras el siguiente ciclo de lanzamientos. Una arquitectura fija puede convertir la caída de los costes upstream en presión para migrar.

La respuesta del mercado ya es visible en el diseño de productos. Los proveedores compiten cada vez más mediante entornos de programación, agentes, sistemas de archivos, conectores, memoria, controles de seguridad y opciones de implementación.

Estas características generan valor que un benchmark no mide. Cambiar de modelo se vuelve más difícil cuando el servicio circundante comprende los permisos, la terminología, los documentos y el proceso de revisión de una empresa.

La fiabilidad también importa. Una empresa no se beneficia de una respuesta más barata si esa respuesta provoca más revisión humana. La métrica útil es el coste total de completar un trabajo aceptable, incluidos los fallos y la supervisión.

La latencia crea otra distinción. Dos modelos pueden lograr puntuaciones similares en benchmarks y, aun así, tardar tiempos distintos en responder. Los productos interactivos suelen valorar más una velocidad predecible que una pequeña reducción del gasto de inferencia.

La privacidad y la gobernanza también pueden pesar más que el precio. Los compradores necesitan saber adónde van los datos, cuánto tiempo los conservan los proveedores y si los administradores pueden aplicar reglas de acceso.

Estos factores proporcionan a los proveedores establecidos defensas frente a la competencia puramente basada en el precio. Las interfaces conocidas, las integraciones existentes, las aprobaciones de seguridad y el contexto de usuario acumulado crean costes prácticos de cambio.

Sin embargo, esas defensas solo funcionan cuando el producto aporta valor más allá de la selección de modelos. Un envoltorio ligero con prompts genéricos tiene poca protección cuando abundan los sustitutos capaces.

Es probable que los servicios independientes más sólidos traten los modelos como infraestructura sustituible. Pueden dirigir tareas sencillas a sistemas eficientes y reservar capacidades premium para trabajos difíciles.

Ese enfoque exige evaluación en lugar de lealtad. Los desarrolladores necesitan pruebas representativas para sus propios casos de uso, incluidas la calidad, la latencia, las tasas de fallo y el consumo de recursos de extremo a extremo.

También cambia la forma en que las organizaciones deberían ver la adquisición de IA. La pregunta ya no es qué modelo individual gana todos los benchmarks. La pregunta es qué cartera ofrece resultados aceptables en distintas tareas.

Los productos intensivos en conocimiento tienen otra ventaja. Un sistema que organiza la información fiable de un usuario puede conservar su valor incluso cuando cambia su modelo subyacente. El contexto acumulado pertenece al flujo de trabajo, no a una generación concreta de modelos.

Aquí es donde una base de conocimiento de IA puede ser más duradera que el acceso directo a un chat. Su valor proviene de la recuperación, la organización, los permisos y la continuidad entre trabajos repetidos.

La caída de los costes de los modelos puede mejorar los márgenes de estos productos. Pueden utilizar modelos más potentes sin aumentar los costes de cara al cliente, o aplicar IA a más pasos dentro de un flujo de trabajo.

El mismo descenso puede perjudicar a los servicios que compiten principalmente por el acceso. A medida que la inteligencia artificial se abarata, la diferenciación se desplaza hacia el contexto propietario, una ejecución fiable y resultados empresariales medibles.

Lo que las cifras no demuestran

Las caídas de precios ajustadas por benchmark son evidencia real, pero no constituyen una medida universal de trabajo útil o fiable.

Epoch AI expone directamente varias limitaciones. Su conjunto de datos principal abarca unos tres años, contiene combinaciones incompletas de modelos y benchmarks, e incluye estimaciones con ruido.

Es un periodo corto para comparar la IA con tecnologías medidas durante décadas. La computación, las baterías, la secuenciación y la electricidad también tienen productos, mercados y definiciones de rendimiento diferentes.

Las comparaciones siguen ofreciendo una escala histórica. Sin embargo, una respuesta de benchmark está menos estandarizada físicamente que una unidad de electricidad o de capacidad de batería.

La optimización para benchmarks plantea otra preocupación. Los desarrolladores pueden entrenar modelos con tareas parecidas a evaluaciones populares, de forma intencionada o indirecta. El rendimiento puede entonces mejorar más rápido en la prueba que en entornos reales desconocidos.

Epoch AI denomina a este riesgo benchmaxxing. Los elementos aleatorizados de los benchmarks pueden reducir el reconocimiento y la memorización, pero no pueden eliminar todas las formas de contaminación u optimización dirigida.

Una puntuación alta tampoco garantiza un trabajo fiable. GPQA Diamond mide respuestas a preguntas científicas difíciles. No mide si un modelo puede mantener un proyecto, seguir la política de una empresa o evitar errores costosos.

La guía de evaluación de NIST subraya que las comparaciones entre modelos dependen de la configuración de las tareas, las herramientas, los prompts, los niveles de razonamiento, el número de muestras y los métodos de puntuación. Pequeñas diferencias de configuración pueden alterar tanto el rendimiento como el gasto.

Las evaluaciones de CAISI también muestran por qué importa la medición de extremo a extremo. Un modelo con tarifas por token más bajas puede consumir más tokens, utilizar más llamadas a herramientas o fallar con mayor frecuencia. Por tanto, el coste total de su tarea puede superar al de un rival aparentemente caro.

Los usuarios reales tampoco cambian de modelos con la misma eficiencia que supone el método de frontera de Epoch AI. La migración requiere pruebas, trabajo de integración, revisión de riesgos y formación del personal.

Una empresa puede mantener racionalmente a un proveedor más caro porque ya cumple los requisitos de seguridad. Otra puede valorar resultados estables porque los cambios alterarían sus flujos de trabajo automatizados.

La demanda puede absorber parte de los ahorros. Cuando una tarea de IA se abarata, los desarrolladores suelen ejecutarla con más frecuencia, ampliar el contexto, solicitar más alternativas o añadir etapas de verificación.

Esta es una versión del efecto Jevons. Una mayor eficiencia reduce el coste de cada unidad, pero el consumo total puede aumentar lo suficiente como para mantener o incrementar el gasto global.

Los modelos de razonamiento refuerzan ese efecto. Un modelo base más eficiente puede dedicar computación adicional a comprobar una respuesta o explorar alternativas. Los usuarios obtienen mejores resultados sin que necesariamente vean una reducción proporcional de su uso total.

El informe tampoco demuestra que el desarrollo de frontera se haya vuelto barato. Entrenar un nuevo modelo líder exige recursos distintos de los necesarios para ofrecer una capacidad ya conocida.

Los equipos de investigación pagan por experimentos, trabajo especializado, preparación de datos, evaluación e infraestructura. Estos costes pueden aumentar incluso mientras la inferencia para tareas establecidas se vuelve drásticamente más barata.

Esta distinción resuelve una aparente contradicción. Los proveedores de modelos pueden anunciar enormes programas de infraestructura mientras el precio ajustado por rendimiento de sus resultados continúa bajando.

Por tanto, el informe respalda una conclusión limitada pero importante. Una capacidad medida comparable se ha vuelto mucho más barata en la frontera del mercado.

No demuestra que todas las cargas de trabajo mejoren al mismo ritmo. No garantiza una seguridad, fiabilidad, privacidad, latencia o calidad de integración equivalentes.

Los compradores deberían tratar la tasa trimestral del 47% como una señal de mercado, no como una previsión presupuestaria. La dirección parece estar bien respaldada. El ritmo exacto sigue siendo sensible a las decisiones de medición y al comportamiento de los usuarios.

Tres señales que pondrán a prueba la caída de costes de la IA

La próxima prueba es si los ahorros en benchmarks resisten el contacto con cargas de trabajo reales, la economía de los proveedores y el comportamiento cotidiano de cambio.

La primera señal es el coste de tareas de extremo a extremo medido de forma independiente. Más evaluaciones deberían comparar el gasto total necesario para completar con éxito flujos de trabajo de programación, investigación, atención al cliente y documentos.

Estas pruebas necesitan conjuntos de tareas estables, herramientas controladas y umbrales de calidad claros. Deberían incluir reintentos, tokens de razonamiento, llamadas a herramientas, latencia y revisión humana.

Si esas mediciones caen a un ritmo cercano a la estimación de Epoch AI, las implicaciones comerciales del informe se reforzarán. Un descenso mucho más lento mostraría que los ahorros en benchmarks sobrestiman las ganancias prácticas.

La segunda señal son los precios y el empaquetado de productos de los proveedores. Los proveedores de modelos pueden responder a la caída de los precios de inferencia reduciendo tarifas, aumentando las asignaciones de uso o integrando capacidades en suscripciones más amplias.

También pueden proteger los ingresos mediante plataformas de agentes, controles empresariales, almacenamiento y herramientas propietarias. Esas incorporaciones confirmarían que la competencia se está desplazando por encima del modelo base.

Observe con qué frecuencia los proveedores sustituyen funciones premium por acceso estándar. Una migración rápida desde la exclusividad de los modelos insignia hacia modelos más pequeños respaldaría el hallazgo de Epoch AI sobre las primas de frontera efímeras.

La tercera señal es el cambio de cliente. El cálculo de frontera supone que los compradores eligen repetidamente el modelo capaz más barato. Los datos reales de adopción mostrarán si realmente se comportan de esa manera.

Los desarrolladores pueden adoptar sistemas de enrutamiento que envíen cada tarea al modelo adecuado. Las empresas pueden exigir cláusulas de portabilidad y evaluaciones estandarizadas antes de asumir compromisos de larga duración.

Como alternativa, los flujos de trabajo integrados pueden mantener a los clientes con un proveedor pese a grandes diferencias de precio. Ese resultado debilitaría la afirmación de que la caída de los precios por rendimiento destruye automáticamente la lealtad hacia los proveedores.

Los modelos de pesos abiertos influirán en las tres señales. Ofrecen a los alojadores independientes más libertad para optimizar la implementación y desafiar a los proveedores cerrados en costes. También trasladan más responsabilidad sobre seguridad, mantenimiento y evaluación al operador.

El resultado probable no es una carrera uniforme hacia la tarifa más baja. Los mercados de IA se separarán en capas.

En la capa de modelos, la capacidad comparable debería seguir enfrentando presión sobre los precios. En la capa de aplicaciones, los proveedores competirán mediante contexto, propiedad del flujo de trabajo, confianza y calidad de ejecución.

Para los desarrolladores, la respuesta práctica es preservar la opcionalidad. Mantengan modulares las interfaces de modelos, conserven conjuntos de evaluación y midan la finalización exitosa de tareas en lugar del consumo de tokens por sí solo.

Los compradores empresariales también deberían acortar sus supuestos sobre la estabilidad de costes. Un contrato que hoy parece eficiente puede volverse poco competitivo rápidamente, incluso cuando el servicio subyacente sigue siendo capaz.

Los trabajadores del conocimiento deberían esperar que las funciones de IA se extiendan a más productos. Los menores costes de inferencia hacen económicamente viables la síntesis, la recuperación, la redacción, la clasificación y el procesamiento en segundo plano en más situaciones.

El informe de costes de Epoch AI no resuelve cuán rentable llegará a ser el sector. Sí muestra que el acceso a un nivel fijo de inteligencia medida está perdiendo escasez a una velocidad inusualmente alta.

La pregunta para cada producto de IA ahora es concreta: si la capacidad de los modelos se vuelve 13 veces más barata en un año, ¿qué valor sigue siendo único? Los productos con contexto fiable y flujos de trabajo dependables tienen una respuesta. Los servicios que venden poco más que acceso a modelos todavía necesitan una.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page