top of page

AMD y Cerebras se asocian para ofrecer inferencia de IA de baja latencia y alto rendimiento

AMD y Cerebras han unido dos sistemas de computación que hasta ahora abordaban la inferencia de IA desde direcciones diferentes. Su asociación del 23 de julio apunta tanto a un alto rendimiento como a una baja latencia.

La cobertura de Tom's Hardware describe una plataforma desagregada que asigna el procesamiento de prompts a AMD Helios. Los Cerebras Wafer-Scale Engines se encargan del trabajo intensivo en memoria de generar tokens. Las empresas esperan obtener hasta cinco veces más tokens por segundo por vatio que con una configuración solo de Cerebras.

Esta afirmación sigue basándose en modelos de las empresas, no en pruebas de producción independientes. Sin embargo, la arquitectura importa antes de que las cifras reciban validación externa. AMD y Cerebras cuestionan la idea de que una sola familia de aceleradores deba controlar cada etapa de una solicitud de IA.

Nvidia ya separa el trabajo de inferencia mediante su estrategia de software y hardware. La nueva asociación convierte esa separación en un argumento competitivo a favor de arquitecturas mixtas. AMD aporta capacidad a escala de rack, mientras que Cerebras proporciona rendimiento especializado para la decodificación.

El resultado se parece a un encuentro cooperativo entre gigantes, no al enfrentamiento hostil de la Odisea de Homero. Cada gigante se ocupa de la tarea que mejor se adapta a su arquitectura. Que la conexión entre ambos funcione eficientemente determinará si la alianza se convierte en algo más que un diagrama impresionante.

La cobertura de Tom's Hardware muestra exactamente qué cambió

AMD y Cerebras están construyendo un único servicio de inferencia a partir de dos plataformas de computación físicamente distintas.

Las empresas anunciaron la asociación técnica durante el evento Advancing AI 2026 de AMD, el 23 de julio. Su sistema combina la infraestructura a escala de rack AMD Helios con la tecnología Cerebras Wafer-Scale Engine.

Cerebras planea instalar sistemas Helios en sus propios centros de datos. Según las empresas, el primer acceso público debería llegar a través de Cerebras Cloud durante la segunda mitad de 2026.

Este plan de despliegue distingue el anuncio de un acuerdo de compatibilidad poco definido. Cerebras operará equipos de AMD junto a sus propios racks WSE y ofrecerá la infraestructura combinada como servicio.

La arquitectura divide la inferencia de grandes modelos de lenguaje en dos etapas principales. El prefill procesa el prompt del usuario y crea el estado interno necesario para la generación. La decodificación produce repetidamente los tokens de respuesta que ven los usuarios.

Estas etapas ejercen presiones distintas sobre el hardware. El prefill se vuelve intensivo en cómputo cuando los prompts contienen documentos largos, registros recuperados o un historial de conversación extenso. La decodificación lee repetidamente los datos del modelo y, por tanto, depende en gran medida del ancho de banda de memoria y de una baja sobrecarga de comunicación.

AMD Helios se encargará del prefill, incluidos los prompts con grandes ventanas de contexto. Los sistemas Cerebras WSE se encargarán de la decodificación y la generación de tokens. Una capa de orquestación deberá mover cada solicitud y su estado intermedio entre esos entornos.

La asociación de inferencia oficial presenta esta división como una forma de evitar tener que elegir entre interactividad y capacidad total. AMD proporciona el motor de rendimiento, mientras que Cerebras aporta el motor de generación de baja latencia.

Las empresas afirman que su plataforma combinada puede ofrecer hasta cinco veces más tokens por segundo por vatio. Esta comparación utiliza tokens por segundo por kilovatio con un nivel de interactividad similar.

AMD Performance Labs y Cerebras modelaron el resultado en julio de 2026 utilizando el modelo Kimi 2.6 de un billón de parámetros. La referencia fue una configuración solo con Cerebras WSE, no un sistema rival de Nvidia.

Esta salvedad importa. La cifra de cinco veces no establece una ventaja de cinco veces frente a todas las alternativas. Estima cuánto puede mejorar la eficiencia la capacidad de AMD cuando se añade a un despliegue específico de Cerebras.

Tom's Hardware también identificó un detalle importante que falta. AMD y Cerebras no han explicado cómo se interconectarán las dos plataformas. No han publicado mediciones de latencia, rendimiento, utilización ni fiabilidad para el flujo de trabajo completo.

Mover la caché clave-valor, o caché KV, es especialmente importante. Esta caché almacena la información creada durante el prefill para que el sistema de decodificación pueda continuar la solicitud sin repetir los cálculos previos.

Una transferencia de caché grande puede eliminar las ganancias de la especialización cuando la conexión es lenta. El enrutamiento eficiente también debe evitar que un WSE rápido espere a un rack Helios sobrecargado.

Por tanto, el anuncio modifica el mapa competitivo antes de resolver la cuestión del rendimiento. AMD ahora tiene una vía hacia la inferencia sensible a la latencia sin diseñar un procesador a escala de oblea. Cerebras obtiene un motor de prompts de alta capacidad sin reemplazar su arquitectura distintiva.

La asociación también fija una fecha real de entrega para ese diseño. Los clientes deberían poder probar el concepto a través de Cerebras Cloud antes de que termine 2026. Hasta entonces, la arquitectura es creíble, pero sus características operativas siguen sin verificarse.

Por qué la inferencia de IA se está dividiendo en dos problemas de hardware

La asociación existe porque el procesamiento de prompts y la generación de tokens ya no se comportan como una carga de trabajo uniforme.

Un chatbot sencillo puede ocultar esta distinción. Un usuario introduce una pregunta breve, el modelo la procesa y aparece una respuesta. Ambas etapas de inferencia ocurren con la suficiente rapidez como para que la infraestructura permanezca invisible.

El software agéntico cambia el patrón. Un agente de programación puede ingerir repositorios, historiales de incidencias, resultados de herramientas y comentarios repetidos. Un agente de investigación puede recuperar muchos documentos antes de producir una respuesta.

Estas aplicaciones aumentan la longitud de los prompts y la demanda simultánea. También hacen más visibles los retrasos de respuesta porque un agente puede realizar varias llamadas al modelo para una sola acción del usuario.

El prefill trabaja en paralelo sobre todos los tokens de entrada. Sus exigencias aumentan con la longitud del contexto, el tamaño del modelo y el volumen de solicitudes. Los grandes sistemas de GPU son adecuados para este trabajo porque pueden dividir cálculos densos entre muchos aceleradores.

La decodificación se comporta de forma distinta. El modelo suele generar tokens secuencialmente porque cada token nuevo depende de la salida anterior. La aritmética rápida por sí sola no garantiza una respuesta rápida.

El procesador debe acceder continuamente a los pesos y al estado almacenado en caché. El ancho de banda de memoria, el movimiento de datos y la planificación pueden volverse más importantes que las cifras de cómputo máximo. Un menor agrupamiento puede mejorar la capacidad de respuesta, pero reducir la eficiencia total del sistema.

Este conflicto crea el problema central de infraestructura. Los operadores quieren un alto rendimiento porque reduce los recursos necesarios para muchas solicitudes. Los usuarios quieren baja latencia porque los agentes lentos se perciben como poco receptivos.

Agrupar más solicitudes suele aumentar el rendimiento. Sin embargo, puede hacer que una solicitud individual espere más tiempo. Optimizar solo una métrica puede debilitar la otra.

La inferencia desagregada aborda este conflicto creando grupos de trabajadores separados. La documentación de serving de Nvidia describe un motor de prefill que crea la caché KV, la transfiere y pasa la solicitud a un motor de decodificación.

Los grupos independientes permiten a los operadores escalar cada fase según su verdadero cuello de botella. El tráfico de contexto largo puede recibir más capacidad de prefill sin obligar a ampliar en igual medida la decodificación. La generación de alta concurrencia puede recibir más trabajadores de decodificación.

AMD y Cerebras extienden esta idea de software a través de diferentes arquitecturas de procesadores. Helios utiliza GPU convencionales a escala de rack, respaldadas por CPU EPYC y redes de AMD. Cerebras utiliza un procesador construido a partir de casi una oblea completa de silicio.

Un fabricante de chips tradicional corta una oblea en muchos chips separados. Cerebras mantiene conectado un tejido de cómputo del tamaño de una oblea, reduciendo algunas fronteras de comunicación presentes en clústeres de procesadores más pequeños.

El enfoque WSE está diseñado para mantener las operaciones del modelo y la comunicación de memoria cerca de una gran superficie de cómputo. Esto convierte a Cerebras en un candidato lógico para la generación rápida de tokens, donde el movimiento repetido de datos afecta a la capacidad de respuesta.

Helios aporta la otra mitad de la ecuación. La plataforma contiene 72 GPU Instinct MI455X, procesadores de servidor EPYC, redes Pensando y un diseño de rack abierto.

AMD indica hasta 2,9 exaFLOPS de rendimiento máximo MXFP4 para un rack Helios. También indica 31 terabytes de memoria HBM4 y aproximadamente 1,67 petabytes por segundo de ancho de banda de memoria agregado.

Estas cifras son especificaciones teóricas de la plataforma, no pruebas de rendimiento de aplicaciones. Aun así, muestran por qué AMD quiere posicionar Helios como el motor de prompts de alto volumen.

Por tanto, la alianza es menos misteriosa de lo que sugiere su hardware gigantesco. Cada empresa tiene una debilidad visible cuando actúa por separado. AMD carece de la ruta especializada de decodificación a escala de oblea de Cerebras, mientras que Cerebras carece de la amplia capacidad de rack de Helios.

Unirlas promete una mejor adecuación de los recursos. También crea otra frontera de red, otro problema de orquestación y otra capa de integración de software. El valor depende de si la especialización ahorra más tiempo del que consume la coordinación.

El verdadero rival es la fábrica de IA integrada de Nvidia

AMD y Cerebras cuestionan la capacidad de Nvidia para vender la inferencia como una plataforma coordinada única.

El rival inmediato no es una sola GPU de Nvidia. Es la combinación integrada de aceleradores, redes, sistemas y software de inferencia de Nvidia.

Nvidia Dynamo ya admite serving desagregado. Separa los trabajadores de prefill y decodificación, transfiere el estado de la caché KV y enruta las solicitudes mediante infraestructura dedicada.

Nvidia puede aplicar ese enfoque dentro de un entorno construido alrededor de sus GPU y redes. Los clientes obtienen una pila de software común y un proveedor principal, aunque la arquitectura sigue conteniendo funciones de trabajadores diferenciadas.

El informe de Tom's Hardware también comparó la asociación con el concepto CPX anterior de Nvidia. Esa propuesta asignaba hardware especializado al procesamiento del contexto, mientras que las GPU con memoria de alto ancho de banda se encargaban de la generación.

AMD y Cerebras invierten esa especialización. Las GPU Helios asumen la etapa del prompt y del contexto amplio. El hardware Cerebras WSE asume la etapa de decodificación sensible a la latencia.

Desde aquel informe, la posición competitiva de Nvidia ha vuelto a cambiar. Nvidia presenta ahora Groq 3 LPX como un acelerador de inferencia de baja latencia dentro de la plataforma Vera Rubin.

Nvidia completó la adquisición de Groq en 2026, convirtiendo a un antiguo rival especialista en parte de su estrategia de infraestructura más amplia. Su arquitectura Groq 3 coordina hardware de baja latencia con GPU Rubin a través de Dynamo.

Esto convierte la asociación entre AMD y Cerebras en algo más que un interesante acuerdo de ingeniería. Forma una alianza alternativa frente a un rival que puede combinar hardware de inferencia especializado con una pila consolidada de centros de datos.

AMD aporta varios activos estratégicos. Las CPU EPYC ya tienen una presencia considerable en servidores. ROCm ofrece a los clientes una base de software de código abierto, mientras que Helios empaqueta aceleradores y redes en un diseño a escala de rack.

Las especificaciones de Helios incluyen 72 GPU MI455X y 260 terabytes por segundo de ancho de banda agregado de escalado vertical. AMD también diseñó la plataforma en torno a los estándares OCP, UALink y Ultra Ethernet.

Helios es un diseño de referencia, no un producto de rack único vendido directamente por AMD. Los fabricantes de equipos originales y los socios de diseño pueden construir sistemas basados en este plano.

Ese modelo puede ampliar la variedad de proveedores. También puede introducir diferencias de configuración que compliquen las comparaciones de rendimiento. La estimación de cinco veces de la alianza señala que los fabricantes de sistemas pueden variar las configuraciones.

Cerebras aporta su propia ventaja estratégica. Su hardware ofrece una arquitectura distinta y un servicio en la nube ya existente, lo que da a la alianza un lugar donde desplegarse antes de que haya una disponibilidad local generalizada.

AMD también participó en la financiación de Cerebras de 2026, según las divulgaciones de la empresa. Esa inversión sitúa la alianza técnica dentro de una relación estratégica más estrecha.

Ninguno de estos hechos garantiza la adopción por parte de los clientes. Los compradores empresariales compararán disponibilidad, soporte de modelos, herramientas operativas, fiabilidad y complejidad total de despliegue. El rendimiento máximo por sí solo rara vez decide una compra de infraestructura.

Nvidia conserva importantes ventajas en familiaridad con el software y experiencia de despliegue. Muchos equipos de ingeniería ya utilizan herramientas, bibliotecas y prácticas operativas basadas en CUDA.

AMD ha mejorado el soporte de ROCm y hace hincapié en la portabilidad. Sin embargo, el servicio combinado ahora necesita software que abarque las GPU de AMD y los procesadores de Cerebras, en lugar de una sola familia de aceleradores.

Esto crea una forma distinta de apertura. Los clientes obtienen hardware heterogéneo y potencialmente una mayor variedad de proveedores. También dependen de que dos proveedores coordinen lanzamientos, depuración, capacidad y compromisos de servicio.

La alianza presiona a Nvidia al validar la especialización. Sostiene que el mejor motor de prefill y el mejor motor de decode no tienen por qué compartir proveedor ni arquitectura.

La integración de Groq de Nvidia ofrece la respuesta opuesta. Defiende que la especialización funciona mejor cuando una sola empresa controla la plataforma que la rodea.

Esa es la competencia principal. AMD y Cerebras ofrecen cooperación entre gigantes. Nvidia ofrece un gigante integrado con varios motores internos.

La afirmación de una eficiencia cinco veces mayor tiene una brecha en forma de red

La mayor ganancia que afirma la alianza depende de la conexión que AMD y Cerebras menos han explicado.

Las empresas modelaron una producción de tokens por vatio hasta cinco veces mayor que una configuración basada únicamente en WSE. No publicaron un informe completo de benchmarks con la topología del sistema, los patrones de tráfico ni resultados a nivel de solicitud.

Varias mediciones determinarán si esa estimación refleja el rendimiento en producción. El tiempo hasta el primer token mide cuánto esperan los usuarios antes de que comience la salida. La latencia entre tokens mide el retraso entre los tokens posteriores.

El rendimiento total cuenta los tokens entregados a muchos usuarios. La eficiencia energética compara ese trabajo con el consumo de energía. Un sistema puede liderar una métrica y quedar rezagado en otra.

La comparación también necesita cargas de trabajo representativas. Un agente de programación con contexto largo somete el prefill a una presión distinta que una breve solicitud conversacional. Un modelo de un billón de parámetros se comporta de forma diferente a un modelo más pequeño con mayor concurrencia.

La prueba oficial utilizó el modelo Kimi 2.6 de un billón de parámetros. AMD y Cerebras evaluaron tokens por kilovatio en un punto de interactividad comparable.

Es un escenario relevante para modelos grandes, pero no describe todas las cargas de trabajo. Los clientes necesitan resultados en distintos tamaños de modelo, longitudes de contexto, niveles de lote, longitudes de salida y objetivos de nivel de servicio.

La referencia merece el mismo escrutinio. Las empresas compararon la solución combinada con una configuración basada únicamente en WSE. Añadir capacidad Helios debería mejorar las cargas de trabajo en las que los recursos WSE, de otro modo, manejarían el prefill.

Eso no revela si la plataforma mixta supera a un sistema basado únicamente en Helios, a un despliegue de Nvidia o a otra configuración desagregada. Tampoco establece una ventaja económica más allá de la eficiencia energética modelada.

La variable más importante que falta es el movimiento de la caché KV. El prefill crea datos de caché que decode necesita. Trasladarlos entre racks puede añadir retraso y consumir capacidad de red.

La propia guía de Nvidia ilustra esta sensibilidad. Su documentación sobre comunicación desagregada advierte que los despliegues de producción requieren acceso remoto directo a memoria de alta velocidad.

La misma documentación informa de una grave degradación del tiempo hasta el primer token en una configuración basada en TCP frente a RDMA. Esas cifras se aplican al entorno probado por Nvidia, no a la plataforma de AMD-Cerebras.

Aun así, la lección de ingeniería es transferible. La desagregación solo funciona cuando el movimiento de datos se mantiene rápido, predecible y consciente de la topología. Una transferencia lenta puede hacer que los procesadores especializados se esperen entre sí.

La red Pensando de AMD y su estrategia de Ethernet abierto proporcionan posibles bloques de construcción. Cerebras también tiene experiencia conectando sistemas WSE a escala de centro de datos. Ninguna de las empresas ha publicado el diseño conjunto de interconexión.

La orquestación de software crea otro riesgo. La plataforma debe decidir qué capacidad Helios procesa cada prompt y qué WSE maneja el decode.

Debe mover el estado de caché, recuperar solicitudes fallidas, equilibrar la utilización y preservar el comportamiento de streaming. También debe exponer una única interfaz de servicio para que los desarrolladores no gestionen manualmente la división.

La compatibilidad de modelos será importante. Un modelo compatible necesita ejecución optimizada en ambos entornos. Las actualizaciones deben mantenerse sincronizadas entre las implementaciones de prefill y decode.

La cuantización añade más complejidad. Los formatos de menor precisión pueden reducir el uso de memoria y aumentar el rendimiento, pero ambas etapas deben preservar un comportamiento de modelo compatible.

Luego está la planificación de capacidad. La demanda de prefill y decode no crece al mismo ritmo. Una avalancha de prompts largos puede saturar Helios mientras la capacidad WSE permanece infrautilizada.

Las respuestas largas crean el desequilibrio inverso. El servicio necesita suficiente escalado independiente para evitar que cualquiera de los dos grupos se convierta en una costosa sala de espera.

La fiabilidad también pasa a ser una responsabilidad compartida. Cuando una solicitud se ralentiza, los operadores deben identificar si la causa está en Helios, la interconexión, el software de enrutamiento o un sistema WSE.

Por tanto, los clientes deberían tratar la afirmación de cinco veces como una hipótesis comprobable. Procede de las empresas que diseñaron la configuración y carece de confirmación independiente.

Esa cautela no hace que la arquitectura sea menos importante. Identifica el lugar exacto donde la alianza debe demostrar su valía.

Los procesadores gigantes ya existen. El diseño de Helios ya cuenta con especificaciones de hardware detalladas. La pregunta sin respuesta es si el puente entre ellos se comporta como parte de una sola máquina.

Cerebras Cloud decidirá si los gigantes trabajan juntos

Las próximas tres señales mostrarán si esta alianza se convierte en una plataforma de producción o sigue siendo una promesa arquitectónica.

La primera señal es el lanzamiento inicial de Cerebras Cloud. Las empresas prevén disponibilidad durante la segunda mitad de 2026, lo que deja una ventana relativamente corta tras el anuncio de julio.

Un lanzamiento significativo debería incluir modelos compatibles identificados, regiones de servicio claras y documentación de rendimiento accesible. También debería ofrecer objetivos de nivel de servicio para latencia y disponibilidad.

Una vista previa limitada aún validaría la integración básica. Un acceso amplio para clientes proporcionaría pruebas más sólidas de que el modelo de orquestación y capacidad puede operar bajo tráfico mixto.

El lanzamiento también debería revelar cómo se encuentran los desarrolladores con la arquitectura. La experiencia más sólida presentaría un único endpoint y ocultaría la transición de hardware tras una interfaz estable.

Si los usuarios deben gestionar por separado los recursos de prefill y decode, gran parte del valor de la plataforma vuelve a recaer sobre los equipos de ingeniería. Eso debilitaría la afirmación de un flujo de trabajo único e integrado.

La segunda señal es la divulgación de benchmarks. AMD y Cerebras deben publicar juntos el tiempo hasta el primer token, la latencia entre tokens, el rendimiento, la energía y la utilización.

Esos resultados deberían cubrir varias longitudes de contexto y niveles de concurrencia. Deberían comparar la plataforma combinada con configuraciones solo Helios y solo WSE bajo objetivos de servicio equivalentes.

Las pruebas independientes importarían más que otra proyección de la empresa. Los compradores también deberían buscar cargas de trabajo de clientes relacionadas con programación, recuperación, agentes o aplicaciones científicas.

La plataforma MI455X de AMD aporta suficiente capacidad teórica para hacer creíble el argumento del prefill. Los datos de producción deben mostrar si esa capacidad se mantiene ocupada de forma eficiente.

Un benchmark que confirme la ganancia de eficiencia modelada reforzaría la tesis central. Una latencia débil de transferencia de caché o una utilización desigual sugerirían que los costes de coordinación consumen el beneficio.

La tercera señal es la respuesta de Nvidia mediante Rubin, Groq 3 LPX y Dynamo. Nvidia no necesita copiar el diseño exacto de AMD-Cerebras.

Puede responder con una integración más estrecha, un soporte de modelos más amplio o mejores herramientas operativas. También puede usar su base de software instalada para reducir la fricción de adopción.

Una respuesta sólida de Nvidia confirmaría que el decode especializado se ha vuelto estratégicamente importante. Aun así, podría debilitar comercialmente a la alianza al mantener a los compradores dentro de la plataforma de Nvidia.

La adopción empresarial dependerá, en última instancia, de algo más que una victoria en benchmarks. Los equipos de compras evaluarán suministro, cobertura de servicio, herramientas para desarrolladores, soporte de modelos y recuperación ante fallos.

Los desarrolladores deberían observar si los frameworks habituales pueden dirigirse al sistema combinado sin código personalizado. Los equipos de infraestructura deberían examinar la observabilidad en ambos dominios de hardware.

Los líderes de productos de IA deberían centrarse en la latencia que percibe el usuario bajo cargas de trabajo reales. La generación rápida de tokens importa cuando un agente de programación itera, un robot responde o un sistema de investigación realiza varias llamadas dependientes.

Los trabajadores del conocimiento también tienen interés en esta carrera de infraestructura. Los agentes más rápidos pueden buscar, sintetizar y revisar información sin obligar a los usuarios a atravesar largas pausas.

Los equipos que construyen estos sistemas aún necesitan acceso fiable a su propio contexto técnico. Una base de conocimiento de ingeniería con capacidad de búsqueda puede organizar los documentos que deben procesar los prompts con gran carga de recuperación.

La cobertura de Tom's Hardware apunta a un cambio más amplio en el diseño de inferencia. Los centros de datos están pasando de un único grupo de aceleradores de propósito general a motores coordinados optimizados para distintas etapas.

AMD y Cerebras han presentado un mecanismo claro para ese cambio. Helios absorbe prompts largos y un alto volumen de solicitudes. Los sistemas WSE devuelven tokens con baja latencia.

Ahora la alianza debe exponer la conexión, publicar las mediciones y sobrevivir al tráfico real de clientes. Siga el lanzamiento en la nube, los benchmarks completos y la respuesta de Nvidia.

Si esas señales se alinean, la inferencia heterogénea se convertirá en una opción práctica de compra. Si no lo hacen, los gigantes se habrán encontrado sin aprender a moverse como uno solo.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

​Añade una barra de búsqueda a tu cerebro

Solo tienes que preguntarle a remio

Recuérdalo todo

No organices nada

bottom of page