top of page

Kimi K3 llegó a Hacker News después de que MI355X superara a B300 en rendimiento por dólar

Kimi K3 llegó a Hacker News después de que Wafer informara que ocho GPU AMD MI355X sirvieron el modelo a aproximadamente 952 tokens de salida por segundo. El sistema quedó por detrás de un nodo Nvidia B300 de ocho GPU en rendimiento agregado. Sin embargo, los supuestos de alquiler de Wafer dieron a AMD un mejor resultado de rendimiento por dólar.

Esta distinción importa porque Kimi K3 es excepcionalmente exigente. El modelo de pesos abiertos de Moonshot AI contiene aproximadamente 2,8 billones de parámetros, de los cuales se activan unos 104.000 millones para cada token. Su checkpoint ocupa más de 1,5 terabytes antes de que el sistema de servicio reserve memoria para el estado de ejecución y prompts largos.

Un nodo B200 estándar de ocho GPU no puede alojar cómodamente esa implementación tal como está configurada. Por ello, Wafer comparó un nodo MI355X con un nodo B300 y una configuración B200 de dos nodos. El resultado pone en cuestión la ventaja de Nvidia mediante una pregunta acotada pero comercialmente importante: ¿qué plataforma ofrece una inferencia de Kimi K3 aceptable al menor coste de infraestructura?

La afirmación de Hacker News trata sobre economía, no sobre una victoria absoluta en velocidad

Wafer no informó que MI355X fuera más rápido que B300. Informó que MI355X producía más rendimiento por cada unidad de gasto horario en infraestructura.

Es fácil perder esa distinción en un titular. Según la publicación del benchmark de Wafer, su nodo MI355X de ocho GPU alcanzó 952 tokens de salida agregados por segundo. La misma prueba registró 1.568 tokens por segundo en una configuración B300 de ocho GPU.

Eso otorga a Nvidia una ventaja sustancial en rendimiento bruto. El nodo B300 también entregó 172 tokens por segundo en un único flujo, frente a 118 en MI355X. Un comprador que optimizara exclusivamente la producción máxima de un nodo seguiría favoreciendo B300 según estos resultados.

Wafer llegó a una conclusión distinta después de aplicar estimaciones de alquiler por hora. Su cálculo situó a MI355X por delante en rendimiento agregado por unidad de gasto. La compañía describió al acelerador de AMD como el ganador en rendimiento por dólar, no como el ganador en rendimiento total.

El benchmark utilizó prompts de 1.024 tokens de entrada y solicitó 400 tokens de salida. Esta carga de trabajo resulta útil porque capta el comportamiento habitual de generación de texto sin convertirse en una prueba de estrés de contexto largo. No representa todas las cargas de trabajo de producción.

La comparación con B200 añade otra capa. Kimi K3 requirió 16 GPU B200 repartidas en dos nodos en la configuración de Wafer. Esa implementación produjo 498 tokens agregados por segundo, o alrededor de 249 por nodo.

La comunicación entre nodos impuso una penalización porque las GPU tenían que coordinar la ejecución del modelo a través de una red. Wafer afirmó que esa conexión operaba mediante RoCE v2, un protocolo basado en Ethernet para transferir datos directamente entre sistemas con poca intervención de la CPU.

Por tanto, el resultado desfavorable de B200 refleja tanto la topología como el silicio. El modelo no cabía en un nodo B200 de ocho GPU con la asignación de memoria requerida por Wafer. Dividirlo entre dos nodos introdujo comunicación en la ruta de decodificación.

Esta limitación es central en la historia. Kimi K3 convierte la capacidad de memoria en una ventaja arquitectónica incluso antes de que comience la optimización del software. Tanto MI355X como B300 ofrecen 288 GB de memoria de alto ancho de banda por GPU, suficiente para que un único nodo de ocho GPU sea viable.

El debate en Hacker News se centró en si este resultado debilita la ventaja competitiva de Nvidia en software. Un benchmark de un único proveedor no puede resolver esa cuestión más amplia. Sí demuestra que la capacidad de memoria y la economía del alquiler pueden imponerse a las clasificaciones convencionales de GPU para un modelo específico.

También cambia la forma en que los compradores deberían interpretar las comparaciones de aceleradores. El rendimiento aritmético máximo importa, pero es solo un factor. El tamaño del modelo, la cuantización, la ubicación de la memoria, el soporte del framework, la concurrencia, la latencia, las redes y la utilización pueden determinar la factura real.

Para Kimi K3, la primera victoria corresponde a la plataforma que puede alojar el modelo sin una incómoda división entre varios nodos. AMD supera ese umbral con un nodo MI355X. Nvidia lo supera con B300, mientras que B200 se vuelve menos atractivo para esta configuración concreta.

Por tanto, el resultado es más acotado y útil que una declaración general de que AMD ha alcanzado a Nvidia. Identifica una carga de trabajo en la que las decisiones de diseño de AMD adquieren relevancia financiera.

Kimi K3 convierte la capacidad de memoria en la limitación decisiva

Kimi K3 convierte la memoria del acelerador en un requisito de implementación, no en una especificación que los compradores puedan considerar secundaria.

Moonshot AI describe Kimi K3 como un modelo de mezcla de expertos con 2,8 billones de parámetros. Un modelo de mezcla de expertos enruta cada token a través de solo una parte de su red, reduciendo el cómputo activo mientras conserva un conjunto mucho mayor de parámetros aprendidos.

El artículo técnico de K3 indica que el modelo activa aproximadamente 104.000 millones de parámetros por token. Selecciona 16 expertos enrutados de un conjunto de 896. Esta dispersión limita el cómputo, pero no elimina la necesidad de almacenar los pesos completos de los expertos.

Cada solicitud puede enrutar tokens hacia expertos diferentes. Por tanto, el sistema de servicio debe mantener accesible el checkpoint más amplio en todo el grupo de GPU. Ese checkpoint crea el requisito de memoria que da forma a la comparación de Wafer.

La propia guía de implementación de AMD estima un tamaño de checkpoint consciente del cargador de aproximadamente 1,56 TB. Con paralelismo tensorial de ocho vías, cada MI355X aloja alrededor de 191 GiB de pesos del modelo.

El paralelismo tensorial divide las grandes operaciones del modelo entre varias GPU. Cada acelerador calcula una parte y luego intercambia resultados intermedios con sus pares. Mantener las ocho GPU en un solo servidor suele reducir la penalización de comunicación frente a repartirlas entre varias máquinas.

AMD estima que el estado de ejecución conocido para una secuencia en el contexto máximo del modelo añade unos 14,4 GiB por GPU. La asignación conocida combinada alcanza aproximadamente 205,4 GiB, dejando unos 82,6 GiB en cada MI355X antes de otros gastos generales.

La memoria restante debe absorber búferes de comunicación, espacios de trabajo temporales, fragmentación del asignador, estado del framework y otros costes de producción. También puede admitir el procesamiento por lotes, que agrupa solicitudes para que las GPU realicen más trabajo útil de forma conjunta.

Moonshot otorga a Kimi K3 una ventana de contexto de un millón de tokens. Una ventana de contexto es la cantidad máxima de texto y otra entrada tokenizada que el modelo puede considerar durante una interacción. Admitir ese máximo teórico exige más memoria que servir prompts cortos.

Kimi Delta Attention ayuda a contener este crecimiento. Utiliza un estado recurrente de tamaño fijo para muchas capas en lugar de mantener una caché convencional de clave-valor en todas partes. Una caché de clave-valor almacena datos de atención previos para que el modelo no recalcule toda la secuencia para cada token generado.

Kimi K3 sigue incluyendo capas que mantienen un estado de caché dependiente de los tokens. Por ello, los prompts largos continúan consumiendo una cantidad significativa de memoria. La arquitectura reduce la carga sin hacer que el contexto largo sea gratuito.

MI355X de AMD y B300 de Nvidia ofrecen ambas 288 GB de HBM por GPU en sus plataformas estándar de ocho GPU. La arquitectura B300 de Nvidia indica 2,3 TB de memoria en todo el nodo, lo que coincide con la amplia clase de capacidad de la plataforma de AMD.

B200 ofrece menos memoria por GPU. Ocho dispositivos pueden ser suficientes para muchos modelos, pero Wafer afirma que esa configuración no podía alojar Kimi K3 con su reserva de memoria prevista para contexto largo. Pasar a 16 GPU resuelve la capacidad, pero añade costes de red y complejidad operativa.

Esta es la inversión más profunda detrás del interés de Hacker News. B200 de Nvidia sigue siendo un acelerador de gama alta, pero Kimi K3 puede hacer que la topología del sistema circundante sea más importante que la conocida posición de mercado del chip.

El mismo principio se aplica más allá de este modelo. Los modelos de pesos abiertos permiten a los operadores elegir su propio hardware, framework de servicio, cuantización y planificador de solicitudes. Los checkpoints más grandes hacen que esas decisiones dependan cada vez más de la capacidad de memoria.

Una empresa que planifique agentes internos de programación, análisis de documentos o automatización de investigación puede prever prompts largos y generación sostenida. Estos equipos deberían modelar la demanda de memoria antes de comparar el rendimiento de los aceleradores.

Mantener una base de conocimiento de ingeniería con capacidad de búsqueda también puede facilitar la reproducción de esas evaluaciones. De lo contrario, las notas de configuración, los resultados de perfilado, los cambios de implementación y los informes de fallos se dispersan entre documentos locales e hilos de chat.

Kimi K3 no demuestra que la memoria sea la única ventaja competitiva. Demuestra que la memoria puede decidir qué plataformas entran siquiera en la competencia.

La decodificación especulativa redujo parte de la brecha de software de AMD

El resultado de MI355X dependió de correcciones de software y optimización del servicio, aunque Wafer no necesitó escribir un nuevo kernel de GPU para su principal mejora de decodificación.

Wafer partió del soporte de Kimi K3 desde el primer día de AMD. Esa base ya cargaba el modelo en ocho GPU MI355X y lo exponía a través de un servidor de inferencia compatible. Pasar de una implementación funcional a un rendimiento competitivo seguía requiriendo trabajo de ingeniería.

La mayor mejora en decodificación provino de la decodificación especulativa. Esta técnica utiliza un modelo borrador más pequeño para predecir varios tokens futuros. El modelo principal verifica después esos candidatos en conjunto, reduciendo el número de costosos pasos secuenciales de decodificación.

Kimi K3 no se distribuyó con sus propios tensores borrador para los métodos especulativos integrados habitualmente en modelos de frontera. Wafer utilizó en su lugar Kimi-K3-DSpark, un modelo borrador externo de difusión por bloques publicado por RadixArk.

Según se informó, la versión CUDA funcionó sin la misma interrupción. En ROCm, la plataforma de software de AMD para cómputo con GPU, la primera solicitud de producción desencadenó un error de función ausente dentro de la ruta de verificación de tokens de SGLang.

SGLang es un framework de servicio de código abierto que programa solicitudes de modelos, gestiona la memoria y ejecuta kernels optimizados. Su compilación CUDA importaba una función de renormalización de probabilidades top-k. La rama ROCm no proporcionaba una definición equivalente para la ruta probada.

El muestreo top-k conserva solo los candidatos de token más probables antes de seleccionar la siguiente salida. La renormalización reajusta las probabilidades restantes para que sumen uno. La operación ausente era matemáticamente sencilla, pero su ausencia bloqueaba el planificador de solicitudes.

Wafer implementó la operación con primitivas estándar de PyTorch. La función ordenaba las probabilidades, conservaba los candidatos mejor clasificados, enmascaraba el resto y reajustaba los valores restantes.

Según se informó, esa corrección aumentó el rendimiento de un único flujo aproximadamente 2,2 veces. Con una carga moderada, el rendimiento por flujo mejoró cerca de 1,7 veces. El rendimiento agregado máximo aumentó un 18 por ciento.

Estas ganancias ilustran por qué las especificaciones de hardware no predicen directamente la inferencia en producción. El acelerador ejecuta las operaciones, pero la pila de servicio decide si las solicitudes llegan a rutas de código eficientes.

La plataforma CUDA de Nvidia se beneficia de años de integración con frameworks y atención de los desarrolladores. Las nuevas técnicas de inferencia suelen aparecer primero allí. Los errores reciben una exposición más amplia, mientras que las bibliotecas tienden a asumir el comportamiento de CUDA antes de añadir otros backends.

AMD ha invertido mucho en ROCm y sus bibliotecas complementarias. El despliegue de Kimi K3 muestra avances porque la función ausente requería una corrección de software acotada, no meses de trabajo en kernels de bajo nivel.

Sin embargo, el error sigue siendo relevante. Una ruta de solicitudes que falla bajo tráfico real no es una molestia estética. Representa un riesgo de pruebas, mantenimiento y operación que los equipos de infraestructura deben incorporar en sus decisiones de despliegue.

El resultado de Wafer también dependió de alcanzar una alta concurrencia. La concurrencia mide cuántas secuencias procesa el servidor al mismo tiempo. Más solicitudes simultáneas pueden aumentar el rendimiento total al mantener el acelerador ocupado con trabajo útil.

La decodificación especulativa desplazó el rendimiento máximo del sistema hacia una configuración de mayor concurrencia. Ese resultado se adapta bien a un servicio compartido que recibe muchas solicitudes. Puede importar menos para una aplicación que necesita una respuesta inmediata.

Esta diferencia separa el rendimiento agregado de la interactividad. El rendimiento agregado mide el total de tokens producidos entre todos los usuarios. La interactividad mide la rapidez con la que avanza cada flujo individual.

El resultado agregado de 952 tokens del nodo MI355X es valioso para un servicio con mucha actividad. Sus 118 tokens en un solo flujo cuentan otra historia. B300 siguió siendo más rápido tanto para un flujo como para el nodo en conjunto.

Por tanto, el mecanismo respalda una conclusión práctica, no universal. El hardware de AMD ofreció una economía favorable después de que Wafer corrigiera una brecha del framework y configurara la decodificación especulativa en torno a un modelo de borrador externo.

Otros equipos deben determinar si pueden reproducir esa pila. Necesitan versiones compatibles del framework, la misma representación del modelo, un comportamiento de muestreo estable y suficiente volumen de solicitudes.

También necesitan ingenieros capaces de diagnosticar fallos específicos de cada backend. Una función ausente puede ser fácil de corregir una vez que alguien la identifica. Descubrir el fallo preciso bajo carga de producción puede llevar mucho más tiempo.

Por eso, la afirmación de Hacker News no debería reducirse a una puntuación de hardware. Es evidencia de que la desventaja de software de AMD puede, en ocasiones, delimitarse y corregirse. No demuestra que esa desventaja haya desaparecido.

B300 Sigue Liderando Donde Más Importan la Latencia y la Densidad

Nvidia’s B300 siguió siendo la opción más sólida cuando el objetivo pasó de la eficiencia de infraestructura al máximo rendimiento o al menor tiempo de espera.

Wafer midió 1.568 tokens de salida agregados por segundo en el nodo B300. Eso fue aproximadamente un 65 por ciento superior al resultado de 952 tokens del nodo MI355X en la configuración probada.

B300 también alcanzó 172 tokens por segundo en un solo flujo. MI355X alcanzó 118. Para programación interactiva, agentes en vivo o chat orientado al cliente, esa diferencia puede influir en lo ágil que se percibe el producto.

La comparación se vuelve más exigente durante el prefill. El prefill es la fase en la que el modelo procesa el prompt existente del usuario antes de generar su primer token de salida. Los documentos extensos y los grandes repositorios de código hacen que esta etapa sea especialmente importante.

Wafer probó un prompt en frío idéntico de aproximadamente 172.000 tokens. La configuración MI355X necesitó inicialmente unos 51 segundos para procesarlo, frente a unos 23 segundos en B300.

Esa brecha supera la diferencia observada durante la decodificación ordinaria. Un usuario puede aceptar un flujo algo más lento una vez que el texto empieza a avanzar. Esperar mucho más antes del primer token puede hacer que una aplicación parezca bloqueada.

Wafer atribuyó la mayor parte de la brecha de prefill de AMD a una ruta de respaldo del kernel de atención. Kimi K3 asignó 12 cabezas de atención a cada GPU bajo paralelismo tensorial de ocho vías. El kernel AITER más rápido de AMD admitía otras formas de recuento de cabezas, por lo que el framework seleccionó código Triton genérico más lento.

AITER es la biblioteca de AMD de operadores de IA optimizados. Triton es un lenguaje y compilador utilizado para escribir kernels de GPU portables. Una ruta Triton genérica puede simplificar la compatibilidad, pero quizá no iguale una implementación en ensamblador específica para el hardware.

Wafer rellenó la entrada de 12 cabezas hasta 16, ejecutó el kernel optimizado y eliminó después las salidas artificiales. Según se informa, este ajuste de forma aumentó el rendimiento sostenido del prefill hasta unos 13.000 tokens por segundo.

La ruta de respaldo anterior oscilaba entre aproximadamente 4.000 y 7.000 tokens por segundo. Wafer describió la corrección como una mejora de prefill de entre dos y tres veces.

Es importante destacar que esa optimización no elevó el resultado principal de decodificación. Se centró en el tiempo hasta el primer token, o TTFT, que mide cuánto esperan los usuarios antes de que comience la generación.

El episodio muestra ambas caras de la posición de AMD. El hardware contaba con un kernel eficiente capaz de ofrecer un rendimiento mucho mayor. El framework no logró seleccionarlo porque Kimi K3 producía una forma no compatible.

Nvidia se beneficia cuando estos desajustes ya se han previsto en las bibliotecas CUDA. AMD se beneficia cuando los desarrolladores pueden adaptar kernels existentes sin diseñar otros nuevos. Los compradores deben decidir cuánto trabajo de integración pueden tolerar.

B300 también ofrece mayor rendimiento agregado por GPU en la prueba de Wafer. Esa densidad puede importar cuando el espacio en rack, la entrega de energía, los puertos de red o la disponibilidad del centro de datos limitan el despliegue.

Una GPU de menor coste no es automáticamente más barata a nivel de servicio. Los operadores deben incluir la utilización del servidor, energía, red, tiempo de ingeniería, capacidad de reserva, recuperación ante fallos y mantenimiento de software.

Si un nodo B300 puede absorber tráfico que requiere más nodos AMD, la infraestructura circundante puede reducir la ventaja inicial de rendimiento por dólar. Por el contrario, una aplicación con requisitos moderados de latencia puede ahorrar más si acepta el menor pico de AMD.

La comparación correcta es un objetivo de nivel de servicio, no un eslogan a nivel de chip. Un objetivo de nivel de servicio define la latencia, disponibilidad y rendimiento que un sistema debe entregar de forma consistente.

Los equipos deberían comparar ambas plataformas con el mismo nivel de interactividad objetivo. También deberían medir longitudes de prompt, longitudes de salida, comportamiento de caché, concurrencia, cuantización y expectativas de disponibilidad idénticos.

Un benchmark optimizado de forma independiente en cada plataforma puede responder qué sistema rinde mejor tras un ajuste experto. Un benchmark que use software idéntico puede responder cuán portátil es la pila. Son preguntas distintas.

La prueba de Wafer se inclina hacia la primera. Ajustó la ruta MI355X y comparó el servicio resultante con sus despliegues de Nvidia. Eso refleja cómo un operador podría buscar la mejor economía disponible, pero complica una atribución arquitectónica estricta.

B300 sigue siendo la plataforma más rápida en las cifras publicadas. MI355X atrae atención porque la hipótesis de alquiler más bajo compensa con creces esa diferencia bajo la carga de trabajo seleccionada por Wafer.

Es un resultado competitivo significativo. No es una transferencia de la corona de rendimiento de Nvidia.

Lo Que el Benchmark No Demuestra

Los resultados publicados siguen siendo una instantánea realizada por la empresa, con detalles metodológicos limitados y sin una reproducción independiente vinculada a la afirmación principal.

Wafer desarrolla productos de optimización de GPU e inferencia. También ofrece acceso alojado a modelos. La empresa tiene una clara experiencia, pero un interés comercial en demostrar que el trabajo de software puede desbloquear alternativas a Nvidia.

Eso no invalida el benchmark. Significa que los lectores deberían tratar las mediciones como resultados reportados por el operador, no como una certificación neutral de la industria.

La publicación del benchmark identifica la longitud del prompt, la salida solicitada, las configuraciones de hardware, el rendimiento y el trabajo de optimización seleccionado. No proporciona un paquete completo de reproducibilidad dentro del artículo.

Siguen sin estar claros detalles importantes. La publicación no especifica por completo cada revisión de software, procedimiento de calentamiento, distribución de solicitudes, duración de la medición, paso de verificación de salida o medición de energía.

La configuración B300 también utilizó procesamiento de contexto desagregado, según la etiqueta de comparación de Wafer. La desagregación separa el procesamiento del prompt de la generación de tokens para que cada etapa pueda usar recursos adecuados. Eso puede afectar tanto al rendimiento como al diseño del sistema.

La entrada MI355X utilizó paralelismo tensorial de ocho vías. El despliegue B200 usó 16 GPU distribuidas en dos nodos. La entrada B300 combinó paralelismo tensorial de ocho vías con procesamiento desagregado.

Son despliegues prácticos, pero no configuraciones perfectamente simétricas. Cada plataforma enfrentó restricciones distintas de memoria y topología. Esa asimetría es, en parte, el objetivo, pero limita las conclusiones sobre la arquitectura del chip por sí sola.

El resultado de rendimiento por dólar también depende de las hipótesis de alquiler. Los mercados de GPU varían entre proveedores de nube, duraciones de contrato, regiones, disponibilidad y modelos de reserva. Un comprador con capacidad Nvidia descontada puede llegar a una conclusión diferente.

Las reglas compartidas de redacción impiden enumerar aquí precios comerciales específicos. El hecho importante es que Wafer asumió que la capacidad MI355X costaba sustancialmente menos por hora de GPU que B300. Su veredicto económico se deriva directamente de esa premisa.

La disponibilidad también importa. Un acelerador teóricamente atractivo no genera ahorros si un equipo no puede reservar suficientes nodos en la región requerida. La presencia más amplia de Nvidia en la nube puede reducir la fricción de adquisición.

El comportamiento del modelo plantea otra incertidumbre. La decodificación especulativa acelera la generación solo cuando el modelo de borrador predice tokens que acepta el modelo principal. Las tasas de aceptación pueden cambiar entre programación, prosa, matemáticas, idiomas y configuraciones de muestreo.

Por tanto, el benchmark de entrada corta de Wafer puede producir ganancias distintas de las de un agente que procesa un gran repositorio. La investigación de contexto largo, la atención al cliente y la extracción por lotes pueden desplazar cada una el equilibrio entre prefill y decodificación.

El propio modelo también es nuevo. Moonshot lanzó los pesos de Kimi K3 el 27 de julio de 2026, solo unos días antes de que Wafer publicara sus mediciones del 31 de julio. Los frameworks, las cuantizaciones y los kernels optimizados aún están en una fase temprana.

La guía inicial de AMD fue deliberadamente cautelosa. Validó la carga y la corrección básica en ocho GPU MI355X, pero no afirmó rendimiento máximo, latencia de tokens ni eficiencia del kernel.

Wafer proporcionó esa siguiente capa de trabajo de rendimiento. Los equipos independientes deberían ahora reproducir el resultado con scripts abiertos y objetivos de servicio claramente definidos.

La comparación también debería extenderse más allá de B300. Los sistemas más nuevos de Nvidia, futuros aceleradores de AMD y hardware especializado para inferencia cambiarán las opciones disponibles. Las versiones de software pueden modificar la clasificación actual sin reemplazar ningún chip.

También existe una cuestión de calidad. Los formatos de baja precisión y los métodos especulativos deberían preservar el comportamiento de salida dentro de tolerancias definidas. Un resultado de velocidad necesita comprobaciones de corrección, especialmente cuando los cambios de muestreo pueden ocultar diferencias sutiles.

El modelo de Moonshot utiliza representaciones mixtas de baja precisión para reducir las exigencias de memoria y cómputo. Estas decisiones forman parte de su arquitectura prevista. Las implementaciones aún deben confirmar que cada backend produce resultados aceptables en tareas representativas.

La interpretación más defendible es condicional: bajo la carga de trabajo, la pila de software y las hipótesis de alquiler de Wafer, MI355X ofreció el resultado más sólido de rendimiento por dólar.

La interpretación menos defendible es que AMD ha derrotado ampliamente a Nvidia en inferencia de IA. La evidencia publicada no respalda esa conclusión.

Tres Señales Decidirán Si AMD Puede Repetir la Victoria

El resultado de AMD con Kimi K3 adquiere importancia estratégica solo si resiste pruebas independientes, cargas de trabajo más amplias y lanzamientos rutinarios de frameworks.

La primera señal es la reproducibilidad. Operadores independientes deberían ejecutar Kimi K3 en MI355X y B300 con configuraciones publicadas, prompts idénticos, salidas verificadas y objetivos de latencia equivalentes.

Una ventaja repetida de rendimiento por dólar reforzaría la afirmación de Wafer. Grandes diferencias entre equipos sugerirían que el resultado depende en gran medida de un ajuste especializado o de condiciones de infraestructura favorables.

La reproducción debe abarcar más que el rendimiento máximo agregado. Las pruebas deben medir el tiempo hasta el primer token, la velocidad de decodificación por usuario, la concurrencia sostenida, las tasas de error, el uso de memoria, el consumo energético y la estabilidad durante ejecuciones prolongadas.

También deben informar el modelo de costes completo, sin asumir que una única instantánea de alquiler público representa a todos los compradores. La capacidad contratada y la infraestructura propia pueden cambiar el cálculo.

La segunda señal es si las mejoras de ROCm llegan a los frameworks de serving estándar. La reparación top-k de Wafer y su ruta de prefill con padding resolvieron problemas concretos, pero los parches privados generan obligaciones de mantenimiento.

Si SGLang, AITER, vLLM y proyectos relacionados incorporan correcciones comparables, más equipos podrán reproducir el resultado sin mantener ramas personalizadas. Eso convertiría la experiencia de un operador en una ganancia para un ecosistema más amplio.

Un soporte upstream rápido también reduciría el riesgo de que una actualización del framework rompa una ruta optimizada. Los compradores de infraestructura valoran la repetibilidad porque los sistemas de producción duran mucho más que las ejecuciones de benchmarks.

Si las correcciones siguen fragmentadas, la ventaja de software de Nvidia se mantiene incluso cuando el hardware de AMD parece favorable. El foso defensivo de CUDA incluye documentación, herramientas de depuración, cobertura de bibliotecas, desarrolladores experimentados y un comportamiento predecible de los frameworks.

La tercera señal es el rendimiento en cargas de trabajo similares a producción. El contexto de un millón de tokens de Kimi K3 propicia tareas que involucran repositorios grandes, colecciones de documentos, historiales de investigación y sesiones extensas de agentes.

Estas cargas de trabajo aumentan la importancia del prefill, la gestión de caché, la programación de solicitudes y la fragmentación de memoria. Wafer ya mostró que el resultado inicial de cold-prefill de AMD quedó por detrás de B300 antes de habilitar una ruta de kernel optimizada.

Una victoria más amplia requeriría que MI355X siga siendo competitivo en prompts de chat cortos, documentos extensos, agentes de código, entradas multimodales y tráfico mixto. También debe mantener una latencia aceptable mientras el nodo atiende a muchos usuarios.

Si AMD rinde bien en todas esas condiciones, los compradores de hardware obtendrán una capacidad de negociación significativa. Podrán negociar frente a una segunda plataforma creíble y desplegar grandes modelos de pesos abiertos sin aceptar automáticamente una prima de Nvidia.

Si la ventaja desaparece fuera de las pruebas de rendimiento con entradas cortas, MI355X seguirá siendo una opción específica para determinadas cargas de trabajo. Aun así, puede generar despliegues valiosos, pero no debilitará fundamentalmente la posición de Nvidia.

La lección más amplia de Hacker News es que los modelos de pesos abiertos están convirtiendo la inferencia en una competencia de sistemas. Los desarrolladores de modelos definen la arquitectura, los fabricantes de chips aportan memoria y capacidad de cómputo, mientras que los equipos de frameworks determinan qué parte de esa capacidad se vuelve utilizable.

Kimi K3 intensifica esa competencia porque su checkpoint obliga a los compradores a enfrentar de inmediato los límites de memoria. También recompensa a las plataformas que pueden admitir computación de baja precisión, enrutamiento eficiente de expertos y estados de contexto amplios.

Los desarrolladores deberían seguir los repositorios de benchmarks y las notas de lanzamiento de los frameworks. Los equipos de infraestructura deberían ejecutar sus propias trazas de tráfico en lugar de basarse en una única cifra de tokens por segundo.

Los compradores empresariales deberían exigir comparaciones con la latencia que requieren sus aplicaciones. Deberían incluir la mano de obra de ingeniería y el riesgo operativo junto con las hipótesis de alquiler de aceleradores.

La evidencia actual ofrece a AMD un resultado creíble y a Nvidia una advertencia clara. B300 sigue siendo más rápido, mientras que MI355X, según se informa, ofrece una economía más sólida para el despliegue de Kimi K3 de Wafer.

La siguiente pregunta es si esa ventaja se vuelve habitual. Siga los benchmarks independientes, el soporte de software upstream y las pruebas de producción con contextos largos antes de considerar un resultado de Hacker News como un cambio duradero.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page