top of page

Análisis de SemiAnalysis sobre HBM 4-hi: por qué las pilas más cortas podrían imponerse en la inferencia de IA

14 sept
19 min de lectura

SemiAnalysis ha cuestionado la carrera ascendente de la industria de memoria para IA, argumentando que HBM 4-hi puede ofrecer todo el ancho de banda con un tercio de los chips DRAM.

La afirmación importa porque los fabricantes de aceleradores han pasado años añadiendo pilas de memoria más altas. Más capas aumentaron la capacidad, permitieron modelos más grandes y ayudaron a consolidar la memoria de alto ancho de banda como una parte esencial de la computación de IA.

El análisis de SemiAnalysis sobre HBM 4-hi sostiene que la inferencia cambia ahora ese cálculo. Los sistemas a escala de rack proporcionan más capacidad agregada, mientras que la cuantización y la descarga de caché reducen la cantidad que debe alojar cada GPU.

El informe no afirma que todas las cargas de trabajo necesiten menos memoria. El entrenamiento, los lotes grandes y los modelos futuros aún pueden favorecer pilas más altas. Su argumento más preciso se refiere a la inferencia interactiva, donde el ancho de banda suele limitar la generación de tokens antes de que la capacidad escasee.

Esto genera una competencia directa entre dos prioridades de diseño. Una privilegia la máxima capacidad de memoria por acelerador. La otra busca el máximo ancho de banda de tokens a partir de cada oblea de DRAM limitada.

La reducción de memoria reportada para Rubin Ultra de Nvidia proporciona la señal inmediata. SemiAnalysis afirma que el acelerador contará con 192GB de HBM, frente a los 288GB de Rubin estándar y Blackwell Ultra.

La empresa no ha detallado públicamente una configuración Rubin Ultra 4-hi. Sin embargo, el movimiento reportado hacia pilas 8-hi sugiere que las HBM cada vez más altas ya no son una elección automática.

Si este razonamiento se extiende a HBM4E 4-hi, la infraestructura de IA podría utilizar menos chips DRAM sin sacrificar el ancho de banda externo de cada pila. Eso reduciría los costes de memoria y produciría más paquetes HBM utilizables a partir de un suministro limitado de obleas.

La hoja de ruta de memoria de Nvidia ya no avanza en una sola dirección

El cambio significativo no es que Nvidia necesite de repente poca memoria. Es que la capacidad adicional ya no parece valiosa a cualquier precio.

Blackwell Ultra estableció claramente la dirección de alta capacidad. Nvidia indica 288GB de HBM3E por GPU Blackwell Ultra y 20TB en un rack GB300 NVL72.

Las especificaciones de GB300 de la empresa también indican que el ancho de banda agregado de memoria de GPU alcanza los 576TB por segundo. Estas cifras muestran por qué Nvidia antes enfatizaba tanto la capacidad como el ancho de banda.

SemiAnalysis informa ahora de que Rubin Ultra revertirá parte de esa tendencia. Sus 192GB esperados por GPU representan una reducción de un tercio respecto a Blackwell Ultra y Rubin convencional.

La comparación requiere cierta cautela. Según se informa, la arquitectura de Rubin Ultra cambió de cuatro chips de cómputo a dos. Por tanto, su capacidad de memoria esperada anteriormente correspondía a un diseño de sistema distinto.

Incluso tras normalizar ese cambio, SemiAnalysis estima que la memoria cae de los anteriores 256GB por chip de cómputo a 96GB. Se trata de una importante redefinición arquitectónica, no de un ajuste cosmético de especificaciones.

El informe identifica el suministro como una razón. Nvidia habría asegurado una capacidad significativa de lógica avanzada y empaquetado, pero las obleas HBM disponibles no pueden respaldar volúmenes equivalentes de pilas 12-hi.

Una pila 12-hi contiene doce chips DRAM centrales sobre su chip base. Una pila 8-hi utiliza ocho, lo que permite que el mismo suministro de DRAM procesada respalde más pilas terminadas.

Esto importa porque HBM consume más capacidad de fabricación por bit que la DRAM convencional. Las vías a través del silicio, conocidas como TSV, transportan señales y energía verticalmente a través de la pila de memoria.

Esas TSV requieren procesamiento adicional. Los chips HBM también incluyen área para conexiones verticales, lo que reduce la densidad de bits en comparación con la memoria ordinaria fabricada con un proceso similar.

SemiAnalysis estimó anteriormente que HBM consume aproximadamente tres veces más capacidad de oblea por bit que la DRAM básica. Su estimación se aproxima a cuatro veces a medida que la producción avanza hacia HBM4.

Esta cifra es una estimación de analistas, no un estándar de la industria. Sin embargo, la carga de fabricación subyacente está bien establecida entre los proveedores de memoria.

SK hynix, Samsung y Micron deben procesar, adelgazar, conectar, probar y empaquetar múltiples chips funcionales. Cada capa adicional aumenta el uso de materiales y expone el paquete a riesgos de rendimiento adicionales.

Históricamente, las pilas más altas han justificado esa carga porque los aceleradores necesitaban su capacidad. Los pesos de los modelos, las activaciones, los gradientes, los estados del optimizador y las cachés de clave-valor compiten por la memoria durante distintas cargas de trabajo.

La nueva decisión sugiere que la capacidad ha superado un umbral para algunos sistemas de inferencia. Una vez que un rack alberga el conjunto de trabajo requerido, añadir memoria a cada GPU aporta menos valor.

Nvidia no ha confirmado públicamente el desglose exacto de capacidad de Rubin Ultra de SemiAnalysis. Por tanto, la afirmación debe seguir considerándose un cambio reportado en la hoja de ruta, no una especificación final de producto.

Aun así, los preparativos de la cadena de suministro pueden revelar una dirección antes de un lanzamiento público. SemiAnalysis afirma que los proveedores se preparan para que las configuraciones 8-hi se conviertan en estándar después de un impulso de la industria hacia productos 12-hi y 16-hi.

El cambio reportado abre la puerta a HBM 4-hi. Si ocho capas son suficientes, los diseñadores deben preguntarse si cuatro capas pueden atender determinadas implementaciones de inferencia de manera más económica.

Esta pregunta habría sonado regresiva durante la reciente carrera por la capacidad. Bajo fuertes restricciones de DRAM, se convierte en una de las decisiones arquitectónicas más prácticas de la industria.

SemiAnalysis 4-hi HBM conserva el ancho de banda mientras elimina chips

Una pila HBM más corta reduce la capacidad, pero no reduce automáticamente el ancho de banda externo del paquete.

HBM transfiere datos mediante una interfaz muy amplia en lugar de depender únicamente de una velocidad de señalización extrema. HBM4 amplía esa interfaz a 2.048 conexiones de datos por pila.

El estándar HBM4 fue publicado por JEDEC en abril de 2025. Define la base para una nueva generación de memoria para IA y computación de alto rendimiento.

Según SemiAnalysis, cada chip DRAM HBM4 puede acceder a hasta 512 de las conexiones de datos de la pila. Por tanto, cuatro chips pueden ocupar las 2.048 conexiones.

Añadir del quinto al duodécimo chip incrementa la capacidad. No amplía la interfaz externa más allá de esas 2.048 conexiones.

Los pines disponibles se distribuyen entre más capas de memoria en una pila más alta. La pila sigue presentando la misma interfaz general al acelerador.

Ese es el mecanismo central tras el argumento de las pilas cortas. Un paquete 4-hi, 8-hi y 12-hi puede ofrecer un ancho de banda nominal comparable cuando utiliza la misma generación y velocidad de señalización.

Sus capacidades difieren notablemente. SemiAnalysis modela chips centrales HBM4E de 32 gigabits, que producen 16GB para 4-hi, 32GB para 8-hi y 48GB para 12-hi.

Se trata de configuraciones futuras modeladas, no de productos comerciales generalmente disponibles. Ilustran cómo el número de capas cambia la capacidad mientras mantiene intacta la interfaz del paquete.

La distinción económica se deriva de lo que consumen los proveedores. El contenido de DRAM determina gran parte del coste de una pila HBM, mientras que los clientes de inferencia a menudo valoran el ancho de banda que alimenta sus aceleradores.

Un comprador de 4-hi obtiene menos gigabytes. Aun así, puede recibir la vía de datos necesaria para mantener abastecidas las unidades de cómputo.

Eso cambia la métrica de eficiencia relevante. La adquisición centrada en la capacidad pregunta cuántos gigabytes caben junto a cada acelerador. La adquisición centrada en el ancho de banda pregunta cuántos tokens pueden admitir esos enlaces de memoria.

Para la inferencia, la segunda pregunta puede dominar. La decodificación autorregresiva genera resultados secuencialmente, y cada paso debe leer de la memoria los pesos activos del modelo.

El proceso suele realizar relativamente poca aritmética por cada byte transferido. Eso hace que la decodificación esté limitada por el ancho de banda de memoria, lo que significa que la entrega de datos limita el rendimiento antes que el cómputo bruto.

Una pila más alta solo ayuda cuando la carga de trabajo utiliza su capacidad adicional. De lo contrario, los chips extra contienen información que el ancho de banda disponible no puede leer con suficiente frecuencia.

SemiAnalysis ofrece un ancho de banda ilustrativo de HBM4E de 3.328GB por segundo por pila. Deriva esa cifra de 2.048 pines que operan a 13 gigabits por segundo.

A 100 tokens generados por segundo, eso representa 33,28GB de ancho de banda teórico para cada token. El conjunto de trabajo útil no puede superar ese presupuesto si cada token debe leerlo una vez.

Una pila de 48GB contendría entonces más datos de los que el ancho de banda teórico puede recorrer por token. Parte de la capacidad permanecería inaccesible para esa carga de trabajo específica a esa velocidad.

Los sistemas reales nunca sostienen cada unidad del ancho de banda nominal. La sobrecarga de protocolo, los patrones de acceso, la comunicación y el comportamiento del software reducen el rendimiento efectivo.

Esta limitación puede reforzar el caso de las pilas cortas. Un ancho de banda utilizable menor significa que la carga de trabajo alcanza su límite de ancho de banda antes de poder aprovechar toda la capacidad instalada.

La HBM 4-hi explicada por este mecanismo no es simplemente memoria más barata. Es una configuración que separa el ancho de banda externo de la máxima densidad vertical.

La distinción también afecta a la producción de fabricación. Una oblea utilizada para pilas de cuatro capas puede, en teoría, respaldar tres veces más paquetes que una usada para pilas de 12 capas.

Las ganancias reales dependen de los rendimientos, la disponibilidad de chips base, las pruebas y la capacidad de empaquetado. Las pilas más cortas también deberían evitar algunas pérdidas acumulativas de ensamblaje asociadas a capas adicionales.

SemiAnalysis sostiene que el ancho de banda resultante por oblea HBM importa tanto como los tokens por vatio. Ambas métricas miden la producción útil de IA frente a un recurso que no puede expandirse rápidamente.

Por qué la inferencia valora más el ancho de banda que la capacidad máxima

La inferencia interactiva recompensa la memoria que puede alimentar rápidamente al procesador, mientras que la capacidad no utilizada aporta poco al rendimiento de tokens.

El entrenamiento y la inferencia imponen exigencias distintas a HBM. El entrenamiento almacena pesos, activaciones, gradientes y datos del optimizador mientras procesa grandes lotes mediante pasadas hacia adelante y hacia atrás.

Esta carga de trabajo puede consumir una capacidad enorme. También realiza suficiente aritmética como para quedar limitada por cómputo durante muchas operaciones.

La decodificación de inferencia es distinta. El sistema lee repetidamente los pesos activos y la caché de clave-valor del usuario, o caché KV, mientras produce un token tras otro.

La caché KV almacena información de atención de tokens anteriores. Evita que el modelo recalcule toda la conversación cada vez que genera otro token.

Más usuarios y contextos más largos amplían esa caché. Sin embargo, una mayor capacidad solo es valiosa si el sistema puede atender a esos usuarios dentro de un objetivo de latencia aceptable.

El procesamiento por lotes complica el panorama. Al procesar varias solicitudes juntas, un servidor puede amortizar una lectura de los pesos del modelo entre varios usuarios.

Los lotes más grandes mejoran el rendimiento total, pero también requieren más capacidad de caché KV. Aquí es donde las pilas 8-hi o 12-hi pueden recuperar una ventaja.

La contrapartida es la interactividad. Un proveedor puede esperar más para formar lotes mayores, o puede devolver tokens rápidamente con lotes más pequeños.

SemiAnalysis modela esta relación utilizando Kimi K3 en una futura configuración Rubin Ultra NVL576. Concluye que las pilas más altas ofrecen ganancias de rendimiento decrecientes a medida que aumenta la velocidad requerida por usuario.

A unos 213 tokens por segundo modelados para cada usuario, el informe no encuentra ningún beneficio de rendimiento más allá de 4-hi. El límite de ancho de banda llega antes de que la capacidad de memoria adicional resulte útil.

En otros puntos de la curva, 8-hi eleva el rendimiento máximo un 8 por ciento. Una configuración 12-hi lo eleva un 10 por ciento respecto a 4-hi.

Esas mejoras son reales dentro del modelo. La cuestión es si compensan el coste adicional de memoria y sistema.

SemiAnalysis estima que su sistema Rubin Ultra modelado de 8-hi cuesta un 12,1 por ciento más que la referencia de 4-hi. Su configuración de 12-hi añade un 26,3 por ciento.

Se trata de estimaciones de analistas basadas en componentes futuros y precios de memoria supuestos. No son cotizaciones de proveedores ni costes de propiedad medidos en sistemas Rubin Ultra ya desplegados.

Bajo esos supuestos, el rendimiento crece más lentamente que el coste del sistema. El coste resultante por token es mayor en ambas configuraciones más altas.

Esta es la afirmación más contundente del caso de SemiAnalysis a favor de HBM de 4-hi. Las pilas más cortas no solo reducen la factura de hardware; mejoran la producción modelada por unidad de gasto.

La computación a escala de rack hace que el argumento resulte más plausible. Los servidores anteriores conectaban ocho GPU, por lo que la memoria de cada dispositivo limitaba considerablemente todo el sistema de servicio.

Un sistema H100 HGX proporcionaba 640GB de HBM agregada. Los pesos de modelos grandes podían ocupar la mayor parte de esa capacidad antes de que el sistema almacenara una caché KV sustancial.

El H200 alivió esa presión al añadir memoria a cada GPU. En esa etapa, una mayor capacidad por dispositivo tenía un valor operativo inmediato.

GB300 NVL72 cambia la escala. Nvidia conecta 72 GPU Blackwell Ultra mediante NVLink, creando un dominio de comunicación compartido mucho mayor.

El rack incorpora alrededor de 20TB de memoria GPU. Su capacidad agregada supera con creces la de un servidor Hopper de ocho GPU.

SemiAnalysis compara este crecimiento con Kimi K3, un modelo de mezcla de expertos de 2,8 billones de parámetros. Estos modelos activan solo un subconjunto de sus expertos para cada token.

El informe estima que una réplica cuantizada de Kimi K3 ocupa 1.561GB. Esto consumiría menos del 8 por ciento de una configuración GB300 NVL72 de aproximadamente 21TB.

La cuantización representa números con menos bits, reduciendo el almacenamiento de pesos y el tráfico de memoria. Sacrifica cierta precisión numérica a cambio de requisitos de hardware considerablemente menores.

Los grandes dominios NVLink también distribuyen expertos entre más GPU. Esta disposición aumenta las exigencias de comunicación, pero reduce la cantidad de pesos del modelo que debe alojar cada dispositivo.

Según los informes, Rubin Ultra amplía el dominio de NVL72 a NVL576. Ese aumento de ocho veces en las GPU conectadas puede compensar una reducción de un tercio de la HBM por acelerador.

Por tanto, la capacidad pasa de ser un problema de GPU individual a uno de asignación a nivel de rack. Un despliegue puede alojar un modelo grande utilizando pilas de memoria locales más delgadas.

Esto no elimina las restricciones de memoria. Cambia dónde las resuelven los arquitectos y qué recurso escasea primero.

La descarga de caché ayuda, pero HBM de 4-hi no es una solución gratis

La estrategia de pilas cortas solo funciona cuando el software, la memoria secundaria y el comportamiento de la carga de trabajo evitan que la menor capacidad de HBM se convierta en un cuello de botella.

SemiAnalysis puso a prueba parte de ese supuesto con una carga de trabajo de InferenceX que utilizaba Kimi K3 y 16 GPU GB300. Ocho GPU se encargaban del prefill, mientras que otras ocho gestionaban el decode.

El prefill procesa el prompt antes de que comience la generación de tokens. Separarlo del decode permite a los operadores ajustar cada fase para comportamientos diferentes de computación y memoria.

El experimento redujo la utilización permitida de HBM del 92 por ciento al 85 por ciento. Esto es mucho menor que el recorte de capacidad entre pilas de 8-hi y 4-hi.

Sin embargo, el límite redujo sustancialmente el espacio disponible para la caché KV. La capacidad agregada de KV para servicio cayó de 53GB a 34GB por GPU, según el informe.

Para pares desagregados, el presupuesto disponible cayó de 44GB a 24GB. Estos cambios representaron reducciones del 36 por ciento y del 44 por ciento.

El rendimiento se mantuvo similar en la mayoría de los niveles de concurrencia probados. La configuración restringida trasladó datos inactivos de la caché KV a la DRAM convencional del servidor.

Ese proceso se denomina descarga de caché KV. Mantiene la información a la que se accede con frecuencia en HBM, mientras traslada el estado de conversación menos activo a una memoria más lenta y de mayor capacidad.

Las cargas de trabajo agénticas pueden adaptarse a este enfoque. A menudo se pausan mientras se ejecutan herramientas, las CPU procesan código o servicios externos devuelven información.

Durante esas pausas, la GPU no necesita inmediatamente la caché de cada conversación. Mover datos menos activos puede liberar HBM costosa para solicitudes activas.

La prueba restringida encontró un límite claro. Una vez que la concurrencia superó 70, el rendimiento cayó casi un 30 por ciento frente a la configuración con más memoria.

La ocupación de KV en la GPU había alcanzado el 100 por ciento. La preempción, las transferencias repetidas y las colas redujeron entonces el trabajo útil.

La ejecución limitada también registró más de diez veces más lecturas desde la caché KV basada en DRAM. La descarga alivió la presión de capacidad, pero incrementó el tráfico a través de un nivel más lento.

Este resultado es a la vez favorable y cauteloso. Demuestra que el software puede preservar el rendimiento tras una reducción significativa de memoria, pero solo por debajo de un umbral dependiente de la carga de trabajo.

Un servicio de producción con muchos usuarios simultáneos de contexto largo puede superar ese umbral. En ese caso, las pilas HBM más altas pueden admitir lotes mayores y un rendimiento total superior.

La capacidad de red también importa. Distribuir expertos y cachés entre cientos de aceleradores crea una comunicación intensiva de todos a todos.

Un sistema puede dejar de estar limitado por la capacidad de memoria y pasar a estar limitado por la red. Ese resultado sigue dejando HBM adicional sin aprovechar, pero no garantiza un rendimiento global eficiente.

La DRAM secundaria presenta otra restricción. La memoria de servidor experimenta su propia presión de suministro a medida que los sistemas de IA aumentan la capacidad del lado de CPU.

La descarga también consume energía y añade complejidad operativa. El software debe decidir qué permanece activo, qué se mueve y cuándo deben regresar los datos.

Las malas decisiones pueden convertir el ahorro de capacidad en picos de latencia. La arquitectura requiere una programación cuidadosa, gestión de caché y aislamiento de cargas de trabajo.

El crecimiento futuro de los modelos plantea la mayor incertidumbre. SemiAnalysis reconoce que su análisis aplica una carga de trabajo actual a hardware previsto para más adelante.

Los servidores de IA suelen permanecer desplegados durante más de cinco años. Los modelos, los contextos, la concurrencia de usuarios y las cargas de trabajo de razonamiento pueden cambiar drásticamente durante ese período.

El informe somete a pruebas de estrés un modelo tres veces mayor que Kimi K3 y con el triple de requisitos de caché por usuario. Las pilas más altas resultan más útiles bajo ese supuesto.

Su configuración de 8-hi ofrece un 36 por ciento más de tokens totales que la de 4-hi. La versión de 12-hi ofrece un 47 por ciento más, aunque ambas operan a una velocidad menor por usuario.

Tras incluir los costes estimados, 8-hi pasa a ser favorable por debajo de 180 tokens por segundo por usuario. El sistema de 12-hi sigue sin compensar el aumento de coste modelado.

Estos resultados demuestran por qué HBM de 4-hi no puede convertirse en una recomendación universal. La altura de pila preferida depende del tamaño del modelo, los objetivos de latencia, el procesamiento por lotes y la vida útil del sistema.

Los sistemas de entrenamiento siguen siendo un objetivo especialmente poco adecuado para una reducción agresiva de capacidad. Sus activaciones, gradientes y estados del optimizador pueden utilizar toda la memoria disponible.

Los sistemas de inferencia que sirven muchos modelos independientes también necesitan capacidad. Los operadores pueden valorar más la flexibilidad que el menor coste para una carga de trabajo optimizada.

Los compradores de hardware se enfrentan a un problema de opcionalidad. Un acelerador de 4-hi puede ser eficiente para el servicio actual, pero restrictivo cuando cambian las cargas de trabajo.

Los investigadores podrían adaptar los modelos al hardware instalado. El cálculo iterativo, la cuantización, los expertos dispersos y las cachés más pequeñas pueden reducir la dependencia de los parámetros almacenados.

Esa adaptación no está garantizada. Las mejoras en la calidad de los modelos podrían volver a proceder de mayores recuentos de parámetros o de arquitecturas intensivas en memoria.

Por tanto, la mejor interpretación es más limitada. HBM de cuatro capas ofrece una configuración sólida para inferencia cuidadosamente caracterizada, no un sustituto automático de la memoria más alta.

Menos capas presionan a los proveedores de memoria y a los fabricantes de sistemas

Si los compradores optimizan el ancho de banda en lugar de los gigabytes, la presión económica se desplaza de la producción de DRAM hacia los chips base, el empaquetado, las redes y la integración completa del sistema.

SK hynix, Samsung y Micron han dedicado años a desarrollar HBM más densa y más alta. Sus hojas de ruta enfatizan la capacidad, la velocidad de señalización, el rendimiento de empaquetado y el control térmico.

SK hynix comenzó a suministrar muestras de HBM4 de 12 capas en 2025. Su anuncio de HBM4 describía paquetes de 36GB con más de 2TB por segundo de ancho de banda.

Esa dirección de producto sigue siendo útil para entrenamiento e inferencia con alta demanda de capacidad. Un cambio significativo hacia 4-hi añadiría una prioridad de compra muy diferente.

Los clientes podrían exigir todo el ancho de banda de la interfaz con menos chips DRAM. Los proveedores enviarían más paquetes, pero menos bits de DRAM dentro de cada uno.

A primera vista, esto parece negativo para los ingresos de HBM. Los proveedores se han beneficiado de vender más contenido de DRAM especializada en cada generación de aceleradores.

SemiAnalysis sostiene que el resultado puede ser más equilibrado. Las pilas más cortas podrían mejorar los rendimientos de ensamblaje y aumentar el número de paquetes comercializables producidos por cada oblea.

Un proveedor también podría cobrar por el valor del ancho de banda, en lugar de tratar HBM principalmente como un producto de gigabytes. Sigue siendo incierto si los clientes aceptarán ese modelo.

El beneficio para el suministro es más claro. Pasar de 12-hi a 4-hi triplica teóricamente el número de grupos de chips del tamaño de una pila disponibles a partir de una cantidad fija de DRAM.

El aumento real puede superar esa simple proporción si las pilas más cortas elevan el rendimiento de empaquetado. Será inferior cuando otros componentes se conviertan en limitaciones.

Cada paquete HBM sigue necesitando un chip base, pruebas, apilado y montaje junto a un acelerador. Multiplicar la producción de paquetes aumenta la demanda de todos esos pasos.

HBM4 hace que el chip base sea más importante porque incluye más lógica y puede utilizar un proceso avanzado de fundición. El ahorro de DRAM no crea una capacidad equivalente de fundición.

Más paquetes de memoria también requieren más paquetes de aceleradores. Esos paquetes requieren interposers, sustratos orgánicos, suministro de energía, refrigeración y ensamblaje de alta densidad.

Por tanto, el cuello de botella puede migrar en lugar de desaparecer. Las obleas lógicas, los chips base, los sustratos, las placas de circuito y la integración de sistemas afrontarían una demanda mayor.

Los grandes dominios de escalado intensifican otra restricción. Más aceleradores requieren una amplia conmutación y conectividad de red antes de que su memoria agregada se comporte como un recurso compartido práctico.

El GB300 NVL72 de Nvidia utiliza nueve bandejas NVSwitch para conectar 72 GPU. Su tejido NVLink de quinta generación ofrece 130TB por segundo de ancho de banda agregado.

Los futuros sistemas NVL576 deberán ampliar sustancialmente esa escala. Su economía depende de que la red siga siendo lo bastante rápida como para admitir expertos distribuidos y movimiento de caché.

La energía sigue siendo el límite final. Duplicar el número de paquetes HBM con gran ancho de banda solo ayuda cuando los operadores pueden desplegar los aceleradores conectados a ellos.

Una estrategia de 4-hi puede ampliar el suministro de DRAM sin crear nueva capacidad eléctrica. La construcción de centros de datos, la refrigeración y el acceso a la red eléctrica siguen determinando la computación utilizable.

Esta presión explica por qué los tokens por oblea de HBM son una métrica útil, pero no completa. Los operadores deben optimizar conjuntamente los tokens por vatio, rack, puerto de red y presupuesto de capital.

El cambio también afectaría a los mercados de memoria convencionales. La producción de HBM compite con la DRAM para servidores, PC y móviles por recursos de fabricación.

Utilizar menos chips DRAM de HBM puede devolver parte de la capacidad de obleas a esos productos. Ese alivio importa a medida que la memoria del lado de CPU crece junto con los despliegues de IA agéntica.

Sin embargo, el beneficio depende de la adopción real. Un diseño de 4-hi que permita muchos más envíos de aceleradores podría consumir parte del ahorro mediante un mayor volumen total de unidades.

Los proveedores de memoria también podrían resistirse a un cambio rápido si debilita la demanda de bits. Su respuesta se reflejará en la disponibilidad de productos, los calendarios de homologación y la asignación de capacidad.

Por lo tanto, la competencia principal no es Nvidia contra un proveedor de memoria. Es el diseño de inferencia orientado al ancho de banda frente a la economía de HBM orientada a la capacidad.

Ese mapa de rivales mantiene claras las consecuencias para la industria. Las pilas bajas ganan cuando el ancho de banda genera ingresos y los gigabytes instalados no.

Las pilas más altas ganan cuando los clientes pueden convertir la capacidad adicional en lotes más grandes, más modelos o una flexibilidad de hardware más duradera.

Tres señales mostrarán si la HBM 4-hi realmente gana

La tesis de las pilas bajas solo será creíble cuando converjan las hojas de ruta de productos, la disponibilidad de producción y los resultados de inferencia medidos.

La primera señal es la configuración final de Rubin Ultra de Nvidia. La documentación pública debe confirmar la capacidad de memoria, la altura de las pilas, el ancho de banda y la arquitectura del sistema NVL576.

Una configuración confirmada de 192GB con HBM 8-hi respaldaría el argumento direccional. Un retorno a 12-hi debilitaría las afirmaciones de que los requisitos de capacidad se han relajado de forma generalizada.

Un producto comercial Rubin de 4-hi aportaría evidencia mucho más sólida. Hasta entonces, la propuesta de HBM 4-hi de SemiAnalysis sigue siendo una previsión fundamentada sobre futuros ASICs y aceleradores.

La segunda señal es la cualificación por parte de proveedores de HBM4 o HBM4E 4-hi de alta velocidad. Los proveedores deben ofrecer esos paquetes a las velocidades de señalización requeridas por los diseñadores de aceleradores.

El ancho nominal de la interfaz por sí solo es insuficiente. Los productos necesitan rendimientos aceptables, gestión térmica, fiabilidad y rendimiento sostenido en sistemas completos.

Observe si SK hynix, Samsung o Micron añade configuraciones 4-hi a sus hojas de ruta públicas. Las muestras para clientes demostrarían que las pilas bajas han superado los estudios arquitectónicos internos.

También observe el modelo de precios. Si los costes de 4-hi escalan principalmente con su menor capacidad, su economía de ancho de banda se vuelve convincente.

Si los proveedores concentran la mayor parte del valor en el die base y la interfaz, los ahorros esperados podrían reducirse. La escasez de paquetes también podría mantener primas elevadas pese al menor contenido de DRAM.

La tercera señal son las pruebas de inferencia independientes en cargas de trabajo variadas. Los benchmarks deben incluir asistentes interactivos, servicios agénticos, solicitudes de contexto largo e implementaciones de grandes lotes.

El rendimiento medio de tokens no será suficiente. Las pruebas deben medir la velocidad por usuario, el comportamiento de las colas, las tasas de aciertos de caché, el tráfico de descarga y la latencia de cola.

Los resultados también deben comparar modelos que difieren en tamaño y arquitectura. Una configuración optimizada para Kimi K3 no puede establecer la mejor opción para todos los futuros modelos de frontera.

La evidencia decisiva será una ventaja estable en coste por token bajo objetivos realistas de nivel de servicio. Esa ventaja debe mantenerse con alta concurrencia y cambios en la combinación de cargas de trabajo.

Los desarrolladores deberían prestar atención porque las restricciones de hardware determinan el diseño de los modelos. La memoria disponible influye en la cuantización, la ubicación de expertos, la gestión del contexto y la política de caché.

Los compradores empresariales deberían prestar atención porque la capacidad anunciada puede resultar engañosa. Más HBM no garantiza una inferencia más útil cuando el ancho de banda, las redes o la latencia establecen el límite.

Los equipos de infraestructura deberían evaluar los conjuntos de trabajo a nivel de rack. Deben separar las cargas de trabajo de entrenamiento, prefill, decode y agentes antes de seleccionar un perfil de memoria.

También deberían conservar margen operativo. Un sistema 4-hi optimizado de forma muy estrecha puede perder su ventaja cuando la demanda cambia hacia lotes más grandes o más modelos simultáneos.

La lección más amplia no es que menos memoria siempre gane. Es que la memoria debe adquirirse en función del recurso que realmente consume una carga de trabajo.

Para la inferencia interactiva, ese recurso suele ser el ancho de banda. La HBM de cuatro capas puede mantener toda la ruta externa de datos utilizando menos dies de DRAM escasos.

Esto convierte el análisis de SemiAnalysis sobre HBM 4-hi en un desafío serio para las suposiciones de la industria sobre las pilas más altas. Las próximas divulgaciones de productos mostrarán si los equipos de hardware están de acuerdo.

Antes de comprometerse con una futura flota de aceleradores, plantee tres preguntas. ¿El conjunto de trabajo cabe a escala de rack, los datos de caché fría pueden moverse de forma segura y la capacidad adicional aumenta el rendimiento útil?

Si las respuestas apuntan al ancho de banda, el rey bajo merece un lugar en la hoja de ruta.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page