top of page

NVIDIA Vera Rubin NVL72 asegura un rendimiento por dólar 67 veces superior, pero el punto operativo importa

16 sept
19 min de lectura

NVIDIA Vera Rubin NVL72 ha registrado una ventaja declarada de 67 veces en rendimiento por dólar frente a GB300 NVL72 en una prueba temprana de inferencia agéntica. Esa cifra es válida dentro de la comparación de referencia seleccionada, pero no es un multiplicador universal. A velocidades de servicio más habituales, la ventaja medida fue mucho menor.

Los resultados del 14 de septiembre ofrecen a los compradores de infraestructura su primera evaluación independiente de Rubin bajo una carga de trabajo de contexto largo y múltiples turnos. También hacen que la previsión de rendimiento anterior del CEO de NVIDIA, Jensen Huang, parezca conservadora. Sin embargo, el mayor multiplicador depende de un exigente punto operativo en el que la configuración Blackwell comparada se aproxima a su límite de rendimiento.

Por tanto, la cuestión central no es simplemente Rubin frente a Blackwell. Es la afirmación de titular frente al rendimiento que los operadores pueden reproducir en distintos modelos, motores de servicio, objetivos de latencia y tráfico de producción. NVIDIA parece haber desplazado toda esa curva de rendimiento, pero la distancia varía considerablemente a lo largo de ella.

NVIDIA Vera Rubin NVL72 pasa de las previsiones al trabajo agéntico medido

El cambio importante es que Rubin ahora cuenta con resultados medidos de inferencia agéntica, no solo con especificaciones arquitectónicas o proyecciones de NVIDIA.

SemiAnalysis publicó los primeros resultados revisados de Rubin procedentes de AgentX, su benchmark para tráfico de agentes de programación con contexto largo. Las pruebas utilizaron sesiones con patrones de producción, con contexto acumulado, pausas por herramientas, reutilización de prefijos y ráfagas de subagentes en paralelo.

Ese tráfico difiere de un benchmark convencional de chatbot. Una solicitud básica de chat suele contener un prompt y una respuesta. Un agente puede realizar cientos de turnos mientras llama a herramientas, consulta a subagentes y reenvía repetidamente un historial de conversación cada vez mayor.

Estos patrones imponen exigencias distintas a un sistema de inferencia. Los historiales largos consumen capacidad de caché clave-valor, que almacena datos de atención calculados previamente. Los prefijos reutilizados premian una caché eficiente, mientras que las ráfagas de subagentes ponen a prueba la planificación y la concurrencia.

La metodología pública de AgentX se basa en 393 sesiones de programación con consentimiento que contienen 135.282 solicitudes. Su solicitud reconstruida mediana tiene 142.016 tokens de entrada y 444 tokens de salida.

AgentX elimina los prompts, el código, los argumentos de herramientas y los resultados de herramientas. Conserva las longitudes de las solicitudes, los tiempos, las relaciones de prefijos compartidos y la estructura de subagentes, y luego los sustituye por tokens sintéticos deterministas.

Este diseño ofrece patrones de tráfico más realistas sin exponer el contenido original. Sin embargo, AgentX no evalúa si un modelo genera código correcto o completa con éxito la tarea de un agente. Mide el sistema de servicio, no la inteligencia del modelo.

Los nuevos resultados utilizaron DeepSeek V4 Pro y una versión temprana de TensorRT-LLM. TensorRT-LLM es el tiempo de ejecución de inferencia de NVIDIA para optimizar la ejecución de modelos en sus aceleradores.

Según el análisis del benchmark de Rubin, Vera Rubin NVL72 produjo aproximadamente 67 veces más rendimiento total por coste de propiedad modelado que GB300 NVL72 a 170 tokens por segundo.

Esa comparación utilizó TensorRT-LLM y NVFP4, el formato numérico de cuatro bits de NVIDIA para computación de IA de menor precisión. También midió la configuración completa de hardware y software, en lugar de comparar especificaciones teóricas de chips.

En el mismo punto operativo, Rubin logró una ventaja notable porque la curva seleccionada de GB300 con TensorRT-LLM estaba cerca de su punto final de rendimiento medido más rápido. SemiAnalysis informó de una ventaja de Rubin mucho menor frente a GB300 ejecutando SGLang, otro marco de servicio.

El resultado sigue siendo importante. Rubin no ganó únicamente porque el benchmark seleccionara una generación obsoleta o un servidor básico de una sola GPU. Superó al sistema Blackwell Ultra de NVIDIA a escala de rack mientras servía el mismo modelo grande y mantenía un objetivo de velocidad de respuesta equivalente.

Sin embargo, la cifra de 67 veces describe un punto en una curva de rendimiento. No significa que cada despliegue de Rubin genere 67 veces más tokens por el mismo coste total.

En el rango de 60 a 100 tokens por segundo, que SemiAnalysis describe como más representativo para los proveedores que sirven esta carga de trabajo, Rubin ofreció aproximadamente entre 1,4 y tres veces más rendimiento por coste total.

Es menos llamativo que 67 veces, pero es comercialmente significativo. Una mejora sostenida de dos veces puede transformar la planificación de capacidad cuando la energía, la red, la refrigeración y el espacio disponible en el centro de datos ya limitan la expansión.

Los resultados también muestran una mayor interactividad máxima. Rubin alcanzó aproximadamente 276 tokens por segundo P90, frente a unos 172 de GB300 con la configuración seleccionada de TensorRT-LLM.

La interactividad P90 mide la velocidad de transmisión alcanzada por el 90 % de las respuestas. Ayuda a los operadores a determinar si un resultado de rendimiento también ofrece una experiencia de usuario aceptable.

La ventaja de Rubin no fue idéntica en todas las pilas de software. SemiAnalysis observó que GB300 ejecutando SGLang podía alcanzar una interactividad similar a la de Rubin, aunque Rubin conservaba otras ventajas de rendimiento y latencia.

Esta variación establece la tensión principal del artículo. NVIDIA Vera Rubin NVL72 parece sustancialmente más rápida, pero su mayor ventaja reportada surge de una combinación específica de modelo, tiempo de ejecución, precisión y objetivo de nivel de servicio.

Por qué la inferencia agéntica convierte la energía en el recurso escaso

La ganancia más importante de Rubin no es el rendimiento aritmético máximo, sino la cantidad de tráfico agéntico útil que puede atender dentro de un límite fijo de energía.

Un agente consume más tokens que una interacción de chat simple porque cada paso puede convertirse en contexto para el siguiente. Los agentes de investigación, programación y soporte pueden buscar en bases de datos, ejecutar herramientas, inspeccionar resultados y delegar trabajo antes de responder.

NVIDIA afirma que las solicitudes agénticas consumen aproximadamente 15 veces más tokens que las solicitudes de chat simples, según datos de OpenRouter. Esa cifra variará según la aplicación, pero la tendencia subyacente es clara.

A medida que crece el contexto, el sistema procesa o recupera repetidamente información de turnos anteriores. Varios subagentes también pueden crear ráfagas breves e intensas de solicitudes simultáneas.

Estas características convierten la capacidad de memoria, el ancho de banda de memoria, la latencia de interconexión, la gestión de caché y la coordinación de CPU en restricciones de primer orden. El rendimiento bruto de tensor sigue siendo importante, pero ya no explica el resultado completo del servicio.

El acceso a la electricidad añade otro límite. Un operador puede adquirir aceleradores adicionales, pero carecer de suficiente capacidad de red eléctrica para alimentarlos. Las nuevas subestaciones, conexiones de transmisión, sistemas de refrigeración y salas de datos tardan más en construirse que los servidores.

Por tanto, el rendimiento por megavatio mide más que la eficiencia energética. Aproxima cuánto trabajo facturable puede extraer un operador de un recurso escaso de la instalación.

A 100 tokens por segundo, SemiAnalysis midió Rubin en aproximadamente 59,4 millones de tokens totales por segundo por megavatio de servicio público. La configuración GB300 más potente medida alcanzó 28,5 millones con el mismo objetivo.

Eso hace que Rubin sea aproximadamente 2,09 veces más rápida que el motor GB300 más potente en este punto operativo práctico. GB300 ejecutando TensorRT-LLM alcanzó 21,1 millones de tokens por segundo por megavatio.

La magnitud de la ventaja cambió a medida que aumentaba el requisito de velocidad. A 150 tokens por segundo, Rubin mantuvo casi 37 millones de tokens por segundo por megavatio, alrededor de 7,2 veces el resultado medido de GB300 con SGLang.

A 170 tokens por segundo, la ventaja de rendimiento por megavatio de Rubin fue 62,9 veces superior a la de GB300 con TensorRT-LLM. Sin embargo, frente a GB300 con SGLang, el multiplicador fue de 5,56 veces.

Esa diferencia explica por qué toda gran afirmación de rendimiento necesita la etiqueta de su motor. Un comprador que compare únicamente nombres de aceleradores no vería cuánto cambia el resultado según el tiempo de ejecución.

Las cifras anteriores de NVIDIA mostraban otra perspectiva de la misma tendencia. La compañía informó de hasta 30 veces más rendimiento por megavatio que GB300 a 160 tokens por segundo.

NVIDIA indicó que esas pruebas utilizaron la carga de trabajo AgentX DeepSeek V4 Pro. En el momento de la publicación, la compañía también señaló que los resultados estaban pendientes de revisión por SemiAnalysis y no incluían el rendimiento de la CPU Vera para llamadas a herramientas.

La revisión posterior respalda una ventaja sustancial de Rubin, pero no un multiplicador fijo. Los datos de rendimiento agéntico de NVIDIA muestran que la ventaja aumenta de aproximadamente dos veces a 110 tokens por segundo a 30 veces a 160.

Esta curva importa más que un único gráfico de barras. Un proveedor de inferencia elige un equilibrio entre concurrencia, velocidad de respuesta, tiempo hasta el primer token, latencia total y coste.

Una configuración optimizada para el máximo rendimiento agregado puede hacer que cada usuario espere demasiado. Un sistema optimizado para una interactividad extrema puede dejar capacidad costosa infrautilizada.

Los productos agénticos añaden otra complicación. La ejecución de herramientas, la compilación de código, la recuperación y las llamadas a API externas pueden dejar a las GPU esperando a las CPU o a servicios remotos.

Rubin aborda este problema con 36 CPU Vera junto a 72 GPU Rubin en cada rack NVL72. NVIDIA diseñó estas CPU para gestionar la orquestación de agentes, las llamadas a herramientas, el procesamiento de datos y la ejecución aislada.

El argumento económico se refuerza si esos componentes reducen el tiempo de inactividad en todo un flujo de trabajo. Se debilita si las herramientas externas, las llamadas de red o la lógica de aplicación siguen siendo el cuello de botella dominante.

Para los proveedores de nube y los laboratorios de modelos, la presión es inmediata. Una gran ventaja de Rubin dificultaría justificar una expansión continua de Blackwell para nueva capacidad de inferencia limitada por energía.

Los despliegues existentes de Blackwell no se volverán antieconómicos de repente. Su hardware ya está instalado, su software está maduro y muchas cargas de trabajo no necesitan el rango de interactividad más alto de Rubin.

La respuesta obligada es más selectiva. Los operadores deben decidir qué cargas de trabajo merecen Rubin primero, cuáles deberían permanecer en Blackwell y cuáles pueden trasladarse a aceleradores de la competencia.

El codiseño extremo es el mecanismo detrás de la ganancia de Rubin

El resultado de NVIDIA procede de coordinar la GPU, la CPU, la memoria, la interconexión, el tiempo de ejecución y la instalación, no de un único chip más rápido trabajando por sí solo.

NVIDIA denomina a esta estrategia codiseño extremo. Vera Rubin NVL72 integra 72 GPU Rubin y 36 CPU Vera mediante NVLink de sexta generación dentro de un dominio a escala de rack.

La GPU Rubin incluye 288 GB de memoria HBM4 con 22 TB por segundo de ancho de banda de memoria. La memoria de alto ancho de banda se sitúa cerca del procesador y suministra datos del modelo más rápido que la memoria convencional de servidor.

NVLink proporciona 3,6 TB por segundo de ancho de banda para cada GPU y 260 TB por segundo en todo el rack. Esta red permite que las 72 GPU se comporten más como un gran recurso informático.

Esta arquitectura beneficia a los modelos de mezcla de expertos. Estos modelos activan redes de expertos seleccionadas para cada token en lugar de utilizar todos los parámetros para cada operación.

Servirlos de forma eficiente requiere un enrutamiento rápido entre procesadores. Los retrasos al mover activaciones entre expertos pueden desperdiciar la capacidad aritmética que parece impresionante en una hoja de especificaciones.

Rubin también mejora las operaciones de sincronización utilizadas durante la inferencia distribuida. Una menor sobrecarga de comunicación significa que los procesadores dedican más tiempo a calcular y menos a esperar coordinación.

La arquitectura de racks de NVIDIA combina Rubin con redes ConnectX-9, unidades de procesamiento de datos BlueField-4, switches NVLink y la plataforma Ethernet Spectrum-6.

La compañía describe ahora el sistema más amplio como una arquitectura de siete chips tras añadir el LPU Groq 3. Un LPU es un procesador diseñado para ejecutar modelos de lenguaje de forma predecible y con baja latencia.

Rubin se encarga del procesamiento de contexto intensivo en cómputo, también llamado prefill. Los racks LPX construidos con procesadores Groq 3 pueden centrarse en la generación de tokens sensible a la latencia, denominada decode.

Esta separación se conoce como servicio desagregado. Permite a los operadores escalar de forma independiente los recursos de prefill y decode, en lugar de obligar a que ambas fases usen hardware idéntico.

Las cargas de trabajo de agentes hacen atractivo este reparto porque sus solicitudes contienen largos historiales de entrada, pero pueden requerir respuestas interactivas rápidas. El prefill necesita capacidad de memoria y cómputo paralelo, mientras que el decode se beneficia de una baja latencia.

El ajuste de tasas equilibra entonces la velocidad con la que ambos grupos intercambian trabajo. Un mal ajuste puede dejar inactivo a un grupo mientras el otro se sobrecarga.

El software de servicio integra estos componentes. TensorRT-LLM proporciona kernels optimizados, mientras que NVIDIA Dynamo coordina la inferencia entre recursos distribuidos.

Los resultados de AgentX demuestran por qué el software debe considerarse parte del producto. La diferencia entre GB300 con TensorRT-LLM y GB300 con SGLang alcanzó decenas de veces en un extremo.

Eso no significa que un motor sea universalmente superior. El motor de GB300 más sólido cambió a lo largo del rango de velocidad probado: TensorRT-LLM lideró en un objetivo y SGLang en objetivos más altos.

El resultado inicial de Rubin llegó antes de que su pila de software hubiera madurado por completo. Esto deja margen de mejora, pero también introduce incertidumbre en el despliegue.

NVIDIA afirma que la plataforma está en plena producción y que se enviará durante la segunda mitad de 2026. La afirmación anterior de la compañía sobre la plataforma era de hasta diez veces más rendimiento de inferencia por vatio que Blackwell.

SemiAnalysis encontró hasta siete veces más rendimiento por megavatio en torno a la región operativa, frente a la ilustración de GTC de Huang que mostraba una mejora de tres veces. En algunos extremos comparables, el múltiplo medido fue mucho mayor.

Esto respalda la interpretación de “sandbagging”, pero solo en un sentido limitado. La presentación de Huang cubría una expectativa amplia de plataforma, mientras que el nuevo resultado abarca una carga de trabajo agéntica y configuraciones concretas.

El diseño de Rubin también aborda el aprovisionamiento de energía. Los centros de datos suelen dimensionar sus sistemas eléctricos para el consumo máximo posible de un rack, incluso cuando las cargas de inferencia rara vez alcanzan ese máximo de forma continua.

NVIDIA DSX MaxLPS utiliza asignación dinámica de energía para recuperar capacidad no utilizada entre GPUs y racks. Busca incorporar más cómputo dentro del mismo límite del sitio sin exceder la envolvente energética de la instalación.

La documentación de MaxLPS describe un despliegue ilustrativo de inferencia de un megavatio con 400 GPUs. En ese ejemplo, la gestión dinámica eleva el rendimiento de tokens a 1,35 veces la referencia estática de potencia máxima.

NVIDIA afirma que la planificación combinada de instalaciones y el control energético pueden permitir hasta un 40 por ciento más de GPUs dentro de una envolvente fija. Es una afirmación de planificación, no un resultado garantizado para cada instalación.

Los operadores deben validar el perfil energético real de su carga de trabajo, la capacidad de refrigeración, el margen de seguridad y el impacto sobre la latencia. Una flota que alcance con frecuencia su consumo máximo ofrecerá menos capacidad recuperable.

Por tanto, el mecanismo es multiplicativo. GPUs más rápidas, memoria más amplia, enlaces de menor latencia, mejor programación, CPUs especializadas y gestión dinámica de energía eliminan distintos cuellos de botella.

Si estas capas funcionan juntas, Rubin puede generar más tokens útiles desde el mismo edificio. Si una capa no escala, la ganancia teórica se reduce antes de llegar a los clientes.

La afirmación de 67x se reduce fuera de su punto operativo seleccionado

El benchmark respalda la ventaja de Rubin, pero también muestra por qué una cifra máxima de rendimiento por dólar no debería convertirse en una hipótesis de planificación para toda una flota.

La primera limitación es el extremo seleccionado. A 170 tokens por segundo, la configuración comparada de GB300 TensorRT-LLM estaba cerca de su techo de interactividad medido.

Pequeños aumentos en el objetivo de velocidad pueden reducir drásticamente la cantidad de tráfico que un sistema atiende cerca de ese límite. Rubin aún tenía margen de rendimiento sin utilizar, lo que generó la relación inusualmente elevada.

Comparar Rubin con GB300 SGLang en el mismo objetivo redujo la ventaja de rendimiento por megavatio de 62,9 veces a 5,56 veces. Sigue siendo grande, pero cuenta una historia de compra distinta.

La segunda limitación es el modelo de coste total. SemiAnalysis calcula el coste de propiedad usando hardware, redes, energía, financiación, colocation, vida útil y condiciones de compra asumidas para hyperscalers.

Un proveedor más pequeño afrontará condiciones distintas de financiación, utilización e infraestructura. Un arrendatario de nube también verá una relación diferente entre el rendimiento del hardware y la capacidad contratada.

El rendimiento por dólar depende de mantener el equipo ocupado. Un acelerador con una economía máxima excelente puede decepcionar si la demanda llega de forma irregular o el software impide una alta utilización.

La tercera limitación es el alcance de la carga de trabajo. El resultado publicado de Rubin se centra en DeepSeek V4 Pro bajo el patrón de tráfico de agentes de programación de AgentX.

Un cliente que atienda prompts más cortos, generación de imágenes, recuperación, vídeo, modelos densos o trabajos batch sin conexión encontrará cuellos de botella diferentes. La propia SemiAnalysis señala que las ganancias comparativas de Rubin son menores para la inferencia batch sin conexión y el entrenamiento.

AgentX también utiliza cargas sintéticas. Preserva longitudes, prefijos compartidos, tiempos y ramificaciones, pero no puede conservar el contenido semántico de sesiones privadas.

La decodificación especulativa presenta un desafío particular. Esta técnica usa un modelo borrador más pequeño o rápido para sugerir varios tokens futuros y después pide al modelo principal que los acepte o rechace.

El texto sintético puede producir comportamientos de aceptación poco realistas. AgentX aborda esto usando longitudes de aceptación medidas a partir de un conjunto de datos de programación independiente y registrando esos ajustes.

Ese control mejora la comparabilidad, pero sigue siendo una aproximación. El benchmark no puede reproducir plantillas propietarias de proveedores, razonamiento oculto, herramientas del lado del servidor, imágenes ni todas las transformaciones de tokenizadores.

La ejecución de circuito cerrado introduce otro matiz. Los sistemas más rápidos avanzan más a través de sesiones muestreadas durante la ventana de prueba, por lo que pueden encontrar una mezcla de solicitudes algo distinta.

Ninguno de estos problemas invalida el resultado. Definen qué mide el resultado y dónde los compradores deberían exigir pruebas adicionales.

La cuarta limitación es el software temprano. SemiAnalysis utilizó una compilación previa al lanzamiento de TensorRT-LLM, y las versiones posteriores deberían mejorar la eficiencia de Rubin.

El software temprano también puede contener regresiones, funciones incompletas y comportamientos operativos que no aparecen en un benchmark controlado. Las pilas maduras de Blackwell han tenido más tiempo para incorporar correcciones de producción.

La fiabilidad importa a escala de rack. Un rack NVL72 completo contiene 1,3 millones de componentes y casi 1.300 chips, según NVIDIA.

Un operador de centro de datos necesita rendimiento útil sostenido, es decir, salida útil después de considerar fallos, mantenimiento, reintentos y hardware no disponible. El rendimiento máximo de un benchmark no mide todo ese historial operativo.

La quinta limitación es la respuesta competitiva. AMD lanzó su acelerador Instinct MI455X en julio de 2026 para la plataforma Helios a escala de rack.

Las especificaciones oficiales del MI455X enumeran 40,3 petaflops de rendimiento MXFP4 máximo y una arquitectura CDNA5. Las cifras máximas de capacidad aritmética no pueden compararse directamente con los resultados de AgentX.

SemiAnalysis incluyó el anterior MI355X en sus nuevas mediciones. A 100 tokens por segundo, la configuración MI355X más sólida probada alcanzó unos 2,01 millones de tokens por segundo por megavatio.

Rubin alcanzó 59,4 millones en ese punto, generando una ventaja reportada de 29,5 veces. Según SemiAnalysis, AMD se ha comprometido a colaborar en futuras pruebas de AgentX con MI455X.

Esa comparación futura será mucho más relevante que Rubin frente a MI355X. Pondrá a prueba dos plataformas actuales a escala de rack con la misma carga de trabajo, modelo, patrón de tráfico y objetivo de nivel de servicio.

TPU7x Ironwood de Google también apunta a grandes modelos densos y de mezcla de expertos. Su disponibilidad a través de Google Cloud ofrece a los clientes otra vía que combina silicio personalizado con una plataforma de software integrada verticalmente.

NVIDIA conserva una ventaja en profundidad de ecosistema. CUDA, TensorRT-LLM, Dynamo, NVLink y su red de socios dan a la compañía control sobre una parte mayor de la ruta de despliegue.

Ese control puede mejorar la optimización, pero también puede profundizar la dependencia de los clientes respecto a un solo proveedor. El codiseño extremo funciona mejor cuando los compradores aceptan toda la pila.

La interpretación creíble no es que Rubin sea 67 veces mejor en todas partes. Es que Rubin amplía la frontera útil de la inferencia, especialmente para grandes cargas de trabajo agénticas con requisitos estrictos de interactividad.

Más tokens por gigavatio no significan automáticamente más beneficios

Rubin puede mejorar la economía de los centros de datos, pero el beneficio depende de la utilización, la demanda, la fiabilidad y los precios de venta que el benchmark no puede establecer.

SemiAnalysis estima que Rubin puede generar más del doble de beneficio anual por gigavatio que Blackwell. La firma espera que esa diferencia aumente a medida que maduren los kernels y el software de servicio.

Esta estimación sigue un mecanismo razonable. Si un megavatio produce más tokens facturables, la capacidad de ingresos aumenta mientras la asignación de red eléctrica de la instalación permanece fija.

Un menor coste unitario también puede ampliar los márgenes o permitir tarifas más bajas para los clientes. Los proveedores pueden elegir entre retener la ganancia de eficiencia y utilizarla para captar más demanda.

Sin embargo, el rendimiento representa capacidad, no ventas. Un proveedor solo gana más cuando los clientes consumen esa capacidad adicional a tasas sostenibles.

El perfil de demanda debe encajar con el hardware. Las ventajas más fuertes de Rubin aparecen en cargas de trabajo de agentes interactivas y con contexto largo, no en todas las formas de computación de IA.

Esto crea un problema de asignación. Los proveedores necesitan suficiente tráfico agéntico para mantener ocupados los nuevos racks sin desviar cargas de trabajo que se ejecutan de forma más económica en otro lugar.

La eficiencia de los modelos también puede reducir la demanda de infraestructura por tarea. Mejores arquitecturas, trazas de razonamiento más cortas, mejor caché y modelos especializados más pequeños pueden reducir el consumo de tokens.

El efecto contrario es igualmente plausible. Los tokens más baratos pueden animar a los desarrolladores a crear agentes de ejecución más prolongada, utilizar más subagentes y automatizar tareas que antes no eran económicamente viables.

Este es el conocido efecto rebote de la informática. La eficiencia reduce el coste de una operación y, después, el software se expande para consumir la nueva capacidad.

NVIDIA apuesta con fuerza por ese resultado. Su planteamiento trata los centros de datos como fábricas de IA cuya producción son tokens, en lugar de servicios informáticos convencionales.

La metáfora tiene límites. Los tokens varían mucho en valor. Un token que contribuye a una tarea de programación completada vale más que uno generado durante un bucle de razonamiento fallido.

Los benchmarks de agentes aún tienen dificultades para conectar la eficiencia de la infraestructura con el trabajo completado. AgentX mantiene deliberadamente el comportamiento del modelo fuera de su alcance y no evalúa la calidad de salida.

Una prueba económica completa mediría el coste por tarea exitosa, no solo el coste por millón de tokens. Incluiría precisión del modelo, reintentos, fallos de herramientas y el esfuerzo humano necesario para revisar los resultados.

La latencia también afecta indirectamente a los ingresos. Un agente más rápido puede completar más tareas y mantener a los usuarios involucrados, pero solo si la aplicación y las herramientas externas responden a una velocidad comparable.

Los resultados de latencia de extremo a extremo reportados para Rubin son alentadores. En un punto comparable de eficiencia de propiedad, SemiAnalysis midió aproximadamente 20 segundos para Rubin y 60 segundos para B200 o B300.

En un punto con mayor rendimiento por coste, la firma informó de unos 20 segundos para Rubin y 120 segundos para los sistemas Blackwell comparados.

Estas mediciones refuerzan el caso de Rubin porque combinan mayor rendimiento con tiempos de finalización más cortos. Aun así, siguen siendo resultados de referencia específicos de una configuración.

La rentabilidad también depende de la velocidad de despliegue. Un rack retrasado no produce tokens, independientemente de su eficiencia prevista.

NVIDIA diseñó Rubin en torno al formato de rack MGX de tercera generación para facilitar la instalación y el mantenimiento. La bandeja de cómputo utiliza un diseño interno sin cables, sin mangueras y sin ventiladores.

La compañía afirma que el tiempo de ensamblaje y mantenimiento de las bandejas se redujo de casi dos horas a cinco minutos. La experiencia en campo deberá demostrar si esos cambios de diseño mejoran la disponibilidad de la flota.

La refrigeración y la densidad de potencia siguen siendo consideraciones importantes para las instalaciones. Rubin concentra una demanda eléctrica considerable en un solo rack, lo que exige una distribución de energía y refrigeración líquida compatibles.

Los operadores con instalaciones antiguas no pueden aprovechar la mejora simplemente sustituyendo servidores. Podrían necesitar nuevos equipos eléctricos, distribución de refrigerante, redes y procedimientos operativos.

Esto hace que Rubin resulte más atractivo para hyperscalers, laboratorios de modelos y proveedores de nube especializados que ya están construyendo nuevos campus de IA. Los compradores más pequeños pueden acceder a él de forma más eficiente mediante servicios en la nube.

“Cuanto más compras, más ganas” funciona como un resumen memorable del argumento comercial de NVIDIA. No es una ley económica.

La versión más precisa es condicional. Cuanta más capacidad eficiente despliegue, ocupe, alimente y mantenga disponible un operador, más ingresos podrá sostener ese sitio fijo.

Qué deberían vigilar los compradores tras el resultado de NVIDIA Vera Rubin NVL72

Tres señales determinarán si la ventaja inicial de Rubin en benchmarks se convierte en una ventaja duradera en producción.

La primera señal son datos de AgentX reproducibles de forma independiente en distintos motores de serving. Rubin necesita resultados públicos de TensorRT-LLM, SGLang y vLLM utilizando modelos y objetivos de nivel de servicio idénticos.

Esta comparación mostrará qué parte de la ventaja actual procede del hardware de Rubin y qué parte de una combinación de software inusualmente favorable.

Los resultados históricos deberían seguir siendo visibles a medida que mejoran los runtimes. De lo contrario, los compradores no podrán distinguir las mejoras genuinas de hardware de los cambios de software que también benefician a sistemas más antiguos.

La reproducción por parte de proveedores de nube reforzaría aún más el caso. Sus despliegues incluyen restricciones de programación, redes, monitorización, multitenencia y fiabilidad que no están presentes en entornos de prueba controlados.

Si Rubin mantiene una gran ventaja entre motores y operadores, el extremo de 67x parecerá un ejemplo extremo de un cambio más amplio. Si la brecha se estrecha de forma marcada, la selección de software habrá sido el factor dominante.

La segunda señal es el rendimiento de MI455X y TPU7x en la misma carga de trabajo AgentX. Las comparaciones actuales mezclan Rubin con aceleradores de distintos ciclos de producto o metodologías de benchmarking diferentes.

La plataforma Helios de AMD es el rival más directo porque combina GPU, CPU, redes e integración a escala de rack actuales. Una prueba comparable revelará si la pila de software de NVIDIA sigue siendo su ventaja decisiva.

TPU7x ofrece una vía competitiva diferente. Google controla el acelerador, el compilador, el servicio en la nube y partes de la pila de modelos, lo que le proporciona su propia forma de codiseño.

Si cualquiera de los competidores se acerca al rendimiento por megavatio de Rubin con una interactividad útil, los compradores obtendrán mayor poder de negociación y más opciones arquitectónicas. Una amplia ventaja de Rubin reforzaría el control de NVIDIA sobre la infraestructura agéntica.

La tercera señal es la economía de producción tras considerar utilización y fiabilidad. Los compradores deberían seguir el goodput sostenido, el tiempo hasta el primer token, la latencia de extremo a extremo, el consumo eléctrico, las tasas de fallos y el coste por tarea completada.

También deberían separar la interactividad máxima del rango utilizado por clientes reales. La región de 60 a 100 tokens por segundo puede importar más comercialmente que un extremo impresionante.

DSX MaxLPS merece un escrutinio similar. Ejecutar más GPU dentro de un presupuesto energético fijo solo aporta valor cuando el sistema respeta los límites del sitio sin perjudicar la latencia ni la vida útil del equipo.

Una mejora verificada de densidad del 40 por ciento multiplicaría la ventaja de hardware de Rubin. Un resultado menor en campo reduciría la mejora proyectada de beneficio por gigavatio.

A los desarrolladores debería importarles porque la economía de infraestructura acaba dando forma al diseño de productos. Unos costes menores para servir agentes pueden permitir sesiones más largas, más recuperación de información y más subagentes en paralelo.

Los trabajadores del conocimiento percibirán el cambio indirectamente. Los agentes más rápidos y baratos pueden procesar historiales de proyectos más amplios, pero un resultado valioso sigue dependiendo de material fuente fiable.

Una base de conocimiento personal bien mantenida puede proporcionar ese contexto sin tratar una mayor cantidad de tokens generados como sustituto de mejores pruebas.

El veredicto inicial es claro, pero acotado. NVIDIA Vera Rubin NVL72 ha logrado una ventaja sustancial en inferencia agéntica, y la previsión anterior de Jensen Huang parece conservadora.

La cifra de 67x se sitúa en el extremo de la curva, no en su promedio. La mejora práctica se acerca más al doble o al triple en regiones operativas habituales, con ventajas mayores bajo objetivos de interactividad más estrictos.

Eso sigue siendo suficiente para presionar a todos los grandes proveedores de infraestructura de IA. La siguiente pregunta es si Rubin puede preservar esa economía cuando los benchmarks se conviertan en despliegues y los tokens deban transformarse en trabajo completado.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page