top of page

NVIDIA Vera Rubin NVL72 afirma desempenho por dólar 67x superior, mas o ponto operacional importa

16 de set.
18 min de leitura

A NVIDIA Vera Rubin NVL72 registrou uma vantagem alegada de 67x em desempenho por dólar sobre a GB300 NVL72 em um teste inicial de inferência agêntica. Esse número é real dentro da comparação de benchmark escolhida, mas não representa um multiplicador universal. Em velocidades de atendimento mais comuns, a vantagem medida foi muito menor.

Os resultados de 14 de setembro dão aos compradores de infraestrutura seu primeiro olhar independente sobre a Rubin em uma carga de trabalho de contexto longo e múltiplas interações. Eles também fazem a previsão de desempenho anterior do CEO da NVIDIA, Jensen Huang, parecer conservadora. Ainda assim, o maior multiplicador depende de um ponto operacional exigente em que a configuração Blackwell comparada se aproxima de seu limite de desempenho.

Portanto, a disputa central não é simplesmente Rubin contra Blackwell. É a alegação de manchete contra o desempenho que os operadores podem reproduzir em modelos, mecanismos de atendimento, metas de latência e tráfego de produção. A NVIDIA parece ter deslocado toda essa curva de desempenho, mas a distância varia significativamente ao longo dela.

NVIDIA Vera Rubin NVL72 passa de previsões para trabalho agêntico mensurado

A mudança importante é que a Rubin agora tem resultados mensurados de inferência agêntica, não apenas especificações arquiteturais ou projeções da NVIDIA.

A SemiAnalysis publicou os primeiros resultados revisados da Rubin no AgentX, seu benchmark para tráfego de agentes de programação com contexto longo. Os testes usaram sessões semelhantes às de produção, com contexto acumulado, pausas de ferramentas, reutilização de prefixos e picos de subagentes paralelos.

Esse tráfego difere de um benchmark convencional de chatbot. Uma solicitação básica de chat geralmente contém um prompt e uma resposta. Um agente pode conduzir centenas de interações enquanto chama ferramentas, consulta subagentes e envia repetidamente um histórico de conversa em expansão.

Esses padrões impõem exigências diferentes a um sistema de inferência. Históricos longos consomem capacidade de cache de chave-valor, que armazena dados de atenção calculados anteriormente. Prefixos reutilizados recompensam o cache eficiente, enquanto picos de subagentes testam agendamento e concorrência.

A metodologia do AgentX pública baseia-se em 393 sessões voluntárias de programação contendo 135.282 solicitações. Sua solicitação reconstruída mediana tem 142.016 tokens de entrada e 444 tokens de saída.

O AgentX remove prompts, código, argumentos de ferramentas e resultados de ferramentas. Ele preserva comprimentos e temporização das solicitações, relações de prefixos compartilhados e estrutura de subagentes, substituindo-os por tokens sintéticos determinísticos.

Esse desenho oferece formatos de tráfego mais realistas sem expor o conteúdo original. No entanto, o AgentX não testa se um modelo produz código correto ou conclui a tarefa de um agente com sucesso. Ele mede o sistema de atendimento, não a inteligência do modelo.

Os novos resultados usaram DeepSeek V4 Pro e uma versão inicial da pilha TensorRT-LLM. TensorRT-LLM é o runtime de inferência da NVIDIA para otimizar a execução de modelos em seus aceleradores.

Segundo a análise de benchmark da Rubin, a Vera Rubin NVL72 produziu cerca de 67 vezes mais throughput total por custo de propriedade modelado do que a GB300 NVL72 a 170 tokens por segundo.

Essa comparação usou TensorRT-LLM e NVFP4, o formato numérico de quatro bits da NVIDIA para computação de IA de menor precisão. Ela também mediu a configuração completa de hardware e software, em vez de comparar especificações teóricas de chips.

No mesmo ponto operacional, a Rubin alcançou uma vantagem marcante porque a curva TensorRT-LLM da GB300 selecionada estava próxima de seu ponto final mais rápido medido. A SemiAnalysis relatou uma vantagem da Rubin muito menor contra a GB300 executando SGLang, outro framework de atendimento.

O resultado ainda importa. A Rubin não venceu apenas porque o benchmark selecionou uma geração ultrapassada ou um servidor básico de GPU única. Ela superou o sistema em escala de rack Blackwell Ultra da NVIDIA ao atender o mesmo modelo grande e manter uma meta equivalente de velocidade de resposta.

No entanto, o número de 67x descreve um ponto em uma curva de desempenho. Isso não significa que toda implantação da Rubin gere 67 vezes mais tokens pelo mesmo custo total.

Na faixa de 60 a 100 tokens por segundo, que a SemiAnalysis descreve como mais representativa para provedores que atendem essa carga de trabalho, a Rubin entregou aproximadamente 1,4 a três vezes mais throughput por custo total.

Isso é menos dramático do que 67x, mas é comercialmente significativo. Um ganho sustentado de duas vezes pode remodelar o planejamento de capacidade quando energia, rede, refrigeração e espaço disponível no data center já limitam a expansão.

Os resultados também mostram maior interatividade máxima. A Rubin alcançou aproximadamente 276 tokens por segundo em P90, em comparação com cerca de 172 para a GB300 usando a configuração TensorRT-LLM selecionada.

A interatividade P90 mede a velocidade de streaming alcançada por 90% das respostas. Ela ajuda os operadores a determinar se um resultado de throughput também oferece uma experiência de usuário aceitável.

A vantagem da Rubin não foi idêntica entre as pilhas de software. A SemiAnalysis constatou que a GB300 executando SGLang podia alcançar interatividade semelhante à da Rubin, embora a Rubin mantivesse outras vantagens de throughput e latência.

Essa variação estabelece a principal tensão do artigo. A NVIDIA Vera Rubin NVL72 parece substancialmente mais rápida, mas sua maior vantagem relatada surge de uma combinação específica de modelo, runtime, precisão e meta de nível de serviço.

Por que a inferência agêntica transforma energia no recurso escasso

O ganho mais consequente da Rubin não é o desempenho aritmético de pico, mas a quantidade de tráfego agêntico útil que ela pode atender dentro de um envelope fixo de energia.

Um agente consome mais tokens do que uma interação simples de chat porque cada etapa pode se tornar contexto para a seguinte. Agentes de pesquisa, programação e suporte podem pesquisar bancos de dados, executar ferramentas, inspecionar resultados e delegar trabalho antes de responder.

A NVIDIA afirma que solicitações agênticas consomem cerca de 15 vezes mais tokens do que solicitações simples de chat, com base em dados da OpenRouter. Esse número variará conforme a aplicação, mas a direção subjacente é clara.

À medida que o contexto cresce, o sistema processa ou recupera repetidamente informações de interações anteriores. Vários subagentes também podem criar picos curtos e intensos de solicitações simultâneas.

Essas características transformam capacidade de memória, largura de banda de memória, latência de interconexão, gestão de cache e coordenação de CPU em restrições de primeira ordem. O desempenho bruto de tensor continua importante, mas já não explica o resultado completo do atendimento.

O acesso à eletricidade acrescenta outro limite. Um operador pode conseguir comprar aceleradores adicionais, mas não ter capacidade de rede elétrica suficiente para alimentá-los. Novas subestações, conexões de transmissão, sistemas de refrigeração e salas de data center levam mais tempo para ser construídos do que servidores.

Portanto, throughput por megawatt mede mais do que eficiência energética. Ele aproxima quanto trabalho faturável um operador pode extrair de um recurso escasso da instalação.

A 100 tokens por segundo, a SemiAnalysis mediu a Rubin em aproximadamente 59,4 milhões de tokens totais por segundo por megawatt de rede elétrica. A configuração GB300 mais forte medida alcançou 28,5 milhões na mesma meta.

Isso torna a Rubin cerca de 2,09 vezes mais rápida do que o mecanismo GB300 mais forte nesse ponto operacional prático. A GB300 executando TensorRT-LLM alcançou 21,1 milhões de tokens por segundo por megawatt.

A dimensão da vantagem mudou à medida que a exigência de velocidade aumentou. A 150 tokens por segundo, a Rubin manteve quase 37 milhões de tokens por segundo por megawatt, cerca de 7,2 vezes o resultado medido da GB300 com SGLang.

A 170 tokens por segundo, a vantagem da Rubin em throughput por megawatt foi de 62,9 vezes sobre a GB300 TensorRT-LLM. Contra a GB300 SGLang, porém, o multiplicador foi de 5,56 vezes.

Essa diferença é o motivo pelo qual toda grande alegação de desempenho precisa de seu rótulo de mecanismo. Um comprador que comparasse apenas os nomes dos aceleradores deixaria de perceber o quanto o runtime altera o resultado.

Os números anteriores da NVIDIA mostraram outra visão da mesma tendência. A empresa relatou throughput por megawatt até 30 vezes maior do que o da GB300 a 160 tokens por segundo.

A NVIDIA afirmou que esses testes usaram a carga de trabalho AgentX DeepSeek V4 Pro. Na publicação, a empresa também disse que os resultados aguardavam revisão da SemiAnalysis e não incluíam o desempenho da CPU Vera para chamadas de ferramentas.

A revisão subsequente sustenta uma vantagem substancial da Rubin, mas não um multiplicador fixo. Os dados de desempenho agêntico da NVIDIA mostram a vantagem crescendo de cerca de duas vezes a 110 tokens por segundo para 30 vezes a 160.

Essa curva importa mais do que um único gráfico de barras. Um provedor de inferência escolhe um equilíbrio entre concorrência, velocidade de resposta, tempo até o primeiro token, latência total e custo.

Uma configuração otimizada para throughput agregado máximo pode fazer cada usuário esperar tempo demais. Um sistema otimizado para interatividade extrema pode deixar capacidade cara subutilizada.

Produtos agênticos adicionam outra complicação. Execução de ferramentas, compilação de código, recuperação e chamadas de APIs externas podem deixar GPUs esperando por CPUs ou serviços remotos.

A Rubin aborda esse problema com 36 CPUs Vera ao lado de 72 GPUs Rubin em cada rack NVL72. A NVIDIA projetou essas CPUs para lidar com orquestração de agentes, chamadas de ferramentas, processamento de dados e execução em sandbox.

O argumento econômico se fortalece se esses componentes reduzirem o tempo ocioso em todo um fluxo de trabalho. Ele enfraquece se ferramentas externas, chamadas de rede ou lógica de aplicação continuarem sendo o gargalo dominante.

Para provedores de nuvem e laboratórios de modelos, a pressão é imediata. Uma grande vantagem da Rubin tornaria mais difícil justificar a expansão contínua da Blackwell para nova capacidade de inferência limitada por energia.

As implantações existentes da Blackwell não se tornarão subitamente antieconômicas. Seu hardware já está instalado, seu software é maduro e muitas cargas de trabalho não precisam da faixa mais alta de interatividade da Rubin.

A resposta forçada é mais seletiva. Os operadores precisam decidir quais cargas de trabalho merecem Rubin primeiro, quais devem permanecer na Blackwell e quais podem migrar para aceleradores concorrentes.

O codesign extremo é o mecanismo por trás do ganho da Rubin

O resultado da NVIDIA vem da coordenação entre GPU, CPU, memória, interconexão, runtime e instalação, não de um único chip mais rápido trabalhando sozinho.

A NVIDIA chama essa estratégia de codesign extremo. A Vera Rubin NVL72 integra 72 GPUs Rubin e 36 CPUs Vera por meio da NVLink de sexta geração em um único domínio em escala de rack.

A GPU Rubin inclui 288 GB de memória HBM4 com 22 TB por segundo de largura de banda de memória. A memória de alta largura de banda fica próxima ao processador e fornece dados do modelo mais rapidamente do que a memória convencional de servidor.

A NVLink oferece 3,6 TB por segundo de largura de banda para cada GPU e 260 TB por segundo em todo o rack. Essa malha permite que as 72 GPUs se comportem mais como um grande recurso computacional.

Essa arquitetura beneficia modelos mixture-of-experts. Esses modelos ativam redes especialistas selecionadas para cada token, em vez de usar todos os parâmetros em cada operação.

Atendê-los com eficiência requer roteamento rápido entre processadores. Atrasos na movimentação de ativações entre especialistas podem desperdiçar a capacidade aritmética que parece impressionante em uma ficha de especificações.

A Rubin também melhora as operações de sincronização usadas durante a inferência distribuída. Menos sobrecarga de comunicação significa que os processadores passam mais tempo computando e menos tempo aguardando coordenação.

A arquitetura de rack da NVIDIA combina Rubin com rede ConnectX-9, unidades de processamento de dados BlueField-4, switches NVLink e a plataforma Ethernet Spectrum-6.

A empresa agora descreve o sistema mais amplo como uma arquitetura de sete chips após adicionar o Groq 3 LPU. Uma LPU é um processador projetado para a execução previsível e de baixa latência de modelos de linguagem.

Rubin executa o processamento de contexto intensivo em computação, também chamado de prefill. Racks LPX construídos com processadores Groq 3 podem se concentrar na geração de tokens sensível à latência, chamada de decode.

Essa separação é conhecida como serving desagregado. Ela permite que operadores escalem recursos de prefill e decode de forma independente, em vez de forçar ambas as fases a usar hardware idêntico.

Cargas de trabalho de agentes tornam essa divisão atraente porque suas solicitações contêm históricos de entrada longos, mas podem exigir respostas interativas rápidas. O prefill precisa de capacidade de memória e computação paralela, enquanto o decode se beneficia de baixa latência.

O ajuste de taxa equilibra então a velocidade com que os dois pools trocam trabalho. Um ajuste inadequado pode deixar um grupo ocioso enquanto o outro fica sobrecarregado.

O software de serving conecta esses componentes. O TensorRT-LLM fornece kernels otimizados, enquanto o NVIDIA Dynamo coordena a inferência entre recursos distribuídos.

Os resultados do AgentX demonstram por que o software deve ser tratado como parte do produto. A diferença entre o GB300 usando TensorRT-LLM e o GB300 usando SGLang chegou a dezenas de vezes em um dos endpoints.

Isso não significa que um mecanismo seja universalmente superior. O mecanismo mais forte para o GB300 mudou ao longo da faixa de velocidade testada, com o TensorRT-LLM liderando em um alvo e o SGLang liderando em alvos mais altos.

O resultado inicial de Rubin chegou antes de sua pilha de software amadurecer completamente. Isso cria espaço para melhorias, mas também introduz incerteza na implantação.

A NVIDIA afirma que a plataforma está em produção plena e com envio programado para o segundo semestre de 2026. A alegação anterior da empresa para a plataforma era de desempenho de inferência por watt até dez vezes superior ao Blackwell.

A SemiAnalysis encontrou throughput até sete vezes maior por megawatt na região operacional, em comparação com a ilustração anterior de Huang no GTC, que mostrava um ganho de três vezes. Em alguns endpoints equivalentes, o múltiplo medido foi muito maior.

Isso sustenta a interpretação de “sandbagging”, mas apenas em sentido restrito. A apresentação de Huang cobria uma expectativa ampla para a plataforma, enquanto o novo resultado cobre uma carga de trabalho agêntica e configurações específicas.

O design de Rubin também aborda o provisionamento de energia. Data centers normalmente dimensionam seus sistemas elétricos para o consumo máximo possível de um rack, mesmo quando cargas de inferência raramente consomem esse máximo de forma contínua.

O NVIDIA DSX MaxLPS usa alocação dinâmica de energia para recuperar a margem não utilizada entre GPUs e racks. Ele tenta acomodar mais computação dentro do mesmo limite do local sem ultrapassar o envelope de energia da instalação.

A documentação do MaxLPS descreve uma implantação ilustrativa de inferência de um megawatt com 400 GPUs. Nesse exemplo, a gestão dinâmica eleva o throughput de tokens para 1,35 vez a linha de base estática de potência máxima.

A NVIDIA afirma que o planejamento combinado da instalação e o controle de energia podem suportar até 40% mais GPUs em um envelope fixo. Trata-se de uma alegação de planejamento, não de um resultado garantido para todos os locais.

Os operadores precisam validar o perfil real de consumo de sua carga de trabalho, a capacidade de resfriamento, a margem de segurança e o impacto na latência. Uma frota que frequentemente atinge o consumo de pico oferecerá menos margem recuperável.

O mecanismo é, portanto, multiplicativo. GPUs mais rápidas, memória mais ampla, conexões de menor latência, melhor agendamento, CPUs especializadas e gestão dinâmica de energia removem, cada um, diferentes gargalos.

Se essas camadas funcionarem juntas, Rubin poderá gerar mais tokens úteis a partir do mesmo prédio. Se uma camada não escalar, o ganho teórico diminui antes de chegar aos clientes.

A Alegação de 67x Diminui Fora de Seu Ponto Operacional Selecionado

O benchmark sustenta a liderança de Rubin, mas também mostra por que um número máximo de desempenho por dólar não deve se tornar uma premissa de planejamento para toda a frota.

A primeira limitação é o endpoint selecionado. A 170 tokens por segundo, a configuração comparada do GB300 com TensorRT-LLM estava próxima de seu teto medido de interatividade.

Pequenos aumentos na meta de velocidade podem reduzir drasticamente a quantidade de tráfego que um sistema atende perto desse limite. Rubin ainda tinha faixa de desempenho não utilizada, criando a proporção excepcionalmente grande.

Comparar Rubin com o GB300 SGLang na mesma meta reduziu a vantagem de throughput por megawatt de 62,9 vezes para 5,56 vezes. Isso continua sendo expressivo, mas conta uma história de compra diferente.

A segunda limitação é o modelo de custo total. A SemiAnalysis calcula o custo de propriedade usando hardware, rede, energia, financiamento, colocation, vida útil e termos presumidos de compra de hyperscalers.

Um provedor menor enfrentará condições diferentes de financiamento, utilização e infraestrutura. Um locatário de nuvem também verá uma relação distinta entre o desempenho do hardware e a capacidade contratada.

O desempenho por dólar depende de manter o equipamento ocupado. Um acelerador com excelente economia de pico pode decepcionar se a demanda chegar de forma irregular ou se o software impedir alta utilização.

A terceira limitação é o escopo da carga de trabalho. O resultado publicado de Rubin se concentra no DeepSeek V4 Pro sob o perfil de tráfego de agentes de programação do AgentX.

Um cliente que atende prompts mais curtos, geração de imagens, recuperação, vídeo, modelos densos ou trabalhos em lote offline encontrará gargalos diferentes. A própria SemiAnalysis observa que os ganhos comparativos de Rubin são menores para inferência em lote offline e treinamento.

O AgentX também usa cargas sintéticas. Ele preserva comprimentos, prefixos compartilhados, temporização e ramificações, mas não consegue reter o conteúdo semântico de sessões privadas.

A decodificação especulativa apresenta um desafio específico. Essa técnica usa um modelo de rascunho menor ou mais rápido para sugerir vários tokens futuros e depois pede ao modelo principal que os aceite ou rejeite.

Texto sintético pode produzir um comportamento de aceitação irrealista. O AgentX aborda isso usando comprimentos de aceitação medidos em um conjunto de dados de programação separado e registrando essas configurações.

Esse controle melhora a comparabilidade, mas continua sendo uma aproximação. O benchmark não consegue reproduzir modelos proprietários de provedores, raciocínio oculto, ferramentas no lado do servidor, imagens ou todas as transformações de tokenizador.

A execução em circuito fechado introduz outra nuance. Sistemas mais rápidos avançam mais nas sessões amostradas durante a janela de teste, portanto podem encontrar uma mistura de solicitações um pouco diferente.

Nenhuma dessas questões invalida o resultado. Elas definem o que o resultado mede e onde os compradores devem exigir evidências adicionais.

A quarta limitação é o software inicial. A SemiAnalysis usou uma versão pré-lançamento do TensorRT-LLM, e versões posteriores devem melhorar a eficiência de Rubin.

O software inicial também pode conter regressões, recursos incompletos e comportamento operacional que não aparece em um benchmark controlado. As pilhas maduras do Blackwell tiveram mais tempo para incorporar correções de produção.

A confiabilidade importa na escala de rack. Um rack NVL72 completo contém 1,3 milhão de componentes e quase 1.300 chips, segundo a NVIDIA.

Um operador de data center precisa de goodput sustentado, ou seja, saída útil após considerar falhas, manutenção, novas tentativas e hardware indisponível. O throughput de pico em benchmark não mede todo esse histórico operacional.

A quinta limitação é a resposta competitiva. A AMD lançou seu acelerador Instinct MI455X em julho de 2026 para a plataforma Helios em escala de rack.

As especificações oficiais do MI455X listam 40,3 petaflops de desempenho MXFP4 de pico e uma arquitetura CDNA5. Valores de pico aritmético não podem ser comparados diretamente aos resultados do AgentX.

A SemiAnalysis incluiu o MI355X anterior em suas novas medições. A 100 tokens por segundo, a configuração MI355X mais forte testada atingiu cerca de 2,01 milhões de tokens por segundo por megawatt.

Rubin atingiu 59,4 milhões nesse ponto, produzindo uma liderança reportada de 29,5 vezes. A AMD se comprometeu a colaborar em futuros testes do AgentX com o MI455X, segundo a SemiAnalysis.

Essa comparação futura será muito mais relevante do que Rubin contra MI355X. Ela testará duas plataformas atuais em escala de rack na mesma carga de trabalho, modelo, perfil de tráfego e meta de nível de serviço.

O TPU7x Ironwood do Google também mira grandes modelos densos e de mixture-of-experts. Sua disponibilidade pelo Google Cloud oferece aos clientes outra rota que combina silício personalizado com uma plataforma de software verticalmente integrada.

A NVIDIA mantém uma vantagem na profundidade de seu ecossistema. CUDA, TensorRT-LLM, Dynamo, NVLink e sua rede de parceiros dão à empresa controle sobre uma parcela maior do caminho de implantação.

Esse controle pode melhorar a otimização, mas também pode aprofundar a dependência dos clientes de um único fornecedor. A coengenharia extrema funciona melhor quando os compradores aceitam toda a pilha.

A interpretação crível não é que Rubin seja 67 vezes melhor em todos os lugares. É que Rubin amplia a fronteira utilizável da inferência, especialmente para grandes cargas de trabalho agênticas com requisitos rigorosos de interatividade.

Mais Tokens por Gigawatt Não Significam Automaticamente Mais Lucro

Rubin pode melhorar a economia dos data centers, mas o lucro depende de utilização, demanda, confiabilidade e preços de venda que o benchmark não consegue estabelecer.

A SemiAnalysis estima que Rubin pode gerar mais do que o dobro do lucro anual por gigawatt em comparação com Blackwell. A empresa espera que essa diferença aumente à medida que os kernels e o software de serving amadureçam.

Essa estimativa segue um mecanismo razoável. Se um megawatt produz mais tokens faturáveis, a capacidade de receita aumenta enquanto a alocação de rede elétrica da instalação permanece fixa.

O menor custo unitário também pode ampliar margens ou permitir tarifas menores para os clientes. Os provedores podem escolher entre reter o ganho de eficiência e usá-lo para conquistar mais demanda.

No entanto, throughput representa capacidade, não vendas. Um provedor só ganha mais quando os clientes consomem essa capacidade adicional a taxas sustentáveis.

O perfil de demanda deve corresponder ao hardware. As vantagens mais fortes de Rubin aparecem em cargas de trabalho de agentes interativos e com contexto longo, não em todas as formas de computação de IA.

Isso cria um problema de alocação. Os provedores precisam de tráfego agêntico suficiente para manter os novos racks ocupados sem desviar cargas de trabalho que operam de forma mais econômica em outro lugar.

A eficiência dos modelos também pode reduzir a demanda de infraestrutura por tarefa. Arquiteturas melhores, rastros de raciocínio mais curtos, cache aprimorado e modelos especializados menores podem reduzir o consumo de tokens.

O efeito oposto é igualmente plausível. Tokens mais baratos podem incentivar desenvolvedores a construir agentes de execução mais longa, usar mais subagentes e automatizar tarefas antes antieconômicas.

Esse é o conhecido efeito rebote da computação. A eficiência reduz o custo de uma operação, e então o software se expande para consumir a nova capacidade.

A NVIDIA está apostando fortemente nesse resultado. Seu enquadramento trata data centers como fábricas de IA cuja produção são tokens, em vez de serviços convencionais de computação.

A metáfora tem limites. Tokens variam muito em valor. Um token que contribui para uma tarefa de programação concluída vale mais do que um gerado durante um ciclo de raciocínio fracassado.

Os benchmarks de agentes ainda têm dificuldade para conectar eficiência de infraestrutura ao trabalho concluído. O AgentX deliberadamente mantém o comportamento do modelo fora de seu escopo e não avalia a qualidade da saída.

Um teste econômico completo mediria o custo por tarefa bem-sucedida, não apenas o custo por milhão de tokens. Ele incluiria a precisão do modelo, novas tentativas, falhas de ferramentas e o esforço humano necessário para revisar os resultados.

A latência também afeta a receita indiretamente. Um agente mais rápido pode concluir mais tarefas e manter os usuários engajados, mas apenas se a aplicação e as ferramentas externas responderem em velocidade comparável.

Os resultados de latência de ponta a ponta relatados para Rubin são encorajadores. Em um ponto comparável de eficiência de utilização, a SemiAnalysis mediu aproximadamente 20 segundos para Rubin e 60 segundos para B200 ou B300.

Em um ponto de maior throughput por custo, a empresa relatou cerca de 20 segundos para Rubin e 120 segundos para os sistemas Blackwell comparados.

Essas medições reforçam o argumento a favor de Rubin porque combinam maior throughput com tempos de conclusão menores. Ainda assim, permanecem resultados de benchmark específicos de cada configuração.

O lucro também depende da velocidade de implantação. Um rack atrasado não produz tokens, independentemente de sua eficiência projetada.

A NVIDIA projetou Rubin em torno do formato de rack MGX de terceira geração para facilitar a instalação e a manutenção. A bandeja de computação utiliza um design interno sem cabos, sem mangueiras e sem ventoinhas.

A empresa afirma que o tempo de montagem e manutenção da bandeja caiu de quase duas horas para cinco minutos. A experiência em campo deverá mostrar se essas mudanças de design melhoram a disponibilidade da frota.

O resfriamento e a densidade de potência continuam sendo considerações sérias para as instalações. Rubin concentra uma demanda elétrica substancial em um único rack, exigindo resfriamento líquido e distribuição de energia compatíveis.

Operadores com instalações mais antigas não podem obter esse ganho apenas trocando servidores. Eles podem precisar de novos equipamentos elétricos, distribuição de refrigerante, rede e procedimentos operacionais.

Isso torna Rubin mais atraente para hyperscalers, laboratórios de modelos e provedores especializados de nuvem que já estão construindo novos campi de IA. Compradores menores podem acessá-lo de forma mais eficiente por meio de serviços de nuvem.

“Quanto mais você compra, mais você ganha” funciona como um resumo memorável do argumento de vendas da NVIDIA. Não é uma lei econômica.

A versão mais precisa é condicional. Quanto mais capacidade eficiente um operador implanta, ocupa, energiza e mantém disponível, mais receita esse site fixo pode sustentar.

O que os compradores devem observar após o resultado do NVIDIA Vera Rubin NVL72

Três sinais determinarão se a liderança inicial de Rubin em benchmarks se torna uma vantagem duradoura em produção.

O primeiro sinal são dados AgentX reproduzíveis de forma independente em diferentes motores de serving. Rubin precisa de resultados públicos do TensorRT-LLM, SGLang e vLLM usando modelos idênticos e metas de nível de serviço idênticas.

Essa comparação mostrará quanto da liderança atual vem do hardware Rubin e quanto vem de uma combinação de software excepcionalmente favorável.

Os resultados históricos devem permanecer visíveis à medida que os runtimes melhoram. Caso contrário, os compradores não poderão distinguir ganhos genuínos de hardware de mudanças de software que também beneficiam sistemas mais antigos.

A reprodução por provedores de nuvem fortaleceria ainda mais o caso. Suas implantações incluem restrições de agendamento, rede, monitoramento, multitenancy e confiabilidade ausentes em ambientes de teste controlados.

Se Rubin mantiver uma grande vantagem entre motores e operadores, o ponto extremo de 67x parecerá um exemplo extremo de uma mudança mais ampla. Se a diferença diminuir acentuadamente, a seleção de software terá sido o fator dominante.

O segundo sinal é o desempenho de MI455X e TPU7x na mesma carga de trabalho AgentX. As comparações atuais misturam Rubin com aceleradores de diferentes ciclos de produto ou metodologias de benchmark distintas.

A plataforma Helios da AMD é a desafiante mais direta porque combina GPUs, CPUs, rede e integração em escala de rack atuais. Um teste equivalente revelará se a pilha de software da NVIDIA continua sendo sua vantagem decisiva.

TPU7x oferece uma rota competitiva diferente. O Google controla o acelerador, o compilador, o serviço de nuvem e partes da pilha de modelos, o que lhe dá sua própria forma de codesign.

Se qualquer um dos concorrentes se aproximar do desempenho de Rubin por megawatt com interatividade útil, os compradores ganharão poder de negociação e mais opções arquiteturais. Uma ampla liderança de Rubin reforçaria o controle da NVIDIA sobre a infraestrutura agêntica.

O terceiro sinal é a economia de produção após considerar utilização e confiabilidade. Os compradores devem acompanhar goodput sustentado, tempo até o primeiro token, latência de ponta a ponta, consumo de energia, taxas de falha e custo por tarefa concluída.

Eles também devem separar a interatividade de pico da faixa usada por clientes reais. A região de 60 a 100 tokens por segundo pode importar mais comercialmente do que um ponto extremo impressionante.

O DSX MaxLPS merece um escrutínio semelhante. Executar mais GPUs dentro de um envelope de energia fixo só é valioso quando o sistema respeita os limites do site sem prejudicar a latência ou a vida útil do equipamento.

Um ganho de densidade verificado de 40% multiplicaria a vantagem de hardware de Rubin. Um resultado menor em campo reduziria a melhoria projetada de lucro por gigawatt.

Os desenvolvedores devem se importar porque a economia da infraestrutura eventualmente molda o design de produtos. Custos menores para servir agentes podem sustentar sessões mais longas, mais recuperação de informações e mais subagentes paralelos.

Os trabalhadores do conhecimento sentirão a mudança indiretamente. Agentes mais rápidos e baratos podem processar históricos maiores de projetos, mas resultados valiosos ainda dependem de material de origem confiável.

Uma base de conhecimento pessoal bem mantida pode fornecer esse contexto sem tratar mais tokens gerados como substituto para evidências melhores.

O veredito inicial é claro, mas limitado. O NVIDIA Vera Rubin NVL72 apresentou uma liderança substancial em inferência agêntica, e a previsão anterior de Jensen Huang parece conservadora.

O número de 67x está na borda da curva, não em sua média. O ganho prático fica mais próximo de duas ou três vezes nas regiões operacionais comuns, com vantagens maiores sob metas de interatividade mais rigorosas.

Isso ainda é suficiente para pressionar todos os principais provedores de infraestrutura de IA. A próxima questão é se Rubin pode preservar essa economia depois que os benchmarks se tornarem implantações e os tokens precisarem se transformar em trabalho concluído.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page