top of page

AMD Helios Une 72 GPUs, mas Nvidia Define o Teste

12 de ago.
17 min de leitura

A AMD lançou o Helios como um único sistema com 72 GPUs, e não como uma coleção dispersa de servidores aceleradores conectados dentro de um gabinete. A análise de arquitetura da AMD ServeTheHome é relevante porque a empresa agora controla quase todas as principais camadas de seu rack de IA.

O Helios combina aceleradores Instinct MI455X, processadores EPYC Venice, redes Pensando, software ROCm e infraestrutura de alimentação com refrigeração líquida. A Broadcom fornece o silício comercial de comutação Ethernet que conecta as GPUs por meio de uma única malha scale-up.

Essa combinação cria o verdadeiro conflito. A AMD deixou de desafiar a Nvidia apenas com uma placa aceleradora. Agora, desafia o modelo de rack em escala da Nvidia ao mesmo tempo que rejeita a abordagem fechada de rede que tornou os sistemas da Nvidia difíceis de reproduzir.

O Helios parece convincente no papel. No entanto, especificações de pico não comprovam desempenho de aplicação entregue, maturidade de software, volume de fornecimento ou economia operacional. Essas questões ainda em aberto determinarão se a abertura se tornará uma vantagem de compra ou apenas uma preferência arquitetural.

O Que a Cobertura da AMD ServeTheHome Revela Sobre o Helios

O Helios muda a unidade de competição da AMD de uma GPU para um rack de IA integrado.

O sistema contém 72 aceleradores Instinct MI455X distribuídos em 18 bandejas de computação com refrigeração líquida. Cada bandeja comporta quatro GPUs e um soquete para um processador EPYC 9006 de sexta geração, de codinome Venice.

A AMD atribui 432 GB de memória HBM4 a cada MI455X. Em todo o rack, isso produz cerca de 31 TB de memória de alta largura de banda disponível dentro do domínio scale-up.

A memória de alta largura de banda, ou HBM, fica próxima à GPU e fornece dados em taxas muito maiores que a memória convencional de servidores. Essa capacidade é importante para modelos grandes, contextos longos, caches de inferência e cargas de trabalho que, de outra forma, exigiriam maior particionamento.

A AMD lista até 23,3 TB/s de largura de banda de memória para cada MI455X em sua documentação sobre a arquitetura CDNA 5. O rack agrega esses dispositivos em um sistema de memória com mais de um petabyte por segundo de largura de banda teórica.

O layout físico é tão importante quanto a contagem de aceleradores. O Helios usa uma estrutura Open Rack Wide do Open Compute Project, mais larga que um rack convencional. O design oferece espaço para bandejas de computação densas, cabeamento, equipamentos de energia e hardware de refrigeração líquida.

O rack inclui seis bandejas de switches scale-up. Cada bandeja contém dois chips de switch Broadcom Tomahawk 6, dando ao Helios 12 chips de switch em todo o sistema.

Cada dispositivo Tomahawk 6 oferece 102,4 Tbps de capacidade de comutação. Suas linhas Ethernet formam a malha interna que permite a cada acelerador se comunicar com todos os demais por meio de um único salto de switch.

Essa malha transporta UALink sobre Ethernet, frequentemente abreviado como UALoE. O UALink define uma conexão scale-up para aceleradores, enquanto a Ethernet fornece o transporte subjacente e o hardware comercial de comutação.

A AMD afirma que cada MI455X recebe 3,6 TB/s de largura de banda scale-up bidirecional. Em 72 dispositivos, o valor agregado chega a cerca de 260 TB/s.

Esse é o mecanismo por trás da afirmação da AMD de que o Helios se comporta como um único sistema de 72 GPUs. Clusters tradicionais frequentemente dividem a propriedade da memória entre servidores separados e, depois, transferem dados por múltiplos estágios de rede.

O Helios reduz essas fronteiras dentro do rack. Ele ainda contém processadores e dispositivos de memória distintos, mas sua malha de salto único oferece ao software um domínio de aceleradores mais estreitamente conectado.

As especificações do MI455X da AMD também mostram quanto da rede foi transferido para o pacote da GPU. Cada módulo acelerador inclui dois dies de E/S aprimorados e 36 links UALoE bidirecionais.

Essa mudança transforma a rede em parte da arquitetura do acelerador. Ela deixou de ser um acessório escolhido após o projeto da plataforma de computação.

O Helios também usa hardware Pensando para a comunicação além do domínio scale-up. Cada GPU pode se conectar a três placas de interface de rede Vulcano de 800 Gbps, fornecendo até 2,4 Tbps de largura de banda scale-out por acelerador.

A rede scale-out conecta vários racks em uma implantação maior. Uma unidade de processamento de dados Pensando Salina gerencia o tráfego de front-end, incluindo gerenciamento, acesso ao armazenamento e solicitações de aplicações.

Assim, o rack contém duas camadas de rede distintas. O silício da Broadcom une os aceleradores dentro do Helios, enquanto dispositivos AMD Pensando conectam o Helios ao armazenamento, aos serviços e a outros racks.

A entrega de energia completa o sistema. Um barramento traseiro de corrente contínua de 50 volts alimenta o rack, e a refrigeração líquida remove o calor de seus componentes densos.

Reportagens do evento Advancing AI da AMD situaram a carga do rack entre 225 kW e 245 kW. Essa exigência torna o Helios inadequado para salas de dados sem suporte a energia de alta densidade e refrigeração líquida.

O rack também pode pesar cerca de 5.000 libras, de acordo com detalhes publicados da plataforma. Os compradores precisam tratar a implantação como um projeto de infraestrutura, e não como uma atualização rotineira de servidores.

Portanto, o foco arquitetural da ServeTheHome é justificado. O produto central é a própria integração, incluindo computação, memória, rede, energia, refrigeração, mecânica e software.

Por Que a AMD Precisou Construir Agora o Rack Inteiro

A Nvidia forçou todos os fornecedores sérios de aceleradores a competir em escala de sistema.

Cargas de trabalho modernas de IA passam uma parcela substancial do tempo movendo dados entre aceleradores. Aritmética mais rápida só ajuda quando modelos, ativações e resultados intermediários conseguem chegar aos mecanismos de computação sem criar longas interrupções.

Essa realidade favorece sistemas projetados como unidades coordenadas. A Nvidia estabeleceu esse modelo com suas plataformas NVL72, que combinam 72 GPUs, CPUs, comutação NVLink, rede, refrigeração e software.

Anteriormente, a AMD vendia aceleradores competitivos que fornecedores de sistemas montavam em servidores e clusters. Esse modelo dava opções aos clientes, mas deixava mais trabalho de integração fora do controle direto da AMD.

A empresa podia aprimorar uma GPU e ainda assim perder no nível do sistema. A topologia de rede, a comunicação coletiva, os limites de refrigeração, o ajuste de software e o design do servidor podiam eliminar uma vantagem medida no acelerador.

O Helios resolve essa fragilidade ao fornecer uma arquitetura de referência completa. A AMD especifica a bandeja de computação, a topologia scale-up, a rede scale-out, o formato do rack, a entrega de energia, a abordagem de refrigeração e o software associado.

O momento também reflete a chegada da CDNA 5, a mais recente arquitetura dedicada de computação para data centers da AMD. A MI455X usa oito chiplets de computação fabricados em processo de 2 nm e os posiciona sobre dois dies de malha e cache de 3 nm.

Dois dies adicionais de E/S gerenciam a comunicação externa. Doze pilhas HBM4 circundam a lógica, enquanto o empacotamento avançado conecta os componentes em um único módulo acelerador.

Esse design de chiplets permite à AMD otimizar diferentes funções com processos de fabricação distintos. Densidade de computação, interfaces de memória, cache e rede não precisam ter as mesmas características de silício.

A MI455X contém 320 bilhões de transistores e 256 processadores de grupos de trabalho. Um processador de grupo de trabalho organiza recursos de execução que processam grupos de operações de IA e computação científica.

A AMD mira cálculos de IA de baixa precisão com formatos como MXFP4, MXFP6, MXFP8 e FP8. Esses formatos representam valores de modelos com menos bits, aumentando o throughput quando uma aplicação consegue preservar precisão aceitável.

O acelerador atinge um pico listado de 40,3 petaflops para operações MXFP4. Em todo o rack, a AMD anuncia até 2,9 exaflops de desempenho máximo em FP4 e 1,4 exaflops em FP8.

Esses números são picos teóricos, não resultados medidos para um modelo completo. Ainda assim, explicam por que a integração do rack chegou junto com a MI455X.

Um único acelerador agora move dados suficientes e consome energia suficiente para que o sistema ao seu redor determine se as aplicações conseguem usar a aritmética disponível. A AMD precisava do Helios para expor as capacidades da CDNA 5 em escala significativa.

A empresa também adquiriu a ZT Systems em 2025, obtendo experiência de engenharia em design de racks hiperescaláveis. Posteriormente, a AMD separou o negócio de fabricação, limitando a competição direta com parceiros de servidores já estabelecidos.

Essa transação deu à AMD conhecimento mais profundo de sistemas sem exigir que ela se tornasse a única fornecedora do Helios. HPE, Supermicro, provedores de nuvem e outros parceiros podem construir produtos a partir do design de referência.

A Microsoft anunciou planos para implantar o Helios em seus data centers. A HPE já havia se comprometido a adotar a arquitetura, abrindo caminhos para a AMD tanto na infraestrutura hiperescalável quanto na empresarial.

A AMD afirmou na CES que o Helios serviria como um modelo para sistemas de IA muito maiores. Sua prévia em escala de rack associou o design ao treinamento, à inferência e a futuras implantações com múltiplos racks.

Portanto, a pressão vai além da Nvidia. Fabricantes de servidores precisam decidir quanto da engenharia da AMD adotar, enquanto provedores de nuvem precisam decidir se uma plataforma de referência aberta reduz o risco de integração.

Fornecedores de chips também enfrentam um novo padrão de compra. Os clientes avaliam cada vez mais os aceleradores como partes de sistemas completos, e não como placas intercambiáveis com pontuações de benchmark isoladas.

A Ethernet Aberta É o Principal Desafio da AMD à Nvidia

A disputa principal é o rack Ethernet aberto da AMD contra a plataforma NVLink verticalmente controlada da Nvidia.

O Helios se assemelha à Vera Rubin NVL72 da Nvidia em vários aspectos importantes. Ambos distribuem 72 aceleradores em 18 bandejas de computação com refrigeração líquida e usam bandejas de switch dedicadas para comunicação de alta largura de banda.

A diferença está no controle da rede scale-up. A Nvidia integra NVLink e a comutação NVLink à sua plataforma, dando à empresa autoridade direta sobre o protocolo, o silício, a topologia e a integração de software.

A AMD usa um link aberto para aceleradores transportado por Ethernet. A Broadcom fornece o silício de switch Tomahawk 6, enquanto o UALink define como os aceleradores se comunicam por essa malha.

Essa escolha permite à AMD usar tecnologia comercial de rede, em vez de uma arquitetura de switch proprietária. Fornecedores de sistemas e hiperescaladores podem trabalhar com ferramentas, fornecedores e práticas operacionais Ethernet já conhecidas.

A abertura não significa que todos os componentes possam ser trocados sem trabalho de engenharia. Redes scale-up têm exigências rigorosas de latência, congestionamento, confiabilidade, sincronização e software.

No entanto, interfaces publicadas oferecem aos parceiros mais espaço para personalizar o rack. Um provedor de nuvem pode ajustar as escolhas de rede, gerenciamento ou implantação sem depender de um único fornecedor para cada camada.

O papel da Broadcom torna essa afirmação mais concreta. O Tomahawk 6 fornece 512 linhas a 200 Gbps, com capacidade suficiente para atender às 72 GPUs na taxa scale-up declarada pela AMD.

O relatório de arquitetura do Helios mostra por que essa parceria importa. O portfólio de hardware da AMD é amplo, mas ela não precisa fabricar cada componente para controlar o design do sistema.

Isso cria uma alternativa baseada em coalizão à Nvidia. A AMD contribui com as GPUs, CPUs, dispositivos de rede Pensando, software e engenharia de plataforma. A Broadcom contribui com o silício central de comutação scale-up.

A HPE e outros fabricantes podem então transformar esse modelo em sistemas. Operadores de nuvem podem implantar esses sistemas mantendo maior influência sobre as escolhas de rede e software.

A Nvidia oferece a proposta oposta. Sua integração mais estreita reduz o número de variáveis externas e oferece aos clientes uma plataforma otimizada por um único fornecedor.

Esse controle pode simplificar o ajuste de desempenho. A Nvidia pode coordenar o comportamento das GPUs, os chips de switching, bibliotecas de comunicação, drivers, rede e frameworks de aplicações por meio de um único roteiro.

A AMD aposta que padrões abertos podem alcançar eficiência comparável sem exigir que uma empresa controle todos os elos. Essa proposta precisa se sustentar em cargas de trabalho reais, não apenas em diagramas de topologia.

Os dois sistemas também diferem fora do rack. O Helios atribui três interfaces Vulcano de 800 Gbps a cada acelerador, alcançando 2,4 Tbps de largura de banda scale-out por GPU.

As configurações Vera Rubin publicadas associam cada GPU a uma interface ConnectX-9 de 1,6 Tbps. A AMD, portanto, afirma oferecer 50% mais largura de banda scale-out por acelerador.

Essa comparação favorece cargas de trabalho distribuídas por vários racks, desde que o software consiga usar os links de forma eficiente. Grandes trabalhos de treinamento e serviços de inferência distribuída dependem dessa camada quando um único rack não comporta toda a carga de trabalho.

A AMD também afirma oferecer maior capacidade e largura de banda de memória. O Helios disponibiliza 31 TB de HBM4 em todo o rack, e a AMD diz que isso representa 50% mais capacidade do que a plataforma concorrente da Nvidia.

A capacidade de memória pode reduzir a particionamento de modelos e deixar mais espaço para caches de chave-valor. Um cache de chave-valor armazena dados de atenção para que um sistema de inferência possa gerar tokens posteriores sem recalcular o contexto anterior.

Essa vantagem é particularmente relevante para inferência com contexto longo e modelos que atendem muitas solicitações simultâneas. Ainda assim, a capacidade por si só não determina latência nem throughput.

Agendamento de software, qualidade dos kernels, eficiência de comunicação e o perfil da carga de trabalho ainda determinam quanto desempenho útil chega aos clientes. O ambiente CUDA da Nvidia continua sendo a referência consolidada para muitas equipes de IA.

O ROCm melhorou ao longo das gerações recentes de Instinct, e os principais frameworks agora oferecem suporte ao hardware da AMD. O Helios, porém, coloca sobre a AMD uma responsabilidade maior de fazer 72 aceleradores operarem de modo previsível como uma única plataforma.

A disputa entre aberto e controlado, portanto, não é filosófica. É uma questão mensurável sobre se uma arquitetura baseada em parceiros pode igualar o desempenho entregue e a confiabilidade de uma plataforma integrada.

As Especificações Não Resolvem o Desempenho

Os números mais fortes da AMD continuam sendo alegações do fornecedor até que testes independentes em nível de rack os confirmem.

A AMD afirma que o Helios oferece 15% mais desempenho FP4 de pico por acelerador do que o principal sistema concorrente. A empresa também projeta uma economia de tokens até 30% melhor.

Essas alegações exigem enquadramento cuidadoso. A aritmética FP4 de pico descreve a operação de baixa precisão compatível mais rápida em condições ideais, não a velocidade sustentada de um modelo implantado.

Uma comparação de tokens por dólar exige ainda mais premissas. Utilização do hardware, eletricidade, refrigeração, licenciamento de software, equipe, precisão do modelo, tamanho do lote e disponibilidade do sistema afetam o resultado.

A AMD não divulgou preços públicos em um formato que permita uma comparação neutra de custo de propriedade. Os compradores também negociarão acordos de hardware, suporte, rede e implantação em escalas diferentes.

Os números em nível de rack complicam a narrativa de desempenho. A AMD lista 2,9 exaflops de desempenho FP4 de pico para o Helios, enquanto a Nvidia publicou um número maior de 3,6 exaflops por rack para o Vera Rubin NVL72.

As definições por trás desses números podem ser diferentes. O resultado da Nvidia pode incorporar um comportamento de compressão adequado a algumas tarefas de inferência, enquanto a AMD enfatiza taxas brutas de precisão compatível.

A comparação de racks do The Register observou essa distinção. Algumas cargas de trabalho podem se beneficiar da compressão adaptativa da Nvidia, enquanto outras exigem cálculos que se alinhem mais estreitamente ao número não comprimido da AMD.

Nenhuma das comparações representa um vencedor universal. Treinamento, ajuste fino, inferência densa, modelos mixture-of-experts e atendimento de contexto longo exigem o hardware de maneiras diferentes.

Um modelo mixture-of-experts ativa apenas grupos selecionados de parâmetros para cada token. Ele pode reduzir a computação, mas também cria padrões exigentes de comunicação entre GPUs.

O Helios pode ter bom desempenho quando a capacidade de memória ou a largura de banda scale-out limita uma aplicação. A Nvidia pode manter uma vantagem quando sua pilha de software extrai mais trabalho de recursos nominais menores.

A mesma cautela se aplica à linguagem da AMD sobre memória de salto único. O Helios fornece um domínio HBM fortemente conectado, mas não transforma 72 pools físicos de memória em um único dispositivo convencional de memória uniforme.

O software ainda precisa entender o posicionamento dos dados, a propriedade dos aceleradores, a sincronização e os custos de comunicação. Um acesso remoto à HBM por meio de um switch não se comporta como um acesso local dentro de um pacote de GPU.

A latência também importa, além da largura de banda. A AMD publica throughput agregado impressionante, mas resultados detalhados de aplicações mostrarão como a malha se comporta sob contenção e tráfego irregular.

A confiabilidade cria outro desafio. Um rack com 72 GPUs combina aceleradores, processadores, switches, interfaces de rede, conexões de refrigeração, componentes de energia, cabos e software em um único domínio operacional.

As falhas se tornam mais caras quando as cargas de trabalho tratam o rack como um único sistema. Operadores precisam de isolamento de falhas, telemetria, checkpointing, facilidade de manutenção e procedimentos previsíveis de recuperação.

O rack de largura dupla também apresenta restrições de infraestrutura. Sua faixa de potência de 225 kW a 245 kW excede a capacidade de muitos data halls empresariais existentes.

A refrigeração líquida é obrigatória nessa densidade. Os compradores precisam de distribuição adequada de fluido refrigerante, conversão de energia, capacidade de carga do piso, acesso para manutenção e equipes de operações treinadas.

Esses requisitos não enfraquecem o Helios em relação a todos os concorrentes. Os sistemas em escala de rack da Nvidia criam demandas de infraestrutura semelhantes.

No entanto, eles limitam o mercado endereçável. Inicialmente, o Helios se encaixa em data centers de hiperescala, instalações especializadas em IA, laboratórios nacionais e locais projetados para equipamentos densos com refrigeração líquida.

O software continua sendo a maior variável incerta. O ROCm precisa oferecer suporte à topologia do rack ao mesmo tempo em que iguala a usabilidade e o desempenho que os desenvolvedores esperam de implantações maduras da Nvidia.

Os clientes precisarão de comunicação coletiva estável, kernels otimizados, integração com frameworks, observabilidade, orquestração e suporte rápido para novas arquiteturas de modelos.

A AMD controla mais desse caminho do que antes. Possuir o processador, o acelerador, as interfaces de rede e o sistema de referência dá a seus engenheiros mais oportunidades para eliminar problemas entre fornecedores.

Ainda assim, controle não cria maturidade instantaneamente. As primeiras implantações de produção revelarão problemas que benchmarks de apresentação e projetos de referência não conseguem antecipar.

O Helios Pressiona os Compradores Tanto Quanto a Nvidia

O Helios oferece aos compradores de infraestrutura um segundo caminho em escala de rack, mas também torna seu trabalho de avaliação mais exigente.

Uma alternativa crível pode melhorar o poder de negociação. Os hyperscalers não precisam mais comparar um rack integrado da Nvidia com um conjunto de servidores AMD montados de forma independente.

Eles podem comparar duas arquiteturas de rack com 72 GPUs e ambições físicas semelhantes. Ambas chegam como plataformas coordenadas para treinamento e inferência em escala de data center.

Isso torna as comparações de aquisição mais significativas. Os compradores podem examinar memória por rack, largura de banda scale-up, largura de banda scale-out, energia, refrigeração, prontidão do software, facilidade de manutenção e resultados das cargas de trabalho.

A análise aprofundada da AMD pelo ServeTheHome também destaca a importância da escolha na cadeia de suprimentos. O switching da Broadcom e um padrão de rack aberto criam mais espaço para os fabricantes diferenciarem suas implementações.

A HPE pode combinar o Helios com sua própria engenharia de sistemas e experiência em redes Juniper. A Supermicro pode mirar clientes que já operam suas plataformas com refrigeração líquida.

Provedores de nuvem podem disponibilizar capacidade MI455X por meio de serviços gerenciados, reduzindo a necessidade de clientes menores instalarem os racks físicos por conta própria.

A AMD ganha alcance com esse modelo, mas também depende de parceiros para executar de forma consistente. Uma integração ruim por parte de um fabricante pode prejudicar a percepção da plataforma mais ampla.

O projeto controlado da Nvidia limita essa variação. Os clientes recebem menos escolhas arquiteturais, mas também se beneficiam de um alvo mais uniforme para ajuste de aplicações e suporte.

Por isso, compradores empresariais devem evitar tratar a abertura como uma redução automática de custos. A personalização só cria valor quando a organização tem capacidade de engenharia para utilizá-la.

Uma empresa que executa modelos padrão por meio de um serviço de nuvem gerenciado pode se importar mais com tokens entregues e disponibilidade do que com o fornecedor do switch subjacente.

Um hyperscaler que desenvolve software personalizado de rede e agendamento pode atribuir muito mais valor a interfaces publicadas e chips de mercado.

Pesquisadores que trabalham com modelos que excedem a memória de um servidor podem se beneficiar do domínio HBM de 31 TB do Helios. A mesma capacidade pode suportar caches de inferência maiores e mais solicitações simultâneas.

Os desenvolvedores devem se importar porque a diversidade de hardware afeta a portabilidade de software. Uma segunda arquitetura de rack viável dá aos projetos de frameworks e fornecedores de modelos motivos mais fortes para otimizar além do CUDA.

Esse processo não acontecerá automaticamente. As equipes de aplicações precisam validar kernels, comportamento numérico, bibliotecas de comunicação, imagens de contêiner, ferramentas de monitoramento e fluxos de trabalho de implantação.

O setor mais amplo também se beneficia de uma disputa entre padrões. UALink e Ultra Ethernet agora têm um sistema de alto perfil no qual seu desempenho pode ser medido sob cargas de trabalho exigentes de IA.

O sucesso incentivaria mais fornecedores de switches, projetistas de aceleradores e fabricantes de sistemas a participar. Resultados fracos fortaleceriam o argumento a favor da integração proprietária.

A AMD também está pressionando a si própria. Lançamentos anuais de aceleradores exigem que o projeto do rack, a rede, o software e a cadeia de fabricação avancem no mesmo cronograma.

Um componente atrasado pode atrasar todo o sistema. A plataforma só está pronta quando aceleradores, CPUs, switches, interfaces de rede, refrigeração, firmware, drivers e frameworks funcionam juntos.

A empresa afirma que o Helios entrou em produção, com envios esperados até o fim do terceiro trimestre de 2026. Esse cronograma o coloca perto do lançamento do Vera Rubin da Nvidia, em vez de uma geração inteira atrás.

O timing reduz a desvantagem tradicional da AMD. Ele também elimina desculpas caso o software ou o fornecimento não atendam às expectativas dos clientes.

O anúncio de produção relatou implantações planejadas por grandes parceiros. O próximo teste é saber se esses compromissos se tornarão capacidade de produção acessível.

Um rack instalado para avaliação não é o mesmo que uma frota atendendo cargas de trabalho que geram receita. Os compradores devem solicitar resultados reproduzíveis ao longo de semanas, e não demonstrações curtas em condições controladas.

Três Sinais Decidirão se o Helios Funciona

Volume de envios, resultados independentes de cargas de trabalho e confiabilidade em múltiplos racks decidirão se o Helios muda o mercado.

O primeiro sinal é a entrega em produção. A AMD espera envios do Helios até o fim do terceiro trimestre, portanto os clientes devem observar quais sistemas chegam antes do fechamento de setembro.

Instalações nomeadas importam, mas as quantidades importam mais. Múltiplas frotas em operação mostrariam que a AMD e seus parceiros conseguem obter HBM4, encapsular dispositivos MI455X, montar racks e colocar em operação instalações com refrigeração líquida.

Atrasos enfraqueceriam o argumento de timing da AMD. A base instalada e a experiência de produção da Nvidia se tornam mais valiosas a cada trimestre em que o Helios permanece escasso.

O segundo sinal são os benchmarks independentes de aplicações. Avaliadores precisam de resultados completos de rack para os modelos de linguagem atuais, cargas de trabalho de mixture-of-experts, tarefas de fine-tuning e inferência de contexto longo.

Testes úteis devem relatar latência, throughput, consumo de energia, utilização, precisão e comportamento em caso de falhas. O pico aritmético por si só não consegue mostrar se 72 GPUs permanecem ocupadas durante uma carga de trabalho real.

Os benchmarks também devem comparar o esforço de software. Uma plataforma que exige semanas de trabalho personalizado em kernels pode oferecer resultados de hardware atraentes, mas aumentar o risco do projeto.

As comparações mais informativas usarão modelos, tamanhos de lote, formatos numéricos e metas de nível de serviço equivalentes. Caso contrário, os fornecedores podem selecionar configurações que favoreçam sua arquitetura.

Os resultados devem abranger cargas de trabalho intensivas em memória, além das intensivas em computação. As alegações de capacidade e largura de banda do Helios se tornam mais fortes se as aplicações conseguirem usar ambas sem sobrecarga excessiva de comunicação.

O terceiro sinal é o escalonamento confiável em múltiplos racks. Um rack Helios testa UALink sobre Ethernet, enquanto implantações maiores também testam as interfaces Pensando Vulcano e a rede Ultra Ethernet ao redor.

A AMD precisa demonstrar que o desempenho permanece previsível quando os trabalhos ultrapassam os limites de um rack. Congestionamento, operações coletivas, agendamento de tarefas e falhas de componentes tornam-se mais difíceis nessa escala.

Grandes clientes observarão com que rapidez um acelerador ou link de rede com falha pode ser isolado. Eles também medirão se uma tarefa pode continuar, reiniciar ou se recuperar de um checkpoint recente.

Resultados sólidos em múltiplos racks sustentariam a tese da AMD sobre redes abertas. Eles mostrariam que switching comercial, especificações abertas e engenharia de parceiros podem fornecer um sistema de IA coordenado.

Um escalonamento fraco favoreceria a integração mais rígida da Nvidia. Isso sugeriria que o controle sobre toda a malha ainda oferece uma vantagem operacional que as especificações não conseguem captar.

Esses sinais devem moldar a forma como os leitores interpretam futuros relatórios da AMD no ServeTheHome. Novos diagramas e números de pico serão úteis, mas as evidências de produção agora têm mais peso do que a intenção arquitetônica.

Helios não é apenas mais um servidor Instinct. É a tentativa da AMD de combinar seus ativos acumulados de data center em um único produto competitivo.

O MI455X fornece computação de baixa precisão e 432 GB de HBM4. Venice fornece processamento de host, Pensando oferece rede para scale-out, e ROCm conecta o sistema a frameworks de IA.

O silício Tomahawk 6 da Broadcom fornece o elo central entre os 72 aceleradores. O hardware Open Rack Wide dá aos fabricantes uma base física comum.

Essa combinação torna o Helios o desafio mais completo da AMD à estratégia de infraestrutura de IA da Nvidia. Ela também submete a AMD a um padrão mais exigente.

Os clientes não avaliarão mais a empresa apenas pelas especificações dos aceleradores. Eles avaliarão a disponibilidade do rack, o desempenho das aplicações, a qualidade do software, os requisitos das instalações, a confiabilidade e o suporte como um único pacote.

A próxima questão é prática: operadores independentes reproduzirão as alegações da AMD depois que o Helios chegar aos data centers de produção? Acompanhe as primeiras grandes implantações, compare os resultados completos das cargas de trabalho e observe se a Ethernet aberta permanece eficiente além de um rack.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page