SK Hynix Abre o HBF com o Google, Aumentando a Pressão sobre Rivais de Memória para IA
A SK Hynix publicou a primeira especificação aberta de HBF com a Sandisk, colocando uma pilha de memória de 512 GB e uma meta de 3 TB/s na cobertura do Google News. O anúncio oferece aos projetistas de chips de IA uma alternativa concreta entre a cara memória de alta largura de banda e o armazenamento em estado sólido mais lento.
A especificação não substitui a HBM, que continua essencial para alimentar aceleradores na velocidade máxima. Em vez disso, a High Bandwidth Flash, ou HBF, acrescenta uma camada maior baseada em NAND próxima ao processador. Essa capacidade poderia manter pesos de modelos e dados de inferência mais perto do processamento, reduzindo transferências repetidas de SSDs convencionais.
O conflito agora passa de uma proposta técnica para uma disputa de adoção. Google e a projetista de chips de IA Tenstorrent participaram do esforço de padronização, segundo as empresas. Ainda assim, Nvidia, AMD, Samsung, Micron e outros grandes fornecedores de semicondutores não assumiram publicamente um compromisso com o HBF.
A Especificação HBF Transforma uma Proposta de Memória em uma Disputa Aberta
SK Hynix e Sandisk transformaram o HBF de uma ambição compartilhada em uma especificação que outras empresas podem avaliar e implementar.
As parceiras apresentaram suas primeiras especificações padrão de HBF durante a conferência Future of Memory and Storage, na Califórnia, em 4 de agosto de 2026. Elas divulgaram o trabalho por meio do Open Compute Project, uma organização que desenvolve projetos abertos de infraestrutura com operadores de nuvem e fornecedores de hardware.
Essa escolha importa porque o HBF precisa de participação para além de dois fornecedores de memória. Uma interface proprietária exigiria que empresas de processadores aceitassem a dependência de um único fornecedor. Uma especificação aberta oferece a projetistas de chips, empresas de encapsulamento, desenvolvedores de software e fabricantes concorrentes de memória um ponto de partida técnico compartilhado.
O projeto inicial suporta configurações NAND de oito e 16 dies. No limite superior, um pacote pode fornecer 512 GB de capacidade. As classes de desempenho vão de cerca de 400 GB/s a 3 TB/s, segundo detalhes técnicos divulgados após a apresentação.
Esses números colocam o HBF em um território pouco familiar. Um SSD empresarial convencional pode oferecer enorme capacidade, mas se conecta por interfaces concebidas para armazenamento em blocos. A HBM fica ao lado de um acelerador e entrega uma largura de banda muito maior, porém sua capacidade é menor e seu encapsulamento continua caro.
O HBF tenta ocupar o espaço entre as duas tecnologias. A SK Hynix o descreve como uma nova camada de memória entre HBM e SSDs, projetada especificamente para cargas de trabalho de inferência. A NAND fornece densidade e não volatilidade, enquanto o encapsulamento empilhado e caminhos de acesso paralelos aumentam a largura de banda.
As parceiras iniciaram o trabalho formal de padronização antes de publicar essas especificações. Em fevereiro, criaram uma frente de trabalho dedicada no âmbito da OCP, após uma reunião do consórcio na sede da Sandisk em Milpitas. O plano de padronização apresentou o HBF como infraestrutura para inferência de IA escalável e consciente do consumo de energia.
A divulgação de agosto, portanto, representa progresso, não uma invenção inesperada. Ela traduz aquela estrutura anterior em requisitos de capacidade, largura de banda, interface, eletricidade, encapsulamento, confiabilidade e software.
A especificação supostamente usa UCIe, ou Universal Chiplet Interconnect Express, para conectar um pacote HBF a um processador host. O UCIe define uma conexão comum die a die para chiplets montados em um mesmo pacote.
Essa interface é central para a estratégia aberta. Uma ligação comum pode permitir que diferentes processadores se comuniquem com dispositivos HBF compatíveis sem que cada combinação exija uma conexão inteiramente proprietária.
No entanto, um documento aberto não equivale a um mercado aberto. Os fornecedores ainda precisam de dies fabricáveis, lógica de base, capacidade de encapsulamento, suporte a controladores, firmware, integração com sistemas operacionais e clientes dispostos a validar o sistema completo.
SK Hynix e Sandisk criaram a linha de partida. Elas não definiram a vencedora.
Por que a Inferência de IA Precisa de uma Camada entre HBM e SSDs
O argumento mais forte para o HBF vem de cargas de trabalho de inferência cujos dados úteis já não cabem confortavelmente na capacidade HBM de um acelerador.
Treinamento e inferência pressionam a memória de formas diferentes. O treinamento atualiza repetidamente os parâmetros do modelo e exige alta taxa de transferência entre muitos aceleradores. A inferência atende solicitações de um modelo já treinado, frequentemente enquanto gerencia pesos do modelo, dados de atenção e caches em crescimento.
Uma carga de trabalho importante é o cache de chave-valor, geralmente abreviado como cache KV. Ele armazena informações de atenção geradas enquanto um modelo processa um prompt, permitindo que o sistema reutilize cálculos anteriores durante a geração subsequente de tokens.
Contextos mais longos e usuários simultâneos ampliam esse cache. Sistemas de recuperação também podem manter índices ou embeddings substanciais próximos aos aceleradores. Grandes modelos de recomendação adicionam outra classe de dados que se beneficia de maior capacidade perto do processamento.
A HBM entrega a largura de banda desejada por esses processadores, mas a capacidade não pode aumentar sem limites. Cada pilha adicional afeta a área do pacote, o consumo de energia, o roteamento de sinais, o rendimento e o custo. Transferir dados excedentes para SSDs introduz maior latência e um caminho de acesso voltado ao armazenamento.
O HBF propõe um compromisso. Sua classe mais rápida se aproxima do território de largura de banda associado aos atuais produtos HBM, enquanto sua maior capacidade especificada supera em várias vezes uma pilha HBM típica.
Segundo uma análise da especificação, uma pilha HBF de 512 GB se compara a cerca de 48 GB a 64 GB de uma pilha HBM4. Essa comparação não torna as duas tecnologias intercambiáveis. NAND e DRAM têm latência, durabilidade, comportamento de gravação e características de desempenho diferentes.
A capacidade ainda muda o projeto do sistema. Um servidor que mantém mais dados do modelo dentro do pacote do acelerador pode reduzir o tráfego pelo armazenamento externo e pela memória host. Menos movimentações podem melhorar a consistência das respostas e reduzir a energia gasta no transporte de dados.
Essa distinção explica por que o anúncio atraiu atenção além da agregação rotineira de notícias do Google. A proposta visa um gargalo cada vez mais moldado pela localização da memória, e não apenas pela aritmética do processador.
A Sandisk apresenta esse argumento desde 2025. Seu resumo técnico do HBF descreveu um conceito de primeira geração com 1,6 TB/s de largura de banda de leitura, 512 GB em 16 dies e um perfil físico comparável ao HBM4.
Esses números eram metas do fornecedor, não resultados independentes de desempenho. A nova especificação eleva o teto para 3 TB/s, mas os compradores ainda precisam de medições em silício sob cargas de trabalho realistas.
O uso inicial mais plausível não é a computação de uso geral. O HBF é adequado para sistemas em que modelos ou dados de inferência associados excedem a HBM disponível, mas ainda exigem acesso substancialmente mais rápido do que um SSD oferece.
Considere um serviço que executa vários modelos grandes em uma plataforma de aceleradores. O armazenamento convencional pode guardar todos os modelos, enquanto a HBM pode atender à computação ativa. O HBF poderia reter um conjunto de trabalho maior próximo ao processador, reduzindo a frequência e a duração das trocas de modelo.
Outro exemplo envolve aplicações de contexto longo que atendem muitos usuários simultâneos. Seus caches KV podem competir com os pesos do modelo pela capacidade HBM. Colocar dados selecionados no HBF poderia preservar a escassa HBM para as operações mais sensíveis à latência.
A busca vetorial oferece uma terceira possibilidade. Pesquisadores exploraram aceleradores assistidos por HBF para grandes buscas aproximadas de vizinhos mais próximos, nas quais índices grandes exigem largura de banda substancial. Esse trabalho permanece experimental, mas ilustra as cargas de trabalho que a capacidade do HBF poderia atender.
O software determinará se esses cenários funcionam. Os desenvolvedores precisam de regras previsíveis para decidir o que permanece na HBM, o que vai para o HBF e o que recorre aos SSDs. Um posicionamento inadequado pode eliminar o benefício por meio de transferências desnecessárias.
Por isso, o HBF deve ser entendido como parte de uma hierarquia. A HBM continua sendo a camada de trabalho mais rápida. O HBF fornece um pool maior próximo ao processamento. Os SSDs oferecem capacidade persistente econômica fora do pacote.
O mecanismo parece simples, mas a gestão coordenada de memória é difícil. O hardware precisa expor as camadas de forma clara, enquanto compiladores e sistemas de execução devem entender sua latência, largura de banda, durabilidade e capacidade.
Para compradores de infraestrutura, a questão prática não é se 512 GB parecem impressionantes. É se o HBF aumenta os tokens por segundo, suporta mais solicitações simultâneas ou reduz a energia por token depois de contabilizado todo o custo do sistema.
O Interesse do Google News Aumenta a Pressão sobre o Estabelecimento da Memória para IA
A participação do Google dá ao HBF um avaliador influente, mas o amplo apoio dos fornecedores continua sendo o ingrediente mais importante que falta ao padrão.
SK Hynix e Sandisk são defensoras naturais do HBF. Ambas entendem de fabricação de memória, encapsulamento e armazenamento para data centers. Seu interesse comercial também é claro: o crescimento da inferência cria uma oportunidade de vender produtos baseados em NAND mais valiosos.
O Google traz uma perspectiva diferente. A empresa projeta unidades de processamento tensorial, opera enormes serviços de IA e gerencia infraestrutura em uma escala que poucas organizações conseguem igualar. Seu envolvimento sinaliza que pelo menos uma hyperscaler vê valor suficiente para ajudar a moldar a especificação.
Isso não significa que o Google tenha se comprometido a implantar HBF. A participação pode incluir avaliação técnica, orientação sobre cargas de trabalho ou desenvolvimento de interfaces, sem garantir um pedido comercial.
A Tenstorrent acrescenta outra voz útil. A empresa desenvolve processadores de IA com base em ideias de chiplets e arquitetura aberta, tornando uma camada aberta de memória próxima ao processamento relevante para sua estratégia de projeto. Ela também tem muito menos poder de mercado que a Nvidia.
Juntas, Google e Tenstorrent oferecem ao consórcio tanto a perspectiva de um potencial comprador quanto a de um projetista de processadores. Ainda assim, dois participantes visíveis não formam um ecossistema completo de fornecimento.
Os nomes ausentes são significativos. A Nvidia controla grande parte do mercado de aceleradores. A AMD vende GPUs e CPUs concorrentes. Broadcom e Marvell desenvolvem silício personalizado para clientes de nuvem. Samsung e Micron competem em memória, enquanto Intel e Qualcomm abrangem processadores, aceleradores e plataformas.
Nenhuma delas havia adotado publicamente o esforço do HBF quando a primeira especificação apareceu. A ausência não prova oposição. As empresas frequentemente evitam endossar um padrão inicial até que cronogramas de produtos, exigências dos clientes e concessões técnicas fiquem mais claros.
No entanto, o silêncio cria um risco para os desenvolvedores. Se apenas um pequeno número de processadores oferecer suporte ao HBF, o investimento em software se torna mais difícil de justificar. Se apenas dois fornecedores de memória o fabricarem, os compradores poderão continuar preocupados com a diversidade de fornecimento.
Padrões abertos têm sucesso quando os participantes acreditam que a compatibilidade cria um mercado maior do que o controle proprietário. Eles enfrentam dificuldades quando fornecedores líderes podem alcançar melhor economia por meio de interfaces internas ou de roteiros de produtos existentes.
A Nvidia, por exemplo, pode coordenar aceleradores, interconexões, sistemas e software. Ela pode decidir que maior capacidade HBM, melhor compartilhamento de memória ou armazenamento estreitamente integrado atende seus clientes sem adotar o HBF.
Os fornecedores de memória enfrentam outro cálculo. Samsung e Micron já investem pesadamente em HBM. Apoiar o HBF expandiria o mercado endereçável para NAND de alto desempenho, mas também poderia introduzir outro produto complexo e uma exigência adicional de encapsulamento.
A SK Hynix ocupa uma posição incomum porque já é uma fornecedora líder de HBM. Promover a HBF não necessariamente prejudica esse negócio. Um sistema hierárquico pode usar ambos os produtos, dando à empresa exposição a duas camadas valiosas de memória.
O interesse da Sandisk está mais diretamente ligado à NAND. A empresa quer aproximar a flash dos processadores e conquistar uma parcela maior dos gastos com infraestrutura de IA. Seu anterior roteiro de HBF previa amostras de memória no segundo semestre de 2026 e amostras de dispositivos de inferência com HBF no início de 2027.
Esse cronograma pressiona o consórcio a transformar documentação em hardware rapidamente. Cada atraso dá aos concorrentes mais tempo para ampliar a capacidade de HBM, a expansão de memória baseada em CXL, o descarregamento para SSDs e o cache em software.
CXL, ou Compute Express Link, oferece aos processadores uma conexão coerente com dispositivos de expansão de memória. Ele resolve um problema de capacidade relacionado, embora sua topologia e desempenho sejam diferentes de um pacote HBF empilhado ao lado do processador.
Caminhos de dados no estilo DirectStorage, armazenamento computacional e dispositivos NVMe avançados também disputam partes da mesma carga de trabalho. Essas abordagens mantêm grandes conjuntos de dados mais distantes do acelerador, mas podem melhorar a eficiência de transferência.
Portanto, a disputa principal não é SK Hynix contra uma única rival. É HBF aberta contra hierarquias de memória consolidadas, construídas com HBM, memória do host, CXL e SSDs.
A visibilidade nas notícias do Google ajuda a atrair atenção para essa disputa. Compromissos de engenharia importarão muito mais do que manchetes.
A Meta de 3 TB/s Ainda Precisa Resistir ao Hardware Real
A capacidade da HBF é crível como vantagem da NAND, mas suas alegações de largura de banda, latência, durabilidade, consumo de energia e software ainda não foram comprovadas em escala de produção.
A especificação define o que produtos compatíveis devem fazer. Ela não demonstra que SK Hynix ou Sandisk conseguem fabricar esses produtos de forma econômica, em volume e com desempenho consistente.
Uma pilha de 16 dies introduz complexidade de encapsulamento. Cada die precisa de acesso paralelo substancial, enquanto o pacote exige um die base capaz de coordenar o tráfego com o processador host. O calor precisa ser dissipado sem ultrapassar o limite de energia do sistema.
Alcançar 3 TB/s também exige mais do que uma interface rápida. Os dies NAND precisam fornecer paralelismo interno suficiente, o controlador deve agendar solicitações com eficiência e o software precisa manter cargas de trabalho adequadas a alta taxa de leitura.
A NAND tem pontos fortes importantes. Ela retém dados sem energia e oferece densidade muito maior que a DRAM. Também apresenta latência de acesso mais lenta e durabilidade de gravação limitada em comparação com a DRAM.
Essas diferenças influenciam quais dados pertencem à HBF. Pesos de modelos com predominância de leitura parecem mais adequados do que dados de trabalho atualizados com frequência. O comportamento do cache KV exige análise mais detalhada, pois os sistemas criam e modificam continuamente entradas de cache durante a inferência.
O desempenho pode variar conforme o padrão de acesso. Um fornecedor pode atingir uma largura de banda sequencial impressionante e, ainda assim, entregar resultados mais fracos em leituras pequenas e irregulares. Cargas de trabalho de IA podem envolver tanto fluxos previsíveis quanto consultas dispersas.
Portanto, os primeiros testes independentes devem informar mais do que a taxa máxima de transferência. Os compradores precisam de distribuições de latência, comportamento em leitura aleatória, desempenho de gravação, limitação térmica, taxas de erro, durabilidade e energia por byte transferido.
Eles também precisam de medições no nível do sistema. Tokens por segundo, tempo até o primeiro token, capacidade de usuários simultâneos e energia por token conectam o comportamento da memória aos resultados de negócio.
Uma análise da especificação técnica observou que o projeto inclui requisitos elétricos, de interface, encapsulamento, confiabilidade e I/O de software. Também destacou o desafio de extrair até mesmo 400 GB/s de um pacote de 512GB.
Esse número menor é importante. O padrão oferece várias classes de desempenho, portanto o teto de 3 TB/s não deve se tornar uma abreviação para todos os futuros dispositivos HBF.
As configurações de capacidade também exigem tratamento cuidadoso. Um pacote de 512GB representa o limite superior da especificação, não uma promessa de que todas as amostras iniciais entregarão essa quantidade na largura de banda máxima.
O cronograma de comercialização continua sendo outra incerteza. A Sandisk havia definido como meta amostras de memória HBF em 2026 e dispositivos que usam HBF no início de 2027. O anúncio da especificação não substituiu publicamente esse cronograma.
Uma cautelosa avaliação de comercialização descreveu a solução atual como existente no papel, enquanto os fornecedores preparam amostras. Essa distinção deve orientar as expectativas.
A amostragem é apenas um marco inicial. Os clientes precisam testar a funcionalidade, integrar controladores e runtimes, qualificar o encapsulamento, validar a confiabilidade e decidir se o desempenho justifica novos projetos de sistema.
A economia de produção pode se tornar o fator decisivo. A HBF usa NAND, mas não é um pacote padrão de flash commodity. Dies especializados, lógica, conexões de alta densidade e montagem avançada elevam os custos.
Se o dispositivo final se aproximar do preço da HBM sem reproduzir o comportamento da HBM, sua vantagem de capacidade pode não ser suficiente. Se oferecer várias vezes mais capacidade a um custo de sistema atraente, os projetistas de aceleradores ganharão uma nova opção significativa.
A energia cria uma troca semelhante. Manter dados perto da computação pode reduzir a energia gasta para movê-los de SSDs. Ainda assim, interfaces largas, acesso NAND paralelo e controladores complexos também consomem energia.
O consórcio precisa demonstrar economia líquida sob tráfego real de inferência. Estimativas de fornecedores, por si só, não resolverão esse cálculo.
A maturidade do software apresenta o risco menos visível. Um processador pode se conectar tecnicamente à HBF enquanto as aplicações não conseguem usá-la de maneira eficaz. Alocação de memória, cache, expulsão, movimentação de dados e observabilidade exigem novo suporte.
Operadores de nuvem têm experiência em administrar camadas complexas de armazenamento, mas a memória heterogênea no nível do pacote muda o problema de otimização. Os desenvolvedores precisam de ferramentas que exponham o benefício sem obrigar cada equipe de aplicações a administrar manualmente regiões individuais de memória.
Runtimes de código aberto poderiam reduzir esse fardo. Ferramentas compartilhadas também ajudariam o padrão a atrair adotantes além dos hyperscalers capazes de desenvolver software personalizado.
Até que essas peças cheguem, a HBF continua sendo uma arquitetura crível com uma história de produto incompleta. A distinção importa para investidores, compradores e desenvolvedores que acompanham a cobertura das notícias do Google sobre o anúncio.
O Que Observar Após o Anúncio da HBF Aberta
Três sinais determinarão se a HBF se tornará uma camada de memória para IA ou permanecerá uma especificação atraente sem um mercado amplo.
O primeiro sinal é silício funcional. SK Hynix e Sandisk precisam fornecer amostras de HBF com capacidade, largura de banda, latência, consumo de energia, durabilidade e comportamento térmico divulgados.
Uma amostra que se aproxime das metas publicadas em cargas de trabalho realistas fortaleceria o argumento a favor da HBF. Uma demonstração limitada com leituras sequenciais favoráveis deixaria sem resposta a questão central do desempenho.
O momento também importa. O roteiro anteriormente declarado da Sandisk situava as amostras iniciais no segundo semestre de 2026. Cumprir essa janela mostraria que a padronização e a engenharia de produto avançaram juntas.
O segundo sinal é a adoção por processadores. Google e Tenstorrent ajudaram a moldar o esforço, mas observadores devem procurar por um roteiro de acelerador, uma placa protótipo ou um teste de inferência publicamente descrito usando HBF.
Uma implementação do Google teria peso especial porque a empresa controla tanto modelos de IA quanto processadores personalizados. Mesmo um teste restrito poderia fornecer dados de carga de trabalho críveis, indisponíveis em um laboratório de fornecedor de memória.
A Tenstorrent poderia oferecer uma prova diferente. Sua arquitetura orientada a chiplets pode mostrar como uma empresa independente de processadores integra HBF por meio de UCIe sem depender de uma pilha fechada de fornecedores.
A validação mais forte seria outra grande empresa de processadores ou nuvem aderindo à especificação. O apoio de AMD, Broadcom, Marvell, Microsoft, Meta ou Amazon reduziria o risco de a HBF ficar vinculada a um grupo pequeno.
O terceiro sinal é software e economia. Os compradores precisam de suporte de runtime que trate a HBF como parte de uma hierarquia gerenciável, em vez de um dispositivo de armazenamento controlado manualmente.
Observe recursos de compilador, políticas de posicionamento de memória, mudanças no sistema operacional, integrações com frameworks de inferência e ferramentas de monitoramento. Esses lançamentos revelarão se o ecossistema está se preparando para a implementação, em vez de apenas revisar uma especificação.
As evidências econômicas precisam vir em seguida. As métricas relevantes incluem tokens por segundo por servidor, sessões simultâneas, energia por token e o custo de hospedar um modelo em um nível de serviço definido.
A largura de banda bruta não pode responder a essas perguntas. A capacidade isoladamente tampouco.
A comparação deve incluir sistemas existentes que usam configurações maiores de HBM, memória do host, expansão por CXL e descarregamento otimizado para SSD. A HBF só conquista espaço se seu desempenho e capacidade combinados melhorarem a plataforma completa de inferência.
Para desenvolvedores, o anúncio é um motivo para examinar mais de perto o uso de memória. A otimização de modelos depende cada vez mais de onde residem pesos, caches, índices de recuperação e dados intermediários.
As equipes que avaliam a futura infraestrutura de IA devem registrar agora essas características das cargas de trabalho. Uma base de conhecimento técnico pesquisável pode ajudar engenheiros a comparar especificações, notas de benchmark, decisões de arquitetura e alegações de fornecedores à medida que os produtos HBF surgirem.
Para compradores empresariais, a ação imediata é mais modesta. Pergunte aos fornecedores como planejam lidar com a capacidade de memória para inferência, quais interfaces abertas apoiam e quais evidências de carga de trabalho sustentam seus roteiros.
Não trate um rótulo HBF como prova de desempenho. Solicite medições que reflitam os tamanhos de seus modelos, comprimentos de contexto, metas de concorrência e requisitos de nível de serviço.
A especificação da SK Hynix e da Sandisk tornou o debate concreto. A HBF agora tem classes de capacidade definidas, metas de desempenho, um espaço aberto de padronização e dois participantes externos notáveis.
Ela ainda não tem dispositivos de produção, benchmarks independentes e amplo suporte de processadores. Essas lacunas separam um padrão interessante de um mercado duradouro.
A próxima manchete nas notícias do Google importará menos do que o primeiro benchmark completo de HBF. Observe se sistemas funcionais oferecem custos de inferência mais baixos sem sacrificar o tempo de resposta e, em seguida, compare essas evidências com alternativas de HBM e expansão de memória que evoluem rapidamente.



