La carrera de infraestructura entre AMD y Google cambia mientras Schneider Electric hace desplegable Helios
- Ethan Carter

- 4 ago
- 15 min de lectura
Schneider Electric y AMD han presentado el primer diseño de infraestructura para Helios, compatible con racks de 246 kilovatios y clústeres con hasta 10,4 megavatios de carga de TI. Esto cambia de forma práctica la competencia de infraestructura entre amd google. AMD cuenta ahora con un camino documentado desde las especificaciones de los aceleradores hasta un centro de datos de alta densidad en funcionamiento.
El anuncio no otorga a AMD una victoria repentina de rendimiento sobre Google, Nvidia u otro proveedor de plataformas. Aborda una debilidad competitiva distinta. Comprar aceleradores es solo el comienzo cuando cada rack también requiere distribución eléctrica especializada, refrigeración líquida, controles y modelado a nivel de instalación.
Google ha dedicado años a desarrollar estos sistemas en torno a sus Tensor Processing Units, o TPUs, procesadores optimizados para cargas de trabajo de aprendizaje automático. Nvidia también ha trabajado con Schneider Electric en infraestructura física para sus sistemas acelerados. AMD debe convencer a los operadores de que Helios puede convertirse en un clúster operativo sin obligarlos a diseñar desde cero la instalación que lo respalda.
Por eso importa este diseño de referencia. Convierte a Schneider Electric en algo más que un proveedor de equipos. La empresa pasa a formar parte de la respuesta de AMD a la infraestructura de IA integrada verticalmente.
El plano de Helios conecta chips con una instalación de 10,4 MW
AMD y Schneider Electric han definido los sistemas físicos que rodean a Helios, no solo la disposición de los procesadores dentro de su rack.
Las empresas anunciaron su diseño desarrollado conjuntamente en San Francisco el 23 de julio de 2026. Según el plano de Helios, admite clústeres de IA modulares que alcanzan 10,4 megavatios de capacidad de TI.
Cada rack de alta densidad puede requerir hasta 246 kilovatios. Un rack de ese nivel utiliza varias veces la energía asociada a muchas instalaciones empresariales convencionales. También concentra casi toda esa entrada eléctrica en calor que debe eliminarse de forma continua.
Helios combina aceleradores AMD Instinct MI455X, procesadores EPYC de sexta generación, tarjetas de interfaz de red Pensando Vulcano y el entorno de software ROCm. ROCm es la pila de software abierta de AMD para programar y operar sus aceleradores.
Estos componentes de computación representan solo una capa. El diseño de referencia cubre energía de la instalación, refrigeración de la instalación, espacio de TI y software de ciclo de vida. Especifica cómo deben funcionar juntas esas capas en torno a los requisitos de Helios.
Schneider Electric afirma que su sistema de refrigeración Motivair puede eliminar hasta el 84 por ciento del calor mediante métodos basados en líquido e híbridos de aire y líquido. Las unidades de distribución de refrigerante, o CDUs, transfieren calor entre el circuito del rack y el sistema de refrigeración del edificio.
El diseño también utiliza modelado eléctrico ETAP y dinámica de fluidos computacional mediante EcoStruxure IT Design. La dinámica de fluidos computacional simula el flujo de aire y el comportamiento de la temperatura antes de que los equipos lleguen al sitio.
Los operadores pueden usar un gemelo digital eléctrico para modelar el comportamiento de la infraestructura. Unified Operations Center de AVEVA añade monitorización y visibilidad operativa después del despliegue. Estas herramientas están destinadas a detectar antes los conflictos eléctricos o térmicos durante el proceso de construcción.
Schneider Electric afirma que la configuración completada puede alcanzar una efectividad de uso de energía, o PUE, de aproximadamente 1,12 a plena carga. El PUE compara el uso total de energía de una instalación con la energía entregada a los equipos de computación. Un valor más cercano a 1 indica menos sobrecarga, aunque los resultados reales dependen del clima, la utilización y las decisiones operativas.
El diseño inicial sigue los requisitos del American National Standards Institute para despliegues en Estados Unidos. Schneider Electric planea desarrollar una versión alineada con las normas de la International Electrotechnical Commission para otros mercados.
Esta limitación geográfica es importante. El anuncio ofrece un punto de partida validado, en lugar de un diseño universal que pueda eludir los códigos eléctricos locales o las condiciones de las empresas de servicios públicos. Los clientes aún necesitan trabajo de ingeniería vinculado a su sitio.
El plano está disponible sin una tarifa independiente para el cliente, según información independiente. Su valor real reside en la incertidumbre evitada en torno a la integración, no en el coste de adquirir el documento.
Un diseño de referencia no suministra electricidad ni asegura una conexión a la red. No puede verter hormigón, obtener derechos de agua ni resolver los permisos locales. Puede reducir el número de preguntas de ingeniería sin respuesta una vez que existe un sitio adecuado.
Esta distinción establece la tensión central del artículo. AMD ha producido procesadores competitivos y una arquitectura a escala de rack. Ahora necesita una forma repetible de instalar esa arquitectura dentro de instalaciones construidas bajo restricciones físicas reales.
Por qué la competencia entre AMD y Google va más allá de los chips
La comparación entre amd google depende cada vez más de la ingeniería de instalaciones, porque los sistemas de IA densos compiten como plataformas completas eléctricas, térmicas, de red y de software.
Google ha operado infraestructura de IA personalizada durante aproximadamente una década. Diseña TPUs, redes a escala de pod, sistemas de refrigeración, marcos de software y muchos componentes de soporte para centros de datos dentro de una misma organización.
Esa experiencia crea una ventaja que las especificaciones brutas de los aceleradores no pueden reflejar. Google puede coordinar las hojas de ruta de los procesadores con los edificios que los alojan. También puede probar cambios de infraestructura en una amplia flota interna antes de ofrecer capacidad a través de Google Cloud.
Google informó que había desplegado refrigeración líquida a escala de gigavatios en más de 2.000 pods TPU durante siete años. También informó una disponibilidad de aproximadamente el 99,999 por ciento para esos despliegues de refrigeración. La empresa habló de esa experiencia al presentar diseños de racks de un megavatio.
Estas son cifras comunicadas por la empresa, no una comparación independiente con AMD Helios. Aun así, muestran la madurez operativa que las plataformas de infraestructura competidoras deben afrontar.
Google también desarrolló Brazos, un sistema de refrigeración líquida-a-aire montado en rack para hardware refrigerado por líquido dentro de instalaciones refrigeradas por aire. El sistema Brazos captura el calor mediante un circuito líquido cerrado y después lo libera en el pasillo caliente existente.
Brazos y el diseño de Helios de Schneider Electric abordan situaciones de despliegue diferentes. Sin embargo, ambos reflejan la misma presión del sector. La adopción de hardware de IA se frena cuando el edificio objetivo no puede proporcionar el circuito líquido, la alimentación eléctrica o la capacidad de rechazo de calor necesarios.
AMD no posee una flota de centros de datos de hiperescala comparable con la de Google. Por ello, necesita socios de infraestructura, fabricantes de servidores, proveedores de nube y proveedores de redes para crear una vía equivalente para los clientes.
Schneider Electric cubre una parte significativa de esa brecha. Aporta distribución eléctrica, equipos de refrigeración, software de modelado e ingeniería de instalaciones al programa de AMD a escala de rack. HPE proporciona otra vía al incorporar Helios en sistemas comerciales.
Este modelo de asociación puede ofrecer flexibilidad. Un cliente no está limitado al procesador o la arquitectura de instalaciones de un único operador de nube. Los operadores pueden adaptar un diseño abierto a proyectos de colocación, nube privada, IA soberana y computación especializada.
Sin embargo, un modelo liderado por socios también crea riesgo de coordinación. Los cambios en un acelerador, switch, CDU, bus eléctrico o lanzamiento de software pueden afectar a varias empresas. La validación debe mantener el ritmo de cada hoja de ruta importante de componentes.
El modelo integrado de Google reduce parte de esa distancia organizativa. La empresa puede alinear sus equipos de TPU, redes, software e instalaciones mediante planificación interna. También puede reservar su infraestructura para cargas de trabajo que se ajusten a su economía.
La contrapartida es el control del cliente. Un cliente de Google Cloud consume la plataforma en gran medida como un servicio gestionado. Un comprador de Helios puede obtener un control más directo sobre el entorno de computación, el diseño de la instalación y el modelo operativo.
Esto no convierte a AMD y Google en sustitutos directos en cada proceso de adquisición. Google vende servicios en la nube y utiliza silicio personalizado, mientras que AMD vende procesadores y tecnología de plataforma a través de una red del sector.
Aun así, los compradores empresariales comparan la capacidad resultante. Examinan el tiempo de despliegue, la compatibilidad de modelos, las regiones disponibles, el control operativo, el rendimiento y el uso de energía. La unidad competitiva se está convirtiendo en el clúster de IA operativo, en lugar del chip individual.
Nvidia sigue siendo el principal punto de referencia en ese mercado. Schneider Electric anunció una colaboración de infraestructura con Nvidia en 2024, centrada en distribución de alta potencia y refrigeración líquida para clústeres densos de aceleradores. Esa anterior colaboración con Nvidia demuestra que Schneider no está eligiendo una sola plataforma de aceleradores.
En cambio, Schneider Electric se beneficia a medida que varias arquitecturas demandan nuevos diseños de instalaciones. Para AMD, la relación aporta credibilidad en infraestructura. Para los clientes, crea otra opción diseñada junto a los TPUs nativos de la nube y los sistemas centrados en Nvidia.
La energía y la refrigeración definen ahora el mecanismo competitivo
La contribución de Schneider Electric importa porque un rack de 246 kilovatios transforma la instalación antes de transformar la hoja de cálculo de compras.
La planificación tradicional de servidores a menudo trataba el centro de datos como un contenedor estable. Los compradores seleccionaban servidores, asignaban posiciones de rack y comprobaban si la capacidad eléctrica y de refrigeración existente era suficiente.
La IA de alta densidad invierte esa secuencia. La carga de trabajo y la hoja de ruta de aceleradores ahora determinan la topología eléctrica, las tuberías, la disposición del suelo, el modelo de redundancia y el calendario de construcción. Un edificio diseñado para los servidores de ayer no puede aceptar automáticamente los racks de mañana.
Con 246 kilovatios, un rack Helios requiere coordinación directa entre los equipos de computación y los sistemas de la instalación. Un diseño eléctrico debe gestionar la carga sostenida, el comportamiento transitorio, los ajustes de protección, los estados de mantenimiento y los escenarios de fallo.
El diseño de refrigeración debe suministrar suficiente líquido a cada placa fría. También debe transferir calor a través de las CDUs y los circuitos de la instalación sin crear cambios de temperatura inaceptables ni desequilibrios de flujo.
La refrigeración por aire sigue formando parte del diseño porque algunos componentes y equipos circundantes aún liberan calor en la sala. Por ello, Schneider Electric describe un enfoque híbrido en lugar de afirmar que el líquido elimina todos los requisitos del lado del aire.
La biblioteca de diseños de referencia de la empresa explica por qué el modelado debe cubrir el comportamiento eléctrico, el flujo de aire y el flujo de líquido. Cada modelo detecta una clase de fallo distinta. Combinarlos puede identificar interacciones antes de que los operadores energicen el clúster.
Consideremos un fallo parcial de refrigeración. El equipo restante debe absorber calor adicional o la carga de computación debe disminuir rápidamente. Ese evento afecta a los controles de la instalación, la programación del clúster y, potencialmente, al progreso del entrenamiento del modelo.
Una interrupción eléctrica crea otro problema entre capas. Los sistemas de respaldo deben mantener el estado operativo previsto, mientras el entorno de software gestiona los trabajos interrumpidos. La resiliencia de la instalación y la resiliencia informática no pueden planificarse de forma independiente.
Este es el mecanismo detrás de la alianza Helios. AMD define el comportamiento y los requisitos de la plataforma informática. Schneider Electric traduce esos requisitos en configuraciones de infraestructura que los equipos de proyecto pueden evaluar.
El diseño de clúster modular de 10,4 megavatios añade otra capa. Los operadores pueden planificar la capacidad en bloques repetibles en lugar de diseñar cada implementación desde cero. La estandarización puede simplificar las compras y reducir los desacuerdos entre ingenieros, contratistas y proveedores tecnológicos.
La repetibilidad también ayuda a los proveedores a prever las necesidades de equipos. Los CDU, las celdas de maniobra, los sistemas de monitorización y los módulos prefabricados pueden planificarse en torno a configuraciones de clúster conocidas. Sin embargo, un módulo repetido sigue requiriendo integración a nivel de sitio.
La capacidad de la red eléctrica sigue siendo el límite más difícil. Un diseño pulido no garantiza que una empresa de servicios pueda suministrar otros 10,4 megavatios en el calendario deseado. Las colas de interconexión y los trabajos en subestaciones pueden durar más que el cronograma de despliegue del hardware informático.
El agua y la disipación de calor también varían según la ubicación. Una instalación puede necesitar enfriadoras, refrigeradores secos, torres de refrigeración u otra configuración según el clima y las restricciones locales. El diseño de referencia no puede eliminar esas diferencias ambientales.
El PUE declarado de aproximadamente 1,12 merece un contexto similar. El PUE cambia con la utilización, el clima, la redundancia, el método de refrigeración y los límites de medición. Un valor modelado a plena carga no debe tratarse como un resultado anual garantizado.
Los operadores también deben elegir cuánta capacidad reservar para mantenimiento y fallos. Utilizar infraestructura redundante para capacidad de cómputo adicional puede mejorar la utilización durante el funcionamiento normal. También reduce el margen disponible cuando los equipos quedan fuera de servicio.
Schneider Electric describe esta elección como una competencia entre mayor capacidad de cómputo y la estrategia de redundancia original. La decisión debe ser explícita, porque la capacidad de respaldo no utilizada no es automáticamente capacidad de producción gratuita.
Google se enfrenta a los mismos límites físicos pese a su modelo integrado. Su trabajo en refrigeración líquida muestra que el silicio personalizado no elimina la ingeniería de instalaciones. En su lugar, la organización debe desarrollar sistemas de refrigeración y alimentación junto con cada generación de cómputo.
Por tanto, el concurso amd google expone dos enfoques del mismo mecanismo. Google coordina gran parte de la pila internamente. AMD está construyendo una red abierta de socios en torno a Helios, con Schneider Electric a cargo de una capa crítica de las instalaciones.
Un diseño validado no es un despliegue validado
La incertidumbre central es si los clientes pueden reproducir los resultados modelados del plano en sitios reales, cargas de trabajo, proveedores y condiciones operativas.
Schneider Electric y AMD describen el diseño como desarrollado y validado conjuntamente. Esa validación indica que los componentes y las hipótesis de ingeniería se evaluaron juntos. No establece el rendimiento en campo en una gran base instalada.
Ningún resultado público de despliegues de clientes acompañó el anuncio de julio. Las empresas no divulgaron una instalación Helios terminada que operara continuamente a 246 kilovatios por rack bajo el nuevo diseño.
Esa brecha es normal en una arquitectura recién lanzada. Aun así, limita lo que los compradores pueden inferir sobre el tiempo de puesta en marcha, el comportamiento ante fallos, la disponibilidad de componentes y el mantenimiento a largo plazo.
La plataforma Helios también depende de que el hardware llegue según lo previsto. Su diseño incluye aceleradores MI455X, procesadores EPYC de sexta generación e interfaces de red Vulcano. Los retrasos o cambios de especificación pueden forzar otro ciclo de validación.
Las redes presentan un riesgo específico. Helios utiliza un enfoque abierto y orientado a Ethernet, diseñado para ofrecer una alternativa al entorno NVLink estrechamente integrado de Nvidia. Esto ofrece a los compradores más flexibilidad de proveedores, pero da importancia a un ecosistema de socios emergente.
HPE ha anunciado planes para ofrecer sistemas basados en Helios, proporcionando a AMD una importante vía comercial. Su implementación utiliza una estructura de aceleradores de gran ancho de banda y un conmutador diseñado específicamente para ello.
Un detallado análisis del sistema Helios describió una configuración prevista con 72 aceleradores MI455X. El informe también señaló el objetivo de AMD de 31 terabytes de memoria HBM4 y 2,9 exaFLOPS de cómputo FP4 por rack.
Estas cifras son objetivos vinculados a hardware futuro, no resultados de producción verificados de forma independiente. FP4 es un formato numérico de baja precisión utilizado para algunas tareas de inferencia de IA. No debe compararse directamente con todas las cargas de entrenamiento o científicas.
El software sigue siendo otra variable. ROCm ha ampliado su compatibilidad con frameworks y modelos, pero la disponibilidad de hardware por sí sola no garantiza un rendimiento equivalente de las aplicaciones. Los compradores deben probar sus modelos, operadores, compiladores y comportamiento de entrenamiento distribuido reales.
Google puede optimizar cargas de trabajo importantes para TPU mediante JAX, XLA y su entorno de software interno. Nvidia cuenta con una base de desarrolladores de CUDA consolidada desde hace tiempo. AMD debe demostrar que su pila abierta reduce la dependencia sin trasladar un trabajo de integración excesivo a los clientes.
Un diseño de referencia puede resolver el plano de la instalación y dejar sin resolver la migración de aplicaciones. Ese límite es importante para los equipos empresariales que evalúan el coste total de cambiar de plataforma de aceleradores.
El mantenimiento crea otra prueba. Los circuitos líquidos añaden bombas, conexiones, sensores, colectores y procedimientos de servicio cerca de costosos equipos informáticos. Los operadores necesitan evidencia sobre fugas, filtración, calidad del refrigerante, sustitución de componentes y formación del personal.
La cifra de eliminación de calor del 84 por ciento también requiere una interpretación cuidadosa. Schneider Electric afirma que sus enfoques de refrigeración propuestos son capaces de eliminar esa proporción mediante líquido. La carga térmica restante y las condiciones operativas siguen determinando las necesidades de refrigeración a nivel de sala.
La misma cautela se aplica a la velocidad de despliegue. Un diseño preingenierizado puede acortar la planificación y reducir el trabajo duplicado. No puede garantizar una construcción más rápida cuando los transformadores, las celdas de maniobra, las enfriadoras, los aceleradores o las mejoras de la red eléctrica siguen estando limitados.
También hay una cuestión comercial. Los compradores deben decidir si una mayor elección arquitectónica justifica operar una relación más distribuida con los proveedores. Algunos preferirán un servicio en la nube que oculte la instalación bajo una API.
Otros valorarán el control directo, la residencia local de los datos o la independencia de una plataforma en la nube. Los proyectos de IA soberana y los proveedores de nube especializados tienen una probabilidad especialmente alta de examinar esa opción.
Esta tensión hace que la estrategia de AMD sea creíble, pero incompleta. Schneider Electric ha reducido una categoría de incertidumbre. Los despliegues de clientes deben demostrar ahora si el sistema combinado funciona de forma consistente fuera de un entorno modelado.
Tres señales mostrarán si AMD puede cerrar la brecha de infraestructura
La siguiente fase depende de evidencia operativa, entrega por parte de los socios y adopción repetible por los clientes, en lugar de otra ronda de afirmaciones arquitectónicas.
La primera señal es un despliegue de cliente terminado que utilice el diseño de Schneider Electric. La evidencia más sólida incluiría densidad de rack medida, tiempo de puesta en marcha, rendimiento de refrigeración, disponibilidad y PUE ante cambios realistas de carga de trabajo.
Un piloto confirmaría que el plano puede salir del entorno de diseño. Varios despliegues en climas y tipos de instalaciones distintos respaldarían una conclusión más sólida sobre la repetibilidad.
Un resultado cercano al PUE de 1,12 declarado a plena carga reforzaría el argumento de eficiencia de las empresas. Un resultado muy por encima de ese valor no invalidaría automáticamente el diseño, pero pondría de manifiesto la importancia de las condiciones del sitio.
Los compradores también deberían observar cómo gestionan los operadores los fallos y el mantenimiento. Un clúster de alta densidad debe seguir siendo mantenible cuando un CDU, una bomba, un componente eléctrico o una bandeja informática requiere atención.
La segunda señal es la entrega coordinada por parte de los socios de hardware y redes de AMD. Los aceleradores MI455X, los nuevos procesadores EPYC, las interfaces Vulcano, los conmutadores, los servidores y los equipos de las instalaciones deben llegar a los proyectos en calendarios compatibles.
Una arquitectura de referencia pierde valor si un componente esencial provoca un retraso prolongado. Por el contrario, una disponibilidad sincronizada demostraría que el modelo de socios de AMD puede comportarse como una plataforma coherente.
Las pruebas de interoperabilidad serán especialmente importantes. Los clientes necesitan evidencia de que los cambios en servidores, conmutadores, software, alimentación y refrigeración no crean ciclos repetidos de rediseño.
Los sistemas comerciales Helios de HPE proporcionarán una prueba temprana. Otros fabricantes de servidores u operadores de nube que adopten los mismos supuestos a nivel de rack reforzarían la estandarización.
La tercera señal es la adopción de cargas de trabajo frente a los TPU de Google y los sistemas de Nvidia. AMD no necesita que todos los compradores sustituyan esas plataformas. Necesita suficientes cargas de trabajo de producción para establecer Helios como una alternativa fiable.
Esa evidencia debería incluir aplicaciones de entrenamiento e inferencia, no solo resultados máximos de benchmarks. Los operadores examinarán el rendimiento útil, el esfuerzo de software, la disponibilidad del clúster, el consumo energético y la velocidad de expansión de capacidad.
El propio desarrollo de infraestructura de Google proporciona una referencia útil. Su larga trayectoria en refrigeración líquida muestra que el conocimiento operativo se acumula a lo largo de generaciones de hardware. AMD y Schneider Electric deben comenzar a construir un historial comparable a través de clientes y socios.
La comparación amd google seguirá siendo imperfecta porque las empresas ocupan posiciones distintas en el mercado. Google opera una nube integrada y una plataforma de silicio personalizado. AMD suministra una arquitectura abierta que otras empresas despliegan.
Sin embargo, ese contraste es precisamente por lo que importa el nuevo diseño. Ofrece a los compradores una elección entre consumir una plataforma integrada y ensamblar un sistema validado basado en socios bajo su control.
Nvidia también determinará el resultado. Sus sistemas a escala de rack, su base de software y sus alianzas de infraestructura establecen el referente de madurez de despliegue. Si Nvidia avanza más rápido, la arquitectura abierta de AMD deberá compensarlo mediante flexibilidad, disponibilidad o economía de las cargas de trabajo.
Schneider Electric tiene incentivos para respaldar cada plataforma principal. Esa posición neutral puede ayudar a los clientes a comparar los requisitos de las instalaciones sin tratar una hoja de ruta de aceleradores como permanente.
Para los equipos técnicos y de compras, la acción inmediata es concreta. Modelen primero las cargas de trabajo previstas y, después, prueben si el sitio elegido puede respaldar sus requisitos eléctricos, térmicos, de red y de resiliencia.
Los equipos que evalúan grandes anuncios de infraestructura también necesitan una forma duradera de conectar las hipótesis de ingeniería con evidencia operativa posterior. Una base de conocimiento técnico con capacidad de búsqueda puede mantener accesibles los documentos de diseño, los resultados de pruebas y las decisiones de proveedores a medida que cambian los proyectos.
El diseño de Schneider Electric no resuelve la carrera de los aceleradores. Lleva a AMD a la etapa más difícil, en la que las especificaciones de rack deben resistir los límites de la red eléctrica, los calendarios de construcción, los fallos de refrigeración y las cargas de trabajo de producción.
¿Publicarán los clientes de Helios resultados medidos que coincidan con el plano, y entregarán los socios cada capa a tiempo? Esas son las pruebas que ahora importan. Observe los primeros sitios en operación, la disponibilidad coordinada de hardware y la adopción de cargas de trabajo antes de declarar un ganador en la carrera de infraestructura AMD Google.


