top of page

La expansión Colossus 2 de xAI de Elon Musk pone a prueba los límites de la infraestructura de IA

25 sept
14 min de lectura

Elon Musk afirma que la expansión de xAI Colossus 2 podría más que duplicar el número de chips Nvidia del clúster antes de que termine 2026. La promesa convertiría una instalación de IA ya enorme en una prueba mucho mayor de energía, refrigeración, redes y disciplina operativa.

La cifra principal sigue siendo menos segura de lo que parece a primera vista. xAI no ha publicado un inventario detallado que indique cuántos procesadores están instalados, conectados y disponibles para cargas de trabajo sostenidas. Las estimaciones independientes también distinguen entre chips físicos y capacidad de cómputo equivalente a H100, que ajusta los procesadores más nuevos según su mayor rendimiento.

Esa diferencia importa porque el clúster de IA de Elon Musk ya no atiende únicamente a los modelos Grok de xAI. Según informes, la capacidad de Colossus ha atraído a clientes como Anthropic y Reflection, situando a xAI dentro del mercado de computación de IA externa. Más chips podrían reforzar esa posición, pero solo si la infraestructura circundante mantiene el ritmo.

La expansión de xAI Colossus 2 es una afirmación, no una actualización completada

Musk ha establecido una dirección para fin de año, pero la evidencia pública aún no confirma el recuento final de chips ni la capacidad operativa.

Según un informe de Bloomberg del 25 de septiembre, Musk dijo que Colossus 2 podría más que duplicar su número actual de procesadores Nvidia. La declaración describe un posible resultado, no un despliegue ya completado.

Varios detalles básicos siguen sin divulgarse. Musk no proporcionó un recuento inicial verificado, un objetivo preciso para fin de año ni un desglose por generación de procesadores Nvidia. Tampoco aclaró si “duplicar” se refiere a hardware comprado, entregado, instalado, conectado en red u operativo.

Esas etapas no son intercambiables. Un procesador puede llegar a un centro de datos mucho antes de integrarse en un clúster de producción. Los servidores deben ensamblarse, probarse, conectarse a equipos de red, recibir suministro eléctrico e integrarse con sistemas de refrigeración.

Colossus 2 es un clúster de computación de IA, es decir, una gran colección de procesadores conectados para entrenar y operar modelos de aprendizaje automático. Su utilidad depende de todo el sistema, no del número de procesadores almacenados dentro de sus edificios.

Epoch AI estima actualmente que Colossus 2 contiene 440.000 procesadores Nvidia. Su modelo de instalación reparte esa estimación entre 110.000 chips B200 y 330.000 chips B300. La organización describe esas cifras como estimaciones basadas en imágenes satelitales, modelos de refrigeración, divulgaciones de la empresa e imágenes de drones.

Si esa estimación refleja con precisión el hardware operativo, más que duplicar la flota exigiría que Colossus 2 superara los 880.000 procesadores. La formulación de Musk permite un total aún mayor. Sin embargo, ni xAI ni Nvidia han confirmado de forma independiente esa interpretación.

Epoch AI proyecta un aumento menor a corto plazo, hasta unos 722.200 procesadores durante el primer trimestre de 2027. Su proyección puede cambiar a medida que aparezcan nuevas imágenes, divulgaciones o equipos. La diferencia entre esa estimación y la ambición declarada por Musk ilustra la incertidumbre central.

La cifra también puede resultar confusa cuando los analistas traducen los procesadores más nuevos a equivalentes H100. Esa medida estima cuánto rendimiento de clase H100 más antiguo representa un sistema moderno. No significa que la instalación contenga físicamente esa cantidad de procesadores H100.

Epoch AI estima que el hardware actual ofrece unos 1,11 millones de equivalentes H100. Un lector que confunda ese total ajustado por rendimiento con un inventario físico podría concluir que Colossus 2 ya supera el millón de chips instalados.

El historial público de xAI fomenta la atención sobre la escala bruta. Su resumen oficial de Colossus indica que el sistema original alcanzó 200.000 GPUs después de comenzar con 100.000. La empresa también presenta una hoja de ruta a más largo plazo hacia un millón de GPUs.

El Colossus original y Colossus 2 son instalaciones, configuraciones y fases de despliegue diferentes. Las cifras que describen uno no deben aplicarse automáticamente al otro. Las declaraciones públicas a veces utilizan “Colossus” de forma general, lo que genera margen adicional para la confusión.

Por eso, la expansión de xAI Colossus 2 debe considerarse un objetivo de despliegue. El anuncio establece la dirección y el calendario previstos por Musk. No aporta evidencia suficiente para certificar la base actual ni el total operativo final.

Para Nvidia, la señal comercial sigue siendo significativa. Incluso una expansión incompleta representa demanda de procesadores, equipos de red y sistemas a escala de rack. Sin embargo, el resultado operativo dependerá de una infraestructura que Nvidia no puede proporcionar por sí sola.

Más chips Nvidia presionan la energía y la refrigeración

El factor limitante está pasando de adquirir aceleradores a operarlos de forma fiable al mismo tiempo.

Los procesadores de IA consumen electricidad y producen calor que debe eliminarse de forma continua. Por tanto, añadir cientos de miles de chips exige más que espacio físico. El operador necesita subestaciones, turbinas o conexiones a la red eléctrica, equipos de refrigeración, redes, sistemas de respaldo y personal capacitado.

Epoch AI estima que Colossus 2 admite actualmente 946 megavatios de potencia de tecnología de la información. Proyecta 1.531 megavatios para el primer trimestre de 2027. Esas cifras son estimaciones modeladas, no mediciones publicadas por xAI.

La escala sigue siendo útil para comprender el problema físico. Un megavatio equivale a un millón de vatios. Un gigavatio equivale a 1.000 megavatios, lo que sitúa a los mayores campus de IA en un rango antes asociado principalmente con grandes instalaciones industriales.

Un artículo de investigación que examinó más de 500 supercomputadoras de IA determinó que las necesidades energéticas de los sistemas líderes se duplicaron aproximadamente cada año entre 2019 y 2025. El mismo estudio sobre supercomputadoras concluyó que el rendimiento de los sistemas líderes se duplicaba aproximadamente cada nueve meses.

Esa relación histórica explica la estrategia de Musk. Más procesadores y procesadores más nuevos pueden elevar rápidamente el rendimiento informático total. La infraestructura física que los sostiene se desarrolla con un calendario distinto.

La construcción de centros de datos implica pedidos de equipos, coordinación con empresas de servicios públicos, revisiones de ingeniería, permisos ambientales y pruebas de puesta en marcha. Algunos componentes tienen largos plazos de fabricación. Un transformador, paquete de aparamenta eléctrica o instalación de refrigeración retrasados pueden impedir que servidores disponibles funcionen.

Colossus 2 ya ha enfrentado dudas sobre si su capacidad utilizable coincidía con las descripciones públicas. En enero, informes basados en análisis satelitales indicaron que la instalación tenía mucho menos equipo de refrigeración del que requeriría un sistema totalmente operativo a escala de gigavatios.

El análisis de refrigeración estimó que el sitio contaba entonces con unos 350 megavatios de capacidad de refrigeración. Cuestionó la descripción de Musk de Colossus 2 como el primer clúster de entrenamiento de un gigavatio del mundo.

Esa evaluación de enero no establece el estado de la instalación en septiembre. La construcción puede avanzar sustancialmente en ocho meses, especialmente en un proyecto que se mueve a la velocidad de Colossus. Sí demuestra por qué los recuentos de chips requieren evidencia de respaldo.

La capacidad de refrigeración no es solo una cuestión de comodidad o eficiencia. Los procesadores pueden reducir su frecuencia, apagarse u operar por debajo de su utilización prevista cuando no se puede eliminar el calor. Por tanto, una gran flota instalada puede ofrecer menos capacidad de cómputo útil de la que su especificación sugiere.

Las redes introducen otra restricción. Entrenar un modelo de frontera implica dividir cálculos entre muchos procesadores mientras se intercambian datos a alta velocidad. La congestión, los fallos de componentes o el software ineficiente pueden dejar costoso hardware esperando a otras partes del clúster.

El reto crece a medida que se expanden los clústeres. Más nodos crean más puntos potenciales de fallo y más tráfico que los ingenieros deben coordinar. Un sistema dos veces mayor no completa automáticamente todas las cargas de trabajo dos veces más rápido.

La memoria y el almacenamiento también importan. Las ejecuciones de entrenamiento trasladan grandes conjuntos de datos a los procesadores y guardan regularmente puntos de control, que preservan el estado de un modelo. Esas operaciones requieren suficiente ancho de banda para evitar ralentizar los procesadores.

Por tanto, la expansión de xAI Colossus 2 representa una prueba de ingeniería de sistemas. Las entregas de chips serán visibles y comercialmente significativas, pero la utilización sostenida revelará si la infraestructura realmente se duplicó.

Esta distinción presiona a xAI, no solo a Nvidia. Nvidia puede enviar procesadores y productos de red. xAI debe convertir esos componentes en un servicio informático fiable mientras la construcción continúa a su alrededor.

Nvidia gana el pedido, mientras xAI asume el riesgo de ejecución

La tensión principal no enfrenta a xAI con otro proveedor de chips; enfrenta la promesa de escala de Musk con el trabajo físico necesario para cumplirla.

Musk ha reforzado recientemente la dependencia de xAI de Nvidia. Dijo que sus empresas planeaban utilizar exclusivamente GPUs de Nvidia porque las consideraba la mejor opción disponible. Esa postura reduce la relevancia de un simple enfoque Nvidia frente a AMD para este proyecto concreto.

La elección da a xAI acceso a la pila informática integrada de Nvidia. Esa pila combina procesadores, interconexiones de alta velocidad, hardware de red, software de sistemas y la plataforma de programación CUDA utilizada por muchos desarrolladores de IA.

Un proveedor integrado puede simplificar el despliegue. Los ingenieros reciben componentes diseñados para funcionar juntos, mientras los desarrolladores pueden reutilizar software y herramientas de optimización familiares. Esas ventajas cobran más valor cuando un operador quiere expandirse rápidamente.

La dependencia también concentra el riesgo. Un retraso que afecte a los sistemas Nvidia, la memoria de apoyo, el ensamblaje de servidores o los equipos de red puede influir en todo el calendario. xAI no puede sustituir fácilmente un acelerador distinto sin cambiar el software y los diseños de sistema.

Nvidia se beneficia tanto si Colossus 2 admite modelos de xAI como clientes externos. Cada nuevo despliegue refuerza la demanda de su hardware y software. Una expansión exitosa también demostraría que los sistemas Nvidia pueden operar dentro de clústeres que se acercan a un tamaño sin precedentes.

La pregunta más difícil se refiere al retorno de xAI sobre la capacidad instalada. Entrenar Grok es un uso, pero un clúster de este tamaño necesita un flujo sostenido de cargas de trabajo valiosas. De lo contrario, la utilización puede caer incluso cuando aumenta el número de activos físicos.

Los contratos externos ofrecen una respuesta. Reflection, una startup de IA de código abierto respaldada por Nvidia, firmó un acuerdo para acceder al hardware de Colossus 2. Un artículo de Axios indicó que el acuerdo incluye procesadores Nvidia GB300.

El mismo informe afirmó que también se esperaba que Anthropic y Google utilizaran capacidad informática controlada por Musk. Esas relaciones hacen que el panorama competitivo sea inusual. Las empresas que compiten con xAI en la capa de modelos pueden convertirse en clientes en la capa de infraestructura.

Ese acuerdo cambia la economía del clúster de IA de Elon Musk. Colossus 2 puede respaldar a Grok y, al mismo tiempo, funcionar en parte como proveedor de capacidad de cómputo. Alquilar capacidad puede mejorar la utilización cuando xAI no necesita todos los procesadores para sus propias ejecuciones de entrenamiento.

También crea cuestiones de asignación. xAI debe decidir qué clientes reciben procesadores escasos, cómo se aíslan las cargas de trabajo y si los proyectos internos tienen prioridad. Esas decisiones se vuelven más difíciles durante períodos de entrenamiento intensivo de modelos.

A los clientes empresariales les importará menos el total de procesadores anunciado que la capacidad disponible. Necesitan fechas de inicio previsibles, niveles de servicio, controles de seguridad y un rendimiento estable. Una sala parcialmente puesta en marcha no satisface esos requisitos.

El giro hacia clientes externos también expone a xAI a las expectativas consolidadas de la nube. Amazon Web Services, Microsoft Azure y Google Cloud han dedicado años a construir sistemas de monitorización, facturación, cumplimiento y soporte en torno a la infraestructura informática.

Colossus 2 no necesita copiar todas las funciones de una nube de uso general. Aun así, debe ofrecer los controles operativos que exigen los laboratorios de IA sofisticados. La escala del hardware por sí sola no crea un servicio maduro.

Aquí es donde el método de construcción rápida de Musk afronta su prueba más exigente. El proyecto original Colossus demostró que xAI podía montar rápidamente un gran clúster. Duplicar un sistema mucho mayor mientras presta servicio a clientes requiere operaciones repetibles, no solo velocidad de construcción.

Un despliegue exitoso presionaría a los laboratorios de vanguardia que no disponen de un acceso directo equivalente al hardware. Necesitarían compromisos más profundos con la nube, más financiación o nuevos socios de infraestructura. También reforzaría a Nvidia al demostrar que los clientes siguen dispuestos a organizar instalaciones enormes en torno a su arquitectura.

Un despliegue parcial dejaría una lección distinta. Mostraría que la demanda de chips de Nvidia puede superar la capacidad de energizarlos y utilizarlos. En ese escenario, el pedido de procesadores seguiría beneficiando a Nvidia, mientras que el riesgo de calendario recaería en xAI.

El número de chips no mide la capacidad de cómputo útil

La pregunta sin responder más importante es qué parte de Colossus 2 puede operar de forma fiable con cargas de trabajo reales.

El debate público suele reducir la infraestructura de IA a un recuento de procesadores. Esa métrica es fácil de comunicar, pero oculta diferencias en la generación de chips, el estado de la energía, las redes, la eficiencia de las cargas de trabajo y la disponibilidad.

Un B300 no equivale a un H100. Los procesadores más nuevos pueden ofrecer mayor rendimiento y capacidad de memoria para algunas cargas de trabajo. Por tanto, comparar totales físicos sin tener en cuenta la combinación de hardware puede distorsionar el progreso.

Las estimaciones equivalentes a H100 abordan parte de ese problema, pero siguen siendo modelos. El rendimiento real depende de la precisión, la arquitectura del modelo, los patrones de comunicación y la optimización del software. Una relación de conversión no puede predecir todas las cargas de trabajo de producción.

La capacidad instalada también difiere de la capacidad efectiva. Los servidores pueden estar en pruebas, esperando conexiones de red o reservados para clientes concretos. Algunos procesadores estarán fuera de línea por mantenimiento en cualquier momento.

La utilización mide qué parte de la capacidad informática disponible realiza trabajo útil. Un clúster puede contener una cantidad extraordinaria de chips y, aun así, generar un rendimiento modesto si las cargas de trabajo no pueden mantener ocupados esos procesadores.

Una utilización elevada tampoco es automáticamente ideal. Los operadores necesitan capacidad de reserva para fallos, mantenimiento, picos de demanda y planificación de cargas de trabajo. El objetivo significativo es una operación fiable y económicamente útil, no un único porcentaje.

xAI no ha publicado un historial completo de utilización de Colossus 2. Tampoco ha divulgado resultados de pruebas de rendimiento independientes que cubran todo el sistema. Por ello, los lectores deberían evitar tratar la expansión anunciada como prueba de una mejora proporcional del modelo.

Por lo general, más capacidad de cómputo ofrece a un laboratorio opciones adicionales. Los equipos pueden entrenar modelos más grandes, utilizar más datos, realizar más experimentos o atender a más usuarios. También pueden dedicar la capacidad al posentrenamiento, la generación de datos sintéticos y la inferencia.

La inferencia es el proceso de ejecutar un modelo entrenado para responder solicitudes. Presenta patrones de tráfico distintos del entrenamiento, que normalmente coordina un gran número de procesadores durante períodos prolongados. Una base de clientes diversa puede ayudar a xAI a equilibrar esos tipos de cargas de trabajo.

Sin embargo, convertir más procesadores en mejores productos requiere más que infraestructura. xAI necesita datos adecuados, diseños de modelos, métodos de entrenamiento, sistemas de evaluación y distribución de productos. La capacidad de cómputo puede ampliar el espacio de búsqueda sin garantizar que los investigadores encuentren un modelo mejor.

La misma cautela se aplica a las afirmaciones competitivas. Un clúster mayor no demuestra que Grok superará a los modelos de OpenAI, Anthropic o Google. Los competidores pueden mejorar los algoritmos, la calidad de los datos, los métodos de inferencia y el hardware personalizado.

La escala aún puede generar una ventaja. Una empresa con más capacidad de cómputo utilizable puede realizar más experimentos y atender más demanda. También puede entrenar varias variantes de modelos sin esperar a que haya capacidad disponible.

La salvedad es “utilizable”. Si el suministro eléctrico, la refrigeración o las redes impiden la operación simultánea, la flota nominal exagera la ventaja. Si los clientes externos reservan una capacidad considerable, el total también exagera lo que queda disponible para xAI.

Las cuestiones ambientales y regulatorias añaden otra incertidumbre. Las instalaciones de Colossus han utilizado turbinas de gas natural in situ para acelerar el despliegue eléctrico. Grupos comunitarios y reguladores han cuestionado los permisos y la contaminación asociados con algunas unidades temporales.

SpaceXAI ha dicho que retirará 69 generadores temporales mientras entra en funcionamiento una instalación eléctrica permanente. Los informes sobre la transición de las turbinas indican que se espera que el proceso de retirada continúe hasta 2027.

Esa transición coincide con el objetivo de chips de Musk para fin de año. xAI debe ampliar la capacidad informática mientras modifica parte del sistema energético que sustenta sus instalaciones. Los proyectos pueden avanzar juntos, pero sus calendarios están vinculados por la electricidad que requieren los procesadores.

El impacto local merece atención independientemente de la historia competitiva de la IA. La generación adicional puede afectar a la calidad del aire, el ruido, el uso del suelo, la planificación del agua y la infraestructura de transmisión. Las comunidades experimentan esos costes incluso cuando la capacidad de cómputo atiende a clientes en otros lugares.

xAI puede sostener que una generación permanente y autorizada ofrece una vía operativa más clara que las turbinas temporales. La prueba práctica será si el equipo se retira según lo previsto y la capacidad de reemplazo cumple los requisitos legales y técnicos.

Por tanto, la evidencia disponible respalda una conclusión prudente. La expansión de xAI Colossus 2 es creíble como una ambición respaldada por construcción y una fuerte demanda de Nvidia. Su escala final, fecha de operación y rendimiento utilizable siguen sin verificarse.

Tres señales mostrarán si Musk cumple el objetivo de fin de año

Los inventarios de chips, la infraestructura de apoyo y las cargas de trabajo de los clientes ofrecerán un veredicto mejor que otra cifra llamativa.

La primera señal es un desglose de hardware verificado. xAI, Nvidia o una presentación regulatoria tendrían que identificar las generaciones de procesadores y distinguir entre sistemas pedidos, entregados, instalados y operativos.

Esa divulgación resolvería la mayor ambigüedad de la declaración de Musk. Si los procesadores Nvidia operativos superan el doble de la referencia de septiembre, la afirmación central se vería reforzada. Si xAI informa únicamente de compras o entregas previstas, la afirmación seguirá siendo incompleta.

Las estimaciones independientes seguirán siendo importantes. Las imágenes satelitales pueden mostrar nuevos equipos de refrigeración, instalaciones eléctricas y edificios terminados. No pueden demostrar directamente que todos los servidores estén conectados o ejecutando una carga de trabajo de producción.

La evidencia más sólida combinaría un inventario de la empresa con infraestructura observable y datos técnicos de operación. Incluso divulgaciones limitadas sobre capacidad conectada, escala de red o salas puestas en marcha mejorarían la confianza.

La segunda señal es el progreso en energía y refrigeración. Epoch AI proyecta actualmente un crecimiento considerable tanto de la capacidad informática como de la potencia de tecnologías de la información a principios de 2027. Las actualizaciones de esas estimaciones pueden mostrar si la construcción física respalda el calendario más acelerado de Musk.

Los lectores deberían estar atentos a subestaciones terminadas, generación permanente, nuevos conjuntos de refrigeración y aprobaciones regulatorias. Estas incorporaciones reforzarían la idea de que los chips pueden operar juntos en lugar de esperar a que las instalaciones estén listas.

Los retrasos debilitarían la afirmación de fin de año sin reducir necesariamente la escala final. xAI podría poseer o instalar procesadores que permanezcan indisponibles hasta que se pongan en marcha los sistemas de apoyo. La distinción debe mantenerse explícita en futuras coberturas.

La transición de las turbinas forma parte de esta señal. La generación temporal ayudó a acelerar el despliegue, pero xAI afronta ahora presión para sustituir el equipo cuestionado. El avance hacia energía permanente autorizada reduciría la incertidumbre legal y operativa.

La tercera señal es una actividad sostenida de clientes y modelos. Nuevas ejecuciones de entrenamiento de Grok, grandes despliegues de inferencia o contratos externos ampliados indicarían que Colossus 2 está generando resultados útiles.

Los anuncios de clientes deberían incluir suficiente detalle para identificar el hardware o la capacidad implicados. Una declaración amplia de asociación no demuestra que ya esté activa una gran asignación. Las fechas de inicio, los tipos de procesador y las descripciones de cargas de trabajo aportarían evidencia más sólida.

Anthropic y Reflection son especialmente relevantes porque sus cargas de trabajo pueden demostrar una demanda más allá de xAI. Si amplían su uso del sitio mientras continúa el desarrollo de Grok, Colossus 2 se parecerá más a una plataforma informática duradera.

Si los despliegues de clientes se retrasan, la expansión puede estar avanzando más lentamente de lo que sugiere el número de procesadores. También podría indicar que la integración, la planificación o la preparación del servicio se han convertido en el cuello de botella.

Estas tres señales deben evaluarse conjuntamente. Un inventario mayor sin energía es infraestructura inacabada. Más energía sin cargas de trabajo activas es capacidad infrautilizada. La demanda de clientes sin hardware entregado es una promesa pendiente de ejecución.

La lección más amplia para la industria va más allá de xAI. El desarrollo de IA de vanguardia está llevando los centros de datos a escalas eléctricas y físicas que tensionan los calendarios tradicionales de construcción. La carrera se está convirtiendo en una competencia por sistemas operativos completos, no solo por procesadores.

Nvidia sigue siendo central porque su hardware y software conectan gran parte de ese sistema. Sin embargo, cada pedido adicional aumenta la carga para los clientes de proporcionar electricidad, refrigeración, redes, financiación y experiencia operativa.

Musk ha demostrado repetidamente su disposición a comprimir los calendarios de infraestructura. Colossus 2 pone ahora a prueba si ese enfoque funciona cuando el clúster ya se cuenta en cientos de miles de procesadores y atiende a clientes externos.

La expansión de xAI Colossus 2 será significativa solo cuando el hardware prometido realice trabajo útil a escala. Observe primero el inventario verificado, después la energía y la refrigeración de apoyo, y en tercer lugar las cargas de trabajo reales de los clientes. Esos indicadores mostrarán si Musk duplicó una plataforma de IA funcional o si, principalmente, amplió la cifra asociada a ella.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page