top of page

La apuesta de VAST Data por AMD Blocks desafía el control de Nvidia sobre la infraestructura de IA

VAST Data ha ampliado su asociación con AMD a seis capas de infraestructura, convirtiendo la propuesta de amd blocks en un desafío directo a los sistemas de IA centrados en Nvidia.

El acuerdo conecta el AI Operating System de VAST con procesadores AMD EPYC de sexta generación, GPU Instinct, racks Helios, redes Pensando, software ROCm y almacenamiento compartido para inferencia. VAST también utilizará chips EPYC en su próximo hardware CBox y EBox.

Este alcance importa más que otro anuncio de compatibilidad. VAST ya mantiene estrechos vínculos con Nvidia y con los proveedores de nube que despliegan aceleradores de Nvidia. Ahora está construyendo una vía con AMD que abarca desde los datos almacenados hasta los tokens generados.

El cambio refleja una transformación más amplia del gasto en IA. El entrenamiento sigue siendo importante, pero las empresas necesitan cada vez más infraestructura para inferencia continua, agentes de razonamiento y aplicaciones basadas en recuperación de información. Estas cargas de trabajo mueven repetidamente modelos, prompts y contexto reutilizable entre almacenamiento, memoria, CPU y GPU.

AMD aporta los componentes de cómputo. VAST quiere coordinar los datos que los rodean. Si su diseño funciona bajo cargas de producción, los compradores obtendrán una alternativa más completa al modelo de infraestructura integrada de Nvidia.

La cuestión central no es si AMD puede ofrecer un acelerador rápido. Es si AMD y sus socios pueden lograr que un sistema de IA completo se comporte como un solo producto.

La asociación AMD Blocks va más allá del soporte para GPU

VAST está tratando a AMD como una base de infraestructura, no como una opción de acelerador añadida al final de un ciclo de ventas.

La colaboración ampliada se dio a conocer en torno al evento Advancing AI 2026 de AMD, celebrado en San Francisco el 22 y 23 de julio. Las empresas describieron una plataforma común para entrenamiento, inferencia, aprendizaje por refuerzo e IA agéntica.

El primer compromiso se refiere a los propios appliances de VAST. Los procesadores EPYC de sexta generación, antes conocidos con el nombre en clave Venice, impulsarán la sexta generación de sistemas VAST CBox y la tercera generación de sistemas EBox.

Los sistemas CBox ejecutan servicios de datos y operaciones de metadatos dentro de la arquitectura de VAST. Los sistemas EBox proporcionan la capacidad de almacenamiento subyacente y las rutas de datos. Incorporar procesadores EPYC a ambas líneas de productos otorga a AMD un papel dentro de la plataforma de VAST, incluso cuando los clientes utilizan otros aceleradores.

La nueva generación de EPYC admite PCI Express 6.0. Esta interconexión proporciona el doble de ancho de banda teórico que PCI Express 5.0, lo que puede mejorar el movimiento entre procesadores, almacenamiento, dispositivos de red y aceleradores conectados.

VAST afirma que el ancho de banda adicional debería ayudar a sus servicios de archivos, objetos, bases de datos, almacenes de datos y streaming de eventos. Sin embargo, el rendimiento de las aplicaciones seguirá dependiendo del comportamiento del software, la profundidad de cola, el diseño de red y la concurrencia de las cargas de trabajo.

La colaboración también abarca una arquitectura de referencia para infraestructura de IA desarrollada con DriveNets. El diseño combina VAST AI OS, sistemas Helios a escala de rack de AMD y redes DriveNets AI Fabric.

Una arquitectura de referencia es un patrón de despliegue documentado con elecciones de componentes, pautas de dimensionamiento y conexiones validadas. Reduce el trabajo de diseño, pero no demuestra que la carga de trabajo de todos los clientes alcanzará el mismo objetivo de rendimiento.

La orientación prevista abarca entrenamiento de modelos, inferencia, aprendizaje por refuerzo y cargas de trabajo de caché clave-valor. Una caché clave-valor, normalmente abreviada como caché KV, almacena datos de atención que un modelo de lenguaje puede reutilizar al generar tokens posteriores.

TensorMesh y EmbeddedLLM participan en trabajo adicional de inferencia. Su implicación extiende el proyecto más allá de la certificación de procesadores, hacia el despliegue de software para aplicaciones de agentes en producción.

La cobertura original también menciona a siete proveedores de nube de IA que utilizan servicios relacionados con AMD: 5C, Core42, Crusoe, EmbeddedLLM, Phanos.AI, TensorWave y Vultr.

Esa lista de clientes muestra actividad de despliegue existente, pero no revela cuánta capacidad opera cada proveedor. Tampoco establece si los clientes utilizan el diseño completo de VAST, AMD y DriveNets.

Aun así, el alcance de los compromisos hace que esto vaya más allá de una insignia de certificación. AMD entra en la hoja de ruta de productos de VAST, su arquitectura de referencia, su software de inferencia y la narrativa de despliegue de sus clientes.

Por tanto, la asociación crea una prueba medible. Los compradores pueden evaluarla mediante sistemas lanzados, diseños documentados, benchmarks públicos y referencias de producción, en lugar de declaraciones generales sobre apertura.

La inferencia convierte el contexto almacenado en un problema de cómputo

La asociación llega ahora porque la inferencia convierte el movimiento de datos en parte de la ruta crítica de cada respuesta.

El entrenamiento tradicional de modelos concentra una enorme capacidad de cómputo en ejecuciones programadas. La inferencia en producción se comporta de otra manera. Atiende muchas solicitudes simultáneas, mantiene el contexto del usuario, recupera información externa y, a menudo, genera largas secuencias de razonamiento.

Este patrón puede dejar a los aceleradores costosos esperando. Una GPU puede contar con suficiente capacidad aritmética y aun así detenerse mientras el sistema carga los pesos del modelo, recupera documentos o reconstruye contexto generado previamente.

VAST sostiene que la inferencia es, fundamentalmente, un problema de datos. La afirmación es razonablemente creíble en términos generales, aunque el cómputo, las redes y la planificación del software siguen siendo igual de importantes en muchos despliegues.

Los prompts largos y las conversaciones de varios turnos amplían la caché KV asociada a cada solicitud activa. Mantener todas las entradas de caché en la memoria de la GPU ofrece baja latencia, pero la memoria de los aceleradores es limitada y costosa.

Eliminar la caché ahorra espacio, pero obliga al modelo a recalcular estados de atención anteriores. Mover entradas seleccionadas a la memoria del host o al almacenamiento compartido crea otra opción, siempre que el sistema pueda recuperarlas con suficiente rapidez.

VAST y AMD están probando esa tercera vía. Su integración combina GPU Instinct, AMD Infinity Context, software ROCm y almacenamiento VAST para descargar entradas reutilizables de caché KV.

La ruta de datos utiliza la tarjeta de interfaz de red Pensando Pollara 400 de AMD. Mueve información entre la memoria de la GPU y el almacenamiento NVMe de VAST mediante NFS usando TCP o acceso remoto directo a memoria.

El acceso remoto directo a memoria, o RDMA, permite que un sistema acceda a la memoria de otro con una intervención limitada de la CPU. En la red adecuada, puede reducir la latencia y la sobrecarga del procesador durante transferencias repetidas.

VAST también planea controles automatizados del ciclo de vida de la caché. Los administradores podrían aplicar políticas que expiren y eliminen el contexto almacenado que contenga información personal, confidencial o regulada.

Esta función aborda una consecuencia menos visible de la descarga de caché. Una vez que el estado transitorio del modelo pasa al almacenamiento compartido, se convierte en datos gobernados en lugar de memoria temporal de GPU.

Las empresas deben saber qué usuario o aplicación creó la caché, cuánto tiempo permanece disponible y si otro tenant puede acceder a ella. También necesitan controles de eliminación que funcionen entre réplicas y sistemas de recuperación.

El contexto compartido podría mejorar la utilización en varias situaciones. Un agente de atención al cliente podría reutilizar un extenso manual de producto en miles de conversaciones. Un asistente de programación podría conservar el contexto de un repositorio entre tareas relacionadas.

Un sistema de investigación podría preservar documentos procesados mientras varios agentes examinan la misma evidencia. Un servicio de razonamiento podría mover conversaciones inactivas fuera de la memoria del acelerador y restaurarlas cuando los usuarios regresen.

Estos escenarios explican por qué los proveedores de almacenamiento se están acercando al software de inferencia. Su función ya no termina cuando un checkpoint de modelo llega a un clúster de GPU.

La arquitectura de VAST, llamada Disaggregated Shared Everything, separa los recursos de cómputo y almacenamiento mientras presenta un espacio de datos común. La empresa afirma que este modelo admite múltiples protocolos, tenants aislados y un espacio de nombres global.

El diseño encaja con las nubes de IA que deben atender a muchos clientes desde una infraestructura común. También crea más dependencias entre las capas de almacenamiento, red, runtime y aceleradores.

VAST informó de pruebas iniciales con una GPU Instinct MI355X. La empresa afirma que la descarga remota de caché proporcionó una mejora de nueve veces en el tiempo hasta el primer token y un rendimiento de tokens 9,7 veces mayor.

El tiempo hasta el primer token mide el retraso antes de que un modelo comience a responder. El rendimiento de tokens mide cuánto output generado produce el sistema a lo largo del tiempo, especialmente bajo demanda simultánea.

Estas cifras procedían de una comparación específica entre la descarga de caché a memoria local del host y una partición VAST remota mediante NFS con RDMA. No eran resultados frente a hardware de Nvidia ni un entorno de producción completo.

La distinción es importante. Las cifras respaldan un mecanismo de almacenamiento en condiciones probadas. No demuestran que cada despliegue de VAST y AMD vaya a producir una mejora de nueve veces.

Aun así, el experimento identifica el mecanismo detrás de la asociación. Las empresas no afirman que el almacenamiento haga que una GPU sea intrínsecamente más rápida. Intentan reducir el trabajo repetido y mantener ocupados a los aceleradores.

AMD necesita socios para contrarrestar la pila integrada de Nvidia

La principal competencia enfrenta un sistema AMD abierto, construido por socios, con la pila de infraestructura estrechamente coordinada de Nvidia.

La ventaja de Nvidia va más allá del rendimiento de los aceleradores. CUDA, las redes, los sistemas, las bibliotecas, las herramientas de despliegue y el conocimiento operativo consolidado reducen la fricción para los compradores.

Esa base instalada determina las decisiones de compra. Una empresa que elige Nvidia a menudo puede encontrar ingenieros experimentados, frameworks probados, capacidad de nube gestionada y plantillas de despliegue existentes.

AMD ha abordado el mismo problema construyendo una mayor parte de la plataforma circundante. Su estrategia combina CPU EPYC, GPU Instinct, redes Pensando, racks Helios y software ROCm.

VAST cubre una brecha notable en ese conjunto. Proporciona servicios de datos capaces de alimentar aceleradores, alojar activos de modelos, gestionar el contexto de inferencia y respaldar aplicaciones en torno a los modelos.

La lógica competitiva es clara. AMD no necesita poseer cada capa si sus socios pueden integrar esas capas en un sistema coherente.

Ese enfoque puede preservar la capacidad de elección de los compradores. Una nube de IA podría combinar hoy los servicios de datos de VAST con aceleradores AMD y conservar cierta capacidad de Nvidia para cargas de trabajo ligadas a CUDA.

VAST también se beneficia al evitar la dependencia de un único proveedor de GPU. Sus clientes quieren cada vez más acceso a varios tipos de aceleradores porque la disponibilidad, la adecuación a la carga de trabajo y los requisitos de software difieren.

La empresa no está abandonando Nvidia. Su trabajo más profundo con AMD, en cambio, posiciona a VAST como una infraestructura de datos común para flotas heterogéneas de IA.

Esto convierte la estrategia de amd blocks en una forma de competencia modular. Cada bloque tiene una función definida, pero el sistema completo depende de estándares e ingeniería entre proveedores.

AMD ha repetido ese patrón en otros ámbitos. Su asociación con Nutanix combina EPYC, Instinct, ROCm, orquestación en la nube y gestión del ciclo de vida empresarial.

AMD comprometió una inversión de capital y financiación de ingeniería en ese acuerdo. La estructura comercial difiere del anuncio de VAST, pero ambos se dirigen a empresas que buscan una alternativa a las plataformas de IA integradas verticalmente.

AMD también ha trabajado con Red Hat, Oracle, Microsoft, importantes desarrolladores de modelos y proyectos de software de inferencia. Su ecosistema de software incluye frameworks y proveedores de modelos que pueden reducir las brechas de compatibilidad a nivel de aplicación.

VAST contribuye en un nivel diferente. Se centra en el camino desde la información almacenada hasta el contexto activo del modelo, donde un movimiento ineficiente de datos puede borrar las ganancias aportadas por procesadores más rápidos.

El diseño Helios de AMD eleva aún más la apuesta. Helios integra CPU, GPU, redes y software en un sistema a escala de rack, en lugar de pedir a los clientes que ensamblen servidores aceleradores por su cuenta.

El analista independiente Steve McDowell describió la configuración Helios de 2026 como 72 GPU MI455X y 18 CPU Venice en un rack con refrigeración líquida. Su análisis de Helios plantea el desafío de AMD como la conversión de los avances de hardware en capacidad desplegada comparable con la escala de Nvidia.

La arquitectura de referencia de VAST y DriveNets rodea ese rack con datos y redes de escalado horizontal. En conjunto, esos componentes acercan a AMD a un sistema que se puede comprar, en lugar de un catálogo de chips.

Sin embargo, la modularidad introduce costes de coordinación. Los clientes necesitan firmware, controladores, ajustes de red, políticas de almacenamiento, versiones de runtime, observabilidad y escalamiento de soporte alineados.

Nvidia puede resolver más de estos problemas dentro de una única estructura corporativa. Un diseño basado en AMD distribuye la responsabilidad entre varias empresas.

Esa diferencia es la principal contrapartida. Una pila construida por socios ofrece flexibilidad y capacidad de negociación, pero su experiencia operativa debe acercarse a la consistencia de una plataforma estrechamente integrada.

VAST puede reducir esa carga mediante diseños de referencia documentados y configuraciones probadas. No puede eliminar la necesidad de soporte conjunto entre proveedores independientes.

La presión de mercado recae primero sobre los proveedores de nube de IA centrados en Nvidia y las empresas que planifican su próximo ciclo de capacidad. Ahora tienen otra arquitectura que evaluar antes de ampliar una infraestructura de un solo proveedor.

También presiona a AMD. Las asociaciones públicas elevan las expectativas sobre sistemas disponibles, benchmarks repetibles y clientes dispuestos a ejecutar cargas de trabajo valiosas fuera del entorno de Nvidia.

El resultado de 9,7x necesita una comprobación de realidad en producción

El benchmark de caché de VAST es alentador, pero su línea de base limitada no puede resolver por sí sola el caso de negocio de la arquitectura combinada.

La ganancia de rendimiento reportada de 9,7 veces compara dos métodos de colocación de caché dentro de una prueba basada en AMD. No compara sistemas completos de AMD y Nvidia, ni divulga un benchmark estándar del sector.

Muchos detalles pueden cambiar el resultado. El tamaño de la caché, la longitud del prompt, la concurrencia de solicitudes, la arquitectura del modelo, la memoria de host disponible, la distancia al almacenamiento, la congestión de red y la tasa de aciertos de caché afectan al rendimiento.

La elección de la línea de base importa especialmente. La memoria local del host parece más rápida que el almacenamiento remoto, pero la presión de capacidad y los patrones de acceso pueden invertir esa expectativa bajo alta concurrencia.

Una partición remota de VAST puede agrupar capacidad entre servidores y conservar más contexto reutilizable. Si la línea de base de memoria local expulsa con frecuencia entradas útiles, el almacenamiento remoto puede evitar una recomputación considerable.

Ese es un beneficio válido a nivel de sistema. Aun así, exige que los compradores entiendan exactamente cuándo se produce.

VAST reconoce que las aceleraciones relativas dependen del hardware subyacente. Un sistema con distinta capacidad de cómputo o latencia de almacenamiento puede producir una proporción diferente.

Las cargas de trabajo de producción también mezclan tipos de solicitudes. Algunas conversaciones son breves y obtienen poco beneficio de una caché persistente. Otras contienen contextos amplios, pero se repiten con demasiada poca frecuencia como para justificar mantener su estado.

La reutilización de caché crea otra incertidumbre. La descarga de datos solo aporta valor cuando una solicitud posterior puede reutilizar la información almacenada más barato que recomputarla.

Por tanto, los administradores necesitan políticas de admisión y expulsión. El sistema debe decidir qué entradas merecen almacenamiento, cuáles deben permanecer en la memoria del acelerador y cuáles deben desaparecer.

Los controles de seguridad requieren el mismo escrutinio. Una caché KV almacenada puede codificar información sensible procedente de prompts, documentos recuperados y salidas anteriores del modelo.

Las políticas automatizadas de eliminación ayudan, pero los compradores necesitarán pruebas sobre aislamiento entre tenants, cifrado, registros de acceso, replicación, comportamiento de las copias de seguridad y borrado verificable.

La calidad de la inferencia también entra en juego. Una caché obsoleta o asociada incorrectamente podría producir resultados inválidos, contaminación entre usuarios o fallos difíciles de depurar.

El anuncio de colaboración describe la gestión del ciclo de vida, pero no publica un modelo de amenazas completo. Tampoco explica cómo funciona la aplicación de políticas en cada runtime de inferencia compatible.

La propiedad operativa sigue sin resolverse. Un problema de latencia podría originarse en ROCm, el servidor de modelos, las redes Pollara, la infraestructura DriveNets, la configuración de NFS, el software de VAST o la propia aplicación.

Las arquitecturas de referencia pueden definir versiones compatibles y procedimientos de diagnóstico. Las referencias de clientes revelarán si esos procedimientos funcionan durante incidentes reales.

La misma cautela se aplica a las declaraciones más amplias de rendimiento de AMD. Las pruebas internas pueden orientar la evaluación, pero los compradores deberían reproducir los resultados con sus modelos, prompts, concurrencia y objetivos de nivel de servicio.

Una empresa debe comparar el comportamiento total del sistema, no solo las especificaciones de los aceleradores. Las medidas importantes incluyen solicitudes completadas por rack, latencia hasta el primer token, latencia de tokens de salida, consumo energético, tasas de aciertos de caché, recuperación ante fallos y tiempo de ingeniería.

La colaboración ampliada describe una mayor eficiencia y rendimiento. No divulga precios para clientes, duración de los despliegues ni ahorros de producción auditados.

Esa ausencia es normal en un anuncio temprano de arquitectura. También significa que la conclusión comercial sigue abierta.

El enfoque amd blocks será creíble cuando varios clientes informen resultados de despliegue y operación predecibles. Una gran demostración en un evento de proveedor es útil, pero la repetibilidad genera confianza.

VAST y AMD también se enfrentan a un objetivo en movimiento. Nvidia sigue mejorando las redes, el software de inferencia, la integración de almacenamiento y los sistemas a escala de rack.

Otras empresas de almacenamiento persiguen la misma oportunidad de alimentar GPU. Weka, DDN, Dell, HPE, Pure Storage y las plataformas de datos nativas de la nube buscan desempeñar un papel mayor en la infraestructura de IA.

Por tanto, los clientes tienen más de dos opciones. Pueden utilizar una pila integrada de Nvidia, ensamblar sistemas basados en AMD u operar clústeres mixtos con infraestructura de datos independiente.

La ruta ganadora variará según la carga de trabajo. Una empresa vinculada a software específico de CUDA puede aceptar menos opciones de hardware para reducir el trabajo de migración.

Una nube de IA que sirve modelos abiertos con alta concurrencia puede valorar más la diversidad de aceleradores y la capacidad de caché compartida. Las grandes empresas pueden priorizar la responsabilidad de soporte y los controles de cumplimiento por encima de los ratios máximos de benchmark.

Estas distinciones impiden que el anuncio se convierta en una simple tabla de resultados AMD frente a Nvidia. Es una opción arquitectónica que debe ganarse su lugar mediante evidencia específica de cada carga de trabajo.

Tres señales mostrarán si la estrategia funciona

La siguiente fase depende de enviar sistemas de referencia, publicar resultados reproducibles y demostrar adopción más allá de las asociaciones anunciadas.

La primera señal es la disponibilidad de las próximas generaciones CBox y EBox de VAST con procesadores EPYC de sexta generación. Los sistemas comercializados convertirán un compromiso de hoja de ruta en equipos que los clientes puedan validar.

Los compradores deberían vigilar las configuraciones compatibles, las fechas de disponibilidad general, las rutas de actualización y la orientación para el despliegue. Una amplia disponibilidad reforzaría la afirmación de que AMD se está convirtiendo en una plataforma estándar de VAST.

Los retrasos o las configuraciones limitadas debilitarían esa conclusión. Sugerirían que la asociación sigue estando más avanzada en marketing que en operaciones de producto.

La segunda señal es la ampliación de las pruebas de caché KV. Una divulgación útil incluiría modelos, longitudes de contexto, niveles de concurrencia, tasas de aciertos de caché, topología de red y distribuciones de latencia.

La evidencia más sólida procedería de pruebas ejecutadas por clientes o de instrucciones de benchmark reproducibles. Los resultados en varios modelos y motores de inferencia mostrarían si el mecanismo se transfiere más allá de una carga de trabajo controlada.

Una mejora repetida reforzaría el argumento de tratar el almacenamiento compartido como infraestructura activa de inferencia. Ganancias menores o inconsistentes reducirían los casos de uso abordables por la tecnología.

La tercera señal es la adopción en producción de la arquitectura de referencia conjunta. Los clientes anunciados ya muestran interés en la capacidad de AMD, pero los despliegues del diseño completo importan más.

Busque clientes que conecten racks Helios, redes DriveNets, VAST AI OS e inferencia basada en ROCm en un entorno compatible. Sus informes operativos deberían incluir utilización, fiabilidad y tiempo de implementación.

La expansión entre clientes validaría la respuesta liderada por socios de AMD a la ventaja de integración de Nvidia. Los pilotos aislados mostrarían que la elección técnica por sí sola no supera la familiaridad con el software y la complejidad del soporte.

La propia hoja de ruta de AMD añade urgencia. La empresa había fijado previamente la disponibilidad de Helios durante 2026 e informó de una creciente adopción de ROCm en su estrategia de centros de datos.

VAST aporta a esa estrategia una capa de datos más sólida. También crea una exigente prueba porque el almacenamiento y la gestión de contexto se sitúan directamente en la ruta de latencia visible para el usuario.

Los desarrolladores deberían interesarse porque las decisiones de infraestructura determinan qué modelos, runtimes y herramientas de optimización siguen siendo prácticos. Un mejor soporte para AMD puede reducir la dependencia del software diseñado en torno a una única plataforma de aceleradores.

Los operadores de nubes de IA deberían interesarse porque el tiempo de GPU sin utilizar reduce directamente la capacidad de servicio disponible. El contexto compartido solo puede ayudar si sus costes de almacenamiento y red se mantienen por debajo de la recomputación que sustituye.

Los compradores empresariales deberían interesarse porque los datos de inferencia tienen requisitos de gobernanza. Mover el contexto almacenado en caché a almacenamiento gestionado puede mejorar el control, pero también amplía el perímetro de seguridad.

Los trabajadores del conocimiento experimentarán el resultado indirectamente. Si los sistemas conservan el contexto útil de forma eficiente, los asistentes podrán gestionar proyectos más largos sin reconstruir repetidamente los mismos antecedentes.

Ese resultado también depende de cómo las aplicaciones organicen el material de origen. Una base de conocimiento de IA bien mantenida puede mejorar la recuperación antes de que comience cualquier optimización de infraestructura.

La estrategia amd blocks no es, por tanto, una declaración de que AMD haya desplazado a Nvidia. Es un plan para facilitar el despliegue del cómputo de AMD como parte de un sistema completo de inferencia.

VAST ha comprometido hardware, software, redes, gestión de caché y diseños de referencia para ese plan. El trabajo pendiente es la validación pública bajo una demanda de clientes mixta y sostenida.

Durante los próximos meses, ignore las afirmaciones generales sobre apertura o fábricas de IA. Busque dispositivos VAST comercializados, resultados de caché reproducibles y clientes que operen la arquitectura completa.

Esas tres señales mostrarán si la asociación crea una segunda vía creíble para la infraestructura de IA, o simplemente otra colección de componentes compatibles.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

​Añade una barra de búsqueda a tu cerebro

Solo tienes que preguntarle a remio

Recuérdalo todo

No organices nada

bottom of page