top of page

El acuerdo NVLink Fusion de d-Matrix integra Raptor en la estrategia de racks de NVIDIA

12 sept
16 min de lectura

d-Matrix ha adoptado NVIDIA NVLink Fusion para Raptor, pese a desarrollar un acelerador de inferencia concebido como alternativa a los diseños convencionales de GPU. El acuerdo conecta el futuro procesador con la arquitectura de racks, las redes, las CPU y la cadena de suministro de infraestructura de NVIDIA. También deja al descubierto la tensión central detrás de la alianza d-Matrix NVLink Fusion.

Los aceleradores especializados pueden desafiar el silicio de cómputo de NVIDIA sin desplazar el resto de su plataforma. Para d-Matrix, ese acuerdo ofrece una vía más rápida desde un ambicioso diseño de chip hasta una infraestructura desplegable. Para NVIDIA, cada nueva XPU conectada mediante NVLink refuerza su posición en torno al rack.

La decisión llega antes de que Raptor se convierta en un producto comercial. d-Matrix espera que el chip llegue a tape-out antes de finales de 2026, con sistemas MGX integrados disponibles inicialmente en el cuarto trimestre de 2027. Ese calendario convierte esto en un anuncio de hoja de ruta, no en una prueba de rendimiento en producción.

También sitúa a d-Matrix junto a un grupo cada vez mayor de empresas que utilizan infraestructura de NVIDIA para procesadores especializados. Entre esos socios hay proveedores consolidados de silicio, proveedores de nube y especialistas en inferencia. La ruta alternativa es un rack abierto construido en torno a tecnologías como la arquitectura Helios de AMD, UALink y Ultra Ethernet.

Qué cambia el acuerdo d-Matrix NVLink Fusion

d-Matrix ya no diseña Raptor como una tarjeta aceleradora aislada. Está diseñando el procesador como parte de un rack definido por NVIDIA.

Las compañías anunciaron su colaboración el 10 de septiembre de 2026. Según el anuncio de Raptor, el acuerdo incluye una hoja de ruta de productos plurianual, no una única prueba de interoperabilidad.

Raptor se conectará a switches NVLink para la comunicación scale-up dentro de un sistema estrechamente integrado. Las redes scale-up permiten que varios aceleradores se comporten más como un único recurso de cómputo grande, con menores retrasos de comunicación que las redes convencionales de centros de datos.

El rack también utilizará Ethernet Spectrum-X para redes scale-out entre sistemas. Esa capa conecta racks o clústeres independientes mientras gestiona la congestión y los patrones de tráfico asociados a las cargas de trabajo de IA distribuida.

El diseño propuesto incluye CPU NVIDIA Vera, unidades de procesamiento de datos BlueField-4 y SuperNIC ConnectX-9. También utiliza NVIDIA MGX, una arquitectura de referencia modular que abarca bandejas físicas, suministro eléctrico, refrigeración e integración de sistemas.

Astera Labs proporcionará tecnología de conectividad destinada a mantener el movimiento de datos de alto rendimiento en todo el sistema. d-Matrix afirma que el rack utilizará bandejas modulares sin cables procedentes del ecosistema de fabricación MGX existente.

Este alcance importa porque un procesador por sí solo no constituye un servicio de IA utilizable. Los compradores necesitan servidores, firmware, redes, orquestación, refrigeración, procedimientos de reparación y un flujo fiable de piezas de repuesto.

Una startup normalmente debe construir esos elementos o convencer a socios de que lo hagan. Después debe certificar el sistema completo para clientes que no pueden tolerar tiempos de inactividad inesperados.

NVLink Fusion cambia esa secuencia. NVIDIA proporciona acceso a elementos seleccionados de su tejido scale-up y sus diseños de racks, permitiendo que la XPU de otra empresa entre en el mismo marco de infraestructura.

El término XPU se refiere en sentido amplio a un procesador especializado optimizado para cargas de trabajo que no encajan en una CPU de propósito general. En el caso de Raptor, el objetivo es la inferencia de IA generativa, especialmente la generación de tokens sensible a la latencia.

La XPU d-Matrix Raptor también puede operar junto a sistemas de GPU NVIDIA, incluido Vera Rubin NVL72. NVIDIA describe esa disposición como inferencia desagregada, en la que distintos procesadores se encargan de etapas o tipos de trabajo de servicio diferenciados.

Esa coexistencia crea la inversión de la historia. d-Matrix no necesita reemplazar a NVIDIA en todo un centro de datos para lograr un despliegue de inferencia. Puede competir por cargas de trabajo seleccionadas mientras depende de componentes de NVIDIA en todo lo que rodea a su chip.

NVIDIA obtiene algo igualmente importante. Puede admitir aceleradores personalizados sin ceder su control sobre la arquitectura del sistema circundante. El límite competitivo se desplaza del chip al rack.

Por tanto, el acuerdo representa más que otra insignia de compatibilidad. Pone a prueba si NVIDIA puede lograr que los aceleradores de terceros aumenten la demanda de su infraestructura, incluso cuando esos aceleradores compiten con sus GPU.

Por qué la integración en racks se ha convertido en la verdadera barrera

La capacidad escasa ya no consiste en diseñar un acelerador impresionante. Consiste en convertir ese silicio en infraestructura que los clientes puedan desplegar de forma predecible.

La inferencia de IA impone exigencias al hardware distintas de las del entrenamiento de modelos. El entrenamiento enfatiza cálculos paralelos a gran escala en muchos aceleradores. La inferencia también debe gestionar el tiempo de respuesta, los usuarios simultáneos, la memoria del modelo y un flujo impredecible de solicitudes.

Los modelos de razonamiento intensifican esa presión porque pueden generar muchos más tokens antes de devolver una respuesta. Las aplicaciones de contexto largo también mantienen grandes cachés de clave-valor, que almacenan la información necesaria durante la generación de tokens.

Estas cargas de trabajo convierten el movimiento de memoria en una restricción central. Un acelerador puede ofrecer abundante capacidad aritmética mientras las unidades de cómputo esperan los pesos del modelo o el contexto almacenado en caché.

d-Matrix aborda ese problema mediante computación centrada en la memoria. Su arquitectura sitúa las operaciones matriciales más cerca de los datos almacenados, reduciendo la distancia que recorre la información durante la inferencia.

Sin embargo, resolver el cuello de botella de memoria dentro de un procesador no resuelve el despliegue fuera de él. Los sistemas a escala de rack deben coordinar aceleradores, hosts, almacenamiento, redes, alimentación y refrigeración en condiciones operativas reales.

Cada componente introduce trabajo de certificación. Los ingenieros deben validar la integridad de la señal, el comportamiento térmico, la compatibilidad del firmware, la comunicación colectiva, la recuperación ante fallos y los procedimientos de servicio.

Los racks refrigerados por líquido añaden otra capa operativa. Un nuevo proveedor debe encajar en los diseños de instalaciones existentes sin obligar a los clientes a reconstruir la alimentación y la refrigeración en torno a un único procesador.

El lanzamiento original de NVLink Fusion de NVIDIA abordó ese problema directamente. La empresa presentó la plataforma en mayo de 2025 para infraestructura de IA semipersonalizada que utiliza CPU y XPU externas.

Su lista inicial de socios cubría varias partes de la cadena de diseño. MediaTek, Marvell, Alchip, Astera Labs, Synopsys y Cadence respaldaban silicio personalizado, conectividad o propiedad intelectual.

Fujitsu y Qualcomm planeaban CPU personalizadas que pudieran funcionar con GPU NVIDIA. Colaboraciones posteriores ampliaron la plataforma a procesadores adicionales y diseños para la nube.

Esa creciente lista ejerce presión sobre todos los proveedores independientes de aceleradores. Un fabricante de chips puede unirse a un ecosistema de racks establecido, construir por sí solo un sistema equivalente o alinearse con un estándar abierto competidor.

La primera ruta reduce el riesgo de integración, pero crea dependencia estratégica. La segunda preserva mayor control, pero exige capital, tiempo y confianza de los clientes. La tercera depende de que otro ecosistema alcance una madurez comparable.

d-Matrix ha elegido velocidad y facilidad de despliegue para Raptor. Su director ejecutivo, Sid Sheth, expresó claramente la limitación: la demanda de inferencia está aumentando mientras el capital, el tiempo y la energía siguen siendo finitos.

La decisión de la empresa también refleja su etapa de desarrollo. d-Matrix comenzó a enviar su plataforma Corsair antes de presentar Raptor, pero sigue siendo mucho más pequeña que los proveedores de infraestructura a los que espera desafiar.

Construir una nueva plataforma de racks junto a una nueva arquitectura de memoria multiplicaría los riesgos de ejecución. El uso de MGX permite a la empresa concentrar más recursos de ingeniería en su procesador, compilador y software de inferencia.

Esta elección no elimina la certificación. Raptor aún debe implementar NVLink correctamente, funcionar con los demás dispositivos de NVIDIA y cumplir los objetivos de rendimiento y fiabilidad a nivel de sistema.

Sí reduce el número de elementos nuevos que los clientes deben aceptar de una vez. Un rack familiar puede facilitar que un equipo de infraestructura evalúe un acelerador desconocido.

El resultado ejerce presión sobre las empresas rivales de aceleradores tanto como sobre los proveedores de GPU. Una startup que solo ofrece un chip rápido ahora compite contra procesadores empaquetados en diseños de racks validados y reparables.

Cómo funciona NVLink Fusion en torno a Raptor

NVLink Fusion separa la elección del procesador de la construcción del rack, pero mantiene la interconexión de NVIDIA en el centro del sistema.

La arquitectura tiene dos niveles de red. NVLink conecta aceleradores dentro de un dominio scale-up, mientras Spectrum-X transporta tráfico a través de un clúster scale-out más amplio.

Dentro del rack, los switches NVLink proporcionan comunicación de alto ancho de banda y baja latencia entre dispositivos Raptor. Esta conexión es importante cuando un modelo o sus datos de trabajo no pueden permanecer en un solo acelerador.

Fuera de ese dominio, las SuperNIC ConnectX y Ethernet Spectrum-X enlazan sistemas a través del centro de datos. Las DPU BlueField pueden gestionar tareas de infraestructura como redes, aislamiento y movimiento de datos.

Las CPU Vera actúan como procesadores host. MGX define el marco mecánico y eléctrico que integra esos elementos en bandejas y racks desplegables.

Comprender cómo funciona NVLink Fusion exige distinguir el acceso de la estandarización. NVIDIA abre su tejido a silicio de terceros aprobado, pero NVLink sigue siendo una tecnología controlada por NVIDIA.

Por tanto, el diseño es horizontalmente inclusivo sin convertirse en neutral respecto a proveedores. Los socios obtienen acceso a la plataforma, mientras NVIDIA conserva influencia sobre interfaces, certificaciones, hojas de ruta y componentes circundantes.

Ese modelo ofrece ventajas prácticas. Un rack compartido puede admitir distintos tipos de aceleradores sin obligar a un operador a crear un diseño físico independiente para cada procesador.

Un constructor de centros de datos puede estandarizar el espacio de suelo, las conexiones de refrigeración, la distribución eléctrica y las prácticas de mantenimiento. La capacidad de cómputo puede variar después según los requisitos de cada carga de trabajo.

NVIDIA también aporta una red de fabricación establecida. Los fabricantes de equipos originales y los fabricantes de diseño ya producen sistemas derivados de MGX y de las plataformas de GPU a escala de rack de NVIDIA.

La explicación técnica de la empresa describe el acceso a interfaces NVLink, chiplets, switches, cableado y tecnología de racks. También incluye diseños de alimentación y refrigeración líquida.

Para d-Matrix, esta infraestructura aborda un problema que los benchmarks brutos de aceleradores no pueden reflejar. Los clientes que compran capacidad de inferencia evalúan los calendarios de despliegue, la facilidad de mantenimiento, la utilización y el riesgo operativo junto con los tokens por segundo.

Un procesador que llega tarde o requiere un rack único puede perder incluso con resultados favorables de laboratorio. La consistencia de la infraestructura puede pesar más que una ventaja limitada de rendimiento.

El enfoque también permite a los clientes combinar inferencia especializada con cargas de trabajo basadas en GPU. NVIDIA afirma que los racks Raptor pueden funcionar junto a sistemas Vera Rubin NVL72, en lugar de reemplazarlos.

Un posible despliegue dirigiría la generación de tokens sensible a la latencia a Raptor, mientras mantiene otras etapas del modelo en GPU. Las compañías no han publicado una configuración completa de producción que demuestre ese flujo de trabajo.

El software sigue siendo esencial en cualquier división de este tipo. Los entornos de ejecución de modelos deben ubicar correctamente las tareas, gestionar la memoria y mover datos sin eliminar las ganancias del hardware especializado.

d-Matrix ha desarrollado su propia pila de software para Corsair y Raptor. La integración con el ecosistema más amplio de NVIDIA determinará si los compradores experimentan una plataforma gestionable o dos sistemas contiguos.

Esa distinción será importante para los desarrolladores. La heterogeneidad del hardware permite una mejor adecuación de las cargas de trabajo, pero puede introducir compiladores, herramientas de monitorización, perfiles de rendimiento y rutas de depuración independientes.

NVLink reduce la fricción de comunicación entre dispositivos. No hace automáticamente idénticos sus modelos de programación.

Por tanto, el valor de la asociación depende de la coordinación por encima del enlace físico. Las empresas deben convertir componentes compatibles en patrones de implementación repetibles que los operadores de nube puedan ofrecer como servicios.

El diseño de memoria de Raptor es la apuesta dentro del rack

NVIDIA aporta la base del sistema, pero Raptor aún debe justificar por qué los clientes necesitan otro procesador de inferencia.

Raptor amplía el enfoque centrado en la memoria utilizado por la plataforma Corsair anterior de d-Matrix. Su característica definitoria es un encapsulado tridimensional que coloca un chip de cómputo directamente sobre DRAM personalizada.

La DRAM ofrece mayor densidad que la SRAM, la memoria más rápida utilizada ampliamente en Corsair. Sin embargo, la DRAM convencional está más alejada del cómputo y normalmente requiere más energía para mover cada bit.

El diseño de d-Matrix expone muchos pequeños bancos de memoria directamente a los motores de cómputo mediante conexiones verticales densas. El objetivo es combinar la capacidad de la DRAM con un ancho de banda local mucho mayor.

En Hot Chips 2026, la empresa presentó un encapsulado con un chip de cómputo TSMC de 4 nanómetros unido sobre un chip de DRAM personalizada. La interfaz utiliza un paso de conexión de 36 micras.

El diseño demostrado ofrece 32GB por tarjeta y un ancho de banda interno declarado de 100 terabytes por segundo. Estas cifras describen el movimiento dentro del encapsulado, no el ancho de banda de red entre aceleradores separados.

Informes independientes sobre el diseño de DRAM 3D también destacaron una salvedad importante. Muchos resultados de rendimiento publicados siguen siendo proyecciones basadas en silicio inicial.

d-Matrix midió la interfaz vertical en 0,37 picojulios por bit. La empresa comparó esa cifra con aproximadamente 2,4 picojulios para el movimiento hacia un chip base HBM4.

Un artículo de investigación asociado proyectó cerca de 4,7 veces más rendimiento por tarjeta que los diseños basados en HBM. Ni una proyección ni una medición de interfaz establecen el rendimiento de un sistema completo en producción.

La gestión térmica plantea otro desafío. El chip lógico se sitúa arriba para que una placa fría pueda contactarlo directamente, mientras que la DRAM situada debajo también actúa como interposer.

El encapsulado completo tiene un presupuesto de potencia divulgado de 422 vatios. La interfaz de memoria vertical representa 296 vatios cuando opera a plena capacidad.

El calor afecta a la retención de la DRAM, que determina cuánto tiempo las celdas de memoria preservan los datos antes de requerir una actualización. A la temperatura de operación indicada, el diseño requiere operaciones de actualización sustancialmente más frecuentes.

d-Matrix afirma que los bancos de memoria más pequeños limitan el coste resultante en ancho de banda. También incluye bancos de reserva, corrección de errores y redundancia destinadas a mantener una operación fiable.

Estos detalles explican por qué importa la integración con un rack maduro refrigerado por líquido. La arquitectura de Raptor no requiere simplemente un conector. Requiere alimentación, refrigeración y validación diseñadas para un encapsulado inusual.

La tecnología apunta a la generación de tokens porque esa fase a menudo mueve repetidamente los pesos del modelo mientras realiza una cantidad relativamente modesta de operaciones aritméticas por byte. Un mayor ancho de banda de memoria local puede mantener ocupadas las unidades de cómputo.

El prefill, que procesa un prompt entrante, tiene un perfil de rendimiento distinto. Puede exigir más operaciones aritméticas y favorecer una configuración de aceleradores diferente.

Esa diferencia respalda el argumento de la inferencia desagregada. Los operadores podrían asignar procesadores independientes al prefill y a la decodificación, siempre que el software y las redes mantengan eficiente la transferencia.

Sin embargo, el valor de Raptor no puede inferirse únicamente del ancho de banda. El rendimiento útil depende de la compatibilidad con modelos, los formatos numéricos, la planificación, el tamaño de lote, la longitud de contexto y la latencia de respuesta aceptable.

La capacidad de memoria también importa. Una tarjeta de 32GB no puede alojar cada modelo grande de forma independiente, por lo que las cargas de trabajo mayores requieren partición entre varios dispositivos.

Ese requisito hace que el dominio de escalado vertical de NVLink sea más relevante. El diseño interno de memoria de Raptor y la estructura externa de NVIDIA deben funcionar juntos sin crear un nuevo cuello de botella.

Por tanto, el XPU Raptor de d-Matrix es una apuesta compuesta. Su encapsulado 3D debe funcionar con rendimiento de fabricación apto para producción, y el rack debe convertir ese encapsulado en un rendimiento de aplicaciones fiable.

La plataforma abierta de NVIDIA sigue teniendo límites

La competencia principal no es d-Matrix contra las GPU de NVIDIA. Es la integración controlada por NVIDIA frente a la infraestructura de rack neutral respecto a proveedores.

NVIDIA describe su plataforma de IA como integrada verticalmente y abierta horizontalmente. La frase resume su estrategia, pero los compradores deberían examinar qué significa cada parte.

La integración vertical reúne procesadores NVIDIA, switches, adaptadores de red, DPU, software, diseños de rack y relaciones de suministro. La apertura horizontal permite que determinadas CPU y XPU externas entren en ese entorno.

Esta estructura amplía la elección de procesadores dentro de un sistema cuya infraestructura esencial sigue controlada por NVIDIA. Es más abierta que un rack solo de GPU, pero menos neutral que una interconexión gobernada por la industria.

Ese límite es comercialmente útil para NVIDIA. Si los aceleradores personalizados ganan cuota, la empresa aún puede suministrar componentes de red e infraestructura de alto valor a su alrededor.

También puede mantener NVLink como elemento central a medida que los sistemas de IA pasan de servidores a computadoras a escala de rack. El rack se convierte en el producto, mientras los procesadores individuales pasan a ser elementos configurables.

d-Matrix se beneficia porque puede llegar a compradores que ya están preparando instalaciones para equipos NVIDIA. La asociación reduce el coste organizativo de probar un procesador menos conocido.

Sin embargo, d-Matrix también hereda dependencia del proceso de cualificación y de la hoja de ruta de infraestructura de NVIDIA. Los cambios en switches, CPU, software o condiciones comerciales pueden afectar sus planes de sistemas.

Las empresas no han divulgado la estructura financiera de la asociación. Tampoco han detallado qué capas de software se compartirán ni cómo los clientes adquirirán y recibirán soporte para racks completos.

Estas preguntas sin responder importan porque la apertura tiene varias dimensiones. El hardware puede ser físicamente interoperable mientras las compras, la gestión y el desarrollo siguen estrechamente vinculados a un proveedor.

El modelo competidor hace hincapié en interfaces industriales abiertas. El diseño de rack Helios de AMD utiliza OCP Open Rack Wide, UALink para la conectividad de escalado vertical y Ultra Ethernet para clústeres más grandes.

Helios combina aceleradores AMD Instinct, procesadores EPYC y redes Pensando. Su diseño publicado incluye 72 aceleradores, en línea con el movimiento de la industria hacia sistemas densos a escala de rack.

UALink busca permitir que múltiples proveedores conecten aceleradores mediante una especificación compartida. Ese enfoque promete una portabilidad más amplia, aunque una especificación abierta no garantiza igual madurez de producto ni volumen de implementación.

La ventaja de NVIDIA es que NVLink ya opera en varias generaciones de sistemas comercializados. Sus socios de fabricación también tienen experiencia práctica con racks densos refrigerados por líquido.

La vía abierta ofrece mayor independencia teórica. La vía de NVIDIA ofrece una ruta de integración establecida bajo la dirección arquitectónica de una sola empresa.

Ninguna elección elimina por completo la dependencia. Un comprador que adopta Raptor también depende del software de d-Matrix, de su cadena de suministro de memoria 3D y de la capacidad de la startup para respaldar productos futuros.

El campo competitivo más amplio incluye a Groq, Cerebras, AMD, Intel y aceleradores diseñados por hyperscalers. Una visión general del mercado de inferencia identificó previamente a esas empresas como alternativas dirigidas a cargas de trabajo dominadas por GPU.

Desde entonces, varias se han acercado a ofertas de sistemas completos. Groq, por ejemplo, también ha entrado en la estrategia de infraestructura de inferencia en expansión de NVIDIA.

Ese patrón sugiere que NVIDIA quiere absorber la especialización en lugar de resistirse a ella. Un XPU exitoso puede convertirse en otra razón para adoptar las tecnologías de red y rack de NVIDIA.

Para d-Matrix, unirse a esa plataforma es pragmático. También significa que el desafío de la empresa a NVIDIA es más limitado de lo que sugiere una simple narrativa de chips rivales.

La asociación disputa qué procesador realiza la inferencia. No disputa quién define gran parte de la infraestructura circundante.

La entrega, los benchmarks y los clientes decidirán el resultado

El anuncio establece una intención arquitectónica. No establece preparación para la fabricación, demanda comercial ni rendimiento en producción.

El primer punto de observación es el tape-out previsto de Raptor antes de finales de 2026. El tape-out es el momento en que un diseño de chip queda finalizado para su fabricación.

Cumplir ese hito respaldaría el calendario actual. No alcanzarlo reduciría el tiempo para fabricación, encapsulado, pruebas, trabajo de software y cualificación del rack antes de finales de 2027.

La segunda señal es un rendimiento de sistema reproducible de forma independiente. Los compradores necesitan resultados de racks Raptor completos, no cifras de ancho de banda aisladas ni ejecuciones de modelos proyectadas.

Esas evaluaciones deberían divulgar los modelos, longitudes de contexto, tamaños de lote, objetivos de latencia, ajustes de precisión y consumo de energía. Los tokens por segundo sin esas condiciones pueden ocultar importantes compromisos.

El rendimiento por usuario será especialmente relevante para la propuesta de la empresa de un servicio premium de tokens. Un alto rendimiento agregado importa menos si las solicitudes individuales esperan en lotes grandes.

Las mediciones de energía deberían cubrir todo el rack. La eficiencia a nivel de encapsulado puede verse diluida por CPU, switches, equipos de refrigeración, redes y capacidad inactiva.

La tercera señal es la implementación por parte de clientes identificados. d-Matrix afirma que Raptor está siendo evaluado por hyperscalers y laboratorios de frontera, pero no ha identificado esas organizaciones.

Una instancia de nube comprometida, un servicio de inferencia gestionado o un clúster de producción anunciado reforzarían el caso comercial de la asociación. Las evaluaciones por sí solas no demuestran intención de compra.

La disponibilidad inicial sigue programada para el cuarto trimestre de 2027. Ese largo intervalo da tiempo a los sistemas competidores para mejorar su memoria, redes y software de inferencia.

También expone a d-Matrix a incertidumbre de fabricación. La empresa debe producir un chip de DRAM personalizado, unirlo a lógica avanzada, lograr rendimientos aceptables y validar el encapsulado bajo calor sostenido.

Su afirmación de contar con más de 100 patentes no resuelve esas cuestiones de producción. Las patentes protegen ideas técnicas, mientras que los clientes necesitan volumen fiable y servicio predecible.

NVIDIA también tiene trabajo por completar. Los componentes relevantes Vera, BlueField, ConnectX, Spectrum-X y NVLink deben alcanzar la madurez requerida en calendarios compatibles.

Astera Labs debe entregar sus componentes de conectividad como parte del diseño integrado. Los fabricantes de racks deben entonces cualificar bandejas sin cables, refrigeración, firmware y gestión del sistema.

El software presenta un calendario paralelo. d-Matrix debe admitir los modelos y frameworks actuales cuando Raptor se comercialice, no solo los disponibles durante el diseño.

Las arquitecturas de modelos pueden cambiar rápidamente. Las mezclas dispersas de expertos, las ventanas de contexto más largas, las cargas de trabajo multimodales y las nuevas técnicas de decodificación modifican los patrones de memoria y comunicación.

Un procesador especializado tiene éxito cuando su arquitectura sigue siendo útil a lo largo de esos cambios. También necesita actualizaciones del compilador lo suficientemente rápidas como para seguir el ritmo de los modelos de uso generalizado.

La plataforma de NVIDIA puede reducir el riesgo físico del despliegue, pero no puede garantizar la adopción del software. Los desarrolladores y operadores de nube aún necesitan un motivo para dirigir las cargas de trabajo hacia Raptor.

El argumento más sólido combinaría baja latencia por usuario, consumo energético competitivo e incorporación sencilla de modelos. Una debilidad en cualquiera de estas áreas puede limitar la utilización.

Los compradores también deberían observar cómo NVIDIA posiciona Raptor junto a sus propias GPU y otros productos de inferencia. Un acceso técnico equivalente no produce necesariamente la misma visibilidad comercial.

Una preocupación final es la concentración de la plataforma. Admitir XPU externas ofrece a los clientes más opciones de procesadores, al tiempo que traslada más decisiones sobre los racks a la influencia de NVIDIA.

Ese resultado no representa ni una apertura absoluta ni un cierre simple del mercado. Es un mercado por capas, en el que la competencia sobrevive dentro de un límite de infraestructura cada vez más común.

La colaboración entre d-Matrix y NVLink Fusion importará si Raptor cruza ese límite como un servicio comercializado, medible y ampliamente disponible. Hasta entonces, su relevancia reside en la estrategia.

d-Matrix ha aceptado que un chip de inferencia superior no basta sin un rack creíble. NVIDIA ha aceptado que los procesadores especializados pueden integrarse en su plataforma sin debilitar su posición en infraestructura.

Durante los próximos meses, conviene seguir la fabricación inicial (tape-out), los benchmarks de sistemas completos y los despliegues identificados, en ese orden. Cada hito mostrará si esta hoja de ruta está convirtiéndose en un producto.

Para los compradores de infraestructura, la pregunta útil no es si Raptor supera a todas las GPU. La cuestión es si ofrece un perfil de inferencia valioso sin añadir una complejidad operativa inaceptable. Esa evidencia determinará si el rack de NVIDIA se convierte en una plataforma de lanzamiento para la elección de aceleradores o en otro punto duradero de dependencia.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page