Llega NVIDIA DGX Spark 64GB mientras el modelo de 128GB recibe una importante subida de precio
NVIDIA ha anunciado NVIDIA DGX Spark 64GB, mientras que el sistema original de 128GB recibe un aumento de precio de casi el 50 por ciento.
La nueva configuración conserva el procesador GB10 Grace Blackwell, la pila de software de NVIDIA y las redes de alta velocidad. Sin embargo, reduce a la mitad la memoria unificada y, según los informes, también disminuye el almacenamiento local.
Este cambio transforma el significado del sistema de IA de escritorio de NVIDIA. DGX Spark prometía originalmente una cantidad inusualmente grande de memoria unificada en una máquina compacta. El nuevo modelo de entrada hace que ese recurso definitorio sea más escaso, al tiempo que cuesta más que el precio de lanzamiento original del modelo de 128GB.
NVIDIA afirma que los sistemas de 64GB estarán disponibles a través de Acer, ASUS, Dell, Gigabyte, HP y MSI el 23 de octubre. La empresa no venderá una Founders Edition de 64GB con marca NVIDIA.
Los detalles del lanzamiento de 64GB destacan la inferencia privada, los agentes de IA persistentes y una vía más sencilla hacia clústeres de dos nodos. Estos usos son creíbles, pero los límites de capacidad determinarán qué modelos y flujos de trabajo seguirán siendo prácticos.
La subida de precio de NVIDIA DGX Spark genera el conflicto central. Los compradores pueden aceptar menos memoria, pagar considerablemente más por 128GB o evaluar sistemas rivales basados en silicio de AMD y Apple.
NVIDIA DGX Spark 64GB conserva el GB10, pero reduce su memoria a la mitad
El nuevo sistema mantiene la plataforma informática de NVIDIA, pero recorta el recurso que hacía a DGX Spark especialmente valioso.
DGX Spark combina una GPU de generación Blackwell y una CPU Arm de 20 núcleos en el Superchip GB10 Grace Blackwell. MediaTek colaboró con NVIDIA en el diseño del procesador.
La CPU y la GPU comparten un único conjunto de memoria coherente. La memoria unificada coherente permite que ambos procesadores accedan a los mismos datos sin mantener asignaciones separadas de memoria del sistema y memoria gráfica.
Esta disposición importa para la inteligencia artificial local. Los modelos grandes deben alojar sus pesos, estado de ejecución, prompts y datos generados dentro de la memoria disponible.
Las GPU de escritorio tradicionales suelen contar con mucha menos memoria dedicada que DGX Spark. Los desarrolladores pueden añadir RAM de sistema, pero una GPU discreta no puede utilizarla con la misma eficiencia que la memoria de vídeo local.
La máquina original de 128GB ofrecía un equilibrio diferente. NVIDIA afirmó que podía ejecutar inferencia en modelos de hasta 200.000 millones de parámetros y ajustar modelos de hasta 70.000 millones de parámetros.
Estos son límites del proveedor, no garantías para todos los modelos. La precisión, la cuantización, la longitud de contexto, los requisitos de caché y la sobrecarga del framework modifican el consumo real de memoria.
NVIDIA DGX Spark 64GB reduce el límite declarado por NVIDIA para modelos en un solo sistema a 100.000 millones de parámetros. Sigue siendo una cifra considerable, especialmente cuando los modelos utilizan pesos comprimidos.
Sin embargo, alojar un modelo no equivale a ejecutarlo con comodidad. Una carga de trabajo también necesita espacio para su caché clave-valor, que almacena los datos de atención generados durante la inferencia.
Los prompts más largos consumen más caché. Varios usuarios o agentes vuelven a incrementar el requisito. Un modelo que apenas logra cargarse puede dejar muy poco margen para un trabajo útil.
NVIDIA no ha reducido el ancho de banda de memoria junto con la capacidad. Los informes indican que los sistemas de 64GB mantienen un ancho de banda de 273GB por segundo.
Esto sugiere que los fabricantes utilizan paquetes LPDDR5X de menor densidad sin estrechar la interfaz de memoria. Por tanto, el diseño debería evitar una penalización evidente de ancho de banda cuando las cargas de trabajo caben en memoria.
Las nuevas máquinas también conservan DGX OS, las bibliotecas CUDA, la compatibilidad con PyTorch, las herramientas de agentes de NVIDIA y los tiempos de ejecución de inferencia populares. Entre las opciones compatibles se incluyen Ollama, llama.cpp, vLLM y LM Studio.
Las redes ConnectX-7 siguen formando parte de la plataforma. Su conexión de 200Gbps permite que dos sistemas intercambien datos mucho más rápido que con Ethernet de consumo convencional.
Por tanto, la versión de 64GB no es un procesador más lento vendido bajo el mismo nombre. Es una versión de la plataforma existente limitada por capacidad.
Esta distinción favorece a los desarrolladores que ejecutan modelos compactos de forma repetida. Resulta menos atractiva para los compradores que eligieron DGX Spark específicamente para evitar límites de memoria.
Según los informes, el almacenamiento también disminuye junto con la memoria del sistema. El anuncio público de NVIDIA se concentra en la memoria y los clústeres, en lugar de proporcionar una especificación completa de almacenamiento para cada socio.
Los compradores deberían comprobar la configuración de cada fabricante antes de realizar un pedido. El lanzamiento exclusivo a través de socios implica que el almacenamiento, los puertos, el soporte y las condiciones de garantía pueden variar entre sistemas.
El primer lanzamiento de DGX Spark de NVIDIA posicionó la máquina como un superordenador personal de IA. La edición de 64GB reduce esa promesa a cargas de trabajo locales más específicas.
Sigue siendo útil. Simplemente es una propuesta distinta de disponer de un entorno de desarrollo de modelos inusualmente grande sobre un escritorio.
La subida de precio de NVIDIA DGX Spark reescribe el argumento de valor
El modelo de menor capacidad existe porque el sistema original se ha alejado mucho de su posición inicial en el mercado.
DGX Spark comenzó como Project Digits, un sistema de escritorio compacto anunciado en CES 2025. Su posicionamiento inicial sugería un punto de entrada más bajo que el que finalmente tuvo la máquina.
La Founders Edition de 128GB se lanzó posteriormente a un precio superior. NVIDIA volvió a aumentar ese precio durante 2026, citando restricciones en el suministro de memoria LPDDR5X y almacenamiento flash NAND.
El último ajuste comunicado eleva el precio del modelo de 128GB casi a la mitad respecto a su precio de lista anterior. Se sitúa cerca de tres cuartas partes por encima del nivel de lanzamiento original.
El precio exacto de transacción puede variar según el vendedor y la disponibilidad. Sin embargo, la dirección es clara en toda la línea de productos de NVIDIA y en varios sistemas de socios.
Según el informe de precios original, la nueva configuración de 64GB sirve ahora como la puerta de entrada menos costosa a GB10.
Menos costosa es una expresión relativa en este caso. Según los informes, el modelo reducido cuesta una cuarta parte más de lo que costaba la Founders Edition de 128GB en su lanzamiento.
Esa comparación deja al descubierto la inversión. Los compradores no reciben un descuento normal por menor memoria frente a un producto estable.
En cambio, reciben la mitad de memoria a un coste de entrada superior al del modelo de capacidad completa del año pasado. La alternativa de 128GB ha pasado a otra categoría de gasto.
NVIDIA presenta la edición de 64GB como un punto de partida accesible. Esta descripción solo tiene sentido dentro del mercado actual de GB10, no a lo largo de toda la historia del producto.
La empresa cuenta con una explicación razonable por el lado de la oferta. Los paquetes LPDDR5X están soldados en estos sistemas compactos, y las configuraciones de alta capacidad requieren numerosos componentes de alta densidad.
El almacenamiento NAND también afecta a los costes. A diferencia de una estación de trabajo convencional, DGX Spark no permite a los compradores instalar módulos de memoria más baratos después de la compra.
Los precios de los componentes no explican por completo todos los movimientos minoristas. Los márgenes de los fabricantes, el momento del inventario, la demanda y la disponibilidad en los canales también influyen en los precios publicados.
NVIDIA no ha proporcionado públicamente un desglose de materiales para ninguna de las dos capacidades. Por ello, los compradores no pueden aislar cuánto del aumento procede directamente de la memoria.
No obstante, los proveedores de memoria describen un mercado tenso. Micron ha advertido que la demanda seguirá superando a la oferta durante 2027 y 2028.
Esta perspectiva importa porque la infraestructura de IA compite por capacidad de fabricación en varias categorías de memoria. Los proveedores priorizan naturalmente los productos y clientes que ofrecen mejores rendimientos.
Los sistemas compactos de IA ocupan una posición incómoda. Necesitan suficiente memoria para diferenciarse de los PC convencionales, pero carecen de la escala de compra de los centros de datos.
Por tanto, la subida de precio de NVIDIA DGX Spark es más que el fin de una promoción temporal. Refleja presión sobre el componente que define el producto.
Esta presión también modifica los cálculos de compra. Un equipo que considere varios Sparks debe compararlos ahora con estaciones de trabajo, aceleradores alquilados y servidores de inferencia centralizados.
La computación en la nube sigue siendo costosa para cargas de trabajo persistentes. Sin embargo, evita el riesgo de comprar un sistema de capacidad fija poco antes de que crezcan los modelos o los requisitos.
El hardware local ofrece privacidad, disponibilidad predecible y control directo. Su ventaja financiera depende de la utilización, el ajuste del modelo, la energía, el soporte y el calendario de desarrollo del comprador.
Una estación de trabajo inactiva tiene una mala economía. Un Spark que ejecuta ininterrumpidamente un agente interno de programación o investigación ofrece un caso más sólido.
La nueva estructura de precios hace esencial definir la carga de trabajo. Los compradores ya no pueden justificar el sistema principalmente porque ofrece un conjunto de memoria inusualmente grande a un agresivo precio de lanzamiento.
DGX Spark 64GB frente a 128GB es en realidad una decisión de carga de trabajo
La capacidad correcta depende de la longitud de contexto, la concurrencia, las necesidades de ajuste fino y la elección del modelo, no solo del número de parámetros.
NVIDIA sostiene que los modelos abiertos más pequeños se han vuelto lo suficientemente capaces para realizar trabajo local valioso. Señala modelos en el rango de 26.000 a 35.000 millones de parámetros.
Estos modelos pueden respaldar programación, análisis de documentos, asistencia de investigación y otras tareas de agentes. La cuantización puede reducir aún más su huella de memoria al almacenar los pesos con menor precisión.
La empresa afirma que un Spark de 64GB puede admitir modelos de hasta 100.000 millones de parámetros. Esa cifra describe un límite superior bajo condiciones seleccionadas.
Un modelo más pequeño suele ofrecer una mejor experiencia de trabajo. Puede dejar memoria para prompts largos, solicitudes simultáneas, herramientas, embeddings y procesos del sistema operativo.
Pensemos en un desarrollador que ejecuta un agente de programación continuamente. El sistema debe mantener el modelo mientras indexa repositorios, procesa documentación y conserva una conversación en expansión.
Un conjunto de 64GB puede gestionar ese flujo de trabajo con un modelo adecuado. Se vuelve restrictivo cuando el desarrollador aumenta la longitud de contexto o inicia varios agentes.
El análisis de documentos genera una presión similar. Un agente de investigación puede necesitar procesar miles de tokens de informes, notas y archivos fuente.
Los pesos del modelo son solo una parte de la asignación. El motor de inferencia, la caché, las herramientas de procesamiento de documentos y los servicios de aplicaciones compiten todos por la memoria.
La generación de imágenes y las cargas de trabajo multimodales añaden otra capa. Los modelos pueden combinar codificadores de texto, decodificadores de imágenes, componentes de visión y tensores temporales.
El ajuste fino es aún más exigente. Entrenar o adaptar un modelo requiere memoria para parámetros, gradientes, estado del optimizador y activaciones intermedias.
Técnicas como la adaptación de bajo rango reducen esa carga. No la eliminan, especialmente cuando los equipos quieren modelos más grandes, secuencias más largas o lotes mayores.
Por eso la elección entre DGX Spark 64GB y 128GB no puede basarse en las etiquetas de máximo de modelo de NVIDIA. Los compradores necesitan mediciones de su software previsto.
La configuración de 128GB ofrece más margen para la experimentación. Puede alojar modelos más grandes, ventanas de contexto más amplias y cargas de trabajo simultáneas sin necesidad inmediata de crear clústeres.
La capacidad también reduce la fricción operativa. Los desarrolladores dedican menos tiempo a cambiar niveles de cuantización, descargar servicios o dividir el trabajo entre máquinas.
El sistema de 64GB encaja en un entorno más controlado. Es adecuado para equipos que se estandarizan en un modelo conocido y comprenden la huella de ejecución del modelo.
Las implementaciones solo de inferencia pueden ser especialmente adecuadas. Una vez que un equipo selecciona y prueba un modelo, puede optimizar la pila de servicio en torno a un tráfico predecible.
Los equipos de ajuste fino afrontan una decisión más difícil. Deberían tratar los 64GB como un límite que validar, no como un sustituto general del Spark original.
Los ejemplos de aplicaciones de NVIDIA incluyen agentes de programación, agentes de investigación, generación de imágenes y servicio remoto de modelos. Son categorías, no cargas de trabajo estandarizadas.
Un agente de programación que lee un repositorio pequeño difiere de uno que analiza millones de líneas. Un asistente de investigación para un único usuario difiere de un servicio departamental compartido.
La pregunta útil no es si 64GB ejecutan IA local. Está claro que sí.
La cuestión es si la carga de trabajo objetivo completa funciona con suficiente capacidad disponible para crecer. Esa respuesta exige pruebas con modelos y datos reales.
Los equipos deben registrar el uso máximo de memoria, la velocidad de procesamiento de prompts, la velocidad de generación y el comportamiento ante solicitudes simultáneas. También deben probar su contexto realista más largo.
La compatibilidad de software refuerza la posición de NVIDIA. CUDA sigue siendo la plataforma preferida para muchas bibliotecas de IA, y los desarrolladores optimizan con frecuencia las nuevas herramientas primero para NVIDIA.
Esa ventaja puede compensar una menor memoria o un mayor coste de adquisición. Importa más cuando un sistema competidor requiere kernels no compatibles o correcciones manuales.
Sin embargo, la compatibilidad con CUDA no puede crear capacidad inexistente. Cuando una carga de trabajo supera la memoria física, el comprador debe usar un modelo más pequeño, distribuir la carga de trabajo o elegir otro sistema.
NVIDIA Convierte Dos Sistemas Más Pequeños en Su Ruta de Actualización
La agrupación ofrece más capacidad de cómputo y memoria compartida, pero no recrea una única máquina de 128GB a menor coste.
Cada DGX Spark incluye una interfaz de red ConnectX-7. Dos sistemas pueden conectarse directamente mediante un cable QSFP y formar un clúster de alta velocidad.
NVIDIA Sync Cluster Assistant detecta las máquinas, valida sus configuraciones y prepara la conexión ConnectX-7. Esto elimina varios pasos manuales de red.
Un próximo Model Launcher simplificará el despliegue de modelos compatibles en uno o dos nodos. NVIDIA afirma que Qwen3.8 27B estará entre las opciones iniciales.
Este trabajo de software aborda una debilidad real. La inferencia local distribuida requería anteriormente configuración mediante línea de comandos y cambios en los ajustes de inicio de vLLM o TensorRT-LLM.
NVIDIA afirma que dos sistemas de 64GB agrupan su memoria para admitir modelos de hasta 200.000 millones de parámetros. También proporcionan el doble de ancho de banda de memoria agregado.
En la prueba de NVIDIA con Qwen3.8 27B, un clúster de dos nodos ofreció hasta 1,7 veces el rendimiento de un sistema de 64GB.
Ese resultado fue generado por el proveedor y no ha recibido una validación independiente amplia. No debe interpretarse como una relación de escalado universal.
El rendimiento distribuido depende de la frecuencia con que una carga de trabajo mueve datos entre nodos. Las transferencias de red añaden latencia incluso cuando la interconexión es rápida.
Algunos modelos se dividen limpiamente entre dos procesadores. Otros pierden más rendimiento por sincronización, comunicación o sobrecarga de software.
El clúster también duplica el cómputo, el almacenamiento, el hardware de red y los sistemas físicos. No es simplemente un método para combinar dos bancos de memoria.
Esto hace que el diseño sea valioso para el rendimiento total. Un equipo podría atender más solicitudes, ejecutar varios agentes o asignar tareas separadas a cada dispositivo.
Sin embargo, comprar dos sistemas de 64GB cuesta mucho más que adquirir un único sistema de 128GB con el nuevo precio. El clúster proporciona cómputo adicional, pero no una vía más barata hacia una capacidad equivalente.
El argumento de actualización es más sólido cuando las necesidades crecen gradualmente. Un desarrollador puede empezar con un nodo, confirmar la demanda y añadir otro sin reemplazar la máquina original.
Es menos sólido cuando la carga de trabajo ya requiere más de 64GB. Ese comprador aceptaría complejidad inmediata y un gasto total mayor para evitar el modelo de capacidad completa.
El consumo eléctrico y la administración también aumentan con el número de nodos. Los equipos deben supervisar dos sistemas operativos, dos dispositivos de almacenamiento, la salud de la red y el comportamiento del software distribuido.
NVIDIA Sync reduce el trabajo de configuración. No elimina las diferencias operativas entre un ordenador y un clúster.
La empresa afirma que las aplicaciones pueden acceder al modelo agrupado desde portátiles y equipos de escritorio convencionales. Esto crea un pequeño dispositivo compartido de inferencia para un equipo.
Un nodo podría alojar un modelo privado de programación mientras los empleados utilizan navegadores o herramientas de desarrollo conocidas. Los datos sensibles podrían permanecer dentro de la red de la organización.
Este escenario muestra por qué DGX Spark no es simplemente un mini PC prémium. NVIDIA está empaquetando software de centro de datos, redes y patrones de despliegue para entornos más pequeños.
El enfoque también protege la estrategia de plataforma de NVIDIA. Un cliente que añade un segundo Spark aumenta su dependencia de DGX OS, CUDA, ConnectX y las herramientas de gestión de NVIDIA.
Por tanto, NVIDIA DGX Spark 64GB funciona tanto como producto como unidad de expansión. Su valor a largo plazo depende de lo bien que se comporte el clúster fuera de demostraciones seleccionadas.
Las pruebas independientes deberían medir la latencia hasta el primer token, la generación sostenida, los usuarios simultáneos, el consumo eléctrico y la recuperación ante fallos en dos máquinas.
Hasta que lleguen esas pruebas, el resultado de 1,7 veces de NVIDIA es un límite útil, no un resultado esperado para todos los modelos.
AMD y Apple Presionan la Decisión de Memoria de NVIDIA
NVIDIA lidera con integración de CUDA y redes para IA, mientras los rivales pueden ofrecer más memoria o una mayor flexibilidad de escritorio.
AMD ha ampliado su respuesta a la IA local compacta mediante sistemas Ryzen AI Halo. Estas máquinas utilizan memoria unificada y gráficos Radeon integrados.
Un sistema para desarrolladores de AMD anunciado en 2026 incluía 128GB de memoria LPDDR5X y compatibilidad con Linux o Windows. Su posicionamiento inicial rebajaba el precio anterior de Spark de NVIDIA.
La comparación de sistemas AMD ilustra la elección. AMD ofrece la flexibilidad familiar de un PC, mientras NVIDIA proporciona un entorno de software de IA más consolidado.
Los sistemas Ryzen AI Max de varios fabricantes también se dirigen a usuarios de modelos locales. Algunos ofrecen configuraciones de 128GB, funciones estándar de PC y almacenamiento reemplazable.
Las plataformas AMD de mayor capacidad amplían aún más esa competencia. Pueden priorizar grandes grupos de memoria para usuarios dispuestos a sacrificar parte del rendimiento de IA o la comodidad del software.
La capacidad de memoria por sí sola no resuelve la comparación. Las reseñas han constatado con frecuencia que GB10 es más rápido en trabajo de IA basado en GPU que las alternativas Radeon integradas contemporáneas.
CUDA sigue siendo otra ventaja. Muchos frameworks, paquetes de modelos y proyectos de optimización publican soporte para NVIDIA antes de que maduren rutas equivalentes de AMD.
Los desarrolladores que necesitan una biblioteca específica dependiente de CUDA pueden no tener ningún sustituto práctico. Ahorrar dinero en hardware aporta poco valor si el software requerido no puede ejecutarse correctamente.
La compatibilidad de AMD con Windows puede importar igual de mucho para otro grupo. Los profesionales creativos y desarrolladores pueden querer IA local sin mantener un dispositivo Linux dedicado.
Apple ofrece una tercera vía. Los sistemas Mac Studio combinan altas capacidades de memoria, procesadores eficientes y un sistema operativo de escritorio maduro.
La memoria unificada de Apple permite cargar modelos grandes sin el límite habitual de memoria de vídeo de una GPU discreta. Herramientas como MLX se dirigen directamente a Apple silicon.
Sin embargo, la disponibilidad de software y el rendimiento de los modelos varían. Los flujos de trabajo centrados en CUDA no pasan automáticamente a los entornos Metal o MLX de Apple.
Los sistemas Mac tampoco cuentan con la infraestructura ConnectX-7 integrada de DGX Spark. No están diseñados en torno a la ruta de inferencia local directa de dos nodos de NVIDIA.
Por tanto, la decisión competitiva tiene varias dimensiones.
Capacidad de memoria
Sistemas NVIDIA de 64GB: Más adecuados para modelos definidos y cargas de trabajo de inferencia controladas.
Sistemas NVIDIA de 128GB: Más margen, pero el último aumento debilita su valor original.
Sistemas AMD y Apple: Las configuraciones seleccionadas pueden proporcionar grupos de memoria más grandes con distintas compensaciones de rendimiento y software.
Compatibilidad de software
NVIDIA: Amplio soporte de CUDA y una pila de IA preconfigurada.
AMD: Compatibilidad ROCm en mejora, además de opciones convencionales de Windows y Linux.
Apple: Aplicaciones nativas sólidas y herramientas MLX, pero compatibilidad limitada con CUDA.
Estrategia de expansión
NVIDIA: Agrupación directa ConnectX-7 con configuración asistida.
AMD: Opciones más convencionales de estaciones de trabajo y despliegue en red.
Apple: Alta capacidad en un único sistema, sin un diseño de agrupación Spark equivalente.
Informática general
NVIDIA: DGX OS centra el sistema en el desarrollo y la inferencia de IA.
AMD: Funciona más como un PC estándar de gama alta.
Apple: Combina IA local con una plataforma consolidada de creatividad y productividad.
Por tanto, la decisión entre DGX Spark 64GB y 128GB debe incluir alternativas. Los compradores deben evitar tratar GB10 como la única vía hacia modelos locales privados.
La defensa más fuerte de NVIDIA es la integración. Combina silicio, CUDA, runtimes optimizados, redes y gestión de sistemas bajo un único diseño compatible.
Su vulnerabilidad es el valor de la memoria. Si los compradores necesitan principalmente capacidad, los competidores pueden desafiar a NVIDIA sin igualar todos los resultados de rendimiento de GB10.
El último precio amplía esa oportunidad. Un comprador puede tolerar una inferencia más lenta si una alternativa aloja el modelo requerido en una sola máquina.
A la inversa, un modelo más pequeño que se ejecuta más rápido mediante CUDA puede superar en el uso diario a un despliegue más grande pero más lento. Las cargas de trabajo reales deben decidir el ganador.
Qué Deben Vigilar los Compradores Tras el Lanzamiento de 64GB
Tres señales mostrarán si el Spark más pequeño se convierte en una plataforma práctica o en una costosa respuesta a la escasez de memoria.
La primera señal es la disponibilidad de socios desde el 23 de octubre y después. NVIDIA ha nombrado seis fabricantes, pero importarán sus configuraciones exactas y volúmenes de envío.
Una configuración inicial nominal aporta poco valor si sigue sin estar disponible. Los compradores deben seguir los sistemas entregados, no las páginas de anuncios ni los listados con pedidos pendientes.
Las especificaciones de los socios también requieren una comparación cuidadosa. La capacidad de almacenamiento, la selección de puertos, la disponibilidad regional, el servicio de garantía y el software incluido pueden cambiar el valor real.
Si varios fabricantes mantienen existencias fiables, el lanzamiento de 64GB reforzará la afirmación de NVIDIA de que creó un punto de entrada utilizable.
Si el inventario sigue siendo escaso, el producto parecerá más una referencia de precios que una máquina de desarrollo ampliamente accesible.
La segunda señal son las pruebas independientes de cargas de trabajo. Las reseñas deberían comparar un Spark de 64GB, un Spark de 128GB y un clúster de dos nodos de 64GB.
Cargar modelos no es suficiente. Las pruebas necesitan contextos largos, usuarios simultáneos, llamadas a herramientas de agentes, cargas de trabajo de ajuste fino y funcionamiento sostenido.
Las mediciones más importantes incluyen la memoria utilizable, el tiempo hasta el primer token, la velocidad de salida, el consumo de energía y la eficiencia de escalado del clúster.
Los recuentos máximos de parámetros de NVIDIA deben recibir un escrutinio especial. Un modelo que técnicamente cabe aún puede ofrecer una experiencia poco práctica.
Las pruebas independientes también pueden revelar si el ancho de banda sin cambios conserva la mayor parte del rendimiento de un solo nodo. Las cargas de trabajo limitadas por capacidad deberían comportarse de forma distinta de las limitadas por ancho de banda.
Si la máquina más pequeña ofrece un rendimiento predecible con modelos populares de 27.000 a 35.000 millones de parámetros, el posicionamiento de NVIDIA ganará respaldo.
Si los contextos normales o los agentes simultáneos agotan la memoria, la versión de 64GB atenderá a un público mucho más reducido de lo que sugiere su marketing.
La tercera señal es la respuesta competitiva. Los ensambladores de sistemas AMD y Apple pueden presionar a NVIDIA mediante capacidad de memoria, soporte de software o menores costes totales de propiedad.
AMD tiene margen para mejorar la compatibilidad con ROCm y promover la IA local basada en Windows. Un mejor soporte de los ejecutores de modelos debilitaría el bloqueo práctico de CUDA.
Apple puede enfatizar configuraciones con gran memoria unificada e inferencia local eficiente. Su oportunidad es más fuerte entre los desarrolladores que ya utilizan macOS.
NVIDIA puede responder con mejor software en lugar de otro cambio de hardware. Sync Cluster Assistant y Model Launcher son ejemplos tempranos de esa estrategia.
Observe cuántos modelos reciben perfiles de despliegue con un solo clic. Observe también si los desarrolladores pueden personalizar esos perfiles sin volver a complejas configuraciones manuales.
El mercado de la memoria sigue siendo la variable externa. Si continúan las carencias, se normalizarían precios más altos y se incentivaría a los fabricantes a priorizar configuraciones más pequeñas.
Una mejora de la oferta pondría a prueba si los recientes aumentos son temporales. También podría volver a presionar a NVIDIA para ofrecer más memoria en los modelos de entrada.
Para los compradores empresariales, la acción inmediata es sencilla. Defina la carga de trabajo antes de elegir la máquina.
Pruebe el modelo previsto, la longitud de contexto, el número de usuarios y el método de ajuste fino. Incluya la compatibilidad con frameworks y los costes operativos en la comparación.
El NVIDIA DGX Spark 64GB ofrece la misma base GB10 con un límite de memoria más ajustado. Puede funcionar para despliegues específicos de inferencia y agentes.
No debe considerarse un sustituto universal del sistema original de 128GB. El modelo de 128GB sigue siendo más flexible, pero su precio más elevado exige una utilización mayor.
¿Su carga de trabajo se beneficiará más del rendimiento de CUDA y la pila gestionada de NVIDIA, o de la mayor reserva de memoria que puede ofrecer un sistema? Haga esa prueba antes de comprometerse con cualquiera de las configuraciones de Spark.



