El supuesto modelo de un billón de parámetros de NVIDIA sigue sin verificarse. Su modelo confirmado es más pequeño
- Sophie Larsen

- hace 3 días
- 14 min de lectura
NVIDIA apareció en un titular de Google News con una afirmación llamativa: la empresa estaba desarrollando un modelo abierto de IA de un billón de parámetros para desafiar a los sistemas líderes. Sin embargo, los materiales publicados por NVIDIA no confirman esa descripción. Su buque insignia verificado, Nemotron 3 Ultra, contiene 550.000 millones de parámetros totales y activa 55.000 millones para cada token.
Esa diferencia es más que una corrección numérica. Revela con qué facilidad los parámetros totales, los parámetros activos, los tokens de entrenamiento y los planes de desarrollo pueden condensarse en un titular engañoso. Cada cifra describe una parte distinta de un sistema de IA.
La historia de fondo sigue siendo relevante. NVIDIA está yendo más allá de vender procesadores e infraestructura de software. Está publicando pesos de modelos abiertos, recursos de entrenamiento, herramientas de despliegue y una colaboración sectorial para la próxima generación de Nemotron.
La verdadera competencia no es simplemente NVIDIA contra OpenAI, Anthropic o Google. Es la estrategia abierta y centrada en infraestructura de NVIDIA frente a los servicios de modelos cerrados que actualmente definen gran parte de la frontera comercial.
Lo que el titular de Google News no establece
Ningún lanzamiento público de NVIDIA verifica actualmente que haya un modelo Nemotron de un billón de parámetros en desarrollo.
El titular distribuido a través de Google News se remonta a una publicación de un medio, no a un informe técnico ni a un anuncio de producto de NVIDIA. No aporta una tarjeta de modelo accesible, una arquitectura identificada, un paquete de benchmarks, una fecha de lanzamiento ni una declaración de la empresa que confirme la cifra.
Eso no demuestra que NVIDIA no tenga un modelo interno más grande. Las empresas prueban sistemas de forma habitual antes de anunciarlos. Pero sí significa que la descripción de un billón de parámetros debe seguir considerándose un informe sin verificar, y no un hecho establecido sobre un producto.
La referencia verificada más cercana es Nemotron 3 Ultra. NVIDIA publicó el modelo el 4 de junio de 2026 y lo describió como su lanzamiento Nemotron más capaz. La visión general oficial del modelo especifica 550.000 millones de parámetros totales y 55.000 millones de parámetros activos.
Nemotron 3 Ultra utiliza una arquitectura de mezcla de expertos. Ese diseño divide el modelo en grupos especializados y activa solo una parte de la red para cada token. El enfoque puede aumentar la capacidad total sin aplicar todos los parámetros durante cada respuesta.
Su nombre completo, Nemotron 3 Ultra 550B-A55B, muestra ambas cifras. “550B” representa los parámetros totales, mientras que “A55B” indica que aproximadamente 55.000 millones se activan para cada token.
Esta distinción modifica la economía del despliegue. Un modelo denso de 550.000 millones de parámetros implicaría toda la red durante la inferencia. Un modelo disperso puede dirigir cada token a expertos seleccionados, reduciendo el trabajo computacional necesario para una respuesta.
Otra posible fuente de confusión es el corpus de entrenamiento. NVIDIA afirma que preentrenó Ultra con 20 billones de tokens de texto. Los tokens son fragmentos de datos de entrenamiento, no parámetros aprendidos del modelo. Un modelo entrenado con billones de tokens no es automáticamente un modelo de un billón de parámetros.
NVIDIA ha hablado de entrenamiento a escala de un billón durante años. En 2021, sus ingenieros describieron una demostración de entrenamiento que involucraba un modelo de un billón de parámetros y 3.072 GPU A100. Ese trabajo demostró software de entrenamiento distribuido, en lugar de anunciar un modelo conversacional público.
Estas cifras pueden desvincularse fácilmente de sus contextos originales. Un experimento histórico de escalado, un conjunto de datos de 20 billones de tokens y un lanzamiento de 550.000 millones de parámetros describen tres hechos independientes.
El titular también utiliza “modelo abierto de IA”, lo que puede crear otra ambigüedad. En este contexto, “abierto” describe el acceso al modelo. No indica una relación con OpenAI, la empresa detrás de ChatGPT.
La agregación de Google News puede ampliar el alcance de un informe, pero la agregación no verifica su afirmación central. La verificación sigue dependiendo de documentación primaria, fuentes identificadas, artefactos técnicos y evaluaciones reproducibles.
Por ahora, la conclusión defendible es limitada. NVIDIA ha publicado un modelo de pesos abiertos de 550.000 millones de parámetros, mientras que un sucesor específico de un billón de parámetros sigue sin confirmarse.
El modelo abierto verificado de NVIDIA es Nemotron 3 Ultra
El lanzamiento confirmado ya es un modelo importante, pero NVIDIA lo diseñó en torno al cómputo selectivo y no solo al número de parámetros.
Nemotron 3 Ultra es el modelo más grande de la familia Nemotron 3. Sigue a Nano y Super, que se orientan a despliegues más pequeños y requisitos de rendimiento diferentes.
Ultra combina el enrutamiento de mezcla de expertos con capas Mamba y de atención. Mamba es una arquitectura de procesamiento de secuencias diseñada para manejar entradas largas con características computacionales distintas de la atención estándar.
El modelo también utiliza expertos latentes y predicción de múltiples tokens. Los expertos latentes proporcionan especialización adicional dentro de la red, mientras que la predicción de múltiples tokens permite al sistema anticipar más de un token futuro durante la generación.
NVIDIA afirma que Ultra admite longitudes de contexto de hasta un millón de tokens. Una ventana de contexto es la cantidad de material de entrada y generado que el modelo puede considerar durante una interacción.
Esa capacidad apunta a agentes de larga ejecución, en lugar de intercambios breves con chatbots. Las cargas de trabajo probables incluyen análisis de repositorios de software, investigación prolongada, planificación en varias etapas y procesos empresariales que acumulan un contexto de trabajo considerable.
El informe técnico de la empresa indica que el preentrenamiento utilizó 20 billones de tokens de texto. NVIDIA amplió después la longitud de contexto y aplicó ajuste fino supervisado, aprendizaje por refuerzo y destilación de modelos docentes.
La destilación de modelos docentes transfiere comportamientos de otros modelos a un modelo objetivo. NVIDIA afirma que más de diez docentes centrados en dominios aportaron orientación durante el proceso de posentrenamiento de Ultra.
El lanzamiento incluye checkpoints base, posentrenados y cuantizados. La cuantización representa los valores del modelo con menos bits, reduciendo los requisitos de memoria y cómputo mientras intenta preservar una precisión útil.
NVIDIA preentrenó una versión de Ultra utilizando NVFP4, su formato de punto flotante de cuatro bits. La empresa presenta ese formato como una vía hacia un mayor rendimiento en hardware Blackwell.
Esta conexión con el hardware es central. NVIDIA no necesita que Nemotron se convierta en el único modelo que usen las empresas. Se beneficia cuando los desarrolladores entrenan, adaptan y sirven muchos modelos utilizando procesadores y software de NVIDIA.
Por ello, Ultra funciona tanto como modelo utilizable como implementación de referencia. Puede demostrar cómo se comporta un gran modelo disperso en toda la pila de entrenamiento, optimización e inferencia de NVIDIA.
NVIDIA afirma que Nemotron 3 Ultra alcanza una inferencia hasta cinco veces más rápida y un coste hasta un 30 por ciento menor que modelos abiertos comparables. Son comparaciones de la empresa y dependen del hardware, la precisión, el software, los prompts y las longitudes de salida seleccionados.
Su página de investigación ofrece afirmaciones de rendimiento más específicas. NVIDIA informa de 5,9 veces el rendimiento de GLM-5.1, 4,8 veces el de Kimi K2.6 y 1,6 veces el de Qwen 3.5.
Esas pruebas utilizaron una entrada de 8.000 tokens y una salida de 64.000 tokens en sistemas GB200. NVIDIA utilizó TensorRT-LLM para Ultra, mientras que los modelos de comparación utilizaron vLLM, seleccionando la configuración disponible más potente para cada uno.
Esa metodología no hace que los resultados carezcan de sentido. Pero sí significa que los lectores deben interpretarlos como resultados de despliegue a nivel de sistema, no como comparaciones basadas únicamente en la arquitectura.
Un modelo, un entorno de ejecución, un formato numérico y un acelerador funcionan conjuntamente. NVIDIA compite deliberadamente en ese nivel combinado.
Por qué NVIDIA está desafiando a los sistemas de IA cerrados
La ventaja estratégica de NVIDIA proviene de suministrar la plataforma sobre la que se ejecutan muchos modelos, no de ganar todos los benchmarks con un único asistente.
OpenAI, Anthropic y Google ofrecen en su mayoría sus principales sistemas de propósito general a través de servicios alojados. Los clientes envían solicitudes a endpoints gestionados, mientras que los pesos de los modelos y los métodos básicos de entrenamiento siguen sin estar disponibles.
NVIDIA está adoptando una vía diferente con Nemotron. Publica pesos y una mayor parte del material de desarrollo circundante para que las organizaciones puedan inspeccionar, adaptar y desplegar modelos en los entornos que elijan.
Los pesos abiertos no implican automáticamente un desarrollo completamente abierto. Los datos de entrenamiento pueden contener restricciones, las licencias pueden imponer condiciones y reproducir un modelo grande sigue siendo costoso.
Aun así, el acceso a los pesos cambia lo que las empresas pueden controlar. Los equipos pueden ajustar un modelo, evaluarlo en cargas de trabajo privadas, modificar su comportamiento y operarlo sin dirigir cada solicitud a través de un proveedor externo de modelos.
Esta opción importa en entornos regulados o sensibles a los datos. Los bancos, las organizaciones sanitarias, los gobiernos y las empresas industriales a menudo necesitan un control más claro sobre la ubicación de los datos, las políticas de acceso y el comportamiento del sistema.
Nemotron 3 Ultra también se orienta a cargas de trabajo agénticas. Un sistema agéntico combina un modelo con herramientas, memoria y un bucle de ejecución para poder completar tareas de varios pasos.
Los agentes de larga ejecución generan una demanda de inferencia considerable. Inspeccionan repetidamente el estado, llaman a herramientas, leen resultados, reconsideran planes y producen nuevas acciones. Una solicitud de usuario puede desencadenar muchas llamadas al modelo.
Ese patrón favorece el negocio de NVIDIA. Más actividad de agentes significa más cómputo, incluso cuando los pesos del modelo subyacente están disponibles gratuitamente.
NVIDIA también vende los componentes que rodean esas cargas de trabajo. Su cartera incluye aceleradores, redes, sistemas DGX, bibliotecas CUDA, motores de inferencia, software de servicio de modelos y capacidad en la nube.
Por tanto, un modelo abierto exitoso puede ampliar el mercado de NVIDIA sin exigir que la empresa cobre por cada respuesta del modelo. El modelo impulsa la demanda de la infraestructura que lo entrena y lo sirve.
Los proveedores cerrados enfrentan un cálculo diferente. Su ventaja proviene de ofrecer sistemas integrados con alto rendimiento, acceso sencillo, controles de seguridad y actualizaciones frecuentes.
Muchos clientes prefieren ese acuerdo. Operar un modelo de 550.000 millones de parámetros requiere hardware especializado, experiencia operativa, monitorización y un proceso de evaluación continuo.
Por tanto, la presión competitiva es selectiva. Nemotron no necesita reemplazar a todos los asistentes alojados. Necesita hacer creíble el despliegue autogestionado para las organizaciones que valoran el control o la personalización.
La escala de NVIDIA también diferencia su esfuerzo de proyectos más pequeños de modelos abiertos. La empresa puede conectar directamente la investigación de modelos con el hardware y el software utilizados para la inferencia en producción.
Esto crea un ciclo de refuerzo. NVIDIA puede diseñar modelos para sus formatos numéricos, optimizar los entornos de ejecución para esos modelos y utilizar los resultados para demostrar sus plataformas informáticas más recientes.
El titular sobre el modelo de un billón de parámetros de NVIDIA exagera lo que se ha verificado. Sin embargo, el desafío estratégico que subyace es real. NVIDIA quiere que los modelos abiertos se conviertan en una fuente importante de demanda de computación operada por NVIDIA.
La verdadera competencia es la eficiencia, no un billón de parámetros
Un mayor total de parámetros no garantiza un modelo mejor, especialmente cuando la mayoría de los parámetros permanecen inactivos durante cada token.
Los recuentos de parámetros sirvieron en su momento como un indicador práctico de la escala de un modelo. Esa señal se volvió menos útil a medida que los desarrolladores adoptaron arquitecturas dispersas, destilación, datos sintéticos, razonamiento más prolongado y posentrenamiento especializado.
Kimi K2.6, uno de los objetivos de comparación de NVIDIA, cuenta con un billón de parámetros totales, pero activa 32.000 millones por token. Nemotron 3 Ultra contiene 550.000 millones de parámetros totales y activa 55.000 millones.
El primer modelo es mayor por recuento total. El segundo activa más parámetros durante cada token. Ningún dato por sí solo establece qué modelo rinde mejor en una tarea determinada.
La arquitectura, los datos de entrenamiento, la optimización y la configuración de inferencia pueden importar tanto como el tamaño anunciado. Un modelo más pequeño con un postentrenamiento más sólido puede superar a uno mayor en evaluaciones concretas.
El argumento de NVIDIA se apoya en esta distinción. Ultra está diseñado para ofrecer una precisión competitiva mientras genera resultados más rápido en los sistemas actuales de NVIDIA.
Las pruebas independientes aportan un contrapeso útil a los resultados del proveedor. Artificial Analysis evaluó el modelo previo al lanzamiento y lo calificó como el principal modelo estadounidense de pesos abiertos en el momento de su lanzamiento.
Su evaluación independiente otorgó a Ultra una puntuación de 48 en el Intelligence Index. La misma evaluación situó a Kimi K2.6 en 54, dejando a NVIDIA por detrás del modelo chino de pesos abiertos más sólido evaluado allí.
El resultado respalda solo una parte del posicionamiento de NVIDIA. Ultra parecía competitivo entre los lanzamientos estadounidenses de pesos abiertos y ofreció una alta velocidad de servicio medida. No lideró todo el campo de modelos de pesos abiertos en inteligencia.
Las versiones de los benchmarks también cambian. Posteriormente, la página en vivo del modelo de Artificial Analysis mostró una puntuación distinta con una suite de evaluación actualizada. Por ello, las clasificaciones deben tratarse como mediciones con fecha, no como posiciones permanentes.
Aquí es donde la afirmación original de Google News se vuelve distractora. La etiqueta de un billón de parámetros sugiere que alcanzar un tamaño concreto situaría a NVIDIA junto a los principales sistemas cerrados.
Esa suposición ignora el problema de evaluación. OpenAI, Anthropic y Google exponen capacidades, herramientas, interfaces y capas de seguridad diferentes. Sus modelos no son comparables directamente mediante recuentos de parámetros porque estas empresas, por lo general, no divulgan cifras equivalentes.
El rendimiento empresarial real también depende de la aplicación completa. La calidad de la recuperación, la fiabilidad de las herramientas, los permisos, el diseño de memoria y la revisión humana pueden determinar si un agente completa trabajo útil.
El modelo puede fallar incluso cuando su puntuación de benchmark parece sólida. Un contexto largo no garantiza una recuperación precisa, y buenos resultados de programación no garantizan cambios de código seguros.
La eficiencia operativa tiene sus propias limitaciones. Los resultados más rápidos de NVIDIA dependen de hardware NVIDIA, formatos de baja precisión y software de servicio ajustado. Las organizaciones que utilizan otros entornos podrían no reproducir el mismo rendimiento.
Los modelos dispersos también introducen complejidad de enrutamiento. El sistema debe seleccionar expertos adecuados, equilibrar cargas de trabajo y mover datos del modelo de forma eficiente entre aceleradores.
Un modelo con 55.000 millones de parámetros activos sigue siendo considerable. Alojarlo por cuenta propia a escala de producción requiere mucha más infraestructura que descargar un modelo local pequeño.
Por tanto, la comparación importante no es “550.000 millones frente a un billón”. Es la precisión útil por unidad de computación, medida en cargas de trabajo realistas bajo condiciones de servicio comparables.
NVIDIA parece comprender ese cambio. Sus materiales técnicos hacen hincapié en el rendimiento, los parámetros activos, el comportamiento de contexto largo y la eficiencia de despliegue más que en una carrera hacia el mayor total posible.
Nemotron 4 Convierte el Modelo en un Proyecto de Coalición
El próximo movimiento de NVIDIA en modelos abiertos es un programa de desarrollo compartido, pero la empresa no le ha asignado una especificación verificada de un billón de parámetros.
En GTC, el 16 de marzo de 2026, NVIDIA anunció la Nemotron Coalition. Entre sus miembros fundadores se encuentran Mistral AI, Black Forest Labs, Cursor, LangChain, Perplexity, Reflection AI, Sarvam y Thinking Machines Lab.
El primer modelo base de la coalición está siendo codesarrollado por NVIDIA y Mistral AI. Se espera que otros participantes aporten datos, evaluaciones y conocimiento de dominio durante etapas posteriores del desarrollo.
NVIDIA afirma que el modelo resultante se entrenará en DGX Cloud y se lanzará al ecosistema abierto. También sustentará la próxima familia Nemotron 4.
El anuncio oficial de la coalición no revela el número de parámetros de Nemotron 4. No proporciona un objetivo de un billón de parámetros, una especificación de checkpoint ni una fecha de lanzamiento.
Esta ausencia importa porque Nemotron 4 es el proyecto más plausible detrás de los informes sobre un modelo NVIDIA más grande aún no anunciado. Es público, sigue en desarrollo y pretende impulsar sistemas abiertos de frontera.
Sin embargo, la plausibilidad no es confirmación. El proyecto podría producir varios tamaños, utilizar una arquitectura dispersa o priorizar capacidades especializadas por encima de la escala total.
La estructura de la coalición también revela el objetivo más amplio de NVIDIA. En vez de pedir a un único grupo interno de investigación que defina todos los objetivos, NVIDIA está reclutando empresas que representan distintos requisitos de aplicación.
Cursor puede aportar casos de uso de programación. LangChain puede orientar el uso de herramientas y los agentes de larga duración. Perplexity aporta experiencia con aplicaciones centradas en la búsqueda, mientras que Mistral contribuye experiencia en desarrollo de modelos.
Este acuerdo da a NVIDIA acceso a comentarios sobre cargas de trabajo antes de que el modelo llegue al lanzamiento. También anima a los miembros de la coalición a optimizar sus productos en torno a la base abierta resultante.
Existe una clara alineación comercial. Un modelo desarrollado de forma colaborativa, entrenado en DGX Cloud y optimizado para sistemas NVIDIA puede aumentar la demanda de infraestructura de NVIDIA.
Eso no elimina su valor potencial para los desarrolladores. Las evaluaciones compartidas y los pesos accesibles pueden ampliar la participación en comparación con un modelo disponible solo mediante la API de un proveedor.
La apertura real del modelo dependerá del lanzamiento. Los desarrolladores deberían examinar la licencia, los usos permitidos, las divulgaciones sobre datos de entrenamiento, los checkpoints, las recetas, la documentación de seguridad y los requisitos de hardware.
También deberían distinguir los pesos abiertos de la reproducibilidad. Publicar checkpoints permite el despliegue y la modificación, pero pocas organizaciones pueden repetir de forma independiente un preentrenamiento a escala de frontera.
Nemotron 4 ejercerá presión sobre los proveedores cerrados solo si la coalición produce rendimiento competitivo y opciones de despliegue prácticas. Una gran cifra de parámetros sin esas cualidades generaría atención, no adopción duradera.
La coalición también introduce riesgos de coordinación. Los participantes tienen productos, incentivos, políticas de datos y clientes diferentes. El desarrollo compartido de modelos exige decisiones sobre arquitectura, evaluaciones, calendario de lanzamiento y gobernanza.
NVIDIA conserva una posición organizadora sólida porque proporciona la plataforma de entrenamiento. Sin embargo, la credibilidad del proyecto dependerá de si las contribuciones van más allá de asociaciones promocionales.
Un checkpoint base público proporcionaría la evidencia más clara. Informes técnicos detallados, evaluaciones reproducibles y recursos de postentrenamiento utilizables reforzarían aún más el argumento.
Hasta que aparezcan esos artefactos, Nemotron 4 debe describirse como un programa anunciado de modelos abiertos. No debe presentarse como un modelo NVIDIA confirmado de un billón de parámetros.
Qué Deben Vigilar los Desarrolladores y Compradores Empresariales
Tres señales concretas mostrarán si NVIDIA está construyendo una plataforma duradera de modelos abiertos o simplemente beneficiándose de un titular inflado.
La primera señal es una ficha de modelo o un informe técnico de Nemotron 4. Esa documentación debería resolver la cuestión del tamaño al enumerar parámetros totales, parámetros activos, arquitectura, tokens de entrenamiento, longitud de contexto y formatos numéricos.
Si NVIDIA confirma un diseño a escala de un billón, el titular de Google News obtendrá respaldo retrospectivo. Si Nemotron 4 utiliza una red más pequeña o estructurada de otra manera, la afirmación original parecerá una confusión de métricas de modelos.
La segunda señal es el rendimiento independiente en condiciones comparables. Las pruebas deberían evaluar razonamiento, programación, uso de herramientas, fiabilidad de contexto largo y rendimiento en varias configuraciones de servicio.
Los benchmarks de las empresas son útiles para comprender las fortalezas previstas. Las evaluaciones independientes revelan si esas fortalezas se mantienen con diferentes prompts, entornos de ejecución y supuestos de hardware.
Vigile los parámetros activos tan de cerca como los parámetros totales. Examine también la longitud de salida, la latencia, los requisitos de memoria, las tasas de fallo y la precisión por unidad de computación.
La tercera señal es la adopción empresarial práctica. NVIDIA ha nombrado marcos de agentes y socios de software, pero la compatibilidad anunciada no demuestra un uso sostenido en producción.
La evidencia útil incluiría despliegues documentados, mejoras repetibles en cargas de trabajo, herramientas de servicio estables y organizaciones que eligen Nemotron frente a modelos cerrados alojados.
Los desarrolladores deberían resistirse a tratar la apertura como una recomendación automática. El acceso al modelo es solo una parte de un sistema de producción. Las revisiones de seguridad, la gobernanza de datos, la observabilidad, la evaluación y los procedimientos de respaldo siguen siendo necesarios.
Los compradores empresariales deberían comparar modelos operativos completos. Un servicio alojado reduce el trabajo de infraestructura, mientras que un modelo autogestionado ofrece mayor control y personalización.
Los trabajadores del conocimiento experimentarán la competencia a través de productos construidos sobre estos sistemas. Los modelos abiertos más rápidos pueden reducir las demoras y permitir a los proveedores de software ofrecer más opciones de despliegue privado.
Los hechos verificados ya respaldan una historia relevante. NVIDIA lanzó un modelo disperso de 550.000 millones de parámetros, abrió varios artefactos de desarrollo y organizó socios en torno a una futura familia de modelos.
Lo que no respaldan es la certeza sobre un producto de un billón de parámetros. Esa cifra sigue siendo una afirmación sin documentación primaria correspondiente.
La próxima vez que aparezca una cifra llamativa sobre un modelo en Google News, busque el recuento de parámetros activos, la ficha del modelo, el informe técnico y las pruebas independientes. Esos detalles mostrarán si NVIDIA ha ampliado la frontera o simplemente ha generado un titular más grande.


