Xenon Hunmin VLM 397B es abierto, pero Qwen-CUA sigue ganando la prueba más difícil
Xenon ha lanzado Hunmin VLM 397B como código abierto, dotando a un modelo de 397.000 millones de parámetros de nuevas capacidades de control informático tras entrenarlo con ocho GPU Nvidia B200. El lanzamiento pone a disposición, bajo una licencia Apache 2.0, el reconocimiento de pantalla, los clics, la escritura y el trabajo de escritorio de varios pasos. Sin embargo, los propios resultados de Xenon revelan una importante diferencia entre reconocer elementos de interfaz y completar tareas más largas.
Xenon Hunmin VLM 397B obtuvo 75,6 en ScreenSpot-Pro, un benchmark que mide si un modelo puede localizar objetivos de interfaz en aplicaciones profesionales. Según la empresa, ese resultado lo situó en segundo lugar en la clasificación de Hugging Face del benchmark cuando se lanzó el modelo. También superó tanto a su modelo base Qwen3.5 como a Qwen-CUA en las cinco evaluaciones de localización de interfaz comunicadas.
La jerarquía cambia cuando la prueba pasa de localizar un botón a terminar un flujo de trabajo completo. Xenon informa de una puntuación de 70,5 en su evaluación OSWorld de 360 tareas, frente a 77,1 de Qwen-CUA bajo la misma configuración reproducida. Esa diferencia hace que este lanzamiento sea más revelador que un simple anuncio de clasificación.
Hunmin demuestra que una empresa puede transferir una capacidad especializada a un gran modelo abierto con un clúster de entrenamiento relativamente pequeño. No demuestra que la precisión visual por sí sola produzca el agente informático más fiable. Para desarrolladores y compradores empresariales, esa distinción importa más que el llamativo número de parámetros del modelo.
Xenon Hunmin VLM 397B añade control informático a Qwen3.5
El lanzamiento transforma un modelo multimodal general en un modelo abierto para uso informático sin volver a entrenar toda su base de 397.000 millones de parámetros.
Xenon, también conocida internacionalmente como GenON, lanzó el modelo el 18 de septiembre de 2026. La empresa publica sus modelos a través de la organización mncai en Hugging Face. Su nuevo repositorio incluye el modelo de precisión completa, una versión FP8, resultados de evaluación y orientación para la implementación.
Hunmin parte de Qwen3.5-397B-A17B, un modelo de mezcla de expertos con pesos abiertos del equipo Qwen de Alibaba. Tiene 397.000 millones de parámetros totales, pero activa unos 17.000 millones en cada pasada hacia delante. Ese diseño ofrece la capacidad de conocimiento de un modelo muy grande sin utilizar todos los parámetros para cada token.
El lanzamiento original de Qwen3.5 introdujo el procesamiento multimodal nativo para texto, imágenes y vídeo. Xenon conservó esa base mientras añadía capacidades de uso informático. Estas capacidades permiten al modelo interpretar capturas de pantalla, producir coordenadas y decidir qué acción de interfaz debe ocurrir después.
El nombre público completo del modelo es Hunmin-397B-A17B-CUA. CUA significa agente de uso informático, un sistema que realiza tareas mediante interfaces gráficas utilizadas por personas. En lugar de depender únicamente de la API de un sitio web, un modelo de este tipo puede operar navegadores, aplicaciones de oficina y software de escritorio mediante controles visibles.
Este enfoque amplía el trabajo previo de Xenon con Hunmin. La empresa lanzó Hunmin 32B en 2025 y continuó con Hunmin VLM 235B a principios de 2026. Su cronología corporativa también vincula la serie Hunmin con OneAgent, un producto empresarial de IA orientado a la acción.
Xenon afirma que el nuevo modelo conserva la mayor parte del rendimiento de Qwen3.5 en coreano. En ocho benchmarks coreanos comunicados, sus puntuaciones se mantuvieron a aproximadamente dos puntos del modelo base. Algunos resultados individuales subieron ligeramente, mientras que otros descendieron.
Ese equilibrio es estratégicamente importante para Xenon. Un modelo de uso informático que pierde demasiada capacidad lingüística puede tener dificultades con instrucciones, documentos e interfaces localizadas. Mantener el rendimiento en coreano proporciona a la empresa una posición empresarial más clara que la de un modelo optimizado solo para tareas web en inglés.
La tarjeta pública del modelo ofrece más detalles que los titulares del lanzamiento. Identifica los datos de entrenamiento, la pila de software, la configuración de hardware, los ajustes de comparación y los límites conocidos de la evaluación. También etiqueta los resultados de referencia como reproducidos por los autores, en lugar de puntuaciones comunicadas por los proveedores.
Esa divulgación mejora la utilidad del lanzamiento. Los desarrolladores pueden ver qué comparaciones comparten la misma configuración, en vez de combinar cifras incompatibles de clasificaciones no relacionadas. También expone la contrapartida que define la posición actual de Hunmin.
Ocho GPU B200 asumieron el trabajo de posentrenamiento
La afirmación más relevante de Xenon se refiere a la eficiencia del entrenamiento, no al número total de parámetros del modelo.
Entrenar desde cero un modelo base de 397.000 millones de parámetros requeriría mucho más que ocho GPU. Xenon no lo intentó. Transfirió una capacidad informática existente a Qwen3.5 y después refinó el modelo resultante mediante aprendizaje supervisado y aprendizaje por refuerzo.
El primer paso utilizó Qwen-CUA como fuente del comportamiento de control informático. Xenon calculó las diferencias de parámetros entre Qwen-CUA y su punto de control base Qwen3.5 correspondiente. Después aproximó esas diferencias mediante descomposición en valores singulares truncada, un método matemático para comprimir una matriz grande en componentes de menor rango.
Esas diferencias comprimidas se convirtieron en adaptadores de estilo LoRA. LoRA, o adaptación de bajo rango, representa una actualización del modelo con matrices entrenables más pequeñas en lugar de modificar cada peso original de forma independiente. Xenon fusionó esos adaptadores en el punto de control más grande Qwen3.5-397B-A17B.
Esta técnica importa porque el ajuste fino convencional se vuelve difícil a medida que crece un modelo. Los estados del optimizador, los gradientes, las activaciones y los pesos del modelo consumen memoria de GPU. Actualizar una representación limitada de bajo rango reduce la cantidad de datos entrenables y la carga de memoria asociada.
Xenon cuantizó después el punto de control transferido a FP8. FP8 almacena muchos valores numéricos con ocho bits, reduciendo el uso de memoria frente a los formatos de 16 bits. El equipo realizó más posentrenamiento mediante FP8 QLoRA, ajuste fino supervisado y aprendizaje por refuerzo de agentes.
El ajuste fino supervisado enseñó al modelo a partir de ejemplos que contenían las acciones de interfaz deseadas. El aprendizaje por refuerzo de agentes recompensó después el comportamiento exitoso dentro de entornos informáticos. Xenon identifica GRPO, o Group Relative Policy Optimization, como el método de refuerzo utilizado durante esta etapa.
La pila de entrenamiento incluyó MS-Swift, Ray, Megatron-Core y vLLM. Xenon nombra ScaleCUA-Data de OpenGVLab como su conjunto de datos supervisado. También enumera ScaleCUA y CUA-Gym como entornos de aprendizaje por refuerzo.
Según Xenon, el proceso completo de posentrenamiento se ejecutó en ocho GPU Nvidia B200. Esa afirmación no significa que el modelo base completo se creara con ocho aceleradores. Significa que las etapas de transferencia de capacidades y posentrenamiento utilizaron ese clúster después de que Qwen ya hubiera construido el modelo base.
Esta distinción evita que un resultado de ingeniería impresionante se convierta en una comparación de cómputo engañosa. Xenon se benefició del modelo original de Qwen, del punto de control especializado de Qwen-CUA, de conjuntos de datos de entrenamiento abiertos y de software de optimización consolidado. Su contribución reside en combinar esos componentes de forma eficiente y adaptarlos a sus capacidades objetivo.
El método ofrece una posible plantilla para proveedores de IA más pequeños. En lugar de financiar un nuevo modelo base, una empresa puede comenzar con un punto de control abierto y añadir una habilidad operativa específica. Después puede dedicar recursos de cómputo limitados a datos de tareas, evaluación y refuerzo, en vez de repetir el preentrenamiento general.
Esta vía también reduce la distancia entre el trabajo académico y los modelos empresariales desplegables. Un equipo puede centrarse en aplicaciones, idiomas locales y entornos controlados. El modelo resultante aún puede heredar amplias capacidades visuales y lingüísticas de su base.
Sin embargo, el modelo sigue siendo exigente durante la inferencia. Una arquitectura de mezcla de expertos activa solo parte de su conjunto de parámetros, pero los 397.000 millones de pesos siguen requiriendo almacenamiento. El lanzamiento FP8 de Xenon reduce aproximadamente a la mitad las necesidades de almacenamiento, aunque el despliegue continúa requiriendo una infraestructura multi-GPU importante.
Por tanto, la afirmación sobre el entrenamiento con ocho GPU no debe interpretarse como una promesa de despliegue con ocho GPU. Entrenar adaptadores y servir un modelo fusionado presentan requisitos de recursos distintos. Los equipos empresariales deben evaluar capacidad de memoria, ancho de banda de interconexión, latencia, concurrencia y consumo energético antes de elegir esta arquitectura.
El reconocimiento de pantalla es la ventaja más clara de Hunmin
Los resultados más sólidos de Hunmin muestran que puede identificar objetivos de interfaz, especialmente en pantallas profesionales densas.
La localización en interfaces gráficas de usuario vincula una instrucción escrita con una ubicación específica en una captura de pantalla. Si un usuario pide a un agente seleccionar una fórmula de hoja de cálculo, el modelo debe encontrar la celda o el control relevante de la barra de herramientas. Un pequeño error de coordenadas puede llevar al agente al menú equivocado o modificar el archivo incorrecto.
ScreenSpot-Pro prueba esa capacidad en aplicaciones profesionales de alta resolución. Sus tareas incluyen interfaces más densas y menos permisivas que los sitios web de consumo típicos. El benchmark ScreenSpot-Pro se diseñó porque las pruebas de localización anteriores no representaban adecuadamente el software de escritorio especializado.
Xenon informa de un resultado de 75,6 con inferencia de vista única y de 76,6 con un método de ampliación. Sus puntuaciones reproducidas del modelo base Qwen3.5 fueron 72,7 y 75,1, respectivamente. Qwen-CUA obtuvo 62,2 sin ampliación y 71,9 con ampliación en el mismo entorno comunicado.
Hunmin también obtuvo 96,2 en ScreenSpot-v2, frente a 95,2 de su modelo base y 95,0 de Qwen-CUA. En OSWorld-G, una evaluación centrada en localización, alcanzó 79,9. En la versión refinada OSWorld-G-R, obtuvo 86,8.
La tarjeta del modelo afirma que estos resultados de localización lideraron el grupo de comparación evaluado por Xenon bajo su configuración reproducida. Esa formulación es importante. No establece un liderazgo permanente frente a todos los modelos, configuraciones de evaluación o envíos posteriores.
Los resultados comunicados siguen mostrando un patrón coherente. Hunmin mejora la percepción de interfaces en varias pruebas, en lugar de depender de una sola cifra favorable. Su mayor ventaja sobre Qwen-CUA aparece en ScreenSpot-Pro, donde la diferencia alcanza 13,4 puntos bajo la configuración de Xenon.
Para el software empresarial, esta fortaleza tiene valor práctico. Las interfaces densas siguen siendo habituales en sistemas contables, plataformas de gestión de relaciones con clientes, entornos de desarrollo y herramientas internas de administración. Muchos de estos productos ofrecen API incompletas o requieren acciones que atraviesan estados visibles de interfaz.
Un modelo con buena localización también puede trabajar con aplicaciones antiguas que nunca fueron diseñadas para la integración con IA. Puede identificar controles a partir de píxeles y etiquetas en vez de depender de elementos estructurados de páginas web. Esto ofrece una cobertura más amplia, aunque también genera retos de fiabilidad y seguridad.
Xenon indica a los usuarios que proporcionen capturas de pantalla de resolución nativa y normalicen las coordenadas en un rango de cero a 1.000. Las coordenadas resultantes deben después escalarse al ancho y alto reales de la pantalla. Estos detalles pueden afectar de forma sustancial a la precisión de los clics.
El modelo también utiliza un límite de historial visual de cinco capturas de pantalla para las evaluaciones de uso informático comunicadas. Xenon afirma que un historial más cercano a 20 imágenes puede aumentar el uso de memoria y el coste de inferencia. La ventana más pequeña refleja una decisión de despliegue, no solo una elección de benchmarking.
Limitar el historial visual puede mantener los costes de servicio más manejables. También puede dejar al agente con menos evidencia sobre acciones, diálogos o estados de página anteriores. Esa tensión cobra mayor importancia a medida que una tarea se alarga.
Un solo clic preciso no requiere una memoria extensa. Completar un flujo de trabajo de 30 pasos sí. La diferencia explica por qué las sólidas puntuaciones de grounding de Hunmin no se traducen automáticamente en liderazgo en tareas informáticas completas.
Qwen-CUA sigue liderando en tareas informáticas de extremo a extremo
El resultado central es una decisión dividida: Hunmin identifica mejor los objetivos de la interfaz, mientras que Qwen-CUA completa más tareas de largo recorrido.
OSWorld evalúa agentes dentro de aplicaciones informáticas reales, en lugar de probar coordenadas aisladas. Las tareas pueden involucrar navegadores, operaciones con archivos, clientes de correo, editores de imágenes, herramientas de documentos y múltiples aplicaciones. El agente debe observar un estado, elegir una acción, recuperarse de los cambios y continuar hasta finalizar.
El benchmark OSWorld oficial reunió originalmente 369 tareas informáticas con estados iniciales reproducibles y evaluación basada en la ejecución. Xenon utilizó una configuración de 360 tareas para los resultados de su tarjeta de modelo. Informa que todos los modelos comparados usaron el mismo límite de historial visual de cinco imágenes.
Hunmin obtuvo 70,5 en esa evaluación. El modelo base Qwen3.5 alcanzó 48,2, lo que supone una mejora de 22,3 puntos para Hunmin. Es una mejora sustancial y respalda la afirmación de Xenon de que su postentrenamiento incorporó un comportamiento significativo de control informático.
Sin embargo, Qwen-CUA obtuvo 77,1 bajo la misma configuración reproducida, superando a Hunmin por 6,6 puntos. WindowsAgentArena arroja el mismo orden. Hunmin obtuvo 50,9, 9,1 puntos por encima de los 41,8 del modelo base, mientras que Qwen-CUA alcanzó 57,3.
Los resultados no invalidan las mejoras de grounding de Hunmin. Demuestran que un agente necesita más que una selección visual precisa de objetivos. Debe planificar, seguir el progreso, gestionar errores, comprender el estado de la aplicación y evitar acciones que descarrilen el flujo de trabajo.
Pensemos en un agente al que se le pide actualizar cifras en una hoja de cálculo y enviar el resultado por correo electrónico. Puede localizar correctamente cada menú, celda y botón. Aun así, puede fallar al editar el libro equivocado, aplicar una fórmula al rango incorrecto o adjuntar un archivo desactualizado.
Las tareas más largas multiplican los pequeños errores. Un fallo inicial modifica las capturas posteriores e invalida el plan original. El modelo debe detectar esa desviación y recuperarse, en lugar de continuar con confianza por una ruta equivocada.
Los resultados de entrenamiento de Hunmin revelan de dónde procedió parte de la mejora. Xenon afirma que su checkpoint de transferencia de capacidades alcanzó 66,2 en OSWorld antes del entrenamiento posterior. El ajuste fino supervisado y el aprendizaje por refuerzo elevaron esa puntuación hasta 70,5, una mejora adicional de 4,3 puntos.
Esta progresión respalda el valor del método de Xenon. La transferencia de capacidades aportó gran parte de la habilidad inicial de uso informático, mientras que el postentrenamiento específico para tareas la mejoró. Sin embargo, la ventaja restante de Qwen-CUA sugiere que parte del comportamiento se comprimió de manera imperfecta o cambió durante la integración.
El objetivo en lengua coreana también puede influir en este equilibrio. Hunmin preserva mejor el rendimiento en ocho benchmarks coreanos que Qwen-CUA en varias comparaciones. Xenon no optimizó únicamente para conseguir la máxima puntuación posible en OSWorld.
Por ejemplo, Hunmin obtuvo 76,1 en KMMLU-Pro, frente a 71,4 de Qwen-CUA. También alcanzó 80,3 en K-MMStar, frente a 75,0. Estos resultados sugieren un perfil multilingüe más equilibrado, aunque siguen siendo evaluaciones reproducidas por la empresa.
Ese equilibrio puede importar a las empresas coreanas. Un modelo debe comprender instrucciones, documentos, terminología e interfaces de usuario locales antes de que su capacidad para hacer clic resulte útil. Una puntuación superior de un agente centrado en inglés no resuelve todas las decisiones de compra.
Aun así, Xenon no debería presentar el liderazgo en grounding como equivalente al liderazgo general en uso informático. Su tarjeta de modelo evita ese error al publicar la comparación desfavorable de OSWorld. La cobertura del lanzamiento resulta menos útil cuando enfatiza el segundo puesto en ScreenSpot-Pro sin explicar la brecha de extremo a extremo.
Para los compradores, la comparación correcta depende de la carga de trabajo prevista. Un flujo dominado por la selección de objetivos en interfaces densas puede favorecer el perfil de Hunmin. Una secuencia más larga que requiera recuperación y planificación puede dejar al descubierto su debilidad actual frente a Qwen-CUA.
La apertura del modelo ofrece otra opción a los equipos. Los desarrolladores pueden inspeccionar el lanzamiento, adaptarlo y ejecutar evaluaciones controladas en su propio software. Esa flexibilidad es valiosa, pero no elimina la necesidad de pruebas específicas para cada aplicación.
Los pesos abiertos no eliminan el riesgo de despliegue
El acceso mediante Apache 2.0 mejora el control, pero un modelo de uso informático descargable sigue estando lejos de ser un trabajador autónomo seguro.
Xenon lanzó tanto el modelo original como una variante FP8 bajo Apache 2.0. Esa licencia generalmente permite el uso comercial, la modificación y la redistribución, sujetas a sus condiciones. Ofrece a las empresas mayor libertad de despliegue que un agente cerrado disponible solo mediante una interfaz alojada.
El acceso abierto también permite una evaluación privada. Una empresa puede probar Hunmin frente a aplicaciones internas sin enviar capturas de pantalla a un proveedor externo de modelos. Los equipos pueden medir su comportamiento con lenguaje local, formularios especializados y flujos de trabajo propios de la organización.
Sin embargo, el acceso al modelo es solo una capa de un sistema de uso informático. Un agente de producción aún necesita un entorno de ejecución, un controlador de acciones, un modelo de permisos, una pista de auditoría, una estrategia de credenciales y un proceso de recuperación. También necesita defensas contra instrucciones maliciosas incrustadas en páginas web o documentos.
Un modelo de uso informático puede interactuar con todo aquello a lo que pueda acceder la cuenta del sistema operativo. Eso puede incluir correo electrónico, registros de clientes, almacenamiento en la nube, paneles internos y aplicaciones financieras. Una acción equivocada puede tener consecuencias que una respuesta incorrecta de un chatbot no tiene.
Los benchmarks de grounding de pantalla aportan poca evidencia sobre autorización o intención. Localizar el botón correcto de “Eliminar” tiene éxito técnico incluso cuando pulsarlo violaría una política. El agente que lo rodea debe decidir si la acción está permitida y si se requiere aprobación humana.
Las tareas de benchmark también parten de estados controlados. Los escritorios reales acumulan notificaciones, actualizaciones de software, extensiones de navegador, sesiones vencidas, diseños personalizados y tamaños de ventana inconsistentes. Estas variaciones pueden cambiar tanto lo que ve el modelo como el efecto de una acción.
Xenon reconoce varios límites de evaluación. Afirma que los resultados dependen de la resolución de las capturas, la configuración de razonamiento, los límites de interacción, el software de servicio y las versiones de los benchmarks. También advierte contra comparar directamente sus puntuaciones con resultados producidos usando historiales de capturas mucho más largos.
Esa cautela debería influir en cómo los lectores interpretan cada cifra del lanzamiento. La empresa reprodujo modelos de referencia en su propio entorno. Esto crea una comparación interna más justa, pero los equipos independientes todavía no han replicado ampliamente los resultados.
La posición en los rankings presenta otra incertidumbre. Las clasificaciones de ScreenSpot-Pro pueden cambiar a medida que aparecen nuevos modelos y métodos de inferencia. Un segundo puesto en el lanzamiento es una instantánea fechada, no un estatus permanente.
La escala de parámetros también introduce riesgo operativo. Incluso con cuantización FP8 y activación dispersa, las organizaciones necesitan infraestructura adecuada. Un modelo especializado más pequeño puede ofrecer precisión suficiente con menor latencia, un despliegue más simple y un ajuste fino más fácil.
Por tanto, los equipos deberían comparar los sistemas al nivel del flujo de trabajo. Las métricas útiles incluyen la tasa de finalización, la frecuencia de intervención, los pasos medios, el éxito de recuperación, la latencia y la gravedad de las acciones fallidas. Una sola puntuación agregada de benchmark no puede captar todas estas dimensiones.
El mismo principio se aplica al trabajo de conocimiento que rodea las operaciones de los agentes. Los equipos necesitan registros consultables de instrucciones, resultados, excepciones y decisiones humanas. Una base de conocimiento de IA controlada puede ayudar a los revisores a reconstruir por qué una tarea automatizada produjo un resultado concreto.
Esto no hace seguro a un agente por sí solo. Crea evidencia para la revisión, la depuración y la mejora de políticas. Los sistemas de uso informático se vuelven más fáciles de gobernar cuando sus acciones permanecen conectadas a los documentos y decisiones que las autorizaron.
El lanzamiento de Xenon merece reconocimiento por publicar limitaciones y comparaciones desfavorables junto con sus puntuaciones más sólidas. Esa transparencia permite a los desarrolladores hacer mejores preguntas. El siguiente paso es realizar pruebas independientes que midan tanto la capacidad como las consecuencias de los fallos.
Tres señales mostrarán si Hunmin puede cerrar la brecha
La relevancia de Hunmin depende ahora de la reproducción independiente, de mejores resultados a largo plazo y de la adopción más allá de un repositorio de modelos.
La primera señal es la replicación independiente de benchmarks. Investigadores externos deben ejecutar Hunmin, Qwen3.5 y Qwen-CUA con el mismo hardware, historial de capturas, configuración de razonamiento y marco de tareas. Resultados similares reforzarían la afirmación de Xenon de que la transferencia de bajo rango preservó capacidades útiles de control informático.
La replicación debería cubrir más que ScreenSpot-Pro. Los investigadores deberían probar grounding, finalización completa de tareas, recuperación, latencia y consumo de recursos. También deberían publicar categorías de fallos, no solo puntuaciones agregadas.
Si las ejecuciones independientes reproducen el resultado de grounding de 75,6 y la puntuación de 70,5 en OSWorld, aumentará la confianza en la evaluación de Xenon. Desviaciones importantes debilitarían la narrativa del lanzamiento y apuntarían a una sensibilidad de configuración.
La segunda señal es si Xenon reduce la brecha de largo recorrido con Qwen-CUA. Su modelo actual ya encuentra objetivos con precisión, por lo que las próximas mejoras deben proceder de la planificación y la gestión de estado. Una memoria mejor, entornos de aprendizaje por refuerzo más sólidos o una recuperación de errores mejorada podrían elevar la finalización de extremo a extremo.
Un checkpoint futuro debería reducir el déficit reportado de 6,6 puntos en OSWorld sin sacrificar el rendimiento en coreano. Ese resultado respaldaría el argumento de Xenon de que un postentrenamiento eficiente puede producir un modelo de uso informático equilibrado y práctico. Las mejoras de grounding por sí solas dejarían sin resolver la limitación central.
La tercera señal es el despliegue dentro de OneAgent u otro producto empresarial. Un checkpoint público demuestra acceso técnico, pero el uso en productos revela si el modelo resiste las restricciones de latencia y las interfaces impredecibles. La adopción real también mostraría si las empresas valoran lo suficiente el control en lengua local como para aceptar los requisitos de infraestructura del modelo.
Xenon afirma que planea usar las nuevas capacidades para mejorar OneAgent y ampliar el trabajo que puede realizar la IA. Los compradores deberían estar atentos a despliegues identificados, flujos de trabajo repetibles, tasas de intervención y evidencia de que las tareas siguen siendo fiables fuera de los entornos de benchmark.
Los estudios de caso más útiles describirán los límites con la misma claridad que los éxitos. Deberían identificar qué aplicaciones puede operar el agente, qué acciones requieren aprobación y con qué frecuencia debe intervenir una persona. Sin esos detalles, los anuncios de clientes ofrecerán poca evidencia técnica.
Xenon Hunmin VLM 397B ya es un lanzamiento de ingeniería notable. Demuestra que un equipo relativamente especializado puede añadir comportamiento de control informático a un enorme modelo abierto utilizando ocho GPU de gama alta para el postentrenamiento. Sus propias cifras también impiden una narrativa de victoria sencilla.
Los desarrolladores que evalúen el modelo deberían comenzar con un flujo de trabajo acotado y un entorno aislado reversible. Midan el éxito de la tarea completa, no solo la precisión de los clics, y registren cada intervención o recuperación. Después, comparen esos resultados con Qwen-CUA y alternativas más pequeñas en condiciones idénticas. La licencia abierta hace posible ese trabajo, pero solo las pruebas independientes establecerán si la ventaja de Hunmin en grounding se convierte en una acción fiable.



