DeepSeek Flash Vision Exp ya está abierto, pero sus afirmaciones más ambiciosas aún necesitan pruebas
- Sophie Larsen

- hace 1 día
- 16 min de lectura
DeepSeek publicó los pesos abiertos de DeepSeek Flash Vision Exp el 1 de septiembre de 2026, diez días después de presentar el modelo experimental a través de su API. El movimiento transforma un servicio al que los desarrolladores solo podían llamar en software que pueden inspeccionar, adaptar y ejecutar por sí mismos. Sin embargo, el lanzamiento también plantea una cuestión más difícil: si las mejoras de referencia reportadas por DeepSeek resistirán pruebas independientes fuera de su marco preferido para agentes.
El momento es relevante porque no se trata simplemente de otro modelo de visión que entra en un catálogo ya saturado. DeepSeek afirma que el modelo conserva las capacidades de texto y agentes de V4 Flash al tiempo que incorpora comprensión de imágenes. Sus resultados publicados sitúan varias puntuaciones cerca de Opus 4.8 de Anthropic, aunque esas comparaciones proceden de la propia configuración de evaluación de DeepSeek.
Por tanto, el lanzamiento plantea una competencia directa entre el despliegue abierto y los sistemas multimodales gestionados. Los desarrolladores ahora tienen un modelo que pueden ejecutar dentro de sus propios límites de seguridad, pero el repositorio indica 305.000 millones de parámetros. Esa escala hace posible la experimentación local en principio, aunque mantiene el despliegue práctico fuera del alcance del hardware de escritorio convencional.
DeepSeek Flash pasó de una API a pesos abiertos
El lanzamiento del 1 de septiembre transforma DeepSeek Flash Vision Exp de un experimento alojado en un modelo que los desarrolladores pueden examinar y operar por sí mismos.
DeepSeek anunció por primera vez el modelo multimodal el 21 de agosto de 2026. Ese lanzamiento inicial se limitaba a la plataforma API de la compañía. Los desarrolladores podían seleccionar deepseek-v4-flash-vision-exp y enviar entradas mixtas de texto e imagen, pero no podían descargar los pesos subyacentes.
El lanzamiento de la API estableció la función prevista del producto. Según el anuncio de visión de la compañía, el modelo acepta imágenes mediante datos base64, URL externas o archivos subidos. Funciona a través de las interfaces Chat Completions, Messages y Responses.
DeepSeek también presentó una Files API junto con el modelo. Un desarrollador puede subir una imagen una vez, recibir un file_id y reutilizar esa referencia en distintas solicitudes. Esto reduce las transferencias repetidas cuando un agente debe inspeccionar la misma captura de pantalla, gráfico, página de documento o interfaz durante varios pasos de razonamiento.
El lanzamiento abierto cambia el lado del despliegue de esa ecuación. El repositorio oficial del modelo incluye pesos, archivos de configuración, instrucciones sobre el formato de prompts y rutas de inferencia de ejemplo. El repositorio utiliza la licencia MIT e identifica el paquete como un modelo de 305.000 millones de parámetros.
Ese recuento de parámetros difiere de los 284.000 millones asociados con el V4 Flash original. DeepSeek afirma que Vision Exp se basa en esa arquitectura al añadir módulos visuales y continuar el entrenamiento para la comprensión de imágenes. La compañía no ha publicado suficientes detalles arquitectónicos como para atribuir todo el incremento a un único componente.
El repositorio admite varias rutas habituales de despliegue. Su documentación incluye ejemplos para Transformers, vLLM, SGLang y Docker Model Runner. Esos ejemplos reducen la barrera de integración, pero no eliminan los considerables requisitos de memoria y cómputo del modelo.
La secuencia es importante. DeepSeek no abrió los pesos cuando apareció la API el 21 de agosto. Esperó diez días, creando un breve periodo en el que los desarrolladores podían evaluar el comportamiento, pero no inspeccionar ni alojar el modelo por sí mismos.
Esa brecha también explica por qué el evento del 1 de septiembre atrajo una atención renovada. El modelo subyacente no se anunció ese día por primera vez. Lo que cambió fue el acceso, la licencia y el control sobre dónde se realiza la inferencia.
Llamar al lanzamiento “de código abierto” es ampliamente coherente con el repositorio de DeepSeek bajo licencia MIT. Aun así, los desarrolladores deberían distinguir entre el acceso a los pesos y la transparencia completa sobre los datos y métodos de entrenamiento. El paquete público permite el uso y la modificación, pero no documenta todas las decisiones detrás del proceso de entrenamiento.
Esta distinción crea la tensión central del artículo. DeepSeek ha abierto el modelo desde el punto de vista operativo, pero muchas de sus afirmaciones de rendimiento más importantes siguen dependiendo de pruebas realizadas por la propia empresa.
La visión convierte un modelo de texto rápido en una plataforma para agentes
La comprensión de imágenes importa aquí porque los agentes encuentran cada vez más información que no puede recuperarse únicamente a partir del texto.
El DeepSeek V4 Flash original llegó como el integrante más pequeño de la familia V4 el 24 de abril de 2026. DeepSeek lo describió como un modelo de mezcla de expertos de 284.000 millones de parámetros, con 13.000 millones de parámetros activos para cada token.
Un modelo de mezcla de expertos contiene muchos grupos especializados de parámetros, pero activa solo un subconjunto durante cada paso de inferencia. El diseño puede reducir el cómputo en comparación con activar todos los parámetros para cada token.
DeepSeek combinó esa estructura con una ventana de contexto de un millón de tokens. El anuncio de V4 de la compañía también destacó el razonamiento, la programación y el uso de herramientas. Sin embargo, el lanzamiento original de Flash siguió centrado en el texto.
Esa limitación importa en los flujos de trabajo con agentes. Un modelo solo de texto puede llamar API y operar terminales, pero muchos entornos reales se comunican mediante imágenes. Un navegador puede mostrar un gráfico sin etiquetas accesibles. Un escritorio remoto puede presentar un cuadro de diálogo de error. Un formulario escaneado puede contener campos que nunca aparecen en la capa de texto de la página.
Vision Exp añade una vía para abordar esas situaciones dentro de un único modelo. Un agente de programación podría inspeccionar una captura de pantalla de una prueba de interfaz fallida, compararla con una referencia de diseño y después editar el componente correspondiente. Un agente de documentos podría leer una página escaneada antes de decidir qué herramienta invocar.
Un agente de soporte podría examinar la captura de pantalla de un cliente e identificar dónde el estado de una aplicación se desvía del comportamiento esperado. Un agente de datos podría inspeccionar un panel, reconocer una anomalía visual y consultar la fuente subyacente para confirmarla.
Estos ejemplos no significan que el modelo pueda ejecutar todos los flujos de trabajo de forma fiable. Explican por qué la multimodalidad, la capacidad de procesar más de un tipo de entrada, cambia la posición estratégica del modelo. La visión no es una función ornamental cuando el modelo también planifica y llama herramientas.
DeepSeek afirma que Vision Exp conserva un rendimiento comparable a V4 Flash 0731 en tareas de agentes solo de texto. Si ese resultado se confirma de manera independiente, los equipos no necesitarían modelos separados para el razonamiento textual y la inspección visual.
Esa consolidación puede simplificar una pila de agentes. Cada transferencia entre modelos introduce decisiones de formato, latencia y otro punto de fallo. Un único modelo que lee una pantalla y actúa sobre lo que ve puede preservar más contexto a lo largo del flujo de trabajo.
La Files API refuerza este diseño orientado a agentes. Las referencias persistentes a archivos son útiles cuando un agente vuelve a consultar una imagen durante una tarea más larga. Un proceso de depuración visual podría inspeccionar la misma captura de pantalla antes y después de leer registros o editar código.
Los pesos abiertos extienden ese mismo flujo de trabajo a la infraestructura privada. Una empresa podría mantener capturas de pantalla de paneles internos, productos no publicados o documentos sensibles dentro de su propio entorno. También podría adaptar la capa de servicio en torno a los controles de acceso existentes.
El autoalojamiento no garantiza la privacidad por sí solo. Los operadores aún necesitan almacenamiento seguro, registros controlados, aislamiento de red y políticas de retención cuidadosas. El lanzamiento les da más control sobre esas decisiones, no una solución automática.
Para los trabajadores del conocimiento, el cambio más amplio consiste en pasar de leer archivos aislados a combinar evidencia visual y textual. Ese mismo desafío aparece en una base de conocimiento de IA personal, donde el contexto útil puede abarcar notas, documentos, capturas de pantalla y grabaciones.
La apuesta de DeepSeek es que un solo modelo puede razonar entre esos formatos mientras conserva la identidad centrada en la velocidad de Flash. El lanzamiento abierto permite a los desarrolladores poner a prueba esa propuesta en condiciones que DeepSeek no controla.
El despliegue abierto presiona a los modelos multimodales gestionados
DeepSeek está ejerciendo presión mediante la libertad de despliegue, no a través de una victoria concluyentemente demostrada en benchmarks.
Opus 4.8 de Anthropic es el punto de referencia más claro en los materiales de DeepSeek. DeepSeek afirma repetidamente que su modelo experimental se aproxima a Opus 4.8 en trabajo multimodal con agentes. Esa formulación evita afirmar un liderazgo general.
La comparación importa porque los modelos de frontera gestionados suelen combinar razonamiento multimodal con infraestructura alojada. Los clientes obtienen acceso conveniente y escalado gestionado por el proveedor, mientras el proveedor controla los pesos y el entorno de servicio.
DeepSeek Flash Vision Exp ofrece un esquema diferente. Los equipos pueden utilizar la API alojada, descargar el modelo o crear un flujo de trabajo híbrido. Esa flexibilidad genera presión competitiva incluso si el modelo no gana todas las evaluaciones.
El repositorio reporta una puntuación de 83,9 para Vision Exp en Terminal Bench 2.1. Indica 82,7 para V4 Flash 0731 y 85,0 para Opus 4.8. Terminal Bench evalúa agentes que realizan tareas en entornos de terminal.
En NL2Repo, DeepSeek reporta 57,7 para Vision Exp, frente a 54,2 para Flash 0731 y 69,7 para Opus 4.8. La mayor diferencia en ese caso sugiere que “cerca” depende en gran medida de qué tarea recibe mayor peso.
Según los informes, Vision Exp obtuvo 75,3 en Cybergym. Las puntuaciones de comparación indicadas son 76,7 para Flash 0731 y 78,3 para Opus 4.8. Esto también recuerda de forma útil que añadir entrenamiento visual no mejora todos los benchmarks textuales u orientados al uso de herramientas.
DeepSWE muestra el patrón opuesto. DeepSeek reporta 59,3 para Vision Exp, 54,4 para Flash 0731 y 58,0 para Opus 4.8. En ese resultado publicado por la compañía, Vision Exp termina por encima de ambos modelos de comparación.
Toolathlon-Verified produjo otro grupo ajustado. El repositorio indica 75,9 para Vision Exp, 70,3 para Flash 0731 y 76,2 para Opus 4.8. DSBench-Hard muestra una separación mayor, con puntuaciones respectivas de 63,6, 59,6 y 71,7.
La mejora visual reportada más clara aparece en ApexBench Pass@1. Vision Exp obtuvo 36,5, frente a 26,2 para el Flash 0731 centrado en texto y 39,4 para Opus 4.8.
DeepSeek señala que Flash 0731 ignoró los elementos multimodales de la entrada de ApexBench. Por tanto, la mejora confirma que añadir visión ayuda frente a un modelo que no puede consumir correctamente la misma evidencia. No aísla todas las demás diferencias entre los dos lanzamientos.
Aun así, la combinación es competitivamente significativa. Un modelo descargable no necesita superar a un servicio cerrado en todos los benchmarks para influir en las decisiones de compra. Debe ser suficientemente capaz para un conjunto valioso de cargas de trabajo.
Las empresas pueden preferir un modelo cerrado cuando buscan un trabajo mínimo de infraestructura, controles de servicio establecidos y escalado predecible. Pueden preferir un modelo abierto cuando la ubicación de los datos, la personalización o evitar la dependencia de una única API importan más.
Los investigadores obtienen otra ventaja. Pueden examinar patrones de fallo, probar configuraciones alternativas de servicio y reproducir evaluaciones sin enviar cada prompt al proveedor original. Los equipos independientes también pueden cuestionar el enfoque de los benchmarks.
El lanzamiento también añade presión a otros desarrolladores de modelos abiertos. Un modelo de texto abierto ahora afronta un umbral más alto si los agentes deben interactuar con capturas de pantalla, diagramas, documentos escaneados o aplicaciones gráficas.
Por eso, la competencia principal no es simplemente DeepSeek contra Anthropic. Se trata de despliegue abierto frente a acceso multimodal gestionado. Anthropic aporta la referencia de evaluación, pero la decisión más profunda gira en torno a quién controla el modelo y su entorno operativo.
La historia de los benchmarks tiene vacíos importantes
Las puntuaciones publicadas son evidencia útil, pero todavía no constituyen una prueba independiente de un rendimiento fiable en el mundo real.
DeepSeek generó los resultados reportados y seleccionó la configuración de evaluación. La tarjeta del modelo indica que sus pruebas de agentes de texto utilizaron el modo mínimo de DeepSeek Harness, el máximo esfuerzo de razonamiento, una temperatura de 1.0 y un valor de top_p de 0.95.
Estos detalles mejoran la transparencia. También muestran por qué otro laboratorio debe reproducir el trabajo. Los resultados de los agentes pueden cambiar cuando una prueba emplea un harness distinto, otra descripción de herramientas, una política de reintentos, un presupuesto de razonamiento o una regla de finalización diferente.
DeepSeek Harness es el framework de agentes de la empresa, y la versión 0.1.1 añadió compatibilidad directa con Vision Exp durante el lanzamiento de la API. Un resultado favorable dentro de ese framework puede reflejar el modelo, el harness o la interacción entre ambos.
Eso no invalida las puntuaciones. Limita lo que los lectores deberían inferir de ellas. Los resultados describen el rendimiento bajo una configuración documentada de DeepSeek, no un comportamiento garantizado en todos los sistemas de agentes de terceros.
La etiqueta experimental del modelo merece la misma atención. DeepSeek lo denomina Vision Exp en lugar de un lanzamiento multimodal de disponibilidad general. Esto señala una etapa de desarrollo activa, aunque los pesos sean accesibles públicamente.
Los modelos experimentales pueden cambiar con rapidez. Los formatos de prompts pueden evolucionar, los motores de inferencia pueden requerir parches y los checkpoints posteriores pueden comportarse de forma distinta. Los equipos deberían fijar revisiones exactas en lugar de asumir que el nombre del repositorio siempre representa pesos idénticos.
La escala introduce otra incertidumbre. Hugging Face identifica el modelo como uno que contiene 305 mil millones de parámetros. Incluso con formatos de menor precisión y serving optimizado, supone un compromiso serio de infraestructura.
Un desarrollador puede descargar pesos abiertos sin disponer de una forma económica de servirlos. La inferencia con varias GPU, la planificación de memoria, la cuantización y el procesamiento por lotes de solicitudes afectan tanto a la latencia como a la calidad de salida. La compatibilidad con un framework no garantiza un buen rendimiento en todas las configuraciones de hardware.
La cuantización introduce su propio requisito de pruebas. Reducir la precisión de los pesos puede disminuir la demanda de memoria, pero una compresión agresiva puede alterar la precisión del reconocimiento visual o del uso de herramientas. El efecto debe medirse frente a la carga de trabajo exacta.
Los agentes visuales también heredan riesgos de seguridad que los benchmarks de texto rara vez resuelven. Una imagen puede contener instrucciones engañosas, texto oculto o elementos de interfaz diseñados para redirigir a un agente. Un modelo que interpreta píxeles y controla herramientas amplía la superficie de ataque.
El peligro aumenta cuando se concede autoridad automática a la evidencia visual. Una captura de pantalla puede estar desactualizada. Un gráfico puede omitir su escala. Un botón puede parecer un control seguro mientras desencadena una acción relevante.
Los desarrolladores deberían separar la percepción del permiso. El modelo puede identificar el estado de una interfaz, pero una capa de políticas debería decidir si puede hacer clic, subir archivos, eliminar o divulgar información. Las acciones de alto impacto deberían requerir confirmación o una autorización con alcance limitado.
La fiabilidad también varía según el tipo de imagen. Leer una captura de pantalla limpia es distinto de interpretar escritura a mano, un diagrama técnico denso, un escaneo de baja resolución o un panel con etiquetas superpuestas.
El anuncio de DeepSeek no ofrece un desglose completo entre esas condiciones. Los benchmarks del repositorio miden tareas seleccionadas de agentes, no todas las cargas de trabajo visuales que encontrará un sistema de producción.
Tampoco hay base todavía para tratar puntuaciones de texto comparables como una paridad universal con V4 Flash 0731. La tarjeta del modelo muestra mejoras en algunos benchmarks y un descenso en Cybergym. Un lenguaje general sobre igualar al modelo anterior puede ocultar compromisos específicos de cada tarea.
Por ello, las pruebas independientes deberían centrarse en distribuciones, no solo en promedios. Los equipos necesitan tasas de éxito en ejecuciones repetidas, el coste de los reintentos, el tiempo hasta completar la tarea y la gravedad de los fallos.
Un modelo que tiene éxito una vez pero entra con frecuencia en bucles repetitivos de herramientas puede resultar menos útil que uno algo menos capaz con un comportamiento predecible. Los agentes de producción se juzgan por flujos de trabajo completados, no por picos aislados en benchmarks.
Lo que cambian los pesos abiertos para los desarrolladores
El beneficio práctico es el control, pero asumirlo también transfiere la responsabilidad operativa al desarrollador.
La licencia MIT ofrece a los equipos amplio margen para usar, modificar y redistribuir el repositorio conforme a sus términos. Esto hace que el lanzamiento sea relevante para investigadores, proveedores de infraestructura y empresas que desarrollan sistemas de agentes privados.
Los desarrolladores ahora pueden inspeccionar la configuración y la codificación de prompts en lugar de tratar el modelo como un endpoint remoto. Pueden probar prompts de sistema, esquemas de herramientas y opciones de preprocesamiento visual frente al mismo checkpoint.
Un equipo también podría crear un conjunto de evaluación controlado a partir de su propio trabajo. Para una empresa de software, podría incluir capturas de compilaciones fallidas, regresiones de navegador y paneles internos. Un procesador de documentos podría usar facturas escaneadas, contratos o formularios anotados.
La primera pregunta útil no es si Vision Exp lidera una clasificación pública. Es si completa un flujo de trabajo definido con mayor fiabilidad que el stack de modelos existente del equipo.
Una prueba creíble debería incluir rutas ideales y casos adversariales. Los desarrolladores deberían variar la resolución de imagen, el recorte, la compresión, el desorden y el contenido visual irrelevante. También deberían probar qué ocurre cuando el texto dentro de una imagen entra en conflicto con la solicitud del usuario.
La evaluación de agentes requiere registros a nivel de herramienta. Los equipos deberían registrar qué herramientas seleccionó el modelo, los argumentos que produjo y si se recuperó tras un error. Una respuesta final correcta puede ocultar una trayectoria insegura o costosa.
Las pruebas repetidas importan porque el muestreo introduce variación. La configuración indicada por DeepSeek incluye una temperatura distinta de cero, por lo que una ejecución exitosa no establece una tasa de finalización estable. Los equipos deberían comparar tasas de aprobación a través de múltiples intentos.
La latencia debe incluir todo el flujo de trabajo. Un modelo multimodal puede dedicar más tiempo a codificar imágenes, generar razonamiento y llamar herramientas. Una generación de tokens más rápida no garantiza una tarea completada más rápidamente.
El despliegue abierto también introduce trabajo de mantenimiento. Los operadores deben gestionar archivos del modelo, software de inferencia compatible, asignación de GPU, observabilidad, controles de acceso y actualizaciones. Las API alojadas ocultan gran parte de esa carga.
El mejor despliegue podría ser híbrido. Las capturas de pantalla sensibles podrían permanecer dentro de un clúster privado, mientras que las tareas menos sensibles utilizan un servicio gestionado. Una capa de enrutamiento podría elegir un modelo según la clasificación de datos y la complejidad de la tarea.
Sin embargo, el enrutamiento de modelos añade otro sistema de decisión que necesita evaluación. Si el enrutador clasifica erróneamente una imagen, el contenido sensible podría salir del límite previsto. Los controles deberían optar por la ruta más restrictiva cuando la clasificación siga siendo incierta.
Los desarrolladores también deberían conservar el material de origen. Una descripción generada por un modelo de un gráfico no sustituye al gráfico en sí. Mantener la imagen original permite a los revisores rastrear la conclusión de un agente hasta la evidencia.
Esta procedencia se vuelve esencial en los flujos de trabajo de conocimiento. Cuando las personas combinan notas, capturas de pantalla y documentos, la combinación de conocimientos es más fiable cuando cada afirmación permanece conectada a su fuente.
Para los equipos más pequeños, el tamaño del modelo puede orientar la experimentación hacia proveedores de inferencia alojada o clústeres compartidos. Los pesos abiertos amplían el conjunto de proveedores incluso cuando una empresa no puede alojar por sí sola todo el modelo.
Eso aún modifica el poder de negociación. Un modelo disponible en varios entornos de serving genera menos dependencia que un checkpoint accesible a través de un único endpoint propietario.
El lanzamiento también puede acelerar variantes optimizadas. Los desarrolladores de la comunidad pueden explorar mejoras en cuantización e inferencia, mientras que los proveedores de hardware pueden ajustar las rutas de serving para sus sistemas. Cada derivado requiere su propia evaluación de calidad.
Por tanto, el acceso abierto crea una superficie de experimentación más amplia. No hace que todos los despliegues resultantes sean equivalentes a la configuración de referencia de DeepSeek.
Tres señales decidirán si el lanzamiento importa
La reproducción independiente, las opciones prácticas de serving y un sucesor estable determinarán si Vision Exp se convierte en infraestructura o sigue siendo un checkpoint interesante.
La primera señal es la reproducción independiente de los benchmarks. Los investigadores necesitan ejecutar los pesos publicados en las mismas tareas de agentes y documentar su harness, prompts, presupuestos y políticas de reintento.
Reproducir las puntuaciones reportadas reforzaría el argumento de DeepSeek de que las mejoras visuales residen en el modelo y no en su entorno privado de evaluación. Resultados sustancialmente inferiores debilitarían la comparación con Opus 4.8.
Las pruebas más valiosas irán más allá del conjunto de benchmarks publicado. Deberían incluir operación visual en navegador, lectura de gráficos, inspección de documentos y recuperación tras fallos de herramientas. Las evaluaciones de seguridad deberían probar instrucciones incrustadas dentro de imágenes.
La segunda señal es la llegada de configuraciones prácticas de serving. El repositorio ya documenta rutas para vLLM, SGLang, Transformers y Docker, pero la compatibilidad por sí sola no demuestra un rendimiento alcanzable.
Los operadores necesitan configuraciones verificadas con requisitos de hardware claros, procesamiento por lotes estable y calidad medida después de la cuantización. Los informes de la comunidad deberían incluir configuraciones completas en lugar de cifras aisladas de velocidad.
Si los despliegues optimizados preservan el rendimiento visual y de agentes, el modelo abierto se vuelve relevante para más organizaciones. Si una inferencia útil requiere clústeres inusualmente grandes, su impacto seguirá concentrado entre equipos con muchos recursos.
La tercera señal es la próxima decisión de lanzamiento de DeepSeek. La etiqueta experimental plantea dudas sobre si Vision Exp se convertirá en una variante Flash estable, se integrará en el modelo principal o será sustituido por otro checkpoint.
Un lanzamiento de disponibilidad general con documentación más completa reforzaría el argumento para su adopción en producción. Un reemplazo rápido sin guía de migración reforzaría la idea de que este checkpoint pertenece principalmente a entornos de evaluación.
Los desarrolladores también deberían observar si DeepSeek publica un informe técnico más completo. El repositorio actual explica el diseño general y la configuración de evaluación, pero muchos detalles de entrenamiento y arquitectura permanecen sin divulgar.
Una documentación más clara sobre módulos visuales, construcción de datos, pruebas de seguridad y limitaciones conocidas facilitaría el análisis independiente. El silencio no eliminaría la utilidad de los pesos, pero mantendría la incertidumbre sobre por qué el modelo se comporta como lo hace.
Las respuestas de los competidores aportan evidencia de apoyo, no el veredicto principal. Otros desarrolladores de modelos abiertos pueden responder con modelos multimodales de agentes descargables, mientras que los proveedores gestionados pueden enfatizar la fiabilidad, los controles de seguridad y un despliegue más sencillo.
Esa respuesta mostrará si el acceso multimodal abierto se está convirtiendo en una expectativa básica. No establecerá, por sí sola, qué modelo ofrece el mejor rendimiento para una organización concreta.
El juicio central debería seguir siendo acotado. DeepSeek ha eliminado una barrera de acceso significativa al publicar pesos con licencia MIT tras un debut exclusivo mediante API. No ha eliminado la necesidad de verificación independiente.
Los desarrolladores ahora tienen los elementos para realizar esa verificación. Pueden ejecutar DeepSeek Flash Vision Exp con sus propios harnesses, sobre sus propias imágenes, con sus propias herramientas y políticas de seguridad.
Por tanto, el siguiente paso es práctico: elegir un flujo de trabajo en el que la evidencia visual bloquee de verdad a un agente que solo trabaja con texto y, después, medir la fiabilidad de las tareas completas en ejecuciones repetidas. Registre los fallos, las exigencias de infraestructura y las acciones inseguras, en lugar de limitarse a seguir las respuestas finales.
Si esas pruebas reproducen las mejoras comunicadas por DeepSeek, el lanzamiento del 1 de septiembre marcará una expansión significativa de los agentes multimodales abiertos. Si no es así, los pesos abiertos seguirán habiendo cumplido una función importante al hacer visible la brecha.


