DeepSeek Flash acaba de superar a V4 Pro Preview en pruebas de agentes, pero la parte difícil empieza ahora
DeepSeek Flash entró en beta pública el 31 de julio con una afirmación llamativa: sus puntuaciones actualizadas en agentes superan ahora al modelo más grande V4 Pro Preview en todas las pruebas reportadas.
La compañía también añadió soporte nativo para Responses API, la interfaz utilizada por el agente de programación Codex de OpenAI. Esto transforma DeepSeek-V4-Flash de un modelo rápido que los desarrolladores pueden colocar detrás de un agente en uno diseñado para funcionar dentro de un cliente de agentes consolidado.
Este cambio importa porque DeepSeek situó originalmente a Flash por debajo de V4 Pro. Su modelo más pequeño era la opción más rápida, mientras que Pro sostenía la narrativa más sólida para agentes. El postentrenamiento aparentemente ha reducido o invertido esa jerarquía sin modificar la arquitectura de Flash.
Sin embargo, las cifras proceden de la propia evaluación de DeepSeek. Dos pruebas son internas, varios resultados dependen de un arnés aún no publicado y los desarrolladores independientes apenas han empezado a probar el nuevo endpoint. Por tanto, la beta pública plantea un desafío creíble a los modelos de programación más grandes, pero no resuelve la competencia.
Qué cambió en la beta pública de DeepSeek Flash
DeepSeek mejoró el comportamiento alrededor de su arquitectura Flash existente en lugar de presentar un modelo de reemplazo más grande.
Según el anuncio de benchmarks de DeepSeek, DeepSeek-V4-Flash-0731 conserva la arquitectura y el tamaño del modelo de vista previa. La compañía afirma que solo aplicó postentrenamiento adicional, la etapa que determina cómo un modelo entrenado razona, sigue instrucciones y utiliza herramientas.
Esa distinción es central para el lanzamiento. DeepSeek no sostiene que más parámetros hayan producido la mejora reportada. Afirma que un modelo más pequeño se convirtió en un agente mucho mejor tras recibir entrenamiento más específico.
DeepSeek-V4-Flash tiene 284.000 millones de parámetros totales, con 13.000 millones activados para cada token. La arquitectura de mezcla de expertos selecciona solo una parte del modelo en cada paso de inferencia. V4 Pro es mucho mayor, con 1,6 billones de parámetros totales y 49.000 millones de parámetros activos.
Ambos modelos aparecieron inicialmente en vista previa el 24 de abril. DeepSeek describió Flash como su opción rápida y eficiente, con razonamiento cercano a Pro y un rendimiento similar en tareas sencillas de agentes. Sus notas de lanzamiento de V4 también otorgaban a ambos modelos una ventana de contexto de un millón de tokens.
La nueva actualización cambia esa relación. DeepSeek reportó los siguientes resultados de la beta pública: 82,7 en Terminal Bench 2.1, 54,2 en NL2Repo, 76,7 en Cybergym y 54,4 en DeepSWE. También indicó 70,3 en Toolathlon Verified y 25,2 en Agent Last Exam.
DeepSeek reportó otro 25,1 en la parte pública de Automation Bench. Sus dos pruebas internas de programación produjeron 68,7 en DSBench-FullStack y 59,6 en DSBench-Hard.
Estas cifras cubren distintas partes del trabajo de un agente. Los benchmarks de terminal miden si un modelo puede completar tareas mediante interacción con la línea de comandos. Las pruebas de repositorios examinan la navegación y los cambios en bases de código existentes. Los benchmarks de herramientas evalúan si un modelo puede elegir y operar funciones externas a lo largo de varios pasos.
DeepSeek afirma que el modelo Flash actualizado superó a V4 Pro Preview en las nueve evaluaciones reportadas. Los cambios reportados más drásticos aparecieron en tareas que requieren una acción de programación sostenida, en lugar de respuestas breves o completado de código aislado.
La beta pública afecta únicamente a la API oficial de Flash. DeepSeek indicó que su aplicación web, su aplicación de consumo y la API de V4 Pro permanecieron sin cambios. Los desarrolladores que utilicen esos productos no deben asumir que ya cuentan con el comportamiento actualizado.
El identificador del modelo sigue siendo deepseek-v4-flash, lo que reduce el trabajo de migración para los usuarios actuales de la API. Sin embargo, esa comodidad genera una preocupación de versionado. Los equipos necesitan sus propios registros de evaluación para determinar si el comportamiento cambió tras la actualización del endpoint.
Esto es más que una actualización rutinaria de modelo porque cuestiona una suposición conocida. Un modelo más grande no sigue siendo automáticamente el mejor agente cuando el postentrenamiento, el formato de herramientas y el arnés de ejecución cambian a la vez.
DeepSeek Flash ahora habla el lenguaje que espera Codex
El soporte nativo para Responses API hace que el lanzamiento sea operacionalmente importante, incluso antes de que las afirmaciones sobre los benchmarks reciban confirmación independiente.
Un modelo de programación no trabaja solo dentro de un agente. El cliente circundante envía instrucciones, declara herramientas, registra resultados, gestiona el contexto y decide cuándo debe continuar el modelo. Pequeños fallos de compatibilidad pueden socavar un modelo por lo demás capaz.
Responses API de OpenAI proporciona una interfaz estructurada para esas interacciones. DeepSeek afirma ahora que su API admite ese formato de forma nativa, lo que permite a los clientes de Codex dirigirse a DeepSeek como proveedor de modelos alternativo.
La configuración oficial de Codex de DeepSeek cubre la CLI de Codex, la aplicación de escritorio de ChatGPT y la extensión de Codex para Visual Studio Code. Estos clientes comparten un archivo de configuración, por lo que una configuración de proveedor puede exponer el modelo en los tres entornos.
La documentación identifica actualmente a DeepSeek-V4-Flash como el único modelo de DeepSeek disponible mediante esta integración. Indica que se espera soporte para V4 Pro a principios de agosto de 2026.
DeepSeek proporciona un catálogo de modelos que describe Flash a Codex. Especifica una ventana de contexto de 1.048.576 tokens, soporte para llamadas de herramientas en paralelo, tres niveles de esfuerzo de razonamiento y una herramienta de parches de formato libre. También declara las interfaces de shell y búsqueda web que espera el cliente.
Ese catálogo no es un añadido cosmético. Los clientes de agentes deben comprender los límites de contexto de cada modelo, las formas de herramientas compatibles y los controles de razonamiento. Los metadatos incorrectos pueden provocar tareas truncadas, solicitudes no válidas o llamadas a herramientas que el cliente no puede ejecutar.
DeepSeek ofrece un script de configuración automatizada y una ruta de configuración manual. El script realiza una copia de seguridad de la configuración existente de Codex, escribe el catálogo de modelos de DeepSeek, añade el proveedor y valida los archivos resultantes.
La integración directa crea un caso de uso concreto. Un desarrollador puede abrir un repositorio desconocido, pedir al agente que investigue una prueba fallida y dejar que busque archivos, edite código y ejecute comandos. El modelo debe mantener el estado durante toda la secuencia.
Ese flujo de trabajo es más difícil que generar una función a partir de un prompt. El agente debe interpretar los resultados de las herramientas, detectar supuestos fallidos, preservar las restricciones y evitar repetir una acción no válida. También necesita producir parches que encajen en el repositorio en lugar de limitarse a parecer plausibles.
Responses API elimina una capa de adaptación entre Flash y Codex. No garantiza que el modelo tome buenas decisiones. Sin embargo, proporciona a los desarrolladores un cliente estándar mediante el cual pueden probar esas decisiones.
Esto presiona a los proveedores que dependen de paquetes propietarios de cliente y modelo. Si Codex puede operar varios backends de modelos mediante el mismo flujo de trabajo, los desarrolladores pueden comparar modelos sin reemplazar toda su interfaz.
También presiona a DeepSeek. La compatibilidad nativa facilita la comparación en ambas direcciones. Los usuarios pueden probar Flash en los repositorios y comandos que ya utilizan, y después cambiar a otra opción si su ventaja en benchmarks no sobrevive al trabajo real.
Por qué un modelo más pequeño puede superar a V4 Pro Preview
El salto reportado apunta al postentrenamiento y a la infraestructura de agentes como mecanismo, no a una expansión repentina del tamaño del modelo.
El rendimiento de un agente depende de más que el conocimiento almacenado durante el preentrenamiento. Un modelo debe aprender cuándo llamar a una herramienta, cómo leer el resultado, cuándo revisar un plan y cuándo detenerse. Estos comportamientos pueden mejorar mediante aprendizaje por refuerzo en entornos ejecutables.
DeepSeek describió anteriormente un sistema de entrenamiento de agentes llamado DeepSeek Elastic Compute, o DSec. Admite llamadas a funciones, contenedores, micro máquinas virtuales y máquinas virtuales completas detrás de una única interfaz de software.
Según un análisis técnico de la arquitectura V4, DSec puede ejecutar cientos de miles de entornos aislados simultáneos. Esos entornos permiten a los trabajos de entrenamiento recompensar resultados de interacciones reales con herramientas en lugar de evaluar solo texto.
El diseño de V4 también intenta reducir el coste de las trazas largas de agentes. Cada resultado de terminal, extracto de archivo, mensaje de error y respuesta del modelo añade tokens. Los pasos posteriores deben procesar ese historial cada vez mayor.
DeepSeek combina dos mecanismos de atención comprimida en todo el modelo. Compressed Sparse Attention reduce la secuencia antes de seleccionar bloques relevantes. Heavily Compressed Attention crea una representación mucho más corta que cada consulta puede inspeccionar.
El análisis informó que V4 Flash utiliza el 10 % del cómputo de inferencia de un solo token requerido por DeepSeek-V3.2 con un millón de tokens. También utiliza el 7 % de la caché clave-valor de V3.2, la memoria que conserva el contexto previo durante la generación.
Estas cifras se aplican a la eficiencia arquitectónica, no a la actualización de agentes de julio en sí. Aun así, explican por qué Flash es una base plausible para agentes de larga ejecución. Un agente no puede beneficiarse de una gran ventana de contexto si cada paso adicional vuelve impracticable la inferencia.
V4 también conserva el contenido de razonamiento entre mensajes de usuario cuando intervienen herramientas. Ese comportamiento se dirige a flujos de trabajo en los que un desarrollador añade instrucciones después de que un agente ya haya inspeccionado archivos o ejecutado comandos.
El formato de las herramientas también importa. DeepSeek introdujo tokens dedicados y un esquema basado en XML para las llamadas a herramientas. Este enfoque separa las cadenas de texto simples de los parámetros estructurados y pretende reducir los errores de escape dentro de solicitudes anidadas.
Según los informes, la actualización de julio no modifica ninguno de esos fundamentos arquitectónicos. Ajusta el comportamiento de Flash sobre ellos. Esto sugiere que DeepSeek encontró ganancias adicionales en los datos de entrenamiento, el diseño de recompensas, las trayectorias de herramientas o las políticas de instrucciones.
La receta exacta sigue sin revelarse. DeepSeek no ha publicado suficiente información para separar la contribución del modelo actualizado de la del arnés de evaluación. Esa brecha impide a terceros atribuir el aumento de puntuación a una sola técnica.
Aun así, la dirección coincide con un cambio más amplio en el desarrollo de modelos. Los proveedores optimizan cada vez más los modelos para trayectorias completas de tareas en lugar de respuestas aisladas. La unidad de rendimiento se está convirtiendo en un flujo de trabajo exitoso.
Esto favorece a los modelos más pequeños cuando pueden actuar de forma fiable. Un modelo compacto que elige la herramienta correcta y se recupera de errores puede superar a un modelo más grande que razona bien, pero pierde el control del flujo de trabajo.
También cambia la forma en que los equipos de ingeniería deberían evaluar un agente de programación con IA. Una puntuación general de programación dice poco sobre si el modelo puede operar dentro de un repositorio concreto, seguir las convenciones locales y verificar su propio parche.
Los equipos que ya mantienen documentación técnica con capacidad de búsqueda pueden conectar las pruebas de agentes con su base de conocimiento de ingeniería existente. Esto permite a los evaluadores comparar los cambios generados con notas de arquitectura, decisiones e incidentes previos, en lugar de juzgar el resultado por su apariencia.
La ventaja de los modelos más pequeños es, por tanto, condicional. Flash necesita el cliente adecuado, definiciones de herramientas, contexto del repositorio y permisos de ejecución. DeepSeek ha mejorado varias capas de esa pila, pero los despliegues reales deben proporcionar el resto.
La ventaja en benchmarks viene con importantes salvedades
Los resultados de DeepSeek son evidencia significativa para probar el modelo, pero no constituyen una prueba independiente de su fiabilidad en producción.
La primera salvedad es el control de la evaluación. DeepSeek seleccionó la configuración del modelo, el harness, los límites de las tareas y el formato de los informes. Las evaluaciones de los proveedores sirven para mostrar las fortalezas previstas, pero rara vez reflejan todos los fallos que encontrarán los usuarios.
DeepSeek probó tareas públicas de agentes de programación con lo que denomina DeepSeek Harness en modo mínimo. Utilizó la configuración de máximo esfuerzo, un top_p de 0.95 y una temperatura de 1.0.
El harness no se ha publicado. Por tanto, los investigadores independientes no pueden reproducir la configuración exacta ni determinar cuánto contribuyó a los resultados. Las puntuaciones de los agentes suelen variar cuando cambian el prompt, el envoltorio de herramientas, el tiempo límite o la política de reintentos.
La segunda salvedad se refiere a la combinación de pruebas. DSBench-FullStack y DSBench-Hard son conjuntos de datos internos. Los evaluadores externos no pueden examinar su distribución de tareas, controles de contaminación, reglas de calificación ni casos de fallo.
Las evaluaciones internas pueden revelar debilidades que los benchmarks públicos pasan por alto. Sin embargo, no pueden aportar rendición de cuentas pública hasta que las tareas o un proceso de auditoría creíble estén disponibles.
La tercera cuestión es la saturación y optimización de los benchmarks. Cuando las tareas públicas se utilizan ampliamente, los desarrolladores de modelos pueden orientar el entrenamiento hacia sus formatos. Una puntuación más alta puede reflejar aprendizaje útil, especialización limitada o ambas cosas.
La cuarta cuestión es la fiabilidad operativa. Un modelo puede tener éxito en un benchmark acotado y, aun así, comportarse de manera inconsistente durante una tarea de varias horas. Los agentes en producción afrontan instrucciones ambiguas, dependencias cambiantes, servicios no disponibles y límites de permisos.
La seguridad plantea otro desafío. Cybergym puede medir partes del razonamiento en ciberseguridad, pero los despliegues empresariales también necesitan controles sobre la ejecución de comandos, la gestión de secretos, el acceso a la red y las acciones destructivas. La capacidad del modelo no sustituye a un entorno de ejecución restringido.
Analistas independientes plantearon preocupaciones similares tras la vista previa de V4 en abril. El analista de Morningstar Ivan Su describió V4 como una continuación competente, pero afirmó que se necesitaba una evaluación independiente antes de extraer conclusiones definitivas.
El analista de Omdia Lian Jye Su ofreció una lectura más positiva y señaló que los benchmarks iniciales indicaban que V4 competiría con los principales modelos estadounidenses. Ambas perspectivas aparecieron en un informe independiente sobre V4.
Estas opiniones no son contradictorias. DeepSeek puede ser un competidor serio mientras que sus afirmaciones más sólidas siguen requiriendo pruebas externas. La beta pública es la etapa en la que esas propuestas se ponen a prueba.
Las comparaciones con OpenAI, Anthropic y Google también requieren cautela. Los distintos proveedores informan resultados con diferentes configuraciones de modelo y andamiajes de agentes. Una puntuación atribuida a un modelo a menudo refleja un sistema completo.
La actualización de V4 Flash crea un problema adicional de comparación porque V4 Pro Preview es un objetivo en movimiento. DeepSeek afirma que el lanzamiento oficial de V4 Pro llegará después, y su documentación de Codex prevé pronto soporte de integración.
Por tanto, una victoria de Flash sobre el modelo de vista previa podría ser temporal. La comparación sigue siendo importante porque muestra lo que logró un postentrenamiento enfocado, pero no establece una jerarquía permanente de productos.
Los desarrolladores también deberían vigilar las regresiones. El aprendizaje por refuerzo adicional puede mejorar la persistencia con herramientas mientras hace que un modelo sea más prolijo, menos cauteloso o más dispuesto a ejecutar un plan incierto.
Una evaluación útil debería registrar la finalización de tareas, el tiempo de corrección humana, las llamadas inválidas a herramientas, las acciones repetidas, los fallos de pruebas y los cambios involuntarios en archivos. La latencia y el consumo de contexto también importan porque los agentes invocan repetidamente el modelo.
La evidencia más sólida procederá de repositorios que nunca formaron parte del proceso de entrenamiento o benchmarking. Los resultados deberían incluir tareas fallidas, no solo demostraciones pulidas.
Hasta que lleguen esas evaluaciones, la conclusión precisa es limitada. DeepSeek informa de una gran mejora de sus agentes, expone el endpoint actualizado para pruebas públicas y ofrece una integración directa con Codex. Aún no ha demostrado la misma ventaja en entornos de producción no controlados.
Quién afronta presión por la actualización del agente DeepSeek V4
La presión inmediata recae sobre los proveedores de modelos que cobran a los desarrolladores por inteligencia y vinculan esa inteligencia a una experiencia de agente propietaria.
OpenAI construyó Codex en torno a sus propios modelos y a la Responses API. El soporte nativo de DeepSeek convierte esa interfaz en un punto de competencia. El cliente sigue siendo familiar mientras cambia el proveedor subyacente.
Esto no convierte a DeepSeek en un equivalente inmediato para todas las cargas de trabajo de Codex. Los modelos pueden interpretar de forma distinta las mismas definiciones de herramientas, y las funciones del cliente pueden depender de comportamientos específicos del proveedor. Aun así, la compatibilidad reduce el esfuerzo necesario para realizar una comparación seria.
Anthropic afronta un desafío relacionado a través de Claude Code. DeepSeek ya documentó integraciones con Claude Code, OpenCode, OpenClaw y otros sistemas de agentes durante el período de vista previa de V4.
Google compite mediante productos de programación y API para desarrolladores basados en Gemini. Su escala, sus capacidades multimodales y su distribución en la nube siguen siendo ventajas considerables. Sin embargo, cada proveedor debe explicar ahora por qué los desarrolladores deberían aceptar una pila estrechamente acoplada.
La presión también alcanza a los proveedores más pequeños de modelos de programación. DeepSeek Flash combina una gran ventana de contexto, una API oficial, pesos de modelo abiertos de la versión de vista previa y soporte para varios clientes de agentes.
La distribución importa aquí tanto como el rendimiento en benchmarks. Un modelo muy valorado que requiere una integración personalizada puede recibir menos pruebas que un modelo algo más débil disponible dentro de herramientas conocidas.
La estrategia de DeepSeek parece orientada a reducir la fricción de cambio en la capa de interfaz. Los desarrolladores pueden conservar un cliente, exponer el mismo repositorio y comparar resultados. Esto pone mayor énfasis en la finalización real de las tareas.
La empresa también compite contra su propio modelo V4 Pro. Flash servía anteriormente como la opción más pequeña para trabajos sensibles a la velocidad. Las nuevas puntuaciones dan a los desarrolladores una razón para probarlo en tareas antes reservadas para Pro.
Esa competencia interna puede ayudar a DeepSeek a segmentar las cargas de trabajo con mayor eficacia. Los equipos podrían enviar el trabajo rutinario de repositorio a Flash y reservar Pro para tareas que requieran un razonamiento más profundo.
Sin embargo, DeepSeek no ha demostrado que esta estrategia de enrutamiento funcione de forma consistente. Los nuevos resultados de Flash se centran en benchmarks de agentes, mientras que Pro podría conservar ventajas en conocimiento, razonamiento y planificación compleja.
Las empresas afrontan consideraciones que van más allá de la capacidad bruta. La residencia de datos, las normas de cumplimiento, la gobernanza de proveedores, los compromisos de soporte y las restricciones geopolíticas pueden impedir la adopción independientemente del rendimiento en benchmarks.
DeepSeek también está bajo escrutinio por sus prácticas de entrenamiento y su política de seguridad. Anthropic y OpenAI han acusado a laboratorios chinos, incluido DeepSeek, de extraer capacidades mediante destilación. DeepSeek no ha aceptado esas acusaciones.
Esa disputa no determina si Flash funciona bien. Sí afecta a las revisiones de compras, especialmente en organizaciones reguladas y entornos del sector público.
Para los desarrolladores independientes y los equipos pequeños, la decisión es más directa. Pueden ejecutar tareas representativas, inspeccionar cada comando y comparar los parches resultantes. La beta ofrece suficiente acceso para empezar ese trabajo de inmediato.
Para las organizaciones más grandes, la mejor pregunta no es si Flash gana un ranking público. Es si el modelo reduce el esfuerzo total de ingeniería sin crear una exposición inaceptable en materia de seguridad o gobernanza.
Ese estándar también se aplica a sus competidores. El lanzamiento de DeepSeek presiona al mercado al hacer más práctica la intercambiabilidad de modelos, pero cada proveedor aún debe ganarse la confianza para producción.
Tres señales decidirán si DeepSeek Flash mantiene su ventaja
La próxima fase estará determinada por la reproducibilidad, el lanzamiento oficial de V4 Pro y la adopción sostenida en flujos de trabajo reales de agentes.
La primera señal es la publicación de DeepSeek Harness. DeepSeek afirma que utilizó este marco en modo mínimo para evaluaciones públicas de agentes de programación y que planea publicarlo.
Un harness público permitiría a los investigadores repetir las pruebas, inspeccionar los prompts y comparar Flash con otros modelos en condiciones similares. Obtener resultados coincidentes reforzaría la afirmación de DeepSeek de que el postentrenamiento produjo un aumento genuino de capacidad.
Las grandes diferencias debilitarían esa conclusión. Podrían indicar que los reintentos ocultos, los prompts específicos de cada tarea o las políticas de ejecución contribuyeron más que el propio modelo.
La segunda señal es el lanzamiento oficial de V4 Pro. DeepSeek afirma que Pro llegará pronto, mientras que su documentación apunta al soporte de Codex a principios de agosto.
Ese lanzamiento pondrá a prueba la inversión central del artículo. Si el modelo final de Pro recupera una clara ventaja como agente, Flash se convertirá en una opción secundaria eficiente en lugar de la nueva referencia de rendimiento.
Si Flash se mantiene cerca o por delante, DeepSeek tendrá que explicar el papel de su modelo mucho más grande. Los desarrolladores podrían entonces preferir Flash, salvo que Pro aporte una ventaja medible en sus tareas más difíciles.
La tercera señal son los datos reales de adopción de los usuarios de Codex. La evidencia útil incluirá trazas completas de repositorios, parches reproducibles e informes de fallos procedentes de bases de código diversas.
Observe con qué frecuencia Flash se recupera tras un comando fallido. Registre si repite operaciones inválidas, edita archivos no relacionados o se detiene antes de verificar. Estos comportamientos determinan si un agente ahorra tiempo.
Las pruebas de larga duración también revelarán si el contexto de un millón de tokens sigue siendo útil a medida que se acumulan los historiales. La capacidad por sí sola no garantiza que el modelo recupere el detalle correcto tras cientos de interacciones con herramientas.
Los desarrolladores deberían comenzar con tareas delimitadas. Una prueba adecuada podría consistir en localizar un defecto, escribir un parche específico, ejecutar las pruebas existentes y explicar el resultado. El repositorio debería utilizar control de versiones, credenciales restringidas y un entorno de ejecución aislado.
Los equipos pueden comparar después Flash con su modelo actual utilizando el mismo conjunto de tareas. Deberían conservar las ejecuciones fallidas y las intervenciones humanas porque los ejemplos que solo muestran éxitos ocultan la carga operativa.
La beta pública de DeepSeek Flash merece atención porque combina tres cambios: puntuaciones de agentes más sólidas según informes del proveedor, soporte estándar para Responses API y compatibilidad directa con Codex. En conjunto, estos cambios facilitan la evaluación del modelo allí donde los agentes de programación realmente operan.
No eliminan la necesidad de escepticismo. La ventaja comunicada del modelo depende de pruebas gestionadas por la empresa, dos benchmarks internos y un harness que los externos aún no pueden inspeccionar.
La próxima decisión corresponde a los desarrolladores. Elijan varias tareas que representen trabajo real, ejecútenlas con permisos controlados y midan resultados completados en lugar de respuestas atractivas. Si DeepSeek Flash mantiene su ventaja en esas condiciones, el modelo más pequeño habrá hecho más que superar un benchmark de vista previa. Habrá cuestionado cómo los equipos eligen la inteligencia detrás de sus agentes.



