DeepSeek Pro Parece Brillante en Modo Minimal. Ese Es También el Problema
- Martin Chen

- hace 4 días
- 14 min de lectura
DeepSeek pro entró en disponibilidad general el 13 de agosto, pero su comportamiento más sólido del que se ha informado apareció solo después de que usuarios recrearan una configuración de agente inusualmente específica.
Esa configuración es el ajuste predefinido Minimal de DeepSeek Harness, el entorno de ejecución recientemente lanzado por la empresa para agentes de IA que usan herramientas. Pruebas de la comunidad afirman que este ajuste transforma un modelo de programación inconsistente en algo mucho más cercano a la presentación de benchmarks de DeepSeek.
La mejora no se ha medido de forma independiente en un conjunto diverso y controlado de tareas. Sin embargo, la controversia importa incluso si las demostraciones más llamativas no pueden reproducirse. Los propios materiales de DeepSeek relacionan el rendimiento de los agentes con prompts, herramientas, ajustes de razonamiento y entornos de ejecución específicos.
Por tanto, la verdadera pregunta es más concreta que si DeepSeek-V4-Pro es «bueno» o «malo». Se trata de si un modelo debería recibir todo el crédito por capacidades que parecen funcionar de forma fiable solo dentro de un harness alineado con su entrenamiento.
Anthropic, OpenAI y otros proveedores de modelos se enfrentan al mismo problema cuando sus modelos operan a través de Claude Code, Codex u otro entorno de ejecución de agentes. DeepSeek simplemente ha hecho que esa dependencia sea inusualmente visible.
La Disponibilidad General de DeepSeek Pro Llegó con una Disputa sobre el Rendimiento de Agentes
El lanzamiento del 13 de agosto cambió el modelo disponible, pero no resolvió qué sistema se estaba evaluando realmente.
DeepSeek lanzó formalmente la versión de disponibilidad general de V4-Pro en su app, sitio web y API el 13 de agosto de 2026. El lanzamiento GA de la empresa destacó mejoras para agentes, tres niveles de esfuerzo de razonamiento y soporte nativo para la Responses API de OpenAI.
El esfuerzo bajo está orientado a tareas simples. El esfuerzo alto maneja flujos de trabajo habituales de agentes, mientras que el esfuerzo máximo asigna más razonamiento al trabajo complejo. El lanzamiento también añadió una ruta de configuración orientada a Codex sin cambiar el nombre del modelo V4-Pro en la API.
Ese anuncio siguió al avance del 24 de abril de la familia V4 más amplia. DeepSeek describió V4-Pro como un modelo de mezcla de expertos con 1,6 billones de parámetros totales y 49.000 millones activos durante la inferencia.
Un modelo de mezcla de expertos enruta cada token por solo una parte de la red. Ese diseño puede aumentar la capacidad total sin activar todos los parámetros en cada solicitud.
El modelo admite una ventana de contexto de un millón de tokens. DeepSeek afirma que fue preentrenado con más de 32 billones de tokens y luego pasó por aprendizaje supervisado, aprendizaje por refuerzo y destilación on-policy.
Esas especificaciones no provocaron la controversia. La fricción comenzó cuando los primeros usuarios compararon las afirmaciones de DeepSeek sobre benchmarks de agentes con sus propios resultados tras el lanzamiento GA.
Algunos informes de la comunidad describieron trazas de razonamiento breves, planificación débil y uso inconsistente de herramientas. Un relato ampliamente compartido calificó el lanzamiento de decepcionante y sugirió que un problema de despliegue o de configuración del lado del servidor estaba suprimiendo el comportamiento previsto del modelo.
Estas observaciones fueron anecdóticas. Procedían de prompts, cuentas, herramientas, sistemas operativos y rutas de solicitud diferentes. No pueden establecer un nivel general de rendimiento.
Entonces apareció una segunda oleada de informes. Los usuarios dijeron que el mismo modelo se volvía sustancialmente más capaz cuando se ejecutaba mediante DeepSeek Harness Minimal en Linux o Windows Subsystem for Linux.
Una prueba de la comunidad afirmó que varios usuarios reprodujeron la mejora. Aun así, el autor consideró que el modelo estaba por debajo de un modelo líder de comparación y criticó su criterio visual.
Esa salvedad es importante. La afirmación no era que el modo Minimal corrigiera todas las debilidades. Era que el ajuste revelaba un nivel de comportamiento de programación ausente en muchas sesiones ordinarias.
Un análisis de repositorio independiente relacionó el modo Minimal con un commit del 10 de agosto. Según ese análisis, el commit alineó el ajuste predefinido con la composición de agentes utilizada durante el aprendizaje por refuerzo.
El análisis describió un entorno acotado que contenía un prompt de sistema sobrio, acceso persistente al shell, un editor de archivos designado y una política específica de compactación del contexto. También indicó que el ajuste excluía descripciones de herramientas no relacionadas que podrían contaminar el prompt del sistema.
Esa interpretación sigue siendo una lectura de la comunidad sobre código y documentación públicos. DeepSeek no ha publicado pruebas que demuestren que V4-Pro falle fuera del modo Minimal ni que fuera optimizado deliberadamente para un único ajuste predefinido público.
Aun así, la secuencia es concreta. DeepSeek lanzó V4-Pro GA el 13 de agosto, publicó su harness en vista previa para desarrolladores y expuso un entorno estrechamente relacionado con la evaluación de agentes.
La tensión surge de cómo encajan esas piezas. Si el mejor comportamiento del modelo exige ese entorno, los usuarios están comprando un sistema modelo-harness, no un endpoint de modelo intercambiable.
Por Qué DeepSeek Harness Cambia el Significado de un Benchmark
Un benchmark de agentes mide conjuntamente el modelo, el prompt, las herramientas, la política de memoria y el entorno de ejecución, incluso cuando la clasificación muestra solo el nombre de un modelo.
Un harness de agentes es la capa de software que permite a un modelo de lenguaje inspeccionar archivos, ejecutar comandos, llamar herramientas, conservar estado y decidir qué ocurre después. Convierte la predicción de texto en un ciclo operativo.
Ese ciclo toma muchas decisiones relevantes. Da formato al prompt del sistema, define esquemas de herramientas, devuelve errores, trunca el historial, resume el trabajo anterior y decide cuándo el modelo recibe otro turno.
Los cambios pequeños pueden producir grandes diferencias de rendimiento. Un modelo puede entender una tarea, pero fallar porque la descripción de una herramienta es ambigua. Puede editar el archivo equivocado porque la compactación del contexto eliminó una restricción anterior.
Un modelo también puede desperdiciar su presupuesto de razonamiento tras recibir mensajes de estado ruidosos. Otro harness puede evitar el mismo fallo manteniendo el prompt breve y preservando el estado adecuado.
El repositorio oficial de DeepSeek describe DeepSeek Harness como un entorno de ejecución de agentes de código abierto donde todo es un plugin. El proyecto está en vista previa para desarrolladores y advierte que se producirán cambios que romperán la compatibilidad.
Su arquitectura de plugins puede intercambiar o recomponer capacidades en lugar de encerrar a los usuarios en un diseño fijo de agente. Esa flexibilidad hace útil al proyecto, pero también complica cualquier afirmación sobre el «rendimiento de DeepSeek-V4-Pro».
¿Qué plugins estaban activos? ¿Qué ajuste predefinido los cargó? ¿Qué prompt de sistema se utilizó? ¿Cómo se compactó el historial de conversación? ¿El shell permaneció activo entre turnos?
Esos detalles no son trivialidades de implementación. Determinan la información y las acciones disponibles para el modelo en cada paso.
La documentación del modelo de DeepSeek hace visible esta dependencia del sistema. La empresa recomienda el razonamiento máximo para tareas exigentes de agentes y al menos 384.000 tokens de contexto para ese modo.
Su model card también informa grandes diferencias entre los ajustes de razonamiento. En Terminal Bench 2.0, DeepSeek sitúa V4-Pro en 59,1 en modo sin razonamiento, 63,3 con esfuerzo alto y 67,9 con esfuerzo máximo.
En SWE-bench Verified, la progresión comunicada es 73,6, 79,4 y 80,6. En BrowseComp, los modos alto y máximo obtienen 80,4 y 83,4, mientras que no se incluye un resultado sin razonamiento.
Estas son evaluaciones de DeepSeek, no reproducciones independientes. Sin embargo, demuestran la postura de la empresa de que la configuración de inferencia cambia materialmente la capacidad medida.
El informe técnico va más allá al explicar el entorno de evaluación. Para las tareas de agentes de código, DeepSeek utilizó una colección mínima de herramientas, incluido el acceso al shell y la edición de archivos.
Para las tareas de agentes de búsqueda, la empresa utilizó un harness interno. Eso significa que las puntuaciones de agentes comunicadas nunca representaron un modelo aislado respondiendo a prompts independientes.
No hay nada intrínsecamente impropio en ello. Los modelos de agentes necesitan herramientas y un benchmark debe proporcionar algún entorno de ejecución. Todos los proveedores eligen uno.
El problema empieza cuando una puntuación específica de un harness se convierte en una abreviatura de la capacidad general de un modelo en distintos productos. Un resultado generado con un shell persistente y una compactación alineada con el entrenamiento no se transfiere automáticamente a otra extensión de editor.
Un desarrollador que use un cliente compatible con Anthropic podría enviar resultados de herramientas con una estructura diferente. Una plataforma empresarial puede insertar instrucciones de seguridad, mensajes de auditoría, resultados de recuperación y controles de aprobación.
Esas adiciones pueden ser necesarias en producción. También pueden alejar el prompt del entorno utilizado durante el aprendizaje por refuerzo.
Por tanto, el modo Minimal hace más que mejorar una demostración. Expone cuánta infraestructura oculta hay detrás de la puntuación de un modelo.
Por eso la disputa sobre DeepSeek pro importa más allá de un lanzamiento. La model card nombra DeepSeek-V4-Pro, pero la unidad funcional en una tarea de agente es DeepSeek-V4-Pro más una configuración de harness.
Una vez que esa distinción se hace explícita, las clasificaciones deben informar ambas partes.
La Alineación con el Entrenamiento No Es Automáticamente Sobreajuste
La evidencia pública respalda la sensibilidad a la configuración, pero todavía no demuestra que DeepSeek-V4-Pro se haya sobreajustado a un único harness.
El sobreajuste tiene un significado preciso. Un sistema se sobreajusta cuando aprende patrones que funcionan bien en su distribución de entrenamiento, pero no logran generalizar a entradas significativamente diferentes.
En este caso, la distribución de entrenamiento sospechada incluye más que problemas de programación. También puede incluir la estructura del prompt del agente, nombres de herramientas, formatos de respuesta, comportamiento del shell y política de gestión del contexto.
Si el aprendizaje por refuerzo recompensó repetidamente el éxito dentro de una composición, el modelo se adaptaría racionalmente a esa composición. Una semántica consistente de herramientas reduce la incertidumbre y facilita aprender la señal de recompensa.
Esa adaptación puede ser beneficiosa. Los humanos también rinden mejor con interfaces familiares, herramientas fiables y flujos de trabajo estables.
Un modelo entrenado para usar un editor de archivos predecible debería superar a otro obligado a inferir el comportamiento no documentado de un editor. Llamar «sobreajuste» a cada ganancia de ese tipo volvería el término casi inútil.
La acusación más fuerte exige un patrón de fallos más amplio. V4-Pro tendría que mostrar una degradación inusualmente pronunciada cuando cambian detalles ambientales irrelevantes, aunque la tarea subyacente siga siendo equivalente.
Por ejemplo, los investigadores podrían cambiar los nombres de las herramientas conservando sus descripciones y comportamiento. Podrían reordenar los esquemas de herramientas, variar formulaciones inocuas, reemplazar el editor por una interfaz equivalente o modificar la compactación sin eliminar hechos necesarios.
Un agente general debería tolerar muchos de esos cambios. Un modelo vinculado a un harness perdería un rendimiento considerable pese a recibir las mismas capacidades prácticas.
Ningún estudio público ha establecido todavía ese patrón en un número suficiente de tareas y ensayos aleatorios. Las capturas de pantalla, los vídeos y las sesiones personales de programación pueden identificar una pregunta de investigación, pero no pueden medir la generalización.
La afirmación de que «Minimal desbloquea el modelo real» también tiene varias explicaciones alternativas.
En primer lugar, el modo Minimal puede eliminar ruido del prompt. Los manuales extensos de herramientas y las instrucciones superpuestas suelen empeorar el comportamiento de los agentes, especialmente en sesiones prolongadas.
En segundo lugar, puede preservar el estado con mayor eficacia. Un shell persistente permite a un modelo mantener directorios de trabajo, estado del entorno y procesos en ejecución sin tener que reconstruirlos.
En tercer lugar, el preset puede exponer las interfaces de herramientas utilizadas durante el postentrenamiento. Eso crea alineación de distribución, pero no necesariamente memorización de benchmarks.
En cuarto lugar, las solicitudes iniciales tras la disponibilidad general podrían haber encontrado variaciones de despliegue. Informes de la comunidad mencionaron razonamientos inusualmente breves y posibles cambios de enrutamiento, aunque DeepSeek no verificó una reversión de emergencia.
En quinto lugar, los usuarios pueden seleccionar y difundir las ejecuciones exitosas más llamativas. Las demostraciones positivas se propagan rápidamente, mientras que las reproducciones fallidas reciben menos atención.
También existe el sesgo opuesto. Los usuarios decepcionados pueden generalizar a partir de una sesión defectuosa, especialmente después de leer afirmaciones sobre benchmarks que elevaron sus expectativas.
Los resultados oficiales de DeepSeek sí dejan espacio para el escepticismo. La empresa informa que V4-Pro Max resuelve el 80,6 por ciento de SWE-bench Verified y obtiene un 67,9 en Terminal Bench 2.0.
También informa una calificación de 3206 en Codeforces y una tasa de aprobación del 93,5 en LiveCodeBench. Estas cifras presentan al modelo como un sistema de programación de gama alta bajo la configuración de evaluación indicada.
La evaluación independiente proporciona un punto de referencia más útil. El Center for AI Standards and Innovation del gobierno de Estados Unidos evaluó el modelo preliminar utilizando la configuración recomendada por los desarrolladores.
En su evaluación independiente, CAISI ejecutó DeepSeek V4 en GPU H200 y B200. Conservó el razonamiento interno y utilizó valores recomendados para contexto, muestreo, prompts de sistema y razonamiento máximo.
CAISI también reprodujo el resultado de GPQA-Diamond informado por DeepSeek, lo que reduce la probabilidad de un error básico de configuración de inferencia en ese benchmark. Sin embargo, para las pruebas de agentes utilizó el agente ReAct integrado de Inspect en lugar de DeepSeek Harness Minimal.
Esa diferencia es exactamente lo que debería examinar el análisis futuro. Un modelo puede igualar un benchmark estático de razonamiento y, aun así, seguir siendo muy sensible al bucle de agentes que lo rodea.
Por tanto, la evidencia disponible respalda una conclusión cautelosa. DeepSeek-V4-Pro es sensible al entorno, y DeepSeek optimizó su flujo de trabajo de agentes en torno a composiciones conocidas.
La evidencia no establece que DeepSeek memorizara tareas de benchmarks públicos. Tampoco demuestra una manipulación intencionada.
Llamar al modelo sobreajustado hoy se adelanta a los datos. Llamar irrelevante al harness ignora lo que muestran tanto la documentación de DeepSeek como las pruebas de la comunidad.
La verdadera competencia es entre agentes alineados con el entrenamiento y modelos portátiles
El desafío inmediato de DeepSeek no es superar a un modelo rival. Es demostrar que su capacidad se mantiene fuera de su entorno de ejecución preferido.
Los proveedores de modelos optimizan cada vez más sistemas completos de agentes. El modelo sigue siendo importante, pero la orquestación determina si su razonamiento produce un resultado útil.
OpenAI combina modelos con Codex. Anthropic desarrolla modelos junto con Claude Code. Google controla el comportamiento de los modelos dentro de sus productos de programación Gemini, mientras que los entornos de ejecución independientes añaden sus propios prompts y herramientas.
DeepSeek tiene ahora la misma opción estratégica. Puede codiseñar V4-Pro con DeepSeek Harness, medir los fallos de extremo a extremo y utilizar esas trazas para el aprendizaje por refuerzo.
Este enfoque puede producir mejores resultados en el mundo real que tratar la API como un generador de texto aislado. También puede acelerar la depuración porque la empresa controla ambos lados de la interacción.
Un harness estable proporciona a los equipos de entrenamiento un entorno repetible. Pueden recompensar el uso correcto de comandos, validar cambios de archivos, penalizar el trabajo sin terminar y probar sesiones de larga duración.
La contrapartida es la portabilidad. Las empresas rara vez despliegan un modelo dentro del entorno de referencia intacto del proveedor.
Añaden comprobaciones de permisos, recuperación privada, registros, filtros de políticas, aprobaciones humanas y herramientas específicas de la organización. Los desarrolladores aportan editores existentes, agentes de línea de comandos y marcos de automatización.
Cada incorporación cambia la distribución de interacción. Un modelo que depende de un prompt de sistema escueto puede degradarse cuando una política de seguridad empresarial añade varios miles de tokens.
Un modelo entrenado en torno a un protocolo de edición de archivos puede manejar mal los mensajes de error de otro protocolo. Una estrategia de compactación que funciona para programación puede descartar pruebas necesarias en tareas legales o analíticas.
La capacidad portátil significa mantener el rendimiento ante estas variaciones. No requiere puntuaciones idénticas en todas partes, pero sí una degradación gradual.
La capacidad alineada con el entrenamiento ofrece una promesa diferente. El proveedor proporciona un sistema recomendado con configuraciones conocidas, y los usuarios reciben el rendimiento anunciado al adoptar toda la pila.
Ningún enfoque es universalmente superior. Un sistema estrechamente integrado puede ofrecer mejores resultados a los equipos dispuestos a estandarizarse en torno a él.
Un modelo portátil da más libertad a quienes construyen plataformas. También hace que los resultados de benchmarks sean más fáciles de comparar entre entornos de ejecución.
La comunicación actual de DeepSeek intenta reclamar ambas ventajas. V4-Pro está disponible mediante varios formatos de API y se presenta como compatible con los principales productos de agentes.
Al mismo tiempo, su comportamiento reportado más sólido parece estar estrechamente vinculado al razonamiento máximo y a una composición de harness especializada. Esa brecha presiona la afirmación de portabilidad.
El anuncio oficial de la versión preliminar dijo que DeepSeek había optimizado V4 para Claude Code, OpenClaw, OpenCode y otros productos de agentes. También dijo que la empresa utilizaba V4 internamente para programación agéntica.
Estas declaraciones implican una adaptación más amplia que un preset Minimal. DeepSeek puede respaldarlas publicando resultados en múltiples entornos de ejecución independientes con presupuestos equivalentes.
La comparación debe controlar más que la puntuación final. Los investigadores deberían informar el uso de tokens, tiempo de ejecución, tasa de finalización, errores de herramientas, reintentos y categorías de fallos.
También deberían separar los fallos del modelo de los fallos del harness. Si un editor rechaza un parche malformado, la traza debería mostrar si el esquema, el analizador o el modelo causó el defecto.
Este nivel de información mejoraría todo el mercado de agentes. Las clasificaciones actuales a menudo comprimen un sistema complicado en un porcentaje junto al nombre de un modelo.
Esta presentación anima a los compradores a comparar endpoints de modelos mientras ignoran la orquestación. También permite a los proveedores elegir harnesses favorables sin mostrar cuán sensibles son sus resultados.
DeepSeek Harness podría ayudar a resolver ese problema si la empresa utiliza su diseño de plugins para realizar ablaciones controladas. El equipo puede intercambiar un componente a la vez y publicar los cambios de puntuación resultantes.
Las pruebas de ablación eliminan o modifican un elemento para medir su contribución. En este caso, podrían cuantificar el valor del estado persistente del shell, la política de compactación, los nombres de herramientas o la longitud del prompt de sistema.
Si el modo Minimal gana porque elimina instrucciones irrelevantes, otros desarrolladores de harnesses pueden copiar esa lección. Si gana porque el modelo espera tokens exactos del tiempo de entrenamiento, las preocupaciones sobre portabilidad se vuelven más sólidas.
Cualquiera de los dos resultados sería más informativo que otra ejecución de exhibición. La disputa necesita medición, no un concurso entre clips entusiastas y publicaciones frustradas.
Qué confirmaría o debilitaría la preocupación sobre DeepSeek Pro
Tres señales observables pueden determinar si el modo Minimal es una configuración de referencia sensata o una dependencia de rendimiento.
La primera señal es una evaluación controlada entre harnesses del modelo 0813. Debería ejecutar tareas idénticas mediante DeepSeek Harness Minimal, su preset estándar y al menos dos entornos de ejecución de agentes independientes.
Cada configuración necesita el mismo nivel de razonamiento, presupuesto de tokens, política de muestreo, capacidades de herramientas y margen de reintentos. Los evaluadores deberían utilizar múltiples ensayos porque los resultados de los agentes varían entre ejecuciones.
Una gran ventaja de Minimal reforzaría la preocupación por la dependencia de la configuración. Resultados similares entre entornos de ejecución equivalentes debilitarían la teoría del sobreajuste y sugerirían que los fallos iniciales procedían de problemas de configuración o despliegue.
La segunda señal es la resiliencia ante cambios inofensivos en la interfaz. Los evaluadores deberían renombrar herramientas, reordenar esquemas, parafrasear instrucciones y sustituir editores funcionalmente equivalentes.
El rendimiento debería mantenerse ampliamente estable cuando la información y las acciones disponibles permanecen sin cambios. Una caída pronunciada mostraría que el modelo depende de características superficiales en lugar de una comprensión general de las herramientas.
Esta prueba importa más que comparar un harness de proveedor con otro. Los distintos productos introducen muchas variables a la vez, lo que dificulta aislar la causa de un cambio de puntuación.
La tercera señal es la propia divulgación de DeepSeek. La empresa debería publicar la composición exacta de agentes detrás de cada benchmark destacado, incluidos prompts, esquemas de herramientas, reglas de compactación y configuraciones de inferencia.
También debería distinguir el modelo preliminar del checkpoint de disponibilidad general del 13 de agosto. Sin resultados versionados, los usuarios no pueden saber si una puntuación anterior se transfiere al endpoint que están utilizando.
DeepSeek no necesita revelar datos privados de entrenamiento para proporcionar esta transparencia. Los scripts de evaluación reproducibles y las configuraciones completas de ejecución abordarían la cuestión central.
Los investigadores independientes podrían entonces probar si las mejoras afirmadas se mantienen en otros repositorios, lenguajes, duraciones de tareas y restricciones de seguridad. Los compradores empresariales podrían evaluar si adoptar el harness de referencia encaja en sus sistemas.
Para los desarrolladores, la lección práctica ya está clara. No evalúen DeepSeek pro a través de una única ventana de chat, y no confíen en un único éxito del modo Minimal como resultado universal.
Prueben el par exacto de modelo y harness que entrará en producción. Registren las configuraciones de razonamiento, la política de contexto, las definiciones de herramientas, los reintentos y la finalización de tareas, en lugar de juzgar solo el texto final.
Para los editores de benchmarks, informen las configuraciones como entradas de primera clase. “DeepSeek-V4-Pro con DSH Minimal” es más honesto que una fila etiquetada solo “DeepSeek-V4-Pro”.
Para DeepSeek, la oportunidad es mayor que defender un solo lanzamiento. La empresa puede convertir esta controversia en un estándar más claro para evaluar sistemas de agentes.
El resultado más sólido no sería una prueba de que el modo Minimal hace que V4-Pro parezca excepcional. Sería evidencia de que el modelo sigue siendo útil cuando organizaciones reales sustituyen Minimal por sus propios entornos complejos.
Hasta que lleguen esos resultados, “sobreajuste” sigue siendo un diagnóstico no probado. La dependencia de la configuración es la preocupación establecida, y es lo bastante significativa por sí sola.
Si está probando la versión 0813, ejecute la misma tarea de repositorio mediante al menos dos harnesses y repita cada ejecución. Conserve las trazas, normalice los presupuestos y publique los fallos junto con los éxitos. Esa evidencia nos dirá si DeepSeek pro aprendió un comportamiento de agentes transferible o un flujo de trabajo inusualmente familiar.


