top of page

DeepSeek Pro llega a SiliconFlow, pero su contexto de 1M es solo parte de la historia

28 ago
14 min de lectura

DeepSeek Pro ha llegado a SiliconFlow con una ventana de contexto de un millón de tokens y un enfoque más marcado en agentes para producción. SiliconFlow incorporó DeepSeek-V4-Pro-0813 después de que DeepSeek lanzara el modelo en su app, sitio web y API el 13 de agosto de 2026.

La cifra principal es enorme, pero la capacidad de contexto no es el conflicto central. DeepSeek posiciona V4 Pro como un modelo abierto para programación, uso de herramientas y flujos de trabajo de larga duración. Son ámbitos en los que los sistemas propietarios de Anthropic y otros desarrolladores de frontera han establecido expectativas exigentes.

SiliconFlow ofrece a los desarrolladores otra vía compatible con OpenAI para acceder a ese modelo sin obligarlos a operar sus pesos excepcionalmente grandes. Por tanto, el lanzamiento pone a prueba algo más relevante que la longitud máxima de los prompts. Evalúa si un modelo abierto puede convertirse en un motor fiable para agentes que modifican repositorios, llaman herramientas, inspeccionan resultados y se recuperan de errores.

DeepSeek Pro obtiene un endpoint de SiliconFlow orientado a producción

SiliconFlow está vendiendo acceso a un modelo de agentes, no simplemente alojando un chatbot con más contexto.

SiliconFlow afirma que DeepSeek-V4-Pro-0813 ya está disponible a través de su biblioteca de modelos y de su interfaz Chat Completions compatible con OpenAI. Las aplicaciones pueden seleccionar el modelo con el identificador deepseek-ai/DeepSeek-V4-Pro-0813.

Esa compatibilidad importa porque los desarrolladores no necesitan reconstruir cada integración alrededor de un protocolo nuevo. Los asistentes de programación, agentes de terminal y sistemas de orquestación personalizados existentes pueden apuntar a una URL base y un identificador de modelo distintos.

El lanzamiento de SiliconFlow enumera el chat, la completación por prefijo, el razonamiento y el uso de herramientas entre las capacidades compatibles. La completación por prefijo permite a un modelo rellenar contenido después de un inicio proporcionado, lo que puede ayudar con la edición de código y la generación estructurada.

La plataforma también describe su soporte como disponible desde el ciclo de lanzamiento inicial del modelo. Esto reduce el retraso entre el lanzamiento de un modelo upstream y el acceso a través de un proveedor de inferencia gestionado.

DeepSeek presentó la familia V4 en abril de 2026. Ofreció V4 Pro para tareas exigentes y V4 Flash para escenarios que priorizan respuestas más rápidas y eficiencia.

La actualización de agosto sustituye la vista previa de V4 Pro en vez de crear un producto sin relación. DeepSeek afirma que mantuvo la estructura subyacente del modelo de vista previa e incorporó DSpark, su módulo de decodificación especulativa.

La decodificación especulativa genera tokens de borrador mediante un proceso auxiliar y los verifica con el modelo objetivo. El propósito es acelerar la generación sin aceptar un borrador no verificado como salida final.

El modelo también utiliza una arquitectura de mezcla de expertos. Este diseño enruta cada token a través de un subconjunto de componentes especializados del modelo, en lugar de activar todos los parámetros para cada token.

El repositorio publicado por DeepSeek enumera aproximadamente 1,7 billones de parámetros para el checkpoint completo. Esa escala dificulta la operación directa, aunque solo una parte de la red procese cada token.

La ficha oficial del modelo describe un despliegue en un nodo que contiene cuatro aceleradores GB300. Ese ejemplo ilustra por qué el acceso alojado sigue siendo importante pese a la licencia abierta.

Descargar los pesos y tener permiso para modificarlos no vuelve la inferencia de producción barata ni sencilla. Los equipos siguen necesitando capacidad de aceleradores, software de serving, monitorización, programación de solicitudes y experiencia en inferencia distribuida.

SiliconFlow convierte ese problema de infraestructura en una solicitud de API. Ese es el valor inmediato de la incorporación, especialmente para equipos que quieren evaluar el modelo antes de comprometer hardware.

La ventana de contexto de 1M sigue siendo significativa. Una ventana de contexto es el total de material de entrada y generado que el modelo puede considerar durante una solicitud o interacción continua.

En teoría, puede albergar contenido extenso de repositorios, especificaciones técnicas, logs, resultados de herramientas e historial de agentes. Esos datos suelen fragmentarse cuando una aplicación debe dividirlos entre muchos prompts más pequeños.

SiliconFlow también admite configuraciones de razonamiento baja, alta y máxima para el modelo. Estos controles permiten a una aplicación ajustar cuánto esfuerzo de inferencia recibe una tarea, en lugar de tratar cada solicitud de forma idéntica.

Un paso ligero de clasificación no requiere el mismo cómputo que una migración compleja de un repositorio. Un sistema de producción puede dirigir el trabajo rutinario hacia un esfuerzo menor y reservar el razonamiento máximo para pasos relevantes.

Esa flexibilidad facilita integrar el modelo en un flujo de trabajo más amplio. También crea nuevas obligaciones de prueba, porque la calidad, la latencia y la longitud de salida pueden variar según el esfuerzo seleccionado.

El producto resultante no es simplemente “DeepSeek con más tokens”. Es un endpoint de inferencia configurable pensado para mantenerse activo a través de cadenas de trabajo complejas.

Por qué DeepSeek Pro apunta a flujos de trabajo con agentes

La verdadera propuesta del modelo es una ejecución sostenida a través de múltiples acciones dependientes.

Los modelos de chat responden preguntas dentro de una conversación. Los agentes van más allá: seleccionan herramientas, proporcionan argumentos, leen los datos devueltos y deciden qué acción debe seguir.

Esa diferencia genera una prueba de fiabilidad mucho más dura. Una respuesta imprecisa es indeseable, pero un argumento incorrecto para una herramienta puede modificar un archivo, consultar el sistema equivocado o llevar una automatización por una ruta costosa.

DeepSeek ha centrado la actualización de V4 Pro en la comprensión de repositorios, la operación de terminales, la ingeniería de software, la selección de herramientas y la automatización de flujos de trabajo. No son tareas aisladas de preguntas y respuestas.

Un agente de programación podría comenzar con un informe de incidencia y un gran repositorio. Debe localizar los archivos relevantes, rastrear dependencias, planificar cambios, editar código, ejecutar pruebas, interpretar fallos y revisar su solución.

Un agente empresarial que usa herramientas sigue un ciclo similar. Podría leer documentos, consultar una base de datos, comparar registros devueltos y preparar un resultado que se mantenga fundamentado en esas fuentes.

El contexto largo puede respaldar ambos patrones al mantener más evidencia al alcance. El problema más difícil es decidir qué evidencia importa en cada paso.

Introducir un repositorio completo en una sola solicitud no garantiza la comprensión del repositorio. Los modelos pueden pasar por alto detalles enterrados en entradas largas, confundir archivos similares o depender demasiado de la información cercana a los límites del prompt.

Por tanto, un límite de un millón de tokens debe tratarse como capacidad, no como prueba de una recuperación efectiva. Los equipos necesitan evaluaciones que coloquen información decisiva en distintas posiciones y prueben si el modelo la aplica correctamente.

Los niveles de razonamiento del modelo añaden otra capa. Un esfuerzo mayor puede mejorar el rendimiento en tareas complejas, pero los desarrolladores deben determinar en qué casos ese cómputo adicional cambia los resultados.

La política de enrutamiento más útil probablemente dependerá de la etapa de la tarea. La planificación, la depuración y la verificación final merecen más escrutinio que dar formato a un resultado conocido.

Este enfoque también se aplica al trabajo de conocimiento fuera del desarrollo de software. Los equipos que construyen sistemas de búsqueda a partir de material técnico local ya separan la recuperación de documentos del razonamiento y la verificación.

Una base de conocimiento de ingeniería práctica no depende solo del tamaño del contexto. Preserva los límites entre fuentes, recupera los archivos relevantes y permite a los usuarios verificar la evidencia detrás de una respuesta.

Los desarrolladores de agentes necesitan salvaguardas comparables. Un agente debe saber qué información provino de una herramienta, qué infirió y qué hechos requieren otra comprobación.

La documentación de llamadas a herramientas de DeepSeek ofrece una ilustración sencilla relacionada con el tiempo meteorológico. El modelo primero obtiene la fecha actual, calcula qué significa “mañana” y después llama a una función meteorológica con la fecha resuelta.

El ejemplo es pequeño, pero expone el mecanismo central. Una acción posterior depende del resultado de una anterior, por lo que la conversación debe preservar tanto los datos devueltos como el estado de razonamiento.

Las cadenas reales de producción contienen más ramificaciones. Las herramientas pueden devolver resultados parciales, los permisos pueden fallar, los esquemas pueden cambiar y el modelo puede recibir evidencia que contradiga su plan inicial.

DeepSeek Pro debe mantener la coherencia cuando esas interrupciones se acumulan. Su ventana de contexto ofrece al sistema más espacio para retener la cadena, mientras que el uso de herramientas le proporciona una forma de cambiar el entorno externo.

Ninguna de las dos capacidades proporciona por sí sola una agencia fiable. El producto se vuelve valioso únicamente cuando el modelo mantiene el estado, selecciona operaciones válidas y reacciona adecuadamente a resultados inesperados.

La integración de SiliconFlow reduce el esfuerzo necesario para probar esa propuesta. Un desarrollador puede ejecutar el mismo flujo de trabajo contra V4 Pro y otro modelo compatible mientras mantiene constante gran parte de la aplicación circundante.

Eso hace que el lanzamiento sea relevante para los equipos de plataforma, no solo para los entusiastas de los modelos. Permite comparaciones controladas con repositorios, herramientas y condiciones de fallo reales.

La apuesta de DeepSeek Pro enfrenta el control abierto a la fiabilidad gestionada

La competencia central es el control abierto frente a la confianza operativa asociada a los sistemas de agentes propietarios.

DeepSeek distribuye el checkpoint de V4 Pro bajo la licencia MIT. El repositorio oficial del modelo incluye pesos del modelo, instrucciones de despliegue, configuraciones de muestreo recomendadas y resultados de benchmarks.

Esa licencia otorga a las organizaciones una amplia libertad para inspeccionar, modificar, desplegar y desarrollar en torno al modelo. También reduce la dependencia de un único producto alojado.

SiliconFlow añade una opción gestionada sin eliminar la ruta de autoalojamiento. Un equipo puede comenzar con una API, evaluar el comportamiento y decidir después si el control de la infraestructura justifica un despliegue directo.

Esta combinación cuestiona una suposición habitual sobre los agentes de frontera. El rendimiento avanzado en programación y uso de herramientas ha llegado a menudo a través de servicios cerrados con modelos propietarios e interfaces estrechamente integradas.

Esos servicios pueden ofrecer un pulido operativo considerable. Sus proveedores controlan el modelo, la pila de inferencia, el protocolo de herramientas, las actualizaciones y la experiencia de agente circundante.

Un checkpoint abierto cambia esa relación. Las organizaciones pueden preservar una versión del modelo, inspeccionar los componentes de despliegue, personalizar las políticas de serving o mover cargas de trabajo entre proveedores compatibles.

Sin embargo, el control transfiere responsabilidad. Un equipo que ejecuta el modelo debe gestionar hardware, actualizaciones, parches de seguridad, rendimiento, observabilidad y regresiones.

Incluso los proveedores gestionados pueden presentar diferencias. Los modelos con nombres idénticos pueden utilizar cuantización, configuraciones de serving, límites de contexto o controles de razonamiento distintos entre endpoints.

Para los sistemas de agentes, esas diferencias pueden alterar más que el estilo de respuesta. Pueden afectar el formato de las llamadas a herramientas, la latencia, la longitud de las completaciones y el comportamiento de recuperación.

El lanzamiento de agosto también ilustra la rapidez con la que pueden cambiar las comparaciones entre modelos. DeepSeek-V4-Flash-0731 llegó antes del checkpoint final de Pro e inicialmente complicó la jerarquía de la familia.

Flash es la opción más pequeña diseñada en torno a la capacidad de respuesta y la eficiencia de producción. Su ficha oficial indica que mejoró de forma sustancial respecto a ambos modelos de vista previa en varias evaluaciones de agentes.

El lanzamiento final de Pro superó después a Flash en el conjunto de benchmarks de agentes publicados por DeepSeek. Esa secuencia facilita el posicionamiento de la familia, pero también desaconseja asumir de forma simplista que «Pro» siempre es la única opción razonable.

Algunas aplicaciones necesitan clasificación rápida, finalización de código, resúmenes o selección de herramientas con baja latencia. Flash puede encajar en esas etapas incluso cuando Pro se encarga de la planificación y de los pasos de recuperación complejos.

Por tanto, un agente de producción puede utilizar ambos. Puede dirigir las acciones rutinarias hacia DeepSeek-V4-Flash-0731 y escalar las decisiones ambiguas o de alto impacto a V4 Pro.

Este enfoque por etapas alinea la selección del modelo con el riesgo de la tarea. También puede evitar que el razonamiento máximo se convierta en la opción predeterminada para trabajos que no se benefician de él.

El lanzamiento abierto de DeepSeek facilita la personalización de este enrutamiento. Los desarrolladores pueden inspeccionar la interfaz del modelo y conservar puntos de control específicos en lugar de aceptar sustituciones silenciosas.

Sin embargo, los competidores propietarios conservan ventajas que van más allá de las puntuaciones de benchmarks. Sus productos de agentes pueden incluir sistemas maduros de permisos, sandboxing, flujos de revisión de código, gestión de memoria e integraciones mantenidas como un único paquete.

DeepSeek y SiliconFlow proporcionan capas importantes de modelos e infraestructura. No sustituyen automáticamente todo el producto de agentes que se construye alrededor de esas capas.

Esa distinción define la presión sobre los proveedores establecidos. Se enfrentan a otro modelo capaz al que los clientes pueden acceder mediante una API familiar u operar de forma independiente.

Al mismo tiempo, DeepSeek enfrenta presión para demostrar que la apertura puede respaldar un comportamiento de producción predecible. La disponibilidad de los pesos es significativa, pero la fiabilidad determina si los equipos confían al modelo acciones relevantes.

Lo que las mejoras en los benchmarks no demuestran

Los resultados de DeepSeek justifican realizar pruebas, pero no resuelven la fiabilidad en producción.

El lanzamiento oficial informa de grandes mejoras respecto a la versión preliminar de V4 Pro en evaluaciones de terminal, repositorios, ingeniería de software, ciberseguridad, uso de herramientas y automatización.

En Terminal Bench 2.1, DeepSeek informa una puntuación de 87.9 para V4 Pro 0813, frente a 72.1 para su versión preliminar de Pro. El benchmark evalúa la capacidad de un agente para completar tareas en un entorno de terminal.

La empresa informa de 61.5 en NL2Repo, frente a 38.5 para la versión preliminar de Pro. Esa prueba se centra en traducir solicitudes en lenguaje natural a cambios a nivel de repositorio.

DeepSeek también informa de 62.7 en DeepSWE, frente a 12.8 para la versión preliminar. Su resultado en Toolathlon-Verified sube de 55.9 a 74.1, mientras que AutomationBench Public sube de 12.8 a 31.8.

Son diferencias sustanciales dentro de la configuración de evaluación de DeepSeek. El aviso oficial de lanzamiento también aporta una salvedad importante.

DeepSeek evaluó tareas públicas de agentes de código mediante el modo mínimo de su propio DeepSeek Harness. Utilizó el máximo esfuerzo de razonamiento con una temperatura de 1.0 y un ajuste top-p de 0.95.

La empresa afirma que los resultados pueden diferir en otros marcos de agentes. Esa advertencia debería orientar cómo los compradores interpretan cada cifra.

El rendimiento de los agentes depende de algo más que el modelo base. Las descripciones de herramientas, los prompts de sistema, las políticas de reintento, la gestión del contexto, los límites de permisos y los entornos de ejecución pueden cambiar el resultado.

Un modelo probado con el máximo esfuerzo de razonamiento también podría comportarse de forma diferente con ajustes inferiores elegidos para obtener respuestas de producción más rápidas. Liderar un benchmark bajo una configuración no establece cuál es el mejor ajuste operativo.

Dos evaluaciones publicadas en la ficha del modelo son internas. DeepSeek etiqueta DSBench-FullStack y DSBench-Hard como conjuntos de pruebas de la empresa, lo que limita el examen independiente de sus tareas y puntuaciones.

Los benchmarks públicos restantes siguen aportando evidencia útil. Sin embargo, los equipos deberían reproducir flujos de trabajo representativos en lugar de trasladar una conclusión de una clasificación a una decisión de compra.

La evaluación más sólida comienza con fallos que ya se producen en la aplicación. Entre ellos podrían estar seleccionar una herramienta incorrecta, perder restricciones tras la compactación del contexto, editar archivos no relacionados o afirmar que se ha tenido éxito antes de que terminen las pruebas.

Las afirmaciones sobre contexto largo también requieren validación directa. Un modelo puede aceptar técnicamente un millón de tokens y, aun así, mostrar una recuperación o un razonamiento irregular en ese rango.

Los desarrolladores deberían probar la ubicación de la información, las instrucciones contradictorias, los símbolos duplicados y el material irrelevante. También deberían medir si los prompts más extensos mejoran lo suficiente la finalización de tareas como para justificar sus efectos sobre la latencia y la infraestructura.

La seguridad merece atención por separado. Los agentes habilitados para herramientas pueden encontrarse con inyección de prompts dentro de documentos, repositorios, páginas web o contenido devuelto por herramientas.

Una ventana de contexto grande amplía la cantidad de material potencialmente hostil. No determina qué instrucciones merecen autoridad.

Las aplicaciones siguen necesitando esquemas estrictos de herramientas, credenciales con alcance limitado, mecanismos de confirmación y aislamiento en torno a la ejecución de código. El modelo nunca debería convertirse en el único límite de permisos.

Los pesos abiertos mejoran la auditabilidad, pero no proporcionan automáticamente una auditoría. Las organizaciones necesitan personas y procesos capaces de inspeccionar el despliegue del modelo y observar sus acciones.

SiliconFlow introduce una dependencia adicional porque la inferencia alojada sitúa la ejecución fuera del hardware propio del cliente. Los compradores deberían examinar la retención, la disponibilidad regional, el comportamiento del servicio y los controles específicos del proveedor antes de enviar repositorios sensibles.

La Licencia MIT también describe derechos de uso, no el comportamiento del modelo. No certifica precisión factual, seguridad, idoneidad legal ni ausencia de resultados perjudiciales.

Otra cuestión abierta es la fiabilidad de la salida estructurada. Los directorios de modelos informan de compatibilidad con llamadas a herramientas y respuestas con formato JSON, pero el cumplimiento de esquemas puede variar con prompts complejos.

Una llamada a función malformada puede reintentarse. Una llamada válida pero semánticamente incorrecta es más difícil, porque el sistema circundante puede tratarla como legítima.

Aquí es donde los agentes de producción difieren de las demostraciones de benchmarks. Las herramientas reales tienen efectos secundarios, y el coste de un error depende de lo que el agente tenga permiso para hacer.

Por tanto, DeepSeek Pro debería incorporarse a los flujos de trabajo mediante permisos por etapas. Los primeros despliegues pueden priorizar el análisis de repositorios de solo lectura, la planificación, la generación de pruebas y los parches propuestos.

Una autonomía más amplia debería seguir a la evidencia obtenida de los registros y la revisión humana. Los equipos necesitan métricas de éxito que incluyan recuperación, acciones innecesarias y correcciones de revisores, no solo tareas completadas.

Los resultados disponibles convierten a V4 Pro 0813 en un candidato creíble para evaluación. No eliminan la necesidad de realizar esa evaluación.

Tres señales mostrarán si el lanzamiento importa

La próxima prueba es la adopción bajo restricciones reales, no otro anuncio sobre ventanas de contexto.

La primera señal es el rendimiento de agentes reproducido de forma independiente. Los desarrolladores deberían observar si los evaluadores externos pueden aproximarse a los resultados publicados por DeepSeek en distintos harnesses y proveedores.

Resultados consistentes reforzarían la afirmación de que la mejora pertenece principalmente al modelo. Una gran variación mostraría que la orquestación y la configuración de servicio explican una parte mayor del resultado.

La segunda señal es la consistencia entre proveedores. V4 Pro ya está apareciendo a través de múltiples rutas de inferencia, y cada una puede tomar decisiones distintas sobre hardware, caché, cuantización y parámetros compatibles.

Los desarrolladores necesitan comparar la validez de las llamadas a herramientas, la recuperación en contextos largos, la latencia y el comportamiento de finalización entre esas rutas. Un nombre de modelo compartido importará menos si las aplicaciones requieren lógica de reparación específica para cada proveedor.

SiliconFlow puede diferenciar su oferta mediante una implementación predecible de los niveles de razonamiento y el uso de herramientas. La disponibilidad desde el primer día atrae pruebas, pero el comportamiento estable mantiene el tráfico de producción.

La tercera señal es cómo los desarrolladores dividen el trabajo entre Pro y Flash. DeepSeek-V4-Flash-0731 sigue siendo el modelo de la familia orientado a la velocidad, mientras que Pro está posicionado para razonamiento difícil y agentes.

Si los equipos enrutan tareas entre ambos, DeepSeek habrá establecido una cartera de modelos en lugar de un único endpoint insignia. Eso haría que la familia fuera útil para planificación, ejecución, verificación y generación rutinaria.

Si la mayoría de los desarrolladores se queda con Flash, el mercado estará señalando que la capacidad adicional de Pro no justifica sus exigencias operativas para el trabajo cotidiano. Si seleccionan Pro para pasos autónomos, la fiabilidad habrá prevalecido sobre la velocidad bruta.

La documentación de DeepSeek V4 explica la familia más amplia como un sistema de mezcla de expertos diseñado en torno a la inteligencia de contexto de un millón de tokens. La actualización de agosto concentra esa ambición general en agentes que operan en producción.

Ese es el verdadero significado del lanzamiento de SiliconFlow. Sitúa el modelo actualizado detrás de una interfaz accesible en la que los desarrolladores pueden probar sus afirmaciones con sus propias herramientas y datos.

DeepSeek Pro ahora combina contexto largo, razonamiento ajustable, llamadas a herramientas, pesos abiertos y disponibilidad administrada. Pocos de esos elementos son únicos por sí solos.

Su combinación crea una alternativa creíble para los equipos que desean más control sobre un modelo de agentes sin iniciar un gran proyecto de autoalojamiento. También crea una obligación clara de verificar cada configuración de proveedor y flujo de trabajo.

El siguiente paso más útil no es proporcionar al modelo el prompt más largo disponible. Empiece con un flujo de trabajo difícil y medible que contenga herramientas realistas, límites de permisos y casos de fallo conocidos.

Compare razonamiento bajo, alto y máximo en la misma tarea. Registre errores de herramientas, afirmaciones sin respaldo, intentos de recuperación, tiempo de finalización y correcciones de revisores.

Después, repita la prueba con Flash o con un modelo de agente propietario establecido. DeepSeek Pro solo se ganará un papel en producción cuando su contexto y razonamiento adicionales se traduzcan en menos fallos relevantes.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page