top of page

DeepSeek Flash Acaba de Superar o V4 Pro Preview em Testes de Agentes, mas a Parte Difícil Começa Agora

1 de ago.
14 min de leitura

O DeepSeek Flash entrou em beta público em 31 de julho com uma afirmação marcante: suas pontuações atualizadas em agentes agora superam o V4 Pro Preview em todos os testes divulgados.

A empresa também adicionou suporte nativo à Responses API, a interface usada pelo agente de programação Codex da OpenAI. Isso transforma o DeepSeek-V4-Flash de um modelo rápido que desenvolvedores podem colocar por trás de um agente em um modelo projetado para funcionar dentro de um cliente de agentes já estabelecido.

A inversão é relevante porque o DeepSeek originalmente posicionava o Flash abaixo do V4 Pro. Seu modelo menor era a opção mais rápida, enquanto o Pro sustentava a narrativa de maior capacidade para agentes. O pós-treinamento aparentemente reduziu ou inverteu essa hierarquia sem alterar a arquitetura do Flash.

No entanto, os números vêm da própria avaliação do DeepSeek. Dois testes são internos, vários resultados dependem de um harness ainda não lançado, e desenvolvedores independentes mal começaram a testar o novo endpoint. Portanto, o beta público abre um desafio crível aos modelos maiores de programação, mas não encerra a disputa.

O Que Mudou no Beta Público do DeepSeek Flash

O DeepSeek aprimorou o comportamento em torno de sua arquitetura Flash existente, em vez de apresentar um modelo substituto maior.

Segundo o anúncio de benchmarks do DeepSeek, o DeepSeek-V4-Flash-0731 mantém a arquitetura e o tamanho do modelo em preview. A empresa afirma ter aplicado apenas pós-treinamento adicional, a etapa que molda como um modelo treinado raciocina, segue instruções e usa ferramentas.

Essa distinção é central para o lançamento. O DeepSeek não argumenta que mais parâmetros produziram a melhoria reportada. A alegação é que um modelo menor se tornou um agente muito melhor após receber treinamento mais direcionado.

O DeepSeek-V4-Flash tem 284 bilhões de parâmetros totais, com 13 bilhões ativados para cada token. A arquitetura mixture-of-experts seleciona apenas parte do modelo em cada etapa de inferência. O V4 Pro é muito maior, com 1,6 trilhão de parâmetros totais e 49 bilhões de parâmetros ativos.

Ambos os modelos apareceram inicialmente em preview em 24 de abril. O DeepSeek descreveu o Flash como sua opção rápida e eficiente, com raciocínio próximo ao Pro e desempenho semelhante em tarefas simples de agentes. Suas notas de lançamento do V4 também atribuíram aos dois modelos uma janela de contexto de um milhão de tokens.

A nova atualização altera essa relação. O DeepSeek reportou os seguintes resultados do beta público: 82,7 no Terminal Bench 2.1, 54,2 no NL2Repo, 76,7 no Cybergym e 54,4 no DeepSWE. Também listou 70,3 no Toolathlon Verified e 25,2 no Agent Last Exam.

O DeepSeek reportou ainda 25,1 na parte pública do Automation Bench. Seus dois testes internos de programação produziram 68,7 no DSBench-FullStack e 59,6 no DSBench-Hard.

Esses números cobrem diferentes partes do trabalho de um agente. Benchmarks de terminal medem se um modelo consegue concluir tarefas por meio da interação com a linha de comando. Testes de repositórios analisam navegação e alterações em bases de código existentes. Benchmarks de ferramentas testam se um modelo consegue escolher e operar funções externas ao longo de várias etapas.

O DeepSeek afirma que o modelo Flash atualizado superou o V4 Pro Preview nas nove avaliações reportadas. As mudanças mais expressivas apareceram, segundo os resultados, em tarefas que exigem ação contínua de programação, e não respostas curtas ou conclusão isolada de código.

O beta público afeta apenas a API oficial do Flash. O DeepSeek informou que sua aplicação web, seu app para consumidores e a API V4 Pro permanecem inalterados. Desenvolvedores que usam esses produtos não devem presumir que já contam com o comportamento atualizado.

O identificador do modelo continua sendo deepseek-v4-flash, o que reduz o trabalho de migração para usuários existentes da API. Ainda assim, essa conveniência cria uma preocupação com versionamento. As equipes precisam manter seus próprios registros de avaliação para determinar se o comportamento mudou após a atualização do endpoint.

Isso é mais do que uma atualização rotineira de modelo porque desafia uma suposição conhecida. Um modelo maior não permanece automaticamente como o melhor agente quando pós-treinamento, formatação de ferramentas e o harness de execução mudam juntos.

DeepSeek Flash Agora Fala a Linguagem que o Codex Espera

O suporte nativo à Responses API torna o lançamento operacionalmente importante, mesmo antes de as alegações de benchmark receberem confirmação independente.

Um modelo de programação não trabalha sozinho dentro de um agente. O cliente ao redor envia instruções, declara ferramentas, registra saídas, gerencia o contexto e decide quando o modelo deve continuar. Pequenas falhas de compatibilidade podem comprometer um modelo que, de outra forma, seria capaz.

A Responses API da OpenAI fornece uma interface estruturada para essas interações. O DeepSeek agora afirma que sua API oferece suporte nativo a esse formato, permitindo que clientes do Codex usem o DeepSeek como provedor alternativo de modelos.

A configuração oficial do Codex do DeepSeek abrange a CLI do Codex, o aplicativo desktop do ChatGPT e a extensão do Codex para Visual Studio Code. Esses clientes compartilham um arquivo de configuração, de modo que uma única configuração de provedor pode expor o modelo nos três ambientes.

Atualmente, a documentação identifica o DeepSeek-V4-Flash como o único modelo do DeepSeek disponível por meio dessa integração. Ela afirma que o suporte ao V4 Pro é esperado para o início de agosto de 2026.

O DeepSeek fornece um catálogo de modelos que descreve o Flash ao Codex. Ele especifica uma janela de contexto de 1.048.576 tokens, suporte a chamadas paralelas de ferramentas, três níveis de esforço de raciocínio e uma ferramenta de patch em formato livre. Também declara as interfaces de shell e busca na web esperadas pelo cliente.

Esse catálogo não é uma adição cosmética. Clientes de agentes precisam entender os limites de contexto de cada modelo, os formatos de ferramentas compatíveis e os controles de raciocínio. Metadados incorretos podem causar tarefas truncadas, solicitações inválidas ou chamadas de ferramentas que o cliente não consegue executar.

O DeepSeek oferece um script de configuração automatizado e uma opção de configuração manual. O script faz backup da configuração existente do Codex, grava o catálogo de modelos do DeepSeek, adiciona o provedor e valida os arquivos resultantes.

A integração direta cria um caso de uso concreto. Um desenvolvedor pode abrir um repositório desconhecido, pedir ao agente que investigue um teste com falha e deixá-lo pesquisar arquivos, editar código e executar comandos. O modelo precisa manter o estado durante toda a sequência.

Esse fluxo de trabalho é mais difícil do que gerar uma função a partir de um prompt. O agente precisa interpretar resultados de ferramentas, perceber premissas incorretas, preservar restrições e evitar repetir uma ação inválida. Também precisa produzir patches que se encaixem no repositório, em vez de apenas parecerem plausíveis.

A Responses API remove uma camada de adaptação entre o Flash e o Codex. Ela não garante que o modelo tomará boas decisões. No entanto, oferece aos desenvolvedores um cliente padrão por meio do qual podem testar essas decisões.

Isso pressiona provedores que dependem de pacotes proprietários de cliente e modelo. Se o Codex puder operar vários backends de modelos pelo mesmo fluxo de trabalho, os desenvolvedores poderão comparar modelos sem substituir toda a sua interface.

Também pressiona o DeepSeek. A compatibilidade nativa facilita a comparação nos dois sentidos. Os usuários podem testar o Flash nos repositórios e comandos que já utilizam e, depois, migrar para outro modelo caso sua vantagem nos benchmarks não se sustente no trabalho real.

Por Que um Modelo Menor Pode Superar o V4 Pro Preview

O salto reportado aponta para pós-treinamento e infraestrutura de agentes como mecanismo, e não para uma expansão repentina no tamanho do modelo.

O desempenho de agentes depende de mais do que o conhecimento armazenado durante o pré-treinamento. Um modelo precisa aprender quando chamar uma ferramenta, como ler o resultado, quando revisar um plano e quando parar. Esses comportamentos podem melhorar por meio de aprendizado por reforço em ambientes executáveis.

O DeepSeek descreveu anteriormente um sistema de treinamento de agentes chamado DeepSeek Elastic Compute, ou DSec. Ele oferece suporte a chamadas de funções, contêineres, micro máquinas virtuais e máquinas virtuais completas por trás de uma única interface de software.

Segundo uma análise técnica da arquitetura V4, o DSec pode executar centenas de milhares de sandboxes simultâneos. Esses ambientes permitem que trabalhos de treinamento recompensem resultados de interações reais com ferramentas, em vez de avaliar apenas texto.

O design do V4 também busca reduzir o custo de longas trajetórias de agentes. Cada resultado de terminal, trecho de arquivo, mensagem de erro e resposta do modelo adiciona tokens. As etapas posteriores precisam processar esse histórico em expansão.

O DeepSeek combina dois mecanismos de atenção comprimida ao longo do modelo. Compressed Sparse Attention reduz a sequência antes de selecionar blocos relevantes. Heavily Compressed Attention cria uma representação muito mais curta que cada consulta pode examinar.

A análise reportou que o V4 Flash usa 10 por cento do cálculo de inferência de token único exigido pelo DeepSeek-V3.2 em um milhão de tokens. Ele também usa 7 por cento do cache key-value do V3.2, a memória que mantém o contexto anterior durante a geração.

Esses números se aplicam à eficiência arquitetural, e não à atualização de agentes de julho em si. Ainda assim, explicam por que o Flash é uma base plausível para agentes de longa duração. Um agente não pode se beneficiar de uma grande janela de contexto se cada etapa adicional tornar a inferência impraticável.

O V4 também preserva o conteúdo de raciocínio entre mensagens do usuário quando há ferramentas envolvidas. Esse comportamento é voltado a fluxos de trabalho nos quais um desenvolvedor adiciona instruções depois que um agente já inspecionou arquivos ou executou comandos.

A formatação de ferramentas também importa. O DeepSeek introduziu tokens dedicados e um esquema baseado em XML para chamadas de ferramentas. Essa abordagem separa strings simples de parâmetros estruturados e busca reduzir erros de escape em solicitações aninhadas.

A atualização de julho supostamente não altera nenhuma dessas bases arquiteturais. Ela ajusta como o Flash se comporta sobre elas. Isso sugere que o DeepSeek encontrou ganhos adicionais em dados de treinamento, design de recompensas, trajetórias de ferramentas ou políticas de instrução.

A receita exata continua sem divulgação. O DeepSeek não publicou informações suficientes para separar a contribuição do modelo atualizado da contribuição do harness de avaliação. Essa lacuna impede que observadores externos atribuam o aumento de pontuação a uma única técnica.

Ainda assim, a direção acompanha uma mudança mais ampla no desenvolvimento de modelos. Os provedores estão otimizando cada vez mais os modelos para trajetórias completas de tarefas, em vez de respostas isoladas. A unidade de desempenho está se tornando um fluxo de trabalho bem-sucedido.

Isso favorece modelos menores quando eles conseguem agir de forma confiável. Um modelo compacto que escolhe a ferramenta correta e se recupera de erros pode superar um modelo maior que raciocina bem, mas perde o controle do fluxo de trabalho.

Isso também muda a forma como as equipes de engenharia devem avaliar um agente de programação com IA. Uma pontuação geral de programação diz pouco sobre se o modelo consegue operar dentro de um repositório específico, seguir convenções locais e verificar seu próprio patch.

Equipes que já mantêm documentação técnica pesquisável podem conectar testes de agentes à sua base de conhecimento de engenharia existente. Isso permite que os avaliadores comparem mudanças geradas com notas de arquitetura, decisões e incidentes anteriores, em vez de julgar a saída pela aparência.

A vantagem do modelo menor é, portanto, condicional. O Flash precisa do cliente certo, de definições de ferramentas, contexto de repositório e permissões de execução. O DeepSeek aprimorou várias camadas dessa pilha, mas implantações reais precisam fornecer o restante.

A Liderança nos Benchmarks Vem com Ressalvas Importantes

Os resultados da DeepSeek são evidências relevantes para testar o modelo, mas não constituem prova independente de confiabilidade em produção.

A primeira ressalva é o controle da avaliação. A DeepSeek selecionou as configurações do modelo, o harness, os limites das tarefas e o formato de apresentação dos resultados. Avaliações conduzidas por fornecedores são úteis para indicar os pontos fortes pretendidos, mas raramente capturam todas as falhas que os usuários encontrarão.

A DeepSeek testou tarefas públicas de agentes de programação com o que chama de DeepSeek Harness no modo mínimo. Utilizou a configuração de esforço máximo, top_p de 0,95 e temperatura de 1,0.

O harness não foi divulgado. Portanto, pesquisadores independentes não conseguem reproduzir a configuração exata nem determinar quanto ela contribuiu para os resultados. As pontuações de agentes frequentemente mudam quando se alteram o prompt, o wrapper de ferramentas, o tempo limite ou a política de novas tentativas.

A segunda ressalva diz respeito à composição dos testes. DSBench-FullStack e DSBench-Hard são conjuntos de dados internos. Avaliadores externos não podem inspecionar a distribuição das tarefas, os controles de contaminação, as regras de avaliação ou os casos de falha.

Avaliações internas podem revelar fraquezas que benchmarks públicos não detectam. No entanto, não podem oferecer responsabilização pública até que as tarefas ou um processo de auditoria confiável sejam disponibilizados.

A terceira questão é a saturação e a otimização de benchmarks. Quando tarefas públicas passam a ser amplamente utilizadas, desenvolvedores de modelos podem direcionar o treinamento para seus formatos. Uma pontuação mais alta pode refletir aprendizado útil, especialização restrita ou ambos.

A quarta questão é a confiabilidade operacional. Um modelo pode ter sucesso em um benchmark delimitado e, ainda assim, comportar-se de forma inconsistente durante uma tarefa de várias horas. Agentes em produção enfrentam instruções ambíguas, dependências em mudança, serviços indisponíveis e limites de permissão.

A segurança traz outro desafio. Cybergym pode medir partes do raciocínio em cibersegurança, mas implantações empresariais também precisam de controles sobre execução de comandos, tratamento de segredos, acesso à rede e ações destrutivas. A capacidade do modelo não substitui um ambiente de execução restrito.

Analistas independentes levantaram preocupações semelhantes após a prévia do V4 em abril. O analista da Morningstar Ivan Su descreveu o V4 como uma continuação competente, mas afirmou que uma avaliação independente era necessária antes de se chegar a conclusões finais.

O analista da Omdia Lian Jye Su ofereceu uma leitura mais positiva, afirmando que os benchmarks iniciais indicavam que o V4 competiria com os principais modelos americanos. As duas perspectivas apareceram em um relatório independente sobre o V4.

Essas visões não são contraditórias. A DeepSeek pode ser uma concorrente séria, enquanto suas alegações mais fortes ainda exigem testes externos. A beta pública é a etapa em que essas proposições se encontram.

Comparações com OpenAI, Anthropic e Google também exigem cautela. Diferentes fornecedores divulgam resultados com configurações de modelo e estruturas de agentes distintas. Uma pontuação atribuída a um modelo frequentemente reflete um sistema completo.

A atualização do V4 Flash cria um problema adicional de comparação porque V4 Pro Preview é um alvo em movimento. A DeepSeek afirma que o lançamento oficial do V4 Pro virá em seguida, e sua documentação do Codex prevê suporte de integração em breve.

Uma vitória do Flash sobre o modelo em prévia pode, portanto, ser temporária. A comparação continua importante porque mostra o que o pós-treinamento direcionado alcançou, mas não estabelece uma hierarquia permanente entre produtos.

Desenvolvedores também devem observar possíveis regressões. O aprendizado por reforço adicional pode melhorar a persistência no uso de ferramentas, tornando ao mesmo tempo o modelo mais verboso, menos cauteloso ou mais disposto a executar um plano incerto.

Uma avaliação útil deve registrar a conclusão de tarefas, o tempo de correção humana, chamadas de ferramentas inválidas, ações repetidas, falhas de teste e alterações não intencionais em arquivos. Latência e consumo de contexto também importam, pois os agentes invocam o modelo repetidamente.

A evidência mais robusta virá de repositórios que nunca fizeram parte do processo de treinamento ou benchmark. Os resultados devem incluir tarefas que falharam, e não apenas demonstrações bem acabadas.

Até que essas avaliações sejam divulgadas, a conclusão correta é limitada. A DeepSeek relata uma grande melhoria em agentes, disponibiliza o endpoint atualizado para testes públicos e oferece uma integração direta com Codex. Ainda não demonstrou a mesma vantagem em ambientes de produção não controlados.

Quem Sofre Pressão com a Atualização do Agente DeepSeek V4

A pressão imediata recai sobre os fornecedores de modelos que cobram dos desenvolvedores por inteligência enquanto vinculam essa inteligência a uma experiência proprietária de agente.

A OpenAI construiu o Codex em torno de seus próprios modelos e da Responses API. O suporte nativo da DeepSeek transforma essa interface em um ponto de concorrência. O cliente permanece familiar, enquanto o fornecedor subjacente muda.

Isso não torna a DeepSeek uma equivalente imediata para todas as cargas de trabalho do Codex. Modelos podem interpretar as mesmas definições de ferramentas de maneiras diferentes, e recursos do cliente podem depender de comportamentos específicos do fornecedor. Ainda assim, a compatibilidade reduz o esforço necessário para realizar uma comparação séria.

A Anthropic enfrenta um desafio relacionado por meio do Claude Code. A DeepSeek já documentou integrações com Claude Code, OpenCode, OpenClaw e outros sistemas de agentes durante o período de prévia do V4.

A Google concorre por meio de produtos de programação baseados em Gemini e APIs para desenvolvedores. Sua escala, capacidades multimodais e distribuição em nuvem continuam sendo vantagens substanciais. No entanto, cada fornecedor agora precisa explicar por que os desenvolvedores deveriam aceitar uma pilha fortemente acoplada.

A pressão também alcança fornecedores menores de modelos de programação. DeepSeek Flash combina uma grande janela de contexto, uma API oficial, pesos de modelo abertos do lançamento em prévia e suporte a vários clientes de agentes.

A distribuição importa aqui tanto quanto o desempenho em benchmarks. Um modelo muito bem avaliado que exige uma integração personalizada pode receber menos testes do que um modelo um pouco mais fraco disponível em ferramentas familiares.

A estratégia da DeepSeek parece reduzir a fricção de troca na camada de interface. Desenvolvedores podem manter um cliente, expor o mesmo repositório e comparar resultados. Isso dá mais ênfase à conclusão efetiva das tarefas.

A empresa também concorre com seu próprio modelo V4 Pro. O Flash servia anteriormente como a opção menor para trabalhos sensíveis à velocidade. As novas pontuações dão aos desenvolvedores um motivo para testá-lo em tarefas antes reservadas ao Pro.

Essa competição interna pode ajudar a DeepSeek a segmentar cargas de trabalho de modo mais eficaz. Equipes podem enviar trabalho rotineiro em repositórios ao Flash e reservar o Pro para tarefas que exigem raciocínio mais profundo.

Ainda assim, a DeepSeek não demonstrou que essa estratégia de roteamento funciona de forma consistente. Os novos resultados do Flash se concentram em benchmarks de agentes, enquanto o Pro pode manter vantagens em conhecimento, raciocínio e planejamento complexo.

Empresas enfrentam considerações que vão além da capacidade bruta. Residência de dados, regras de conformidade, governança de fornecedores, compromissos de suporte e restrições geopolíticas podem impedir a adoção, independentemente do desempenho em benchmarks.

A DeepSeek também enfrenta escrutínio sobre práticas de treinamento e política de segurança. Anthropic e OpenAI acusaram laboratórios chineses, incluindo a DeepSeek, de extrair capacidades por meio de destilação. A DeepSeek não aceitou essas alegações.

Essa disputa não determina se o Flash tem bom desempenho. Ela afeta revisões de aquisição, especialmente em organizações reguladas e ambientes do setor público.

Para desenvolvedores independentes e pequenas equipes, a decisão é mais direta. Eles podem executar tarefas representativas, inspecionar cada comando e comparar os patches resultantes. A beta oferece acesso suficiente para começar esse trabalho imediatamente.

Para organizações maiores, a pergunta mais relevante não é se o Flash vence um ranking público. É se o modelo reduz o esforço total de engenharia sem criar exposição inaceitável à segurança ou à governança.

Esse padrão também se aplica aos concorrentes. O lançamento da DeepSeek pressiona o mercado ao tornar a interoperabilidade entre modelos mais prática, mas cada fornecedor ainda precisa conquistar confiança em produção.

Três Sinais Decidirão se DeepSeek Flash Mantém Sua Liderança

A próxima fase será decidida pela reprodutibilidade, pelo lançamento oficial do V4 Pro e pela adoção sustentada em fluxos de trabalho reais com agentes.

O primeiro sinal é o lançamento do DeepSeek Harness. A DeepSeek afirma ter usado essa estrutura no modo mínimo para avaliações públicas de agentes de programação e planeja publicá-la.

Um harness público permitiria que pesquisadores repetissem os testes, inspecionassem prompts e comparassem o Flash com outros modelos em condições semelhantes. Resultados equivalentes reforçariam a alegação da DeepSeek de que o pós-treinamento produziu um aumento genuíno de capacidade.

Diferenças grandes enfraqueceriam essa conclusão. Elas poderiam mostrar que novas tentativas ocultas, prompts específicos para tarefas ou políticas de execução contribuíram mais do que o próprio modelo.

O segundo sinal é o lançamento oficial do V4 Pro. A DeepSeek afirma que o Pro será lançado em breve, enquanto sua documentação aponta para suporte ao Codex no início de agosto.

Esse lançamento testará a inversão central do artigo. Se o modelo final do Pro recuperar uma liderança clara em agentes, o Flash se tornará uma opção secundária eficiente, e não a nova referência de desempenho.

Se o Flash permanecer próximo ou à frente, a DeepSeek precisará explicar o papel de seu modelo muito maior. Os desenvolvedores poderão então preferir o Flash, a menos que o Pro apresente uma vantagem mensurável em suas tarefas mais difíceis.

O terceiro sinal são dados de adoção reais de usuários do Codex. Evidências úteis incluirão rastros completos de repositórios, patches reproduzíveis e relatos de falhas em bases de código diversas.

Observe com que frequência o Flash se recupera após um comando que falha. Acompanhe se ele repete operações inválidas, edita arquivos não relacionados ou para antes da verificação. Esses comportamentos determinam se um agente economiza tempo.

Testes de longa duração também revelarão se o contexto de um milhão de tokens continua útil à medida que os históricos se acumulam. A capacidade, por si só, não garante que o modelo recupere o detalhe correto após centenas de interações com ferramentas.

Desenvolvedores devem começar com tarefas delimitadas. Um teste adequado pode envolver localizar um defeito, escrever um patch focado, executar testes existentes e explicar o resultado. O repositório deve usar controle de versão, credenciais restritas e um ambiente de execução isolado.

As equipes podem então comparar o Flash ao seu modelo atual usando o mesmo conjunto de tarefas. Devem preservar execuções que falharam e intervenções humanas, pois exemplos apenas de sucesso ocultam a carga operacional.

A beta pública do DeepSeek Flash merece atenção porque combina três mudanças: pontuações de agentes mais altas relatadas pelo fornecedor, suporte padrão à Responses API e compatibilidade direta com Codex. Juntas, essas mudanças tornam o modelo mais fácil de avaliar onde os agentes de programação realmente operam.

Elas não eliminam a necessidade de ceticismo. A liderança relatada do modelo depende de testes conduzidos pela empresa, dois benchmarks internos e um harness que pessoas externas ainda não podem inspecionar.

A próxima decisão pertence aos desenvolvedores. Escolha várias tarefas que representem trabalho real, execute-as sob permissões controladas e meça resultados concluídos, em vez de respostas atraentes. Se DeepSeek Flash mantiver sua liderança nesse cenário, o modelo menor terá feito mais do que superar um benchmark de prévia. Terá desafiado a forma como as equipes escolhem a inteligência por trás de seus agentes.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page