DeepSeek Flash 0731 Entra no Top 3 dos Modelos Abertos, mas Liderança em Benchmark Precisa Ser Testada
- Ethan Carter

- 1 de ago.
- 14 min de leitura
DeepSeek Flash 0731 alcançou 50 no Artificial Analysis Intelligence Index, colocando o modelo recém-lançado entre os três principais sistemas de pesos abertos.
Esse resultado é dez pontos superior à pontuação anterior do DeepSeek V4 Flash, segundo testes independentes. O avanço é relevante porque a DeepSeek manteve a arquitetura menor do Flash, concentrando sua atualização no comportamento de agente.
O lançamento também intensifica a pressão sobre modelos abertos maiores da Zhipu AI, Moonshot AI, Alibaba e outros laboratórios chineses. Ele questiona a suposição de que contagens mais altas de parâmetros totais ou ativos continuam sendo a rota mais segura para agentes mais capazes.
Ainda assim, uma pontuação composta não pode encerrar o debate. A DeepSeek usou seu próprio harness de agentes, ainda não lançado, em várias avaliações de programação publicadas. Duas das avaliações citadas também vêm de conjuntos de testes internos.
A disputa relevante, portanto, é entre agentes menores de pesos abertos e sistemas maiores, não entre a DeepSeek e uma empresa específica. O Flash 0731 torna a abordagem menor mais crível, mas cargas de trabalho externas agora precisam confirmar sua eficiência relatada.
O Que Mudou no DeepSeek Flash 0731
A DeepSeek mudou mais o comportamento do modelo do que sua arquitetura básica e lançou o resultado sob licença MIT.
A DeepSeek descreve o 0731 como o lançamento oficial do DeepSeek V4 Flash, substituindo a prévia anterior. Seu model card afirma que a atualização melhora substancialmente as capacidades de agente.
Um modelo de agente faz mais do que responder a prompts isolados. Ele planeja etapas, chama ferramentas, examina resultados e revisa sua abordagem enquanto executa uma tarefa.
O modelo mantém a estrutura do V4 Flash, com 284 bilhões de parâmetros totais e cerca de 13 bilhões ativados para cada token. Esse design é uma mistura de especialistas, ou MoE, que encaminha cada token por componentes especialistas selecionados.
Essa distinção importa. Os parâmetros totais indicam a capacidade armazenada do modelo, enquanto os parâmetros ativados aproximam melhor a computação usada durante uma única passagem direta.
A DeepSeek também manteve o DSpark, seu módulo acoplado de decodificação especulativa. A decodificação especulativa permite que um componente de rascunho proponha vários tokens antes que o modelo principal os verifique, melhorando a velocidade de geração quando as previsões são aceitas.
O checkpoint lançado usa precisão mista FP4 e FP8. Os pesos dos especialistas usam representação de quatro bits, enquanto a maioria dos demais parâmetros usa representação de oito bits.
Uma precisão numérica menor reduz os requisitos de armazenamento e memória, embora o suporte de hardware e a implementação em tempo de execução ainda determinem o desempenho prático. O repositório ocupa aproximadamente 167GB em seus arquivos publicados.
A DeepSeek lançou esses pesos sob a licença MIT, que em geral permite modificação, redistribuição e uso comercial com obrigações limitadas. “Open source” continua sendo um rótulo imperfeito para modelos sem dados públicos de treinamento e código completo de treinamento.
“Pesos abertos” é mais preciso. Desenvolvedores podem inspecionar, executar, adaptar e redistribuir o checkpoint, mas não conseguem reproduzir integralmente sua criação a partir dos materiais lançados.
A DeepSeek também disponibilizou o modelo atualizado por trás de sua API oficial. Usuários existentes podem continuar usando o identificador de modelo deepseek-v4-flash, em vez de migrar para um endpoint 0731 separado.
A API oferece suporte a formatos de solicitação compatíveis com OpenAI e Anthropic. Essa compatibilidade reduz a carga de integração para equipes que já usam interfaces comuns de conclusão de chat ou de agentes.
A DeepSeek afirma que a arquitetura e os termos comerciais permanecem alinhados ao serviço Flash anterior. Portanto, a empresa apresentou o 0731 como uma atualização de capacidade, não como um novo produto premium.
Essa combinação cria a tensão central. Os desenvolvedores recebem um agente relatadamente mais capaz sem adotar um modelo ativo maior, uma licença restritiva para os pesos ou uma nova integração de API.
Por Que uma Pontuação de 50 Muda a Corrida dos Modelos Abertos
A pontuação importa porque coloca um modelo com relativamente poucos parâmetros ativos em uma categoria antes associada a sistemas abertos maiores.
A Artificial Analysis informa que o DeepSeek Flash 0731 obteve 50 em seu Intelligence Index. O DeepSeek V4 Flash anterior alcançou 40 dentro do mesmo framework de avaliação da organização.
O índice agrega desempenho em várias avaliações de raciocínio, conhecimento, matemática e programação. Ele fornece um ponto de comparação compartilhado, embora nenhuma métrica composta represente todas as cargas de trabalho de implantação.
Uma melhora de dez pontos é grande o suficiente para mudar as discussões de seleção de modelos. Não se trata apenas de uma pequena revisão escondida dentro do ruído de medição.
O resultado supostamente coloca o modelo entre as três ofertas de pesos abertos mais fortes medidas pela organização. Ele também deixa o Flash próximo de vários sistemas líderes com perfis ativos substancialmente maiores.
Isso cria pressão imediata sobre provedores que competem por escala de modelo. Um comprador que avalia um agente costuma se importar mais com trabalho concluído, latência, requisitos de hospedagem e controle do que com a contagem total de parâmetros.
Um modelo menor em atividade pode melhorar essa economia se sua qualidade resistir a testes independentes. Menos computação por token gerado pode permitir maior throughput ou menores necessidades de infraestrutura.
No entanto, a eficiência de MoE não é sinônimo de implantação simples. Todos os 284 bilhões de parâmetros ainda precisam de armazenamento, e as implementações devem mover os pesos dos especialistas de forma eficiente entre aceleradores.
Assim, o checkpoint oficial continua além do alcance de uma GPU comum de consumidor. O próprio exemplo de implantação da DeepSeek usa um único nó contendo quatro aceleradores GB300.
Quantizações da comunidade podem reduzir ainda mais os requisitos de memória, mas introduzem outra variável. Uma quantização agressiva pode alterar precisão, comportamento de ferramentas e desempenho em contexto longo.
O lançamento de pesos abertos ainda oferece opções que APIs fechadas não podem proporcionar. Organizações podem manter prompts em infraestrutura controlada, modificar o comportamento de inferência ou criar adaptações específicas de domínio.
Também podem inspecionar resultados em conjuntos privados de avaliação sem enviar material sensível a um provedor externo de modelos. Isso é útil para agentes de programação que trabalham com repositórios proprietários.
O lançamento pressiona os modelos abertos maiores de outra maneira. Seus desenvolvedores agora precisam justificar por que computação ativa adicional oferece maior confiabilidade, conhecimento ou execução complexa de agentes.
Um modelo maior pode continuar sendo a escolha correta. Os próprios resultados da DeepSeek mostram que o Flash não supera todos os sistemas proprietários nem todos os alvos de comparação.
A questão é a margem de desempenho. Quando um modelo menor se aproxima de um concorrente maior, os compradores perguntam se a diferença restante justifica hardware adicional e complexidade operacional.
Essa pergunta é especialmente importante para cargas de trabalho repetidas de agentes. Um modelo pode gerar milhares de tokens, chamar ferramentas muitas vezes e manter um longo histórico durante uma única atribuição.
Pequenas diferenças de eficiência se acumulam ao longo dessas etapas. Portanto, um modelo crível com 13 bilhões de parâmetros ativos pode importar mais em um loop de agente do que em uma breve troca com um chatbot.
A pontuação de 50 não coroa um vencedor universal. Ela muda o ônus da prova para modelos que consomem mais recursos enquanto oferecem inteligência medida semelhante.
O Mecanismo por Trás da Atualização do DeepSeek Flash
A DeepSeek melhorou o pós-treinamento, o controle de raciocínio e a execução de agentes sem apresentar o 0731 como uma nova arquitetura-base.
A empresa afirma que o Flash 0731 tem a mesma estrutura do modelo V4 Flash DSpark anterior. Isso significa que os ganhos relatados refletem principalmente refinamento de treinamento e comportamento.
O pós-treinamento molda como um modelo pré-treinado segue instruções, raciocina, usa ferramentas e responde a feedback. Ele pode mudar substancialmente o desempenho prático sem alterar a contagem subjacente de parâmetros.
A DeepSeek não publicou uma receita completa de treinamento do 0731. As evidências disponíveis mostram o resultado e a interface de execução, mas não todos os conjuntos de dados ou decisões de otimização.
O lançamento introduz três configurações de esforço de raciocínio: low, high e max. Essas configurações controlam quanto o modelo delibera antes de produzir sua resposta final.
Esse controle é relevante para produtos de agentes. Uma solicitação simples de formatação não deveria consumir o mesmo orçamento de raciocínio que a depuração de um repositório ou uma tarefa de pesquisa com várias etapas.
A DeepSeek recomenda esforço high ou max para trabalhos exigentes. Ela também oferece suporte a um comprimento máximo de saída de 384.000 tokens nesses modos, segundo as instruções do modelo.
Um teto alto de saída não significa que todas as tarefas devam se aproximar desse tamanho. Um raciocínio mais longo pode aumentar a latência e criar mais oportunidades para o modelo se desviar.
O modelo também mantém a janela de contexto de um milhão de tokens da família V4. Contexto é o material disponível durante uma interação, incluindo prompts, arquivos, resultados de ferramentas e raciocínio anterior.
O relatório técnico original da DeepSeek descreve métodos de atenção híbrida projetados para tornar esse contexto longo mais eficiente. A atenção determina quais tokens anteriores influenciam o cálculo atual.
Uma janela de um milhão de tokens pode acomodar grandes bases de código, rastros extensos de ferramentas ou coleções de documentos técnicos. A capacidade útil de contexto ainda depende da precisão da recuperação e da retenção de instruções.
A arquitetura usa atenção esparsa comprimida juntamente com atenção altamente comprimida. Esses métodos reduzem a computação e a memória associadas ao processamento de sequências longas.
A DeepSeek também usa hiperconexões restritas por variedade, chamadas mHC, para estabilizar o fluxo de informações pela rede. O termo descreve uma alternativa estruturada às conexões residuais convencionais.
A pilha de treinamento do V4 incorpora ainda o otimizador Muon. Um otimizador controla como os parâmetros do modelo mudam durante o treinamento, à medida que o sistema minimiza erros.
Essas escolhas arquiteturais vieram da prévia original do V4. A história do 0731 trata de quanto desempenho adicional a DeepSeek extraiu dessa base já existente.
O DSpark fornece outro mecanismo de eficiência. Ele prevê vários possíveis próximos tokens e permite que a rede principal os aceite ou rejeite em grupos.
A configuração oficial do vLLM propõe sete tokens especulativos de cada vez. Propostas aceitas podem aumentar a velocidade de saída sem substituir a validação do modelo principal.
A implantação ainda exige suporte de software compatível. A DeepSeek documenta caminhos para vLLM e SGLang, dois mecanismos comuns para servir modelos de linguagem de grande porte.
O lançamento não inclui um template de chat Jinja convencional. Em vez disso, a DeepSeek fornece scripts de codificação em Python para converter mensagens no estilo OpenAI no formato de entrada exigido pelo modelo.
Essa escolha acrescenta trabalho de integração para equipes que servem os pesos diretamente. Clientes da API não enfrentam a mesma responsabilidade de formatação de baixo nível.
A tese prática é simples. A DeepSeek usou computação esparsa, pesos de baixa precisão, decodificação especulativa e pós-treinamento mais forte para fazer o Flash competir acima de seu tamanho ativo.
Cada componente tem precedentes. Seu resultado combinado, se reproduzido fora do harness preferido da DeepSeek, dá aos agentes abertos menores um argumento arquitetural mais forte.
Os Benchmarks de Agentes da DeepSeek Precisam de uma Auditoria Independente
Os resultados publicados são impressionantes, mas suas alegações mais fortes dependem de condições de teste que avaliadores externos ainda não reproduziram integralmente.
A DeepSeek informa 82,7 no Terminal-Bench 2.1 para o Flash 0731. A prévia obteve 61,8, enquanto a prévia do V4 Pro marcou 72,1 na comparação da empresa.
O Terminal-Bench avalia agentes que executam tarefas em ambientes de linha de comando. Ele está mais próximo do trabalho real de desenvolvimento de software do que um teste estático de múltipla escolha, mas o ambiente de execução influencia os resultados.
O Flash 0731 também marcou 54,2 no NL2Repo, segundo a DeepSeek. A prévia obteve 39,4, enquanto a prévia maior do Pro marcou 38,5.
No CyberGym, a DeepSeek relata um aumento de 38,7 para 76,7. O CyberGym avalia o comportamento de agentes relacionado à cibersegurança em ambientes controlados.
A maior mudança relatada aparece no DeepSWE. O Flash 0731 marcou 54,4, em comparação com 7,3 da prévia do Flash e 12,8 da prévia do Pro.
Esses números sugerem uma mudança substancial no desempenho de agentes de programação. Eles não isolam quanto veio do modelo, dos prompts, do orçamento de raciocínio ou do ambiente de execução.
A DeepSeek afirma ter avaliado tarefas públicas de agentes de código usando um modo mínimo do DeepSeek Harness. Esse framework ainda não foi lançado.
A empresa também utilizou esforço máximo de raciocínio com uma configuração de amostragem especificada. Outros provedores podem produzir resultados diferentes com orçamentos de raciocínio menores ou esquemas de ferramentas distintos.
Duas avaliações adicionais, DSBench-FullStack e DSBench-Hard, são conjuntos de testes internos da DeepSeek. Pesquisadores externos não conseguem atualmente inspecionar sua composição completa nem reproduzir suas pontuações de forma independente.
A DeepSeek informa 68,7 no conjunto full-stack e 59,6 no conjunto difícil. Ambos os números superam os resultados da prévia por ampla margem.
Benchmarks internos não são automaticamente inválidos. Eles podem testar comportamentos difíceis que rankings públicos deixam de fora.
A limitação é a transparência. Os leitores não conseguem avaliar contaminação, seleção de tarefas, consistência da correção ou sensibilidade à configuração de agente preferida pela empresa.
A Artificial Analysis oferece um contraponto independente valioso. Sua pontuação de 50 confirma que a melhora não é visível apenas nas tabelas da própria DeepSeek.
Ainda assim, esse índice também é agregado. Um modelo pode ganhar pontos ao melhorar em tarefas que não correspondem ao fluxo de trabalho real de uma equipe.
As primeiras reações de usuários ilustram essa diferença. Alguns desenvolvedores descrevem um comportamento mais forte em programação e pesquisa, enquanto outros relatam verbosidade ou suposições confiantes durante tarefas incompletas.
Esses relatos são anedóticos. Eles importam como hipóteses para teste, não como substituto para uma avaliação controlada.
A verbosidade merece atenção especial em sistemas de agentes. Um modelo que raciocina por mais tempo pode alcançar maior precisão, ao mesmo tempo em que aumenta a latência e consome mais tokens de saída.
A conclusão confiante é outro risco. Agentes frequentemente encontram campos ausentes, credenciais indisponíveis, requisitos ambíguos ou ferramentas que retornam dados incompletos.
O comportamento correto pode ser pausar e perguntar. Um modelo otimizado para continuar agindo pode, em vez disso, inventar um valor, escolher um padrão inseguro ou enviar uma operação irreversível.
Portanto, as equipes devem testar mais do que a precisão da resposta final. As avaliações devem medir chamadas de ferramentas desnecessárias, recuperação após erros, estado fabricado, tratamento de permissões e comportamento de interrupção.
Os testes de segurança também são essenciais. Pesos abertos dão mais controle aos defensores, mas não garantem resistência à injeção de prompt ou ao uso inseguro de ferramentas.
A conclusão correta não é que as alegações de benchmark da DeepSeek estejam erradas. As evidências sustentam uma melhoria significativa, enquanto a dimensão dessa melhoria continua dependente da carga de trabalho.
Pesos Abertos Transformam o Resultado do Benchmark em uma Questão de Implantação
O lançamento sob a licença MIT permite que desenvolvedores testem as alegações da DeepSeek em sua própria infraestrutura, o que torna o 0731 mais relevante do que uma entrada de ranking limitada a API.
Modelos fechados exigem que os usuários aceitem o ambiente de serviço do provedor, o cronograma de atualizações, os termos de retenção e a disponibilidade regional. Pesos abertos criam mais opções de implantação.
Uma empresa pode hospedar o Flash 0731 dentro de seu próprio perímetro de segurança. Também pode restringir o acesso à rede, registrar chamadas de ferramentas e aplicar regras de aprovação específicas da organização.
Esses controles são importantes para agentes de programação. Um modelo capaz pode ler arquivos de código-fonte, executar comandos, modificar repositórios ou acessar documentação interna.
A auto-hospedagem não elimina o risco operacional. Ela transfere mais responsabilidade para a organização que executa o modelo.
As equipes precisam atualizar o software de inferência, proteger endpoints, gerenciar credenciais e monitorar as ações geradas. Também precisam de memória de aceleradores e largura de banda suficientes para o checkpoint completo.
O tamanho de 167GB do repositório é apenas um ponto de partida. A memória em tempo de execução também inclui caches, ativações temporárias, sobrecarga do servidor e o comprimento de contexto escolhido.
O cache de chave-valor armazena as informações necessárias para gerar tokens posteriores sem recalcular todo o histórico. Contextos muito longos podem tornar esse cache um grande consumidor de memória.
A DeepSeek recomenda suporte a cache FP8 em seu exemplo com vLLM. Também utiliza paralelismo de especialistas, que distribui especialistas de MoE entre vários aceleradores.
Essa configuração evidencia a troca envolvida. Apenas 13 bilhões de parâmetros são ativados por token, mas o conjunto completo de especialistas ainda precisa de acesso coordenado.
O uso da API em nuvem continua mais simples para muitas equipes. O endpoint do modelo da DeepSeek disponibiliza o Flash por meio de seu serviço existente, evitando conversão de pesos e gerenciamento de clusters.
A API agora oferece suporte tanto a solicitações conhecidas de conclusão de chat quanto ao formato Responses API. Interfaces no estilo Responses ajudam a coordenar ferramentas, estado e saídas de várias etapas em aplicações de agentes.
A conveniência da API cria questões separadas sobre tratamento de dados, disponibilidade do serviço e conformidade regional. Compradores devem avaliar esses aspectos independentemente da qualidade dos benchmarks.
A implantação aberta oferece uma alternativa quando essas restrições são inaceitáveis. Ela também torna mais fácil fixar o comportamento do modelo em um checkpoint específico.
Esse controle de versão é importante porque identificadores hospedados podem mudar por baixo de uma aplicação. A DeepSeek atualizou o identificador existente do Flash para apontar para o 0731.
Uma melhoria silenciosa de capacidade parece útil, mas equipes de produção precisam de testes de regressão. Um raciocínio mais forte ainda pode alterar formatação, escolha de ferramentas, latência ou comportamento de recusa.
Usuários que hospedam o modelo podem manter os checkpoints da prévia e do 0731 lado a lado. Eles podem comparar ambos os modelos com prompts idênticos antes da migração.
A licença MIT também permite adaptações especializadas. Organizações podem ajustar o modelo para convenções internas de código, fluxos de trabalho estruturados ou domínios profissionais restritos.
O ajuste fino introduz sua própria carga de validação. Melhorias em tarefas familiares podem reduzir a generalidade ou enfraquecer o comportamento de segurança em outros contextos.
Portanto, o lançamento amplia o controle em vez de eliminar as trocas envolvidas. Desenvolvedores ganham a capacidade de verificar, modificar e servir o modelo, assumindo ao mesmo tempo mais responsabilidade técnica.
Para compradores corporativos, esse controle pode ser decisivo. Para equipes menores, a API oficial ou um provedor de hospedagem confiável continuará sendo a rota mais prática.
De qualquer forma, pesos abertos transformam uma pontuação abstrata em um artefato testável. Concorrentes precisam responder com acesso comparável, vantagens mais claras ou evidências mais fortes de confiabilidade.
Três Sinais Decidirão se o 0731 Manterá Sua Posição
Testes independentes de agentes, comportamento de tokens em produção e respostas dos concorrentes determinarão se o DeepSeek Flash 0731 representa uma mudança duradoura.
O primeiro sinal é a reprodução em ambientes neutros de agentes. Pesquisadores precisam executar o Flash 0731 no Terminal-Bench, em tarefas de repositório e em suítes de uso de ferramentas sem o framework não lançado da DeepSeek.
Reproduzir os números da empresa fortaleceria a alegação de que o pós-treinamento transformou o próprio modelo. Uma grande queda mostraria que o ambiente de execução sustentava uma parcela maior da melhoria.
Os testes devem publicar prompts, definições de ferramentas, configurações de raciocínio, políticas de repetição e procedimentos de avaliação. Pontuações de agentes são difíceis de interpretar quando esses controles permanecem ocultos.
O segundo sinal é a eficiência em produção. As equipes devem medir tarefas concluídas por hora, total de tokens gerados, recuperação de erros e intervenção humana.
Uma pontuação de inteligência de 50 terá menos importância se o modelo exigir rastros de raciocínio incomumente longos. Terá mais importância se o Flash concluir o trabalho com menos recursos do que concorrentes maiores.
Desenvolvedores também devem acompanhar suposições sem suporte. Um agente rápido que fabrica informações ausentes pode impor mais trabalho de revisão do que um modelo mais lento que pede esclarecimentos.
A latência precisa de medição separada em contextos curtos e longos. Roteamento MoE, crescimento de cache e decodificação especulativa podem se comportar de forma diferente à medida que o histórico de um agente se expande.
O terceiro sinal é a resposta de desenvolvedores de modelos abertos concorrentes. Zhipu AI, Moonshot AI, Alibaba e outros laboratórios agora enfrentam pressão para melhorar modelos menores focados em agentes.
Uma resposta direta pode vir por meio de pós-treinamento mais forte, inferência mais eficiente, lançamentos mais amplos de pesos ou avaliações de agentes verificadas de forma independente.
Se os concorrentes precisarem de modelos ativos substancialmente maiores para recuperar a liderança, o argumento de eficiência da DeepSeek se fortalece. Se um rival menor ultrapassar rapidamente o 0731, a pontuação parecerá temporária.
Provedores proprietários também continuam sendo um contexto relevante. Seus melhores modelos ainda lideram algumas avaliações complexas de programação e agentes, incluindo diversas comparações publicadas pela DeepSeek.
A rota aberta não precisa vencer todos os benchmarks. Ela precisa se tornar confiável o suficiente para que controle e flexibilidade de implantação superem a lacuna de qualidade restante.
Nos próximos três meses, compradores devem evitar tratar uma única classificação como uma decisão de aquisição. Devem criar avaliações a partir de repositórios, ferramentas, permissões e condições de falha reais.
Use tarefas com respostas conhecidas, mas inclua também casos ambíguos. Meça se o agente reconhece informações ausentes e para antes de tomar uma ação insegura.
Registre cada versão de modelo e configuração de execução. O mesmo nome de modelo público pode apontar para um checkpoint hospedado alterado, enquanto quantizações locais podem produzir comportamentos diferentes.
O DeepSeek Flash 0731 conquistou atenção séria porque testes independentes sustentam uma grande melhoria. Seus pesos abertos tornam possível uma verificação mais profunda, em vez de apenas teórica.
O próximo passo cabe a desenvolvedores e avaliadores. Teste o modelo em seu fluxo de trabalho repetível mais difícil, compare resultados concluídos e publique detalhes suficientes para que outros reproduzam o resultado.
Se esses testes confirmarem sua posição nos benchmarks, modelos abertos menores com menos parâmetros ativos se tornarão uma opção padrão crível para muitos sistemas de agentes. Caso contrário, o 0731 continuará sendo uma pontuação marcante com uma história de implantação mais restrita.


