O DeepSeek-V4-Flash-0731, versão oficial do modelo focado em agentes da DeepSeek, acaba de aparecer no Hugging Face com pesos sob licença MIT e suporte a inferência em larga escala.

Adicione ao Google Notícias
Neste artigo
  1. O que muda com o DeepSeek-V4-Flash-0731 no Hugging Face?
  2. Como usar o DeepSeek-V4-Flash-0731: encoding, reasoning e vLLM
  3. DeepSeek-V4-Flash-0731 em GGUF e o efeito no mercado de modelos

Na prática, o DeepSeek-V4-Flash-0731 entra no lugar do antigo DeepSeek-V4-Flash (Preview), preserva a mesma estrutura do DeepSeek-V4-Flash-DSpark — com módulo de speculative decoding integrado — e, de acordo com a DeepSeek, supera o DeepSeek-V4-Pro (Preview) em uma bateria de benchmarks de tarefas agenticas, mesmo ativando bem menos parâmetros por token.

O que muda com o DeepSeek-V4-Flash-0731 no Hugging Face?

O repositório deepseek-ai/DeepSeek-V4-Flash-0731 traz o modelo já encaixado no ecossistema Transformers, com tag de geração de texto, arquivos em safetensors e variantes que incluem precisões 8-bit e FP8. O projeto aparece como compatível com Inference Endpoints do Hugging Face e licenciado sob MIT, o que libera uso comercial e self-hosted sem a burocracia típica de licença customizada.

A DeepSeek informa que o DeepSeek-V4-Flash-0731 registra resultados superiores ao DeepSeek-V4-Pro (Preview) em benchmarks como Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon-Verified, Agents' Last Exam, AutomationBench Public, além dos conjuntos internos DSBench-FullStack e DSBench-Hard. Em Terminal Bench 2.1, por exemplo, o modelo marca 82,7 pontos, contra 61,8 da versão Flash em preview e 72,1 do V4-Pro (Preview). Em Cybergym, a diferença fica ainda maior: 76,7 pontos frente a 38,7 do Flash (Preview) e 52,7 do Pro (Preview).

Para quem roda agente de código, os números internos da DSBench colocam o 0731 como salto geracional em relação aos builds anteriores da própria DeepSeek. O DSBench-FullStack sobe de 37,0 (Flash Preview) e 41,8 (Pro Preview) para 68,7 pontos na versão 0731, enquanto o DSBench-Hard salta de 25,8 e 31,1 para 59,6. Mesma arquitetura, outro patamar de comportamento depois do pós-treinamento.

Como usar o DeepSeek-V4-Flash-0731: encoding, reasoning e vLLM

Quem esperava um chat template padrão Jinja recebe um caminho diferente. A DeepSeek optou por não incluir o template tradicional e, em vez disso, publica um diretório de encoding com scripts em Python detalhando como serializar mensagens no formato compatível com a API da OpenAI e depois parsear a resposta do modelo. A indicação é usar a função encode_messages, definindo o parâmetro thinking_mode="thinking" e o novo reasoning_effort, que agora aceita três níveis: low, high e max.

O fluxo é direto: você monta uma lista de mensagens com papéis user e assistant, inclui um campo opcional reasoning_content, gera uma string de prompt com encode_messages() e passa o resultado para um AutoTokenizer do Transformers. A DeepSeek recomenda temperatura 1,0, com top_p = 0,95 para cenários agenticos e top_p = 1,0 nos demais casos. Para níveis high e max de esforço de raciocínio, o teto sugerido de saída é bem alto: até 384 mil tokens, alinhado com o discurso de “contexto de um milhão de tokens” descrito no paper referenciado (arXiv:2606.19348).

Para servir o modelo com vLLM, o repositório oficial detalha o procedimento: basta adicionar a flag --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ao comando, o que ativa o módulo DSpark de speculative decoding. O exemplo parte de um nó com quatro GPUs GB300, ativa expert parallelism, cache KV em FP8 e um block-size de 256, junto com um backend específico para MoE (--moe-backend deep_gemm_mega_moe) e otimizações de atenção com índice em FP4. É configuração montada para quem já roda vLLM em produção com carga pesada.

Para uso local, a DeepSeek indica uma pasta de inference com scripts de conversão de pesos e demos interativas. O recado implícito: este V4-Flash nasce com expectativa de ir para trás de agente, IDE e trilha de automação real, não de ficar restrito a experimento de laboratório.

DeepSeek-V4-Flash-0731 em GGUF e o efeito no mercado de modelos

Quem prefere rodar tudo em CPU, GPU menor ou no ecossistema llama.cpp não fica excluído. O modelo já aparece também no Hugging Face em versão GGUF pela organização unsloth, no repositório unsloth/DeepSeek-V4-Flash-0731-GGUF, com um template próprio bastante detalhado para raciocínio profundo, integração com ferramentas e controle fino de esforço de pensamento.

Modelo DeepSeek-V4-Flash-0731 carregado dentro do ambiente Unsloth Studio
DeepSeek-V4-Flash-0731 em versão GGUF no Unsloth Studio, voltado para inferência otimizada (Imagem: reprodução/huggingface.co)

Esse template consolida o posicionamento do V4-Flash-0731 como modelo voltado a agentes: ele traz seções extensas sobre uso de ferramentas, esquema de resposta estruturado e regras rígidas para como o modelo deve escrever o raciocínio em blocos <think>...</think> antes de chamar tools ou responder ao usuário. Para quem monta infraestrutura de agentes complexos, isso reduz o trabalho de costurar prompt manualmente em cada projeto.

No plano competitivo, a própria DeepSeek descreve o V4-Flash-0731 como “amplamente competitivo com os modelos proprietários mais fortes disponíveis” em tarefas agenticas, declaração que bate com os números de Terminal Bench 2.1 (82,7 pontos) e com o desempenho em bancadas como Cybergym (76,7) e Toolathlon-Verified (70,3). Em NL2Repo e DeepSWE, que medem habilidades de engenharia de software mais profundas, o modelo marca 54,2 e 54,4 pontos, respectivamente — valores que empurram a discussão de modelos abertos para cima e colocam pressão em quem ainda vende agente de código caro com licença fechada.

O detalhe incômodo para os concorrentes é que tudo isso aparece em pacote de pesos MIT publicado num hub público, com quantizações pipocando pela comunidade quase em tempo real. Cada build como o DeepSeek-V4-Flash-0731 que chega ao Hugging Face encurta o espaço para laboratório fechado justificar preço alto em workload de agente — enquanto a própria DeepSeek ainda não liberou a versão oficial do V4-Pro.

Detalhes técnicos do repositório DeepSeek-V4-Flash-0731 no Hugging Face
Página técnica do DeepSeek-V4-Flash-0731 no Hugging Face com tags de benchmark e licença MIT (Imagem: reprodução/huggingface.co)
Listagem de modelos da organização DeepSeek no Hugging Face
Organização DeepSeek com seus modelos públicos no Hugging Face (Imagem: reprodução/huggingface.co)