O lançamento do DeepSeek V4 Pro 0813 marca a transição do modelo principal da empresa de uma fase de prévia de quatro meses para a disponibilidade geral [4]. Esta versão padroniza os endpoints da API e fornece uma base estável para ambientes de produção [S4, S5].
O que mudou no lançamento 0813?
A build 0813 serve como a versão oficial de produção, substituindo as iterações de prévia anteriores [4]. Enquanto as builds de prévia permitiam experimentação precoce com pesos abertos (open weights), o lançamento GA foca na estabilidade da API e na consistência de desempenho [S4, S5].
A DeepSeek atualizou sua documentação para refletir esta versão como o backend para o endpoint Pro oficial [4]. Para equipes que integram este modelo, a mudança significa migrar do roteamento específico de prévia para a build 0813, a fim de garantir um comportamento e suporte previsíveis [4].
Como a arquitetura impacta a eficiência?
O DeepSeek V4 Pro utiliza uma arquitetura de mistura de especialistas (mixture-of-experts), apresentando um total de 1,6 trilhão de parâmetros e 49 bilhões de parâmetros ativos por token [S4, S8]. Para gerenciar a carga computacional de uma janela de contexto de um milhão de tokens, o modelo emprega um mecanismo de atenção híbrido [S4, S7].
Este mecanismo combina Compressed Sparse Attention e Heavily Compressed Attention [S4, S7]. Essas técnicas foram projetadas para reduzir o processamento de inferência de um único token para 27% e o cache KV para 10% dos requisitos observados na geração V3.2 [S4, S7].
Escolhendo entre modos de raciocínio
A API expõe três modos de operação: non-thinking (sem raciocínio), high reasoning effort (alto esforço de raciocínio) e max effort (esforço máximo) [S4, S8]. Esses modos permitem que os desenvolvedores equilibrem velocidade versus profundidade de raciocínio, dependendo dos requisitos específicos da tarefa [8].
O modo non-thinking é otimizado para respostas rápidas e intuitivas, tornando-o adequado para interfaces de conversação padrão [8]. Em contraste, o modo max effort é destinado a problemas complexos, como os encontrados em benchmarks de codificação ou verificação lógica de múltiplas etapas, onde o modelo requer mais tempo para processar a entrada [S4, S8].
Implantação e considerações econômicas
Para o planejamento de produção, o modelo suporta uma janela de contexto de um milhão de tokens [S4, S7]. A estrutura de preços para o endpoint Pro é de $0,435 por milhão de tokens de entrada em caso de falha de cache (cache miss), o que diminui para $0,003625 por milhão de tokens em caso de acerto de cache (cache hit) [4].
Os tokens de saída são precificados em $0,87 por milhão [4]. Ao realizar a implantação, as equipes devem considerar o limite de concorrência de 500 para o endpoint Pro, que difere do limite aplicado à variante Flash [4].
Os desenvolvedores podem acessar o modelo via requisições de API padrão, com suporte para os formatos OpenAI ChatCompletions e Anthropic Messages [4]. Além disso, a implantação local é suportada através de ferramentas como vLLM e SGLang, permitindo a execução on-premise ou em nuvem [S2, S4]. Se você estiver construindo fluxos de trabalho de agentes (agentic workflows), considere comparar seu caso de uso específico com o desempenho do modelo no SWE-bench Verified, onde ele demonstrou 80,6% de resolução [S4, S8].
Fontes
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion