La sortie de DeepSeek V4 Pro 0813 marque la transition du modèle phare de l’entreprise d’une phase de prévisualisation de quatre mois vers une disponibilité générale [4]. Cette version standardise les points de terminaison (endpoints) de l’API et fournit une base stable pour les environnements de production [S4, S5].
Qu’est-ce qui a changé dans la version 0813?
La version 0813 constitue la version de production officielle, remplaçant les précédentes itérations de prévisualisation [4]. Alors que les versions de prévisualisation permettaient une expérimentation précoce avec des poids ouverts (open weights), la version GA (General Availability) se concentre sur la stabilité de l’API et la constance des performances [S4, S5].
DeepSeek a mis à jour sa documentation pour indiquer que cette version est désormais le backend du point de terminaison Pro officiel [4]. Pour les équipes qui intègrent ce modèle, ce changement implique de passer du routage spécifique aux versions de prévisualisation vers la version 0813 afin de garantir un comportement et un support prévisibles [4].
Quel est l’impact de l’architecture sur l’efficacité?
DeepSeek V4 Pro utilise une architecture de type « Mixture-of-Experts » (mélange d’experts), comprenant un total de 1,6 billion de paramètres, dont 49 milliards de paramètres actifs par jeton (token) [S4, S8]. Pour gérer la charge de calcul d’une fenêtre de contexte d’un million de jetons, le modèle emploie un mécanisme d’attention hybride [S4, S7].
Ce mécanisme combine la « Compressed Sparse Attention » et la « Heavily Compressed Attention » [S4, S7]. Ces techniques sont conçues pour réduire le calcul d’inférence par jeton unique à 27 % et le cache KV à 10 % des exigences observées avec la génération V3.2 [S4, S7].
Choisir entre les modes de raisonnement
L’API propose trois modes de fonctionnement : non-thinking (sans réflexion), high reasoning effort (effort de raisonnement élevé) et max effort (effort maximal) [S4, S8]. Ces modes permettent aux développeurs d’équilibrer la vitesse et la profondeur du raisonnement selon les exigences spécifiques de la tâche [8].
Le mode « non-thinking » est optimisé pour des réponses rapides et intuitives, ce qui le rend idéal pour les interfaces conversationnelles standards [8]. En revanche, le mode « max effort » est destiné aux problèmes complexes, tels que ceux rencontrés dans les benchmarks de codage ou la vérification logique multi-étapes, où le modèle nécessite plus de temps pour traiter l’entrée [S4, S8].
Déploiement et considérations économiques
Pour la planification de la production, le modèle prend en charge une fenêtre de contexte d’un million de jetons [S4, S7]. La structure tarifaire pour le point de terminaison Pro est de 0,435 $ par million de jetons d’entrée en cas d’absence de cache (cache miss), ce qui descend à 0,003625 $ par million de jetons en cas de présence de cache (cache hit) [4].
Les jetons de sortie sont facturés 0,87 $ par million [4]. Lors du déploiement, les équipes doivent tenir compte de la limite de concurrence de 500 pour le point de terminaison Pro, qui diffère de la limite appliquée à la variante Flash [4].
Les développeurs peuvent accéder au modèle via des requêtes API standard, avec une prise en charge des formats OpenAI ChatCompletions et Anthropic Messages [4]. De plus, le déploiement local est pris en charge via des outils comme vLLM et SGLang, permettant une exécution sur site (on-premise) ou via le cloud [S2, S4]. Si vous construisez des workflows agentiques, pensez à comparer votre cas d’utilisation spécifique aux performances du modèle sur SWE-bench Verified, où il a démontré un taux de résolution de 80,6 % [S4, S8].
Sources
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion