DeepSeek V4 Pro 0813 sürümünün yayınlanması, şirketin amiral gemisi modelinin dört aylık ön izleme aşamasından genel erişim (GA) aşamasına geçişini simgeliyor [4]. Bu sürüm, API uç noktalarını standartlaştırarak üretim ortamları için istikrarlı bir temel sağlıyor [S4, S5].
0813 sürümünde neler değişti?
0813 sürümü, önceki ön izleme iterasyonlarının yerini alan resmi üretim versiyonu olarak hizmet veriyor [4]. Ön izleme sürümleri açık ağırlıklı (open weights) modellerle erken aşama deneyimlere olanak tanırken, genel erişim sürümü API kararlılığına ve performans tutarlılığına odaklanıyor [S4, S5].
DeepSeek, dokümantasyonunu bu sürümü resmi Pro uç noktasının arka planı olarak yansıtacak şekilde güncelledi [4]. Bu modeli entegre eden ekipler için bu değişim, öngörülebilir davranış ve destek sağlamak adına ön izleme odaklı yönlendirmelerden 0813 sürümüne geçiş yapılması anlamına geliyor [4].
Mimari verimliliği nasıl etkiliyor?
DeepSeek V4 Pro, toplam 1,6 trilyon parametreye ve token başına 49 milyar aktif parametreye sahip bir uzman karışımı (mixture-of-experts) mimarisi kullanıyor [S4, S8]. Bir milyon tokenlık bağlam penceresinin hesaplama yükunu yönetmek için model, hibrit bir dikkat (attention) mekanizması kullanıyor [S4, S7].
Bu mekanizma, Sıkıştırılmış Seyrek Dikkat (Compressed Sparse Attention) ve Yoğun Sıkıştırılmış Dikkat (Heavily Compressed Attention) tekniklerini birleştiriyor [S4, S7]. Bu teknikler, tek token çıkarım hesaplamasını V3.2 neslinde görülen gereksinimlerin yüzde 27’sine, KV önbelleğini (KV cache) ise yüzde 10’una düşürmek için tasarlandı [S4, S7].
Akıl yürütme modları arasında seçim yapmak
API üç çalışma modu sunuyor: düşünme içermeyen (non-thinking), yüksek akıl yürütme çabası (high reasoning effort) ve maksimum çaba (max effort) [S4, S8]. Bu modlar, geliştiricilerin belirli görev gereksinimlerine bağlı olarak hız ile akıl yürütme derinliği arasında denge kurmasına olanak tanıyor [8].
Düşünme içermeyen mod, hızlı ve sezgisel yanıtlar için optimize edilmiştir; bu da onu standart sohbet arayüzleri için uygun kılar [8]. Buna karşılık, maksimum çaba modu; kodlama benchmarkları veya çok adımlı mantıksal doğrulama gibi modelin girdiyi işlemek için daha fazla zamana ihtiyaç duyduğu karmaşık problemler için tasarlanmıştır [S4, S8].
Dağıtım ve ekonomik hususlar
Üretim planlaması için model, bir milyon tokenlık bir bağlam penceresini destekliyor [S4, S7]. Pro uç noktası için fiyatlandırma yapısı, önbellek hatası (cache miss) durumunda milyon token başına 0,435 $, önbellek eşleşmesi (cache hit) durumunda ise milyon token başına 0,003625 $’dır [4].
Çıktı tokenları milyon başına 0,87 $ olarak fiyatlandırılmıştır [4]. Dağıtım sırasında ekipler, Pro uç noktası için Flash varyantında uygulanan limitten farklı olan 500 eşzamanlılık (concurrency) sınırını hesaba katmalıdır [4].
Geliştiriciler, OpenAI ChatCompletions ve Anthropic Messages formatlarını destekleyen standart API istekleri aracılığıyla modele erişebilirler [4]. Ayrıca, vLLM ve SGLang gibi araçlar aracılığıyla yerel dağıtım desteklenmekte olup, bu da yerinde (on-premise) veya bulut tabanlı yürütmeye olanak sağlamaktadır [S2, S4]. Eğer ajan tabanlı (agentic) iş akışları oluşturuyorsanız, kendi kullanım durumunuzu modelin SWE-bench Verified üzerindeki performansı ile kıyaslamayı düşünün; model burada yüzde 80,6 çözüm oranı göstermiştir [S4, S8].
Kaynaklar
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion