Rilis DeepSeek V4 Pro 0813 menandai transisi model unggulan perusahaan ini dari fase pratinjau selama empat bulan menjadi ketersediaan umum (general availability) [4]. Versi ini menstandarisasi endpoint API dan memberikan fondasi yang stabil untuk lingkungan produksi [S4, S5].
Apa yang berubah dalam rilis 0813?
Build 0813 berfungsi sebagai versi produksi resmi, menggantikan iterasi pratinjau sebelumnya [4]. Jika build pratinjau memungkinkan eksperimen dini dengan open weights, rilis GA berfokus pada stabilitas API dan konsistensi performa [S4, S5].
DeepSeek telah memperbarui dokumentasinya untuk mencerminkan versi ini sebagai backend untuk endpoint Pro resmi [4]. Bagi tim yang mengintegrasikan model ini, perubahan tersebut berarti beralih dari routing khusus pratinjau ke build 0813 untuk memastikan perilaku dan dukungan yang dapat diprediksi [4].
Bagaimana arsitekturnya memengaruhi efisiensi?
DeepSeek V4 Pro menggunakan arsitektur mixture-of-experts, yang memiliki total 1,6 triliun parameter dan 49 miliar parameter aktif per token [S4, S8]. Untuk mengelola beban komputasi dari jendela konteks satu juta token, model ini menggunakan mekanisme attention hybrid [S4, S7].
Mekanisme ini menggabungkan Compressed Sparse Attention dan Heavily Compressed Attention [S4, S7]. Teknik-teknik ini dirancang untuk mengurangi komputasi inferensi single-token menjadi 27 persen dan KV cache menjadi 10 persen dari persyaratan yang terlihat pada generasi V3.2 [S4, S7].
Memilih di antara mode penalaran
API ini menyediakan tiga mode operasi: non-thinking, high reasoning effort, dan max effort [S4, S8]. Mode-mode ini memungkinkan pengembang untuk menyeimbangkan kecepatan dengan kedalaman penalaran tergantung pada kebutuhan tugas spesifik [8].
Mode non-thinking dioptimalkan untuk jawaban cepat dan intuitif, sehingga cocok untuk antarmuka percakapan standar [8]. Sebaliknya, mode max effort ditujukan untuk masalah kompleks, seperti yang ditemukan dalam benchmark coding atau verifikasi logika multi-langkah, di mana model memerlukan lebih banyak waktu untuk memproses input [S4, S8].
Pertimbangan penyebaran dan ekonomi
Untuk perencanaan produksi, model ini mendukung jendela konteks satu juta token [S4, S7]. Struktur harga untuk endpoint Pro adalah $0,435 per satu juta token input pada cache miss, yang turun menjadi $0,003625 per satu juta token pada cache hit [4].
Token output dihargai sebesar $0,87 per satu juta [4]. Saat melakukan penyebaran, tim harus memperhitungkan batas konkurensi sebesar 500 untuk endpoint Pro, yang berbeda dari batas yang diterapkan pada varian Flash [4].
Pengembang dapat mengakses model melalui permintaan API standar, dengan dukungan untuk format OpenAI ChatCompletions dan Anthropic Messages [4]. Selain itu, penyebaran lokal didukung melalui alat seperti vLLM dan SGLang, yang memungkinkan eksekusi on-premise atau cloud-hosted [S2, S4]. Jika Anda membangun alur kerja agentic, pertimbangkan untuk melakukan benchmarking kasus penggunaan spesifik Anda terhadap performa model pada SWE-bench Verified, di mana model ini telah menunjukkan resolusi sebesar 80,6 persen [S4, S8].
Sumber
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion