Semua artikel
TI & Teknologi

Menjelajahi Rilis DeepSeek V4 Pro 0813

Tinjauan teknis mengenai rilis ketersediaan umum (GA) DeepSeek V4 Pro 0813, yang mencakup efisiensi arsitektur, mode penalaran, dan ekonomi penyebaran.

  • #ai-models
  • #deepseek
  • #machine-learning
  • #api-development
navigating-deepseek-v4-pro-0813

Rilis DeepSeek V4 Pro 0813 menandai transisi model unggulan perusahaan ini dari fase pratinjau selama empat bulan menjadi ketersediaan umum (general availability) [4]. Versi ini menstandarisasi endpoint API dan memberikan fondasi yang stabil untuk lingkungan produksi [S4, S5].

Apa yang berubah dalam rilis 0813?

Build 0813 berfungsi sebagai versi produksi resmi, menggantikan iterasi pratinjau sebelumnya [4]. Jika build pratinjau memungkinkan eksperimen dini dengan open weights, rilis GA berfokus pada stabilitas API dan konsistensi performa [S4, S5].

DeepSeek telah memperbarui dokumentasinya untuk mencerminkan versi ini sebagai backend untuk endpoint Pro resmi [4]. Bagi tim yang mengintegrasikan model ini, perubahan tersebut berarti beralih dari routing khusus pratinjau ke build 0813 untuk memastikan perilaku dan dukungan yang dapat diprediksi [4].

Bagaimana arsitekturnya memengaruhi efisiensi?

DeepSeek V4 Pro menggunakan arsitektur mixture-of-experts, yang memiliki total 1,6 triliun parameter dan 49 miliar parameter aktif per token [S4, S8]. Untuk mengelola beban komputasi dari jendela konteks satu juta token, model ini menggunakan mekanisme attention hybrid [S4, S7].

Mekanisme ini menggabungkan Compressed Sparse Attention dan Heavily Compressed Attention [S4, S7]. Teknik-teknik ini dirancang untuk mengurangi komputasi inferensi single-token menjadi 27 persen dan KV cache menjadi 10 persen dari persyaratan yang terlihat pada generasi V3.2 [S4, S7].

Memilih di antara mode penalaran

API ini menyediakan tiga mode operasi: non-thinking, high reasoning effort, dan max effort [S4, S8]. Mode-mode ini memungkinkan pengembang untuk menyeimbangkan kecepatan dengan kedalaman penalaran tergantung pada kebutuhan tugas spesifik [8].

Mode non-thinking dioptimalkan untuk jawaban cepat dan intuitif, sehingga cocok untuk antarmuka percakapan standar [8]. Sebaliknya, mode max effort ditujukan untuk masalah kompleks, seperti yang ditemukan dalam benchmark coding atau verifikasi logika multi-langkah, di mana model memerlukan lebih banyak waktu untuk memproses input [S4, S8].

Pertimbangan penyebaran dan ekonomi

Untuk perencanaan produksi, model ini mendukung jendela konteks satu juta token [S4, S7]. Struktur harga untuk endpoint Pro adalah $0,435 per satu juta token input pada cache miss, yang turun menjadi $0,003625 per satu juta token pada cache hit [4].

Token output dihargai sebesar $0,87 per satu juta [4]. Saat melakukan penyebaran, tim harus memperhitungkan batas konkurensi sebesar 500 untuk endpoint Pro, yang berbeda dari batas yang diterapkan pada varian Flash [4].

Pengembang dapat mengakses model melalui permintaan API standar, dengan dukungan untuk format OpenAI ChatCompletions dan Anthropic Messages [4]. Selain itu, penyebaran lokal didukung melalui alat seperti vLLM dan SGLang, yang memungkinkan eksekusi on-premise atau cloud-hosted [S2, S4]. Jika Anda membangun alur kerja agentic, pertimbangkan untuk melakukan benchmarking kasus penggunaan spesifik Anda terhadap performa model pada SWE-bench Verified, di mana model ini telah menunjukkan resolusi sebesar 80,6 persen [S4, S8].

Sumber

  1. DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
  2. deepseek-v4-pro - ollama.com
  3. AI Model Catalog | Microsoft Foundry Models
  4. deepseek-ai/DeepSeek-V4-Pro · Hugging Face
  5. deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
  6. DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
  7. DeepSeek
  8. DeepSeek releases official V4 Pro model as it steps up expansion
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

581 words 3 min read 8 sources
Diterbitkan oleh

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
gemini-3.1-flash-lite , gemma-4-26b-a4b-it
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1