Semua artikel
TI & Teknologi

Magnitude: Mesin Inferensi yang Mengkompilasi Sendiri yang Menyesuaikan Kernel dengan Perangkat Keras Anda

Magnitude mengkompilasi dan mengoptimalkan kernel pada perangkat Anda sebelum menjalankan model, klaim hingga 2x lebih cepat dibanding llama.cpp pada Apple Silicon dan GPU NVIDIA. Inilah yang perlu diketahui para pengembang.

  • #local-llm
  • #inference-engine
  • #ai-agents
  • #open-source
  • #performance-optimization

Batch Summer 2025 Y Combinator menghasilkan Magnitude, mesin inferensi open-source yang mengadopsi pendekatan berbeda untuk performa model lokal. Alih-alih mengirimkan kernel yang sudah dikompilasi untuk kategori perangkat luas, Magnitude mengkompilasi dan menyesuaikan kernelnya pada perangkat Anda sebelum model berjalan. Proyek melaporkan throughput hingga 2x lebih tinggi dibanding llama.cpp — decode 92% lebih cepat pada Apple Metal dan 19% lebih cepat pada NVIDIA CUDA dalam benchmarknya — sekaligus menggunakan memori per sesi agent yang kurang 27% [1][2].

Mesin ini dikirim sebagai aplikasi desktop untuk macOS, Linux, dan Windows dengan CLI yang dibundel. Ia terhubung ke agen kode populer termasuk Pi, OpenCode, Hermes, Codex, dan Claude Code dengan satu klik, dan mengekspos API kompatibel OpenAI untuk semua hal lain [2][6].

Bagaimana kompilasi kernel pada perangkat mengubah persamaan performa

Sebagian besar mesin inferensi lokal — llama.cpp, Ollama, LM Studio — mendistribusikan kernel yang sudah dibangun sebelumnya yang dioptimalkan untuk keluarga perangkat luas (misalnya, “Apple Silicon” atau “NVIDIA Ampere”). Magnitude justru mengkompilasi kernel pada mesin target saat pertama kali dijalankan, lalu menyimpan biner yang sudah diatur untuk peluncuran berikutnya [1][2]. Ini berarti instruksi kernel cocok dengan revisi chip, subsistem memori, dan versi driver Anda secara tepat, bukan target yang merupakan penyebut umum terendah.

Proyek menerbitkan benchmark untuk Qwen 3.6 35B A3B dengan kuantisasi 4-bit dan konteks 64k: pada M4 Pro 48 GB, decode meningkat dari 30 menjadi 57 token per detik (92% lebih cepat); pada DGX Spark, decode berubah dari 49 menjadi 58 tok/s (19% lebih cepat) [6]. Prefill juga meningkat — 9% pada Metal, 23% pada CUDA. Angka ini berasal dari uji coba internal proyek; reproduksi independen masih dalam tahap awal.

Apa artinya ini untuk memori dan konkurensi

Magnitude melaporkan penggunaan memori per agent berkurang 27% dan membebaskan memori tersebut ketika agent berhenti [2][6]. Sesi simultan membagikan cache prefiks, yang menurut proyek mencegah penurunan performa yang biasanya muncul ketika beberapa agent menyimpan cache KV besar sekaligus [2]. Untuk pengembang yang menjalankan beberapa agent kode berdampingan — pola umum ketika satu agent menulis tes sementara agent lain melakukan refaktorisasi — desain cache bersama ini bisa mengurangi tekanan VRAM pada mesin dengan kapasitas 24–48 GB.

Dukungan perangkat keras dan model dalam praktik

Mesin ini berjalan di setiap Mac Apple Silicon, GPU NVIDIA, GPU AMD, atau sistem hanya CPU di macOS, Linux, dan Windows [2][6]. Tidak ada spesifikasi minimum yang tetap; mesin yang lebih kecil menjalankan model yang lebih kecil, dan lebih banyak memori memungkinkan model yang lebih besar [6]. Kernel yang dioptimasi ada untuk keluarga berat terbuka populer (Qwen, Llama, Mistral, dan yang lain yang tercantum di magnitude.dev/models) [6]. Proyek menulis kernel yang dioptimasi secara manual untuk keluarga ini, bukan hanya bergantung pada auto-tuning, yang merupakan cara mereka mengklaikan mengalahkan mesin umum [6].

Mengintegrasikan dengan alur kerja agen Anda saat ini

Penggunaan dirancang agar memiliki friksi rendah. Aplikasi desktop menyertakan panel “Connections” yang mendeteksi agen yang terinstal (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) dan menghubungkannya dengan satu klik [2][6]. Hal lain bekerja melalui endpoint API kompatibel OpenAI yang diekspos secara lokal oleh aplikasi [6]. Tidak diperlukan server Ollama terpisah atau runtime inferensi — Magnitude mendownload, mengonfigurasi, memuat, dan menjalankan model dalam prosesnya sendiri [8].

Kompromi dan pertanyaan terbuka

Diskusi di Hacker News mengungkapkan beberapa poin yang layak dipertimbangkan [7]. Pertama, klaim kecepatan proyek diukur pada decode single-stream; beban kerja agen yang melibatkan loop penggunaan alat yang bursty mengubah distribusi token dan mungkin memindahkan bottleneck ke manajemen cache KV atau kualitas dekoding spekulatif. Kedua, kernel Metal llama.cpp sudah menyaturasi bandwidth memori pada banyak Mac, sehingga peningkatan decode 92% pada Metal memerlukan verifikasi independen di seluruh ukuran model dan tingkat kuantisasi. Ketiga, angka kecepatan yang diperkirakan oleh UI telah diperketat akurasinya untuk panjang konteks yang lebih rendah. Terakhir, mesin ini baru (diluncurkan 30 September 2026) — kematangan ekosistem, cakupan model, dan pemeliharaan jangka panjang belum terbukti dibandingkan dengan tahun-tahun pengakum komunitas llama.cpp.

Apakah Anda seharusnya mencobanya hari ini?

Jika Anda mengembangkan secara lokal dengan agen kode pada perangkat Apple Silicon atau NVIDIA dan mengalami batas memori atau latensi, Magnitude layak dievaluasi selama akhir pekan. Lisensi Apache 2.0, biaya token nol, dan eksekusi yang sepenuhnya pribadi (tidak ada yang meninggalkan mesin Anda setelah unduhan model) menurunkan risiko pengujian [2][6]. Unduh aplikasi desktop, hubungkan agen yang sudah ada, dan jalankan beban kerja aktual Anda — benchmark sintetis jarang mencerminkan pola token agen. Pantau penggunaan VRAM ketika Anda menjalankan dua atau tiga sesi simultan; cache prefiks bersama adalah fitur yang paling mungkin mengubah alur kerja harian.

Inti keyakinan Magnitude — bahwa kompilasi kernel pada perangkat mengalahkan generalitas yang sudah dibangun — adalah prinsip yang solid. Apakah ia memberikan kemenangan konsisten di seluruh ekor panjang model, skema kuantisasi, dan pola penggunaan alat agen adalah yang akan ditentukan oleh pengujian komunitas selama enam bulan ke depan.

Sources

  1. Magnitude (YC S25) Meluncurkan Mesin Inferensi yang Mengkompilasi Sendiri, Klaim 92% …
  2. GitHub - magnitudedev/magnitude: Mesin inferensi open-source untuk …
  3. Jalankan model terbuka terbaik untuk mesin Anda | Magnitude
  4. Inferensi Lokal - Magnitude
  5. Mesin yang dioptimasi sendiri Magnitude berjalan · Hacker News | Zeli
  6. Magnitude (YC S25) Membuka Sumber Mesin Inferensi… · AGI Hunt
  7. Peluncuran HN: Magnitude (YC S25) - Mesin inferensi yang dioptimasi sendiri untuk a
  8. Magnitude: Server inferensi open-source untuk model lokal | Y Combinator
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,003 words 5 min read 8 sources
Diterbitkan oleh

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , nemotron-3-super-120b-a12b
Publication workflow
Pipeline v1