Tüm makaleler
BT ve Teknoloji

Magnitude: Donanımınıza Göre Kernel Ayarlayan Kendi Kendini Derleyen Bir Çıkarım Motoru

Magnitude, modelleri çalıştırmadan önce cihazınızda kernelleri derleyip optimize ederek Apple Silicon ve NVIDIA GPU'larda llama.cpp'ye göre 2 kata kadar hız artışı vaat ediyor. İşte geliştiricilerin bilmesi gerekenler.

  • #local-llm
  • #inference-engine
  • #ai-agents
  • #open-source
  • #performance-optimization

Y Combinator’ın 2025 Yaz dönemi grubundan çıkan Magnitude, yerel model performansına farklı bir yaklaşım getiren açık kaynaklı bir çıkarım motorudur. Geniş donanım kategorileri için önceden derlenmiş kerneller sunmak yerine Magnitude, bir model çalışmadan önce kernellerini doğrudan sizin cihazınızda derler ve optimize eder. Proje, benchmark testlerinde llama.cpp’ye kıyasla 2 kata kadar daha fazla işlem kapasitesi (Apple Metal’de %92, NVIDIA CUDA’da %19 daha hızlı decode) sunarken, ajan oturumu başına %27 daha az bellek kullandığını raporluyor [1][2].

Motor; macOS, Linux ve Windows için beraberinde bir CLI (komut satırı arayüzü) ile gelen bir masaüstü uygulaması olarak sunuluyor. Pi, OpenCode, Hermes, Codex ve Claude Code gibi popüler kodlama ajanlarına tek tıkla bağlanabiliyor ve diğer tüm ihtiyaçlar için OpenAI uyumlu bir API sağlıyor [2][6].

Cihaz içi kernel derlemesi performans denklemini nasıl değiştiriyor?

llama.cpp, Ollama ve LM Studio gibi çoğu yerel çıkarım motoru, geniş donanım aileleri (örneğin “Apple Silicon” veya “NVIDIA Ampere”) için optimize edilmiş önceden oluşturulmuş kerneller dağıtır. Magnitude ise kernelleri ilk çalıştırmada hedef makinede derler ve ardından sonraki başlatmalar için optimize edilmiş binary dosyalarını önbelleğe alır [1][2]. Bu, kernel talimatlarının “en düşük ortak payda” hedefi yerine, sizin tam çip revizyonunuza, bellek alt sisteminize ve sürücü versiyonunuza tam olarak uyması anlamına gelir.

Proje, 4-bit kuantizasyon ve 64k context ile Qwen 3.6 35B A3B için benchmark sonuçları yayınlamıştır: 48 GB’lık bir M4 Pro’da decode hızı saniyede 30 tokendan 57 tokene çıkarken (%92 daha hızlı); bir DGX Spark’ta decode hızı 49 tok/s’den 58 tok/s’ye yükselmiştir (%19 daha hızlı) [6]. Prefill süreleri de iyileşmiş; Metal’de %9, CUDA’da %23 artış görülmüştür. Bu rakamlar projenin kendi test araçlarından elde edilmiştir; bağımsız doğrulamalar henüz başlangıç aşamasındadır.

Bellek ve eşzamanlılık için ne anlama geliyor?

Magnitude, ajan başına %27 daha az bellek kullandığını ve bir ajan durduğunda bu belleği serbest bıraktığını belirtiyor [2][6]. Eşzamanlı oturumlar prefix önbelleklerini paylaşır; proje, bu sayede birden fazla ajanın aynı anda büyük KV önbellekleri tuttuğunda ortaya çıkan tipik yavaşlamanın önüne geçildiğini ifade ediyor [2]. Bir ajanın testler yazdığı, diğerinin ise kodu yeniden yapılandırdığı yaygın senaryolarda, yan yana birkaç kodlama ajanı çalıştıran geliştiriciler için bu paylaşımlı önbellek tasarımı, 24–48 GB’lık makinelerdeki VRAM baskısını azaltabilir.

Pratik donanım ve model desteği

Motor; macOS, Linux ve Windows üzerinde herhangi bir Apple Silicon Mac, NVIDIA GPU, AMD GPU veya yalnızca CPU tabanlı sistemde çalışır [2][6]. Sabit bir minimum sistem gereksinimi yoktur; küçük makineler küçük modelleri çalıştırır, daha fazla bellek ise daha büyük modellerin çalışmasına olanak tanır [6]. Popüler açık ağırlıklı model aileleri (Qwen, Llama, Mistral ve magnitude.dev/models adresinde listelenen diğerleri) için optimize edilmiş kerneller mevcuttur [6]. Proje, genel amaçlı motorları geride bırakmak için yalnızca otomatik ayarlamaya güvenmek yerine, bu aileler için elle optimize edilmiş kerneller yazmaktadır [6].

Mevcut ajan iş akışınıza entegrasyon

Kullanıma geçiş süreci düşük sürtünmeli olacak şekilde tasarlanmıştır. Masaüstü uygulaması, yüklü ajanları (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) tespit eden ve onları tek tıkla bağlayan bir “Connections” (Bağlantılar) paneli içerir [2][6]. Diğer her şey, uygulamanın yerel olarak sunduğu OpenAI uyumlu API uç noktası üzerinden çalışır [6]. Ayrı bir Ollama sunucusuna veya çıkarım çalışma zamanına (runtime) gerek yoktur; Magnitude modelleri kendi işlemi içinde indirir, yapılandırır, yükler ve çalıştırır [8].

Ödünleşimler ve açık sorular

Hacker News tartışmaları, değerlendirilmesi gereken birkaç noktayı ortaya çıkardı [7]. Birincisi, projenin hız iddiaları tek akışlı (single-stream) decode üzerinden ölçülmüştür; gerçek ajan iş yükleri, token dağılımını değiştiren ve darboğazı KV önbellek yönetimine veya spekülatif decode kalitesine kaydırabilen anlık araç kullanım döngülerini içerir. İkincisi, llama.cpp’nin Metal kernelleri zaten birçok Mac’te bellek bant genişliğini doyurmaktadır; bu nedenle Metal’deki %92’lik decode iyileştirmesinin farklı model boyutları ve kuantizasyon seviyelerinde bağımsız olarak doğrulanması gerekir. Üçüncüsü, kullanıcı arayüzündeki tahmini hız rakamlarının düşük context uzunluklarındaki doğruluğu sorgulanmıştır. Son olarak, motor oldukça yenidir (30 Eylül 2026’da piyasaya sürülmüştür); ekosistem olgunluğu, model kapsamı ve uzun vadeli bakım, llama.cpp’nin yıllar süren topluluk deneyimiyle kıyaslandığında henüz kanıtlanmamıştır.

Bugün denemeli misiniz?

Apple Silicon veya NVIDIA donanımı üzerinde yerel kodlama ajanlarıyla geliştirme yapıyorsanız ve bellek veya gecikme sınırlarına takılıyorsanız, Magnitude bir hafta sonu değerlendirmesine değer. Apache 2.0 lisansı, sıfır token maliyeti ve tamamen gizli yürütme (model indirme sonrası hiçbir veri makinenizden çıkmaz), test riskini azaltmaktadır [2][6]. Masaüstü uygulamasını indirin, mevcut ajanınızı bağlayın ve gerçek iş yükünüzü çalıştırın; sentetik benchmarklar nadiren ajan tabanlı token kalıplarını yansıtır. İki veya üç eşzamanlı oturum çalıştırdığınızda VRAM kullanımını gözlemleyin; paylaşımlı prefix önbelleği, günlük iş akışlarını değiştirme potansiyeli en yüksek olan özelliktir.

Magnitude’un temel iddiası —cihaz içi kernel derlemesinin önceden oluşturulmuş genel yapılardan daha iyi olduğu— prensipte mantıklıdır. Bunun, modellerin, kuantizasyon şemalarının ve ajan araç kullanım kalıplarının geniş yelpazesinde tutarlı kazanımlar sağlayıp sağlamayacağını önümüzdeki altı aylık topluluk testleri belirleyecektir.

Kaynaklar

  1. Magnitude (YC S25) Launches Self-Compiling Inference Engine, Claims 92% …
  2. GitHub - magnitudedev/magnitude: Open source inference engine for …
  3. Run the best open models for your machine | Magnitude
  4. Local Inference - Magnitude
  5. Magnitude’s self-optimizing engine runs · Hacker News | Zeli
  6. Magnitude (YC S25) Open-Sources Inference Engine… · AGI Hunt
  7. Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for a
  8. Magnitude: Open source inference server for local models | Y Combinator
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,286 words 6 min read 8 sources
Yayınlayan

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , gemma-4-31b-it
Publication workflow
Pipeline v1