Alle Artikel
IT & Technologie

Magnitude: Ein selbstkompilierender Inferenz‑Engine, der Kerne an deine Hardware anpasst

Magnitude kompiliert und optimiert Kerne auf deinem Gerät, bevor Modelle ausgeführt werden, und verspricht bis zu 2‑fache Geschwindigkeit gegenüber llama.cpp auf Apple Silicon und NVIDIA‑GPUs. Hier erfahren Entwickler, was sie wissen müssen.

  • #local-llm
  • #inference-engine
  • #ai-agents
  • #open-source
  • #performance-optimization

Wie die on-device‑Kernkompilierung die Leistungsgleichung verändert

Die meisten lokalen Inferenz‑Engines — llama.cpp, Ollama, LM Studio — verteilen vorkompilierte Kerne, die für breite Hardwarefamilien optimiert sind (z. B. „Apple Silicon“ oder „NVIDIA Ampere“). Magnitude kompiliert stattdessen Kerne auf der Zielmaschine beim ersten Start und cached dann die optimierten Binaries für nachfolgende Starts [1][2]. Damit entsprechen die Kernelanweisungen genau deiner Chip‑Revision, dem Speichersubsystem und der Treiberversion anstatt einem kleinsten gemeinsamen Nenner‑Ziel.

Das Projekt veröffentlicht Benchmarks für Qwen 3.6 35B A3B bei 4‑Bit‑Quantisierung mit 64k Kontext: Auf einem M4 Pro mit 48 GB steigt die Dekodierung von 30 auf 57 Token pro Sekunde (92 % schneller); auf einem DGX Spark erhöht sie sich von 49 auf 58 tok/s (19 % schneller) [6]. Auch das Prefill verbessert sich — 9 % bei Metal, 23 % bei CUDA. Diese Zahlen stammen aus dem eigenen Test‑Harness des Projekts; eine unabhängige Reproduktion steht noch aus.

Was das für Speicher und Konkurrenz bedeutet

Magnitude gibt an, 27 % weniger Speicher pro Agent zu verbrauchen und diesen Speicher freizugeben, wenn ein Agent stoppt [2][6]. Gleichzeitige Sitzungen teilen Prefix‑Caches, was laut Projekt das Verlangsamen verhindert, das typischerweise auftritt, wenn mehrere Agenten gleichzeitig große KV‑Caches halten [2]. Für Entwickler, die mehrere Coding‑Agenten nebeneinander ausführen — ein häufiges Muster, wenn ein Agent Tests schreibt, während ein anderer refaktort — könnte dieses Shared‑Cache‑Design den VRAM‑Druck auf 24–48 GB‑Maschinen verringern.

Hardware‑ und Modellunterstützung in der Praxis

Der Engine läuft auf jedem Apple‑Silicon‑Mac, NVIDIA‑GPU, AMD‑GPU oder reinen CPU‑System unter macOS, Linux und Windows [2][6]. Es gibt keine feste Mindestspezifikation; kleinere Maschinen führen kleinere Modelle aus, und mehr Speicher ermöglicht größere [6]. Optimierte Kerne existieren für beliebige offene Gewichts‑Familien (Qwen, Llama, Mistral und andere, die unter magnitude.dev/models aufgeführt sind) [6]. Das Projekt schreibt handoptimierte Kerne für diese Familien, anstatt sich ausschließlich auf Auto‑Tuning zu verlassen — so behauptet es, allgemeine Engines zu schlagen [6].

Integration in deinen aktuellen Agent‑Workflow

Die Einführung ist auf geringe Reibung ausgelegt. Die Desktop‑App enthält einen „Connections“-Bereich, der installierte Agenten (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) erkennt und sie mit einem Klick verknüpft [2][6]. Alles andere funktioniert über den OpenAI‑kompatiblen API‑Endpunkt, den die App lokal verfügbar macht [6]. Es wird kein separater Ollama‑Server oder Inferenz‑Runtime benötigt — Magnitude lädt, konfiguriert, lädt und führt Modelle innerhalb seines eigenen Prozesses aus [8].

Kompromisse und offene Fragen

Eine Diskussion auf Hacker News brachte mehrere Punkte ans Licht, die es wert sind, abgewogen zu werden [7]. Erstens werden die Speed‑Claims des Projekts auf Single‑Stream‑Dekodierung gemessen; reale Agenten‑Workloads beinhalten burstige Tool‑Use‑Schleifen, die die Tokenverteilung ändern und Engpässe möglicherweise in die KV‑Cache‑Verwaltung oder die Qualität spekulativer Dekodierung verlagern können. Zweitens saturieren die Metal‑Kerne von llama.cpp bereits den Speicherbandbreite auf vielen Macs, sodass eine 92 %ige Dekodierungsverbesserung auf Metal einer unabhängigen Überprüfung über verschiedene Modellgrößen und Quantisierungsstufen bedarf. Drittens wurden die im UI geschätzten Speed‑Zahlen hinsichtlich ihrer Genauigkeit bei geringeren Kontextlängen infrage gestellt. Schließlich ist die Engine neu (gestartet am 30. September 2026) — die Reife des Ökosystems, die Modellabdeckung und die langfristige Wartung sind im Vergleich zu den Jahren der Community‑Härtung bei llama.cpp noch unbewiesen.

Solltest du es heute versuchen?

Wenn du lokal mit Coding‑Agenten auf Apple‑Silicon‑ oder NVIDIA‑Hardware arbeitest und an Speicher‑ oder Latenzgrenzen stößt, lohnt sich eine Wochenende‑Evaluation von Magnitude. Die Apache‑2.0‑Lizenz, null Token‑Kosten und die vollständig private Ausführung (nach dem Modell‑Download verlässt nichts deine Maschine) senken das Risiko beim Testen [2][6]. Lade die Desktop‑App herunter, verbinde deinen vorhandenen Agenten und führe deine tatsächliche Workload aus — synthetische Benchmarks spiegeln selten agentische Tokenmuster wider. Beobachte den VRAM‑Verbrauch, wenn du zwei oder drei gleichzeitige Sitzungen ausführst; dieser gemeinsame Prefix‑Cache ist das Feature, das wahrscheinlichsten den täglichen Workflow verändert.

Der Kernwettbewerb von Magnitude — dass die on‑device‑Kernkompilierung vorgefertigte Allgemeinheit schlägt — ist prinzipiell sound. Ob es konsistente Gewinne über den langen Schwanz von Modellen, Quantisierungsschemata und Agent‑Tool‑Use‑Mustern liefert, wird die nächsten sechs Monate Community‑Testing zeigen.

Quellen

  1. Magnitude (YC S25) startet selbstkompilierende Inferenz‑Engine, behauptet 92 % …
  2. GitHub - magnitudedev/magnitude: Open‑Source‑Inferenz‑Engine für …
  3. Die besten offenen Modelle für deine Maschine ausführen | Magnitude
  4. Lokale Inferenz - Magnitude
  5. Magnitudes selbstoptimierende Engine läuft · Hacker News | Zeli
  6. Magnitude (YC S25) stellt Open‑Source‑Inferenz‑Engine bereit… · AGI Hunt
  7. Launch HN: Magnitude (YC S25) - Selbstoptimierende Inferenz‑Engine für …
  8. Magnitude: Open‑Source‑Inferenz‑Server für lokale Modelle | Y Combinator
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

944 words 5 min read 8 sources
Veröffentlicht von

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , nemotron-3-super-120b-a12b
Publication workflow
Pipeline v1