Y Combinator’s Summer 2025 batch produced Magnitude, an open-source inference engine that takes a different approach to local model performance. Instead of shipping precompiled kernels for broad hardware categories, Magnitude compiles and tunes its kernels on your actual device before a model runs. The project reports up to 2x throughput over llama.cpp — 92% faster decode on Apple Metal and 19% faster on NVIDIA CUDA in its benchmarks — while using 27% less memory per agent session [1][2].
The engine ships as a desktop application for macOS, Linux, and Windows with a bundled CLI. It connects to popular coding agents including Pi, OpenCode, Hermes, Codex, and Claude Code with one click, and exposes an OpenAI-compatible API for everything else [2][6].
Como a compilação de kernels no dispositivo altera a equação de desempenho
A maioria dos motores de inferência locais — llama.cpp, Ollama, LM Studio — distribui kernels pré-construídos otimizados para famílias amplas de hardware (por exemplo, “Apple Silicon” ou “NVIDIA Ampere”). O Magnitude, por sua vez, compila os kernels na máquina alvo na primeira execução e, em seguida, armazena em cache os binários ajustados para lançamentos subsequentes [1][2]. Isso significa que as instruções do kernel correspondem à sua revisão exata do chip, ao subsistema de memória e à versão do driver, em vez de um alvo de denominador comum.
O projeto publica benchmarks para Qwen 3.6 35B A3B em quantização de 4 bits com contexto de 64 k: em um M4 Pro de 48 GB, a decodificação sobe de 30 para 57 tokens por segundo (92 % mais rápida); em um DGX Spark, a decodificação passa de 49 para 58 tok/s (19 % mais rápida) [6]. O pré-preenchimento também melhora — 9 % no Metal, 23 % no CUDA. Esses números vêm do próprio conjunto de testes do projeto; a reprodução independente ainda está em estágio inicial.
O que isso significa para memória e concorrência
O Magnitude relata 27 % menos memória por agente e libera essa memória quando um agente é interrompido [2][6]. Sessões concorrentes compartilham caches de prefixo, o que o projeto afirma evitar a desaceleração que normalmente aparece quando vários agentes mantêm grandes caches KV simultaneamente [2]. Para desenvolvedores que executam vários agentes de codificação lado a lado — um padrão comum quando um agente escreve testes enquanto outro refatora — esse design de cache compartilhado pode reduzir a pressão de VRAM em máquinas de 24–48 GB.
Suporte a hardware e modelos na prática
O motor funciona em qualquer Mac Apple Silicon, GPU NVIDIA, GPU AMD ou sistema apenas com CPU, nos ambientes macOS, Linux e Windows [2][6]. Não há especificação mínima fixa; máquinas menores executam modelos menores, e mais memória permite modelos maiores [6]. Kernels otimizados existem para famílias populares de código aberto (Qwen, Llama, Mistral e outras listadas em magnitude.dev/models) [6]. O projeto escreve kernels otimizados manualmente para essas famílias em vez de depender apenas de autoajuste, o que é como afirma superar motores generalistas [6].
Integrando ao seu fluxo de trabalho atual com agentes
A adoção foi projetada para ser de baixa fricção. O aplicativo de desktop inclui um painel “Connections” que detecta agentes instalados (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) e os conecta com um clique [2][6]. Qualquer outra coisa funciona através do endpoint de API compatível com OpenAI que o aplicativo expõe localmente [6]. Não é necessário um servidor Ollama separado ou tempo de execução de inferência — o Magnitude baixa, configura, carrega e executa modelos dentro de seu próprio processo [8].
Compromissos e questões em aberto
A discussão no Hacker News trouxe vários pontos que valem ser ponderados [7]. Primeiro, as alegações de velocidade do projeto são medidas em decodificação de fluxo único; cargas de trabalho reais de agentes envolvem loops de uso de ferramentas intermitentes que alteram a distribuição de tokens e podem deslocar gargalos para a gestão do cache KV ou qualidade da decodificação especulativa. Segundo, os kernels Metal do llama.cpp já saturam a largura de banda de memória em muitos Macs, portanto, uma melhoria de 92 % na decodificação no Metal requer verificação independente em diferentes tamanhos de modelo e níveis de quantização. Terceiro, os números de velocidade estimados pela UI foram questionados quanto à precisão em comprimentos de contexto menores. Por fim, o motor é novo (lançado em 30 de setembro de 2026) — a maturidade do ecossistema, cobertura de modelos e manutenção a longo prazo ainda não foram comprovadas em comparação com os anos de consolidação da comunidade do llama.cpp.
Você deveria experimentá-lo hoje?
Se você desenvolve localmente com agentes de codificação em hardware Apple Silicon ou NVIDIA e atinge limites de memória ou latência, o Magnitude vale uma avaliação de fim de semana. A licença Apache 2.0, custos zero de token e execução totalmente privada (nada sai da sua máquina após o download do modelo) reduzem o risco de testes [2][6]. Baixe o aplicativo de desktop, conecte seu agente existente e execute sua carga de trabalho real — benchmarks sintéticos raramente refletem os padrões de tokens de agentes. Observe o uso de VRAM ao executar duas ou três sessões concorrentes; esse cache de prefixo compartilhado é o recurso mais provável de mudar fluxos de trabalho diários.
A aposta central do Magnitude — que a compilação de kernels no dispositivo supera a generalidade de kernels pré-construídos — é sólida em princípio. Se ele entregará ganhos consistentes ao longo da cauda longa de modelos, esquemas de quantização e padrões de uso de ferramentas por agentes, será decidido nos próximos seis meses de testes da comunidade.
Fontes
- Magnitude (YC S25) Launches Self-Compiling Inference Engine, Claims 92% …
- GitHub - magnitudedev/magnitude: Open source inference engine for …
- Run the best open models for your machine | Magnitude
- Local Inference - Magnitude
- Magnitude’s self-optimizing engine runs · Hacker News | Zeli
- Magnitude (YC S25) Open-Sources Inference Engine… · AGI Hunt
- Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for a
- Magnitude: Open source inference server for local models | Y Combinator