Todos los artículos
Tecnología e informática

Magnitude: Un motor de inferencia autocompilable que optimiza los kernels según tu hardware

Magnitude compila y optimiza los kernels en tu dispositivo antes de ejecutar los modelos, prometiendo hasta el doble de velocidad que llama.cpp en Apple Silicon y GPUs NVIDIA. Esto es lo que los desarrolladores deben saber.

  • #local-llm
  • #inference-engine
  • #ai-agents
  • #open-source
  • #performance-optimization

La promoción de verano 2025 de Y Combinator presentó Magnitude, un motor de inferencia de código abierto que adopta un enfoque diferente para el rendimiento de los modelos locales. En lugar de distribuir kernels precompilados para categorías generales de hardware, Magnitude compila y ajusta sus kernels en el dispositivo real antes de que se ejecute el modelo. El proyecto reporta hasta el doble de rendimiento que llama.cpp —una decodificación un 92% más rápida en Apple Metal y un 19% más rápida en NVIDIA CUDA según sus benchmarks— mientras utiliza un 27% menos de memoria por sesión de agente [1][2].

El motor se distribuye como una aplicación de escritorio para macOS, Linux y Windows con una CLI integrada. Se conecta con un solo clic a agentes de programación populares como Pi, OpenCode, Hermes, Codex y Claude Code, y expone una API compatible con OpenAI para cualquier otra integración [2][6].

Cómo la compilación de kernels en el dispositivo cambia la ecuación del rendimiento

La mayoría de los motores de inferencia local —llama.cpp, Ollama, LM Studio— distribuyen kernels preconstruidos optimizados para familias amplias de hardware (por ejemplo, “Apple Silicon” o “NVIDIA Ampere”). Magnitude, en cambio, compila los kernels en la máquina de destino durante la primera ejecución y luego almacena en caché los binarios optimizados para los siguientes lanzamientos [1][2]. Esto significa que las instrucciones del kernel coinciden exactamente con la revisión de tu chip, el subsistema de memoria y la versión del controlador, en lugar de basarse en un objetivo de mínimo común denominador.

El proyecto publica benchmarks para Qwen 3.6 35B A3B con cuantización de 4 bits y un contexto de 64k: en un M4 Pro de 48 GB, la decodificación sube de 30 a 57 tokens por segundo (92% más rápido); en un DGX Spark, pasa de 49 a 58 tok/s (19% más rápido) [6]. El prefill también mejora: un 9% en Metal y un 23% en CUDA. Estas cifras provienen del propio entorno de pruebas del proyecto; la reproducción independiente aún está en fases iniciales.

Qué significa esto para la memoria y la concurrencia

Magnitude reporta un 27% menos de memoria por agente y libera dicha memoria cuando el agente se detiene [2][6]. Las sesiones concurrentes comparten cachés de prefijo, lo que según el proyecto evita la ralentización que suele ocurrir cuando varios agentes mantienen cachés KV grandes simultáneamente [2]. Para los desarrolladores que ejecutan varios agentes de programación en paralelo —un patrón común cuando un agente escribe pruebas mientras otro refactoriza— este diseño de caché compartida podría reducir la presión sobre la VRAM en máquinas de 24–48 GB.

Soporte de hardware y modelos en la práctica

El motor funciona en cualquier Mac con Apple Silicon, GPU NVIDIA, GPU AMD o sistemas solo de CPU en macOS, Linux y Windows [2][6]. No hay una especificación mínima fija; las máquinas más pequeñas ejecutan modelos más pequeños, y más memoria permite modelos más grandes [6]. Existen kernels optimizados para familias populares de pesos abiertos (Qwen, Llama, Mistral y otros listados en magnitude.dev/models) [6]. El proyecto escribe kernels optimizados a mano para estas familias en lugar de depender únicamente del auto-tuning, que es como afirman superar a los motores generalistas [6].

Integración con tu flujo de trabajo de agentes actual

La adopción está diseñada para ser sencilla. La aplicación de escritorio incluye un panel de “Conexiones” que detecta los agentes instalados (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) y los vincula con un solo clic [2][6]. Cualquier otra herramienta funciona a través del endpoint de la API compatible con OpenAI que la aplicación expone localmente [6]. No se requiere un servidor de Ollama independiente ni un runtime de inferencia externo: Magnitude descarga, configura, carga y ejecuta los modelos dentro de su propio proceso [8].

Compromisos y preguntas abiertas

Las discusiones en Hacker News han sacado a la luz varios puntos a considerar [7]. Primero, las afirmaciones de velocidad del proyecto se miden en decodificación de flujo único; las cargas de trabajo reales de los agentes implican bucles de uso de herramientas intermitentes que cambian la distribución de tokens y pueden desplazar los cuellos de botella hacia la gestión de la caché KV o la calidad de la decodificación especulativa. Segundo, los kernels de Metal de llama.cpp ya saturan el ancho de banda de la memoria en muchos Macs, por lo que una mejora del 92% en la decodificación de Metal requiere verificación independiente en diversos tamaños de modelo y niveles de cuantización. Tercero, se ha cuestionado la precisión de las cifras de velocidad estimadas en la interfaz de usuario para longitudes de contexto cortas. Finalmente, el motor es nuevo (lanzado el 30 de septiembre de 2026); la madurez del ecosistema, la cobertura de modelos y el mantenimiento a largo plazo no están probados en comparación con los años de endurecimiento comunitario de llama.cpp.

¿Deberías probarlo hoy?

Si desarrollas localmente con agentes de programación en hardware Apple Silicon o NVIDIA y has alcanzado límites de memoria o latencia, Magnitude merece una evaluación durante un fin de semana. La licencia Apache 2.0, la ausencia de costes por token y la ejecución totalmente privada (nada sale de tu máquina tras la descarga del modelo) reducen el riesgo de probarlo [2][6]. Descarga la aplicación de escritorio, conecta tu agente actual y ejecuta tu carga de trabajo real; los benchmarks sintéticos rara vez reflejan los patrones de tokens de los agentes. Vigila el uso de la VRAM cuando ejecutes dos o tres sesiones concurrentes; esa caché de prefijo compartida es la función con más probabilidades de cambiar los flujos de trabajo diarios.

La apuesta central de Magnitude —que la compilación de kernels en el dispositivo supera la generalidad preconstruida— es sólida en principio. Si logra victorias consistentes en la larga cola de modelos, esquemas de cuantización y patrones de uso de herramientas de agentes es lo que decidirán los próximos seis meses de pruebas de la comunidad.

Fuentes

  1. Magnitude (YC S25) Launches Self-Compiling Inference Engine, Claims 92% …
  2. GitHub - magnitudedev/magnitude: Open source inference engine for …
  3. Run the best open models for your machine | Magnitude
  4. Local Inference - Magnitude
  5. Magnitude’s self-optimizing engine runs · Hacker News | Zeli
  6. Magnitude (YC S25) Open-Sources Inference Engine… · AGI Hunt
  7. Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for a
  8. Magnitude: Open source inference server for local models | Y Combinator
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,293 words 6 min read 8 sources
Publicado por

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , gemma-4-31b-it
Publication workflow
Pipeline v1