Проект Magnitude, вышедший из летнего набора Y Combinator 2025 года, представляет собой open-source движок инференса с нестандартным подходом к производительности локальных моделей. Вместо того чтобы поставлять предварительно скомпилированные кернелы для широких категорий оборудования, Magnitude компилирует и настраивает их непосредственно на вашем устройстве перед запуском модели. Согласно отчетам проекта, пропускная способность увеличивается до 2 раз по сравнению с llama.cpp: в бенчмарках зафиксировано ускорение декодирования на 92% на Apple Metal и на 19% на NVIDIA CUDA при снижении потребления памяти на 27% на одну сессию агента [1][2].
Движок поставляется в виде десктопного приложения для macOS, Linux и Windows с встроенным CLI. Он позволяет в один клик подключиться к популярным кодинг-агентам, таким как Pi, OpenCode, Hermes, Codex и Claude Code, а для всех остальных инструментов предоставляет OpenAI-совместимый API [2][6].
Как компиляция кернелов на устройстве меняет уравнение производительности
Большинство движков локального инференса — llama.cpp, Ollama, LM Studio — распространяют готовые кернелы, оптимизированные под широкие семейства оборудования (например, «Apple Silicon» или «NVIDIA Ampere»). Magnitude же компилирует кернелы на целевой машине при первом запуске, а затем кэширует настроенные бинарные файлы для последующих сессий [1][2]. Это означает, что инструкции кернела соответствуют конкретной ревизии вашего чипа, подсистеме памяти и версии драйвера, а не ориентируются на «наименьший общий знаменатель».
Проект опубликовал бенчмарки для Qwen 3.6 35B A3B с 4-битным квантованием и контекстом 64k: на M4 Pro 48 ГБ скорость декодирования выросла с 30 до 57 токенов в секунду (на 92% быстрее); на DGX Spark — с 49 до 58 ток/с (на 19% быстрее) [6]. Скорость префилла также улучшилась: на 9% на Metal и на 23% на CUDA. Эти данные получены с помощью собственного тестового стенда проекта; независимое воспроизведение результатов пока находится на ранней стадии.
Что это значит для памяти и многопоточности
Magnitude заявляет о снижении потребления памяти на 27% на одного агента и освобождает эту память после завершения работы агента [2][6]. Параллельные сессии используют общие кэши префиксов, что, по словам разработчиков, предотвращает замедление, которое обычно возникает, когда несколько агентов одновременно удерживают большие KV-кэши [2]. Для разработчиков, запускающих несколько кодинг-агентов параллельно (например, когда один пишет тесты, а другой рефакторит код), такая архитектура с общим кэшем может существенно снизить нагрузку на VRAM на машинах с 24–48 ГБ памяти.
Поддержка оборудования и моделей на практике
Движок работает на любом Mac с Apple Silicon, GPU NVIDIA, GPU AMD или системах только с CPU под управлением macOS, Linux и Windows [2][6]. Фиксированных минимальных требований нет: на слабых машинах запускаются маленькие модели, а большее количество памяти позволяет использовать более крупные [6]. Оптимизированные кернелы созданы для популярных семейств моделей с открытыми весами (Qwen, Llama, Mistral и другие, перечисленные на magnitude.dev/models) [6]. Разработчики пишут вручную оптимизированные кернелы для этих семейств, а не полагаются только на автотюнинг, что, по их утверждению, и позволяет обходить универсальные движки [6].
Интеграция в текущий рабочий процесс с агентами
Процесс внедрения максимально упрощен. Десктопное приложение включает панель «Connections», которая обнаруживает установленных агентов (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) и связывает их одним кликом [2][6]. Все остальное работает через локальный OpenAI-совместимый API-эндпоинт [6]. Отдельный сервер Ollama или среда выполнения инференса не требуются — Magnitude самостоятельно скачивает, настраивает, загружает и запускает модели внутри своего процесса [8].
Компромиссы и открытые вопросы
Обсуждение на Hacker News выявило несколько важных моментов [7]. Во-первых, заявления о скорости основаны на однопоточном декодировании; реальные нагрузки агентов включают циклы использования инструментов с резкими скачками, что меняет распределение токенов и может сместить «узкое место» на управление KV-кэшем или качество спекулятивного декодирования. Во-вторых, кернелы Metal в llama.cpp уже максимально используют пропускную способность памяти на многих Mac, поэтому прирост декодирования в 92% на Metal требует независимой проверки для разных размеров моделей и уровней квантования. В-третьих, точность оценочных показателей скорости в интерфейсе при коротких контекстах была поставлена под сомнение. Наконец, движок совсем новый (запуск 30 сентября 2026 года) — зрелость экосистемы, охват моделей и долгосрочная поддержка пока не проверены временем в отличие от llama.cpp с его многолетней историей сообщества.
Стоит ли пробовать его сегодня?
Если вы разрабатываете локально с помощью кодинг-агентов на Apple Silicon или NVIDIA и упираетесь в потолок по памяти или задержкам, Magnitude стоит протестировать в ближайшие выходные. Лицензия Apache 2.0, отсутствие платы за токены и полностью приватное исполнение (данные не покидают вашу машину после загрузки модели) делают тестирование безопасным [2][6]. Скачайте приложение, подключите своего агента и запустите реальную рабочую нагрузку — синтетические бенчмарки редко отражают паттерны токенов в агентских задачах. Обратите внимание на использование VRAM при запуске двух или трех параллельных сессий; общий кэш префиксов — это та функция, которая с наибольшей вероятностью изменит ваш ежедневный рабочий процесс.
Основная ставка Magnitude — на то, что компиляция кернелов на устройстве эффективнее предустановленного универсализма — в принципе обоснована. Сможет ли она обеспечить стабильный выигрыш для всего многообразия моделей, схем квантования и паттернов работы агентов, покажут следующие шесть месяцев тестирования сообществом.
Источники
- Magnitude (YC S25) Launches Self-Compiling Inference Engine, Claims 92% …
- GitHub - magnitudedev/magnitude: Open source inference engine for …
- Run the best open models for your machine | Magnitude
- Local Inference - Magnitude
- Magnitude’s self-optimizing engine runs · Hacker News | Zeli
- Magnitude (YC S25) Open-Sources Inference Engine… · AGI Hunt
- Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for a
- Magnitude: Open source inference server for local models | Y Combinator