Все статьи
ИТ и технологии

Magnitude: самокомпилируемый движок инференса, который настраивает кернелы под ваше железо

Magnitude компилирует и оптимизирует кернелы прямо на вашем устройстве перед запуском моделей, заявляя о двукратном ускорении по сравнению с llama.cpp на Apple Silicon и GPU NVIDIA. Рассказываем, что нужно знать разработчикам.

  • #local-llm
  • #inference-engine
  • #ai-agents
  • #open-source
  • #performance-optimization

Проект Magnitude, вышедший из летнего набора Y Combinator 2025 года, представляет собой open-source движок инференса с нестандартным подходом к производительности локальных моделей. Вместо того чтобы поставлять предварительно скомпилированные кернелы для широких категорий оборудования, Magnitude компилирует и настраивает их непосредственно на вашем устройстве перед запуском модели. Согласно отчетам проекта, пропускная способность увеличивается до 2 раз по сравнению с llama.cpp: в бенчмарках зафиксировано ускорение декодирования на 92% на Apple Metal и на 19% на NVIDIA CUDA при снижении потребления памяти на 27% на одну сессию агента [1][2].

Движок поставляется в виде десктопного приложения для macOS, Linux и Windows с встроенным CLI. Он позволяет в один клик подключиться к популярным кодинг-агентам, таким как Pi, OpenCode, Hermes, Codex и Claude Code, а для всех остальных инструментов предоставляет OpenAI-совместимый API [2][6].

Как компиляция кернелов на устройстве меняет уравнение производительности

Большинство движков локального инференса — llama.cpp, Ollama, LM Studio — распространяют готовые кернелы, оптимизированные под широкие семейства оборудования (например, «Apple Silicon» или «NVIDIA Ampere»). Magnitude же компилирует кернелы на целевой машине при первом запуске, а затем кэширует настроенные бинарные файлы для последующих сессий [1][2]. Это означает, что инструкции кернела соответствуют конкретной ревизии вашего чипа, подсистеме памяти и версии драйвера, а не ориентируются на «наименьший общий знаменатель».

Проект опубликовал бенчмарки для Qwen 3.6 35B A3B с 4-битным квантованием и контекстом 64k: на M4 Pro 48 ГБ скорость декодирования выросла с 30 до 57 токенов в секунду (на 92% быстрее); на DGX Spark — с 49 до 58 ток/с (на 19% быстрее) [6]. Скорость префилла также улучшилась: на 9% на Metal и на 23% на CUDA. Эти данные получены с помощью собственного тестового стенда проекта; независимое воспроизведение результатов пока находится на ранней стадии.

Что это значит для памяти и многопоточности

Magnitude заявляет о снижении потребления памяти на 27% на одного агента и освобождает эту память после завершения работы агента [2][6]. Параллельные сессии используют общие кэши префиксов, что, по словам разработчиков, предотвращает замедление, которое обычно возникает, когда несколько агентов одновременно удерживают большие KV-кэши [2]. Для разработчиков, запускающих несколько кодинг-агентов параллельно (например, когда один пишет тесты, а другой рефакторит код), такая архитектура с общим кэшем может существенно снизить нагрузку на VRAM на машинах с 24–48 ГБ памяти.

Поддержка оборудования и моделей на практике

Движок работает на любом Mac с Apple Silicon, GPU NVIDIA, GPU AMD или системах только с CPU под управлением macOS, Linux и Windows [2][6]. Фиксированных минимальных требований нет: на слабых машинах запускаются маленькие модели, а большее количество памяти позволяет использовать более крупные [6]. Оптимизированные кернелы созданы для популярных семейств моделей с открытыми весами (Qwen, Llama, Mistral и другие, перечисленные на magnitude.dev/models) [6]. Разработчики пишут вручную оптимизированные кернелы для этих семейств, а не полагаются только на автотюнинг, что, по их утверждению, и позволяет обходить универсальные движки [6].

Интеграция в текущий рабочий процесс с агентами

Процесс внедрения максимально упрощен. Десктопное приложение включает панель «Connections», которая обнаруживает установленных агентов (Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline) и связывает их одним кликом [2][6]. Все остальное работает через локальный OpenAI-совместимый API-эндпоинт [6]. Отдельный сервер Ollama или среда выполнения инференса не требуются — Magnitude самостоятельно скачивает, настраивает, загружает и запускает модели внутри своего процесса [8].

Компромиссы и открытые вопросы

Обсуждение на Hacker News выявило несколько важных моментов [7]. Во-первых, заявления о скорости основаны на однопоточном декодировании; реальные нагрузки агентов включают циклы использования инструментов с резкими скачками, что меняет распределение токенов и может сместить «узкое место» на управление KV-кэшем или качество спекулятивного декодирования. Во-вторых, кернелы Metal в llama.cpp уже максимально используют пропускную способность памяти на многих Mac, поэтому прирост декодирования в 92% на Metal требует независимой проверки для разных размеров моделей и уровней квантования. В-третьих, точность оценочных показателей скорости в интерфейсе при коротких контекстах была поставлена под сомнение. Наконец, движок совсем новый (запуск 30 сентября 2026 года) — зрелость экосистемы, охват моделей и долгосрочная поддержка пока не проверены временем в отличие от llama.cpp с его многолетней историей сообщества.

Стоит ли пробовать его сегодня?

Если вы разрабатываете локально с помощью кодинг-агентов на Apple Silicon или NVIDIA и упираетесь в потолок по памяти или задержкам, Magnitude стоит протестировать в ближайшие выходные. Лицензия Apache 2.0, отсутствие платы за токены и полностью приватное исполнение (данные не покидают вашу машину после загрузки модели) делают тестирование безопасным [2][6]. Скачайте приложение, подключите своего агента и запустите реальную рабочую нагрузку — синтетические бенчмарки редко отражают паттерны токенов в агентских задачах. Обратите внимание на использование VRAM при запуске двух или трех параллельных сессий; общий кэш префиксов — это та функция, которая с наибольшей вероятностью изменит ваш ежедневный рабочий процесс.

Основная ставка Magnitude — на то, что компиляция кернелов на устройстве эффективнее предустановленного универсализма — в принципе обоснована. Сможет ли она обеспечить стабильный выигрыш для всего многообразия моделей, схем квантования и паттернов работы агентов, покажут следующие шесть месяцев тестирования сообществом.

Источники

  1. Magnitude (YC S25) Launches Self-Compiling Inference Engine, Claims 92% …
  2. GitHub - magnitudedev/magnitude: Open source inference engine for …
  3. Run the best open models for your machine | Magnitude
  4. Local Inference - Magnitude
  5. Magnitude’s self-optimizing engine runs · Hacker News | Zeli
  6. Magnitude (YC S25) Open-Sources Inference Engine… · AGI Hunt
  7. Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for a
  8. Magnitude: Open source inference server for local models | Y Combinator
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

347 words 2 min read 8 sources
Автор

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , gemma-4-31b-it
Publication workflow
Pipeline v1