Хитрый трюк: тестировать Mac, а не «среднестатистическую» машину
Такие движки, как llama.cpp и Ollama, поставляются с прекомпилированными ядрами. Это максимизирует переносимость: одна сборка работает на самых разных чипах. Однако такое удобство часто приводит к потере производительности на конкретном устройстве.
Magnitude использует другой подход. Когда вы загружаете модель, она запускает серию микро-бенчмарков прямо на вашем Mac. Она тестирует различные конфигурации ядер, замеряет время и кэширует самую быструю из них. Этот процесс настройки на устройстве, как сообщается, занимает около минуты.
Вы столкнетесь с двумя ключевыми метриками производительности: prefill и decode. Prefill измеряет, как быстро движок обрабатывает ваш промпт. Decode, в свою очередь, отслеживает скорость генерации токенов по одному.
Скорость decode часто является более заметным фактором в интерактивных рабочих процессах агентов, особенно когда вы ждете, пока агент для написания кода выведет свой результат. Заявление Magnitude о двукратном увеличении скорости касается именно этой производительности decode.
Создан для агентов — и удивительно прост в подключении
Практическая настройка проста. Выберите рекомендуемую модель на вкладке Discover, загрузите её, и Magnitude настроит её примерно за минуту. Затем подключите Claude Code, Codex, OpenCode, Cline или Pi через локальные совместимые API — конечные точки OpenAI и Anthropic API доступны на localhost.
Дизайн Magnitude, ориентированный на агентов, выделяет его на фоне других. Движок оптимизирован для многосессионных рабочих процессов:
- Общие кэши промптов между сессиями
- Динамическое управление памятью
- Сжатый KV-кэш (Keys в 8-бит, Values в 4-бит)
- Выгрузка моделей при простое
Это делает позицию Magnitude уникальной. llama.cpp и Ollama отдают приоритет широкому охвату оборудования, в то время как MLX специализируется на Apple Silicon. Серверные движки, такие как vLLM, нацелены на пакетную обработку для инференса в дата-центрах. Magnitude же фокусируется на локальной настройке и агентских рабочих процессах. Он оценивает вашу конкретную машину, настраивается под неё и строится вокруг долгоживущих агентов. Такой подход дает специфические преимущества разработчикам, использующим локальных ИИ-ассистентов.
Результат «почти в 2 раза» не раскрывает всей картины
Заголовки тестов о двукратном приросте Magnitude требуют уточнения. На M4 Pro модель Qwen 3.6 35B A3B (4-бит, 64K контекст) показала 57 токенов в секунду для decode, что на 92% выше, чем 30 т/с у llama.cpp. Однако Prefill улучшился лишь на 9%. «2x» — это в значительной степени метрика, ориентированная на decode.
Это сравнение не является универсальным. На Nvidia DGX Spark при том же тесте прирост decode упал до 19%. Важно отметить, что тест на M4 Pro проводился с разными конфигурациями KV-кэша: путь сжатого кэша в llama.cpp не сработал, вынудив его использовать полный 16-битный кэш, в то время как Magnitude использовал свой стандартный сжатый кэш.
Независимые отчеты еще больше усложняют картину. Некоторые пользователи обнаружили, что MLX или llama.cpp работают быстрее. Есть отчеты, где llama.cpp обходит Magnitude на M5 Max и RTX 5070 Ti, а MLX превосходит Magnitude на M5 Max (175 т/с против 161 т/с). Оборудование, модель и конкретные настройки явно определяют производительность. Для более глубокого технического анализа ознакомьтесь с репозиторием GitHub - magnitudedev/magnitude: Open source inference engine for agents.
Magnitude все еще находится на ранней стадии (v0.2.5), и разработчики отмечают, что он пока не использует новое оборудование Metal Matrix в M5. Ожидайте больше независимых сравнений с MLX по мере развития проекта. Заявления о «чистой» скорости, хотя и привлекают внимание, редко отражают всю картину при работе с разнообразным оборудованием и нагрузками.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Кому стоит установить его, а кому лучше подождать
Magnitude версии 0.2.5 — это ранний эксперимент. Владельцам Mac на чипах M1–M4, использующим локальные агенты для кодинга, стоит его установить. Подключение в один клик к Claude Code, Codex, OpenCode, Cline или Pi выглядит убедительно и часто перевешивает выигрыш в чистой пропускной способности для рабочих процессов агентов.
Будьте готовы к шероховатостям. В курируемом каталоге представлено около 15 моделей, все в формате 4-бит или выше. Руководство по работе с пользовательскими GGUF отсутствует, загруженные модели скрыты в домашней директории пользователя, а выгрузка из памяти при простое означает более медленный первый отклик. Для энтузиастов это лишь мелкие неудобства.
Пользователям M5, стремящимся к максимальной скорости, пока стоит остаться на MLX; Magnitude еще не использует преимущества нового оборудования Metal Matrix в M5. Внедрение в продакшн требует терпения. Дождитесь более широких независимых сравнений, прежде чем принимать решение.
Главная идея заключается в настройке, измеренной на устройстве, а не в гарантированном двукратном приросте. Подход Magnitude к оптимизации ядер под конкретное оборудование — это более разумный способ запуска локальных LLM. Даже если прирост скорости декодирования на 92% на M4 Pro с моделью Qwen 3.6 35B A3B при контексте 64K не является универсальным, сам принцип верен.
Часто задаваемые вопросы
Что такое Magnitude?
Magnitude — это локальный движок для инференса с открытым исходным кодом, разработанный с упором на агенты для кодинга и настройку ядер под конкретное оборудование.
Действительно ли Magnitude в два раза быстрее, чем llama.cpp?
В одном из тестов на M4 Pro была зафиксирована почти двукратная скорость декодирования, но независимые результаты зависят от оборудования, модели и конфигурации.
Как Magnitude настраивается под Mac?
Он проводит бенчмаркинг различных конфигураций ядер на устройстве, выбирает самые быстрые варианты и кэширует их для последующего использования.
Может ли Magnitude подключаться к Claude Code?
Да. Его локальные API, совместимые с OpenAI и Anthropic, поддерживают подключение в один клик к Claude Code и другим инструментам для агентов.
Кому стоит попробовать Magnitude сейчас?
Пользователям Mac на чипах от M1 до M4, которым нужен простой локальный бэкенд для агентов кодинга, он может быть полезен; пользователям в продакшн-среде стоит дождаться дополнительных сравнений.

