ИИ-чудо на 2 ГБ для Apple Silicon
Забудьте о представлении, что для серьезного ИИ нужны серверные стойки. Новый проект с открытым исходным кодом разрушает ожидания, запуская модель с 26 миллиардами параметров на Apple Silicon всего с ~2 ГБ оперативной памяти. В частности, настроенная на выполнение инструкций Gemma 4 (26B-A4B) достигает скорости более 23 токенов в секунду на Mac с чипом M-серии, обеспечивая по-настоящему пригодный для использования локальный вывод без лишних усилий.
Это достижение радикально сокращает типичный объем памяти для модели такого масштаба. Обычно модель с 26 миллиардами параметров, такая как Gemma 4, требует более 14 ГБ оперативной памяти. Turbo Fieldfare обеспечивает 7-кратное сокращение объема памяти, фундаментально меняя возможности локального развертывания LLM и делая мощный ИИ доступным прямо на вашей рабочей станции.
Проект, ответственный за это — Turbo Fieldfare, приложение с открытым исходным кодом, тщательно разработанное для оборудования Apple. Написанное специально на Swift и Metal, низкоуровневом API графического процессора Apple, оно использует уникальные возможности объединенной памяти. Этот специализированный дизайн максимизирует производительность на Apple Silicon, превращая сложную модель Mixture-of-Experts (MoE) в плавный локальный опыт.
Почему большая часть вашей модели ИИ — это мертвый груз
Gemma 4 — это не монолитная сеть. Это модель Mixture-of-Experts (MoE), дизайн которой разрушает традиционную парадигму единой сети. Вместо одного гигантского прямого блока она развертывает 128 небольших специализированных сетей-«экспертов». Каждый эксперт обрабатывает определенные шаблоны данных, что делает общую модель высокоэффективной и адаптируемой без постоянной полной активации.
Каждый слой MoE включает крошечный маршрутизатор. Для любого заданного токена этот маршрутизатор динамически выбирает и активирует только 8 наиболее релевантных экспертов из 128 доступных. Это означает, что из 26 миллиардов параметров Gemma 4 активно задействовано около 3,9 миллиарда. Поразительные 85% от общего количества параметров модели остаются полностью неактивными в любой момент времени.
Эта присущая неактивность — главная особенность Turbo Fieldfare. Вам не нужно держать в оперативной памяти все 14 ГБ Gemma 4, когда 85% — это мертвый груз. Проект интеллектуально хранит в памяти только постоянно необходимые компоненты и активно выбранные ~3,9 миллиарда параметров. Эксперты передаются напрямую с SSD по мере необходимости, минуя необходимость постоянного нахождения всей модели в памяти. Это точное управление памятью по запросу — то, как Apple Silicon достигает своего чуда в 2 ГБ.
Секретное оружие Apple: объединенная память
Традиционные архитектуры ПК создают «узкое место» для вывода ИИ. Обычно доставка весов на дискретную видеокарту проходит сложный путь: данные перемещаются с SSD в системную оперативную память, а затем проходят через медленную шину PCIe в выделенную видеопамять (VRAM). Это две копии и переход через шину для каждого фрагмента данных — убийца производительности, когда вы передаете экспертов по запросу.
Apple Silicon полностью обходит это благодаря объединенной памяти. Процессор и графический процессор используют один и тот же пул физической оперативной памяти. Нет отдельной видеопамяти, в которую нужно копировать данные. Буфер Metal — это просто область этой общей памяти, мгновенно видимая для обоих процессоров.
Эта архитектура обеспечивает критическую оптимизацию: процессор извлекает веса экспертов напрямую с SSD в буфер памяти, к которому графический процессор получает доступ немедленно. Никаких медленных копирований. Никаких передач по PCIe. Задержка радикально снижается, что делает загрузку экспертов по запросу жизнеспособной.
Более того, проект Turbo Fieldfare доводит эту идею до крайности. Веса не хранятся в каком-то общем формате, требующем преобразования во время выполнения. Вместо этого они существуют на диске в точном 4-битном квантованном макете, который потребляет ядро Metal GPU. Это означает отсутствие накладных расходов на преобразование или распаковку; чтение файла буквально загружает веса. Подробнее об этом проекте можно узнать здесь: drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook · GitHub. Такая тесная интеграция обеспечивает невероятную производительность.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Умнее, чем ваша оперативная память: потоковая передача по требованию
Стратегия памяти Turbo Fieldfare использует продуманную систему из двух уровней. Компактный и важный компонент объемом 1.35 ГБ — внимание, маршрутизатор и эмбеддинги — отображается в памяти (memory-mapped) и всегда находится в оперативной памяти. Этот критический блок обрабатывает начальные токены без обращения к диску.
Оставшиеся 12.9 ГБ экспертов полностью находятся на SSD. Turbo Fieldfare использует стратегию выборки «точно в срок» (JIT), передавая этих экспертов в память только тогда, когда их запрашивает маршрутизатор, по несколько мегабайт за раз. Никакой предварительной выборки; выбор зависит от текущего токена и его истории.
Интеллектуальное кэширование еще больше оптимизирует этот процесс. Каждый из 30 слоев Gemma 4 поддерживает LFU-кэш, удерживая 16 из 128 экспертов в оперативной памяти. Если маршрутизатор выбирает кэшированного эксперта, доступ к нему происходит мгновенно. Если нет, нужный эксперт загружается с SSD, заменяя наименее часто используемого в данный момент в памяти.
Этот подход LFU использует неслучайную, предсказуемую природу выбора экспертов в моделях MoE. Некоторые эксперты выбираются постоянно, другие — редко. Приоритезируя часто используемых экспертов, система минимизирует чтение с диска, эффективно скрывая задержки ввода-вывода внутри существующих вычислительных потоков модели.
Часто задаваемые вопросы
Что такое Turbo Fieldfare?
Turbo Fieldfare — это проект с открытым исходным кодом, который запускает большие модели ИИ, такие как Gemma 4 с 26 миллиардами параметров, на компьютерах Apple Silicon Mac с объемом оперативной памяти всего 2 ГБ, передавая части модели напрямую с SSD.
Почему унифицированная память Apple Silicon важна для этого?
Она позволяет CPU и GPU использовать общий пул памяти. Это исключает медленный процесс копирования данных из системной оперативной памяти в отдельную видеопамять GPU, что критически важно для высокоскоростной потоковой передачи данных по требованию, которую использует Turbo Fieldfare.
Что такое модель Mixture-of-Experts (MoE)?
Архитектура модели ИИ, состоящая из множества небольших подсетей-«экспертов». Для любой конкретной задачи маршрутизатор выбирает для активации лишь нескольких экспертов, что делает логический вывод гораздо более эффективным, чем при работе с одной большой монолитной моделью.
Могу ли я запустить это на своем Mac?
Да, если у вас есть любой Mac с процессором M-серии (Apple Silicon). Проект доступен на GitHub с инструкциями по клонированию репозитория и запуску приложения.

