Проблема 20 ГБ: почему это не должно работать
Запуск большой языковой модели с 35 миллиардами параметров непосредственно на iPhone поначалу кажется вычислительно невозможным. Модель такого масштаба в 35 миллиардов параметров при сохранении в обычном 4-битном формате занимает около 20 ГБ. Обычно весь этот набор данных объемом 20 ГБ должен находиться в RAM для эффективной обработки, что значительно превышает возможности любого мобильного устройства.
Однако революционный метод разрушил этот барьер. Исследователи продемонстрировали работу MoE-модели с 35 миллиардами параметров на iPhone, добившись активного использования памяти всего в 1,4 ГБ. Это ошеломляющее сокращение, уменьшающее типичные требования к памяти более чем на 90%.
Секрет заключается в том, как модель управляет своими огромными данными. Вместо загрузки всех 20 ГБ в RAM, только необходимые компоненты и активные в данный момент «эксперты» передаются по требованию с SSD устройства. Этот инновационный подход использует разреженные паттерны активации, присущие архитектурам Mixture-of-Experts.
Этот прорыв знаменует собой глубокий сдвиг в области искусственного интеллекта. Мы движемся к мощным, конфиденциальным возможностям on-device AI, освобождая сложные задачи от постоянной зависимости от облачных серверов. И это открывает двери для нового поколения интеллектуальных локальных приложений.
Знакомство с архитектурой Mixture-of-Experts (MoE)
Решение проблемы нехватки памяти для модели с 35 миллиардами параметров потребовало фундаментального изменения архитектуры: встречайте Mixture-of-Experts (MoE). Вместо одной массивной монолитной модели, где каждая часть активна для каждого токена, MoE использует команду небольших специализированных «экспертов». Специальная сеть «маршрутизаторов» динамически выбирает только тех экспертов, которые актуальны для конкретной задачи.
Эта архитектура идеально подходит для устройств с ограниченными ресурсами, таких как iPhone. Обычно модель с 35 миллиардами параметров в виде обычного 4-битного файла требует около 20 ГБ RAM. Но с MoE в активную память загружаются только выбранные эксперты, а подавляющее большинство остается в неактивном состоянии на более медленном хранилище, таком как SSD. Это радикально сокращает объем активной RAM до 1,4 ГБ.
MoE — это не просто способ уменьшения моделей; это также ключ к их эффективному масштабированию до триллионов параметров. Теперь это позволяет сложным LLM работать непосредственно на периферийных устройствах.
Для iPhone модель была хитроумно разделена. Важнейшие общие компоненты — эмбеддинги, механизмы внимания, маршрутизаторы и общий эксперт — составляют те самые 1,4 ГБ, которые постоянно находятся в RAM. В то же время 40 отдельных файлов экспертов, каждый из которых весит около 300 МБ (всего 12 ГБ), ожидают на SSD. Для каждого токена, после того как внимание (attention) отработает на GPU, маршрутизатор выбирает восемь конкретных экспертов, которые движок затем передает с SSD в память GPU, запуская их вместе с общим экспертом. Это включает 320 небольших операций чтения с SSD для каждого отдельного токена.
Движок потоковой передачи по требованию
Эта модель с 35 миллиардами параметров обходит барьер памяти в 20 ГБ за счет сегментации своих компонентов. Основные 1,4 ГБ необходимых элементов загружаются один раз в RAM, формируя постоянно присутствующий операционный фундамент модели, который остается в памяти на протяжении всего процесса вывода:
- эмбеддинги (представления входных токенов)
- механизмы внимания (контекстное понимание)
- маршрутизаторы (выбор экспертов)
- общий эксперт (базовый компонент общего назначения)
Обычно все модели размещаются в оперативной памяти, но эта архитектура с 35 миллиардами параметров предлагает инновационное решение. Вместо этого оставшиеся 12 ГБ специализированных экспертов хранятся на быстром SSD iPhone. Эта архитектура обеспечивает потоковую передачу экспертов (streaming experts): система извлекает эти большие неактивные части только тогда, когда маршрутизатор модели специально запрашивает их, перемещая в память GPU по мере необходимости.
Для каждого токена, генерируемого моделью, происходит быстрая последовательность передачи данных. Маршрутизатор динамически выбирает 8 экспертов в каждом из 40 слоев, инициируя 320 отдельных небольших операций чтения непосредственно с SSD. Этот постоянный высокоскоростной обмен данными позволяет массивной модели 35B работать в рамках жестких ограничений памяти iPhone.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Новый рубеж для Edge AI
Эта MoE-модель с 35 миллиардами параметров, работающая непосредственно на iPhone, действительно открывает новый рубеж для Edge AI. Представьте себе полностью конфиденциальных помощников, обрабатывающих чувствительные данные пользователя локально на устройстве без передачи в облако, или инструменты для творчества с нулевой задержкой, мгновенно создающие сложные дизайны или текстовые ответы. Эти достижения позволяют создавать полностью автономные AI-приложения, превращая возможности, ранее ограниченные удаленными дата-центрами, в осязаемую личную реальность.
Однако этот прорыв не лишен непосредственных проблем. Механизм потоковой передачи по требованию, при всей своей изобретательности, создает высокую нагрузку на ввод-вывод, требуя 320 небольших операций чтения с SSD для каждого токена. Этот интенсивный и постоянный доступ к данным естественным образом увеличивает расход заряда батареи и требует эффективного управления тепловыделением от компактного оборудования устройства.
Тем не менее, эти препятствия временны. Будущее обещает мощную синергию между инновационными программными методами, такими как текущий движок потоковой передачи экспертов, и все более специализированным аппаратным ускорением. Например, Apple Neural Engine предлагает выделенный кремний, разработанный специально для рабочих нагрузок AI. В сочетании с постоянно оптимизируемыми фреймворками и архитектурами памяти этот интегрированный подход ускорит путь к массовому внедрению локального суперинтеллекта, делая мощный AI повсеместным и органично интегрированным в нашу повседневную жизнь.
Часто задаваемые вопросы
Что такое модель Mixture-of-Experts (MoE)?
Модель MoE — это архитектура нейронной сети, использующая несколько специализированных подсетей-«экспертов». Для любого входного сигнала механизм маршрутизации выбирает лишь нескольких экспертов для его обработки, что делает логический вывод гораздо более эффективным по сравнению с плотными моделями, где используется вся сеть целиком.
Как удалось так значительно сократить объем памяти модели 35B?
Объем оперативной памяти, занимаемой моделью, был сокращен до 1,4 ГБ за счет хранения в памяти только общих компонентов. Основная часть модели, «эксперты», находится на быстром SSD телефона и передается в память по мере необходимости во время логического вывода.
Что такое «потоковая передача экспертов» (streaming experts)?
Это метод, при котором части большой AI-модели («эксперты» в архитектуре MoE) хранятся на более медленном SSD-накопителе и динамически загружаются в более быструю оперативную память или память GPU только тогда, когда они нужны для конкретного вычисления, а затем удаляются.
Каковы преимущества запуска больших AI-моделей на телефоне?
Основными преимуществами являются повышенная конфиденциальность, поскольку данные никогда не покидают устройство, меньшая задержка без необходимости сетевого взаимодействия, полная автономность и снижение зависимости от дорогостоящей облачной инфраструктуры для логического вывода.

