Настоящий враг — не модель, а память
Запуск больших языковых моделей (LLM) на периферийных устройствах сталкивается с фундаментальным препятствием: не вычислительная мощность, а постоянное перемещение весов модели между памятью и процессором. Эта «стена памяти» означает, что извлечение веса из памяти часто потребляет гораздо больше энергии, чем сами вычисления, особенно во время быстрого и итеративного процесса генерации токенов.
Рассмотрим масштаб: модели, такой как Llama 3.1 8B, требуется около 16 ГБ для весов в формате FP16. Даже при агрессивном 4-битном квантовании это все равно требует около 4 ГБ памяти, не считая активаций и других накладных расходов во время выполнения. Постоянное перемещение этих гигабайтов данных является основным ограничением для производительности и энергопотребления LLM на устройствах.
Исследователи из MIT и Университета Дьюка предлагают радикальное решение: AIR-LLM. Их концепция переносит проблему с памяти устройства на беспроводную инфраструктуру путем передачи весов LLM по воздуху. Вместо того чтобы хранить веса локально на каждом телефоне, их транслирует центральная радиостанция, например, базовая станция 5G.
Этот подход использует Orthogonal Frequency-Division Multiplexing (OFDM) — ту же технологию, на которой работают Wi-Fi и 5G. Каждый вес модели отображается на отдельную поднесущую частоту, что позволяет устройству выполнять вычисления непосредственно на входящем радиосигнале, полностью исключая необходимость в локальном хранении или извлечении из памяти.
Радиосигнал становится частью ИИ-чипа
Исследователи предлагают новую архитектуру, в которой центральная радиостанция, например, базовая станция 5G, транслирует веса модели с использованием Orthogonal Frequency-Division Multiplexing (OFDM). Этот метод, распространенный в Wi-Fi и сотовых системах, разделяет сигнал на тысячи поднесущих; каждая поднесущая несет один вес модели.
Существующий в телефоне радиочастотный смеситель становится частью ИИ-чипа. Этот компонент объединяет входящий широковещательный сигнал (несущий веса) с локальными активациями промпта телефона. Важно отметить, что аналоговая операция смесителя естественным образом вычисляет dot product этих двух сигналов — фундаментальную математическую операцию в каждом слое LLM — непосредственно внутри радиоволны.
Такая конструкция позволяет полностью избежать хранения весов модели на устройстве. Телефон по-прежнему обрабатывает свой промпт и выполняет последующие вычисления, но самая ресурсоемкая задача — загрузка весов — переносится на механизм широковещательной передачи. Одна передача обслуживает все устройства в радиусе действия, сохраняя конфиденциальность пользователей, так как промпты никогда не покидают телефон.
Моделирование с использованием Llama 3.1 8B на городских моделях Парижа и Мюнхена показало впечатляющие результаты. Точность предсказания следующего слова снизилась всего на 4,0%, а энергопотребление на токен сократилось в 157,7 раза по сравнению с потоковой передачей весов FP16. Эти аналоговые вычисления внутри радиосигнала представляют собой радикальный подход к периферийному ИИ.
Большая экономия энергии с преимуществом широковещательной передачи
Эта новая архитектура обещает значительный прирост эффективности. Исследователи сообщают о снижении энергопотребления на токен до 157,7 раза по сравнению с потоковой передачей несжатых весов FP16. Для более распространенных 4-битных квантованных весов снижение энергопотребления все еще существенно и составляет примерно 40,4 раза.
Эта экономия энергии достигается при минимальном снижении производительности. При тестировании на бенчмарке WikiText-2 перплексия предсказания следующего токена модели Llama 3.1 8B ухудшилась всего на 4% по сравнению с исходной моделью. Это говорит о том, что ответы модели остаются в значительной степени согласованными, несмотря на переход к аналоговым вычислениям.
Природа широковещательной передачи «один ко многим» в этой системе дает существенное преимущество, особенно в сценариях с несколькими пользователями. Одна трансляция может обслуживать множество устройств одновременно. Это значительно сокращает эфирное время: согласно отчетам, для 20 пользователей оно сокращается в 104,1 раза по сравнению с отдельными одноадресными потоками весов FP16 и в 26 раз для 4-битных весов.
Важно отличать эти смоделированные сокращения эфирного времени от гарантированной производительности в реальных условиях, так как состояние сети может варьироваться. Тем не менее, потенциал базовой станции функционировать как общий ресурс, подобно радио- или телевещателю, весьма убедителен. Для получения дополнительных технических подробностей обратитесь к статье: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Проблема слабого сигнала все еще очень актуальна
Инженеры смоделировали эту архитектуру, используя модели трассировки лучей NVIDIA Sionna для Парижа и Мюнхена в сочетании с лабораторными измерениями РЧ-смесителей. Это обеспечило надежную среду для оценки, но не включало полноценное развертывание в реальной сотовой сети. Поэтому впечатляющая экономия энергии остается теоретическим верхним пределом до момента подтверждения в реальных условиях.
Основным препятствием для таких аналоговых вычислений является подверженность радиосигналов воздействию факторов окружающей среды. Шум, замирание сигнала, физические препятствия и многолучевая интерференция могут исказить тонкие аналоговые вычисления, выполняемые РЧ-смесителем. В отличие от цифровых систем, способных исправлять ошибки, аналоговые вычисления по своей природе менее устойчивы к деградации сигнала.
Исследователи выделили конкретный случай сбоя в смоделированном сценарии с низким уровнем приема в Мюнхене: большая языковая модель (LLM) зациклилась на повторении текста, генерируя фразы вроде «it's beer gardens and its beer gardens». Это демонстрирует, как даже незначительные проблемы с целостностью сигнала могут привести к серьезным сбоям в выводе, подчеркивая сложность поддержания точности в разнообразных реальных условиях.
Если инженеры смогут преодолеть эти проблемы с надежностью, широковещательный вывод (broadcast inference) может оказать глубокое влияние на устройства с ограниченным объемом памяти, такие как смартфоны и носимые гаджеты. Возможность запускать большие модели без локального хранения весов высвободит значительный объем встроенной памяти. Однако обеспечение стабильной производительности в различных географических и сигнальных условиях, а также решение вопросов конфиденциальности и надежного покрытия остаются критически важными открытыми задачами для практического внедрения.
Часто задаваемые вопросы
Что такое AIR-LLM?
AIR-LLM — это исследовательский подход, который транслирует веса модели ИИ по радиоканалу и использует РЧ-оборудование устройства для выполнения части вычислений.
Работает ли AIR-LLM на реальных телефонах сегодня?
Пока нет. Представленная оценка объединяет смоделированные городские радиоканалы с измерениями РЧ-смесителя; это не демонстрация работы «телефон — вышка» в реальных условиях.
Получает ли вышка сотовой связи ваши запросы?
В предложенной односторонней широковещательной архитектуре запросы и активации остаются на устройстве, а не отправляются на вышку.
Сколько энергии может сэкономить AIR-LLM?
В статье сообщается об экономии энергии на токен до 157,7 раза по сравнению с потоковой передачей несжатых весов FP16, с меньшей экономией по сравнению с 4-битной потоковой передачей.

