40-летнее правило, которое хотят нарушить исследователи ИИ
Каждая модель ИИ, от больших языковых моделей до классификаторов изображений, обучается с использованием backpropagation — алгоритма, ставшего популярным в 1986 году. Этот метод работает путем прогона данных через нейронную сеть для получения прогнозов, вычисления «потерь» (loss) для измерения ошибки, а затем использования цепного правила дифференцирования для определения точных градиентов — того, как каждый вес должен измениться, чтобы уменьшить эту ошибку.
Сила backpropagation заключается в эффективном вычислении этих точных градиентов, но она требует, чтобы каждая операция внутри модели была дифференцируемой. Это ограничение часто вынуждает сохранять промежуточные активации для обратного прохода, что влияет почти на каждый архитектурный выбор и дизайн оборудования в современном глубоком обучении. Альтернатива, эволюционные стратегии, предполагает угадывание корректировок весов и итеративную проверку снижения потерь; однако эти методы печально известны своей медлительностью из-за необходимости выполнения множественных прямых проходов.
Исследователи из Q Labs бросают вызов этой 40-летней парадигме с помощью Dust, нового подхода к обучению трансформеров. Dust исследует, может ли трансформер эффективно учиться методом проб и ошибок, а не путем вычисления градиентов, за счет возмущения активаций, а не весов. Это исследование изучает фундаментальный вопрос о том, может ли машинное обучение освободиться от требования дифференцируемости, потенциально открывая путь к совершенно новым, недифференцируемым архитектурам моделей.
Dust превращает каждый токен в эксперимент
Эволюционные стратегии долгое время предлагали альтернативу backpropagation, но традиционно они работают в пространстве весов (weight space). Это означает, что они напрямую возмущают параметры модели, требуя отдельного прямого прохода для каждого набора возмущенных весов для оценки влияния на потери. Такие методы «мучительно медленны» из-за вычислительных затрат на эти индивидуальные оценки.
Dust, новый метод от Q Labs, переворачивает эту парадигму, вводя независимый случайный шум в пространство активаций (activation space) модели — в частности, в выходные данные каждого слоя для каждой позиции токена. Вместо того чтобы угадывать изменения весов, Dust оценивает, какие возмущения активаций снижают потери для каждого токена, используя эти данные для вывода соответствующих корректировок весов.
Этот подход создает «виртуальную популяцию». Один прямой проход с последовательностью из 2048 токенов фактически запускает 2048 параллельных экспериментов с возмущениями. Шум, который снижает потери в данной позиции токена, «поощряется», и эти взвешенные по вознаграждению сигналы затем усредняются для оценки градиента для каждого слоя.
На основе этих оценочных градиентов обновления весов вычисляются с использованием того же механизма, что и в backpropagation. Критическая разница заключается в том, что Dust получает свои оценки градиента путем проб и ошибок в пространстве активаций, а не с помощью исчисления через цепное правило. Этот инновационный метод представляет собой значительный отход от традиционных парадигм обучения.
Результаты оказались странными — и заслуживающими внимания
Первоначальные результаты Q Labs выявили ограниченную победу Dust. На более коротких циклах обучения (100 тыс. и 1 млн токенов) Dust превзошел настроенный backpropagation в достижении более умной модели. Хотя он не полностью догнал показатели на более длинных циклах, увеличение количества выборок постепенно сокращало разрыв в производительности: экстраполированные потери по степенному закону составили 4,43 для Dust против 4,63 для backpropagation на 20 млн токенов при больших бюджетных лимитах популяции.
При сравнении Dust с существующими методами нулевого порядка разница оказалась существенной. Dust показал себя значительно лучше, чем EGGROLL, даже когда EGGROLL получал в 256 раз больше выборок популяции. Это продемонстрировало превосходную эффективность Dust в оценке градиентов через активационные возмущения.
Пожалуй, наиболее контринтуитивно то, что более крупные протестированные модели оказались более эффективными с точки зрения популяции. Это преимущество масштабирования распространялось на модели до 243 миллионов параметров. Однако в этих экспериментах использовались небольшие модели в стиле GPT, основанные на modded-nanoGPT и наборе данных FineWeb, а не LLM промышленного масштаба, с которыми мы обычно сталкиваемся. Для получения дополнительных технических подробностей изучите Dust: Pretraining Transformers Without Backpropagation - Q Labs.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Подвох: умный метод, который стоит слишком дорого
Изобретательность Dust сопряжена со значительными вычислительными затратами. Параллелизм на уровне токенов, хотя и является инновационным, не сокращает общее количество GPU-часов или FLOP по сравнению с обратным распространением ошибки; он лишь перераспределяет их. Исследователи Q Labs прямо заявляют, что Dust требует на порядки больше вычислительных мощностей, что делает его непрактичным в качестве прямой замены обратного распространения ошибки на сегодняшний день, особенно для моделей, превышающих протестированные 243 миллиона параметров.
Краткосрочные приложения для методов обучения без производных, таких как Dust, вероятно, будут в областях, где обратное распространение ошибки затруднено из-за требования дифференцируемости. Это включает обучение моделей с недифференцируемыми компонентами, такими как:
- Внешние программы
- Сложные симуляторы
- Дискретные модули принятия решений
- Повторяющиеся самовызовы внутри архитектуры модели
Следите за улучшениями эффективности и разработкой гибридных методов обучения, которые сочетают гибкость Dust со скоростью обратного распространения ошибки. Такие подходы могут открыть путь к новым архитектурам, которые в настоящее время ограничены аналитической дифференцируемостью. Для тех, кто хочет изучить механику, Q Labs предоставляет подробные исследования на своем веб-сайте и реализацию с открытым исходным кодом на GitHub.
Часто задаваемые вопросы
Что такое Dust?
Dust — это экспериментальный метод обучения моделей трансформеров путем возмущения активаций и оценки направлений обучения на основе изменений функции потерь, без использования обратного распространения ошибки.
Как Dust избегает обратного распространения ошибки?
Он добавляет случайный шум к активациям слоев по позициям токенов, измеряет реакцию функции потерь и объединяет эти сигналы для оценки обновлений.
Превосходит ли Dust обратное распространение ошибки?
Он превзошел настроенное обратное распространение ошибки в некоторых коротких циклах обучения, но не показал общего преимущества в вычислительной эффективности при практических масштабах обучения.
Почему обучение без обратного распространения ошибки может быть важным?
Это может упростить обучение систем, включающих недифференцируемые операции, такие как внешние программы или симуляторы, которые не вписываются в стандартное обучение на основе градиентов.

