Конец эпохи «замороженных» моделей ИИ
Большинство больших языковых моделей (LLM) поставляются замороженными во времени, их знания ограничены моментом их масштабного обучения в дата-центрах. Спросите их о недавних событиях, и вы часто получите устаревшие ответы; они перестали учиться в день своего выпуска. Эта парадигма диктует, что только гиперскейлеры могут по-настоящему создавать такие сложные ИИ.
Новый класс ИИ, получивший название mini-AGI, фундаментально меняет эту модель. Разработанный для непрерывного обучения, он тренируется непосредственно на потребительском оборудовании — например, на MacBook Pro — и никогда не прекращает свою эволюцию. Он начинает с абсолютного нуля, буквально с набора случайных чисел, не имея никаких предварительных знаний.
Это не дообучение (fine-tuning), это обучение с нуля. Модель обрабатывает данные побайтово, впитывая информацию из непрерывного потока без определенной финишной черты. Она делает небольшие шаги в обучении после каждого фрагмента, постепенно накапливая понимание, подобно тому, как человек читает книгу с течением времени.
Традиционно обучение даже небольших моделей требовало значительного объема памяти — примерно в три-четыре раза больше, чем просто их запуск, — что делало это исключительной прерогативой гигантских дата-центров. mini-AGI демократизирует этот процесс, передавая мощь непрерывной разработки ИИ в руки отдельных пользователей прямо на их персональных компьютерах.
Как Mini-AGI побеждает ИИ-амнезию
Катастрофическое забывание представляет собой серьезную проблему для непрерывно обучающегося ИИ. Этот феномен описывает склонность модели ИИ перезаписывать существующие знания, например, владение английским языком, при дообучении на новой узкой теме, такой как шахматы. Стандартная модель может потерять половину своих общих знаний после специализации.
Mini-AGI решает эту проблему с помощью специализированной архитектуры Mixture-of-Experts (MoE). Модель состоит из двух различных компонентов: общего ядра и нескольких экспертов-специалистов. При изучении новой информации экспертам разрешается быстро адаптироваться, но общее ядро обновляется в десять раз медленнее. Этот механизм гарантирует, что новые знания в основном остаются внутри специалистов, сохраняя фундаментальное понимание, удерживаемое ядром, подобно ремонту комнат без нарушения фундамента здания. Mini-AGI сохранил 99,84% своих предыдущих знаний даже после интенсивного узкоспециализированного обучения.
Такая конструкция также обеспечивает замечательную эффективность использования памяти. Каждый эксперт существует как отдельный файл на диске. При обработке фрагмента текста система загружает в VRAM только те конкретные эксперты, которые необходимы. Это позволяет mini-AGI выходить далеко за рамки ограничений физической памяти потребительского GPU, поддерживая непрерывное обучение на персональном оборудовании, таком как MacBook.
От сказок на ночь до Тарантино
Пустая модель начала свой путь, будучи набором случайных чисел, не знающих языка. Исследователи сначала обучили её базовому английскому с помощью набора данных TinyStories, корпуса коротких детских сказок. В течение двух часов модель прошла путь от бессвязного набора звуков вроде «tousind wared therlound» до связных предложений, таких как «It's okay», — сказала Лили, установив фундаментальное владение английским языком.
Затем эксперимент переключился на внедрение в модель характерного стиля Квентина Тарантино. Исследователи загрузили в нее сценарии, включая Pulp Fiction, Jackie Brown и Django Unchained. Сначала mini-AGI быстро освоил форматирование сценария, создавая имена персонажей, таких как Орделл и Луис, заглавными буквами с правильными отступами за считанные минуты.
Однако возникли трудности. Модель начала смешивать только что освоенную структуру сценария со своими знаниями детских сказок. Персонажи в стиле Tarantino начали извиняться «как детсадовцы» («Стивен, мне жаль»), а уровень владения английским языком быстро снизился, превращая даже «Однажды в сказке» в фрагменты сценария. Это указывало на склонность к запоминанию конкретных текстов вместо обобщения стиля, а также на потенциал «катастрофического забывания».
Важно отметить, что когда исследователи дообучили модель на историях, она восстановила владение английским языком за считанные минуты, а не часы. Это быстрое восстановление показало, что ее исходные языковые знания не были стерты, а сохранились, вероятно, благодаря архитектуре mixture of experts, работающей с диском. Этот механизм, при котором общее ядро меняется медленнее, чем специализированные эксперты, позволяет mini-AGI сохранять предыдущие знания. Более подробную техническую информацию о дизайне можно найти по ссылке: GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data..
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Вердикт: Блестящий Франкенштейн
Эксперимент привел к своеобразному результату: модели-«Франкенштейну», способной имитировать формат сценария Tarantino с точными отступами и именами персонажей, написанными заглавными буквами, такими как Орделл, Луис и Шульц из таких фильмов, как Pulp Fiction и Jackie Brown. Однако диалоги представляли собой странный сплав, смешивающий детские извинения («Стивен, мне жаль») с суровой эстетикой режиссера. Владение английским языком ухудшилось, сводя даже «Однажды в сказке» к фрагментарным сценарным репликам.
Этот результат «Франкенштейна», однако, затмевает истинный триумф проекта. Mini-AGI продемонстрировала continual learning на потребительском оборудовании — в частности, на MacBook Pro с чипом M2 Max и 32 гигабайтами оперативной памяти. Что критически важно, она в значительной степени избежала «catastrophic forgetting». После изучения восьми разнообразных тем, таких как истории, код и математика, а затем обработки полумиллиона символов шахматных партий, модель сохранила 99,84% своих предыдущих знаний, что резко контрастирует с типичными моделями, теряющими половину.
Эта устойчивость обусловлена ее архитектурой: общее ядро, которое меняется в 10 раз медленнее, чем специализированные эксперты, эффективно загружаемые по мере необходимости с диска, что позволяет модели быть больше, чем объем памяти GPU. Хотя mini-AGI остается «игрушечной» моделью, а не настоящим AGI, она предлагает убедительное видение будущего. Она доказывает возможность создания персонализированных, постоянно развивающихся моделей ИИ, способных учиться вместе с нами без необходимости в ресурсах уровня дата-центров и без потери прошлого опыта.
Часто задаваемые вопросы
Что такое mini-AGI?
Mini-AGI — это языковая модель игрушечного масштаба, предназначенная для непрерывного обучения (continual learning) на потребительском оборудовании. Она может быть обучена с нуля и спроектирована так, чтобы усваивать новую информацию, не перезаписывая и не забывая предыдущие знания.
Как mini-AGI предотвращает «катастрофическое забывание»?
Она использует двухкомпонентную структуру: общее ядро, которое обучается в 10 раз медленнее для сохранения фундаментальных знаний, и специализированные модели-«эксперты», которые быстро усваивают новую информацию. Это изолирует процесс обучения новому, не нарушая базовые способности модели.
Что такое модель Mixture-of-Experts (MoE)?
Модель MoE состоит из множества небольших специализированных нейронных сетей (экспертов) и механизма маршрутизации (gating), который направляет входные данные наиболее подходящему эксперту. Это делает их высокоэффективными, так как в любой момент времени активна лишь часть модели.
Могу ли я использовать mini-AGI для своего бизнеса?
Нет. Автор проекта прямо называет ее «моделью игрушечного масштаба», которая не подходит для промышленного использования. Это исследовательский проект и концептуальное доказательство (proof-of-concept), демонстрирующее новый подход к обучению ИИ.

