Skip to content
research

AI-модели, возможно, нашли способ обойти токены

Крошечный словарь кажется быстрым решением, но он влечет за собой высокую плату в виде снижения скорости — и неожиданное преимущество при обучении. Настоящий прорыв может заключаться не в замене современных чат-ботов, а в том, чтобы сделать небольшие модели более простыми в обучении.

Aki Tanaka
AI-модели, возможно, нашли способ обойти токены

У «сокращенного пути» токенизации есть скрытая цена

Обычные большие языковые модели (LLM) работают путем разбиения текста на подсловесные токены, используя обширные словари — например, Llama 3 использует около 128 000 таких токенов. В отличие от них, байтовые модели обрабатывают текст, используя всего 256 байтовых символов, представляя каждый знак как его исходное байтовое значение.

Этот «сокращенный путь» токенизации, несмотря на свою эффективность, создает произвольные границы. Возьмем слово «тирамису», которое токенизатор может разбить на T, IRAM и ISU. Такая хрупкая токенизация может снизить производительность при наличии опечаток, использовании менее распространенных языков и программного кода, где критически важно точное понимание на уровне символов.

Исторически модели на основе токенов преобладали из-за практических ограничений. Более короткие последовательности, ставшие прямым результатом токенизации, сделали обучение и инференс возможными на ограниченных вычислительных ресурсах. Байтовые модели, несмотря на свою исходную точность, отставали по производительности в таких условиях, что привело к их повсеместному отказу.

Мост от логитов Llama к «сырым» байтам

Передача знаний от крупной модели-учителя на основе токенов, такой как Llama 3 8B, к небольшой модели-ученику на основе байтов представляет собой фундаментальную проблему. Модель-учитель предсказывает вероятности для своего обширного словаря из 128 000 токенов, которые байтовый ученик, работающий всего с 256 символами, не может напрямую воспринять. Это несоответствие дистилляции исторически препятствовало эффективному обучению между разными словарями.

Исследователи решили эту проблему, введя маркер end-of-token (<eot>). Этот специальный символ фиксирует любую вероятность, которая в противном случае была бы потеряна при переводе предсказания токена в последовательность предсказаний байтов. Например, если токен «тирамису» разбивается на байты t, iram, isu, маркер <eot> гарантирует, что полная вероятность исходного токена сохраняется в его байтовом представлении.

Этот инновационный механизм обеспечивает точный перенос вероятностей за один проход. Добавляя символ <eot>, исследователи гарантировали, что полное распределение вероятностей учителя может быть точно сопоставлено со словарем байтового ученика без аппроксимации.

Этот прорыв позволяет небольшим байтовым моделям учиться напрямую и эффективно у мощных существующих токеновых моделей, таких как Llama 3 8B. Это устраняет необходимость в идентичных токенизаторах у учителя и ученика, открывая новый путь для разработки более надежных и эффективных языковых моделей.

Почему байты могут победить при длительном обучении

Исследователи из Meta и Вашингтонского университета провели критически важный эксперимент, обучив модели-ученики с примерно 1 миллиардом параметров на данных объемом до одного триллиона байтов. Они дистиллировали знания от учителя Llama 3 8B, тщательно преобразуя его предсказания на основе токенов в вероятности на уровне байтов.

На ранних этапах обучения модели на основе токенов неизменно превосходили свои байтовые аналоги — это обычная закономерность, обусловленная их способностью обрабатывать больше семантической информации за один шаг. Однако по мере продления обучения байтовые модели демонстрировали более крутую и устойчивую кривую улучшения, в конечном итоге превзойдя токеновые модели.

Это длительное обучение выявило поразительную эффективность: дистиллированные байтовые модели достигли производительности, сопоставимой с токеновыми моделями, при использовании примерно одной шестой части объема обучающих данных. Дополнительные подробности о методологии можно найти в статье Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models.

Долгосрочное преимущество байтовых моделей значительно. Хотя текущие чекпоинты еще не демонстрируют полного прироста, scaling-law extrapolation (экстраполяция законов масштабирования) прогнозирует, что байтовые модели могут достичь результатов на 4 балла выше, чем токеновые модели. Этот прогноз, а не уже достигнутый показатель, подчеркивает их потенциал в средах обучения с большими вычислительными мощностями.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Дешевле в обучении, медленнее в ответах

Байтовые распределения предлагают существенное преимущество в хранении данных. Вместо использования потерь при top-k усечении, исследователи сохранили все предсказания, сократив logit storage (хранилище логитов) примерно до одной пятой от объема, необходимого для обычных токеновых распределений. Это обеспечивает полную точность процесса дистилляции, что является критическим фактором для фиксации нюансов поведения модели-учителя.

Однако эта эффективность создает компромисс во время инференса. Байтовые последовательности обычно в четыре-пять раз длиннее своих токенизированных аналогов. Эта увеличенная длина напрямую приводит к росту inference time (времени инференса) и потенциально более высоким KV-cache memory requirements (требованиям к памяти KV-кэша), что создает проблему для приложений реального времени и развертывания в условиях ограниченных ресурсов.

Байтовые модели показывают перспективы для сценариев, где приоритетом являются вычислительно насыщенные среды обучения и устойчивость к проблемам, вызванным токенизаторами, например, при работе с редкими языками или сложными наборами символов. Прогнозируемое преимущество в четыре балла и снижение требований к объему обучающих данных весьма значительны. Тем не менее, их практическая скорость, стоимость развертывания и окончательное подтверждение этого прогнозируемого прироста производительности остаются областями для дальнейших исследований.

Часто задаваемые вопросы

Что такое байтовая модель?

Байтовая модель считывает текст как последовательности байтов, вместо того чтобы разбивать его на подсловесные токены из заранее изученного словаря.

Как Meta дистиллирует токеновую модель в байтовую?

Этот метод отображает вероятности токенов модели-учителя на байты и использует маркер конца токена для сохранения полного распределения вероятностей.

Превосходят ли байтовые модели токеновые уже сейчас?

Представленные результаты показывают, что байтовые модели улучшаются по мере обучения, но прогнозируемый прирост в четыре балла — это экстраполяция, а не измеренный финальный результат.

В чем главный недостаток байтовых моделей?

Их последовательности обычно в четыре-пять раз длиннее токеновых, что может замедлить инференс и увеличить потребление памяти.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.