Skip to content
research

Les modèles d'IA auraient trouvé un moyen de contourner les jetons

Un vocabulaire minuscule ressemble à un raccourci, mais il s'accompagne d'une pénalité de vitesse coûteuse, ainsi que d'un avantage surprenant en matière d'entraînement. La véritable percée ne consiste peut-être pas tant à remplacer les chatbots actuels qu'à rendre les petits modèles plus faciles à entraîner.

Aki Tanaka
Les modèles d'IA auraient trouvé un moyen de contourner les jetons

Le raccourci de la tokenisation a un coût caché

Les grands modèles de langage (LLM) conventionnels fonctionnent en divisant le texte en sous-jetons (subword tokens), en puisant dans des vocabulaires étendus — Llama 3, par exemple, utilise environ 128 000 jetons de ce type. En revanche, les modèles d'octets (byte models) traitent le texte en utilisant seulement 256 symboles d'octets, représentant chaque caractère par sa valeur d'octet brute.

Ce raccourci de tokenisation, bien qu'efficace, introduit des limites arbitraires. Prenons le mot « tiramisu », qu'un tokeniseur pourrait fragmenter en T, IRAM et ISU. Une telle tokenisation rigide peut dégrader les performances en cas de fautes de frappe, de langues moins représentées et de code, où une compréhension précise au niveau des caractères est essentielle.

Historiquement, les modèles à jetons ont prévalu en raison de contraintes pratiques. Des séquences plus courtes, résultat direct de la tokenisation, rendaient l'entraînement et l'inférence réalisables avec des ressources de calcul limitées. Les modèles d'octets, malgré leur fidélité brute, accusaient un retard de performance dans ces conditions, ce qui a conduit à leur désuétude généralisée.

Le pont entre les logits de Llama et les octets bruts

Distiller les connaissances d'un grand professeur basé sur les jetons comme Llama 3 8B vers un petit étudiant basé sur les octets présente un défi fondamental. Le modèle professeur prédit des probabilités sur son vaste vocabulaire de 128 000 jetons, qu'un étudiant basé sur les octets, fonctionnant avec seulement 256 symboles, ne peut pas consommer directement. Ce décalage de distillation a historiquement empêché un entraînement efficace entre différents vocabulaires.

Les chercheurs ont résolu ce problème en introduisant un marqueur de fin de jeton (<eot>). Ce symbole spécial capture toute masse de probabilité qui serait autrement perdue lors de la traduction d'une prédiction de jeton en une séquence de prédictions d'octets. Par exemple, si un jeton comme « tiramisu » est décomposé en octets t, iram, isu, le marqueur <eot> garantit que la probabilité totale du jeton original est conservée à travers sa représentation en octets.

Ce mécanisme innovant permet un transfert de probabilité exact en un seul passage. En ajoutant le symbole <eot>, les chercheurs ont garanti que la distribution de probabilité complète du professeur pouvait être mappée précisément sur le vocabulaire de l'étudiant basé sur les octets sans approximation.

Cette percée permet aux petits modèles d'octets d'apprendre directement et efficacement à partir de modèles à jetons puissants et existants tels que Llama 3 8B. Elle élimine le besoin de tokeniseurs identiques entre le professeur et l'étudiant, ouvrant une nouvelle voie pour le développement de modèles de langage plus robustes et plus efficaces.

Pourquoi les octets pourraient gagner sur le long terme

Des chercheurs de Meta et de l'Université de Washington ont mené une expérience cruciale, entraînant des modèles étudiants d'environ 1 milliard de paramètres avec des données allant jusqu'à mille milliards d'octets. Ils ont distillé les connaissances d'un professeur Llama 3 8B, en convertissant méticuleusement ses prédictions basées sur les jetons en probabilités au niveau des octets.

Au début de l'entraînement, les modèles à jetons ont constamment surpassé leurs homologues basés sur les octets, un schéma courant dû à leur capacité à traiter plus d'informations sémantiques par étape. Cependant, à mesure que l'entraînement se prolongeait, les modèles d'octets ont démontré une courbe d'amélioration plus raide et plus soutenue, dépassant finalement les modèles à jetons.

Cet entraînement prolongé a révélé une efficacité frappante : les modèles d'octets distillés ont atteint des performances équivalentes à celles des modèles à jetons avec environ un sixième des données d'entraînement. Pour plus de détails sur la méthodologie, consultez l'article Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models.

L'avantage à long terme des byte models est significatif. Bien que les checkpoints actuels ne montrent pas encore le gain total, l'scaling-law extrapolation prévoit que les byte models pourraient atteindre jusqu'à quatre points de référence de plus que les token models. Cette projection, et non un score déjà réalisé, souligne leur potentiel dans les environnements d'entraînement riches en calcul.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Moins coûteux à entraîner, plus lents à répondre

Les distributions au niveau des octets offrent un avantage de stockage convaincant. Au lieu de s'appuyer sur une troncature top-k avec perte, les chercheurs ont préservé toutes les prédictions, réduisant le logit storage à environ un cinquième de l'espace requis pour les distributions de jetons conventionnelles. Cela permet une fidélité totale dans le processus de distillation, un facteur critique pour capturer le comportement nuancé du teacher model.

Cette efficacité introduit cependant un compromis lors de l'inférence. Les séquences d'octets sont généralement quatre à cinq fois plus longues que leurs équivalents tokenisés. Cette longueur étendue se traduit directement par une augmentation de l'inference time et potentiellement des besoins plus élevés en KV-cache memory, ce qui pose un défi pour les applications en temps réel et les déploiements aux ressources limitées.

Les byte models sont prometteurs pour les scénarios privilégiant des environnements d'entraînement riches en calcul et ceux vulnérables à la fragilité induite par les tokenizers, comme le traitement de nouvelles langues ou de jeux de caractères complexes. L'avantage projeté de quatre points de référence et la réduction des besoins en données d'entraînement sont significatifs. Cependant, leur vitesse pratique, les coûts de déploiement et la validation ultime de ce gain de performance projeté restent des domaines à approfondir.

Questions fréquemment posées

Qu'est-ce qu'un byte model ?

Un byte model lit le texte sous forme de séquences d'octets plutôt que de le diviser en sous-unités de jetons (tokens) issus d'un vocabulaire appris.

Comment Meta distille-t-il un token model en un byte model ?

La méthode mappe les probabilités de jetons du teacher model vers des octets et utilise un marqueur de fin de jeton pour préserver la distribution de probabilité complète.

Les byte models surpassent-ils déjà les token models ?

Les résultats rapportés montrent que les byte models s'améliorent avec plus d'entraînement, mais le gain projeté de quatre points de référence est une extrapolation, et non un résultat final mesuré.

Quel est le principal inconvénient des byte models ?

Leurs séquences sont généralement quatre à cinq fois plus longues que les séquences de jetons, ce qui peut rendre l'inférence plus lente et augmenter l'utilisation de la mémoire.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.