Skip to content
research

AIモデルがトークンを回避する方法を発見した可能性

小さな語彙は近道のように聞こえますが、コストのかかる速度低下と、驚くべき学習上の利点を伴います。真のブレイクスルーは、今日のチャットボットを置き換えることではなく、小さなモデルをより教えやすくすることにあるかもしれません。

Aki Tanaka
AIモデルがトークンを回避する方法を発見した可能性

トークナイザーという近道には隠れたコストがある

従来の大規模言語モデル(LLM)は、テキストを「サブワードトークン」に分割して処理し、広範な語彙から選択します。例えば、Llama 3は、約128,000個のトークンを使用します。対照的に、「バイトモデル」は、各文字を生のバイト値として表現し、わずか256個のバイトシンボルを使用してテキストを処理します。

このトークン化という近道は、効率的ではあるものの、恣意的な境界線を生み出します。「tiramisu」という単語を例にとると、トークナイザーはこれを「T」、「IRAM」、「ISU」に断片化する可能性があります。このような脆弱なトークン化は、誤字脱字、マイナーな言語、そして正確な文字レベルの理解が不可欠なコードにおいて、パフォーマンスを低下させる可能性があります。

歴史的に、トークンモデルが普及したのは実用的な制約によるものです。トークン化の直接的な結果である短いシーケンスにより、限られた計算リソースでも学習と推論が可能になりました。バイトモデルは、その生の忠実度にもかかわらず、これらの条件下ではパフォーマンスが低く、広く使用されるには至りませんでした。

Llamaのロジットから生のバイトへの架け橋

Llama 3 8Bのような大規模なトークンベースの教師モデルから、小さなバイトベースの学生モデルへ知識を蒸留することは、根本的な課題を提示します。教師モデルは128,000トークンという広大な語彙に対する確率を予測しますが、わずか256個のシンボルで動作するバイト学生モデルは、それを直接消費することができません。この「蒸留の不一致」が、歴史的に効率的なクロス語彙学習を妨げてきました。

研究者たちは、「トークン終了(<eot>)」マーカーを導入することでこれに対処しました。この特別なシンボルは、トークンの予測をバイト予測のシーケンスに変換する際に失われる可能性のある確率質量をすべて捕捉します。例えば、「tiramisu」のようなトークンが「t」、「iram」、「isu」というバイトに分割される場合、<eot>マーカーは、元のトークンの全確率がそのバイト表現全体で確実に保持されるようにします。

この革新的なメカニズムにより、1回のパスで「正確な確率転送」が可能になります。<eot>シンボルを追加することで、研究者たちは教師の完全な確率分布を、近似なしでバイト学生モデルの語彙に正確にマッピングすることを保証しました。

このブレイクスルーにより、小さなバイトモデルが、Llama 3 8Bのような強力で既存のトークンモデルから直接かつ効果的に学習できるようになります。教師モデルと学生モデルの間で同一のトークナイザーを使用する必要がなくなり、より堅牢で効率的な言語モデルを開発するための新しい道が開かれます。

学習が長期化する場合にバイトモデルが優位となる理由

Metaとワシントン大学の研究者は、重要な実験を行いました。約10億パラメータの学生モデルを、最大1兆バイトのデータで学習させたのです。彼らはLlama 3 8B教師モデルから知識を蒸留し、そのトークンベースの予測をバイトレベルの確率に細心の注意を払って変換しました。

学習の初期段階では、トークンモデルが一貫してバイトモデルを上回っていました。これは、ステップごとにより多くの意味情報を処理できるためによく見られるパターンです。しかし、学習が長期化するにつれて、バイトモデルはより急峻で持続的な改善曲線を示し、最終的にはトークンモデルを追い越しました。

この長期トレーニングにより、驚くべき効率性が明らかになりました。蒸留されたByte Modelsは、トークンモデルの約6分の1のトレーニングデータで同等のパフォーマンスを達成しました。手法の詳細については、論文『Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models』を参照してください。

Byte Modelsの長期的な利点は非常に大きいです。現在のチェックポイントではまだその利点が完全には現れていませんが、scaling-law extrapolation(スケーリング則の予測)によれば、Byte Modelsはトークンモデルよりもベンチマークスコアが最大で4ポイント向上する可能性があります。この予測は現時点での確定スコアではなく、計算リソースが豊富なトレーニング環境における潜在能力を示しています。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

学習は安価だが、回答は遅い

バイトレベルの分布は、ストレージにおいて魅力的な利点を提供します。損失の多いtop-k切り捨てに頼るのではなく、研究者はすべての予測を保持することで、logit storage(ロジットストレージ)を従来のトークン分布に必要なスペースの約5分の1に削減しました。これにより、蒸留プロセスにおいて完全な忠実度が維持され、教師モデルの微妙な挙動を捉える上で重要な要素となります。

しかし、この効率性は推論時にトレードオフをもたらします。バイトシーケンスは通常、トークン化されたものよりも4〜5倍長くなります。この長さの増加は、直接的にinference time(推論時間)の増加と、KV-cache memory requirements(KVキャッシュメモリ要件)の増大につながり、リアルタイムアプリケーションやリソースが制限された環境での展開において課題となります。

Byte Modelsは、計算リソースが豊富なトレーニング環境を優先する場合や、未知の言語や複雑な文字セットを扱う際など、トークナイザーに起因する脆弱性の影響を受けやすいシナリオにおいて有望です。予測される4ポイントのベンチマーク向上とトレーニングデータ要件の削減は非常に重要です。ただし、実用的な速度、展開コスト、そしてこの予測されたパフォーマンス向上の最終的な検証は、今後の調査課題として残されています。

よくある質問

Byte Modelとは何ですか?

Byte Modelは、学習済み語彙からサブワードトークンに分割するのではなく、テキストをバイトのシーケンスとして読み取ります。

MetaはどのようにしてトークンモデルをByte Modelに蒸留するのですか?

この手法では、教師モデルのトークン確率をバイトにマッピングし、エンドオブトークンマーカーを使用して完全な確率分布を保持します。

Byte Modelsはすでにトークンモデルを上回っていますか?

報告された結果では、Byte Modelsはトレーニングを重ねるごとに改善していますが、予測される4ポイントのベンチマーク向上は外挿によるものであり、測定された最終結果ではありません。

Byte Modelsの主な欠点は何ですか?

シーケンスが通常トークンシーケンスの4〜5倍長いため、推論が遅くなり、メモリ使用量が増加する可能性があります。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

ビルダーの方へ

このページは、他社のツールのために働いています。

AIエージェントが読み、購入検討層がたどり着きます。8言語とMCP経由で答えます。あなたのツールにも同じページを — 24時間以内に公開。