Skip to content
research

KI-Modelle haben möglicherweise einen Weg an Tokens vorbei gefunden

Ein winziges Vokabular klingt nach einer Abkürzung, bringt aber einen kostspieligen Geschwindigkeitsnachteil mit sich – und einen überraschenden Trainingsvorteil. Der eigentliche Durchbruch besteht vielleicht weniger darin, die heutigen Chatbots zu ersetzen, als vielmehr darin, kleine Modelle leichter trainierbar zu machen.

Aki Tanaka
KI-Modelle haben möglicherweise einen Weg an Tokens vorbei gefunden

Die Tokenizer-Abkürzung hat versteckte Kosten

Herkömmliche Large Language Models (LLMs) funktionieren, indem sie Text in Subword-Tokens zerlegen und dabei auf umfangreiche Vokabulare zurückgreifen – Llama 3 verwendet beispielsweise etwa 128.000 solcher Tokens. Im Gegensatz dazu verarbeiten Byte-Modelle Text unter Verwendung von lediglich 256 Byte-Symbolen, wobei jedes Zeichen als sein roher Byte-Wert dargestellt wird.

Diese Tokenisierungs-Abkürzung ist zwar effizient, führt aber willkürliche Grenzen ein. Betrachten wir das Wort „Tiramisu“, das ein Tokenizer in T, IRAM und ISU zerlegen könnte. Eine solch fragile Tokenisierung kann die Leistung bei Tippfehlern, weniger repräsentierten Sprachen und Code beeinträchtigen, wo ein präzises Verständnis auf Zeichenebene entscheidend ist.

Historisch gesehen setzten sich Token-Modelle aufgrund praktischer Einschränkungen durch. Kürzere Sequenzen, ein direktes Ergebnis der Tokenisierung, machten Training und Inferenz auf begrenzten Rechenressourcen erst möglich. Byte-Modelle blieben trotz ihrer rohen Genauigkeit unter diesen Bedingungen leistungsschwach, was zu ihrer weitgehenden Nichtverwendung führte.

Die Brücke von Llamas Logits zu rohen Bytes

Die Wissensdestillation von einem großen tokenbasierten Lehrer wie Llama 3 8B auf einen kleinen bytebasierten Schüler stellt eine grundlegende Herausforderung dar. Das Lehrermodell sagt Wahrscheinlichkeiten über sein umfangreiches 128.000-Token-Vokabular voraus, was ein Byte-Schüler, der mit lediglich 256 Symbolen arbeitet, nicht direkt verarbeiten kann. Dieses Destillations-Mismatch verhinderte bisher ein effizientes Training über Vokabulare hinweg.

Forscher lösten dies durch die Einführung eines End-of-Token (<eot>)-Markers. Dieses spezielle Symbol erfasst jede Wahrscheinlichkeitsmasse, die sonst bei der Übersetzung einer Token-Vorhersage in eine Sequenz von Byte-Vorhersagen verloren gehen würde. Wenn zum Beispiel ein Token wie „Tiramisu“ in die Bytes t, iram, isu zerlegt wird, stellt der <eot>-Marker sicher, dass die volle Wahrscheinlichkeit des ursprünglichen Tokens über seine Byte-Repräsentation hinweg erhalten bleibt.

Dieser innovative Mechanismus ermöglicht eine exakte Wahrscheinlichkeitsübertragung in einem einzigen Durchgang. Durch das Anhängen des <eot>-Symbols garantierten die Forscher, dass die vollständige Wahrscheinlichkeitsverteilung des Lehrers präzise auf das Vokabular des Byte-Schülers abgebildet werden konnte, ohne Annäherungen.

Dieser Durchbruch ermöglicht es kleinen Byte-Modellen, direkt und effektiv von leistungsstarken, existierenden Token-Modellen wie Llama 3 8B zu lernen. Er macht identische Tokenizer zwischen Lehrer und Schüler überflüssig und eröffnet einen neuen Weg zur Entwicklung robusterer und effizienterer Sprachmodelle.

Warum Bytes bei langem Training gewinnen könnten

Forscher von Meta und der University of Washington führten ein entscheidendes Experiment durch, bei dem sie Schülermodelle mit etwa 1 Milliarde Parametern mit Daten von bis zu einer Billion Bytes trainierten. Sie destillierten Wissen von einem Llama 3 8B-Lehrer und wandelten dessen tokenbasierte Vorhersagen akribisch in Byte-Level-Wahrscheinlichkeiten um.

Zu Beginn des Trainings übertrafen Token-Modelle ihre Byte-Pendants durchweg – ein häufiges Muster, da sie pro Schritt mehr semantische Informationen verarbeiten können. Mit zunehmender Trainingsdauer zeigten die Byte-Modelle jedoch eine steilere und nachhaltigere Verbesserungskurve und übertrafen schließlich die Token-Modelle.

Dieses erweiterte Training offenbarte eine bemerkenswerte Effizienz: Destillierte Byte-Modelle erreichten eine Leistung, die der von Token-Modellen entsprach, bei nur etwa einem Sechstel der Trainingsdaten. Weitere Details zur Methodik finden Sie im Paper Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models.

Der langfristige Vorteil von Byte-Modellen ist signifikant. Während aktuelle Checkpoints noch nicht den vollen Gewinn zeigen, prognostiziert die scaling-law extrapolation, dass Byte-Modelle bis zu vier Benchmark-Punkte besser abschneiden könnten als Token-Modelle. Diese Prognose, die noch kein realisiertes Ergebnis darstellt, unterstreicht ihr Potenzial in rechenintensiven Trainingsumgebungen.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Günstiger im Training, langsamer in der Antwort

Byte-Level-Verteilungen bieten einen überzeugenden Speichervorteil. Anstatt sich auf verlustbehaftete Top-k-Kürzungen zu verlassen, bewahrten die Forscher alle Vorhersagen, wodurch der logit storage auf etwa ein Fünftel des Platzbedarfs herkömmlicher Token-Verteilungen reduziert wurde. Dies ermöglicht eine vollständige Wiedergabetreue im Destillationsprozess, ein entscheidender Faktor für die Erfassung des nuancierten Verhaltens von Teacher-Modellen.

Diese Effizienz führt jedoch zu einem Kompromiss bei der Inferenz. Byte-Sequenzen sind typischerweise vier- bis fünfmal länger als ihre tokenisierten Pendants. Diese verlängerte Länge führt direkt zu einer erhöhten inference time und potenziell höheren KV-cache memory requirements, was eine Herausforderung für Echtzeitanwendungen und ressourcenbeschränkte Bereitstellungen darstellt.

Byte-Modelle sind vielversprechend für Szenarien, die rechenintensive Trainingsumgebungen priorisieren und anfällig für durch Tokenizer verursachte Instabilität sind, wie etwa bei der Handhabung neuer Sprachen oder komplexer Zeichensätze. Der prognostizierte Benchmark-Vorsprung von vier Punkten und der geringere Bedarf an Trainingsdaten sind signifikant. Ihre praktische Geschwindigkeit, die Bereitstellungskosten und die endgültige Validierung dieses prognostizierten Leistungszuwachses bleiben jedoch Bereiche für weitere Untersuchungen.

Häufig gestellte Fragen

Was ist ein Byte-Modell?

Ein Byte-Modell liest Text als Byte-Sequenzen, anstatt ihn in Subword-Token aus einem gelernten Vokabular zu unterteilen.

Wie destilliert Meta ein Token-Modell in ein Byte-Modell?

Die Methode bildet die Token-Wahrscheinlichkeiten des Teachers auf Bytes ab und verwendet eine End-of-Token-Markierung, um die vollständige Wahrscheinlichkeitsverteilung zu bewahren.

Übertreffen Byte-Modelle bereits Token-Modelle?

Die berichteten Ergebnisse zeigen, dass sich Byte-Modelle mit mehr Training verbessern, aber der prognostizierte Benchmark-Gewinn von vier Punkten ist eine Extrapolation, kein gemessenes Endergebnis.

Was ist der Hauptnachteil von Byte-Modellen?

Ihre Sequenzen sind typischerweise vier- bis fünfmal länger als Token-Sequenzen, was die Inferenz verlangsamen und den Speicherverbrauch erhöhen kann.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.