Die 40-Jahre-Regel, die KI-Forscher brechen wollen
Jedes KI-Modell, von Large Language Models bis hin zu Bildklassifikatoren, trainiert mithilfe von backpropagation, einem Algorithmus, der 1986 populär wurde. Diese Methode funktioniert, indem Daten vorwärts durch ein neuronales Netzwerk geleitet werden, um Vorhersagen zu treffen, ein "Loss" zur Fehlermessung berechnet wird und dann die Kettenregel der Analysis verwendet wird, um präzise Gradienten zu bestimmen – also wie jedes Gewicht angepasst werden sollte, um diesen Fehler zu reduzieren.
Die Stärke von Backpropagation liegt in der effizienten Berechnung dieser exakten Gradienten, erfordert jedoch, dass jede Operation innerhalb des Modells differenzierbar ist. Diese Einschränkung macht es oft notwendig, Zwischenaktivierungen für den Rückwärtsdurchlauf zu speichern, was fast jede architektonische Entscheidung und jedes Hardware-Design im heutigen Deep Learning beeinflusst. Die Alternative, evolutionäre Strategien, beinhaltet das Raten von Gewichtsanpassungen und die iterative Überprüfung auf Loss-Reduzierung; diese Methoden sind jedoch aufgrund der Notwendigkeit mehrerer Vorwärtsdurchläufe bekanntermaßen langsam.
Forscher bei Q Labs fordern dieses 40 Jahre alte Paradigma mit Dust heraus, einem neuartigen Trainingsansatz für Transformer. Dust untersucht, ob ein Transformer effektiv durch Versuch und Irrtum lernen kann, anstatt durch Gradientenberechnung, indem Aktivierungen anstelle von Gewichten gestört werden. Diese Forschung geht der grundlegenden Frage nach, ob maschinelles Lernen sich von der Differenzierbarkeitsanforderung befreien kann, was potenziell völlig neue, nicht-differenzierbare Modellarchitekturen ermöglichen könnte.
Dust macht aus jedem Token ein Experiment
Evolutionäre Strategien bieten schon lange eine Alternative zu Backpropagation, operieren aber traditionell im weight space. Das bedeutet, sie stören die Parameter eines Modells direkt, was für jeden Satz gestörter Gewichte einen separaten Vorwärtsdurchlauf erfordert, um deren Auswirkungen auf den Loss zu bewerten. Solche Methoden sind aufgrund des Rechenaufwands dieser individuellen Auswertungen "schmerzhaft langsam".
Dust, eine neuartige Methode von Q Labs, kehrt dieses Paradigma um, indem unabhängiges Rauschen in den activation space eines Modells injiziert wird – spezifisch in den Output jeder Schicht an jeder Token-Position. Anstatt Gewichtsänderungen zu raten, schätzt Dust, welche Aktivierungsstörungen den Loss für jedes Token reduzieren, und nutzt diese Erkenntnisse, um auf geeignete Gewichtsanpassungen zu schließen.
Dieser Ansatz schafft eine "virtuelle Population". Ein einzelner Vorwärtsdurchlauf mit einer Sequenz von 2.048 Token führt effektiv 2.048 parallele Störungsexperimente durch. Das Rauschen, das den Loss an einer bestimmten Token-Position senkt, wird "belohnt", und diese belohnungsgewichteten Signale werden dann gemittelt, um den Gradienten für jede Schicht zu schätzen.
Aus diesen geschätzten Gradienten werden Gewichtsaktualisierungen unter Verwendung desselben Mechanismus wie bei Backpropagation berechnet. Der entscheidende Unterschied ist, dass Dust seine Gradientenschätzungen aus Versuch und Irrtum innerhalb des Aktivierungsraums ableitet, anstatt aus der Analysis mittels Kettenregel. Diese innovative Methode stellt eine signifikante Abkehr von konventionellen Trainingsparadigmen dar.
Die Ergebnisse waren seltsam – und es wert, beobachtet zu werden
Erste Ergebnisse von Q Labs zeigten einen begrenzten Sieg für Dust. Bei kürzeren Trainingsläufen (100k und 1M Token) übertraf Dust die abgestimmte backpropagation beim Erreichen eines intelligenteren Modells. Obwohl es bei längeren Läufen nicht ganz aufholte, verringerten mehr Stichproben schrittweise die Leistungslücke, mit einem extrapolierten Power-Law-angepassten Loss von 4,43 für Dust gegenüber 4,63 für Backpropagation bei 20M Token unter großen Populationsbudgets.
Beim Vergleich von Dust mit bestehenden Methoden nullter Ordnung war der Unterschied erheblich. Dust schnitt deutlich besser ab als EGGROLL, selbst wenn EGGROLL 256-mal mehr Populationsstichproben erhielt. Dies demonstrierte die überlegene Effizienz von Dust bei der Schätzung von Gradienten durch Aktivierungsstörungen.
Vielleicht am kontraintuitivsten war, dass größere getestete Modelle populations-effizienter zu sein schienen. Dieser Skalierungsvorteil erstreckte sich auf Modelle mit bis zu 243 Millionen Parametern. Diese Experimente verwendeten jedoch kleine GPT-artige Modelle, die auf modded-nanoGPT und dem FineWeb-Datensatz basierten, nicht auf den LLMs im Produktionsmaßstab, denen wir normalerweise begegnen. Weitere technische Details finden Sie unter Dust: Pretraining Transformers Without Backpropagation - Q Labs.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Der Haken: Eine clevere Methode, die zu viel kostet
Der Einfallsreichtum von Dust ist mit erheblichen Rechenkosten verbunden. Die Parallelisierung auf Token-Ebene ist zwar innovativ, reduziert jedoch nicht die gesamten GPU-Stunden oder FLOPs im Vergleich zur Backpropagation; sie ordnet sie lediglich neu zu. Die Forscher von Q Labs geben ausdrücklich an, dass Dust um Größenordnungen mehr Rechenleistung erfordert, was es heute als direkten Ersatz für Backpropagation unpraktisch macht, insbesondere für Modelle, die die getesteten 243 Millionen Parameter überschreiten.
Kurzfristige Anwendungen für ableitungsfreie Trainingsmethoden wie Dust liegen wahrscheinlich in Bereichen, in denen Backpropagation aufgrund ihrer Differenzierbarkeitsanforderung Schwierigkeiten hat. Dazu gehört das Training von Modellen mit nicht differenzierbaren Komponenten wie:
- Externen Programmen
- Komplexen Simulatoren
- Diskreten Entscheidungsmodulen
- Wiederholten Selbstaufrufen innerhalb der Modellarchitektur
Achten Sie auf Effizienzverbesserungen und die Entwicklung von hybriden Trainingsmethoden, die die Flexibilität von Dust mit der Geschwindigkeit von Backpropagation kombinieren. Solche Ansätze könnten neuartige Architekturen erschließen, die derzeit durch analytische Differenzierbarkeit eingeschränkt sind. Für diejenigen, die die Mechanismen untersuchen möchten, bietet Q Labs detaillierte Forschungsergebnisse auf ihrer Website und eine Open-Source-Implementierung auf GitHub.
Häufig gestellte Fragen
Was ist Dust?
Dust ist eine experimentelle Methode zum Training von Transformer-Modellen durch Störung von Aktivierungen und Schätzung von Lernrichtungen aus Änderungen des Verlusts, ohne Backpropagation zu verwenden.
Wie vermeidet Dust Backpropagation?
Es fügt den Schichtaktivierungen über Token-Positionen hinweg zufälliges Rauschen hinzu, misst, wie der Verlust reagiert, und kombiniert diese Signale, um Updates zu schätzen.
Übertrifft Dust Backpropagation?
Es hat in einigen kurzen Trainingsläufen eine optimierte Backpropagation geschlagen, aber es hat bei praktischen Trainingsmaßstäben keinen allgemeinen Vorteil bei der Recheneffizienz gezeigt.
Warum könnte das Training ohne Backpropagation wichtig sein?
Es könnte das Training von Systemen erleichtern, die nicht differenzierbare Operationen beinhalten, wie externe Programme oder Simulatoren, die nicht sauber in das standardmäßige gradientenbasierte Training passen.

