La règle des 40 ans que les chercheurs en IA veulent briser
Chaque modèle d'IA, des grands modèles de langage aux classificateurs d'images, s'entraîne en utilisant la backpropagation, un algorithme popularisé en 1986. Cette méthode fonctionne en faisant passer les données vers l'avant à travers un réseau neuronal pour effectuer des prédictions, en calculant une "perte" pour mesurer l'erreur, puis en utilisant la règle de dérivation en chaîne pour déterminer des gradients précis : comment chaque poids doit s'ajuster pour réduire cette erreur.
La puissance de la backpropagation réside dans son calcul efficace de ces gradients exacts, mais elle exige que chaque opération au sein du modèle soit dérivable. Cette contrainte nécessite souvent le stockage des activations intermédiaires pour la passe arrière, influençant presque tous les choix architecturaux et la conception matérielle du deep learning actuel. L'alternative, les stratégies évolutionnaires, consiste à deviner les ajustements de poids et à vérifier de manière itérative la réduction de la perte ; cependant, ces méthodes sont notoirement lentes en raison de la nécessité de multiples passes avant.
Les chercheurs de Q Labs remettent en question ce paradigme vieux de 40 ans avec Dust, une nouvelle approche d'entraînement pour les transformers. Dust étudie si un transformer peut apprendre efficacement par essais et erreurs, et non par calcul de gradient, en perturbant les activations plutôt que les poids. Cette recherche explore la question fondamentale de savoir si le machine learning peut s'affranchir de l'exigence de dérivabilité, permettant potentiellement de toutes nouvelles architectures de modèles non dérivables.
Dust transforme chaque jeton en une expérience
Les stratégies évolutionnaires ont longtemps offert une alternative à la backpropagation, mais elles opèrent traditionnellement dans l'espace des poids. Cela signifie qu'elles perturbent directement les paramètres d'un modèle, nécessitant une passe avant distincte pour chaque ensemble de poids perturbés afin d'évaluer son impact sur la perte. De telles méthodes sont "douloureusement lentes" en raison de la surcharge computationnelle de ces évaluations individuelles.
Dust, une nouvelle méthode de Q Labs, renverse ce paradigme en injectant un bruit aléatoire indépendant dans l'espace d'activation d'un modèle, plus précisément dans la sortie de chaque couche à chaque position de jeton. Au lieu de deviner les changements de poids, Dust estime quelles perturbations d'activation réduisent la perte pour chaque jeton, exploitant ces informations pour déduire les ajustements de poids appropriés.
Cette approche crée une "population virtuelle". Une seule passe avant avec une séquence de 2 048 jetons exécute efficacement 2 048 essais de perturbation parallèles. Le bruit qui réduit la perte à une position de jeton donnée est "récompensé", et ces signaux pondérés par la récompense sont ensuite moyennés pour estimer le gradient pour chaque couche.
À partir de ces gradients estimés, les mises à jour des poids sont calculées en utilisant le même mécanisme que la backpropagation. La différence critique est que Dust dérive ses estimations de gradient par essais et erreurs dans l'espace d'activation, plutôt que par le calcul via la règle de dérivation en chaîne. Cette méthode innovante représente un écart significatif par rapport aux paradigmes d'entraînement conventionnels.
Les résultats étaient étranges, et méritent d'être surveillés
Les résultats initiaux de Q Labs ont révélé une victoire limitée pour Dust. Sur des cycles d'entraînement plus courts (100k et 1M de jetons), Dust a surpassé la backpropagation optimisée en obtenant un modèle plus intelligent. Bien qu'il n'ait pas totalement rattrapé son retard sur des cycles plus longs, davantage d'échantillons ont progressivement réduit l'écart de performance, avec une perte extrapolée selon une loi de puissance de 4,43 pour Dust contre 4,63 pour la backpropagation à 20M de jetons sous de grands budgets de population.
En comparant Dust aux méthodes d'ordre zéro existantes, la distinction était substantielle. Dust a obtenu des performances nettement supérieures à EGGROLL, même lorsque EGGROLL bénéficiait de 256 fois plus d'échantillons de population. Cela a démontré l'efficacité supérieure de Dust dans l'estimation des gradients par le biais de perturbations d'activation.
Plus contre-intuitif encore, les modèles testés les plus grands semblaient plus efficaces en termes de population. Cet avantage de mise à l'échelle s'étendait aux modèles allant jusqu'à 243 millions de paramètres. Ces expériences ont toutefois utilisé de petits modèles de type GPT basés sur modded-nanoGPT et le jeu de données FineWeb, et non les LLM à l'échelle de production que nous rencontrons habituellement. Pour plus de détails techniques, explorez Dust: Pretraining Transformers Without Backpropagation - Q Labs.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Le piège : une méthode ingénieuse qui coûte trop cher
L'ingéniosité de Dust s'accompagne d'un coût computationnel considérable. Le parallélisme au niveau des jetons, bien qu'innovant, ne réduit pas le nombre total d'heures GPU ou de FLOP par rapport à la rétropropagation ; il les réalloue simplement. Les chercheurs de Q Labs déclarent explicitement que Dust nécessite des ordres de grandeur de calcul supplémentaires, ce qui le rend peu pratique en tant que remplacement direct de la rétropropagation aujourd'hui, en particulier pour les modèles dépassant les 243 millions de paramètres testés.
Les applications à court terme pour les méthodes d'entraînement sans dérivée comme Dust se situent probablement dans des domaines où la rétropropagation peine en raison de son exigence de différentiabilité. Cela inclut l'entraînement de modèles avec des composants non différentiables tels que :
- Programmes externes
- Simulateurs complexes
- Modules de prise de décision discrets
- Auto-appels répétés au sein de l'architecture du modèle
Surveillez les améliorations de l'efficacité et le développement de méthodes d'entraînement hybrides qui combinent la flexibilité de Dust avec la vitesse de la rétropropagation. De telles approches pourraient débloquer de nouvelles architectures actuellement limitées par la différentiabilité analytique. Pour ceux qui souhaitent examiner les mécanismes, Q Labs fournit des recherches détaillées sur leur site Web et une implémentation open-source sur GitHub.
Questions fréquemment posées
Qu'est-ce que Dust ?
Dust est une méthode expérimentale pour entraîner des modèles transformer en perturbant les activations et en estimant les directions d'apprentissage à partir des changements de perte, sans utiliser la rétropropagation.
Comment Dust évite-t-il la rétropropagation ?
Il ajoute du bruit aléatoire aux activations des couches à travers les positions des jetons, mesure la réponse de la perte et combine ces signaux pour estimer les mises à jour.
Dust surpasse-t-il la rétropropagation ?
Il a battu la rétropropagation ajustée lors de certains entraînements courts, mais il n'a pas montré d'avantage global en termes d'efficacité de calcul aux échelles d'entraînement pratiques.
Pourquoi l'entraînement sans rétropropagation pourrait-il être important ?
Cela pourrait faciliter l'entraînement de systèmes impliquant des opérations non différentiables, telles que des programmes externes ou des simulateurs, qui ne s'intègrent pas facilement dans l'entraînement standard basé sur le gradient.

