La fin des modèles d'IA figés
La plupart des grands modèles de langage (LLM) arrivent figés dans le temps, leurs connaissances étant limitées au moment de leur entraînement massif en centre de données. Interrogez-les sur des événements récents, et vous recevrez souvent des réponses obsolètes ; ils ont cessé d'apprendre le jour de leur déploiement. Ce paradigme impose que seuls les hyperscalers peuvent réellement construire ces IA sophistiquées.
Une nouvelle classe d'IA, baptisée mini-AGI, modifie fondamentalement ce modèle. Conçue pour un apprentissage continu, elle s'entraîne directement sur du matériel grand public — un MacBook Pro, par exemple — sans jamais cesser son évolution. Elle part de zéro absolu, littéralement une collection de nombres aléatoires, dépourvue de toute connaissance préexistante.
Il ne s'agit pas de fine-tuning, mais d'un apprentissage à partir de zéro. Le modèle traite les données octet par octet, absorbant les informations à partir d'un flux continu sans ligne d'arrivée définie. Il effectue de petites étapes d'apprentissage après chaque segment, accumulant la compréhension de manière incrémentale, tout comme une personne lisant un livre au fil du temps.
Traditionnellement, l'entraînement de modèles même petits exigeait une mémoire importante — environ trois à quatre fois plus que la simple exécution — ce qui en faisait un domaine exclusif aux centres de données géants. La mini-AGI démocratise ce processus, mettant la puissance du développement continu de l'IA entre les mains des individus, directement sur leurs ordinateurs personnels.
Comment la mini-AGI vainc l'amnésie de l'IA
L'oubli catastrophique pose un défi majeur pour l'IA à apprentissage continu. Ce phénomène décrit la tendance d'un modèle d'IA à écraser les connaissances existantes, comme la maîtrise de l'anglais, lorsqu'il est affiné sur un nouveau sujet restreint, tel que les échecs. Un modèle standard pourrait perdre la moitié de ses connaissances générales après s'être spécialisé.
La mini-AGI résout ce problème grâce à une architecture spécialisée Mixture-of-Experts (MoE). Le modèle comprend deux composants distincts : un noyau partagé et plusieurs experts spécialisés. Lors de l'apprentissage de nouvelles informations, les experts sont autorisés à s'adapter rapidement, mais le noyau partagé se met à jour à un rythme dix fois plus lent. Ce mécanisme garantit que les nouvelles connaissances résident principalement chez les spécialistes, préservant la compréhension fondamentale détenue par le noyau, un peu comme rénover des pièces sans toucher aux fondations d'un bâtiment. La mini-AGI a conservé 99,84 % de ses connaissances antérieures même après un entraînement intensif et ciblé.
Cette conception offre également une efficacité mémoire remarquable. Chaque expert existe en tant que fichier séparé sur le disque. Lors du traitement d'un segment de texte, le système ne charge dans la VRAM que les experts spécifiques requis. Cela permet à la mini-AGI de dépasser largement les contraintes de mémoire physique d'un GPU grand public, prenant en charge l'apprentissage continu sur du matériel personnel comme un MacBook.
Des histoires pour dormir à Tarantino
Un modèle vierge a commencé son voyage, une collection de nombres aléatoires ne connaissant aucune langue. Les chercheurs lui ont d'abord enseigné l'anglais de base en utilisant le TinyStories dataset, un corpus de courtes histoires pour enfants. En deux heures, le modèle est passé d'un charabia comme « tousind wared therlound » à des phrases cohérentes telles que « It's okay », a dit Lily, établissant une maîtrise fondamentale de l'anglais.
Ensuite, l'expérience a consisté à imprégner le modèle du style distinctif de Quentin Tarantino. Les chercheurs l'ont nourri de scénarios incluant Pulp Fiction, Jackie Brown et Django Unchained. Au départ, la mini-AGI a rapidement saisi le formatage des scénarios, produisant des noms de personnages comme Ordell et Louis en majuscules avec une indentation appropriée en quelques minutes.
Cependant, des défis ont émergé. Le modèle a commencé à mélanger sa structure de scénario nouvellement acquise avec ses connaissances en contes pour enfants. Les personnages de Tarantino ont commencé à s'excuser « comme des enfants de maternelle » (« Stephen, je suis désolé »), et sa maîtrise de l'anglais s'est rapidement dégradée, transformant même « Il était une fois » en fragments de scénario. Cela indiquait une tendance à mémoriser des scripts spécifiques plutôt qu'à généraliser le style, ainsi qu'un risque d'oubli catastrophique.
Il est crucial de noter que lorsque les chercheurs ont réentraîné le modèle sur des histoires, il a retrouvé sa maîtrise de l'anglais en quelques minutes seulement, et non en quelques heures. Cette récupération rapide a démontré que ses connaissances linguistiques initiales n'étaient pas effacées mais préservées, probablement au sein de son architecture mixture of experts basée sur le disque. Ce mécanisme, où un noyau partagé évolue plus lentement que des experts spécialisés, permet au mini-AGI de conserver ses apprentissages antérieurs. Pour plus de détails techniques sur sa conception, consultez GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data..
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Le verdict : Un brillant Frankenstein
L'expérience a donné un résultat curieux : un modèle Frankenstein, capable d'imiter le format de scénario de Tarantino avec une indentation précise et des noms de personnages en majuscules comme Ordell, Louis et Schultz, issus de films tels que Pulp Fiction et Jackie Brown. Cependant, ses dialogues étaient une fusion bizarre, mélangeant des excuses enfantines (« Stephen, je suis désolé ») avec l'esthétique brute du réalisateur. La maîtrise de l'anglais s'est dégradée, réduisant même « Il était une fois » à des indices de script fragmentés.
Ce résultat « Frankenstein », cependant, occulte le véritable triomphe du projet. Le mini-AGI a démontré un continual learning sur du matériel grand public, spécifiquement un MacBook Pro M2 Max avec 32 gigaoctets de RAM. Surtout, il a largement évité l'oubli catastrophique. Après avoir appris huit sujets divers comme les histoires, le code et les mathématiques, puis avoir été exposé à un demi-million de caractères d'échecs, le modèle a conservé 99,84 % de ses connaissances antérieures, un contraste frappant avec les modèles typiques qui en perdent la moitié.
Cette résilience provient de son architecture : un noyau partagé qui change 10 fois plus lentement que ses experts spécialisés, lesquels sont chargés efficacement depuis le disque selon les besoins, permettant au modèle d'être plus grand que la mémoire du GPU. Bien que le mini-AGI reste un « jouet » et non une véritable AGI, il offre une vision convaincante. Il prouve la faisabilité de modèles d'IA personnalisés et en constante évolution, capables d'apprendre à nos côtés sans nécessiter de ressources à l'échelle d'un centre de données ni oublier leur passé.
Foire aux questions
Qu'est-ce que le mini-AGI ?
Le mini-AGI est un modèle de langage à l'échelle d'un jouet conçu pour le continual learning sur du matériel grand public. Il peut être entraîné à partir de zéro et est architecturé pour apprendre de nouvelles informations sans écraser ou oublier les connaissances précédentes.
Comment le mini-AGI empêche-t-il l'« oubli catastrophique » ?
Il utilise une structure en deux parties : un noyau partagé qui apprend 10 fois plus lentement pour préserver les connaissances fondamentales, et des modèles « experts » spécialisés qui apprennent rapidement de nouvelles informations. Cela isole le nouvel apprentissage sans perturber les capacités fondamentales du modèle.
Qu'est-ce qu'un modèle Mixture-of-Experts (MoE) ?
Un modèle MoE est composé de plusieurs réseaux de neurones plus petits et spécialisés (experts) et d'un mécanisme de routage qui dirige l'entrée vers l'expert le plus pertinent. Cela les rend très efficaces, car seule une fraction du modèle est active à un moment donné.
Puis-je utiliser le mini-AGI pour mon entreprise ?
Non. L'auteur du projet le qualifie explicitement de « modèle à l'échelle d'un jouet » qui n'est pas adapté à la production. Il s'agit d'un projet de recherche et d'une preuve de concept démontrant une nouvelle approche de l'entraînement de l'IA.

