Skip to content
research

Diese KI trainiert sich selbst auf Ihrem Laptop

Vergessen Sie statische KI-Modelle, die sofort veraltet sind. Ein neues Experiment zeigt eine 'mini-AGI', die auf einem normalen Laptop ständig dazulernt und das kritische Problem des 'katastrophalen Vergessens' löst, bei dem altes Wissen gelöscht wird.

Aki Tanaka
Diese KI trainiert sich selbst auf Ihrem Laptop

Das Ende eingefrorener KI-Modelle

Die meisten Large Language Models (LLMs) kommen in der Zeit eingefroren an, ihr Wissen ist auf den Moment ihres massiven Trainings im Rechenzentrum begrenzt. Fragt man sie nach aktuellen Ereignissen, erhält man oft veraltete Antworten; sie haben aufgehört zu lernen, sobald sie veröffentlicht wurden. Dieses Paradigma schreibt vor, dass nur Hyperscaler diese hochentwickelten KIs wirklich bauen können.

Eine neue Klasse von KI, genannt mini-AGI, verändert dieses Modell grundlegend. Sie ist für kontinuierliches Lernen konzipiert, trainiert direkt auf Consumer-Hardware – zum Beispiel einem MacBook Pro – und hört nie auf, sich weiterzuentwickeln. Sie beginnt bei absolut null, buchstäblich einer Ansammlung von Zufallszahlen, ohne jegliches Vorwissen.

Dies ist kein Fine-Tuning; es ist Lernen von Grund auf. Das Modell verarbeitet Daten Byte für Byte und nimmt Informationen aus einem kontinuierlichen Strom ohne definierte Ziellinie auf. Es macht nach jedem Block kleine Lernschritte und baut das Verständnis schrittweise auf, ähnlich wie eine Person, die über einen längeren Zeitraum ein Buch liest.

Traditionell erforderte das Training selbst kleiner Modelle erheblichen Speicher – etwa drei- bis viermal mehr als das bloße Ausführen –, was es zu einer exklusiven Domäne riesiger Rechenzentren machte. mini-AGI demokratisiert diesen Prozess und bringt die Macht der kontinuierlichen KI-Entwicklung in die Hände von Einzelpersonen, direkt auf ihren persönlichen Computern.

Wie Mini-AGI KI-Amnesie besiegt

Katastrophales Vergessen stellt eine große Herausforderung für kontinuierlich lernende KI dar. Dieses Phänomen beschreibt die Tendenz eines KI-Modells, vorhandenes Wissen, wie etwa Englischkenntnisse, zu überschreiben, wenn es auf ein neues, eng gefasstes Thema, wie etwa Schach, feinabgestimmt wird. Ein Standardmodell könnte nach der Spezialisierung die Hälfte seines Allgemeinwissens verlieren.

Mini-AGI begegnet dem mit einer spezialisierten Mixture-of-Experts (MoE)-Architektur. Das Modell besteht aus zwei unterschiedlichen Komponenten: einem shared core und mehreren spezialisierten Experten. Beim Erlernen neuer Informationen dürfen sich die Experten schnell anpassen, aber der shared core aktualisiert sich zehnmal langsamer. Dieser Mechanismus stellt sicher, dass neues Wissen hauptsächlich bei den Spezialisten verbleibt, während das grundlegende Verständnis des Kerns erhalten bleibt – ähnlich wie bei der Renovierung von Räumen, ohne das Fundament eines Gebäudes zu stören. Mini-AGI behielt selbst nach intensivem, eng gefasstem Training 99,84 % seines Vorwissens bei.

Dieses Design führt auch zu einer bemerkenswerten Speichereffizienz. Jeder Experte existiert als separate Datei auf der Festplatte. Beim Verarbeiten eines Textblocks lädt das System nur die spezifisch benötigten Experten in den VRAM. Dies ermöglicht es mini-AGI, weit über die physischen Speicherbeschränkungen einer Consumer-GPU hinaus zu skalieren und kontinuierliches Lernen auf persönlicher Hardware wie einem MacBook zu unterstützen.

Von Gute-Nacht-Geschichten bis Tarantino

Ein leeres Modell begann seine Reise, eine Ansammlung von Zufallszahlen, die keine Sprache kannte. Forscher brachten ihm zunächst grundlegendes Englisch mithilfe des TinyStories dataset bei, einem Korpus kurzer Kindergeschichten. Innerhalb von zwei Stunden entwickelte sich das Modell von Kauderwelsch wie "tousind wared therlound" zu zusammenhängenden Sätzen wie "It's okay," Lily said, und etablierte grundlegende Englischkenntnisse.

Als Nächstes verlagerte sich das Experiment darauf, dem Modell den unverwechselbaren Stil von Quentin Tarantino zu vermitteln. Die Forscher fütterten es mit Drehbüchern, darunter Pulp Fiction, Jackie Brown und Django Unchained. Anfangs erfasste die mini-AGI schnell die Formatierung von Drehbüchern und produzierte innerhalb von Minuten Charakternamen wie Ordell und Louis in Großbuchstaben mit korrekter Einrückung.

Es traten jedoch Herausforderungen auf. Das Modell begann, seine neu erworbene Drehbuchstruktur mit seinem Wissen über Kindergeschichten zu vermischen. Tarantino-Charaktere fingen an, sich „wie Kindergartenkinder“ zu entschuldigen („Stephen, es tut mir leid“), und seine Englischkenntnisse verschlechterten sich rapide, sodass selbst „Es war einmal“ zu Drehbuchfragmenten wurde. Dies deutete auf eine Tendenz hin, spezifische Skripte auswendig zu lernen, anstatt den Stil zu verallgemeinern, sowie auf das Potenzial für katastrophales Vergessen.

Entscheidend ist, dass das Modell, als die Forscher es erneut mit Geschichten trainierten, seine Englischkenntnisse in wenigen Minuten statt Stunden wiedererlangte. Diese schnelle Erholung zeigte, dass sein ursprüngliches Sprachwissen nicht gelöscht, sondern bewahrt wurde, wahrscheinlich innerhalb seiner festplattenbasierten mixture of experts-Architektur. Dieser Mechanismus, bei dem sich ein gemeinsamer Kern langsamer verändert als spezialisierte Experten, ermöglicht es mini-AGI, früheres Wissen beizubehalten. Weitere technische Details zum Design finden Sie unter GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data..

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Das Urteil: Ein brillanter Frankenstein

Das Experiment lieferte ein eigenartiges Ergebnis: ein Frankenstein-Modell, das geschickt darin war, das Drehbuchformat von Tarantino mit präzisen Einzügen und großgeschriebenen Charakternamen wie Ordell, Louis und Schultz aus Filmen wie Pulp Fiction und Jackie Brown nachzuahmen. Sein Dialog war jedoch eine bizarre Fusion, die kindliche Entschuldigungen („Stephen, es tut mir leid.“) mit der düsteren Ästhetik des Regisseurs vermischte. Die Englischkenntnisse verschlechterten sich und reduzierten selbst „Es war einmal“ auf fragmentierte Skript-Hinweise.

Dieser „Frankenstein“-Output verschleiert jedoch den wahren Triumph des Projekts. Das mini-AGI demonstrierte continual learning auf Consumer-Hardware – speziell einem M2 Max MacBook Pro mit 32 Gigabyte RAM. Entscheidend ist, dass es catastrophic forgetting weitgehend vermied. Nachdem es acht verschiedene Themen wie Geschichten, Code und Mathematik gelernt hatte und dann einer halben Million Zeichen Schach ausgesetzt war, behielt das Modell 99,84 % seines Vorwissens bei, ein krasser Gegensatz zu typischen Modellen, die die Hälfte verlieren.

Diese Widerstandsfähigkeit beruht auf seiner Architektur: einem gemeinsamen Kern, der sich zehnmal langsamer verändert als seine spezialisierten Experten, die effizient nach Bedarf von der Festplatte geladen werden, was es dem Modell ermöglicht, größer als der Speicher der GPU zu sein. Während mini-AGI ein „Spielzeug“ bleibt und keine echte AGI ist, bietet es eine überzeugende Vision. Es beweist die Machbarkeit personalisierter, sich ständig weiterentwickelnder KI-Modelle, die mit uns lernen können, ohne Ressourcen auf Rechenzentrumsebene zu benötigen oder ihre Vergangenheit zu vergessen.

Häufig gestellte Fragen

Was ist mini-AGI?

Mini-AGI ist ein Sprachmodell im Spielzeugmaßstab, das für kontinuierliches Lernen auf Consumer-Hardware entwickelt wurde. Es kann von Grund auf neu trainiert werden und ist so konzipiert, dass es neue Informationen lernt, ohne früheres Wissen zu überschreiben oder zu vergessen.

Wie verhindert mini-AGI „catastrophic forgetting“?

Es verwendet eine zweiteilige Struktur: einen gemeinsamen Kern, der 10-mal langsamer lernt, um grundlegendes Wissen zu bewahren, und spezialisierte „Experten“-Modelle, die schnell neue Informationen lernen. Dies isoliert neues Lernen, ohne die Kernfähigkeiten des Modells zu stören.

Was ist ein Mixture-of-Experts (MoE)-Modell?

Ein MoE-Modell besteht aus mehreren kleineren, spezialisierten neuronalen Netzwerken (Experten) und einem Gating-Mechanismus, der den Input an den relevantesten Experten weiterleitet. Dies macht sie hocheffizient, da zu jedem Zeitpunkt nur ein Bruchteil des Modells aktiv ist.

Kann ich mini-AGI für mein Unternehmen verwenden?

Nein. Der Autor des Projekts bezeichnet es ausdrücklich als „Modell im Spielzeugmaßstab“, das nicht für die Produktion geeignet ist. Es handelt sich um ein Forschungsprojekt und einen Proof-of-Concept, der einen neuen Ansatz für das KI-Training demonstriert.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.