「固定されたAIモデル」の終焉
ほとんどの大規模言語モデル(LLM)は、巨大なデータセンターでのトレーニングが完了した時点で知識が「固定」されています。最近の出来事について尋ねても、古い回答しか返ってこないのは、リリースされた日に学習を止めてしまったからです。このパラダイムでは、ハイパースケーラーだけが真に高度なAIを構築できることになってしまいます。
「mini-AGI」と呼ばれる新しいクラスのAIは、このモデルを根本から変えます。継続的な学習のために設計されたこのAIは、MacBook Proのようなコンシューマー向けハードウェア上で直接トレーニングを行い、進化を止めることがありません。それは、既存の知識を一切持たない、文字通りのランダムな数値の集合体からスタートします。
これはファインチューニングではなく、ゼロからの学習です。モデルはデータをバイト単位で処理し、終わりのない連続的なストリームから情報を吸収します。本を少しずつ読み進める人間のように、データの塊ごとに小さな学習ステップを踏み、段階的に理解を深めていきます。
従来、小さなモデルをトレーニングする場合でも、実行時の3〜4倍のメモリが必要であり、巨大なデータセンターの独占領域でした。mini-AGIはこのプロセスを民主化し、個人のPC上で継続的なAI開発を行う力を提供します。
Mini-AGIはいかにしてAIの「記憶喪失」を克服するか
破滅的忘却は、継続的に学習するAIにとって大きな課題です。これは、チェスのような新しい特定の分野を学習させた際に、英語の流暢さといった既存の知識をAIモデルが上書きしてしまう現象を指します。標準的なモデルでは、専門化を行うと一般的な知識の半分を失ってしまう可能性があります。
Mini-AGIは、特殊な「Mixture-of-Experts (MoE)」アーキテクチャでこれに対処しています。モデルは「共有コア」と複数の「スペシャリスト・エキスパート」という2つの異なるコンポーネントで構成されます。新しい情報を学習する際、エキスパートは急速に適応しますが、共有コアの更新速度は10分の1に抑えられます。このメカニズムにより、新しい知識は主にエキスパート内に留まり、建物の基礎を壊さずに部屋を改装するように、コアが持つ基礎的な理解が維持されます。Mini-AGIは、集中的かつ限定的なトレーニングの後でも、以前の知識の99.84%を保持しました。
この設計は驚異的なメモリ効率も実現しています。各エキスパートはディスク上の個別のファイルとして存在します。テキストの塊を処理する際、システムは必要な特定のエキスパートのみをVRAMに読み込みます。これにより、mini-AGIはコンシューマー向けGPUの物理メモリ制限を大きく超えてスケールし、MacBookのような個人用ハードウェアでの継続的な学習を可能にします。
ベッドタイムストーリーからTarantinoまで
空のモデルは、言語を知らないランダムな数値の集合体として旅を始めました。研究者たちはまず、子供向けの短い物語を集めた「TinyStories dataset」を使用して、基本的な英語を教えました。2時間以内に、モデルは「tousind wared therlound」のような意味不明な文字列から、「It's okay,」とLilyが言うような一貫した文章へと進歩し、基本的な英語力を確立しました。
次に、実験はQuentin Tarantinoの独特なスタイルをモデルに吹き込むフェーズへ移行しました。研究者たちは『Pulp Fiction』、『Jackie Brown』、『Django Unchained』などの脚本を読み込ませました。mini-AGIはすぐに脚本のフォーマットを把握し、数分以内にはOrdellやLouisといったキャラクター名を、適切なインデントと大文字表記で出力できるようになりました。
しかし、課題も浮上しました。モデルは、新しく習得した脚本の構成と、子供向けストーリーの知識を混同し始めたのです。Tarantinoのキャラクターたちは「幼稚園児のように」謝罪し始め(「Stephen, I'm sorry」)、英語の習熟度は急速に低下し、「Once upon a time」でさえも脚本の断片へと変貌してしまいました。これは、スタイルを一般化するのではなく特定のスクリプトを記憶する傾向があること、そして「破滅的忘却(catastrophic forgetting)」の可能性があることを示していました。
重要なのは、研究者がモデルをストーリーで再学習させた際、英語の習熟度が数時間ではなく、わずか数分で回復したことです。この急速な回復は、元の言語知識が消去されたのではなく、ディスクベースの「mixture of experts」アーキテクチャ内に保持されていたことを示しています。共有コアが専門化されたエキスパートよりもゆっくりと変化するこのメカニズムにより、mini-AGIは以前の学習内容を保持できるのです。設計に関する技術的な詳細については、GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data. を参照してください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
結論:見事なフランケンシュタイン
この実験は奇妙な結果をもたらしました。それは、Tarantinoの脚本形式を模倣することに長けた「Frankenstein」モデルです。Ordell、Louis、Schultzといったキャラクター名が、『Pulp Fiction』や『Jackie Brown』といった映画のように正確なインデントと大文字で記述されていました。しかし、その対話は、子供っぽい謝罪(「Stephen, I'm sorry.」)と監督の荒々しい美学が融合した奇妙なものでした。英語の習熟度は低下し、「Once upon a time」でさえも断片的なスクリプトの合図にまで減少してしまいました。
しかし、この「Frankenstein」的な出力は、プロジェクトの真の成功を覆い隠すものです。mini-AGIは、コンシューマー向けハードウェア(具体的には32GBのRAMを搭載したM2 Max MacBook Pro)上で「continual learning(継続学習)」を実証しました。重要なのは、それが「catastrophic forgetting(破滅的忘却)」をほぼ回避したことです。ストーリー、コード、数学など8つの多様な科目を学習した後、50万文字のチェスデータに触れさせても、モデルは以前の知識の99.84%を保持していました。これは、通常のモデルが半分を失うのとは対照的です。
この回復力は、そのアーキテクチャに由来します。専門化されたエキスパートよりも10倍遅く変化する共有コアを持ち、エキスパートは必要に応じてディスクから効率的にロードされるため、GPUのメモリよりも大きなモデルを構築できます。mini-AGIは依然として「おもちゃ」であり、真のAGIではありませんが、説得力のあるビジョンを提示しています。これは、データセンター規模のリソースを必要とせず、過去を忘れることもなく、私たちと共に学習できる、パーソナライズされた進化し続けるAIモデルの実現可能性を証明しています。
よくある質問
mini-AGIとは何ですか?
mini-AGIは、コンシューマー向けハードウェアでの継続学習を目的として設計された、おもちゃ規模の言語モデルです。ゼロから学習可能であり、以前の知識を上書きしたり忘れたりすることなく新しい情報を学習するように設計されています。
mini-AGIはどのようにして「破滅的忘却」を防いでいますか?
2つの部分からなる構造を採用しています。基礎知識を保持するために10倍遅く学習する共有コアと、新しい情報を素早く学習する専門化された「エキスパート」モデルです。これにより、モデルの核となる能力を損なうことなく、新しい学習を分離しています。
Mixture-of-Experts (MoE) モデルとは何ですか?
MoEモデルは、複数の小さな専門化されたニューラルネットワーク(エキスパート)と、入力を最も関連性の高いエキスパートに振り分けるゲーティングメカニズムで構成されています。これにより、一度にモデルの一部のみがアクティブになるため、非常に効率的です。
mini-AGIをビジネスで使用できますか?
いいえ。プロジェクトの作成者は、これを実運用には適さない「おもちゃ規模のモデル」と明言しています。これは、AIトレーニングへの新しいアプローチを実証するための研究プロジェクトであり、概念実証です。

