AI研究者が打ち破ろうとしている「40年のルール」
大規模言語モデルから画像分類器に至るまで、あらゆるAIモデルは1986年に普及したアルゴリズムであるbackpropagationを使用して学習します。この手法は、ニューラルネットワークにデータを順方向に流して予測を行い、誤差を測定するための「損失」を計算し、微積分の連鎖律(chain rule)を用いて、その誤差を減らすために各重みをどのように調整すべきかという正確な勾配を決定する仕組みです。
Backpropagationの強みは、これらの正確な勾配を効率的に計算できる点にありますが、モデル内のすべての演算が微分可能であることを要求します。この制約により、逆伝播のために中間活性化値を保存する必要が生じ、今日のディープラーニングにおけるほぼすべてのアーキテクチャの選択やハードウェア設計に影響を与えています。代替案である進化戦略(evolutionary strategies)は、重みの調整を推測し、損失が減少するかを繰り返し確認する手法ですが、複数の順方向パスが必要となるため、非常に低速であることが知られています。
Q Labsの研究者たちは、Transformer向けの新しい学習アプローチであるDustを用いて、この40年来のパラダイムに挑戦しています。Dustは、重みではなく活性化値を摂動させることで、Transformerが勾配計算ではなく試行錯誤から効果的に学習できるかどうかを調査しています。この研究は、機械学習が微分可能性の要件から解放され、全く新しい非微分可能なモデルアーキテクチャを実現できるかという根本的な問いを突きつけています。
Dustはすべてのトークンを実験に変える
進化戦略は以前からbackpropagationの代替手段として提案されてきましたが、従来はweight space(重み空間)で動作していました。つまり、モデルのパラメータを直接摂動させるため、摂動を加えた重みのセットごとに、それが損失に与える影響を評価するための個別の順方向パスが必要でした。このような手法は、個々の評価に伴う計算オーバーヘッドのため、「非常に低速」です。
Q Labsの新しい手法であるDustは、このパラダイムを覆し、モデルのactivation space(活性化空間)、具体的には各トークン位置における各層の出力に独立したランダムノイズを注入します。重みの変更を推測する代わりに、Dustはどの活性化値の摂動が各トークンの損失を減らすかを推定し、その知見を活用して適切な重みの調整を推論します。
このアプローチは「仮想的な集団」を作り出します。2,048トークンのシーケンスを用いた単一の順方向パスは、実質的に2,048個の並列摂動試行を実行することになります。特定のトークン位置で損失を低下させたノイズが「報酬」として与えられ、これらの報酬で重み付けされた信号が平均化されることで、各層の勾配が推定されます。
これらの推定された勾配から、backpropagationと同じメカニズムを用いて重みの更新が計算されます。決定的な違いは、Dustが連鎖律による微積分ではなく、活性化空間内での試行錯誤から勾配推定を導き出す点です。この革新的な手法は、従来の学習パラダイムからの大きな脱却を意味しています。
結果は奇妙だが、注目に値する
Q Labsによる初期の結果は、Dustにとって限定的な勝利を明らかにしました。短い学習実行(100kおよび1Mトークン)では、Dustは調整されたbackpropagationを上回り、より賢いモデルを実現しました。より長い実行では完全には追いつきませんでしたが、サンプル数が増えるにつれて性能差は徐々に縮まり、大規模な集団予算の下で20Mトークンに達した際、外挿されたべき乗則による適合損失はDustが4.43、backpropagationが4.63となりました。
Dustを既存の0次最適化手法と比較したところ、その違いは顕著でした。Dustは、EGGROLLに256倍の個体数サンプルを与えた場合でさえ、それを大幅に上回る性能を示しました。これは、アクティベーションの摂動を通じて勾配を推定するDustの優れた効率性を実証するものです。
最も直感に反する点として、テストされたモデルが大きくなるほど、個体数効率が高い傾向が見られました。このスケーリングの利点は、最大2億4300万パラメータのモデルまで確認されました。ただし、これらの実験はmodded-nanoGPTとFineWebデータセットに基づく小規模なGPTスタイルのモデルを使用したものであり、私たちが通常目にするプロダクション規模のLLMではありません。技術的な詳細については、Dust: Pretraining Transformers Without Backpropagation - Q Labsをご覧ください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
落とし穴:コストがかかりすぎる巧妙な手法
Dustの独創性には、かなりの計算コストが伴います。トークンレベルの並列処理は革新的ですが、バックプロパゲーションと比較してGPU時間やFLOPsの総量を削減するものではなく、単にそれらを再配分しているに過ぎません。Q Labsの研究者は、Dustには桁違いの計算量が必要であることを明言しており、特にテストされた2億4300万パラメータを超えるモデルにおいて、現時点でバックプロパゲーションの直接的な代替手段として実用的ではないとしています。
Dustのような微分フリーの学習手法の短期的な応用先として、微分可能性が求められるバックプロパゲーションでは対応が困難な領域が考えられます。これには、以下のような非微分可能なコンポーネントを含むモデルの学習が含まれます:
- 外部プログラム
- 複雑なシミュレーター
- 離散的な意思決定モジュール
- モデルアーキテクチャ内での繰り返しの自己呼び出し
効率性の向上や、Dustの柔軟性とバックプロパゲーションの速度を組み合わせたハイブリッド学習手法の開発に注目してください。このようなアプローチは、解析的な微分可能性によって現在制限されている新しいアーキテクチャの可能性を切り開く可能性があります。仕組みを確認したい方は、Q Labsのウェブサイトで詳細な研究内容を、GitHubでオープンソースの実装をご覧ください。
よくある質問
Dustとは何ですか?
Dustは、バックプロパゲーションを使用せず、アクティベーションに摂動を与えて損失の変化から学習方向を推定することで、Transformerモデルを学習させる実験的な手法です。
Dustはどのようにしてバックプロパゲーションを回避していますか?
トークン位置全体にわたってレイヤーのアクティベーションにランダムなノイズを加え、損失がどのように反応するかを測定し、それらの信号を組み合わせて更新量を推定します。
Dustはバックプロパゲーションを上回りますか?
一部の短い学習実行では調整済みのバックプロパゲーションを上回りましたが、実用的な学習規模において全体的な計算効率の優位性は示されていません。
バックプロパゲーションなしの学習が重要な理由は何ですか?
標準的な勾配ベースの学習には適合しない、外部プログラムやシミュレーターといった非微分可能な操作を含むシステムの学習を容易にする可能性があるためです。

