20GBの壁:なぜこれが本来不可能なのか
350億パラメータのLLMをiPhoneで直接実行することは、当初は計算的に不可能に思えます。この350億パラメータ規模のモデルを通常の4ビットファイルとして保存すると、約20GBの容量を占有します。通常、この20GBのデータセット全体を効率的に処理するにはRAMに常駐させる必要があり、これはモバイルデバイスの容量をはるかに超えています。
しかし、画期的な手法がこの障壁を打ち破りました。研究者たちは、350億パラメータのMoEモデルをiPhone上で実行し、アクティブメモリのフットプリントをわずか1.4GBに抑えることに成功しました。これは驚異的な削減であり、一般的なメモリ要件を90%以上カットしたことになります。
そのトリックは、モデルが膨大なデータを管理する方法にあります。20GB全体をRAMに読み込むのではなく、不可欠なコンポーネントと現在アクティブな「エキスパート」のみをデバイスのSSDからオンデマンドでストリーミングします。この革新的なアプローチは、Mixture-of-Expertsアーキテクチャ固有のスパース(疎)な活性化パターンを活用しています。
このブレイクスルーは、人工知能における大きな転換点を示しています。私たちは、クラウドサーバーへの常時依存から解放された、強力でプライベートな「オンデバイスAI」機能へと向かっています。そしてこれは、インテリジェントでローカル化された次世代アプリケーションへの扉を開くものです。
Mixture-of-Experts (MoE) アーキテクチャとは
この350億パラメータモデルのメモリ不足を解決するには、アーキテクチャの根本的な転換が必要でした。それが「Mixture-of-Experts (MoE)」です。すべてのトークンに対してすべてのパーツがアクティブになる巨大でモノリシックなモデルではなく、MoEは専門化された小さな「エキスパート」のチームを採用します。専用の「ルーター」ネットワークが、特定のタスクに関連する少数のエキスパートのみを動的に選択します。
このアーキテクチャは、iPhoneのようなリソース制限のあるデバイスに最適です。通常、350億パラメータのモデルを4ビットファイルにすると約20GBのRAMを必要とします。しかしMoEでは、選択されたエキスパートのみがアクティブメモリに読み込まれ、大部分はSSDのような低速ストレージに休眠状態で残ります。これにより、アクティブなRAMフットプリントはわずか1.4GBにまで劇的に削減されます。
MoEは単にモデルを縮小するためだけのものではなく、数兆パラメータまで効率的にスケールさせるための鍵でもあります。現在、これにより高度なLLMがエッジデバイス上で直接動作可能になっています。
iPhone向けに、モデルは巧みに分割されています。埋め込み(embeddings)、アテンションメカニズム、ルーター、共有エキスパートといった重要な共有コンポーネントが、RAMに常駐する1.4GBを構成します。一方、それぞれ約300MBで合計12GBに達する40個の個別エキスパートファイルはSSD上で待機します。各トークンに対し、GPUでアテンションが実行された後、ルーターが8つの特定エキスパートを選択し、エンジンがそれらをSSDからGPUメモリへとストリーミングして、共有エキスパートと共に実行します。これには、1つのトークンごとに320回の小さなSSD読み取りが発生します。
オンデマンド・ストリーミング・エンジン
この350億パラメータモデルは、コンポーネントをセグメント化することで20GBのメモリの壁を回避しています。不可欠な要素である1.4GBのコア部分が一度RAMに読み込まれ、推論中ずっとモデルの運用基盤として常駐します。
- 埋め込み(入力トークンの表現)
- アテンションメカニズム(文脈の理解)
- ルーター(エキスパートの選択)
- 共有エキスパート(汎用的なベースライン)
通常、モデル全体はRAMに常駐しますが、この350億パラメータのアーキテクチャは革新的なアプローチをとっています。残りの12GBの専門的なエキスパートはiPhoneの高速なSSDに格納されます。このアーキテクチャによりストリーミング・エキスパートが可能となり、モデルのルーターが具体的に呼び出した時のみ、システムがこれらの巨大で非アクティブな部分をフェッチし、オンデマンドでGPUメモリに転送します。
モデルがトークンを生成するたびに、高速なデータ転送シーケンスが発生します。ルーターは40の各レイヤー内で8つのエキスパートを動的に選択し、SSDから直接320の個別の小さな読み取りを実行します。この絶え間ない高速データシャトルにより、巨大な35BモデルがiPhoneの厳しいメモリ制約の中で動作可能になります。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
エッジAIの新たなフロンティア
iPhone上で直接動作するこの350億パラメータのMoEモデルは、エッジAIの新たなフロンティアを切り拓きます。クラウドへの転送を必要とせず、機密性の高いユーザーデータを完全にデバイス上で処理するプライベートなアシスタントや、複雑なデザインやテキスト応答を瞬時に生成するゼロレイテンシのクリエイティブツールを想像してみてください。これらの進歩は完全なオフラインAIアプリケーションを実現し、これまで遠くのデータセンターに限定されていた機能を、具体的で個人的な現実へと変貌させます。
しかし、このブレイクスルーには直面すべき課題もあります。オンデマンドのストリーミングエンジンは独創的ですが、トークンごとにSSDから320回の小さな読み取りを行うため、I/O負荷が非常に高くなります。この集中的で絶え間ないデータアクセスは、必然的にバッテリー消費を増加させ、コンパクトなデバイスハードウェアに対して堅牢な熱管理を要求します。
とはいえ、これらのハードルは一時的なものです。未来には、現在のエキスパート・ストリーミング・エンジンのような革新的なソフトウェア技術と、ますます専門化するハードウェア・アクセラレーションとの強力な相乗効果が期待されます。例えば、AppleのNeural Engineは、AIワークロード専用に設計されたシリコンを提供しています。継続的に最適化されるフレームワークやメモリ・アーキテクチャと組み合わせることで、この統合的なアプローチは、デバイス上のスーパーインテリジェンスを主流にするまでの道のりを加速させ、強力なAIを遍在させ、私たちの日常生活にシームレスに統合させるでしょう。
よくある質問
Mixture-of-Experts (MoE) モデルとは何ですか?
MoEモデルは、複数の専門化された「エキスパート」サブネットワークを使用するニューラルネットワーク・アーキテクチャです。入力に対してルーティング・メカニズムが少数のエキスパートのみを選択して処理するため、ネットワーク全体を使用する密なモデルよりも推論がはるかに効率的になります。
35Bモデルのメモリフットプリントはどのようにして劇的に削減されたのですか?
共有コンポーネントのみをメモリに保持することで、モデルの常駐RAMをわずか1.4GBに削減しました。モデルの大部分を占める「エキスパート」は、iPhoneの高速なSSDに格納され、推論中にオンデマンドでメモリにストリーミングされます。
「ストリーミング・エキスパート」とは何ですか?
これは、巨大なAIモデルの一部(MoEアーキテクチャにおける「エキスパート」)を低速なSSDストレージに保存し、特定の計算に必要な時だけ高速なRAMやGPUメモリに動的に読み込み、その後破棄する技術です。
スマートフォンで巨大なAIモデルを実行する利点は何ですか?
主な利点は、データがデバイスから決して離れないことによるプライバシーの強化、ネットワークの往復がないことによる低レイテンシ、完全なオフライン機能、そして推論のために高コストなクラウドインフラに依存する必要がなくなることです。

