Skip to content
ai tools

このプロジェクトは、あなたのMacで驚異的なAIを実現します

あなたのMacBookで、かつてはデータセンターが必要だったAIモデルが実行可能になりました。その秘密はAppleのハードウェアだけではありません。ローカルAIの常識を覆す、巧妙なソフトウェアのトリックがあるのです。

Theo Brandt
このプロジェクトは、あなたのMacで驚異的なAIを実現します

Apple Siliconで実現する2GBのAIの奇跡

本格的なAIにはサーバーラックが必要だという考えは捨ててください。ある新しいオープンソースプロジェクトがその期待を打ち砕き、わずか約2GBのRAMで260億パラメータのモデルをApple Silicon上で実行可能にしました。具体的には、指示チューニング済みのGemma 4 (26B-A4B) がMシリーズ搭載Macで23トークン/秒以上を達成し、負荷を感じさせることなく実用的なローカル推論を実現しています。

この偉業は、同規模のモデルに通常必要なメモリフットプリントを劇的に削減します。通常、Gemma 4のような260億パラメータのモデルには14GB以上のRAMが必要です。Turbo Fieldfareはメモリ使用量を7分の1に削減し、ローカルLLM展開の可能性を根本から変え、強力なAIをワークステーションで直接利用可能にしました。

このプロジェクトの正体は、Appleのハードウェア向けに緻密に設計されたオープンソースアプリケーション、Turbo Fieldfareです。Appleの低レベルGPU APIであるSwiftとMetalで専用に構築されており、ユニファイドメモリの独自の能力を活用しています。この特注の設計によりApple Siliconでのパフォーマンスが最大化され、複雑なMixture-of-Experts (MoE) モデルが流れるようなローカル体験へと変わります。

なぜAIモデルの大部分が「無駄な重荷」なのか

Gemma 4は単一の巨大なネットワークではありません。これはMixture-of-Experts (MoE)モデルであり、従来の単一ネットワークのパラダイムを打ち破る設計です。巨大なフィードフォワードブロックを1つ持つ代わりに、128個の小さな専門化された「エキスパート」ネットワークを展開します。各エキスパートが特定のデータパターンを処理するため、モデル全体が常にフル稼働することなく、非常に効率的かつ適応的に動作します。

各MoE層には小さなルーターが含まれています。特定のトークンに対して、このルーターは128個のエキスパートの中から最も関連性の高い上位8個を動的に選択してアクティブ化します。つまり、Gemma 4の260億パラメータのうち、実際に稼働しているのは約39億パラメータに過ぎません。モデル全体のパラメータの実に85%が、どの瞬間も完全にアイドル状態のままなのです。

この本来のアイドル状態こそが、Turbo Fieldfareが活用する核心部分です。85%が無駄な重荷であるなら、Gemma 4の14GBのフットプリントをすべてRAMに保持する必要はありません。このプロジェクトは、常に必要なコンポーネントと、アクティブに選択された約39億パラメータのみをインテリジェントにメモリに保持します。エキスパートはSSDから直接ジャストインタイムでストリーミングされるため、モデル全体を常駐させる必要がありません。この精密なオンデマンドのメモリ管理こそが、Apple Siliconで2GBの奇跡を実現している理由です。

Appleの秘密兵器:ユニファイドメモリ

従来のPCアーキテクチャは、AI推論においてボトルネックとなります。通常、ディスクリートGPUに重みを読み込ませるには、SSDからシステムRAMへ移動し、低速なPCIeバスを経由して専用VRAMへ送るという複雑な経路をたどります。データが送られるたびに2回のコピーとバスの経由が発生し、エキスパートをオンデマンドでストリーミングする際には致命的なパフォーマンス低下を招きます。

Apple Siliconは、ユニファイドメモリによってこれを完全に回避します。CPUとGPUは同じ物理RAMプールを共有します。コピー先の独立したVRAMは存在しません。Metalバッファは単にこの共有メモリ領域の一部であり、両方のプロセッサから即座に参照可能です。

このアーキテクチャにより、重要な最適化が可能になります。CPUはエキスパートの重みをSSDから直接メモリバッファに読み込み、GPUが即座にアクセスできるようにします。低速なコピーはゼロ、PCIe転送もゼロです。レイテンシの発生が劇的に抑えられ、ジャストインタイムでのエキスパート読み込みが実用的なものとなります。

さらに、Turbo Fieldfareプロジェクトでは、これを極限まで推し進めています。重みは実行時の変換を必要とする汎用的な形式で保存されるのではなく、Metal GPUカーネルが消費する4ビット量子化レイアウトそのままでディスク上に存在します。つまり、変換やアンパックのオーバーヘッドはゼロであり、ファイルを読み込むだけで重みがそのままロードされます。このプロジェクトの詳細については、drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook · GitHubをご覧ください。この密接な統合が、驚異的なパフォーマンスを実現しています。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

RAMを超える賢さ:オンデマンド・ストリーミング

Turbo Fieldfareのメモリ戦略は、巧妙な2段階システムを採用しています。アテンション、ルーター、埋め込み(embeddings)を含む1.35GBの軽量で不可欠なコンポーネントは、メモリマップされ、常にRAM上に常駐します。この重要なブロックが、ディスクにアクセスすることなく初期トークン処理を処理します。

残りの12.9GBのエキスパートはすべてSSD上に存在します。Turbo Fieldfareはジャストインタイム(JIT)フェッチ戦略を採用しており、ルーターが呼び出した時にのみ、数メガバイト単位でこれらのエキスパートをメモリにストリーミングします。プリフェッチは行わず、選択は現在のトークンとその履歴に基づいて行われます。

インテリジェントなキャッシュ機能がこれをさらに洗練させています。Gemma 4の30層それぞれがLFUキャッシュを保持しており、128個のエキスパートのうち16個をRAMに保持します。ルーターがキャッシュされたエキスパートを選択した場合、即座にアクセス可能です。そうでない場合は、必要なエキスパートがSSDからロードされ、メモリ内で最も使用頻度の低いものと置き換えられます。

このLFUアプローチは、MoEモデルにおけるエキスパート選択の非ランダムかつ予測可能な性質を活用しています。一部のエキスパートは一貫して選択されますが、そうでないものもあります。頻繁に使用されるエキスパートを優先することで、システムはディスク読み取りを最小限に抑え、モデルの既存の計算スレッド内でI/Oレイテンシを効果的に隠蔽します。

よくある質問

Turbo Fieldfareとは何ですか?

Turbo Fieldfareは、Gemma 4(26Bパラメータ)のような大規模AIモデルを、モデルの一部をSSDから直接ストリーミングすることで、わずか2GBのRAMを搭載したApple Silicon搭載Macで実行可能にするオープンソースプロジェクトです。

なぜApple Siliconのユニファイドメモリがこれに重要なのですか?

CPUとGPUが同じメモリプールを共有できるためです。これにより、システムRAMから個別のGPU VRAMへデータをコピーする低速なプロセスが不要になります。これは、Turbo Fieldfareが使用する高速なオンデマンド・データストリーミングにおいて極めて重要です。

Mixture-of-Experts (MoE) モデルとは何ですか?

複数の小さな「エキスパート」サブネットワークで構成されるAIモデルアーキテクチャです。特定のタスクに対して、ルーターが少数のエキスパートのみをアクティブにするため、単一の巨大なモノリシックモデルを実行するよりもはるかに効率的に推論を行うことができます。

自分のMacで実行できますか?

はい、MシリーズのMac(Apple Silicon)であれば可能です。このプロジェクトはGitHubで公開されており、リポジトリのクローンとアプリケーションの実行手順が記載されています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only