50倍のパフォーマンスという衝撃
9000万パラメータのFalcon H1モデルが、2020年発売のApple Watch Series 6で完全にオフライン動作したことは、オンデバイスAIに対する私たちの理解を根本から覆しました。4年前に発売されたウェアラブルデバイスで行われたこのデモンストレーションは、高度な人工知能がクラウドから独立し、手首の上で直接動作できることを証明しています。これは、ユビキタスでプライベートなAIに向けた真の第一歩です。
達成されたパフォーマンス指標は、このフォームファクタのデバイスとしては驚異的です。Apple Watch Series 6は、平均して毎秒15トークンの速度でテキストを生成しました。これはローカル推論としては非常に滑らかなペースです。この速度は、同様のAIモデルを実行した際に毎秒わずか0.3トークンという低速だった初代Raspberry Piと比較して、50倍という圧倒的なパフォーマンスの優位性を示しています。
この巨大な性能差は、Series 6が低電力デバイスと比較して、いかに堅牢なハードウェア仕様を備えているかを直接的に反映しています。Apple Watch Series 6には、強力なデュアルコア1.8 GHz CPUと1GBのRAMが搭載されています。これらのスペックは、Raspberry Pi 1の控えめなシングル700 MHzコアと512 MBのRAMを容易に凌駕しており、今回目撃された「パフォーマンスの衝撃」と劇的な処理能力の差を決定的に説明しています。
成功の秘訣:なぜFalconが動作するのか
Falcon H1の驚異的な効率性は、その「ハイブリッドアーキテクチャ」に由来します。これは、ほとんどの大規模言語モデルの主力である標準的なアテンション層と、Mamba 2として知られる新しい「状態空間モデル」を独自に組み合わせたものです。この2つのコンポーネントによる設計こそが、Apple Watchのような制約のあるハードウェア上でコンパクトなパフォーマンスを発揮するための鍵となっています。
Mamba 2はメモリ効率に優れています。従来のアテンションのように大きく増大するキーバリューキャッシュを蓄積するのではなく、Mamba 2は固定サイズのメモリ状態で動作します。この状態をトークンごとに更新し、どの情報を保持し、どの情報を上書きするかを動的に決定します。この「スキャン」プロセスにより、1トークンを処理する場合でも1000トークンを処理する場合でもメモリフットプリントが一定に保たれるため、RAMが限られたデバイスに極めて適しています。
このアーキテクチャの選択が、Apple独自のCore MLフレームワークがFalcon H1をサポートできない理由を説明しています。Core MLは、静的な操作に最適化された固定の事前定義済み計算グラフを必要とします。各ステップの計算が前の状態に依存するMamba 2の動的でシーケンシャルな「スキャン」構造は、Core MLがネイティブに処理できないループ依存関係を生み出します。このフレームワークには、この種の状態空間計算のためのビルディングブロックが単純に欠けているのです。
Apple Watchのハッキング:ARM64_32の解説
Appleのネイティブフレームワークを回避するため、このプロジェクトではカスタムコンパイルされたLlama.cppが活用されました。この人気のある推論ライブラリは通常iOSとmacOSをサポートしていますが、WatchOSでコンパイルを有効にするには特定のビルドフラグと1行のソースガードが必要でした。AppleのオンデバイスMLフレームワークであるCore MLは、直接的なビルディングブロックを欠くハイブリッドなMamba 2アーキテクチャを採用しているため、Falcon H1には不向きであることが判明しました。
このWatchOSへの展開において極めて重要だったのは、ARM64_32アーキテクチャをターゲットにしたことです。その名称に反して、これは低速な32ビット命令セットではありません。実際には、数学演算をバッチ処理するためのNeonベクトルユニットを含む完全な64ビットARM命令セットを利用しており、計算速度においてパフォーマンスの低下は一切ありません。
WatchOSは32ビットのメモリーポインターを採用しています。標準的な64ビットシステムではメモリーアドレスは64ビット長ですが、Apple Watchではその半分のサイズです。この設計はシステム全体のRAMを節約するもので、メモリー容量が限られたデバイスにとって重要な最適化となっています。
しかし、この32ビットのアドレッシング方式は、2GBのRAM上限という厳しい制約を課します。このメモリー制限により、数十億パラメーター規模のモデルを実行することはできません。十分なメモリーをアドレス指定できないためです。一方で、わずか57MBのFalcon H1は、この制約内に完璧に収まっており、リソースが制限されたウェアラブルデバイスにおけるコンパクトモデルの実現可能性を証明しています。デバイスのハードウェアに関する詳細は、Apple Watch Series 6 - 技術仕様を参照してください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
古い技術でこれができるなら、なぜ待つ必要があるのか?
Apple Watch Series 6での概念実証アプリは、単なる技術的なデモンストレーションを超え、完全に機能するAIアシスタントを実現しました。ネイティブな音声入力を堅牢に統合し、実用的なツール利用を実証しました。ユーザーはWikipediaで事実を検索したり、現地の天気をチェックしたりできます。「フランスの首都はどこ?」といった質問にほぼ即座に回答するなど、単なるベンチマークを超えたモデルの有用性を証明しました。
短く直接的な質問では、Falcon H1モデルで毎秒最大24トークンという驚異的な速度が得られましたが、より複雑なリクエストではデバイス固有の制限が明らかになりました。より長く、複数の段落にわたる回答を生成すると、パフォーマンスが著しく低下しました。これは、2020年のハードウェア、特にARM64_32アーキテクチャの約2GBというメモリーアドレッシング上限によるメモリーおよび処理の制約を露呈しました。
数年前のコンシューマー向けハードウェア上でのこの成功した(制約はあるものの)展開は、デバイスメーカー、特にAppleに対して根本的な問いを投げかけています。ホビープロジェクトでApple Watch上で実用的なローカルLLM機能を解放できるのであれば、なぜ汎用的なオンデバイスAIモデルが新しいデバイス全体で標準的な統合機能になっていないのでしょうか。技術的な実現可能性は今や否定できないものとなっています。
よくある質問
Apple WatchではどのLLMが使用されましたか?
9000万パラメーターのFalcon H1というモデルが使用されました。これは、従来の注意層(Attention layers)とMamba 2状態空間モデルを組み合わせたハイブリッドアーキテクチャにより、小型で非常に効率的です。
Apple WatchでLLMはどのくらいの速さで動作しましたか?
Falcon H1モデルは平均して毎秒15トークンで動作し、単純なクエリでは毎秒最大24トークンに達しました。これは、Raspberry Pi 1で同様のモデルを実行するよりも約50倍高速です。
なぜAppleのCore MLはFalcon H1モデルを実行できないのですか?
AppleのCore MLフレームワークは、Falcon H1のアーキテクチャの構成要素である状態空間モデル(Mamba 2)をネイティブでサポートしていません。Core MLは固定された計算グラフを想定しており、これがMambaの逐次的かつループ的な性質と競合するためです。
Apple WatchにおけるARM64_32とは何ですか?
これはARM64アーキテクチャのバリエーションで、メモリーアドレスが64ビットではなく32ビットのものです。これにより、RAMが限られたデバイスでメモリーを節約できますが、同時に2GBという厳しい上限が設けられ、非常に大きなモデルには不向きとなります。コアとなる64ビット命令セットは完全に維持されています。

