Skip to content
research

Ваши часы теперь — это ИИ-мозг

Все полагают, что локальный ИИ требует новейшего оборудования, но они ошибаются. 6-летние Apple Watch только что доказали, что мощные локальные LLM уже возможны на технике, которая у вас есть.

Aki Tanaka
Ваши часы теперь — это ИИ-мозг

Шокирующий 50-кратный прирост производительности

Модель Falcon H1 с 90 миллионами параметров недавно была запущена полностью офлайн на Apple Watch Series 6 2020 года, что фундаментально изменило наше понимание локального ИИ. Эта демонстрация, проведенная на носимом устройстве, выпущенном четыре года назад, доказывает, что сложный искусственный интеллект может работать независимо от облака, прямо с вашего запястья. Это реальный шаг к повсеместному и конфиденциальному ИИ.

Достигнутые показатели производительности были по-настоящему поразительными, особенно для устройства такого форм-фактора. Apple Watch Series 6 генерировали текст со средней скоростью 15 токенов в секунду, что является удивительно плавным темпом для локального вывода. Эта скорость представляет собой ошеломляющее 50-кратное преимущество в производительности по сравнению с Raspberry Pi первого поколения, который ранее работал со скоростью всего 0,3 токена в секунду при запуске аналогичной ИИ-модели.

Эта огромная пропасть в производительности напрямую отражает значительно более мощные аппаратные характеристики Series 6 по сравнению с его маломощным аналогом. Apple Watch Series 6 оснащены мощным двухъядерным процессором 1,8 ГГц и 1 ГБ оперативной памяти. Эти характеристики легко превосходят более скромное одно ядро 700 МГц и 512 МБ оперативной памяти Raspberry Pi 1, что убедительно объясняет драматическое различие в вычислительной мощности и наблюдаемый «шокирующий результат».

Секретный ингредиент: почему работает Falcon

Выдающаяся эффективность Falcon H1 обусловлена его гибридной архитектурой. Он уникальным образом сочетает в себе стандартные слои внимания — «рабочие лошадки» большинства больших языковых моделей — с новой моделью пространства состояний, известной как Mamba 2. Этот двухкомпонентный дизайн является ключом к его компактной производительности на ограниченном оборудовании, таком как Apple Watch.

Mamba 2 превосходна в эффективности использования памяти. Вместо накопления большого, постоянно растущего кэша ключей-значений, как в традиционном механизме внимания, Mamba 2 работает с состоянием памяти фиксированного размера. Она обновляет это состояние по мере обработки каждого токена, динамически решая, какую информацию сохранить, а какую перезаписать. Этот процесс «сканирования» гарантирует, что независимо от того, обрабатывается один токен или тысяча, объем используемой памяти остается неизменным, что делает модель исключительно подходящей для устройств с ограниченным объемом ОЗУ.

Этот архитектурный выбор объясняет, почему собственный фреймворк Apple Core ML не поддерживает Falcon H1. Core ML требует фиксированного, заранее определенного графа вычислений, оптимизированного для статических операций. Динамическая последовательная структура «сканирования» Mamba 2, где вычисления на каждом шаге зависят от предыдущего состояния, создает циклическую зависимость, с которой Core ML не может справиться нативно. Во фреймворке просто отсутствуют строительные блоки для такого типа вычислений в пространстве состояний.

Взлом часов: объяснение ARM64_32

В обход нативных фреймворков Apple, в проекте была использована специально скомпилированная версия Llama.cpp. Эта популярная библиотека для вывода обычно поддерживает iOS и macOS, но для WatchOS потребовались специфические флаги сборки и одна строка защиты исходного кода для включения компиляции. Core ML, фреймворк Apple для локального машинного обучения, оказался непригоден для Falcon H1 из-за его гибридной архитектуры Mamba 2, в которой отсутствуют прямые строительные блоки Core ML.

Ключевым моментом для развертывания на WatchOS стал выбор архитектуры ARM64_32. Несмотря на название, это не более медленный 32-битный набор инструкций. Напротив, он использует полный 64-битный набор инструкций ARM, включая векторный блок Neon для пакетной обработки математических операций, что гарантирует отсутствие снижения скорости вычислений.

WatchOS использует 32-битные указатели памяти. В стандартной 64-битной системе адреса памяти имеют длину 64 бита, но на часах они вдвое меньше. Такая архитектура экономит оперативную память во всей системе, что является критически важной оптимизацией для устройств с ограниченным объемом памяти.

Однако эта 32-битная схема адресации накладывает жесткое ограничение в 2 ГБ ОЗУ. Это ограничение памяти не позволяет запускать многомиллиардные модели, так как они просто не могут адресовать достаточно памяти. Тем не менее, Falcon H1 размером всего 57 МБ идеально вписывается в это ограничение, демонстрируя жизнеспособность компактных моделей на носимых устройствах с ограниченными ресурсами. Для получения дополнительной информации об аппаратном обеспечении устройства обратитесь к Apple Watch Series 6 - Технические характеристики.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Если старые технологии на это способны, зачем ждать?

Концептуальное приложение на Apple Watch Series 6 вышло за рамки простого технического трюка, предоставив полноценного ИИ-помощника. Оно успешно интегрировало нативный голосовой ввод и продемонстрировало практическое использование инструментов, позволяя пользователям запрашивать факты в Википедии или узнавать местную погоду. Это доказало полезность модели далеко за пределами простого бенчмарка, позволяя почти мгновенно отвечать на запросы вроде «Какова столица Франции?»

Хотя короткие прямые запросы часто демонстрировали впечатляющую скорость — до 24 токенов в секунду с моделью Falcon H1 — присущие устройству ограничения становились очевидными при более сложных запросах. Генерация более длинных ответов из нескольких абзацев заметно снижала производительность. Это обнажило ограничения памяти и обработки оборудования 2020 года, в частности, ограничение адресации памяти примерно в 2 ГБ архитектуры ARM64_32.

Это успешное, пусть и ограниченное, развертывание на устаревшем потребительском оборудовании ставит фундаментальный вопрос перед производителями устройств, в частности Apple. Если любительский проект может разблокировать значительные возможности локальных LLM в реальном времени на Apple Watch, почему универсальные ИИ-модели на устройстве до сих пор не являются стандартной встроенной функцией новых устройств? Техническая осуществимость теперь кажется неоспоримой.

Часто задаваемые вопросы

Какая LLM использовалась на Apple Watch?

Использовалась модель с 90 миллионами параметров под названием Falcon H1. Она компактна и высокоэффективна благодаря своей гибридной архитектуре, сочетающей традиционные слои внимания с моделью пространства состояний Mamba 2.

Как быстро работала LLM на Apple Watch?

Модель Falcon H1 работала со средней скоростью 15 токенов в секунду, достигая 24 токенов в секунду для простых запросов. Это примерно в 50 раз быстрее, чем работа аналогичной модели на Raspberry Pi 1.

Почему Core ML от Apple не может запустить модель Falcon H1?

Фреймворк Core ML от Apple не поддерживает нативно компонент модели пространства состояний (Mamba 2) в архитектуре Falcon H1. Core ML ожидает фиксированный вычислительный граф, что конфликтует с последовательной, циклической природой Mamba.

Что такое ARM64_32 на Apple Watch?

Это вариант архитектуры ARM64, где адреса памяти являются 32-битными вместо 64-битных. Это экономит память на устройстве с ограниченным объемом ОЗУ, но также создает жесткий потолок в 2 ГБ, что делает его непригодным для очень больших моделей. Основной 64-битный набор инструкций остается полностью нетронутым.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.