O choque de desempenho de 50x
Um modelo Falcon H1 de 90 milhões de parâmetros rodou recentemente de forma totalmente offline em um Apple Watch Series 6 de 2020, mudando fundamentalmente nossa compreensão sobre IA no dispositivo. Esta demonstração, realizada em um dispositivo vestível lançado há quatro anos, prova que a inteligência artificial sofisticada pode operar independentemente da nuvem, diretamente do seu pulso. Isso representa um passo real em direção a uma IA onipresente e privada.
As métricas de desempenho alcançadas foram genuinamente surpreendentes, especialmente para um dispositivo deste formato. O Apple Watch Series 6 gerou texto a uma taxa média de 15 tokens por segundo, um ritmo notavelmente fluido para inferência local. Essa velocidade constitui uma vantagem de desempenho impressionante de 50x em relação a um Raspberry Pi de primeira geração, que anteriormente operava a apenas 0,3 tokens por segundo ao executar um modelo de IA semelhante.
Este enorme abismo de desempenho reflete diretamente as especificações de hardware significativamente mais robustas do Series 6 em comparação com seu equivalente de baixo consumo. O Apple Watch Series 6 integra uma poderosa CPU dual-core de 1,8 GHz e 1 GB de RAM substancial. Essas especificações superam facilmente o núcleo único de 700 MHz e os 512 MB de RAM do Raspberry Pi 1, explicando de forma decisiva a disparidade dramática no poder de processamento e o "choque de desempenho" testemunhado.
O ingrediente secreto: Por que o Falcon funciona
A eficiência notável do Falcon H1 decorre de sua arquitetura híbrida. Ele combina exclusivamente camadas de atenção padrão—os pilares da maioria dos grandes modelos de linguagem—com um novo modelo de espaço de estados conhecido como Mamba 2. Este design de dois componentes é a chave para seu desempenho compacto em hardware limitado como um Apple Watch.
O Mamba 2 se destaca na eficiência de memória. Em vez de acumular um cache de chave-valor grande e crescente como a atenção tradicional, o Mamba 2 opera com um estado de memória de tamanho fixo. Ele atualiza esse estado token por token, decidindo dinamicamente quais informações manter ou substituir. Esse processo de "varredura" garante que, ao processar um ou mil tokens, a ocupação de memória permaneça constante, tornando-o excepcionalmente adequado para dispositivos com RAM limitada.
Essa escolha arquitetônica explica por que o próprio framework Core ML da Apple não suporta o Falcon H1. O Core ML requer um grafo de computação fixo e pré-definido, otimizando para operações estáticas. A estrutura de "varredura" sequencial e dinâmica do Mamba 2, onde o cálculo de cada etapa depende do estado anterior, cria uma dependência de loop que o Core ML não consegue manipular nativamente. O framework simplesmente carece de um bloco de construção para esse tipo de computação de espaço de estados.
Hackeando o relógio: ARM64_32 explicado
Contornando os frameworks nativos da Apple, o projeto utilizou uma versão compilada personalizada do Llama.cpp. Esta popular biblioteca de inferência normalmente suporta iOS e macOS, mas o WatchOS exigiu sinalizadores de compilação específicos e uma proteção de código de uma linha para permitir a compilação. O Core ML, framework de ML no dispositivo da Apple, provou ser inadequado para o Falcon H1 devido à sua arquitetura híbrida Mamba 2, que carece de blocos de construção diretos do Core ML.
Crucial para esta implementação no WatchOS foi o direcionamento para a arquitetura ARM64_32. Apesar do nome, este não é um conjunto de instruções de 32 bits mais lento. Em vez disso, ele utiliza o conjunto completo de instruções ARM de 64 bits, incluindo a unidade vetorial Neon para operações matemáticas em lote, garantindo que não haja degradação de desempenho na velocidade computacional.
O WatchOS utiliza ponteiros de memória de 32 bits. Em um sistema padrão de 64 bits, os endereços de memória têm 64 bits de comprimento, mas no relógio, eles têm metade desse tamanho. Esse design economiza RAM em todo o sistema, uma otimização crítica para dispositivos com memória limitada.
No entanto, esse esquema de endereçamento de 32 bits impõe um limite rígido de 2GB de RAM. Essa limitação de memória impede a execução de modelos com bilhões de parâmetros, pois eles simplesmente não conseguem endereçar memória suficiente. Ainda assim, o Falcon H1, com apenas 57MB, se encaixa perfeitamente nessa restrição, demonstrando a viabilidade de modelos compactos em dispositivos vestíveis com recursos limitados. Para mais detalhes sobre o hardware do dispositivo, consulte as Apple Watch Series 6 - Especificações Técnicas.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
Se a tecnologia antiga consegue fazer isso, por que esperar?
O aplicativo de prova de conceito no Apple Watch Series 6 transcendeu um mero truque técnico, entregando um assistente de IA totalmente funcional. Ele integrou de forma robusta a entrada de voz nativa e demonstrou o uso prático de ferramentas, permitindo que os usuários consultassem a Wikipedia para obter fatos ou verificassem a previsão do tempo local. Isso provou a utilidade do modelo muito além de um simples benchmark, respondendo a perguntas como "Qual é a capital da França?" quase instantaneamente.
Embora consultas curtas e diretas frequentemente resultassem em velocidades impressionantes — até 24 tokens por segundo com o modelo Falcon H1 — as limitações inerentes do dispositivo tornaram-se evidentes com solicitações mais complexas. A geração de respostas mais longas e com vários parágrafos degradou visivelmente o desempenho. Isso expôs as restrições de memória e processamento do hardware de 2020, especificamente o limite de endereçamento de memória de aproximadamente 2 GB da arquitetura ARM64_32.
Essa implementação bem-sucedida, embora limitada, em hardware de consumo com anos de uso levanta uma questão fundamental para os fabricantes de dispositivos, particularmente a Apple. Se um projeto de entusiasta pode desbloquear recursos significativos de LLM local em tempo real em um Apple Watch, por que modelos de IA de uso geral no dispositivo ainda não são um recurso padrão e integrado em todos os novos dispositivos? A viabilidade técnica agora parece inegável.
Perguntas Frequentes
Qual LLM foi usado no Apple Watch?
Foi usado um modelo de 90 milhões de parâmetros chamado Falcon H1. Ele é pequeno e altamente eficiente devido à sua arquitetura híbrida que combina camadas de atenção tradicionais com um modelo de espaço de estados Mamba 2.
Qual foi a velocidade de execução do LLM no Apple Watch?
O modelo Falcon H1 rodou a uma média de 15 tokens por segundo, com velocidades chegando a até 24 tokens/seg para consultas simples. Isso é cerca de 50 vezes mais rápido do que executar um modelo semelhante em um Raspberry Pi 1.
Por que o Core ML da Apple não consegue rodar o modelo Falcon H1?
O framework Core ML da Apple não suporta nativamente o componente de modelo de espaço de estados (Mamba 2) da arquitetura do Falcon H1. O Core ML espera um grafo de computação fixo, o que entra em conflito com a natureza sequencial e de loop do Mamba.
O que é ARM64_32 no Apple Watch?
É uma variante da arquitetura ARM64 onde os endereços de memória são de 32 bits em vez de 64 bits. Isso economiza memória em um dispositivo com RAM limitada, mas também cria um limite rígido de 2GB, tornando-o inadequado para modelos muito grandes. O conjunto de instruções central de 64 bits permanece totalmente intacto.

