La impactante mejora de rendimiento de 50x
Un modelo Falcon H1 de 90 millones de parámetros se ejecutó recientemente completamente offline en un Apple Watch Series 6 de 2020, cambiando fundamentalmente nuestra comprensión de la IA en el dispositivo. Esta demostración, realizada en un dispositivo wearable lanzado hace cuatro años, demuestra que la inteligencia artificial sofisticada puede operar independientemente de la nube, directamente desde tu muñeca. Representa un paso real hacia una IA omnipresente y privada.
Las métricas de rendimiento alcanzadas fueron realmente sorprendentes, particularmente para un dispositivo de este factor de forma. El Apple Watch Series 6 generó texto a una tasa promedio de 15 tokens por segundo, un ritmo notablemente fluido para la inferencia local. Esta velocidad constituye una asombrosa ventaja de rendimiento de 50x sobre una Raspberry Pi de primera generación, que anteriormente avanzaba a solo 0.3 tokens por segundo al ejecutar un modelo de IA similar.
Esta enorme brecha de rendimiento refleja directamente las especificaciones de hardware significativamente más robustas del Series 6 en comparación con su contraparte de bajo consumo. El Apple Watch Series 6 integra una potente CPU de doble núcleo a 1.8 GHz y una memoria RAM considerable de 1 GB. Estas especificaciones superan fácilmente al núcleo único más modesto de 700 MHz y los 512 MB de RAM de la Raspberry Pi 1, explicando de manera decisiva la dramática disparidad en la potencia de procesamiento y la "sorpresa de rendimiento" presenciada.
El ingrediente secreto: Por qué funciona Falcon
La notable eficiencia de Falcon H1 proviene de su arquitectura híbrida. Combina de forma única capas de atención estándar (los caballos de batalla de la mayoría de los modelos de lenguaje grandes) con un novedoso modelo de espacio de estados conocido como Mamba 2. Este diseño de doble componente es clave para su rendimiento compacto en hardware limitado como un Apple Watch.
Mamba 2 destaca en la eficiencia de la memoria. En lugar de acumular una caché de clave-valor grande y creciente como la atención tradicional, Mamba 2 opera con un estado de memoria de tamaño fijo. Actualiza este estado token por token, decidiendo dinámicamente qué información conservar o sobrescribir. Este proceso de "escaneo" asegura que, ya sea procesando un token o mil, la huella de memoria permanezca constante, lo que lo hace excepcionalmente adecuado para dispositivos con RAM limitada.
Esta elección arquitectónica explica por qué el propio framework Core ML de Apple no admite Falcon H1. Core ML requiere un grafo de computación fijo y predefinido, optimizado para operaciones estáticas. La estructura de "escaneo" dinámica y secuencial de Mamba 2, donde el cálculo de cada paso depende del estado anterior, crea una dependencia de bucle que Core ML no puede manejar de forma nativa. El framework simplemente carece de un bloque de construcción para este tipo de computación de espacio de estados.
Hackeando el reloj: Explicación de ARM64_32
Evitando los frameworks nativos de Apple, el proyecto aprovechó una versión compilada a medida de Llama.cpp. Esta popular biblioteca de inferencia normalmente es compatible con iOS y macOS, pero WatchOS requería flags de compilación específicos y una protección de código de una línea para permitir la compilación. Core ML, el framework de ML en el dispositivo de Apple, resultó inadecuado para Falcon H1 debido a su arquitectura híbrida Mamba 2, que carece de bloques de construcción directos de Core ML.
Crucial para este despliegue en WatchOS fue apuntar a la arquitectura ARM64_32. A pesar de su nombre, este no es un conjunto de instrucciones de 32 bits más lento. En cambio, utiliza el conjunto completo de instrucciones ARM de 64 bits, incluida la unidad vectorial Neon para operaciones matemáticas por lotes, asegurando que no haya degradación del rendimiento en la velocidad computacional.
WatchOS emplea punteros de memoria de 32 bits. En un sistema estándar de 64 bits, las direcciones de memoria tienen 64 bits de longitud, pero en el reloj tienen la mitad de ese tamaño. Este diseño conserva la memoria RAM en todo el sistema, una optimización crítica para dispositivos con memoria limitada.
Sin embargo, este esquema de direccionamiento de 32 bits impone un límite estricto de 2GB de RAM. Esta limitación de memoria impide ejecutar modelos de miles de millones de parámetros, ya que simplemente no pueden direccionar suficiente memoria. Aun así, Falcon H1, con apenas 57MB, encaja perfectamente dentro de esta restricción, demostrando la viabilidad de modelos compactos en dispositivos portátiles con recursos limitados. Para obtener más detalles sobre el hardware del dispositivo, consulte las Apple Watch Series 6 - Technical Specifications.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
Si la tecnología antigua puede hacer esto, ¿por qué esperar?
La aplicación de prueba de concepto en el Apple Watch Series 6 trascendió un simple truco técnico, ofreciendo un asistente de IA completamente funcional. Integró de forma robusta la entrada de voz nativa y demostró el uso práctico de herramientas, permitiendo a los usuarios consultar Wikipedia para obtener datos o verificar el clima local. Esto demostró la utilidad del modelo mucho más allá de un simple benchmark, respondiendo a preguntas como "¿Cuál es la capital de Francia?" casi al instante.
Aunque las consultas cortas y directas a menudo arrojaban velocidades impresionantes (hasta 24 tokens por segundo con el modelo Falcon H1), las limitaciones inherentes del dispositivo se hicieron evidentes con solicitudes más complejas. La generación de respuestas más largas y de varios párrafos degradó notablemente el rendimiento. Esto expuso las restricciones de memoria y procesamiento del hardware de 2020, específicamente el límite de direccionamiento de memoria de aproximadamente 2 GB de la arquitectura ARM64_32.
Este despliegue exitoso, aunque limitado, en hardware de consumo de hace años plantea una pregunta fundamental para los fabricantes de dispositivos, particularmente Apple. Si un proyecto de aficionado puede desbloquear capacidades significativas de local LLM en tiempo real en un Apple Watch, ¿por qué los modelos de IA de propósito general en el dispositivo aún no son una característica estándar e integrada en los nuevos dispositivos? La viabilidad técnica ahora parece innegable.
Preguntas frecuentes
¿Qué LLM se utilizó en el Apple Watch?
Se utilizó un modelo de 90 millones de parámetros llamado Falcon H1. Es pequeño y altamente eficiente debido a su arquitectura híbrida que combina capas de atención tradicionales con un modelo de espacio de estados Mamba 2.
¿Qué tan rápido funcionó el LLM en el Apple Watch?
El modelo Falcon H1 funcionó a un promedio de 15 tokens por segundo, con velocidades que alcanzaron hasta 24 tokens/seg para consultas simples. Esto es aproximadamente 50 veces más rápido que ejecutar un modelo similar en una Raspberry Pi 1.
¿Por qué Core ML de Apple no puede ejecutar el modelo Falcon H1?
El framework Core ML de Apple no admite de forma nativa el componente del modelo de espacio de estados (Mamba 2) de la arquitectura de Falcon H1. Core ML espera un grafo de computación fijo, lo que entra en conflicto con la naturaleza secuencial y de bucle de Mamba.
¿Qué es ARM64_32 en el Apple Watch?
Es una variante de la arquitectura ARM64 donde las direcciones de memoria son de 32 bits en lugar de 64 bits. Esto ahorra memoria en un dispositivo con RAM limitada, pero también crea un límite estricto de 2GB, lo que lo hace inadecuado para modelos muy grandes. El conjunto de instrucciones central de 64 bits permanece completamente intacto.

