Skip to content
research

Este truco ejecuta un LLM de 35B en tu iPhone

Todo el mundo piensa que la IA en el dispositivo se limita a modelos pequeños, pero una nueva técnica acaba de romper esa suposición. El avance no es un chip nuevo, sino un ingenioso truco de memoria para el que el sistema operativo de Apple ya era secretamente perfecto.

Aki Tanaka
Este truco ejecuta un LLM de 35B en tu iPhone

El modelo de 20GB en tu iPhone de 8GB

Investigadores de IA lograron recientemente una hazaña notable: implementar el modelo de lenguaje grande Qwen 3.5, un gigante de 35 mil millones de parámetros, directamente en un iPhone estándar. Esto no es solo una demostración; el modelo ofrece unos utilizables 11 tokens por segundo, transformando un dispositivo de bolsillo en un potente motor de IA local.

Un modelo de este tipo suele exigir una memoria inmensa. Un modelo de 35B parámetros, incluso cuando se cuantifica a una precisión de 4 bits, requiere aproximadamente 20 gigabytes (GB) de RAM. Esto supera con creces la memoria física disponible en la mayoría de los dispositivos móviles, que a menudo tienen un límite de 8 GB, lo que crea una barrera fundamental para la IA en el dispositivo.

Superar esta limitación depende de la arquitectura Mixture of Experts (MoE). A diferencia de los modelos densos tradicionales donde cada parámetro se activa para cada cálculo, los modelos MoE se activan de forma dispersa. Para cualquier entrada dada, un componente 'router' selecciona y activa de forma inteligente solo un pequeño subconjunto de 'expertos' especializados dentro del modelo.

Esta activación dispersa altera fundamentalmente la gestión de la memoria. En lugar de cargar todo el modelo de 20 GB en la RAM, solo los expertos activos en ese momento, junto con componentes esenciales como los mecanismos de atención, necesitan residir en la memoria activa. Esto reduce significativamente el uso de memoria en tiempo real, permitiendo que la mayor parte del modelo permanezca en un almacenamiento más lento y grande, como el SSD del iPhone, hasta que sea necesario.

SSD-to-GPU: El pipeline de expertos bajo demanda

Ejecutar un LLM de 35B parámetros en la memoria limitada de un iPhone requiere una estrategia inteligente de particionamiento de memoria. Un núcleo compacto de 1.4GB de componentes esenciales del modelo permanece residente en la RAM, comprendiendo:

  • Embeddings
  • Mecanismos de atención
  • Routers
  • Un experto compartido

Los 12GB restantes, que consisten en los 40 archivos de expertos del modelo (cada uno de unos 300MB), se encuentran en el SSD de alta velocidad del iPhone.

Para cada token generado, el sistema inicia un proceso de recuperación dinámica. Un router interno selecciona ocho expertos específicos por capa de las 256 opciones del modelo, a través de las 40 capas. Luego, el motor lee estos archivos de expertos elegidos directamente desde el SSD a la memoria de la GPU. Esto resulta en aproximadamente 320 lecturas pequeñas por token, asegurando que solo se carguen los parámetros necesarios para el cálculo inmediato.

Esta transmisión de expertos bajo demanda reduce drásticamente el uso de memoria activa. Si bien el modelo Qwen 3.5 cuenta con 35 mil millones de parámetros, solo unos 3 mil millones están activos para cualquier token individual. Tal asignación eficiente de recursos es clave para operar un modelo de esta magnitud en hardware de consumo, aprovechando el SSD como una "RAM virtual" extendida de alta velocidad para la gran mayoría de los parámetros inactivos.

Por qué el sistema operativo de Apple superó a una caché personalizada

Los desarrolladores implementaron inicialmente una caché personalizada sustancial de 9.8GB dentro de su aplicación para gestionar los datos de los expertos. De forma contraintuitiva, eliminar este sistema a medida y confiar en la caché de página nativa de iOS proporcionó un notable aumento del 38% en el rendimiento. Este resultado inesperado destaca un principio fundamental del diseño de sistemas operativos.

Asignar un bloque de RAM tan grande y fijo para la caché exclusiva de la aplicación resultó perjudicial. Esta estrategia privó inadvertidamente a dos recursos críticos del sistema: la GPU, que requiere una memoria significativa para el cálculo, y los propios mecanismos de almacenamiento en caché dinámicos y sofisticados del sistema operativo. La reserva de memoria explícita de la aplicación esencialmente compitió con el sistema operativo, en lugar de complementarlo.

El page cache de iOS surgió como el héroe anónimo, gestionando dinámicamente la memoria RAM disponible. Retiene de forma inteligente en la memoria a los expertos de acceso frecuente, anticipándose a las necesidades futuras. Este sistema es mucho más eficiente, adaptándose a las demandas generales del sistema y asegurando una asignación de memoria óptima en todos los procesos sin requerir que la aplicación realice una preasignación.

Cumplir con los exigentes requisitos de velocidad de lectura de más de 5 GB/s es fundamental para mantener 11 tokens por segundo. Sin embargo, el almacenamiento flash físico del iPhone alcanza un máximo de aproximadamente 1.6 GB/s. En consecuencia, el sistema operativo orquesta la mayoría de las lecturas de expertos directamente desde la RAM a través de su page cache, un factor crítico para modelos como la variante Qwen 3.5 A3B. Obtenga más información sobre su arquitectura en Qwen3.5-35B-A3B - ModelScope.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Compresión más inteligente y disipadores de calor del mundo real

Lograr este rendimiento nativo en iPhone también requirió un enfoque matizado para la compresión del modelo: cuantización por niveles. Los desarrolladores observaron que aproximadamente el 25% de los 'expertos' del modelo Mixture of Experts (MoE) manejaban cerca del 80% del trabajo. Estos expertos "calientes" de acceso frecuente mantienen una precisión de 4 bits de mayor calidad, preservando información crítica.

Por el contrario, los expertos "fríos" restantes, que se utilizan menos, se someten a una compresión más profunda, reduciendo su tamaño a solo 2 bits. Este tratamiento diferencial inteligente reduce la huella de almacenamiento general del modelo en un sustancial 34%, reduciéndolo de 19 GB iniciales a 13 GB.

Esta reducción significativa en el tamaño del disco afecta directamente al rendimiento, permitiendo que una mayor parte de los pesos del modelo Qwen 3.5 residan dentro del eficiente page cache de iOS. Ajustar más datos en la memoria rápida contribuye sustancialmente a la velocidad de generación observada de 11 tokens por segundo, minimizando la dependencia de lecturas más lentas del SSD.

Un cálculo tan intenso y sostenido en un dispositivo móvil compacto genera inevitablemente un calor considerable; los usuarios informan que el iPhone se calienta notablemente, incluso "derritiéndose en mi mano" según un desarrollador. Esto destaca los desafíos térmicos prácticos de llevar la inferencia de IA al límite en el hardware de consumo.

Además, los desarrolladores encontraron un error crítico donde el modelo se quedaba atrapado en un bucle infinito, repitiendo tokens después de unas pocas palabras. La función async_pread_wait, responsable de leer los datos de los expertos desde el almacenamiento, requirió una solución urgente. Inicialmente no lograba validar correctamente las lecturas para los expertos "fríos" de 2 bits a medio tamaño, omitiéndolos silenciosamente y ejecutando efectivamente el modelo con información incompleta. Corregir este descuido fue crucial para obtener una salida estable y coherente.

Preguntas frecuentes

¿Cuál es la técnica principal que permite que un modelo de 35B se ejecute en un iPhone?

La técnica aprovecha una arquitectura de modelo Mixture of Experts (MoE). En lugar de cargar todo el modelo de 20 GB en la RAM, solo un núcleo pequeño de 1.4 GB permanece residente, mientras que el resto de los 'expertos' del modelo se transmiten desde el almacenamiento SSD rápido del teléfono bajo demanda, según se necesiten para cada generación de tokens.

¿Qué modelo se utilizó en la demostración?

La demostración utilizó Qwen 3.5, un modelo Mixture of Experts de 35 mil millones de parámetros. Específicamente, es la variante A3B, lo que significa que solo unos 3 mil millones de parámetros están activos para cualquier token individual.

¿Qué es un modelo Mixture of Experts (MoE)?

Un MoE es una arquitectura de red neuronal donde el modelo está compuesto por muchas redes de 'expertos' más pequeñas. Para cualquier entrada dada, un mecanismo de enrutamiento selecciona un pequeño subconjunto de estos expertos para procesarla. Esta activación dispersa los hace altamente eficientes para la inferencia.

¿Qué tipo de rendimiento se logró en el iPhone?

La configuración logró una velocidad de generación de 11 tokens por segundo. Sin embargo, este nivel de procesamiento provocó que el iPhone se calentara notablemente muy rápido.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.