El problema de los 20GB: Por qué esto no debería funcionar
Ejecutar un large language model de 35 mil millones de parámetros directamente en un iPhone parece inicialmente una imposibilidad computacional. Un modelo de esta escala de 35 mil millones de parámetros, cuando se guarda como un archivo normal de 4-bit, ocupa aproximadamente 20GB. Por lo general, todo este conjunto de datos de 20GB debe residir en la RAM para un procesamiento eficiente, una capacidad muy superior a la de cualquier dispositivo móvil.
Sin embargo, un método innovador ha roto esta barrera. Los investigadores demostraron un modelo MoE con 35 mil millones de parámetros ejecutándose en un iPhone, logrando una huella de memoria activa de solo 1.4GB. Esto representa una reducción asombrosa, recortando el requisito de memoria típico en más de un 90%.
El truco reside en cómo el modelo gestiona su vasta cantidad de datos. En lugar de cargar los 20GB completos en la RAM, solo los componentes esenciales y los "expertos" actualmente activos se transmiten bajo demanda desde el SSD del dispositivo. Este enfoque innovador aprovecha los patrones de activación dispersa inherentes a las arquitecturas Mixture-of-Experts.
Este avance señala un cambio profundo para la inteligencia artificial. Nos estamos moviendo hacia capacidades de on-device AI potentes y privadas, liberando las tareas complejas de la dependencia constante de los servidores en la nube. Y esto abre la puerta a una nueva generación de aplicaciones inteligentes y localizadas.
Conoce la arquitectura Mixture-of-Experts (MoE)
Resolver la crisis de memoria para este modelo de 35 mil millones de parámetros requirió un cambio fundamental en la arquitectura: llega Mixture-of-Experts (MoE). En lugar de un modelo masivo y monolítico donde cada parte está activa para cada token, MoE emplea un equipo de 'expertos' más pequeños y especializados. Una red de 'router' dedicada selecciona dinámicamente solo un puñado de estos expertos relevantes para una tarea determinada.
Esta arquitectura resulta ideal para dispositivos con recursos limitados como un iPhone. Por lo general, un modelo de 35 mil millones de parámetros, como un archivo normal de 4-bit, exige aproximadamente 20GB de RAM. Pero con MoE, solo los expertos seleccionados se cargan en la memoria activa, dejando a la gran mayoría inactiva en un almacenamiento más lento como un SSD. Esto reduce drásticamente la huella de RAM activa a solo 1.4GB.
MoE no es solo para reducir modelos; también es la clave para escalarlos a billones de parámetros de manera eficiente. Ahora, permite que los LLMs sofisticados se ejecuten directamente en dispositivos edge.
Para el iPhone, el modelo está ingeniosamente particionado. Los componentes compartidos cruciales (embeddings, mecanismos de atención, routers y un experto compartido) comprenden los 1.4GB que residen permanentemente en la RAM. Mientras tanto, 40 archivos de expertos individuales, cada uno de unos 300MB y sumando un total de 12GB, esperan en el SSD. Para cada token, después de que la atención se ejecuta en la GPU, el router elige ocho expertos específicos, que el motor transmite desde el SSD a la memoria de la GPU, ejecutándolos junto con el experto compartido. Esto implica 320 pequeñas lecturas de SSD por cada token.
El motor de transmisión bajo demanda
Este modelo de 35 mil millones de parámetros evita la barrera de memoria de 20GB segmentando sus componentes. Un núcleo de 1.4GB de elementos esenciales se carga una vez en la RAM, formando la columna vertebral operativa siempre presente del modelo y permaneciendo residente durante toda la inferencia:
- embeddings (representaciones de tokens de entrada)
- mecanismos de atención (comprensión contextual)
- routers (selección de expertos)
- un experto compartido (una base de propósito general)
Normalmente, los modelos completos residen en la RAM, pero esta arquitectura de 35 mil millones de parámetros innova. En su lugar, los 12 GB restantes de expertos especializados residen en el rápido SSD del iPhone. Esta arquitectura permite el streaming de expertos: el sistema obtiene estas grandes porciones inactivas solo cuando el router del modelo las solicita específicamente, enviándolas a la memoria de la GPU bajo demanda.
Por cada token que genera el modelo, se produce una secuencia rápida de transferencias de datos. El router selecciona dinámicamente 8 expertos dentro de cada una de las 40 capas, lo que provoca 320 lecturas pequeñas y distintas directamente desde el SSD. Este transporte constante de datos a alta velocidad permite que el enorme modelo de 35B funcione dentro de las estrictas limitaciones de memoria del iPhone.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
La nueva frontera para la IA en el borde (Edge AI)
Este modelo MoE de 35 mil millones de parámetros ejecutándose directamente en un iPhone abre verdaderamente una nueva frontera para la IA en el borde. Imagina asistentes privados que procesan datos confidenciales del usuario completamente en el dispositivo, sin transferencias a la nube, o herramientas creativas de latencia cero que generan diseños intrincados o respuestas de texto al instante. Estos avances permiten aplicaciones de IA totalmente offline, transformando capacidades que antes estaban confinadas a centros de datos distantes en realidades tangibles y personales.
Sin embargo, este avance no está exento de desafíos inmediatos. El motor de streaming bajo demanda, aunque ingenioso, genera una carga de E/S pesada, lo que requiere 320 pequeñas lecturas desde el SSD por cada token. Este acceso a datos intensivo y constante aumenta naturalmente el consumo de batería y exige una gestión térmica robusta por parte del hardware compacto del dispositivo.
No obstante, estos obstáculos son temporales. El futuro promete una poderosa sinergia entre técnicas de software innovadoras, como el actual motor de streaming de expertos, y una aceleración de hardware cada vez más especializada. El Neural Engine de Apple, por ejemplo, ofrece silicio dedicado diseñado precisamente para cargas de trabajo de IA. Combinado con marcos de trabajo y arquitecturas de memoria continuamente optimizados, este enfoque integrado acelerará el camino hacia la superinteligencia convencional en el dispositivo, haciendo que la IA potente sea omnipresente y esté perfectamente integrada en nuestra vida diaria.
Preguntas frecuentes
¿Qué es un modelo de Mixture-of-Experts (MoE)?
Un modelo MoE es una arquitectura de red neuronal que utiliza múltiples subredes de 'expertos' especializados. Para cualquier entrada dada, un mecanismo de enrutamiento selecciona solo unos pocos expertos para procesarla, lo que hace que la inferencia sea mucho más eficiente que en los modelos densos donde se utiliza toda la red.
¿Cómo se redujo tan drásticamente la huella de memoria del modelo de 35B?
La RAM residente del modelo se redujo a solo 1.4 GB manteniendo solo los componentes compartidos en la memoria. La mayor parte del modelo, los 'expertos', residen en el rápido SSD del teléfono y se transmiten a la memoria bajo demanda durante la inferencia.
¿Qué es el 'streaming de expertos'?
Es una técnica donde partes de un modelo de IA grande (los 'expertos' en una arquitectura MoE) se almacenan en un almacenamiento SSD más lento y se cargan dinámicamente en una memoria RAM o GPU más rápida solo cuando se necesitan para un cálculo específico, y luego se descartan.
¿Cuáles son los beneficios de ejecutar modelos de IA grandes en un teléfono?
Los beneficios principales son una mayor privacidad, ya que los datos nunca abandonan el dispositivo, menor latencia sin viajes de ida y vuelta a la red, funcionalidad completa offline y una menor dependencia de costosas infraestructuras en la nube para la inferencia.

