Skip to content
research

El truco de IA de las torres de telefonía que podría cambiar los teléfonos

El próximo salto en la IA móvil podría no provenir de un chip más rápido o un modelo más pequeño. Una audaz idea de investigación convierte la señal inalámbrica en parte del ordenador, con ganancias impresionantes y un inconveniente.

Aki Tanaka
El truco de IA de las torres de telefonía que podría cambiar los teléfonos

El verdadero enemigo no es el modelo, es la memoria

Ejecutar grandes modelos de lenguaje (LLMs) en dispositivos periféricos enfrenta un cuello de botella fundamental: no es la aritmética bruta, sino el constante intercambio de pesos del modelo entre la memoria y el procesador. Este "muro de memoria" significa que obtener un peso de la memoria a menudo consume mucha más energía que los cálculos reales que permite, particularmente durante el proceso rápido e iterativo de generación de tokens.

Considere la escala: un modelo como Llama 3.1 8B requiere aproximadamente 16 GB para sus pesos en formato FP16. Incluso con una cuantización agresiva de 4 bits, esto sigue exigiendo alrededor de 4 GB de almacenamiento, antes de tener en cuenta las activaciones y otros gastos generales de tiempo de ejecución. Mover estos gigabytes de datos repetidamente es la principal limitación para el rendimiento y el consumo de energía de los LLM en el dispositivo.

Investigadores del MIT y la Universidad de Duke proponen una solución radical: AIR-LLM. Su premisa traslada el problema de la memoria del dispositivo a la infraestructura inalámbrica mediante la transmisión de pesos de LLM por aire. En lugar de almacenar los pesos localmente en cada teléfono, una radio central, como una estación base 5G, los transmite.

Este enfoque aprovecha la Multiplexación por División de Frecuencia Ortogonal (OFDM), la misma tecnología que sustenta el Wi-Fi y el 5G. Cada peso del modelo se asigna a una subportadora de frecuencia distinta, lo que permite al dispositivo realizar cálculos directamente sobre la señal de radio entrante, evitando por completo la necesidad de almacenamiento local o recuperación de la memoria.

Una señal de radio se convierte en parte del chip de IA

Los investigadores proponen una arquitectura novedosa donde una radio central, como una estación base 5G, transmite los pesos del modelo utilizando Multiplexación por División de Frecuencia Ortogonal (OFDM). Esta técnica, común en sistemas Wi-Fi y celulares, divide una señal en miles de subportadoras; cada subportadora transporta un único peso del modelo.

El mezclador de RF existente de un teléfono se convierte entonces en parte del chip de IA. Este componente combina la señal de transmisión entrante (que transporta los pesos) con las activaciones locales del prompt del teléfono. Fundamentalmente, la operación analógica del mezclador calcula naturalmente el producto escalar de estas dos señales (la operación matemática fundamental en cada capa de LLM) directamente dentro de la onda de radio.

Este diseño evita por completo almacenar los pesos del modelo en el dispositivo. El teléfono sigue procesando su prompt y manejando los cálculos posteriores, pero la tarea que más memoria consume (cargar los pesos) se traslada a un mecanismo de transmisión. Una única transmisión sirve a todos los dispositivos dentro del alcance, preservando la privacidad del usuario ya que los prompts nunca salen del teléfono.

Las simulaciones utilizando Llama 3.1 8B en modelos urbanos de París y Múnich mostraron resultados impresionantes. La precisión de la predicción de la siguiente palabra se degradó solo un 4.0%, mientras que la energía por token se redujo 157.7 veces en comparación con la transmisión de pesos FP16. Este cálculo analógico dentro de la señal de radio representa un enfoque radical para la IA de borde.

Grandes ahorros de energía, con una ventaja del tamaño de una transmisión

Esta arquitectura novedosa promete ganancias significativas en eficiencia. Los investigadores reportan hasta 157.7 veces menos energía por token en comparación con la transmisión de pesos FP16 sin comprimir. Para los pesos cuantizados de 4 bits más comunes, la reducción de energía sigue siendo sustancial, aproximadamente 40.4 veces.

Estos ahorros de energía vienen con una degradación mínima del rendimiento. Al probarse en el benchmark WikiText-2, un modelo Llama 3.1 8B vio cómo su perplejidad de predicción del siguiente token se degradaba solo alrededor de un 4% en relación con el modelo original. Esto sugiere que las respuestas del modelo permanecen en gran medida consistentes a pesar del cambio a la computación analógica.

La naturaleza de transmisión uno a muchos de este sistema ofrece una ventaja sustancial, especialmente en escenarios con múltiples usuarios. Una sola transmisión puede servir a numerosos dispositivos simultáneamente. Esto reduce drásticamente el tiempo de aire, con cifras reportadas que muestran una reducción de 104.1× en el tiempo de aire para 20 usuarios en comparación con transmisiones unicast separadas de pesos FP16, y 26× para pesos de 4 bits.

Es crucial distinguir estas reducciones de tiempo de aire simuladas del rendimiento garantizado en el mundo real, ya que las condiciones reales de la red pueden variar. Sin embargo, el potencial de que una estación base funcione como un recurso compartido, muy parecido a una emisora de radio o televisión, es convincente. Para más detalles técnicos, consulte el documento: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

El problema de la señal débil sigue siendo muy real

Los ingenieros simularon esta arquitectura utilizando modelos de trazado de rayos NVIDIA Sionna de París y Múnich, combinados con mediciones de mezcladores de RF perfiladas en laboratorio. Esto proporcionó un entorno de evaluación robusto, pero no involucró un despliegue celular en vivo completo. Por lo tanto, los impresionantes ahorros de energía siguen siendo un límite superior teórico, pendiente de validación en el mundo real.

El principal obstáculo para esta computación analógica es la susceptibilidad de las señales de radio a los factores ambientales. El ruido, el desvanecimiento de la señal, los obstáculos físicos y la interferencia multicamino pueden corromper los delicados cálculos analógicos realizados por el mezclador de RF. A diferencia de los sistemas digitales que pueden corregir errores, la computación analógica es intrínsecamente menos robusta ante la degradación de la señal.

Los investigadores destacaron un caso de falla específico en un escenario simulado de baja recepción en Múnich: el modelo de lenguaje grande (LLM) quedó atrapado en texto repetitivo, generando frases como "it's beer gardens and its beer gardens". Esto demuestra cómo incluso problemas menores de integridad de la señal pueden conducir a fallas de inferencia significativas, subrayando el desafío de mantener la precisión en condiciones variadas del mundo real.

Si los ingenieros pueden superar estos desafíos de robustez, la inferencia por transmisión podría impactar profundamente a los dispositivos con memoria limitada como teléfonos inteligentes y dispositivos portátiles. La capacidad de ejecutar modelos grandes sin almacenar pesos localmente liberaría una cantidad significativa de memoria integrada. Sin embargo, garantizar un rendimiento consistente en diversos entornos geográficos y de señal, junto con abordar la privacidad y una cobertura confiable, siguen siendo desafíos abiertos críticos para una implementación práctica.

Preguntas frecuentes

¿Qué es AIR-LLM?

AIR-LLM es un enfoque de investigación que transmite pesos de modelos de IA a través de radio y utiliza el hardware de RF de un dispositivo para realizar partes de la computación.

¿Funciona AIR-LLM en teléfonos reales hoy en día?

Todavía no. La evaluación reportada combina canales de radio urbanos simulados con mediciones de un mezclador de RF; no es una demostración en vivo de teléfono a torre.

¿La torre celular recibe tus prompts?

En el diseño de transmisión unidireccional propuesto, los prompts y las activaciones permanecen en el dispositivo en lugar de enviarse a la torre.

¿Cuánta energía puede ahorrar AIR-LLM?

El documento reporta hasta 157.7 veces menos energía por token que la transmisión de pesos FP16 sin comprimir, con ahorros menores frente a la transmisión de 4 bits.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.