O verdadeiro inimigo não é o modelo — é a memória
Executar Large Language Models (LLMs) em dispositivos de borda enfrenta um gargalo fundamental: não a aritmética bruta, mas a constante movimentação de pesos do modelo entre a memória e o processador. Essa "barreira de memória" significa que buscar um peso na memória frequentemente consome muito mais energia do que os cálculos reais que ele permite, particularmente durante o processo rápido e iterativo de geração de tokens.
Considere a escala: um modelo como Llama 3.1 8B requer aproximadamente 16 GB para seus pesos no formato FP16. Mesmo com uma quantização agressiva de 4 bits, isso ainda exige cerca de 4 GB de armazenamento, antes de considerar ativações e outras sobrecargas de tempo de execução. Mover esses gigabytes de dados repetidamente é a principal restrição para o desempenho e o consumo de energia de LLMs em dispositivos.
Pesquisadores do MIT e da Duke University propõem uma solução radical: AIR-LLM. Sua premissa transfere o problema da memória do dispositivo para a infraestrutura sem fio, transmitindo os pesos do LLM pelo ar. Em vez de armazenar pesos localmente em cada telefone, um rádio central, como uma estação rádio-base 5G, os transmite.
Essa abordagem aproveita a Orthogonal Frequency-Division Multiplexing (OFDM), a mesma tecnologia que sustenta o Wi-Fi e o 5G. Cada peso do modelo é mapeado para uma subportadora de frequência distinta, permitindo que o dispositivo realize o cálculo diretamente no sinal de rádio recebido, contornando a necessidade de armazenamento local ou recuperação da memória.
Um sinal de rádio torna-se parte do chip de IA
Pesquisadores propõem uma arquitetura inovadora onde um rádio central, como uma estação rádio-base 5G, transmite pesos de modelo usando Orthogonal Frequency-Division Multiplexing (OFDM). Essa técnica, comum em sistemas Wi-Fi e celulares, divide um sinal em milhares de subportadoras; cada subportadora carrega um único peso de modelo.
O mixer de RF existente em um telefone torna-se então parte do chip de IA. Esse componente combina o sinal de transmissão recebido (que carrega os pesos) com as ativações de prompt locais do telefone. Crucialmente, a operação analógica do mixer calcula naturalmente o dot product desses dois sinais — a operação matemática fundamental em cada camada de LLM — diretamente dentro da onda de rádio.
Esse design evita totalmente o armazenamento de pesos de modelo no dispositivo. O telefone ainda processa seu prompt e lida com cálculos subsequentes, mas a tarefa que mais consome memória — carregar pesos — é transferida para um mecanismo de transmissão. Uma única transmissão atende a todos os dispositivos na área de alcance, preservando a privacidade do usuário, já que os prompts nunca saem do telefone.
Simulações usando Llama 3.1 8B em modelos urbanos de Paris e Munique mostraram resultados impressionantes. A precisão da previsão da próxima palavra degradou apenas 4,0%, enquanto a energia por token caiu 157,7 vezes em comparação com o streaming de pesos FP16. Esse cálculo analógico dentro do sinal de rádio representa uma abordagem radical para a IA de borda.
Grande economia de energia, com uma vantagem em escala de transmissão
Essa arquitetura inovadora promete ganhos significativos de eficiência. Pesquisadores relatam até 157,7× menos energia por token em comparação com o streaming de pesos FP16 não compactados. Para pesos quantizados de 4 bits mais comuns, a redução de energia ainda é substancial, em cerca de 40,4×.
Essa economia de energia vem com uma degradação mínima de desempenho. Ao ser testado no benchmark WikiText-2, um modelo Llama 3.1 8B apresentou uma degradação na perplexidade de predição do próximo token de apenas cerca de 4% em relação ao modelo original. Isso sugere que as respostas do modelo permanecem amplamente consistentes, apesar da mudança para a computação analógica.
A natureza de transmissão um-para-muitos deste sistema oferece uma vantagem substancial, especialmente em cenários com múltiplos usuários. Uma única transmissão pode servir a vários dispositivos simultaneamente. Isso reduz drasticamente o tempo de transmissão, com números relatados mostrando uma redução de 104,1× no tempo de transmissão para 20 usuários em comparação com fluxos unicast separados de pesos FP16, e 26× para pesos de 4 bits.
É crucial distinguir essas reduções de tempo de transmissão simuladas de um desempenho garantido no mundo real, já que as condições reais da rede podem variar. No entanto, o potencial de uma estação base funcionar como um recurso compartilhado, muito parecido com uma emissora de rádio ou TV, é fascinante. Para mais detalhes técnicos, consulte o artigo: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
O problema do sinal fraco ainda é muito real
Os engenheiros simularam essa arquitetura usando modelos de ray-tracing NVIDIA Sionna de Paris e Munique, combinados com medições de misturadores de RF perfiladas em laboratório. Isso forneceu um ambiente de avaliação robusto, mas não envolveu uma implementação celular completa ao vivo. Portanto, a impressionante economia de energia permanece como um limite teórico superior, aguardando validação no mundo real.
O principal obstáculo para essa computação analógica é a suscetibilidade dos sinais de rádio a fatores ambientais. Ruído, desvanecimento de sinal, obstáculos físicos e interferência multicaminho podem corromper os delicados cálculos analógicos realizados pelo misturador de RF. Ao contrário dos sistemas digitais que podem corrigir erros, a computação analógica é inerentemente menos robusta à degradação do sinal.
Os pesquisadores destacaram um caso de falha específico em um cenário simulado de baixa recepção em Munique: o large language model (LLM) ficou preso em textos repetitivos, gerando frases como "it's beer gardens and its beer gardens". Isso demonstra como até mesmo pequenos problemas de integridade de sinal podem levar a falhas significativas de inferência, ressaltando o desafio de manter a precisão em condições variadas do mundo real.
Se os engenheiros conseguirem superar esses desafios de robustez, a broadcast inference poderá impactar profundamente dispositivos com memória limitada, como smartphones e wearables. A capacidade de executar grandes modelos sem armazenar pesos localmente liberaria uma quantidade significativa de memória interna. No entanto, garantir um desempenho consistente em diversos ambientes geográficos e de sinal, além de abordar a privacidade e a cobertura confiável, permanecem desafios críticos em aberto para a implementação prática.
Perguntas Frequentes
O que é o AIR-LLM?
O AIR-LLM é uma abordagem de pesquisa que transmite pesos de modelos de IA via rádio e utiliza o hardware de RF do dispositivo para realizar partes da computação.
O AIR-LLM funciona em telefones reais hoje?
Ainda não. A avaliação relatada combina canais de rádio de cidades simuladas com medições de um misturador de RF; não é uma demonstração ao vivo de telefone para torre.
A torre de celular recebe seus prompts?
No design de transmissão unidirecional proposto, os prompts e as ativações permanecem no dispositivo em vez de serem enviados para a torre.
Quanta energia o AIR-LLM pode economizar?
O artigo relata até 157,7 vezes menos energia por token do que o streaming de pesos FP16 não compactados, com economias menores em relação ao streaming de 4 bits.

