Skip to content
research

O truque para colocar um LLM de 35B em um iPhone

Executar um modelo de IA de 35 bilhões de parâmetros em um telefone parece impossível, dado que ele precisa de 20GB de RAM. Mas uma nova técnica muda o jogo em relação aos limites de memória, abrindo as portas para uma IA poderosa e privada que nunca sai do seu dispositivo.

Aki Tanaka
O truque para colocar um LLM de 35B em um iPhone

O problema dos 20GB: Por que isso não deveria funcionar

Executar um large language model de 35 bilhões de parâmetros diretamente em um iPhone parece inicialmente uma impossibilidade computacional. Um modelo dessa escala de 35 bilhões de parâmetros, quando salvo como um arquivo normal de 4-bit, ocupa aproximadamente 20GB. Normalmente, todo esse conjunto de dados de 20GB precisa residir na RAM para um processamento eficiente, uma capacidade muito além de qualquer dispositivo móvel.

No entanto, um método inovador quebrou essa barreira. Pesquisadores demonstraram um modelo MoE com 35 bilhões de parâmetros rodando em um iPhone, alcançando uma ocupação de memória ativa de apenas 1.4GB. Isso representa uma redução impressionante, diminuindo a exigência de memória típica em mais de 90%.

O truque reside na forma como o modelo gerencia seus vastos dados. Em vez de carregar todos os 20GB na RAM, apenas os componentes essenciais e os "experts" atualmente ativos são transmitidos sob demanda a partir do SSD do dispositivo. Essa abordagem inovadora explora os padrões de ativação esparsa inerentes às arquiteturas Mixture-of-Experts.

Esse avanço sinaliza uma mudança profunda para a inteligência artificial. Estamos caminhando para capacidades poderosas e privadas de on-device AI, aliviando tarefas complexas da dependência constante de servidores em nuvem. E isso abre as portas para uma nova geração de aplicativos inteligentes e localizados.

Conheça a arquitetura Mixture-of-Experts (MoE)

Resolver a crise de memória para este modelo de 35 bilhões de parâmetros exigiu uma mudança fundamental na arquitetura: entra em cena a Mixture-of-Experts (MoE). Em vez de um modelo monolítico e massivo onde cada parte está ativa para cada token, a MoE emprega uma equipe de 'experts' menores e especializados. Uma rede 'router' dedicada seleciona dinamicamente apenas alguns desses experts relevantes para uma determinada tarefa.

Essa arquitetura prova ser ideal para dispositivos com recursos limitados, como um iPhone. Normalmente, um modelo de 35 bilhões de parâmetros, como um arquivo normal de 4-bit, exige cerca de 20GB de RAM. Mas com a MoE, apenas os experts selecionados são carregados na memória ativa, deixando a grande maioria inativa em um armazenamento mais lento, como um SSD. Isso reduz drasticamente a ocupação de RAM ativa para apenas 1.4GB.

A MoE não serve apenas para reduzir modelos; é também a chave para escalá-los eficientemente para trilhões de parâmetros. Agora, ela permite que LLMs sofisticados rodem diretamente em dispositivos de borda (edge devices).

Para o iPhone, o modelo é inteligentemente particionado. Componentes compartilhados cruciais — embeddings, mecanismos de atenção, routers e um expert compartilhado — compõem os 1.4GB que residem permanentemente na RAM. Enquanto isso, 40 arquivos de experts individuais, cada um com cerca de 300MB e totalizando 12GB, aguardam no SSD. Para cada token, após a atenção rodar na GPU, o router escolhe oito experts específicos, que o motor então transmite do SSD para a memória da GPU, executando-os junto com o expert compartilhado. Isso envolve 320 pequenas leituras de SSD para cada token.

O motor de streaming sob demanda

Este modelo de 35 bilhões de parâmetros contorna a barreira de memória de 20GB segmentando seus componentes. Um núcleo de 1.4GB de elementos essenciais é carregado uma vez na RAM, formando a espinha dorsal operacional sempre presente do modelo e permanecendo residente durante toda a inferência:

  • embeddings (representações de tokens de entrada)
  • mecanismos de atenção (compreensão contextual)
  • routers (seleção de experts)
  • um expert compartilhado (uma base de uso geral)

Normalmente, modelos inteiros residem na RAM, mas esta arquitetura de 35 bilhões de parâmetros inova. Em vez disso, os 12GB restantes de especialistas especializados residem no rápido SSD do iPhone. Esta arquitetura permite streaming experts: o sistema busca essas grandes porções inativas apenas quando o roteador do modelo as solicita especificamente, transferindo-as para a memória da GPU sob demanda.

Para cada token que o modelo gera, uma sequência rápida de transferências de dados ocorre. O roteador seleciona dinamicamente 8 especialistas dentro de cada uma das 40 camadas, solicitando 320 leituras pequenas e distintas diretamente do SSD. Esse transporte constante de dados em alta velocidade permite que o enorme modelo de 35B opere dentro das restritas limitações de memória do iPhone.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

A Nova Fronteira para Edge AI

Este modelo MoE de 35 bilhões de parâmetros rodando diretamente em um iPhone abre verdadeiramente uma nova fronteira para a edge AI. Imagine assistentes privados profundos, processando dados sensíveis do usuário inteiramente no dispositivo, livres de transferência para a nuvem, ou ferramentas criativas de zero-latency gerando designs intrincados ou respostas de texto instantaneamente. Esses avanços permitem aplicações de IA totalmente offline, transformando capacidades anteriormente confinadas a data centers distantes em realidades tangíveis e pessoais.

Mas este avanço não deixa de ter seus desafios imediatos. O mecanismo de streaming sob demanda, embora engenhoso, gera uma carga de E/S pesada, necessitando de 320 pequenas leituras do SSD para cada token. Esse acesso constante e intensivo aos dados naturalmente aumenta o consumo da bateria e exige um gerenciamento térmico robusto do hardware compacto do dispositivo.

No entanto, esses obstáculos são temporários. O futuro promete uma sinergia poderosa entre técnicas de software inovadoras, como o atual mecanismo de streaming de especialistas, e hardware acceleration cada vez mais especializado. O Neural Engine da Apple, por exemplo, oferece silício dedicado projetado precisamente para cargas de trabalho de IA. Combinado com frameworks e arquiteturas de memória continuamente otimizados, essa abordagem integrada acelerará a jornada em direção à superinteligência mainstream no dispositivo, tornando a IA poderosa onipresente e perfeitamente integrada às nossas vidas diárias.

Perguntas Frequentes

O que é um modelo Mixture-of-Experts (MoE)?

Um modelo MoE é uma arquitetura de rede neural que usa múltiplas sub-redes 'especialistas'. Para qualquer entrada, um mecanismo de roteamento seleciona apenas alguns especialistas para processá-la, tornando a inferência muito mais eficiente do que modelos densos onde toda a rede é usada.

Como a pegada de memória do modelo de 35B foi reduzida tão drasticamente?

A RAM residente do modelo foi reduzida para apenas 1.4GB, mantendo apenas os componentes compartilhados na memória. A maior parte do modelo, os 'especialistas', reside no rápido SSD do telefone e é transmitida para a memória sob demanda durante a inferência.

O que é 'streaming experts'?

É uma técnica onde partes de um grande modelo de IA (os 'especialistas' em uma arquitetura MoE) são armazenadas em um armazenamento SSD mais lento e carregadas dinamicamente na RAM ou memória da GPU mais rápida apenas quando necessário para um cálculo específico, sendo descartadas em seguida.

Quais são os benefícios de rodar grandes modelos de IA em um telefone?

Os principais benefícios são maior privacidade, já que os dados nunca deixam o dispositivo, menor latência sem ida e volta à rede, funcionalidade offline completa e menor dependência de infraestrutura de nuvem cara para inferência.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.