Skip to content
research

Este modelo de IA de 125B deixou a nuvem comendo poeira

Um PC desktop parece superar uma IA em nuvem por uma margem impressionante — mas o benchmark esconde compensações que podem mudar o significado dos números. Aqui está a engenharia inteligente por trás do resultado e o que é necessário para reproduzi-lo.

Aki Tanaka
Este modelo de IA de 125B deixou a nuvem comendo poeira

O resultado de 6,6 segundos tem um porém

O Strata executou um modelo Qwen 3.8 Flash-Next de 125 bilhões de parâmetros localmente, completando um prompt de resposta longa em 6,6 segundos. O mesmo teste, executado através do serviço em nuvem do OpenRouter, levou 33 segundos. Essa vantagem de velocidade local de 5x também apareceu em tarefas de codificação e escrita criativa.

O criador Niko1221 observou um desempenho variável entre os benchmarks. Um quebra-cabeça lógico curto, por exemplo, resultou em um quase empate: 1,4 segundos localmente contra 1,5 segundos na nuvem. Os resultados mudaram consistentemente com a complexidade da tarefa e o tamanho da resposta, destacando o comportamento adaptativo do modelo.

Crucialmente, várias ressalvas atenuam a comparação direta. O modelo local utilizou uma versão quantizada de 2 bits, inerentemente menor e mais rápida do que uma variante de precisão total. As configurações de hardware da nuvem e a carga do provedor foram variáveis não controladas, potencialmente distorcendo os resultados. Além disso, a configuração local aproveitou uma GPU RTX 5090 com 32 GB de VRAM — um componente de ponta que excede em muito as capacidades típicas de hardware do consumidor.

Esses fatores sugerem que a aceleração impressionante depende de condições específicas. A abordagem inovadora do Strata para processamento distribuído entre GPU, CPU, RAM e SSD certamente permite a execução local de modelos massivos, mas a comparação com serviços em nuvem permanece complexa.

Como um modelo de 125B cabe em um desktop

Alcançar a inferência local com um modelo de 125 bilhões de parâmetros como o Qwen 3.8 Flash-Next pode parecer impossível, dado que até mesmo uma GPU de alto nível como a RTX 5090 tem apenas 32 GB de VRAM. O segredo está na arquitetura Mixture-of-Experts (MoE) do modelo, que o Strata aproveita engenhosamente. Embora o modelo total tenha 125B de parâmetros, apenas cerca de 6 bilhões estão ativos para qualquer token, com um pequeno subconjunto de especialistas selecionados dinamicamente.

O Strata distribui de forma inteligente a carga de trabalho pelos recursos do seu PC. Componentes de modelo compartilhados e especialistas acessados com frequência residem na VRAM da GPU. Todos os 24.576 especialistas, no entanto, são armazenados na RAM do sistema, permitindo acesso rápido.

Uma tabela de consulta de aproximadamente 29 GB permanece no SSD. O Strata busca preventivamente pequenas linhas necessárias, eliminando gargalos de E/S e garantindo uma operação suave. Essa estratégia de memória em camadas permite que um modelo verdadeiramente massivo seja executado em hardware de consumo.

A configuração do vídeo destaca o hardware necessário:

  • Uma RTX 5090 com 32 GB VRAM
  • Um processador Core Ultra 9 285K
  • 62 GB RAM
  • Aproximadamente 80 GB de espaço livre em disco para instalação.

Esta configuração demonstra que, com software otimizado como o Strata, a inferência de IA local de alto desempenho está cada vez mais acessível.

A 'campainha' permite que CPU e GPU trabalhem em equipe

A principal inovação do Strata reside na sua orquestração inteligente de hardware heterogêneo. A GPU, após identificar os dez especialistas necessários para uma determinada camada, sinaliza seus IDs através de um segmento de memória compartilhada, apropriadamente chamado de 'campainha'. Esta notificação permite que a CPU comece a processar simultaneamente na RAM do sistema.

Ao contrário de simplesmente descarregar camadas inteiras, o Strata atribui dinamicamente especialistas disponíveis à GPU e despacha quaisquer falhas de cache diretamente para a CPU. Isso permite que ambos os processadores trabalhem em paralelo na mesma camada, eliminando o tempo ocioso normalmente associado ao movimento de dados e garantindo computação contínua.

Acelerando ainda mais o processo, o Strata integra speculative decoding. Um modelo auxiliar pequeno e eficiente propõe vários tokens futuros potenciais, que o modelo principal Qwen 3.8 Flash-Next verifica em um único lote. Essa abordagem entregou uma aceleração relatada de 1,6–1,8× nos testes, com o modelo principal concordando com as propostas do auxiliar em aproximadamente 79% das vezes, sem alterar o resultado final.

Essa abordagem unificada, aproveitando a VRAM da GPU para especialistas ativos, a RAM do sistema para o conjunto completo de especialistas e até mesmo um SSD NVMe para uma enorme tabela de consulta, maximiza o throughput. Para mais detalhes técnicos sobre este projeto de código aberto, você pode explorar GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware. O Strata transforma efetivamente um PC desktop em um poderoso motor de inferência distribuída.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Inferência Rápida Não é o Mesmo que uma Atualização Gratuita

A inferência local oferece vantagens convincentes, mas os resultados de velocidade do Strata não são uma garantia universal de qualidade ou desempenho do modelo. A quantização local de 2 bits do Qwen 3.8 Flash-Next teve um bom desempenho nos testes específicos do vídeo, mas isso não prova paridade com um modelo em nuvem potencialmente rodando em maior precisão. A precisão frequentemente impacta o raciocínio sutil e a veracidade.

O Strata também exige recursos substanciais do sistema. O modelo de 125B pode consumir quase toda a VRAM disponível (por exemplo, 32 GB em uma RTX 5090) e uma parte significativa da RAM do sistema (até 39 GB no vídeo). O primeiro carregamento do modelo pode travar um PC por minutos, e chats mais longos ou prompts diferentes podem alterar o throughput, como o próprio vídeo observou.

Esses benchmarks impressionantes são específicos do sistema. Por exemplo, o ganho de velocidade de 3–5× do vídeo em uma RTX 5090 não é diretamente comparável a uma configuração com 12 GB de VRAM ou menos RAM de sistema.

Em última análise, a inferência local oferece privacidade, controle do usuário e baixo custo marginal de eletricidade. Serviços em nuvem, por outro lado, evitam o investimento inicial em GPUs de ponta e podem oferecer maior precisão e acesso consistente a modelos poderosos. Os resultados do Strata são uma demonstração convincente do que é possível com software e hardware otimizados, não uma atualização gratuita para todos os usuários.

Perguntas Frequentes

O que é o Strata?

O Strata é um motor de inferência de código aberto projetado para executar o Qwen 3.8 Flash-Next localmente, distribuindo o trabalho entre GPU, CPU, RAM do sistema e SSD.

Como o modelo local superou a nuvem no vídeo?

No PC com RTX 5090 do criador, o Strata completou uma resposta longa em 6,6 segundos, contra 33 segundos para a execução na nuvem. Os resultados dependem de prompts, hardware, carga do provedor e configurações.

Qual PC você precisa para rodar o Strata?

O vídeo relata um mínimo de 12 GB de VRAM, 32 GB de RAM de sistema e cerca de 80 GB de espaço livre em disco. Mais memória e um SSD rápido podem ajudar; o modelo utilizou RAM e VRAM substanciais.

O Strata é mais rápido que a IA em nuvem para todas as tarefas?

Não. O teste de lógica do vídeo foi essencialmente um empate, e o desempenho na nuvem varia. O resultado local também usou um modelo quantizado de 2 bits, portanto, as comparações de velocidade não estabelecem precisão igual.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.