O truque inteligente: fazer o benchmark do Mac, não da máquina comum
Motores como llama.cpp e Ollama são distribuídos com kernels pré-compilados. Isso maximiza a portabilidade; uma única compilação funciona em diversos chips. No entanto, essa conveniência muitas vezes deixa desempenho de lado em dispositivos específicos.
Magnitude adota uma abordagem diferente. Quando você baixa um modelo, ele executa uma série de micro-benchmarks diretamente no seu Mac. Ele testa várias configurações de kernel, mede o tempo e armazena em cache a mais rápida. Esse processo de ajuste no dispositivo leva cerca de um minuto.
Você encontrará duas métricas de desempenho principais: prefill e decode. O prefill mede a rapidez com que o motor processa seu prompt. O decode, por outro lado, rastreia a velocidade da geração de tokens, um por um.
A velocidade de decode é frequentemente o fator mais perceptível em fluxos de trabalho de agentes interativos, especialmente quando você está esperando um agente de codificação transmitir sua saída. A promessa de velocidade 2x do Magnitude foca especificamente nesse desempenho de decode.
Criado para agentes — e impressionantemente fácil de conectar
A configuração prática é direta. Escolha um modelo recomendado na aba Discover, baixe-o e o Magnitude fará o ajuste por cerca de um minuto. Em seguida, conecte Claude Code, Codex, OpenCode, Cline ou Pi através de suas APIs locais compatíveis — tanto os endpoints da API da OpenAI quanto da Anthropic são expostos no localhost.
O design focado em agentes do Magnitude o diferencia. O motor otimiza para fluxos de trabalho de múltiplas sessões:
- Caches de prompt compartilhados entre sessões
- Memória gerenciada dinamicamente
- KV cache comprimido (Keys em 8-bit, Values em 4-bit)
- Modelos descarregados quando ociosos
Isso posiciona o Magnitude de forma única. llama.cpp e Ollama priorizam um amplo alcance de hardware, enquanto o MLX se especializa em Apple Silicon. Motores de servidor como vLLM visam o processamento em lote para inferência em data centers. O Magnitude, no entanto, foca no ajuste local e em fluxos de trabalho de agentes. Ele mede sua máquina exata, ajusta-se a ela e constrói em torno de agentes de longa execução. Essa abordagem gera vantagens específicas para desenvolvedores que executam assistentes de IA locais.
O resultado de quase 2x não conta a história toda
Os resultados dos testes de manchete para a promessa de 2x do Magnitude mostram nuances. Em um M4 Pro, o Qwen 3.6 35B A3B (4-bit, 64K context) atingiu 57 tokens por segundo para decode, um ganho de 92% sobre os 30 t/s do llama.cpp. O prefill, no entanto, melhorou apenas 9%. O "2x" é amplamente uma métrica centrada em decode.
Essa comparação não é universal. Um Nvidia DGX Spark executando o mesmo teste viu os ganhos de decode caírem para 19%. Crucialmente, o teste no M4 Pro foi executado com configurações de KV-cache diferentes; o caminho de cache comprimido do llama.cpp falhou, forçando-o a usar um cache completo de 16-bit enquanto o Magnitude usou seu cache comprimido padrão.
Relatórios independentes complicam ainda mais o cenário. Alguns usuários descobriram que o MLX ou o llama.cpp são mais rápidos. Os relatórios incluem o llama.cpp superando o Magnitude no M5 Max e RTX 5070 Ti, e o MLX superando o Magnitude em um M5 Max (175 t/s vs. 161 t/s). Hardware, modelo e configurações específicas ditam claramente o desempenho. Para análises técnicas mais profundas, confira o repositório GitHub - magnitudedev/magnitude: Open source inference engine for agents.
O Magnitude ainda está em estágio inicial (v0.2.5), e seus desenvolvedores observam que ele ainda não aproveita o novo hardware Metal Matrix do M5. Espere mais comparações independentes de MLX à medida que o projeto amadurece. Alegações de velocidade bruta, embora chamem a atenção, raramente contam a história completa em diversos hardwares e cargas de trabalho.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
Quem deve instalar—e quem deve esperar
O Magnitude, na versão 0.2.5, é um experimento inicial. Proprietários de Macs M1–M4 que executam agentes de codificação locais devem instalá-lo. As conexões de um clique para Claude Code, Codex, OpenCode, Cline ou Pi são atraentes, muitas vezes superando os ganhos de throughput bruto para fluxos de trabalho de agentes.
Espere algumas arestas. O catálogo curado oferece cerca de 15 modelos, todos de 4 bits ou superior. Não há orientação para GGUFs personalizados, os modelos baixados ficam ocultos no diretório pessoal do usuário e os descarregamentos em espera significam respostas iniciais mais lentas. Esses são pequenos atritos para os entusiastas.
Usuários de M5 em busca de velocidade máxima devem continuar com o MLX por enquanto; o Magnitude ainda não aproveita o novo hardware Metal Matrix do M5. Implantações em produção exigem paciência. Aguarde comparações independentes mais amplas antes de se comprometer.
A ideia duradoura é o ajuste medido pelo dispositivo, não uma vitória garantida de 2x. A abordagem do Magnitude para otimizar kernels para hardware específico é uma maneira mais inteligente de executar LLMs locais. Mesmo que o ganho de decodificação de 92% em um M4 Pro com Qwen 3.6 35B A3B em contexto de 64K não seja universal, o princípio é sólido.
Perguntas Frequentes
O que é o Magnitude?
O Magnitude é um motor de inferência local de código aberto projetado em torno de agentes de codificação e ajuste de kernel específico para hardware.
O Magnitude é realmente duas vezes mais rápido que o llama.cpp?
Ele registrou quase o dobro da velocidade de decodificação em um teste de M4 Pro, mas os resultados independentes variam de acordo com o hardware, o modelo e a configuração.
Como o Magnitude se ajusta a um Mac?
Ele realiza benchmarks de diferentes configurações de kernel no dispositivo, seleciona as opções mais rápidas e as armazena em cache para uso posterior.
O Magnitude pode se conectar ao Claude Code?
Sim. Suas APIs locais compatíveis com OpenAI e Anthropic suportam uma conexão de um clique ao Claude Code e outras ferramentas de agente.
Quem deve experimentar o Magnitude agora?
Usuários de Mac de M1 a M4 que desejam um backend local simples para agentes de codificação podem achá-lo útil; usuários de produção devem aguardar mais comparações.

