Skip to content
ai tools

La afirmación de velocidad 2x de Magnitude tiene truco

Un benchmark de casi 2x suena a avance, hasta que observas qué se midió, en qué Mac y contra qué configuración. La historia importante quizás no sea sobre una victoria de velocidad universal, sino sobre una nueva forma de construir herramientas de IA locales.

Theo Brandt
La afirmación de velocidad 2x de Magnitude tiene truco

El truco inteligente: medir el Mac, no la máquina promedio

Motores como llama.cpp y Ollama se distribuyen con kernels precompilados. Esto maximiza la portabilidad; una compilación funciona en diversos chips. Sin embargo, esta conveniencia a menudo deja rendimiento sobre la mesa para cualquier dispositivo específico.

Magnitude adopta un enfoque diferente. Cuando descargas un modelo, ejecuta una serie de micro-benchmarks directamente en tu Mac. Prueba varias configuraciones de kernel, mide sus tiempos y guarda en caché la más rápida. Este proceso de ajuste en el dispositivo tarda aproximadamente un minuto.

Encontrarás dos métricas de rendimiento clave: prefill y decode. Prefill mide qué tan rápido procesa el motor tu prompt. Decode, por otro lado, rastrea la velocidad de generación de tokens, uno por uno.

La velocidad de decode es a menudo el factor más notable en flujos de trabajo de agentes interactivos, particularmente cuando esperas a que un agente de programación transmita su salida. La afirmación de velocidad 2x de Magnitude apunta específicamente a este rendimiento de decode.

Diseñado para agentes, y sorprendentemente fácil de conectar

La configuración práctica es sencilla. Elige un modelo recomendado desde la pestaña Discover, descárgalo y Magnitude lo ajustará durante aproximadamente un minuto. Luego, conecta Claude Code, Codex, OpenCode, Cline o Pi a través de sus APIs locales compatibles; tanto los endpoints de la API de OpenAI como los de Anthropic se exponen en localhost.

El diseño centrado en agentes de Magnitude lo diferencia. El motor optimiza para flujos de trabajo de múltiples sesiones:

  • Cachés de prompts compartidos entre sesiones
  • Memoria gestionada dinámicamente
  • Caché KV comprimido (Keys a 8 bits, Values a 4 bits)
  • Los modelos se descargan cuando están inactivos

Esto posiciona a Magnitude de forma única. llama.cpp y Ollama priorizan un amplio alcance de hardware, mientras que MLX se especializa en Apple Silicon. Los motores de servidor como vLLM apuntan al procesamiento por lotes para inferencia en centros de datos. Magnitude, sin embargo, se enfoca en el ajuste local y los flujos de trabajo de agentes. Mide tu máquina exacta, se ajusta a ella y se construye alrededor de agentes de larga ejecución. Este enfoque ofrece ventajas específicas para desarrolladores que ejecutan asistentes de IA locales.

El resultado de casi 2x no cuenta toda la historia

Los resultados de las pruebas principales para la afirmación de 2x de Magnitude muestran matices. En un M4 Pro, Qwen 3.6 35B A3B (4-bit, 64K context) alcanzó 57 tokens por segundo para decode, una ganancia del 92% sobre los 30 t/s de llama.cpp. Prefill, sin embargo, mejoró solo un 9%. El "2x" es en gran medida una métrica centrada en el decode.

Esta comparación no es universal. Un Nvidia DGX Spark ejecutando la misma prueba vio caer las ganancias de decode al 19%. Críticamente, la prueba del M4 Pro se ejecutó con configuraciones de caché KV diferentes; la ruta de caché comprimido de llama.cpp falló, obligándolo a usar una caché completa de 16 bits mientras que Magnitude usó su caché comprimido predeterminado.

Informes independientes complican aún más el panorama. Algunos usuarios encontraron que MLX o llama.cpp eran más rápidos. Los informes incluyen a llama.cpp superando a Magnitude en M5 Max y RTX 5070 Ti, y a MLX superando a Magnitude en un M5 Max (175 t/s frente a 161 t/s). El hardware, el modelo y la configuración específica dictan claramente el rendimiento. Para análisis técnicos más profundos, consulta el repositorio GitHub - magnitudedev/magnitude: Open source inference engine for agents.

Magnitude aún está en sus inicios (v0.2.5), y sus desarrolladores señalan que todavía no aprovecha el nuevo hardware Metal Matrix del M5. Espera más comparaciones independientes con MLX a medida que el proyecto madure. Las afirmaciones de velocidad bruta, aunque llamativas, rara vez cuentan toda la historia en diversos hardware y cargas de trabajo.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Quién debería instalarlo y quién debería esperar

Magnitude, en su versión 0.2.5, es un experimento temprano. Los propietarios de Mac M1–M4 que ejecutan agentes de codificación locales deberían instalarlo. Las conexiones con un solo clic a Claude Code, Codex, OpenCode, Cline o Pi son atractivas y, a menudo, superan las ganancias de rendimiento bruto para los flujos de trabajo de los agentes.

Espere algunos detalles por pulir. El catálogo curado ofrece aproximadamente 15 modelos, todos de 4 bits o superior. No hay guía para GGUFs personalizados, los modelos descargados se ocultan en el directorio de inicio del usuario y las descargas en reposo significan respuestas iniciales más lentas. Estas son fricciones menores para los entusiastas.

Los usuarios de M5 que busquen la máxima velocidad deberían quedarse con MLX por ahora; Magnitude aún no aprovecha el nuevo hardware Metal Matrix del M5. Las implementaciones en producción requieren paciencia. Espere a que haya comparaciones independientes más amplias antes de comprometerse.

La idea perdurable es el ajuste medido por dispositivo, no una victoria garantizada de 2x. El enfoque de Magnitude para optimizar los kernels para hardware específico es una forma más inteligente de ejecutar LLMs locales. Incluso si la ganancia de decodificación del 92% en un M4 Pro con Qwen 3.6 35B A3B a 64K de contexto no es universal, el principio es sólido.

Preguntas frecuentes

¿Qué es Magnitude?

Magnitude es un motor de inferencia local de código abierto diseñado en torno a agentes de codificación y ajuste de kernels específico para el hardware.

¿Es Magnitude realmente el doble de rápido que llama.cpp?

Registró casi el doble de velocidad de decodificación en una prueba con M4 Pro, pero los resultados independientes varían según el hardware, el modelo y la configuración.

¿Cómo se ajusta Magnitude a un Mac?

Realiza pruebas comparativas de diferentes configuraciones de kernel en el dispositivo, selecciona las opciones más rápidas y las almacena en caché para su uso posterior.

¿Puede Magnitude conectarse a Claude Code?

Sí. Sus APIs locales compatibles con OpenAI y Anthropic admiten una conexión con un solo clic a Claude Code y otras herramientas de agentes.

¿Quién debería probar Magnitude ahora?

Los usuarios de Mac con chips M1 a M4 que deseen un backend local sencillo para agentes de codificación pueden encontrarlo útil; los usuarios de producción deberían esperar a ver más comparaciones.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.