영리한 비결: 일반적인 기기가 아닌 Mac을 벤치마크하라
llama.cpp나 Ollama와 같은 엔진은 사전 컴파일된 커널(precompiled kernels)을 제공합니다. 이는 이식성을 극대화하여 하나의 빌드로 다양한 칩에서 작동하게 합니다. 하지만 이러한 편의성은 특정 기기에서 최상의 성능을 내지 못하게 하는 경우가 많습니다.
Magnitude는 다른 방식을 취합니다. 모델을 다운로드하면 Mac에서 직접 일련의 마이크로 벤치마크를 실행합니다. 다양한 커널 구성을 테스트하고 시간을 측정하여 가장 빠른 것을 캐싱합니다. 이 기기 내 튜닝 과정은 약 1분 정도 소요되는 것으로 알려져 있습니다.
두 가지 주요 성능 지표인 prefill과 decode를 접하게 될 것입니다. Prefill은 엔진이 프롬프트를 처리하는 속도를 측정합니다. 반면, Decode는 토큰이 하나씩 생성되는 속도를 추적합니다.
Decode 속도는 인터랙티브 에이전트 워크플로우에서 훨씬 더 체감되는 요소이며, 특히 코딩 에이전트가 출력을 스트리밍할 때 기다리는 동안 더 중요합니다. Magnitude의 2배 속도 주장은 구체적으로 이 decode 성능을 겨냥한 것입니다.
에이전트를 위해 구축되었으며, 연결이 놀라울 정도로 쉽습니다
실제 설정은 간단합니다. Discover 탭에서 권장 모델을 선택하여 다운로드하면, Magnitude가 약 1분간 튜닝을 진행합니다. 그 후 로컬 호환 API를 통해 Claude Code, Codex, OpenCode, Cline 또는 Pi를 연결하십시오. OpenAI 및 Anthropic API 엔드포인트 모두 localhost에서 노출됩니다.
에이전트에 초점을 맞춘 Magnitude의 설계는 차별화됩니다. 엔진은 다중 세션 워크플로우에 최적화되어 있습니다:
- 세션 간 공유 프롬프트 캐시
- 동적으로 관리되는 메모리
- 압축된 KV 캐시 (Key는 8비트, Value는 4비트)
- 유휴 상태일 때 모델 언로드
이로 인해 Magnitude는 독특한 위치를 차지합니다. llama.cpp와 Ollama는 광범위한 하드웨어 지원을 우선시하고, MLX는 Apple Silicon에 특화되어 있습니다. vLLM과 같은 서버 엔진은 데이터센터 추론을 위한 배치 처리를 목표로 합니다. 반면 Magnitude는 로컬 튜닝과 에이전트 워크플로우에 집중합니다. 사용자의 기기를 정확히 측정하고 그에 맞춰 튜닝하며, 장시간 실행되는 에이전트를 중심으로 구축합니다. 이러한 접근 방식은 로컬 AI 어시스턴트를 실행하는 개발자에게 구체적인 이점을 제공합니다.
거의 2배라는 결과가 전부는 아닙니다
Magnitude의 2배 속도 주장에 대한 헤드라인 테스트 결과는 미묘한 차이를 보입니다. M4 Pro에서 Qwen 3.6 35B A3B(4비트, 64K 컨텍스트) 모델은 decode에서 초당 57 토큰을 기록하여 llama.cpp의 30 t/s 대비 92% 향상되었습니다. 그러나 Prefill은 9% 향상에 그쳤습니다. "2배"는 주로 decode 중심의 지표입니다.
이 비교는 보편적이지 않습니다. 동일한 테스트를 실행한 Nvidia DGX Spark에서는 decode 향상 폭이 19%로 떨어졌습니다. 결정적으로, M4 Pro 테스트는 서로 다른 KV 캐시 구성으로 실행되었습니다. llama.cpp의 압축 캐시 경로가 실패하여 전체 16비트 캐시를 사용해야 했던 반면, Magnitude는 기본 압축 캐시를 사용했습니다.
독립적인 보고서들은 상황을 더욱 복잡하게 만듭니다. 일부 사용자는 MLX나 llama.cpp가 더 빠르다는 것을 발견했습니다. 보고서에 따르면 M5 Max 및 RTX 5070 Ti에서는 llama.cpp가 Magnitude를 앞섰고, M5 Max에서는 MLX가 Magnitude를 능가했습니다(175 t/s 대 161 t/s). 하드웨어, 모델, 특정 설정이 성능을 결정짓는 것은 분명합니다. 더 깊은 기술적 분석은 GitHub - magnitudedev/magnitude: Open source inference engine for agents 저장소를 확인하십시오.
Magnitude는 아직 초기 단계(v0.2.5)이며, 개발자들은 아직 M5의 새로운 Metal Matrix 하드웨어를 활용하지 못하고 있다고 언급했습니다. 프로젝트가 성숙해짐에 따라 더 많은 독립적인 MLX 비교가 나올 것으로 예상됩니다. 속도에 대한 단순한 수치는 주의를 끌 수는 있지만, 다양한 하드웨어와 워크로드 전반에 걸친 전체적인 상황을 설명해주지는 못합니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
누가 설치해야 하며, 누가 기다려야 하는가
버전 0.2.5인 Magnitude는 초기 실험 단계의 제품입니다. 로컬 코딩 에이전트를 실행하는 M1~M4 Mac 사용자는 설치해 볼 만합니다. Claude Code, Codex, OpenCode, Cline 또는 Pi에 대한 원클릭 연결은 매우 매력적이며, 에이전트 워크플로우에 있어서는 단순 처리량 증가보다 더 큰 이점을 제공하는 경우가 많습니다.
다소 거친 부분은 감안해야 합니다. 큐레이션된 카탈로그는 4비트 이상의 모델 약 15개를 제공합니다. 커스텀 GGUF에 대한 가이드는 없으며, 다운로드된 모델은 사용자 홈 디렉토리에 숨겨져 있고, 유휴 상태에서 언로드(unload)되기 때문에 첫 응답 속도가 느릴 수 있습니다. 이는 팅커러(tinkerers)들에게는 사소한 불편함일 뿐입니다.
최고의 속도를 추구하는 M5 사용자는 당분간 MLX를 사용하는 것이 좋습니다. Magnitude는 아직 M5의 새로운 Metal Matrix 하드웨어를 활용하지 못합니다. 프로덕션 환경에 배포하려면 인내심이 필요합니다. 도입을 결정하기 전에 더 광범위한 독립적인 비교 결과를 기다리십시오.
핵심 아이디어는 2배의 성능 향상을 보장하는 것이 아니라 기기 측정 기반 튜닝에 있습니다. 특정 하드웨어에 맞춰 커널을 최적화하는 Magnitude의 접근 방식은 로컬 LLM을 실행하는 더 스마트한 방법입니다. M4 Pro에서 Qwen 3.6 35B A3B, 64K 컨텍스트 환경으로 92%의 디코드 성능 향상을 보인 것이 보편적이지 않더라도, 그 원리는 타당합니다.
자주 묻는 질문
Magnitude란 무엇인가요?
Magnitude는 코딩 에이전트와 하드웨어별 커널 튜닝을 중심으로 설계된 오픈 소스 로컬 추론 엔진입니다.
Magnitude가 정말로 llama.cpp보다 두 배 빠른가요?
한 M4 Pro 테스트에서 거의 두 배의 디코드 속도를 기록했지만, 독립적인 결과는 하드웨어, 모델 및 구성에 따라 다를 수 있습니다.
Magnitude는 어떻게 Mac에 맞춰 스스로를 튜닝하나요?
기기에서 다양한 커널 구성을 벤치마킹하고, 가장 빠른 옵션을 선택하여 나중에 사용할 수 있도록 캐시합니다.
Magnitude를 Claude Code에 연결할 수 있나요?
네. 로컬 OpenAI 및 Anthropic 호환 API를 통해 Claude Code 및 기타 에이전트 도구에 원클릭으로 연결할 수 있습니다.
지금 누가 Magnitude를 사용해 봐야 할까요?
코딩 에이전트를 위한 간단한 로컬 백엔드를 원하는 M1~M4 Mac 사용자는 유용하게 사용할 수 있습니다. 프로덕션 사용자는 더 많은 비교 결과가 나올 때까지 기다리는 것이 좋습니다.

