거대 AI 모델이 GPU를 과부하시키는 이유
거대 AI 모델, 특히 mixture of experts(MoE) 모델은 소비자용 GPU에 독특한 과제를 제시합니다. DeepSeek V4-Flash를 예로 들면, 총 2,840억 개의 파라미터를 자랑합니다. 하지만 단일 토큰의 경우, 약 130억 개라는 극히 일부만이 활발하게 사용됩니다. 이 활성 부분은 많은 GPU에 들어갈 수 있지만, 다음에 어떤 전문가(expert)가 필요할지 알 수 없기 때문에 전체 2,840억 개의 파라미터는 일반적으로 시스템 RAM에 상주해야 합니다.
Ollama와 같은 기존 추론 엔진은 이러한 역동적인 현실에서 어려움을 겪습니다. MoE 모델이 GPU의 VRAM 용량을 초과할 때(예: 32GB 카드에서 38GB Qwen 3.6 35B 모델을 실행할 경우), Ollama는 정적인 해결책을 사용합니다. 모델을 영구적으로 분할하여 레이어를 CPU로 오프로드합니다(예: CPU에 30%, GPU에 70%). 이는 어떤 전문가가 필요한지에 관계없이 모든 토큰이 모든 레이어를 거쳐야 함을 의미하며, 상당 부분 CPU를 거치는 느린 우회 경로를 강제합니다. 테스트 결과, 초당 58토큰이라는 낮은 성능을 보였습니다.
FreeToken은 근본적으로 다른 접근 방식을 제공합니다. 정적 배치를 포기하고 문제를 동적 스케줄링으로 재정의합니다. GPU의 VRAM은 자주 액세스되는 전문가를 위한 지능형 캐시가 되고, 전체 모델은 시스템 RAM에 상주합니다. 오직 활발하게 필요한 전문가만 필요에 따라 GPU로 스트리밍됩니다. 이 동적 캐시 기반 시스템은 토큰 간에 동일한 전문가를 자주 재사용하여 더 빠른 GPU에서 연산을 유지하는 MoE 모델에 훨씬 더 적합합니다.
FreeToken의 비밀: 분할이 아닌 스케줄링
FreeToken은 PC가 거대한 mixture of experts 모델을 처리하는 방식을 재고합니다. DeepSeek V4-Flash의 전체 2,840억 개 파라미터를 GPU에 억지로 밀어 넣는 대신, FreeToken은 GPU VRAM을 고속 캐시로 취급합니다. 전체 모델은 시스템 RAM에 있고, 가장 최근에 사용된 전문가만 동적으로 VRAM으로 가져옵니다. 모델은 종종 토큰 간에 전문가를 재사용하므로, 이 전략은 메모리 트래픽을 획기적으로 줄여줍니다.
프롬프트를 처음 보낼 때(프리필 단계), 모델은 일반적으로 많은 전문가에게 액세스해야 하므로 속도가 느려질 수 있습니다. FreeToken은 이 지연 시간을 숨기기 위해 double buffering을 사용합니다. GPU가 현재 레이어를 처리하는 동안, 이 도구는 PCIe를 통해 시스템 RAM에서 다음 레이어의 전문가를 동시에 스트리밍하여 GPU가 쉬지 않고 작업하게 함으로써 유휴 대기 시간을 방지합니다.
실제 생성 중에 전문가가 GPU에 없으면 캐시 미스가 발생합니다. 이때 FreeToken의 영리한 Q\* policy가 작동합니다. 이 정책은 PC의 특정 PCIe 및 RAM 속도를 자동으로 측정하여, 누락된 전문가를 GPU로 가져오는 것이 빠른지 아니면 CPU에서 직접 계산하는 것이 빠른지를 즉석에서 결정합니다. 이 동적 분할은 좁은 PCIe 링크를 사용하든 빠른 RAM을 사용하든 상관없이 사용자의 고유한 하드웨어에 최적화됩니다.
3배 속도 향상 주장에 대한 검증
그렇다면 FreeToken은 실제로 약속을 지켰을까요? 영상에서는 32GB VRAM만 탑재된 소비자용 GPU에서 38GB mixture of experts 모델을 실행하는 까다로운 시나리오를 통해 Ollama와 비교하는 실제 테스트를 진행했습니다. 이 설정은 기존 추론 엔진을 과부하시켜 모델의 상당 부분을 더 느린 시스템 RAM으로 오프로드하도록 강제하도록 특별히 설계되었습니다.
이 상황에서 Ollama는 모델을 레이어별로 분할하여 약 30%를 CPU로 보냅니다. 이는 모든 토큰이 특정 레이어에 대해 느린 CPU를 거쳐야 함을 의미하며, 이로 인해 상당한 병목 현상이 발생합니다. 결과적으로 Ollama는 14분 20초 이상이 소요되었으며, 초당 58 토큰이라는 느린 속도로 작업을 처리했습니다.
반면 FreeToken은 정확히 동일한 작업을 4분 40초 만에 완료하여 초당 132 토큰이라는 놀라운 성능을 보여주었습니다. 이는 거의 3배 빠른 속도로, 모델 크기가 GPU VRAM을 초과하는 대규모 모델을 로컬에서 실행하는 사용자에게 큰 차이를 만들어냅니다.
FreeToken의 영리한 캐싱 전략 또한 실시간 시연을 통해 입증되었습니다. 이 도구를 사용하면 GPU 전문가 캐시를 즉석에서 조정할 수 있으며, '핫(hot)' 전문가의 작은 조각이 대부분의 작업을 처리한다는 것을 시각적으로 증명합니다. 연구원들은 캐시를 전체 모델 크기의 58%에서 40%로 줄여도 속도 저하는 7%에 불과하다는 것을 확인했습니다. 이는 모델 전문가의 20~40%만이 실제로 활발하게 사용된다는 핵심 아이디어를 검증하며, FreeToken의 동적 캐싱(dynamic caching) 방식의 효율성을 확인시켜 줍니다. 기술적 구현에 대한 자세한 내용은 프로젝트의 GitHub - FlashML-org/FreeToken: FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.에서 확인하실 수 있습니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
FreeToken은 만능 해결책이 아닙니다
FreeToken은 모든 AI 작업에 대한 마법의 지팡이가 아닙니다. 인상적인 속도 향상은 mixture of experts model(전문가 혼합 모델)이 GPU의 VRAM 용량을 초과할 때만 나타납니다. 32GB GPU에서 38GB 모델을 실행하는, 기존 추론 엔진을 한계까지 몰아붙이도록 설계된 중요한 비디오 테스트를 기억하십시오.
하지만 더 작은 모델의 경우 상황이 달라집니다. 예를 들어 32GB VRAM에 충분히 들어가는 4비트 양자화 모델은 실제로 Ollama에서 더 빠르게 실행됩니다. 비디오에서는 이 경우 Ollama가 초당 240 토큰을 기록한 반면, FreeToken은 초당 225 토큰을 기록했습니다. VRAM 과부하를 위해 설계된 FreeToken의 정교한 스트리밍 아키텍처는 시스템 RAM에서 스트리밍할 데이터가 없을 때는 순수한 오버헤드가 됩니다.
따라서 간단한 조언을 드리자면, 모델이 GPU에 완전히 들어간다면 최적의 성능을 위해 Ollama나 Llama.cpp를 계속 사용하십시오. 일반 소비자용 하드웨어에서는 실행할 수 없었던 대규모 mixture of experts models(전문가 혼합 모델)을 실행하고자 할 때만 FreeToken으로 전환하십시오. 이는 이전에 접근할 수 없었던 모델들을 실행 가능하게 만들고 획기적으로 가속화합니다.
자주 묻는 질문
FreeToken이란 무엇인가요?
FreeToken은 대규모 Mixture of Experts (MoE) AI 모델을 소비자용 하드웨어에서 효율적으로 실행하기 위해 설계된 오픈 소스 추론 엔진으로, 이 특정 작업에서 Ollama나 Llama.cpp와 같은 도구에 대한 고성능 대안 역할을 합니다.
FreeToken은 어떻게 AI 모델을 더 빠르게 만드나요?
FreeToken은 모델 레이어를 CPU와 GPU 사이에 영구적으로 분할하는 대신, GPU VRAM을 가장 많이 사용되는 '전문가'를 위한 동적 캐시로 취급합니다. 지능형 스케줄링, 이중 버퍼링, 적응형 CPU-GPU 공동 실행을 사용하여 특히 모델이 사용 가능한 VRAM보다 클 때 데이터 전송 지연 시간을 최소화합니다.
FreeToken이 항상 Ollama보다 빠른가요?
아니요. FreeToken의 주요 장점은 MoE 모델이 GPU VRAM에 담기 너무 클 때 나타납니다. 모델이 VRAM에 충분히 들어간다면, FreeToken의 스트리밍 아키텍처가 불필요한 오버헤드를 발생시키기 때문에 Ollama나 Llama.cpp가 더 빠를 가능성이 높습니다.
FreeToken은 어떤 종류의 모델을 전문으로 하나요?
FreeToken은 DeepSeek-V4-Flash, Qwen3.6-35B, GLM-5.2와 같은 Mixture of Experts (MoE) 모델을 위해 특별히 구축되었습니다. 이 아키텍처는 이러한 모델 고유의 '전문가(experts)' 동적 활성화를 처리하도록 최적화되어 있습니다.

