Skip to content
ai tools

744B 모델을 구동하는 엔진

노트북에서 최첨단 AI 모델을 실행하는 것은 불가능해 보이지만, 새로운 소형 도구가 그 해답을 찾아냈습니다. 이 성능의 진짜 비결은 GPU가 아니라 하드웨어를 재정의하는 영리한 트릭에 있습니다.

Nora Vance
744B 모델을 구동하는 엔진

노트북의 700GB 문제

GLM-5.2와 같은 최첨단 AI 모델을 노트북에서 실행하는 것은 불가능해 보이며, 그럴 만한 이유가 있습니다. 7,440억 개의 파라미터를 가진 이 거대 모델은 데이터 센터용으로 설계되었으며, 가중치만 저장하는 데에도 수백 기가바이트의 용량이 필요합니다. 이는 최고급 사양의 소비자용 기기가 제공할 수 있는 RAM보다 훨씬 큰 용량입니다.

그렇다면 도저히 들어갈 수 없는 것을 어떻게 넣을 수 있을까요? 그 비결은 GLM-5.2의 영리한 Mixture of Experts(MoE) 아키텍처에 있습니다. 하나의 거대한 신경망 대신, 특정 작업이나 데이터 유형에 맞춰진 수천 개의 전문화된 소형 '전문가' 서브 네트워크로 구성되어 있습니다.

이 설계는 엄청난 최적화 기회를 만들어냅니다. 특정 작업이나 입력에 대해 모델은 7,440억 개의 파라미터를 모두 사용하지 않습니다. 대신 전체의 약 5%에 해당하는 400억 개의 파라미터만 사용하여 요청을 스마트하게 라우팅합니다. 이러한 희소성 덕분에 전체 모델은 거대하더라도 특정 순간의 활성 메모리 점유율은 훨씬 작아집니다. 이것이 바로 Colibrì와 같은 도구가 활용하여 이러한 모델을 데스크탑으로 가져오는 방식입니다.

비결은 GPU가 아니라 SSD입니다

Colibrì의 진짜 비결은 단순히 GPU 성능에만 의존하는 것이 아닙니다. 이 도구는 기기의 하드웨어를 GPU의 VRAM, 컴퓨터의 시스템 RAM, 그리고 빠른 NVMe SSD라는 3단계 메모리 계층 구조로 영리하게 처리합니다. 이러한 계층적 접근 방식은 GLM-5.2와 같은 모델을 로컬에서 처리하는 데 필수적입니다.

모든 토큰에 사용되는 작고 밀집된 구성 요소(약 170억 개의 파라미터)인 모델의 핵심 부분은 시스템 RAM에 영구적으로 상주합니다. 이들은 항상 켜져 있는 부분으로, int4 양자화 시 10GB 미만을 소비하여 필수 작업이 빠르고 반응성 있게 유지되도록 합니다.

7,440억 개의 파라미터를 가진 GLM-5.2의 대부분을 구성하는 수천 개의 거대한 Mixture of Experts(MoE) 네트워크는 SSD에 저장됩니다. 바로 여기서 기기의 제한된 RAM을 압도하지 않으면서 모델의 거대한 크기를 관리합니다.

GLM-5.2가 특정 토큰에 대해 특정 전문가를 필요로 할 때, Colibrì는 전체 모델을 로드하지 않습니다. 대신 필요한 부분만 디스크에서 메모리로 직접 스트리밍하여 사용한 뒤 캐시합니다. 이러한 온디맨드 로딩 및 캐싱 방식은 효율성 측면에서 게임 체인저입니다.

Colibrì는 놀라운 효율성으로 이를 달성합니다. Vincenzo Fornaro는 외부 의존성이 전혀 없는 순수 C 언어로 전체 엔진을 구축했습니다. 이러한 간결한 구현은 오버헤드를 줄이고 실행 속도를 높이며, 도저히 실행될 수 없을 것 같은 환경에서도 거대 모델을 구동할 수 있는 진정한 휴대용 도구를 가능하게 합니다.

MacBook vs. 워크스테이션: 병목 현상의 실체

32GB RAM을 탑재한 MacBook M2 Max에서 느린 외장 SSD를 사용하여 GLM-5.2를 실행한 결과는 매우 느렸습니다. 모델은 초당 약 0.1 토큰의 속도로 기어갔습니다. 프로파일링 결과, 처리 시간의 80% 이상이 단순히 디스크에서 필요한 모델 구성 요소를 가져오기를 기다리는 데 소비된다는 냉혹한 사실이 밝혀졌습니다. M2 Max에서도 실제 계산은 전체 턴당 7초에 불과했지만, 2분이 넘는 디스크 지연 시간으로 인해 그 의미가 퇴색되었습니다.

RTX 5090 GPU와 64GB RAM을 갖춘 더 강력한 워크스테이션으로 전환하자 즉각적인 차이가 나타났습니다. 357GB 모델을 빠른 내장 NVMe SSD에 저장하자 성능은 8배 향상되어 초당 0.8 토큰을 기록했습니다. 첫 단어가 나타나는 데 17초밖에 걸리지 않았으며, 이는 MacBook의 2분 대기 시간보다 훨씬 개선된 결과입니다. 디스크 대기 시간은 48%로 크게 줄어들어, 기기가 기다리는 시간보다 계산하는 데 거의 절반의 시간을 할애하게 되었습니다.

이러한 극명한 대조는 Colibrì로 744B Mixture of Experts 모델을 실행할 때의 진정한 병목 현상이 원시 GPU 성능이 아니라 RAM 용량디스크 속도임을 보여줍니다. 워크스테이션의 강력한 RTX 5090 GPU는 거의 활용되지 않았으며, 진정한 제한 요소는 스토리지에서 모델 전문가를 지속적으로 스트리밍해야 한다는 점이었습니다. Colibrì의 간결한 C 구현을 포함한 더 자세한 기술적 통찰력은 GitHub - JustVugg/Colibrì: Run GLM-5.2 (744B MoE) on a 25GB-RAM consumer machine — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 페이지를 확인하세요. 이러한 메모리 계층을 최적화하는 것이 거대한 모델을 로컬에서 구동하는 핵심입니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

왜 RAM이 새로운 AI의 왕인가

실험 결과, 거대한 로컬 AI 모델에 대해 놀라운 사실이 확인되었습니다. 이제는 고성능 GPU보다 시스템 RAM이 더 중요합니다. 7440억 개의 파라미터를 가진 GLM-5.2로 진행한 테스트에서, 32GB RAM을 탑재한 MacBook의 강력한 M2 Max 칩조차도 메모리 부족으로 인해 전체 시간의 80% 이상을 디스크 대기 상태로 보냈습니다.

32GB RAM으로도 모델이 메모리에 완전히 상주할 수 없어 외부 SSD에서 느린 데이터를 지속적으로 가져와야 했습니다. 반면, 워크스테이션의 64GB RAM과 빠른 내부 드라이브는 대기 시간을 48%로 대폭 줄여 성능을 0.8 tokens/second까지 크게 향상시켰습니다.

이러한 개선은 Colibrì의 영리한 학습 캐시(learning cache) 덕분입니다. 더 많은 RAM을 사용하면 이 캐시는 자주 사용되는 Mixture of Experts 구성 요소의 더 큰 풀을 즉시 사용할 수 있도록 유지합니다. 이는 고통스러운 디스크 대기 시간을 실제 연산 시간으로 전환하며, 토큰당 파라미터의 약 5%만 활성화되는 모델의 희소(sparse) 아키텍처를 직접적으로 활용합니다.

GLM-5.2와 같은 최첨단 모델을 모든 노트북에서 엄청난 속도로 실행하는 꿈이 아직 완전히 이루어진 것은 아니지만, Colibrì는 그것이 가능함을 확실히 증명합니다. 강력한 로컬 AI의 미래는 단순히 칩의 무차별적인 속도에 있는 것이 아니라, 지능적인 메모리 관리와 모든 기가바이트의 RAM을 효율적으로 활용하는 데 있습니다.

자주 묻는 질문(FAQ)

Colibri란 무엇인가요?

Colibri는 순수 C 언어로 작성된 간결한 오픈 소스 추론 엔진으로, 744B 파라미터의 GLM-5.2와 같은 거대한 Mixture-of-Experts(MoE) 언어 모델을 RAM이 제한된 소비자용 하드웨어에서 실행할 수 있게 해줍니다.

Colibri는 어떻게 일반 하드웨어에서 그렇게 큰 모델을 실행하나요?

토큰당 모델의 일부만 활성화되는 MoE 아키텍처를 활용합니다. Colibri는 모델의 작고 밀집된 부분은 RAM에 유지하고, 더 큰 '전문가(expert)' 네트워크는 필요에 따라 NVMe SSD에서 스트리밍하여 스토리지를 메모리의 확장으로 취급합니다.

GLM-5.2와 함께 Colibri를 사용하려면 어떤 하드웨어가 필요한가요?

모델을 위해 최소 360GB의 여유 공간이 있는 빠른 NVMe SSD와 최소 25GB의 시스템 RAM이 필요합니다. 성능은 RAM 용량이 크고 디스크 I/O 속도가 빠를수록 크게 향상됩니다.

Colibri는 클라우드 기반 AI 모델만큼 빠른가요?

아니요. 로컬 실행을 가능하게 하지만 클라우드 기반 모델의 속도를 직접 대체할 수는 없습니다. 특히 초기 실행 시 성능이 느릴 수 있으며, 속도는 RAM 및 SSD 성능에 크게 의존합니다.

Colibri는 Ollama나 llama.cpp와 같은 도구와 어떻게 다른가요?

Colibri는 거대한 MoE 모델을 위해 특별히 설계되었으며, Ollama와 같은 도구가 소비자용 하드웨어에서 지원하는 것보다 10배 더 큰 모델을 처리하기 위해 정교한 3계층 메모리 시스템(VRAM, RAM, SSD)을 사용합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only