Skip to content
ai tools

이 프로젝트는 Mac에서 놀라운 AI 성능을 잠금 해제합니다

이제 MacBook에서 데이터 센터가 필요했던 AI 모델을 실행할 수 있습니다. 하지만 그 비결은 단순히 Apple의 하드웨어 때문만이 아닙니다. 로컬 AI의 판도를 바꾸는 영리한 소프트웨어 트릭 덕분입니다.

Theo Brandt
이 프로젝트는 Mac에서 놀라운 AI 성능을 잠금 해제합니다

Apple Silicon에서의 2GB AI 기적

본격적인 AI를 위해 서버 랙이 필요하다는 생각은 버리십시오. 새로운 오픈 소스 프로젝트가 기대를 뛰어넘어, 단 2GB 정도의 RAM만으로 Apple Silicon에서 260억 개의 파라미터 모델을 실행합니다. 특히, 인스트럭션 튜닝된 Gemma 4(26B-A4B)는 M-시리즈 Mac에서 초당 23 토큰 이상의 속도를 구현하여, 무리 없이 실사용 가능한 로컬 추론을 제공합니다.

이 성과는 해당 규모의 모델에 필요한 일반적인 메모리 점유율을 획기적으로 줄여줍니다. 일반적으로 Gemma 4와 같은 260억 파라미터 모델은 14GB 이상의 RAM을 요구합니다. Turbo Fieldfare는 메모리 사용량을 7배 줄여 로컬 LLM 배포의 가능성을 근본적으로 변화시켰으며, 강력한 AI를 워크스테이션에서 직접 사용할 수 있게 만들었습니다.

이 프로젝트의 주인공은 Apple 하드웨어를 위해 정교하게 설계된 오픈 소스 애플리케이션인 Turbo Fieldfare입니다. Apple의 저수준 GPU API인 Swift와 Metal로 특별히 제작되었으며, 통합 메모리의 고유한 기능을 활용합니다. 이러한 맞춤형 설계는 Apple Silicon의 성능을 극대화하여 복잡한 Mixture-of-Experts(MoE) 모델을 매끄러운 로컬 경험으로 전환합니다.

왜 AI 모델의 대부분이 불필요한 짐인가

Gemma 4는 단일 네트워크가 아닙니다. 이는 전통적인 단일 네트워크 패러다임을 깨뜨리는 Mixture-of-Experts(MoE) 모델입니다. 하나의 거대한 피드포워드 블록 대신, 128개의 작고 전문화된 '전문가' 네트워크를 배치합니다. 각 전문가는 특정 데이터 패턴을 처리하므로, 전체 모델이 지속적인 전체 활성화 없이도 매우 효율적이고 유연하게 작동합니다.

각 MoE 레이어에는 작은 라우터가 포함되어 있습니다. 특정 토큰에 대해 이 라우터는 128개의 전문가 중 가장 관련성이 높은 상위 8개만을 동적으로 선택하고 활성화합니다. 즉, Gemma 4의 260억 파라미터 중 약 39억 개만이 실제로 작동합니다. 모델 전체 파라미터의 85%는 어떤 순간에도 완전히 유휴 상태로 남아 있습니다.

이러한 고유한 유휴 상태가 Turbo Fieldfare의 핵심 활용 포인트입니다. 85%가 불필요한 짐(dead weight)이라면 굳이 Gemma 4의 전체 14GB를 RAM에 올릴 필요가 없습니다. 이 프로젝트는 항상 필요한 구성 요소와 실제로 선택된 약 39억 개의 파라미터만 메모리에 지능적으로 유지합니다. 전문가들은 SSD에서 즉시(just-in-time) 스트리밍되므로 모델 전체를 상주시킬 필요가 없습니다. 이러한 정밀한 온디맨드 메모리 관리가 Apple Silicon에서 2GB의 기적을 가능하게 하는 비결입니다.

Apple의 비밀 병기: 통합 메모리

전통적인 PC 아키텍처는 AI 추론의 병목 현상을 유발합니다. 일반적으로 가중치를 외장 GPU로 전달하려면 데이터가 SSD에서 시스템 RAM으로 이동한 다음, 느린 PCIe 버스를 거쳐 전용 VRAM으로 이동하는 복잡한 경로를 거쳐야 합니다. 이는 데이터를 전송할 때마다 두 번의 복사와 버스 이동이 발생하며, 전문가 모델을 온디맨드로 스트리밍할 때 성능 저하의 주범이 됩니다.

Apple Silicon은 통합 메모리(unified memory)를 통해 이를 완전히 우회합니다. CPU와 GPU는 동일한 물리적 RAM 풀을 공유합니다. 복사해야 할 별도의 VRAM이 없습니다. Metal 버퍼는 단순히 이 공유 메모리의 영역일 뿐이며, 두 프로세서 모두 즉시 접근할 수 있습니다.

이 아키텍처는 중요한 최적화를 가능하게 합니다. CPU는 전문가 가중치를 SSD에서 GPU가 즉시 접근할 수 있는 메모리 버퍼로 직접 가져옵니다. 느린 복사도, PCIe 전송도 없습니다. 지연 시간이 획기적으로 줄어들어 전문가 모델의 실시간 로딩이 가능해집니다.

더 나아가, Turbo Fieldfare 프로젝트는 이를 극단적인 수준으로 끌어올렸습니다. 가중치는 런타임 변환이 필요한 일반적인 형식으로 저장되지 않습니다. 대신, Metal GPU 커널이 사용하는 정확한 4비트 양자화 레이아웃 그대로 디스크에 존재합니다. 즉, 변환이나 압축 해제 오버헤드가 전혀 없으며, 파일을 읽는 것만으로 가중치가 즉시 로드됩니다. 이 프로젝트에 대한 자세한 내용은 drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook · GitHub를 확인하세요. 이러한 긴밀한 통합은 놀라운 성능을 구현합니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

RAM보다 스마트하게: 온디맨드 스트리밍

Turbo Fieldfare의 메모리 전략은 영리한 2단계 시스템을 사용합니다. 어텐션(attention), 라우터, 임베딩으로 구성된 1.35GB의 핵심 구성 요소는 메모리 매핑(memory-mapped)되어 항상 RAM에 상주합니다. 이 중요한 블록은 디스크 접근 없이 초기 토큰 처리를 담당합니다.

나머지 12.9GB의 전문가(expert) 모델은 전적으로 SSD에 저장됩니다. Turbo Fieldfare는 적시(JIT) 가져오기 전략을 사용하여 라우터가 호출할 때만 이 전문가 모델들을 한 번에 몇 메가바이트씩 메모리로 스트리밍합니다. 미리 가져오기(pre-fetching)는 없으며, 선택은 현재 토큰과 그 이력에 따라 결정됩니다.

지능형 캐싱은 이를 더욱 정교하게 만듭니다. Gemma 4의 30개 레이어 각각은 LFU 캐시를 유지하며, 128개의 전문가 중 16개를 RAM에 보관합니다. 라우터가 캐시된 전문가를 선택하면 즉시 액세스할 수 있습니다. 그렇지 않은 경우, 필요한 전문가를 SSD에서 로드하여 현재 메모리에 있는 가장 적게 사용된(LFU) 전문가를 대체합니다.

이 LFU 방식은 MoE 모델에서 전문가 선택이 무작위가 아닌 예측 가능한 특성을 활용합니다. 일부 전문가는 일관되게 선택되는 반면, 다른 전문가는 거의 선택되지 않습니다. 자주 사용되는 전문가를 우선시함으로써 시스템은 디스크 읽기를 최소화하고, 모델의 기존 연산 스레드 내에서 I/O 지연 시간을 효과적으로 숨깁니다.

자주 묻는 질문(FAQ)

Turbo Fieldfare란 무엇인가요?

Turbo Fieldfare는 SSD에서 모델의 일부를 직접 스트리밍하여 2GB의 RAM만으로도 Apple Silicon Mac에서 26B 파라미터의 Gemma 4와 같은 대규모 AI 모델을 실행할 수 있게 해주는 오픈 소스 프로젝트입니다.

Apple Silicon의 통합 메모리가 왜 중요한가요?

CPU와 GPU가 동일한 메모리 풀을 공유할 수 있게 해주기 때문입니다. 이는 시스템 RAM에서 별도의 GPU VRAM으로 데이터를 복사하는 느린 과정을 제거하며, Turbo Fieldfare가 사용하는 고속 온디맨드 데이터 스트리밍에 매우 중요합니다.

Mixture-of-Experts (MoE) 모델이란 무엇인가요?

여러 개의 작은 '전문가(expert)' 하위 네트워크로 구성된 AI 모델 아키텍처입니다. 특정 작업에 대해 라우터가 몇 개의 전문가만 활성화하도록 선택하므로, 하나의 거대한 단일 모델을 실행하는 것보다 추론 효율성이 훨씬 높습니다.

제 Mac에서도 실행할 수 있나요?

네, M-series Mac(Apple Silicon)을 사용 중이라면 가능합니다. 이 프로젝트는 GitHub에서 제공되며, 저장소를 복제하고 애플리케이션을 실행하는 방법에 대한 지침이 포함되어 있습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only