8GB iPhone에서 20GB 모델 구동하기
최근 AI 연구원들은 350억 개의 파라미터를 가진 거대 언어 모델인 Qwen 3.5를 일반 iPhone에서 직접 구동하는 놀라운 성과를 거두었습니다. 이는 단순한 시연을 넘어, 초당 11 토큰의 실용적인 속도를 제공하며 주머니 속 기기를 강력한 로컬 AI 엔진으로 탈바꿈시켰습니다.
이러한 모델은 일반적으로 엄청난 메모리를 요구합니다. 35B 파라미터 모델은 4비트 정밀도로 양자화하더라도 약 20기가바이트(GB)의 RAM이 필요합니다. 이는 대부분의 모바일 기기가 가진 8GB의 물리적 메모리 한계를 훨씬 뛰어넘는 수준으로, 온디바이스 AI의 근본적인 장벽이었습니다.
이 제약을 극복하는 핵심은 Mixture of Experts (MoE) 아키텍처에 있습니다. 모든 연산에 모든 파라미터가 활성화되는 기존의 밀집(dense) 모델과 달리, MoE 모델은 희소하게(sparsely) 활성화됩니다. 입력값이 들어오면 '라우터' 구성 요소가 지능적으로 모델 내의 전문화된 '전문가(experts)' 중 일부만 선택하여 활성화합니다.
이러한 희소 활성화는 메모리 관리 방식을 근본적으로 바꿉니다. 20GB 모델 전체를 RAM에 올리는 대신, 어텐션 메커니즘과 같은 필수 구성 요소와 현재 활성화된 전문가들만 활성 메모리에 상주하면 됩니다. 이를 통해 실시간 메모리 사용량이 크게 줄어들어, 모델의 대부분은 필요할 때까지 iPhone의 SSD와 같은 더 느리고 큰 저장 장치에 머물 수 있게 됩니다.
SSD에서 GPU로: 온디맨드 전문가 파이프라인
iPhone의 제한된 메모리에서 35B 파라미터 LLM을 구동하려면 영리한 메모리 파티셔닝 전략이 필요합니다. 다음을 포함한 1.4GB 크기의 핵심 모델 구성 요소는 RAM에 상주합니다:
- 임베딩(Embeddings)
- 어텐션 메커니즘(Attention mechanisms)
- 라우터(Routers)
- 공유 전문가 1개
나머지 12GB는 각각 약 300MB인 40개의 전문가 파일로 구성되어 iPhone의 고속 SSD에 저장됩니다.
토큰이 생성될 때마다 시스템은 동적 검색 프로세스를 시작합니다. 내부 라우터가 40개 레이어 전체에서 레이어당 8개의 특정 전문가를 256개의 옵션 중에서 선택합니다. 그런 다음 엔진은 선택된 전문가 파일을 SSD에서 GPU 메모리로 직접 읽어옵니다. 이 과정에서 토큰당 약 320회의 작은 읽기 작업이 발생하며, 즉각적인 연산에 필요한 파라미터만 로드되도록 보장합니다.
이러한 온디맨드 전문가 스트리밍은 활성 메모리 사용량을 획기적으로 줄여줍니다. Qwen 3.5 모델은 350억 개의 파라미터를 자랑하지만, 단일 토큰을 처리할 때는 약 30억 개만 활성화됩니다. 이러한 효율적인 자원 할당은 SSD를 비활성 파라미터의 대다수를 위한 확장된 고속 '가상 RAM'으로 활용함으로써 소비자용 하드웨어에서 거대 모델을 구동하는 핵심이 됩니다.
왜 Apple의 OS가 맞춤형 캐시보다 뛰어난가
개발자들은 처음에 전문가 데이터를 관리하기 위해 애플리케이션 내에 9.8GB의 상당한 맞춤형 캐시를 구현했습니다. 역설적이게도, 이 맞춤형 시스템을 삭제하고 기본 iOS 페이지 캐시에 의존했을 때 성능이 38% 향상되는 놀라운 결과가 나타났습니다. 이 예상치 못한 결과는 운영 체제 설계의 기본 원칙을 잘 보여줍니다.
앱 전용 캐시를 위해 이렇게 큰 고정 RAM 블록을 할당하는 것은 오히려 해가 되었습니다. 이 전략은 의도치 않게 연산에 상당한 메모리가 필요한 GPU와 운영 체제 자체의 정교하고 동적인 캐싱 메커니즘이라는 두 가지 핵심 시스템 자원을 고갈시켰습니다. 앱의 명시적인 메모리 예약은 OS와 보완 관계가 아닌 경쟁 관계가 된 것입니다.
iOS page cache는 여유 RAM을 동적으로 관리하는 숨은 공신으로 떠올랐습니다. 이 시스템은 자주 액세스하는 전문가 데이터를 메모리에 지능적으로 유지하여 향후 필요를 예측합니다. 이 방식은 앱이 미리 할당할 필요 없이 전체 시스템 요구 사항에 적응하고 모든 프로세스에 걸쳐 최적의 메모리 할당을 보장하므로 훨씬 효율적입니다.
초당 11 토큰의 속도를 유지하려면 5 GB/s 이상의 까다로운 읽기 속도 요구 사항을 충족하는 것이 중요합니다. 하지만 iPhone의 물리적 플래시 스토리지는 약 1.6 GB/s에서 정점에 달합니다. 결과적으로 운영 체제는 Qwen 3.5 A3B 변형과 같은 모델의 핵심 요소인 전문가 읽기 작업의 대부분을 page cache를 통해 RAM에서 직접 수행하도록 조정합니다. 아키텍처에 대한 자세한 내용은 Qwen3.5-35B-A3B - ModelScope에서 확인하세요.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
더 스마트한 압축 및 실사용 방열판
이러한 iPhone 네이티브 성능을 달성하기 위해서는 모델 압축에 대한 세밀한 접근 방식인 계층적 양자화(tiered quantization)가 필요했습니다. 개발자들은 Mixture of Experts (MoE) 모델의 '전문가' 중 약 25%가 전체 작업의 약 80%를 처리한다는 사실을 확인했습니다. 자주 액세스되는 이러한 "hot" 전문가들은 더 높은 품질의 4비트 정밀도를 유지하여 중요한 정보를 보존합니다.
반면, 상대적으로 덜 사용되는 "cold" 전문가들은 더 깊은 압축을 거쳐 크기가 2비트로 줄어듭니다. 이러한 지능적인 차등 처리는 모델의 전체 스토리지 점유율을 34%나 크게 줄여 초기 19GB에서 13GB로 축소시켰습니다.
디스크 크기의 이러한 상당한 감소는 성능에 직접적인 영향을 미치며, Qwen 3.5 모델 가중치의 더 많은 부분을 효율적인 iOS page cache 내에 상주하게 합니다. 더 많은 데이터를 빠른 메모리에 담는 것은 초당 11 토큰의 생성 속도를 달성하는 데 크게 기여하며, 느린 SSD 읽기에 대한 의존도를 최소화합니다.
소형 모바일 기기에서 이처럼 강도 높고 지속적인 연산은 필연적으로 상당한 열을 발생시킵니다. 사용자들은 iPhone이 눈에 띄게 뜨거워진다고 보고하며, 한 개발자는 "손이 녹아내리는 줄 알았다"고 표현하기도 했습니다. 이는 소비자용 하드웨어에서 AI 추론을 한계까지 밀어붙일 때 발생하는 실질적인 발열 문제를 잘 보여줍니다.
또한 개발자들은 모델이 몇 단어 후 토큰을 반복하며 무한 루프에 빠지는 치명적인 버그를 발견했습니다. 스토리지에서 전문가 데이터를 읽는 async_pread_wait 함수에 긴급한 수정이 필요했습니다. 이 함수는 처음에 절반 크기인 2비트 "cold" 전문가에 대한 읽기 작업을 올바르게 검증하지 못해 이를 조용히 건너뛰었고, 결과적으로 모델이 불완전한 정보로 실행되게 만들었습니다. 이 문제를 수정하는 것은 안정적이고 일관된 출력을 위해 필수적이었습니다.
자주 묻는 질문(FAQ)
35B 모델을 iPhone에서 실행할 수 있게 하는 핵심 기술은 무엇인가요?
이 기술은 Mixture of Experts (MoE) 모델 아키텍처를 활용합니다. 전체 20GB 모델을 RAM에 로드하는 대신, 1.4GB의 핵심 부분만 상주시키고 나머지 모델의 '전문가'들은 각 토큰 생성 시 필요할 때마다 휴대폰의 빠른 SSD 스토리지에서 스트리밍 방식으로 불러옵니다.
시연에는 어떤 모델이 사용되었나요?
시연에는 350억 개의 파라미터를 가진 Mixture of Experts 모델인 Qwen 3.5가 사용되었습니다. 구체적으로는 A3B 변형 모델로, 이는 단일 토큰 생성 시 약 30억 개의 파라미터만 활성화됨을 의미합니다.
Mixture of Experts (MoE) 모델이란 무엇인가요?
MoE는 모델이 여러 개의 작은 '전문가' 네트워크로 구성된 신경망 아키텍처입니다. 입력이 들어오면 라우팅 메커니즘이 이 전문가들 중 작은 하위 집합을 선택하여 처리합니다. 이러한 희소 활성화(sparse activation) 방식 덕분에 추론 시 매우 효율적입니다.
iPhone에서 어떤 수준의 성능이 달성되었나요?
이 설정은 초당 11 토큰의 생성 속도를 달성했습니다. 하지만 이러한 수준의 처리 과정에서 iPhone이 매우 빠르게 눈에 띄게 뜨거워졌습니다.

