20GB 문제: 왜 이것이 불가능하다고 여겨지는가
350억 개의 파라미터를 가진 대규모 언어 모델(LLM)을 iPhone에서 직접 실행하는 것은 처음에는 계산상 불가능해 보입니다. 이 350억 파라미터 규모의 모델은 일반적인 4비트 파일로 저장될 경우 약 20GB를 차지합니다. 일반적으로 이 20GB 데이터셋 전체가 효율적인 처리를 위해 RAM에 상주해야 하는데, 이는 모바일 기기의 용량을 훨씬 초과하는 수준입니다.
그러나 획기적인 방법이 이 장벽을 허물었습니다. 연구진은 350억 개의 파라미터를 가진 MoE 모델을 iPhone에서 실행하여 활성 메모리 점유율을 단 1.4GB로 줄이는 데 성공했습니다. 이는 일반적인 메모리 요구 사항을 90% 이상 절감한 놀라운 수치입니다.
비결은 모델이 방대한 데이터를 관리하는 방식에 있습니다. 20GB 전체를 RAM에 로드하는 대신, 필수 구성 요소와 현재 활성화된 '전문가(experts)'만 기기의 SSD에서 필요에 따라 스트리밍합니다. 이 혁신적인 접근 방식은 Mixture-of-Experts 아키텍처 고유의 희소 활성화 패턴을 활용합니다.
이번 돌파구는 인공지능의 심오한 변화를 예고합니다. 우리는 클라우드 서버에 지속적으로 의존하지 않고도 강력하고 개인적인 온디바이스 AI 기능을 향해 나아가고 있습니다. 이는 차세대 지능형 로컬 애플리케이션의 가능성을 열어줍니다.
Mixture-of-Experts (MoE) 아키텍처 소개
이 350억 파라미터 모델의 메모리 부족 문제를 해결하려면 아키텍처의 근본적인 변화가 필요했습니다. 바로 Mixture-of-Experts (MoE)입니다. 모든 토큰에 대해 모든 부분이 활성화되는 거대하고 단일화된 모델 대신, MoE는 더 작고 전문화된 '전문가' 팀을 고용합니다. 전용 '라우터' 네트워크가 특정 작업과 관련된 소수의 전문가만 동적으로 선택합니다.
이 아키텍처는 iPhone과 같이 자원이 제한된 기기에 이상적입니다. 보통 350억 파라미터 모델을 4비트 파일로 저장하면 약 20GB의 RAM이 필요합니다. 하지만 MoE를 사용하면 선택된 전문가만 활성 메모리에 로드되고, 대다수는 SSD와 같은 저속 저장 장치에 휴면 상태로 남습니다. 이를 통해 활성 RAM 점유율을 1.4GB로 획기적으로 줄일 수 있습니다.
MoE는 단순히 모델을 축소하는 데 그치지 않고, 수조 개의 파라미터로 효율적으로 확장하는 핵심 기술이기도 합니다. 이제 정교한 LLM을 엣지 디바이스에서 직접 실행할 수 있게 되었습니다.
iPhone의 경우, 모델은 영리하게 분할되어 있습니다. 임베딩, 어텐션 메커니즘, 라우터, 공유 전문가 등 중요한 공유 구성 요소가 RAM에 상주하는 1.4GB를 구성합니다. 한편, 각각 약 300MB씩 총 12GB에 달하는 40개의 개별 전문가 파일은 SSD에서 대기합니다. 각 토큰에 대해 GPU에서 어텐션이 실행된 후, 라우터가 8개의 특정 전문가를 선택하면 엔진이 이를 SSD에서 GPU 메모리로 스트리밍하여 공유 전문가와 함께 실행합니다. 이는 토큰 하나당 320번의 작은 SSD 읽기 작업을 수반합니다.
온디맨드 스트리밍 엔진
이 350억 파라미터 모델은 구성 요소를 분할하여 20GB 메모리 장벽을 우회합니다. 필수 요소인 1.4GB의 핵심 구성 요소가 RAM에 한 번 로드되어 모델의 상시 운영 기반을 형성하며 추론 내내 상주합니다:
- 임베딩 (입력 토큰 표현)
- 어텐션 메커니즘 (문맥 이해)
- 라우터 (전문가 선택)
- 공유 전문가 (범용 베이스라인)
보통 전체 모델은 RAM에 상주하지만, 이 350억 개의 파라미터 아키텍처는 혁신을 보여줍니다. 대신, 12GB의 특화된 전문가 모델은 iPhone의 빠른 SSD에 상주합니다. 이 아키텍처는 스트리밍 전문가(streaming experts) 기능을 가능하게 합니다. 시스템은 모델의 라우터가 특정하게 호출할 때만 이 거대하고 비활성 상태인 부분을 가져와 필요에 따라 GPU 메모리로 전송합니다.
모델이 토큰을 생성할 때마다 빠른 데이터 전송 시퀀스가 이어집니다. 라우터는 40개 레이어 각각에서 8개의 전문가를 동적으로 선택하며, SSD에서 직접 320개의 개별적인 작은 읽기 작업을 수행합니다. 이러한 지속적인 고속 데이터 전송을 통해 거대한 s 35 모델이 iPhone의 제한된 메모리 환경 내에서 작동할 수 있습니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
엣지 AI의 새로운 지평
iPhone에서 직접 실행되는 이 350억 파라미터 MoE 모델은 엣지 AI의 새로운 지평을 열었습니다. 클라우드 전송 없이 기기 내에서 민감한 사용자 데이터를 완전히 처리하는 개인 정보 보호 어시스턴트나, 복잡한 디자인 또는 텍스트 응답을 즉시 생성하는 지연 시간 제로(zero-latency) 창의적 도구를 상상해 보십시오. 이러한 발전은 완전한 오프라인 AI 애플리케이션을 가능하게 하여, 이전에 원격 데이터 센터에 국한되었던 기능을 실질적이고 개인적인 현실로 변화시킵니다.
하지만 이 돌파구에도 즉각적인 과제는 있습니다. 온디맨드 스트리밍 엔진은 독창적이지만, 토큰 하나당 SSD에서 320번의 작은 읽기 작업을 수행해야 하므로 상당한 I/O 부하를 발생시킵니다. 이러한 집중적이고 지속적인 데이터 액세스는 자연스럽게 배터리 소모를 증가시키며, 소형 기기 하드웨어에서 강력한 열 관리를 요구합니다.
그러나 이러한 장애물은 일시적입니다. 미래에는 현재의 전문가 스트리밍 엔진과 같은 혁신적인 소프트웨어 기술과 점점 더 전문화되는 하드웨어 가속(hardware acceleration) 간의 강력한 시너지가 기대됩니다. 예를 들어, Apple의 Neural Engine은 AI 워크로드를 위해 특별히 설계된 전용 실리콘을 제공합니다. 지속적으로 최적화된 프레임워크 및 메모리 아키텍처와 결합된 이 통합 접근 방식은 온디바이스 슈퍼인텔리전스의 주류화를 가속화하여 강력한 AI를 일상생활에 보편적이고 원활하게 통합할 것입니다.
자주 묻는 질문
Mixture-of-Experts (MoE) 모델이란 무엇인가요?
MoE 모델은 여러 개의 특화된 '전문가(expert)' 서브 네트워크를 사용하는 신경망 아키텍처입니다. 입력이 들어오면 라우팅 메커니즘이 이를 처리할 소수의 전문가만 선택하므로, 전체 네트워크를 사용하는 밀집(dense) 모델보다 추론 효율성이 훨씬 높습니다.
35B 모델의 메모리 점유율은 어떻게 그렇게 획기적으로 줄었나요?
공유 구성 요소만 메모리에 유지함으로써 모델의 상주 RAM을 1.4GB로 줄였습니다. 모델의 대부분인 '전문가'들은 휴대폰의 빠른 SSD에 상주하며 추론 중에 필요에 따라 메모리로 스트리밍됩니다.
'스트리밍 전문가(streaming experts)'란 무엇인가요?
거대 AI 모델의 일부(MoE 아키텍처의 '전문가')를 느린 SSD 저장소에 저장하고, 특정 계산에 필요할 때만 더 빠른 RAM이나 GPU 메모리로 동적으로 로드한 후 폐기하는 기술입니다.
휴대폰에서 거대 AI 모델을 실행하는 것의 이점은 무엇인가요?
주요 이점은 데이터가 기기를 떠나지 않아 강화된 개인 정보 보호, 네트워크 왕복이 없어 지연 시간이 짧음, 완전한 오프라인 기능, 그리고 추론을 위해 비용이 많이 드는 클라우드 인프라에 대한 의존도를 줄이는 것입니다.

