50배 성능의 충격
최근 9천만 개의 파라미터를 가진 Falcon H1 모델이 2020년형 Apple Watch Series 6에서 완전히 오프라인으로 구동되어 온디바이스 AI에 대한 우리의 이해를 근본적으로 뒤흔들었습니다. 4년 전에 출시된 웨어러블 기기에서 수행된 이 시연은 정교한 인공지능이 클라우드 없이 손목에서 직접 독립적으로 작동할 수 있음을 증명합니다. 이는 어디서나 사용할 수 있는 개인화된 AI를 향한 실질적인 진보를 의미합니다.
달성된 성능 지표는 특히 이러한 폼팩터의 기기치고는 매우 놀라운 수준이었습니다. Apple Watch Series 6는 초당 평균 15 토큰의 속도로 텍스트를 생성했는데, 이는 로컬 추론치고는 매우 유연한 속도입니다. 이 속도는 이전의 Raspberry Pi 1세대가 유사한 AI 모델을 실행할 때 초당 0.3 토큰에 불과했던 것과 비교하면 50배나 향상된 놀라운 성능입니다.
이 거대한 성능 격차는 저전력 기기인 Raspberry Pi와 비교했을 때 Series 6의 훨씬 강력한 하드웨어 사양을 직접적으로 반영합니다. Apple Watch Series 6는 강력한 듀얼 코어 1.8 GHz CPU와 1GB의 RAM을 탑재하고 있습니다. 이러한 사양은 Raspberry Pi 1의 700 MHz 싱글 코어 및 512 MB RAM보다 월등히 뛰어나며, 이것이 극적인 처리 능력의 차이와 "성능의 충격"을 설명해 줍니다.
성공의 비결: Falcon이 작동하는 이유
Falcon H1의 놀라운 효율성은 하이브리드 아키텍처에서 비롯됩니다. 이 모델은 대부분의 대규모 언어 모델의 핵심인 표준 어텐션 레이어와 Mamba 2로 알려진 새로운 상태 공간 모델(state space model)을 독특하게 결합했습니다. 이 이중 구성 설계가 Apple Watch와 같이 제약이 많은 하드웨어에서 컴팩트한 성능을 발휘하는 핵심입니다.
Mamba 2는 메모리 효율성이 뛰어납니다. 기존의 어텐션 방식처럼 크기가 계속 커지는 키-값 캐시를 누적하는 대신, Mamba 2는 고정된 크기의 메모리 상태로 작동합니다. 이 모델은 토큰 단위로 상태를 업데이트하며 어떤 정보를 유지하거나 덮어쓸지 동적으로 결정합니다. 이러한 "스캔" 과정 덕분에 토큰을 하나 처리하든 천 개를 처리하든 메모리 사용량이 일정하게 유지되어 RAM이 제한된 기기에 매우 적합합니다.
이러한 아키텍처 선택은 왜 Apple의 자체 Core ML 프레임워크가 Falcon H1을 지원하지 못하는지를 설명해 줍니다. Core ML은 정적 연산에 최적화된 고정된 사전 정의 계산 그래프를 요구합니다. 각 단계의 계산이 이전 상태에 의존하는 Mamba 2의 동적이고 순차적인 "스캔" 구조는 Core ML이 기본적으로 처리할 수 없는 루프 의존성을 생성합니다. 프레임워크 자체에 이러한 유형의 상태 공간 계산을 위한 빌딩 블록이 부족하기 때문입니다.
워치 해킹: ARM64_32 설명
이 프로젝트는 Apple의 기본 프레임워크를 우회하기 위해 맞춤 컴파일된 Llama.cpp 버전을 활용했습니다. 이 인기 있는 추론 라이브러리는 일반적으로 iOS와 macOS를 지원하지만, WatchOS에서는 컴파일을 활성화하기 위해 특정 빌드 플래그와 한 줄의 소스 가드가 필요했습니다. Apple의 온디바이스 ML 프레임워크인 Core ML은 직접적인 빌딩 블록이 부족한 하이브리드 Mamba 2 아키텍처 때문에 Falcon H1에 적합하지 않은 것으로 판명되었습니다.
이번 WatchOS 배포에서 핵심은 ARM64_32 아키텍처를 타겟팅하는 것이었습니다. 이름과는 달리 이는 더 느린 32비트 명령어 세트가 아닙니다. 대신 수학 연산 배칭을 위한 Neon 벡터 유닛을 포함하여 전체 64비트 ARM 명령어 세트를 활용하므로 계산 속도 면에서 성능 저하가 발생하지 않습니다.
WatchOS는 32비트 메모리 포인터를 사용합니다. 표준 64비트 시스템에서는 메모리 주소가 64비트 길이지만, Apple Watch에서는 그 절반 크기입니다. 이러한 설계는 시스템 전반의 RAM을 절약하며, 메모리가 제한된 기기에서 매우 중요한 최적화입니다.
그러나 이 32비트 주소 지정 방식은 2GB RAM 상한선이라는 엄격한 제한을 부과합니다. 이러한 메모리 제한으로 인해 수십억 개의 파라미터를 가진 모델은 충분한 메모리를 주소 지정할 수 없어 실행이 불가능합니다. 하지만 57MB에 불과한 Falcon H1은 이 제약 조건 내에 완벽하게 들어맞으며, 자원이 제한된 웨어러블 기기에서 소형 모델의 실행 가능성을 입증했습니다. 기기 하드웨어에 대한 자세한 내용은 Apple Watch Series 6 - 기술 사양을 참조하십시오.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
구형 기술로도 가능한데, 왜 기다려야 할까요?
Apple Watch Series 6에서 구현된 개념 증명 앱은 단순한 기술적 시연을 넘어 완벽하게 작동하는 AI 비서를 제공했습니다. 이 앱은 네이티브 음성 입력을 강력하게 통합하고 실용적인 도구 사용을 시연하여, 사용자가 Wikipedia에서 사실을 검색하거나 지역 날씨를 확인하도록 했습니다. 이는 "프랑스의 수도는 어디인가요?"와 같은 질문에 즉각적으로 답하며, 단순한 벤치마크를 넘어선 모델의 유용성을 증명했습니다.
짧고 직접적인 질문은 Falcon H1 모델로 초당 최대 24토큰이라는 인상적인 속도를 보였지만, 복잡한 요청을 할 때는 기기 고유의 한계가 명확히 드러났습니다. 더 긴 문단 형태의 응답을 생성할 때는 성능이 눈에 띄게 저하되었습니다. 이는 2020년 하드웨어의 메모리 및 처리 제약, 특히 ARM64_32 아키텍처의 약 2GB 메모리 주소 지정 상한선을 드러냈습니다.
수년 된 소비자용 하드웨어에서 제약이 있기는 하지만 성공적으로 배포된 이 사례는 기기 제조업체, 특히 Apple에 근본적인 질문을 던집니다. 취미 프로젝트로도 Apple Watch에서 의미 있는 실시간 로컬 LLM 기능을 구현할 수 있다면, 왜 범용 온디바이스 AI 모델이 새로운 기기 전반에 걸쳐 표준 통합 기능으로 제공되지 않는 것일까요? 기술적 타당성은 이제 부정할 수 없는 사실로 보입니다.
자주 묻는 질문
Apple Watch에서 사용된 LLM은 무엇인가요?
9천만 개의 파라미터를 가진 Falcon H1 모델이 사용되었습니다. 이 모델은 전통적인 어텐션 레이어와 Mamba 2 상태 공간 모델을 결합한 하이브리드 아키텍처 덕분에 작고 매우 효율적입니다.
Apple Watch에서 LLM은 얼마나 빠르게 실행되었나요?
Falcon H1 모델은 평균 초당 15토큰의 속도로 실행되었으며, 간단한 질문의 경우 초당 최대 24토큰까지 도달했습니다. 이는 Raspberry Pi 1에서 유사한 모델을 실행하는 것보다 약 50배 빠른 속도입니다.
Apple의 Core ML은 왜 Falcon H1 모델을 실행할 수 없나요?
Apple의 Core ML 프레임워크는 Falcon H1 아키텍처의 구성 요소인 상태 공간 모델(Mamba 2)을 기본적으로 지원하지 않습니다. Core ML은 고정된 계산 그래프를 예상하는데, 이는 Mamba의 순차적이고 반복적인 특성과 충돌합니다.
Apple Watch의 ARM64_32란 무엇인가요?
이는 메모리 주소가 64비트 대신 32비트인 ARM64 아키텍처의 변형입니다. 이는 RAM이 제한된 기기에서 메모리를 절약하지만, 2GB의 엄격한 상한선을 만들어 매우 큰 모델을 실행하기에는 부적합하게 만듭니다. 핵심 64비트 명령어 세트는 완전히 유지됩니다.

