진정한 적은 모델이 아니라 메모리입니다
엣지 디바이스에서 거대 언어 모델(LLM)을 실행하는 데는 근본적인 병목 현상이 존재합니다. 이는 단순한 연산 속도가 아니라 메모리와 프로세서 사이에서 모델 가중치를 끊임없이 주고받는 과정에서 발생합니다. 이러한 '메모리 벽(memory wall)'으로 인해 메모리에서 가중치를 가져오는 작업은, 특히 토큰 생성과 같은 빠르고 반복적인 과정에서 실제 연산보다 훨씬 더 많은 에너지를 소비하게 됩니다.
규모를 고려해 봅시다. Llama 3.1 8B와 같은 모델은 FP16 형식의 가중치를 저장하는 데 약 16 GB가 필요합니다. 4비트 양자화를 적극적으로 적용하더라도 활성화 값과 기타 런타임 오버헤드를 제외하고 약 4 GB의 저장 공간이 필요합니다. 이렇게 기가바이트 단위의 데이터를 반복적으로 이동시키는 것이 온디바이스 LLM의 성능과 전력 소비를 결정짓는 가장 큰 제약 요소입니다.
MIT와 듀크 대학교의 연구진은 AIR-LLM이라는 급진적인 해결책을 제시했습니다. 이들의 전제는 문제를 디바이스 메모리에서 무선 인프라로 옮겨 LLM 가중치를 무선으로 전송하는 것입니다. 모든 휴대전화에 가중치를 로컬로 저장하는 대신, 5G 기지국과 같은 중앙 무선 장치가 이를 전송합니다.
이 접근 방식은 Wi-Fi와 5G의 기반 기술인 OFDM(직교 주파수 분할 다중화)을 활용합니다. 각 모델 가중치는 서로 다른 부반송파 주파수에 매핑되며, 이를 통해 디바이스는 수신되는 무선 신호에서 직접 연산을 수행하여 로컬 저장소나 메모리 검색 과정을 완전히 생략할 수 있습니다.
무선 신호가 AI 칩의 일부가 되다
연구진은 5G 기지국과 같은 중앙 무선 장치가 OFDM(직교 주파수 분할 다중화)을 사용하여 모델 가중치를 방송하는 새로운 아키텍처를 제안합니다. Wi-Fi 및 셀룰러 시스템에서 흔히 사용되는 이 기술은 신호를 수천 개의 부반송파로 나누며, 각 부반송파는 하나의 모델 가중치를 전달합니다.
휴대전화의 기존 RF 믹서가 AI 칩의 일부가 됩니다. 이 구성 요소는 수신된 방송 신호(가중치 포함)와 휴대전화의 로컬 프롬프트 활성화 값을 결합합니다. 중요한 점은 믹서의 아날로그 작동 방식이 모든 LLM 레이어의 핵심 수학 연산인 내적(dot product)을 무선 파동 내에서 직접 계산한다는 것입니다.
이 설계는 디바이스에 모델 가중치를 전혀 저장하지 않습니다. 휴대전화는 여전히 프롬프트를 처리하고 후속 연산을 수행하지만, 가장 메모리 집약적인 작업인 가중치 로딩은 방송 메커니즘으로 전환됩니다. 하나의 전송으로 범위 내의 모든 디바이스를 지원하며, 프롬프트가 휴대전화를 떠나지 않으므로 사용자 개인정보도 보호됩니다.
파리와 뮌헨의 도시 모델에서 Llama 3.1 8B를 사용한 시뮬레이션 결과는 인상적이었습니다. 다음 단어 예측 정확도는 4.0%만 저하되었으며, 토큰당 에너지는 FP16 가중치를 스트리밍할 때보다 157.7배 감소했습니다. 무선 신호 내에서의 이러한 아날로그 연산은 엣지 AI에 대한 급진적인 접근 방식을 제시합니다.
방송 규모의 이점과 함께 얻는 큰 에너지 절감
이 새로운 아키텍처는 상당한 효율성 향상을 약속합니다. 연구진은 압축되지 않은 FP16 가중치를 스트리밍하는 것과 비교하여 토큰당 에너지가 최대 157.7배 낮아졌다고 보고했습니다. 더 일반적으로 사용되는 4비트 양자화 가중치의 경우에도 에너지 절감 효과는 약 40.4배로 여전히 상당합니다.
이러한 에너지 절감 효과는 성능 저하를 최소화하면서 이루어집니다. WikiText-2 벤치마크에서 테스트했을 때, Llama 3.1 8B 모델의 다음 토큰 예측 퍼플렉서티(perplexity)는 원본 모델 대비 약 4% 정도만 저하되었습니다. 이는 아날로그 연산으로 전환했음에도 불구하고 모델의 답변이 대체로 일관되게 유지됨을 시사합니다.
이 시스템의 일대다(one-to-many) 브로드캐스트 특성은 특히 다수의 사용자가 있는 환경에서 상당한 이점을 제공합니다. 단일 브로드캐스트로 여러 장치에 동시에 서비스를 제공할 수 있기 때문입니다. 이는 에어타임(airtime)을 획기적으로 줄여주며, 보고된 수치에 따르면 20명의 사용자 환경에서 FP16 가중치를 개별 유니캐스트로 스트리밍할 때보다 104.1배, 4-bit 가중치 대비 26배의 에어타임 감소 효과를 보였습니다.
실제 네트워크 환경은 다양할 수 있으므로, 이러한 시뮬레이션상의 에어타임 감소 수치를 보장된 실제 성능과 구분하는 것이 중요합니다. 하지만 기지국이 라디오나 TV 방송국처럼 공유 자원으로서 기능할 수 있다는 잠재력은 매우 설득력이 있습니다. 더 자세한 기술적 내용은 다음 논문을 참조하십시오: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
약한 신호 문제는 여전히 매우 현실적인 과제입니다.
엔지니어들은 파리와 뮌헨의 NVIDIA Sionna 레이 트레이싱 모델과 실험실에서 프로파일링된 RF 믹서 측정값을 결합하여 이 아키텍처를 시뮬레이션했습니다. 이는 강력한 평가 환경을 제공했지만, 실제 셀룰러 환경에서의 전체 배포를 포함하지는 않았습니다. 따라서 인상적인 에너지 절감 효과는 실제 검증이 이루어지기 전까지는 이론적인 상한선으로 남아 있습니다.
이러한 아날로그 연산의 주요 걸림돌은 무선 신호가 환경적 요인에 취약하다는 점입니다. 노이즈, 신호 페이딩, 물리적 장애물 및 다중 경로 간섭(multipath interference)은 RF 믹서가 수행하는 정밀한 아날로그 계산을 손상시킬 수 있습니다. 오류 수정이 가능한 디지털 시스템과 달리, 아날로그 연산은 본질적으로 신호 저하에 덜 견고합니다.
연구진은 뮌헨의 저수신 환경을 시뮬레이션한 사례에서 특정 실패 사례를 강조했습니다. 대규모 언어 모델(LLM)이 반복적인 텍스트에 갇혀 "it's beer gardens and its beer gardens"와 같은 문구를 생성하는 현상이 발생했습니다. 이는 사소한 신호 무결성 문제조차도 심각한 추론 실패로 이어질 수 있음을 보여주며, 다양한 실제 환경에서 정확성을 유지하는 것이 얼마나 어려운 과제인지 잘 보여줍니다.
엔지니어들이 이러한 견고성 문제를 극복할 수 있다면, 브로드캐스트 추론(broadcast inference)은 스마트폰이나 웨어러블 기기와 같이 메모리가 제한된 장치에 큰 영향을 미칠 수 있습니다. 가중치를 로컬에 저장하지 않고도 대형 모델을 실행할 수 있게 되면 온보드 메모리를 크게 확보할 수 있습니다. 그러나 다양한 지리적 환경과 신호 환경에서 일관된 성능을 보장하고, 개인 정보 보호 및 안정적인 커버리지 문제를 해결하는 것은 여전히 실용적인 배포를 위한 중요한 과제로 남아 있습니다.
자주 묻는 질문(FAQ)
AIR-LLM이란 무엇인가요?
AIR-LLM은 AI 모델 가중치를 무선으로 브로드캐스트하고 장치의 RF 하드웨어를 사용하여 연산의 일부를 수행하는 연구 접근 방식입니다.
AIR-LLM이 현재 실제 휴대폰에서 작동하나요?
아직 아닙니다. 보고된 평가는 시뮬레이션된 도시 무선 채널과 RF 믹서 측정값을 결합한 것이며, 실제 휴대폰과 기지국 간의 라이브 시연은 아닙니다.
셀 타워가 사용자의 프롬프트를 수신하나요?
제안된 일방향 브로드캐스트 설계에서는 프롬프트와 활성화 값이 타워로 전송되지 않고 장치 내에 유지됩니다.
AIR-LLM은 에너지를 얼마나 절약할 수 있나요?
논문에 따르면 압축되지 않은 FP16 가중치를 스트리밍할 때보다 토큰당 에너지를 최대 157.7배 절감할 수 있으며, 4-bit 스트리밍 대비해서도 절감 효과가 있습니다.

