Skip to content
research

10달러짜리 칩이 이제 AI 두뇌가 되다

4500만 개의 파라미터를 가진 AI 모델이 10달러짜리 마이크로컨트롤러에 탑재되었습니다. 하지만 이 모델의 진정한 힘은 대화가 아닙니다. 이는 수십억 개의 일상 기기에 지능형 동작을 내장할 수 있는 획기적인 돌파구입니다.

Aki Tanaka
10달러짜리 칩이 이제 AI 두뇌가 되다

답변이 아닌 명령을 내리는 AI

Cactus Compute는 획기적인 4500만 파라미터 AI 모델인 Needle 2를 공개했습니다. 이 14MB 크기의 소형 모델은 10달러짜리 ESP32-S3 마이크로컨트롤러에서 완전히 오프라인으로 작동하며, 클라우드 의존 없이 온디바이스 지능의 한계를 넓혔습니다. Apache 2.0 라이선스로 오픈 소스화된 Needle 2는 고도로 제한된 엣지 AI를 위한 새로운 패러다임을 제시합니다.

중요한 점은 Needle 2가 특수화된 도구 호출 디스패처(tool call dispatcher) 역할을 한다는 것입니다. 범용 챗봇과 달리 자연어 명령을 해석하여 미리 정의된 기기 기능을 실행합니다. 예를 들어, 스마트 기기에 "3초 동안 빨간 불을 깜빡여"라고 말하면, Needle 2는 이를 LED 제어, 서보 회전 또는 복잡한 모바일 및 스마트 홈 작업을 관리하는 데 필요한 정확한 동작 시퀀스로 변환합니다.

이 놀라운 효율성은 의도적이고 결정적인 절충안에서 비롯되었습니다. Cactus Compute는 광범위한 일반 지식과 대화 능력을 포기했습니다. Needle 2는 "프랑스의 수도는 어디인가?"와 같은 사실 기반 질문에 답할 수 없습니다. 대신 전체 학습 데이터가 기기 동작을 활성화하는 데에만 집중되어 있습니다. 이로 인해 Needle 2는 정보 검색이 아닌 직접적인 동작과 제어의 전문가가 되었으며, 전용 기기 지능을 위한 작은 크기와 높은 효율성을 구현했습니다.

Cactus가 LLM 아키텍처를 해킹한 방법

Cactus Compute는 소형화와 효율성을 달성하기 위해 새로운 아키텍처를 선택하여 Needle 2를 설계했습니다. 주요 혁신 중 하나는 일반적으로 모든 토큰마다 방대한 행렬 곱셈을 요구하는 기존의 학습 가능한 가중치를 해시된 n-gram 룩업 테이블로 대체한 것입니다. 이 설계 덕분에 모델은 계산 비용이 많이 드는 연산을 수행하는 대신 메모리에서 직접 지식을 검색할 수 있으며, 부동 소수점 연산(FLOPs)을 더 큰 모델의 460 MFLOPs 대비 70 MFLOPs/토큰으로 대폭 줄였습니다.

네트워크를 더욱 최적화하기 위해 Cactus는 표준 MLP(다층 퍼셉트론) 레이어를 Hadamard 변환으로 교체했습니다. 기존 MLP 레이어는 거대하고 학습 가능한 행렬을 사용하여 네트워크 혼합을 수행하며, 이러한 연결을 학습하기 위해 모델 파라미터 예산의 상당 부분을 소비합니다. 고정된 수학적 연산인 Hadamard 변환은 이러한 필수적인 혼합을 "무료로" 제공하며, 학습 가능한 파라미터가 거의 필요하지 않아 수백만 개의 파라미터를 절약합니다.

Needle 2 효율성 퍼즐의 마지막 조각은 독자적인 Cactus Quants를 활용한 학습 기반 2비트 양자화입니다. 많은 소형 모델은 학습 후 양자화될 때 성능이 크게 저하되는데, 이는 애초에 그러한 강력한 압축을 고려하여 설계되지 않았기 때문입니다. 그러나 Needle 2는 처음부터 자체 2비트 압축을 기반으로 학습되었기 때문에 최적의 성능을 보장하며 이 초저정밀도에서 품질 손실을 제거했습니다. 즉, 배포된 2비트 모델은 학습된 모델과 동일합니다.

5배 더 큰 거대 모델을 능가하다

Needle 2는 모델의 크기가 클수록 성능이 우수하다는 통념에 도전합니다. 2비트 정밀도로 실행되는 Cactus Compute의 4500만 파라미터 모델은 5~7배 더 큰 LFM2.5 230M과 같은 모델과 대등하게 경쟁하며, 특정하고 더 어려운 도구 호출 테스트에서는 이들을 능가하기도 합니다. LFM2.5가 16비트 정밀도로 작동한다는 점을 고려하면 이러한 성능은 특히 놀랍습니다.

특화된 도메인을 고려해 볼 때, Mobile Actions benchmark에서 Needle 2는 올바른 함수 이름을 선택하는 데 있어 98.3%라는 놀라운 정확도를 달성했습니다. 이 수치는 해당 작업에서 비교된 모든 경쟁 모델을 능가하는 것으로, 정밀한 명령 해석에 대한 탁월한 적성을 입증합니다. 오픈 소스 구현 및 추가 세부 정보에 관심이 있는 분들은 GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots.에서 프로젝트를 확인하실 수 있습니다.

효율성 개선 또한 매우 인상적입니다. Needle 2는 더 큰 규모의 모델들에 비해 토큰당 Floating Point Operations (FLOPs)를 획기적으로 적게 사용합니다. LFM2.5 230M과 같은 모델이 토큰당 약 460 MFLOPs를 필요로 하는 반면, Needle 2는 토큰당 70 MFLOPs만으로 작동합니다. 이는 연산 비용을 7배에서 85배까지 절감하면서도, 해당 틈새 시장에서 경쟁력 있거나 오히려 더 뛰어난 결과를 제공함을 의미합니다.

이러한 효율성 덕분에 정교한 AI를 10달러짜리 칩에서도 구동할 수 있게 되었으며, 더 크고 자원 집약적인 모델이 작동할 수 없는 전력 제약이 있는 엣지 디바이스에서도 고급 에이전트 기능을 활용할 수 있게 되었습니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

이론에서 실제 작동까지

베어 메탈 ESP32-S3 마이크로컨트롤러에서 작동하는 Needle 2를 보면 그 실용적인 능력을 확인할 수 있습니다. 사용자가 "7초 동안 보라색 불을 켜줘"와 같은 명령을 내리면, 모델은 이를 정밀한 도구 호출(tool call)로 변환하여 내장된 신뢰도 점수와 함께 물리적 동작을 실행합니다. GPU가 없는 작은 칩에서 이러한 추론과 실행이 완료되기까지 약 40초가 소요되지만, 그 기능 자체는 혁신적입니다.

이 성능은 더 뛰어난 하드웨어에서 극적으로 확장됩니다. Needle 2는 Raspberry Pi 5에서 최대 500 tokens/second를 달성하여 로봇 공학 및 대화형 디바이스와 같은 실시간 애플리케이션에 매우 적합합니다. VR 기기에서는 400~1,500 tokens/second, 저가형 스마트폰에서는 300~700 tokens/second에 도달하여 다양한 엣지 플랫폼 전반에 걸친 적응성을 보여줍니다.

Needle 2는 이제 새롭고 지능적인 저비용 제품군을 위한 길을 열어줍니다. agentic tool call dispatcher로서 완전히 오프라인으로 작동하는 능력은 다음 분야에 혜택을 줍니다:

  • IoT 디바이스
  • Pebble Index 01 링과 같은 웨어러블
  • 스마트 홈 시스템

이를 통해 클라우드 의존 없이 우리가 매일 사용하는 디바이스 내에서 직접 정교하고 개인정보를 보호하는 AI를 구현할 수 있습니다.

자주 묻는 질문

Needle 2란 무엇인가요?

Needle 2는 Cactus Compute에서 제작한 4,500만 개의 파라미터를 가진 14MB 크기의 에이전트 LLM입니다. 도구 호출 및 함수 디스패칭 작업을 위해 마이크로컨트롤러와 같은 저전력 엣지 디바이스에서 실행되도록 특별히 설계되었습니다.

Needle 2를 범용 챗봇으로 사용할 수 있나요?

아니요. Needle 2는 일반 지식이나 대화에 대해 학습되지 않았습니다. 자연어 명령을 해석하고 미리 정의된 디바이스 기능을 실행하는 데 매우 특화되어 있어, 챗봇이 아닌 도구 호출 디스패처(tool call dispatcher)입니다.

Needle 2가 작고 효율적인 이유는 무엇인가요?

그 효율성은 가중치 대신 해시된 n-gram 룩업 테이블을 사용하는 새로운 아키텍처, 학습 가능한 파라미터가 거의 필요 없는 Hadamard 변환 MLP, 그리고 학습 초기부터 적용된 특수 2비트 양자화에서 비롯됩니다.

어떤 하드웨어에서 Needle 2를 실행할 수 있나요?

ESP32-S3 마이크로컨트롤러, Raspberry Pi 5, Meta Quest와 같은 VR 헤드셋, 저가형 스마트폰을 포함하여 GPU나 NPU가 없는 매우 제약된 하드웨어에서도 실행할 수 있습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only