Skip to content
research

로봇 오리가 15MB AI 두뇌를 갖게 되다

소형 모델이 시뮬레이션된 오리에게 언제 복종하고, 거절하고, 화를 낼지 가르쳤으며, 이 모든 작업은 오프라인에서 수행되었습니다. 놀라운 점은 단 몇 분의 미세 조정만으로도 행동 양식을 얼마나 크게 바꿀 수 있는지입니다.

Aki Tanaka
로봇 오리가 15MB AI 두뇌를 갖게 되다

오리는 복종합니다—단, '부탁합니다(please)'라고 말할 때만요.

시뮬레이션된 로봇 오리가 15MB AI 두뇌인 Needle 3가 자연어 요청을 5개의 사용 가능한 도구 중 하나로 매핑할 때만 걷거나, 춤추거나, 반응합니다. Better Stack에서 선보인 이 시연은 Cactus Compute의 소형 파운데이션 모델을 맞춤형으로 조정하여 물리 시뮬레이션 모델인 가상 Open Duck Mini를 작동시키는 모습을 보여줍니다.

Needle 3는 챗봇이 아닙니다. 대화를 나누거나 오리의 보행 메커니즘을 직접 제어하지 않습니다. 대신 별도의 학습된 컨트롤러가 오리의 움직임을 처리하고, Needle은 행동(예: 걷기, 회전, 감정 표현, 춤추기, 고개 흔들기)을 선택하는 역할을 합니다. 이 모델의 구체적인 임무는 이러한 도구를 적절히 배치하는 것이며, 명령 시 '부탁합니다'라는 표현을 요구하는 것과 같은 미묘한 차이에도 반응합니다.

이러한 집중적인 설계 덕분에 모델은 매우 작고 효율적입니다. 데모에 사용된 4계층 버전은 15MB에 불과하여 엣지 디바이스에서 로컬로 실행하기에 적합합니다. 이 실험은 제한된 도구 호출이 오프라인에서 실행되어 클라우드 연결 없이도 즉각적인 디바이스 측 응답성을 제공하는 실용적인 엣지 AI를 강조합니다.

Cactus Compute의 도구 호출 모델 제품군인 Needle 3는 8MB에서 29MB까지 다양합니다. 이 모델의 '지능 사다리(intelligence ladder)' 아키텍처를 통해 개발자는 1억 2,100만 개의 파라미터 모델(5,000만 개의 파라미터와 동일한 연산량) 중 일부를 선택하여 스마트폰부터 마이크로컨트롤러까지 다양한 하드웨어에 맞출 수 있습니다. 이를 통해 Pebble Index 01 Smart Ring과 같은 기기에서 로컬 AI 기능을 구현할 수 있습니다.

기기에 맞춰 조각화된 단일 모델

Needle 3는 유연한 배포를 위해 설계된 20계층 모델인 '지능 사다리'를 도입했습니다. 개발자는 2계층에서 20계층까지 원하는 접두사 조각을 선택할 수 있으며, 각 조각은 독립적인 모델로 작동합니다. 이를 통해 단일 모델 다운로드만으로 초소형 마이크로컨트롤러부터 고성능 스마트폰까지 다양한 하드웨어를 지원할 수 있습니다.

전체 Needle 3는 1억 2,100만 개의 파라미터를 갖추고 있으며, 이는 Needle 2의 4,500만 개에서 크게 증가한 수치입니다. 그러나 이러한 파라미터의 절반 이상은 n-gram 조회 테이블에 존재합니다. Cactus Compute에 따르면, 이러한 설계 선택은 산술 연산을 최소화하여 실제 연산 프로필을 5,000만 파라미터 모델 수준으로 유지합니다.

이 아키텍처는 직접적인 트레이드오프를 생성합니다. 더 큰 조각은 향상된 기능을 제공하고, 더 작은 조각은 하드웨어 제약이 심한 기기에 적합합니다. Needle은 개방형 대화가 아닌 도구 호출 디스패처로 명확히 설계되었습니다. 자연어 명령을 미리 정의된 작업 세트로 매핑하거나, 파라미터를 구조화된 JSON으로 추출하거나, 로컬 검색을 위한 텍스트 임베딩을 생성하는 데 탁월합니다.

이러한 목적 지향적 기능은 놀라운 효율성을 가능하게 합니다. 예를 들어, Cactus는 2,900만 개의 파라미터만 가진 4계층 버전이 미세 조정 후 특정 작업에서 DeepSeek V4 Flash를 능가할 수 있다고 보고합니다. 이러한 전문화 덕분에 Needle 3는 Pebble Index 01 Smart Ring과 같이 리소스가 제한된 기기에서도 음성 명령을 오프라인으로 실행할 수 있습니다.

1,700개의 예제로 예절 가르치기

로봇 오리에게 예절을 가르치기 위해서는 걷기, 회전, 감정 표현, 춤추기, 고개 흔들기라는 5가지 도구에 대한 명확한 규칙이 필요했습니다. 오리는 다음과 같이 훈련되었습니다:

  • '부탁합니다'가 포함된 요청에는 복종한다.
  • '부탁합니다'가 없는 명령은 고개를 저어 거절한다.
  • '부탁합니다'를 사용했더라도 모욕이나 위협에는 화를 낸다.
  • 극적인 상황에는 '부탁합니다' 없이도 반응한다.
  • 타이머 설정과 같이 수행할 수 없는 작업에는 도구를 호출하지 않는다.

이러한 행동을 주입하기 위해 제작자는 약 1,700개의 학습 예제를 생성했습니다. 각 예제는 자연어 프롬프트와 원하는 도구 응답을 쌍으로 구성하여, 모델이 정확한 문구를 암기하는 대신 근본적인 개념을 학습하도록 했습니다. 예를 들어, "무서운 척해줘"는 무서워하는 이모티콘으로 매핑되었고, "우유 사는 것 좀 알려줘"와 같은 요청은 해당 기능이 존재하지 않기 때문에 아무런 호출도 발생하지 않았습니다.

모델의 일반화 능력을 테스트하기 위해 별도로 준비된 49개의 수동 작성 프롬프트를 사용하여, 학습된 "예절"을 새로운 상황에 적용할 수 있는지 확인했습니다. 기반 기술에 대한 자세한 내용은 Needle 3 - Foundation Model for Tiny Devices - Cactus Compute를 참조하세요.

파인튜닝 과정은 RTX 5090 워크스테이션에서 진행되었습니다. 전체 20계층 Needle 3 모델을 학습하는 데는 약 12.5분이 소요되었으며, 더 작은 4계층 버전(약 15MB)은 약 5분 만에 완료되었습니다. 이러한 로컬 파인튜닝의 주요 단점은 Cactus Compute의 호스팅 플랫폼에서 일반적으로 제공되는 기능인 모델의 신뢰도 점수(confidence score)를 사용할 수 없다는 점입니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

작은 모델의 승리—더 좁은 격차로

별도로 보관된 테스트 결과는 파인튜닝의 이점을 명확히 보여주었습니다. 파인튜닝되지 않은 기본 Needle 3 모델은 49개의 테스트 프롬프트 중 13개만을 맞추는 데 그쳤습니다. 반면, 파인튜닝된 전체 20계층 모델은 49개 중 41개를 맞추며 상당한 성능 향상을 보였습니다.

약 15MB 크기의 4계층 버전은 49개 중 30개를 맞추었는데, 크기에 비하면 준수한 성능이지만 전체 모델보다는 상당히 낮은 수치입니다. 이 작은 모델은 때때로 관련 없는 프롬프트를 잘못 해석하여 이상한 반응을 보이거나, 모욕에 대한 오리의 분노를 제대로 식별하지 못하기도 했습니다. 성능은 특정 작업과 학습 예제의 품질에 크게 좌우됩니다.

이러한 실패는 이 이야기의 한계를 보여줍니다. 작은 모델의 능력이 인상적이긴 하지만 보편적이지는 않습니다. 오리의 예절 학습 성공 사례는 이 모델이 범용 추론 엔진이 아닌 도구 호출 디스패처(tool-calling dispatcher)로서의 특수 설계임을 강조합니다.

결국 엣지 AI(edge AI)를 위한 진정한 교훈은 특수 목적의 로컬 실행 디스패처의 잠재력입니다. 이들은 소형 기기에서 특정되고 제한된 작업을 효율적으로 처리할 수 있습니다. 그러나 벤치마크 수치나 인상적인 데모를 광범위한 추론 능력이나 보장된 제품 성능과 혼동해서는 안 됩니다.

자주 묻는 질문(FAQ)

Needle 3란 무엇인가요?

Needle 3는 범용 챗봇이 아닌, 자원이 제한된 기기에서 구조화된 도구 호출을 처리하기 위해 Cactus Compute에서 설계한 소형 모델입니다.

Needle 3가 어떻게 15MB 모델에 들어갈 수 있나요?

20계층 모델을 더 작은 독립형 버전으로 분할할 수 있습니다. 오리 데모에서는 약 15MB 크기의 파인튜닝된 4계층 버전을 사용했습니다.

파인튜닝을 통해 로봇 오리는 무엇을 배웠나요?

오리는 정중한 요청에 응답하고, 무례한 명령을 거부하며, 무례함이나 극적인 상황에 반응하고, 자신의 능력을 벗어난 요청은 무시하도록 학습되었습니다.

파인튜닝된 오리 모델의 성능은 어느 정도였나요?

49개의 수동 작성 테스트 프롬프트에서 4계층 모델은 30개를 맞췄으며, 이는 파인튜닝되지 않은 모델의 13개, 파인튜닝된 20계층 모델의 41개와 비교되는 결과입니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.