Skip to content
AI 도구

Needle 2 Review

Needle 2는 도구 호출, 장치 사용 및 제한된 리소스의 소형 장치에서 구조화된 추출을 위해 설계된 4,500만 개 매개변수, 14MB의 개방형 에이전트 LLM입니다.

shipped 2026년 8월 18일freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

핵심 포인트

14,500만 개 매개변수를 가진 14MB의 개방형 모델입니다.
2온디바이스 실행에 최적화되어 있으며, 전체 세션에 약 28MB의 RAM이 필요합니다.
3Raspberry Pi 5에서 초당 500토큰, 200달러 미만 휴대폰에서 초당 300~700토큰의 디코딩 속도를 달성합니다.
4효율성을 위해 CQ2-bit 양자화와 Simple Attention Network 아키텍처를 활용합니다.

Needle 2 소개

비즈니스 모델
Hybrid (Subscription + Usage)
투자
Y Combinator
대상 사용자
Developers and companies building AI applications on edge devices

사양

API 제공 여부

예, 공개 API

overview

Needle 2란 무엇인가요?

Needle 2는 Cactus Compute가 개발한 소형 에이전트 Large Language Model (LLM) 도구로, 제한된 하드웨어에서 펌웨어 또는 앱을 출시하는 팀이 도구 호출, 장치 사용 및 구조화된 추출을 수행할 수 있도록 합니다. 이는 4,500만 개 매개변수를 가진 14MB의 개방형 모델로, 리소스가 제한된 환경에서 효율적인 온디바이스 실행을 위해 특별히 설계되었습니다.

features

Needle 2의 주요 기능

Needle 2는 효율성과 특수 작업에 중점을 둔 엣지 AI 배포를 위해 설계된 여러 기술 혁신 및 기능을 통합합니다.

  • Hugging Face에서 가중치를 사용할 수 있는 4,500만 개 매개변수의 개방형 모델입니다.
  • 약 28MB의 RAM에서 실행되는 14MB의 소형 모델 크기입니다.
  • 사전 훈련부터 적용된 Cactus Quants를 사용한 CQ2-bit 양자화입니다.
  • Hadamard MLP 및 GQA 어텐션을 포함한 Simple Attention Network 아키텍처입니다.
  • 도구 호출 및 다단계 작업 실행을 위한 에이전트 LLM 기능입니다.
  • 스키마 준수를 위한 바이트 수준 문법 컴파일러를 통한 구조화된 추출입니다.
  • 오프라인 작동 및 향상된 개인 정보 보호를 위한 온디바이스 AI 배포입니다.
  • 하이브리드 AI 아키텍처를 위한 클라우드 폴백 기능입니다.
  • 외부 지원을 요청할 수 있는 사후 훈련된 모델입니다.
  • 높은 추론 속도: Raspberry Pi 5에서 초당 500토큰, VR 장치에서 초당 400~1,500토큰입니다.

use cases

Needle 2는 누가 사용해야 하나요?

Needle 2는 더 큰 모델이 비실용적인 경우 로컬 AI 기능을 제공하여 리소스가 제한된 하드웨어를 대상으로 하는 개발자와 회사를 위해 특별히 설계되었습니다.

  • 제한된 하드웨어에서 펌웨어 또는 앱을 출시하는 팀: 200달러 미만의 예산 휴대폰 및 마이크로컨트롤러(예: ESP32-S3)와 같은 장치에 AI를 통합하기 위함입니다.
  • 시드 단계 웨어러블 및 IoT 스타트업: 화면 없는 장치에서 음성-액션 및 오프라인 기기 제어를 가능하게 하기 위함입니다.
  • 중견 소비자 가전 OEM 및 로봇 공학 팀: 로컬, 저지연 AI가 필요한 장치 사용, 스마트 홈 제어 및 로봇 동작을 위함입니다.
  • 오프라인 폴백이 필요한 대형 장치 제조업체: 인터넷 연결 없이도 AI 기능을 보장하기 위함입니다.
  • 엣지 배포 작업을 하는 개발자: Raspberry Pi와 같은 장치에서 영수증/송장 필드 추출 또는 열거형 태그 지정과 같은 구조화된 추출 작업을 위함입니다.

how to use

Needle 2 사용 방법

Needle 2는 가중치와 소스 코드가 공개적으로 제공되는 개방형 모델로, 개발자가 엣지 AI 프로젝트에 통합할 수 있습니다.

  • 1프로젝트 통합을 위해 Hugging Face에서 모델 가중치에 액세스합니다.
  • 2엔진 및 훈련 코드를 활용하기 위해 GitHub(https://github.com/cactus-compute/cactus)에서 소스 코드를 복제합니다.
  • 3도구 호출 및 구조화된 추출에 대한 자세한 지침은 API 문서(https://docs.cactuscompute.com/)를 참조하십시오.
  • 414MB의 독립 실행형 바이너리를 ESP32-S3, Raspberry Pi 5 또는 200달러 미만의 휴대폰과 같은 대상 하드웨어에 배포합니다.
  • 5특정 장치 상호 작용 또는 데이터 추출 작업을 위해 Needle 2의 에이전트 기능을 활용하도록 도구 설명 및 스키마를 구현합니다.

pricing

Needle 2 가격 및 요금제

Needle 2는 프리미엄 비즈니스 모델로 운영되며, Cactus Compute의 프리미엄 기능 또는 서비스를 위한 잠재력을 가진 핵심 기능에 대한 액세스를 제공합니다.

  • 프리미엄: 모델 가중치와 소스 코드는 공개적으로 제공되어 프로젝트에 무료로 사용하고 통합할 수 있습니다.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Stork에서 더 보기

관련 AI 도구

같은 카테고리의 다른 도구 — 공통 태그로 연결