Skip to content
AI Инструмент

Обзор Needle 2

Needle 2 — это открытая агентная LLM с 45 миллионами параметров и размером 14 МБ, предназначенная для вызова инструментов, использования устройств и структурированного извлечения данных на крошечных, ресурсно-ограниченных устройствах.

shipped 18 авг. 2026 г.freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

Почему это важно

1Открытая модель с 45 миллионами параметров, весом 14 МБ.
2Оптимизирована для выполнения на устройстве, требуя примерно 28 МБ ОЗУ для полной сессии.
3Достигает скорости декодирования 500 токенов/сек на Raspberry Pi 5 и 300–700 токенов/сек на телефонах стоимостью менее 200 долларов.
4Использует 2-битную квантизацию CQ2 и архитектуру Simple Attention Network для эффективности.

О Needle 2

Бизнес-модель
Hybrid (Subscription + Usage)
Финансирование
Y Combinator
Целевая аудитория
Developers and companies building AI applications on edge devices

Характеристики

Доступность API

Да, публичный API

overview

Что такое Needle 2?

Needle 2 — это компактный агентный инструмент Large Language Model (LLM), разработанный Cactus Compute, который позволяет командам, выпускающим прошивки или приложения для ограниченного оборудования, выполнять вызов инструментов, использовать устройства и осуществлять структурированное извлечение данных. Это открытая модель с 45 миллионами параметров, весом 14 МБ, специально разработанная для эффективного выполнения на устройстве в условиях ограниченных ресурсов.

features

Ключевые особенности Needle 2

Needle 2 включает в себя несколько технических инноваций и возможностей, разработанных для развертывания Edge AI, с акцентом на эффективность и специализированные задачи.

  • Открытая модель с 45 миллионами параметров, веса доступны на Hugging Face.
  • Компактный размер модели 14 МБ, работающая примерно на 28 МБ ОЗУ.
  • 2-битная квантизация CQ2 с использованием Cactus Quants, применяемая с момента предварительного обучения.
  • Архитектура Simple Attention Network с Hadamard MLP и GQA вниманием.
  • Возможности агентной LLM для вызова инструментов и выполнения многошаговых задач.
  • Структурированное извлечение с компилятором грамматики на уровне байтов для соблюдения схемы.
  • Развертывание ИИ на устройстве для автономной работы и повышенной конфиденциальности.
  • Функциональность облачного резервирования для гибридных архитектур ИИ.
  • Модели после обучения, способные запрашивать внешнюю помощь.
  • Высокая скорость вывода: 500 токенов/сек на Raspberry Pi 5, 400–1500 токенов/сек на VR-устройствах.

use cases

Кому следует использовать Needle 2?

Needle 2 специально разработана для разработчиков и компаний, ориентированных на оборудование с ограниченными ресурсами, предлагая локальные возможности ИИ там, где более крупные модели непрактичны.

  • Команды, выпускающие прошивки или приложения для ограниченного оборудования: Для интеграции ИИ в устройства стоимостью менее 200 долларов, такие как бюджетные телефоны и микроконтроллеры (например, ESP32-S3).
  • Стартапы на начальной стадии в области носимых устройств и IoT: Для обеспечения голосового управления на безэкранных устройствах и автономного управления бытовой техникой.
  • OEM-производители бытовой электроники среднего сегмента и команды робототехники: Для использования устройств, управления умным домом и действий роботов, требующих локального ИИ с низкой задержкой.
  • Крупные производители устройств, нуждающиеся в автономном резервировании: Для обеспечения функциональности ИИ даже без подключения к Интернету.
  • Разработчики, работающие над развертыванием на периферии: Для задач структурированного извлечения, таких как извлечение полей из квитанций/счетов или тегирование перечислений на таких устройствах, как Raspberry Pi.

how to use

Как использовать Needle 2

Needle 2 — это открытая модель с публично доступными весами и исходным кодом, что позволяет разработчикам интегрировать ее в свои проекты Edge AI.

  • 1Получите доступ к весам модели на Hugging Face для интеграции в проекты.
  • 2Клонируйте исходный код с GitHub (https://github.com/cactus-compute/cactus), чтобы использовать движок и код обучения.
  • 3Обратитесь к документации API (https://docs.cactuscompute.com/) для получения подробных инструкций по вызову инструментов и структурированному извлечению.
  • 4Разверните 14-мегабайтный автономный бинарный файл на целевом оборудовании, таком как ESP32-S3, Raspberry Pi 5 или телефонах стоимостью менее 200 долларов.
  • 5Реализуйте описания инструментов и схемы, чтобы использовать агентные возможности Needle 2 для конкретных взаимодействий с устройством или задач извлечения данных.

pricing

Цены и планы Needle 2

Needle 2 работает по бизнес-модели freemium, предоставляя доступ к своим основным возможностям с потенциалом для премиум-функций или услуг от Cactus Compute.

  • Freemium: Веса модели и исходный код находятся в открытом доступе, что позволяет бесплатно использовать и интегрировать их в проекты.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Ещё на Stork

Похожие ИИ-инструменты

Другие инструменты этой категории, подобранные по общим тегам