Skip to content
research

Этот чип за $10 теперь стал мозгом ИИ

ИИ-модель с 45 миллионами параметров теперь помещается на микроконтроллере за $10, но её истинная сила не в общении. Это прорыв, который позволит внедрить интеллектуальное управление в миллиарды повседневных устройств.

Aki Tanaka
Этот чип за $10 теперь стал мозгом ИИ

ИИ, который отдает команды, а не дает ответы

Компания Cactus Compute представила Needle 2, революционную ИИ-модель с 45 миллионами параметров. Эта компактная модель объемом 14 МБ работает полностью автономно на микроконтроллере ESP32-S3 за $10, расширяя границы возможного для локального интеллекта без зависимости от облачных сервисов. Needle 2 распространяется с открытым исходным кодом по лицензии Apache 2.0 и демонстрирует новую парадигму для крайне ограниченных по ресурсам периферийных ИИ-систем.

Важно отметить, что Needle 2 функционирует как специализированный диспетчер вызова инструментов. В отличие от чат-ботов общего назначения, она интерпретирует команды на естественном языке для выполнения предопределенных функций устройства. Например, вы можете сказать умному устройству «мигни красным светом в течение трех секунд», и Needle 2 переведет это в точную последовательность действий, необходимых для управления светодиодом, поворота сервопривода или выполнения сложных операций в мобильных или умных домашних системах.

Эта удивительная эффективность стала результатом осознанного и критически важного компромисса. Cactus Compute пожертвовали широкими общими знаниями и способностью к ведению диалога; Needle 2 не может отвечать на фактические вопросы, такие как «Какова столица Франции?». Вместо этого все её обучающие данные сфокусированы исключительно на обеспечении действий устройства. Это делает Needle 2 экспертом в прямом управлении, а не в поиске информации, что обеспечивает её крошечный размер и высокую эффективность для специализированного интеллекта устройств.

Как Cactus взломали архитектуру LLM

Компания Cactus Compute разработала Needle 2 с использованием инновационных архитектурных решений для достижения компактного размера и эффективности. Одно из главных новшеств заключается в замене традиционных обучаемых весов, которые обычно требуют интенсивных матричных вычислений для каждого токена, на хешированные таблицы поиска n-грамм. Такая конструкция позволяет модели извлекать знания напрямую из памяти, вместо выполнения вычислительно затратных операций, что радикально снижает количество операций с плавающей запятой (FLOPs) до всего 70 MFLOPs/токен по сравнению с 460 MFLOPs у более крупных моделей.

Для дальнейшей оптимизации сети Cactus заменили стандартные слои MLP (многослойный перцептрон) на преобразование Адамара. Традиционные слои MLP выполняют смешивание сети с использованием огромных обучаемых матриц, потребляя значительную часть бюджета параметров модели для обучения этих связей. Преобразование Адамара, являясь фиксированной математической операцией, обеспечивает это необходимое смешивание «бесплатно», практически не требуя обучаемых параметров и тем самым экономя миллионы параметров.

Последним элементом головоломки эффективности Needle 2 является встроенная в процесс обучения 2-битная квантование, использующая проприетарную технологию Cactus Quants. Многие небольшие модели страдают от значительного снижения производительности при квантовании после обучения, так как они не были спроектированы для столь агрессивного сжатия. Needle 2, однако, была специально обучена с учетом собственного 2-битного сжатия с самого начала, что обеспечивает оптимальную производительность и исключает потерю качества при такой сверхнизкой точности. Это означает, что развернутая 2-битная модель идентична той, что была обучена.

Побеждая гигантов в пять раз больше себя

Needle 2 бросает вызов представлению о том, что более крупные модели по определению обладают превосходной производительностью. Модель Cactus Compute с 45 миллионами параметров, работающая с 2-битной точностью, конкурирует с такими моделями, как LFM2.5 230M — в пять-семь раз превышающими её по размеру, — и даже превосходит их в специфических, более сложных тестах на вызов инструментов. Эта производительность особенно впечатляет, учитывая, что LFM2.5 работает с 16-битной точностью.

Рассмотрим его специализированную область: в бенчмарке Mobile Actions модель Needle 2 достигла впечатляющей точности 98,3% в выборе правильного имени функции. Этот показатель превосходит все конкурирующие модели, с которыми она сравнивалась в этой конкретной задаче, что демонстрирует её исключительную способность к точному интерпретированию команд. Для тех, кто интересуется реализацией с открытым исходным кодом и дополнительными деталями, проект доступен на GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots..

Повышение эффективности не менее впечатляющее. Needle 2 использует значительно меньше Floating Point Operations (FLOPs) на токен, чем её более крупные аналоги. В то время как модели вроде LFM2.5 230M требуют около 460 MFLOPs/токен, Needle 2 работает всего с 70 MFLOPs/токен. Это представляет собой сокращение вычислительных затрат в 7–85 раз, обеспечивая конкурентоспособные или даже превосходящие результаты в своей нише.

Эта эффективность позволяет сложному ИИ работать на чипе стоимостью $10, делая продвинутые агентные возможности доступными для периферийных устройств с ограниченным питанием, где более крупные и ресурсоемкие модели просто не могут функционировать.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

От теории к мигающему свету

Демонстрация работы Needle 2 на «голом» микроконтроллере ESP32-S3 раскрывает её практическое мастерство. Пользователи отдают команды вроде «включи фиолетовый свет на семь секунд», и модель переводит их в точные вызовы инструментов, запуская физические действия со встроенным показателем уверенности. Хотя это рассуждение и выполнение занимают около 40 секунд на крошечном чипе без GPU, сама возможность является революционной.

Эта производительность значительно масштабируется на более мощном оборудовании. Needle 2 достигает до 500 токенов/секунду на Raspberry Pi 5, что делает её весьма пригодной для приложений реального времени, таких как робототехника и интерактивные устройства. На VR-устройствах она может достигать 400–1500 токенов/секунду, а на бюджетных смартфонах — 300–700 токенов/секунду, демонстрируя свою адаптивность на различных периферийных платформах.

Needle 2 теперь прокладывает путь для нового класса интеллектуальных недорогих продуктов. Её способность работать полностью офлайн в качестве agentic tool call dispatcher приносит пользу:

  • IoT-устройствам
  • Носимым устройствам, таким как кольцо Pebble Index 01
  • Системам «умного дома»

Это позволяет использовать сложный ИИ с сохранением конфиденциальности непосредственно на устройствах, которые мы используем ежедневно, без зависимости от облака.

Часто задаваемые вопросы

Что такое Needle 2?

Needle 2 — это агентная LLM с 45 миллионами параметров и размером 14 МБ, созданная Cactus Compute. Она специально разработана для работы на маломощных периферийных устройствах, таких как микроконтроллеры, для задач вызова инструментов и распределения функций.

Может ли Needle 2 работать как чат-бот общего назначения?

Нет. Needle 2 не обучалась на общих знаниях или ведении диалога. Она узкоспециализирована для интерпретации команд на естественном языке и выполнения предопределенных функций устройства, что делает её диспетчером вызовов инструментов, а не чат-ботом.

Что делает Needle 2 такой маленькой и эффективной?

Её эффективность обусловлена новой архитектурой, использующей хэшированные таблицы поиска n-грамм вместо весов, MLP на основе преобразования Адамара, который почти не требует обучаемых параметров, и специализированной 2-битной квантованностью, применяемой с самого начала обучения.

На каком оборудовании может работать Needle 2?

Она может работать на крайне ограниченном оборудовании без GPU или NPU, включая микроконтроллер ESP32-S3, Raspberry Pi 5, VR-гарнитуры, такие как Meta Quest, и бюджетные смартфоны.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only