Skip to content
ai agents

Модель 2B победила титана 4B. Вот в чем подвох.

Крошечная модель с 2 миллиардами параметров превосходит гигантов в два раза больше себя в сложных задачах по программированию, открывая новую эру для локальных AI-агентов. Но в ее собственной документации скрыта одна настройка, которая может сделать ее совершенно бесполезной.

Sol Aguirre
Модель 2B победила титана 4B. Вот в чем подвох.

Модель 2B, которая превзошла конкурента 4B

MiniCPM5-2B, модель с 2 миллиардами параметров от OpenBMB, недавно произвела сенсацию в бенчмарке SWE-bench Verified. Она набрала 46 баллов, решительно победив Qwen3.5-4B с 4 миллиардами параметров, которая достигла 34 баллов. Эта производительность опровергла общепринятые представления о масштабируемости моделей, обойдя конкурента в два раза больше себя и поставив под сомнение идею о том, что больше — всегда лучше.

Этот скачок еще более значителен, если посмотреть на ее весовую категорию. Другие модели с 2 миллиардами параметров, такие как Qwen3.5-2B и Gemma-4-E2B, показали результаты 5 и 2 балла соответственно. MiniCPM5-2B не просто победила; она переопределила возможности малых моделей, сигнализируя о новом рубеже для эффективного и развертываемого ИИ, особенно в условиях ограниченных ресурсов.

SWE-bench — это не академическое упражнение; он строго проверяет способность модели решать реальные проблемы GitHub, создавая функциональные патчи кода. Речь идет не о беглости чата или теоретическом понимании, а о практическом агентном решении проблем в сложных программных средах. Модель 2B, работающая на таком уровне, сигнализирует о глубоком сдвиге в возможностях AI-агентов, переходя от абстрактного потенциала к ощутимым, проверяемым результатам для разработчиков.

Создана, а не доработана для агентов

Потрясающая производительность MiniCPM5-2B — это не случайность; она представляет собой глубокий сдвиг в проектировании моделей. OpenBMB специально разработала режим обучения для агентного поведения, выйдя за рамки общих возможностей чата, подав на вход 500 000 траекторий агентов во время обучения с учителем. Этот строгий процесс затем включил передовое обучение с подкреплением, кульминацией которого стало объединение 16 отдельных экспертных моделей RL в единого, узкоспециализированного агента.

С архитектурной точки зрения MiniCPM5-2B делает прагматичный, но мощный выбор: использование стандартной базы Llama. Речь идет не об изобретении новых компонентов, а о максимизации полезности и охвата, избегая пользовательского разреженного внимания (sparse attention), которое было проблемой предыдущих итераций. Этот стратегический выбор обеспечивает модели огромную совместимость, позволяя ей легко работать в различных средах, таких как:

  • MLX
  • Llama.cpp
  • WebLLM

Это значительно снижает порог входа для разработчиков, создающих агентные системы.

Критически важно, что технические характеристики MiniCPM5-2B дополнительно подкрепляют ее агентское мастерство. Она оснащена надежным родным контекстным окном в 128 000 токенов, что необходимо для поддержания состояния и понимания последовательностей длительных задач. Выпуск модели по лицензии Apache 2.0 вместе с открытыми наборами данных способствует прозрачности и широкому внедрению, делая ее фундаментальным элементом для новых агентных приложений.

Одна плохая настройка по умолчанию ломает всё

Запуск квантованной 4-битной модели GGUF с настройками по умолчанию выявляет критический недостаток MiniCPM5-2B. Несмотря на успехи в бенчмарках, модель может попадать в изнурительный цикл повторений более чем в 92% случаев, что делает ее практически бесполезной для агентных задач. Эта внутренняя нестабильность, вызванная обычными конфигурациями по умолчанию, изначально скрывала истинный потенциал модели.

Простое, ранее недокументированное исправление преобразует это хаотичное поведение. Изменение настроек сэмплера — в частности, установка min_p на 0 или repeat_penalty на 1.15 — раскрывает скрытые возможности MiniCPM5-2B. В HumanEval+ квантованная версия Q4_KM прыгает с удручающего результата 6 до впечатляющего 71 балла при этих специфических корректировках, что подчеркивает драматическую чувствительность.

Это не просто настройка параметров; это фундаментальный аспект проектирования для эффективного ИИ. Для небольших, узкоспециализированных моделей, таких как MiniCPM5-2B, настройки сэмплера — это уже не просто «тюнинг», а критически важная часть функционального дизайна модели. Игнорирование этих важных настроек по умолчанию может полностью вывести из строя в остальном мощного агента, что демонстрирует, насколько плотно оптимизированы эти системы. Ознакомьтесь с текущими разработками OpenBMB в области этих архитектур в их репозитории GitHub - OpenBMB/MiniCPM: MiniCPM5: SOTA on-device LLMs, small yet powerful..

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Проверка реальностью: когда 4B всё ещё побеждает

Несмотря на свои выдающиеся агентные способности, MiniCPM5-2B сталкивается со значительными ограничениями при выходе за пределы своей узкой ниши. Хотя модель преуспела в SWE-bench Verified, решительно обойдя Qwen3.5-4B, её производительность падает на более широких и разнообразных метриках. В SWE-bench Pro MiniCPM5-2B набирает 14 баллов, что ровно в два раза меньше, чем 28 баллов у Qwen3.5-4B. Terminal-Bench показывает ещё более резкий контраст: MiniCPM5-2B достигает примерно 8,5 баллов по сравнению с 26 баллами у Qwen3.5-4B — разница в три раза.

Важно отметить, что бенчмарки OpenBMB проводятся самим вендором, что представляет собой узкий, отобранный взгляд. Сравнительная таблица включает исключительно модели Qwen и Gemma, демонстративно игнорируя ключевых конкурентов из более широкой экосистемы. Отсутствуют метрики производительности для:

  • Llama
  • Phi
  • SmolLM3
  • MiniCPM4, её собственного предшественника

Такое отсутствие прозрачности, усугубляемое недоступностью скриптов оценки, которые запрашивало сообщество, вызывает вопросы относительно полной конкурентной среды.

MiniCPM5-2B представляет собой захватывающий скачок для экспериментов с локальными агентами, особенно для приложений на устройствах, таких как MacBook Air. Её узкоспециализированное обучение делает её мощным инструментом для конкретных задач программирования и использования инструментов. Однако для более широкой и надежной производительности в разнообразных задачах, включая MMLU-Pro, GPQA Diamond и LongBench V2, где Qwen3.5-4B также побеждает, более крупная модель Qwen3.5-4B бесспорно остается лучшим и более надежным выбором. Меньшая модель показывает нам границы возможного, но титан всё ещё удерживает центр.

Часто задаваемые вопросы

Что такое MiniCPM5-2B?

MiniCPM5-2B — это языковая модель с 2,5 миллиардами параметров с открытым исходным кодом от OpenBMB. Она специально обучена для задач ИИ-агентов и использует стандартную архитектуру Llama для широкой совместимости.

Как MiniCPM5-2B соотносится с более крупной Qwen3.5-4B?

MiniCPM5-2B превосходит Qwen3.5-4B в специфических агентных бенчмарках, таких как SWE-bench Verified (46 против 34). Однако более крупная модель Qwen набирает значительно больше баллов в других бенчмарках, таких как SWE-bench Pro, MMLU-Pro и Terminal-Bench, что делает её более функциональной в целом.

Почему квантованная MiniCPM5-2B зацикливается?

Квантованные версии GGUF могут попадать в бесконечный цикл более чем в 90% случаев из-за плохих настроек сэмплера по умолчанию в таких фреймворках, как Llama.cpp. Установка min_p на 0 или repeat_penalty примерно на 1,15 решает проблему, но это не было четко задокументировано на момент запуска.

Что делает MiniCPM5-2B такой хорошей в агентных задачах?

Её высокая агентная производительность обусловлена специализированным обучением. Оно включало контролируемую донастройку (supervised fine-tuning) на 500 000 агентных траекториях, обучение с подкреплением и объединение 16 отдельных экспертных моделей RL в одну.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.