Skip to content
research

Эта модель ИИ думает меньше, а побеждает чаще

Мы гнались за моделями, которые «рассуждают» глубже, полагая, что это единственный путь к более умному ИИ. Но новая модель с открытым исходным кодом доказывает, что это ловушка, достигая топовых результатов за счет намеренного отказа от этой расточительной привычки.

Aki Tanaka
Эта модель ИИ думает меньше, а побеждает чаще

Ловушка рассуждений ИИ: как «умнее» стало означать медленнее

Первоначальные модели ИИ, такие как GPT-3 (2020) и GPT-4 (2023), работали по парадигме немедленного ответа, предсказывая следующий токен для мгновенной выдачи результата. Этот фундаментальный подход радикально изменился в сентябре 2024 года с выходом OpenAI's O1. Эта модель представила новый «режим мышления», обдумывая ответ внутренне перед его генерацией, что фактически положило начало эре моделей рассуждения.

Это архитектурное изменение, быстро принятое такими моделями, как DeepSeek-R1, было направлено на повышение надежности ИИ. Но стремление к «интеллекту» привело к непредвиденным последствиям: модели теперь часто чрезмерно анализируют даже самые тривиальные запросы. Они тратят токены и время, расходуя вычислительные мощности на ненужные размышления, что увеличивает операционные расходы и задержки.

Рассмотрим крайний пример: на просьбу ответить на одно слово «hello», одна из моделей рассуждения, Step 3.5 Flash, вела дебаты на протяжении нескольких абзацев. Она потратила тысячи токенов на внутренние размышления, взвешивая протоколы идентификации или актуальность даты, прежде чем наконец выдать простое: «Hello! I'm Step 3.5 Flash. How can I assist you today?». Это подчеркивает основной недостаток современного ИИ: модели научились думать, но не научились понимать, когда мышление уже излишне.

Решение: вознаграждение за краткость, а не только за блестящий результат

Bottlecap AI предлагает точный ответ на неэффективность рассуждений с помощью ThinkingCap, специально дообученной версии модели Qwen 3.6 27B. Этот инновационный подход напрямую борется с вычислительным раздуванием, вызванным моделями, которые по умолчанию прибегают к длительному обдумыванию независимо от сложности задачи. ThinkingCap стремится достичь сопоставимого качества вывода при значительном сокращении расхода токенов.

Дообучение этой модели представляет собой значительный архитектурный сдвиг. В отличие от традиционных методов, которые вознаграждают только за правильный ответ, Bottlecap AI в процессе обучения явно стимулировала как правильность, так и эффективность. Модель получала положительное подкрепление за точные результаты, но, что критически важно, также и за достижение этих результатов с оптимальной вычислительной краткостью. Это создает мощный стимул для разумного мышления.

Эта новая структура вознаграждения заставляет ThinkingCap усвоить критически важный навык: понимание того, когда мышления уже достаточно. Это эффективно обучает модель различать по-настоящему продуктивные этапы рассуждения и расточительный вычислительный шум. Учась тому, когда пора переходить к ответу, ThinkingCap избегает траты тысяч токенов на повторный вывод уже известной информации или вхождение в непродуктивные циклы. Эта эффективность приводит к сокращению количества «мыслительных» токенов в среднем на 45,8% по результатам независимых тестов, при этом точность остается в пределах одного процентного пункта.

Цифры говорят сами за себя: сокращение токенов без потери точности

ThinkingCap демонстрирует конкретные результаты, показывая свою эффективность без ущерба для качества вывода. По результатам 12 независимых тестов модель сократила количество «мыслительных» токенов в среднем на 45,8%. Что особенно важно, точность практически не изменилась, изменившись в среднем менее чем на один процентный пункт. Для более глубокого изучения этих показателей ознакомьтесь с официальным отчетом по ссылке ThinkingCap: Qwen3.6-27B Fine-tune for Efficient Reasoning.

Драматическая демонстрация лицом к лицу наглядно проиллюстрировала эту эффективность. На просьбу найти наименьшее положительное целое число N, такое что N! имеет ровно 100 конечных нулей, базовая модель Qwen 3.6 27B потратила 140 секунд и более 7000 токенов на рассуждения. ThinkingCap, напротив, выдала тот же правильный ответ менее чем за 30 секунд, используя всего 1100 токенов. Это сокращение количества токенов для решения на 84% — не просто ускорение; это фундаментальный сдвиг в обработке данных.

Помимо чистого количества токенов, ThinkingCap также значительно снизила «частоту зацикливания» модели. Стандартные модели рассуждений часто тратят токены на повторный вывод уже понятых моментов или перефразирование одной и той же информации другими словами. Это снижение подтверждает, что большая часть рассуждений, выполняемых этими моделями, является непродуктивным шумом, а не подлинным усилием, который ThinkingCap эффективно отсекает.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Случайная гениальность «человеческой усталости»

Неожиданное наблюдение во время разработки ThinkingCap оказалось решающим. Во время дообучения для сокращения многословных рассуждений команда Bottlecap AI заметила, что модели, выдающие более лаконичные и прямые ответы — возможно, как непреднамеренный побочный эффект обучения эффективности — пользовались явным предпочтением. Пользователи воспринимали эту краткость как более «человечную» и полезную, предпочтение, сродни человеческой усталости от излишних объяснений. Эта «случайная гениальность» побудила команду принять краткость как функциональную особенность.

Это понимание подкрепляет важный урок: чистые вычислительные усилия не обязательно означают превосходный интеллект. ThinkingCap демонстрирует, что эффективное рассуждение — это навык, поддающийся тренировке. Она достигает тех же высококачественных результатов — с незначительным изменением точности менее чем на один процентный пункт — за счет сокращения «мыслительных» токенов в среднем на 45,8% на ранее не встречавшихся задачах.

Последствия для разработки ИИ глубоки. Эффективность, когда-то бывшая второстепенной задачей, теперь должна стать основной целью наряду с точностью. Модели, которые понимают, когда нужно прекратить рассуждения, выдавая точные ответы без лишних внутренних монологов, представляют собой следующий рубеж. Разработчики могут изучить этот сдвиг парадигмы напрямую: ThinkingCap, специально дообученная версия Qwen 3.6 27B, доступна как модель с открытым исходным кодом.

Часто задаваемые вопросы

Что такое модель ИИ ThinkingCap?

ThinkingCap — это дообученная версия модели Qwen 3.6 27B с открытым исходным кодом, созданная Bottlecap AI. Она специально оптимизирована для получения высококачественных ответов с использованием значительно меньшего количества токенов и меньшего времени вычислений за счет устранения бесполезных рассуждений.

Как ThinkingCap повышает эффективность ИИ?

Вместо того чтобы вознаграждать только за правильность во время обучения, ThinkingCap также вознаграждалась за эффективность. Это научило модель распознавать, когда она провела достаточно рассуждений для предоставления правильного ответа, сокращая избыточное мышление и использование токенов.

Является ли ThinkingCap менее точной, чем базовая модель, на которой она построена?

Нет. В широком спектре тестов точность ThinkingCap изменилась менее чем на 1% по сравнению с оригинальной моделью Qwen 3.6. В некоторых тестах, таких как GSM8K, ее точность фактически увеличилась при использовании гораздо меньшего количества токенов.

В чем проблема текущих «моделей рассуждений» ИИ?

Будучи мощными, многие модели рассуждений неэффективны. Они часто «передумывают» простые задачи, тратя тысячи токенов и значительное время на ненужные размышления или даже застревая в циклах рассуждений, что увеличивает стоимость и задержку.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only