Skip to content
comparisons

Claude проиграл. Вот почему.

Мы столкнули лидера рейтингов Claude Opus с более дешевой моделью с открытыми весами Qwen 3.8 в реальном соревновании по программированию. Победила не та модель, которую предсказывали бенчмарки.

Vera Cole
Claude проиграл. Вот почему.

Бенчмарки лгут. Тест это доказывает.

Бенчмарки часто искажают реальную полезность. На бумаге Claude Opus 5 выглядит лучше, набирая 63 балла в Artificial Analysis. Его конкурент, Qwen 3.8, отстает с результатом 58. Этот отрыв в пять баллов предполагает, что Claude должен быть явным победителем по уровню интеллекта и возможностей.

Чтобы проверить это предположение, мы разработали строгий тест: поручить обеим моделям создать полноценную играбельную 3D-игру в жанре endless runner. Параметры были жесткими: один HTML-файл, вдохновленный Temple Run, с использованием three.js, по одному идентичному промпту без каких-либо уточняющих инструкций или исправлений.

Результаты оказались поразительными. Несмотря на более низкий балл в бенчмарке, «более слабая» Qwen 3.8 создала заметно более плавную и играбельную игру. Она превзошла конкурента в критически важных областях, таких как движение, обнаружение столкновений и процедурная генерация пути, предоставив в целом более структурированную кодовую базу.

Claude Opus 5, хотя и генерировал код быстро, выдал игру, которая ощущалась менее отполированной и была сложнее в управлении. Это реальное применение выявляет критический разрыв: результаты бенчмарков, хотя и указывают на общий уровень интеллекта, часто не могут предсказать практическую полезность и пользовательский опыт в сложных творческих задачах.

Почему спешка в программировании ведет к провалу

Claude Opus 5 немедленно начал генерировать огромные объемы JavaScript для 3D-раннера. Этот быстрый вывод создал иллюзию стремительного прогресса: сцена three.js и модели игроков быстро обретали форму. Наблюдая за потоком кода, казалось, что Claude выигрывает в начале гонки.

Qwen 3.8 выбрала совершенно иную, методичную стратегию. Она начала с тщательного описания основных систем игры: игрового цикла, состояния игрока, обнаружения столкновений и процедурной генерации. Ни одной строки функционального кода не было написано до завершения этого комплексного этапа архитектурного планирования.

Печально известная verbosity (многословность) Qwen и склонность «перемудрить» стали решающим преимуществом для этой сложной задачи. Такой взвешенный подход, ориентированный на планирование, обеспечил надежный и играбельный конечный продукт, эффективно обрабатывающий движение, столкновения и состояние игры. Скорость Claude, напротив, привела к созданию хрупкой и менее играбельной игры.

Результат подчеркнул критическую разницу: в то время как Claude быстро выдал большой объем JavaScript, начальное architectural foresight (архитектурное предвидение) Qwen позволило создать игру, которая ощущалась значительно плавнее и была гораздо удобнее для дальнейшей доработки. Этот практический результат прямо опроверг лидерство Claude в бенчмарках.

Стоимость, контроль и контекст

Хостинг инференса Qwen переопределяет экономическую целесообразность для крупномасштабного внедрения ИИ. Его ценообразование — $2 за миллион входных токенов и $6 за миллион выходных токенов — значительно ниже, чем у конкурентов вроде Claude, что делает его единственным реалистичным выбором для высоконагруженных agentic workflows (агентных рабочих процессов). Агент может считывать огромные кодовые базы, многократно обращаться к модели, генерировать задачи и проверять ошибки — действия, при которых высокая стоимость Claude за токен быстро становится непомерной.

Помимо экономики, Qwen предлагает непревзойденный контроль благодаря своим open weights (открытым весам). Предприятия получают стратегическое преимущество, развертывая модели на собственной инфраструктуре, что обеспечивает конфиденциальность данных и максимальную кастомизацию. Хотя полная модель Qwen 3.8 2.4T-A95B остается недоступной для большинства локальных развертываний, требуя многоузлового оборудования дата-центра, практичный вариант Qwen 3.8 27B может работать локально на потребительских GPU с 24 ГБ видеопамяти. Это открывает возможности для внутренних экспериментов и дообучения (fine-tuning), чего Claude не предоставляет.

Эта свобода, однако, сопряжена с определенными компромиссами. Qwen работает медленнее, генерируя около 47-48 токенов в секунду согласно Artificial Analysis, что может влиять на взаимодействие в реальном времени. Кроме того, модель печально известна своей многословностью и склонностью выдавать «небольшую историю жизни» даже тогда, когда требуется краткое исправление. Хотя эта многословность может быть полезна для сложных автономных агентов, требующих глубокого понимания контекста, она требует больше инфраструктуры и большей терпимости к более медленной и размеренной модели. Это не бесплатная свобода; это стратегическая инвестиция в контроль, а не в чистую скорость и мгновенную отточенность.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Ваша новая матрица принятия решений по ИИ

Выбор правильной модели ИИ теперь требует точного понимания ее операционного профиля, а не просто результатов тестов. Эра универсальной «лучшей» модели прошла; вместо этого разработчики должны соотносить сильные стороны модели с конкретными требованиями проекта.

Для оперативных задач по программированию, быстрых исправлений или случаев, когда критически важен быстрый всплеск «сырого» интеллекта, Claude Opus 5 остается лучшим выбором. Его скорость и отточенный вывод, обусловленные оценкой 63 в Artificial Analysis, ускоряют разработку для повседневных интерактивных задач, где критически важна скорость ответа на промпт.

Однако для сложных агентных рабочих процессов, проектирования комплексных систем или любого проекта, чувствительного к бюджету, Qwen 3.8 является окончательным выбором. Его стоимость при хостинге — $2 за вход / $6 за выход на миллион токенов — делает крупномасштабные операции экономически выгодными, в отличие от запретительно высоких цен Claude. Кроме того, доступ к открытым весам Qwen обеспечивает непревзойденный контроль и гибкость для индивидуального развертывания.

Важнейший навык для разработчиков сегодня — освоение этих тонких компромиссов. Успех зависит от выбора специализированного инструмента для конкретной задачи и понимания хрупкого баланса между скоростью, стоимостью и кастомным развертыванием. Игнорируйте этот адаптивный подход, и вы обнаружите, что ваши проекты быстро отстают от тех, где для каждого вызова используется подходящая модель.

Часто задаваемые вопросы

Почему Qwen 3.8 показал себя лучше, чем Claude Opus 5 в тесте по разработке игр?

Qwen применил более взвешенный, ориентированный на планирование подход к сложной задаче, что привело к созданию более целостной и играбельной игры. Более быстрый подход Claude, ориентированный на код, дал менее функциональный результат, несмотря на более высокий балл в тестах.

В чем главное преимущество модели с открытыми весами, такой как Qwen 3.8?

Главные преимущества — это контроль и стоимость. Открытые веса позволяют разработчикам самостоятельно размещать и настраивать модель, а стоимость инференса при хостинге значительно ниже, чем у проприетарных конкурентов, что делает ее идеальной для высоконагруженных или агентных задач.

Qwen 3.8 быстрее или медленнее, чем Claude Opus 5?

Qwen 3.8 в целом медленнее: показатели составляют около 47-48 токенов в секунду по сравнению с ~62 токенами в секунду у Claude Opus 5. Его многословность также может создавать ощущение медлительности при простых запросах.

Могу ли я запустить модель Qwen с 2,4 триллионами параметров на своем компьютере?

Нет, для запуска полной модели 2.4T требуется многоузловое оборудование уровня дата-центра. Однако меньшие версии, такие как модель Qwen 3.8 27B, предназначены для локального развертывания на потребительских GPU с объемом видеопамяти около 24 ГБ.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only