Бенчмарковая бойня
Новая модель Opus 5 от Anthropic кардинально изменила ландшафт ИИ, неожиданно превзойдя флагманскую модель Fable 5 почти по всем ключевым бенчмаркам. Этот преемник предыдущего предложения среднего уровня теперь задает новый стандарт, бросая вызов устоявшейся иерархии в семействе моделей Claude.
Прирост производительности поразителен. Opus 5 совершила скачок на 10 пунктов в Frontier Bench для агентского терминального кодинга, набрав 43 балла по сравнению с 33 баллами у Fable 5. В GDP Val от OpenAI, бенчмарке для практических задач реального мира, Opus 5 показала потрясающее улучшение на 100 пунктов. Она также продемонстрировала колоссальный скачок в Arc AGI 3, достигнув 30% с предыдущего максимума около 8%.
Дополнительно подтверждая свое мастерство, Opus 5 показала улучшение на 4 пункта в OS World для компьютерного использования и рост на 9 пунктов в Automation Bench. Она также обошла Fable 5 в Browse Comp (90% против 87%), демонстрируя широкие возможности.
Тем не менее, Opus 5 демонстрирует специализированный профиль возможностей. Она показала небольшое снижение в бенчмарке Deep Swee и уменьшение в юридическом бенчмарке (с 13.3 до 11.7). Health Bench Professional также показал спад, что говорит о том, что, хотя Opus 5 преуспевает во многих областях, её сильные стороны распределены по доменам неравномерно.
Новый итог: стоимость выполнения задачи
Цена за токен, долгое время бывшая упрощенным показателем полезности ИИ, дает обманчивое представление о реальных операционных расходах. Настоящим определяющим фактором ценности является стоимость выполнения задачи (cost-per-task) — комплексная мера, учитывающая как цену токена, так и эффективность модели. Модель, которая вдвое дешевле за токен, может потреблять их в два раза больше, что делает фактическую стоимость равной, как это видно на примере производительности Kimmy K3 по сравнению с конкурентами.
Анализ графиков производительности по сравнению со стоимостью, таких как для OS World и Automation Bench, наглядно иллюстрирует доминирование Opus 5. В OS World, где ось Y отслеживает общий балл, а ось X измеряет стоимость выполнения задачи, Opus 5 неизменно располагается выше и левее. Это указывает как на превосходную производительность, так и на более низкую стоимость по сравнению с Fable 5 и Opus 4.8.
Даже по сравнению с GPT 5.6 Sol, Opus 5 демонстрирует замечательную экономическую эффективность; достижение производительности Opus 5 может стоить пользователям GPT 5.6 Sol более чем в два раза дороже. Это трансформируется в ощутимые преимущества: пользователи получают более способную модель, которая выполняет задачи надежнее за те же или меньшие деньги. Opus 5 представляет собой значительный скачок в экономической жизнеспособности ИИ, выходя за рамки простых оценок бенчмарков для обеспечения доказанной ценности.
Квантовый скачок в рассуждениях
Самое поразительное достижение Opus 5 заключается в её способности к логическим рассуждениям, о чем свидетельствует беспрецедентный результат в 30% в бенчмарке Arc AGI 3. Это монументальный скачок по сравнению с предыдущим лучшим результатом, составлявшим около 8%. Тест Arc AGI 3 измеряет чистое решение задач в режиме zero-shot: модели получают только среду задачи, без инструкций или контекста, что заставляет их самостоятельно выводить правила и достигать целей, подобно человеку, столкнувшемуся с совершенно новой головоломкой.
Этот фундаментальный скачок в рассуждениях напрямую трансформируется в расширенные возможности для сложных корпоративных приложений. Внутренние исследования Sponsor Box подтверждают значительные успехи Opus 5 в требовательной, многоэтапной интеллектуальной работе, превосходящие показатели предыдущих моделей. Модель демонстрирует превосходную производительность в критически важных аналитических задачах, таких как:
- Комплексная проверка (Due diligence)
- Анализ данных
- Составление отчетов на основе данных
Эти исчерпывающие анализы имеют решающее значение для принятия обоснованных, реальных бизнес-решений в различных отраслях.
Модель, способная решать новые задачи, является фундаментальным шагом на пути к созданию более автономных AI-агентов. Улучшенные показатели Opus 5 в таких тестах, как OS World, оценивающих способность ИИ управлять компьютером и взаимодействовать с его интерфейсом — находить элементы, нажимать кнопки и выполнять задачи — свидетельствуют о его готовности к сложным агентным рабочим процессам (agentic workflows). Эта возможность позволяет ИИ эффективно управлять инструментами и компьютерами, переходя от простого выполнения задач к реальному решению проблем в динамических средах. Более подробную информацию о его возможностях см. в разделе Introducing Claude Opus 5 - Anthropic.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Умнее за счет вычитания
Самое контринтуитивное проектное решение Opus 5 заключалось в хирургическом ограничении (surgical nerf): его общая интеллектуальность возросла несмотря на намеренное снижение возможностей по разработке киберугроз. Хотя Opus 5 по-прежнему «значительно отстает от Mythos 5 в разработке эксплойтов», он парадоксальным образом превосходит своего предшественника, Opus 4.8, в общих задачах по кибербезопасности. Это говорит о стратегической оптимизации, при которой ограничение потенциально вредных или второстепенных возможностей позволило глубже и точнее сосредоточиться на основных процессах рассуждения.
Это избирательное вычитание бросает вызов устоявшемуся убеждению, что добавление защитных барьеров неизбежно снижает общую производительность модели. Вместо этого оно намекает на более сложный подход к согласованию ИИ (AI alignment), при котором целенаправленные ограничения могут, подобно устранению отвлекающих факторов, фактически способствовать чистому приросту полезного интеллекта за счет перераспределения ресурсов на более продуктивные когнитивные пути.
Anthropic дополнительно усилила эту философию «безопасность прежде всего» новыми функциями для разработчиков, предназначенными для надежного использования в продакшене. К ним относятся автоматические API-резервы для запросов, помеченных как небезопасные, что обеспечивает бесперебойную работу даже при обнаружении конфиденциального контента. Кроме того, возможность изменять инструменты прямо во время диалога повышает адаптивность и надежность модели, предоставляя разработчикам больший контроль и стабильность в своих приложениях.
Часто задаваемые вопросы
Что такое Claude Opus 5?
Claude Opus 5 — это новейшая модель высшего уровня от Anthropic. Удивительно, но она превосходит их предыдущую флагманскую модель Fable 5 по большинству тестов, сохраняя при этом ту же цену, что и у предшественника, Opus 4.8.
Чем Opus 5 лучше, чем Fable 5?
Opus 5 демонстрирует значительные успехи по сравнению с Fable 5 в таких областях, как агентное программирование (Frontier Bench), выполнение реальных задач (GDP Val) и решение новых проблем (Arc AGI 3). Он также достигает этого при более низкой стоимости выполнения одной задачи, что делает его более эффективным.
Что означает «стоимость задачи» для моделей ИИ?
Стоимость задачи — это реальная цена выполнения работы с учетом как цены токена, так и количества необходимых токенов. Модель может иметь дешевые токены, но быть дорогой в использовании, если она неэффективна. Opus 5 превосходит конкурентов за счет высокой эффективности, тем самым снижая общую стоимость каждой успешно выполненной задачи.
Хорош ли Opus 5 во всем?
Нет. Несмотря на то, что в целом модель более функциональна, Opus 5 демонстрирует небольшое снижение производительности в некоторых специализированных тестах, включая юридические (Legal Bench) и профессиональные медицинские (Health Bench Professional). Она также была намеренно спроектирована так, чтобы быть менее эффективной в разработке эксплойтов для кибербезопасности.

