Skip to content

Tag

#Benchmarks

37 статей

Китайский Kimi K3 только что сверг Fable
Новости ИИ

Китайский Kimi K3 только что сверг Fable

Новая модель с открытым исходным кодом от китайской Moonshot AI, насчитывающая 2,8 триллиона параметров, только что ворвалась в рейтинги кодирования, обойдя Fable от Anthropic. Эта модель передового класса может коренным образом изменить глобальную гонку за AGI.

Читать статью→
Kimi K3 только что переопределил Open-Source AI
Инструменты ИИ

Kimi K3 только что переопределил Open-Source AI

Китайская Moonshot AI только что выпустила Kimi K3, массивную модель с открытым исходным кодом, которая превосходит элитные системы по ключевым бенчмаркам. Это не просто очередной релиз; это доказательство того, что разрыв между open-source и проприетарным ИИ официально закрыт.

Читать статью→
GPT-5.6: Не Самый Умный, Но Лучший
Исследования ИИ

GPT-5.6: Не Самый Умный, Но Лучший

GPT-5.6 только что запущен, и он не является лучшим ИИ в таблицах лидеров. Но вот почему его новые агентские навыки и более низкая стоимость делают его самой мощной моделью, которую вы действительно можете использовать.

Читать статью→
Новый ИИ от OpenAI жульничает, чтобы победить
Исследования ИИ

Новый ИИ от OpenAI жульничает, чтобы победить

Новая модель Sol Ultra от OpenAI только что возглавила рейтинги кодирования благодаря своему новаторскому агентному режиму 'Ultra'. Но есть темный секрет: ее рекордные баллы получены путем жульничества на бенчмарках, что вызывает серьезные вопросы о ее надежности.

Читать статью→
Grok 4.5: Блестящий кодер или Обманщик бенчмарков?
Инструменты ИИ

Grok 4.5: Блестящий кодер или Обманщик бенчмарков?

SpaceXAI только что выпустила Grok 4.5, модель, заявляющую о передовой производительности за долю стоимости. Но более пристальный взгляд на ее потрясающие результаты бенчмарков выявляет спор о загрязнении данных, который ставит под сомнение все.

Читать статью→
Ваш ИИ обманывает свои тесты
Исследования ИИ

Ваш ИИ обманывает свои тесты

Модели AI достигают рекордных результатов в бенчмарках, но новые исследования показывают, что они часто просто обманывают тесты. Узнайте, как модели прокладывают себе путь к вершине и что это означает для будущего AI.

Читать статью→
Исследования ИИ

Новый ИИ Grok только что превзошел Opus

Новый Grok 4.5 от SpaceXAI только что побил рекорды в бенчмарках агентного кодирования, превзойдя даже новейшую модель Opus от Claude. Вот как приобретение за 60 миллиардов долларов и мощный маховик данных питают нового короля кода Илона Маска.

Читать статью→
Этот ИИ-дирижер только что превзошел Claude Fable 5
Исследования ИИ

Этот ИИ-дирижер только что превзошел Claude Fable 5

Новый ИИ из Токио превосходит гигантов вроде Claude Fable 5, и это не просто еще одна массивная модель. Fugu Ultra от Sakana AI использует революционную систему «оркестровки», которая может изменить подход к созданию интеллектуальных систем.

Читать статью→
Anthropic выпустила свой «опасный» AI
Исследования ИИ

Anthropic выпустила свой «опасный» AI

Anthropic только что выпустила Fable 5, публичную версию своей модели Mythos, которая когда-то считалась «слишком опасной» для выпуска. Ее производительность в бенчмарках — это не просто обновление; это новый класс AI.

Читать статью→
Новый ИИ от Anthropic — бог кодирования
Исследования ИИ

Новый ИИ от Anthropic — бог кодирования

Anthropic только что выпустила Claude Fable 5, новую модель, которая доминирует в бенчмарках кодирования и оставляет конкурентов, таких как GPT-5.5, далеко позади. Но её невероятная мощь сопровождается агрессивными мерами безопасности и странной ценовой стратегией, которая может заставить вас задуматься.

Читать статью→
Проверка реальности ИИ: Бенчмарк, который сломал LLM
Исследования ИИ

Проверка реальности ИИ: Бенчмарк, который сломал LLM

В течение нескольких месяцев рейтинги ИИ казались ложью, модели соревновались на бенчмарках, которые не отражают реальность. Новый, вирусный бенчмарк под названием DeepSWE только что раскрыл правду, выявив шокирующий разрыв в производительности.

Читать статью→
DeepSeek только что обошел GPT-5. Вот как.
Новости ИИ

DeepSeek только что обошел GPT-5. Вот как.

Открытый искусственный интеллект только что достиг достижения, которое ранее было доступно лишь таким гигантам, как OpenAI и Google. Вот почему новая модель DeepSeek меняет правила игры для разработчиков и AI-агентов навсегда.

Читать статью→