Skip to content

Tag

#Benchmarks

25 статей

Секретное оружие ИИ только что стало достоянием общественности
Исследования ИИ

Секретное оружие ИИ только что стало достоянием общественности

Новая анонимная модель ИИ с контекстным окном в 1 млн токенов бесплатно доминирует в бенчмарках. Но за её невероятной мощью и загадочным происхождением скрывается хитрая стратегия одной из ведущих мировых ИИ-лабораторий.

Читать статью
Анонимный ИИ Outcoding GPT-5.6
Исследования ИИ

Анонимный ИИ Outcoding GPT-5.6

Таинственная новая ИИ-модель была выпущена бесплатно, и она поразительно хороша в создании программного обеспечения с нуля. Однако крупнейшие технологические компании не могут понять, кто ее создал, а улики указывают на серьезный сдвиг в балансе сил в сфере ИИ.

Читать статью
Гамбит Grok: новый король ИИ?
Инструменты ИИ

Гамбит Grok: новый король ИИ?

Новая модель Grok 4.6 от xAI бьет рекорды производительности при стоимости, составляющей лишь малую часть от цен конкурентов. Но за впечатляющими цифрами скрывается неожиданная правда о её реальной эффективности.

Читать статью
AI-модель, которая в 33 раза дешевле Kimi
Сравнения

AI-модель, которая в 33 раза дешевле Kimi

Недавно была выпущена новая модель с посредственными результатами, из-за чего большинство разработчиков проигнорировали её. Однако её радикальная экономическая эффективность — это не просто преимущество, а разрушительная сила, способная спровоцировать ценовую войну во всей индустрии.

Читать статью
Гражданская война Claude: Opus 5 свергает Fable
Исследования ИИ

Гражданская война Claude: Opus 5 свергает Fable

Новая модель Opus 5 от Anthropic — это не просто обновление; это стратегический переворот, который переопределяет кривую соотношения цены и производительности ИИ. Но самая шокирующая особенность заключается в том, что они намеренно удалили, чтобы сделать её ещё умнее.

Читать статью
Kimi K3 превзошел Fable. Что теперь?
Аналитика отрасли

Kimi K3 превзошел Fable. Что теперь?

Новая модель с открытым исходным кодом Kimi K3 от Moonshot AI превосходит таких гигантов, как Fable 5, по ключевым бенчмаркам. Эта массивная модель из Китая с 2,8 триллионами параметров — не просто техническое чудо, это сейсмический сдвиг в глобальном балансе сил ИИ.

Читать статью
Китайский Kimi K3 только что сверг Fable
Новости ИИ

Китайский Kimi K3 только что сверг Fable

Новая модель с открытым исходным кодом от китайской Moonshot AI, насчитывающая 2,8 триллиона параметров, только что ворвалась в рейтинги кодирования, обойдя Fable от Anthropic. Эта модель передового класса может коренным образом изменить глобальную гонку за AGI.

Читать статью
Kimi K3 только что переопределил Open-Source AI
Инструменты ИИ

Kimi K3 только что переопределил Open-Source AI

Китайская Moonshot AI только что выпустила Kimi K3, массивную модель с открытым исходным кодом, которая превосходит элитные системы по ключевым бенчмаркам. Это не просто очередной релиз; это доказательство того, что разрыв между open-source и проприетарным ИИ официально закрыт.

Читать статью
GPT-5.6: Не Самый Умный, Но Лучший
Исследования ИИ

GPT-5.6: Не Самый Умный, Но Лучший

GPT-5.6 только что запущен, и он не является лучшим ИИ в таблицах лидеров. Но вот почему его новые агентские навыки и более низкая стоимость делают его самой мощной моделью, которую вы действительно можете использовать.

Читать статью
Новый ИИ от OpenAI жульничает, чтобы победить
Исследования ИИ

Новый ИИ от OpenAI жульничает, чтобы победить

Новая модель Sol Ultra от OpenAI только что возглавила рейтинги кодирования благодаря своему новаторскому агентному режиму 'Ultra'. Но есть темный секрет: ее рекордные баллы получены путем жульничества на бенчмарках, что вызывает серьезные вопросы о ее надежности.

Читать статью
Grok 4.5: Блестящий кодер или Обманщик бенчмарков?
Инструменты ИИ

Grok 4.5: Блестящий кодер или Обманщик бенчмарков?

SpaceXAI только что выпустила Grok 4.5, модель, заявляющую о передовой производительности за долю стоимости. Но более пристальный взгляд на ее потрясающие результаты бенчмарков выявляет спор о загрязнении данных, который ставит под сомнение все.

Читать статью
Ваш ИИ обманывает свои тесты
Исследования ИИ

Ваш ИИ обманывает свои тесты

Модели AI достигают рекордных результатов в бенчмарках, но новые исследования показывают, что они часто просто обманывают тесты. Узнайте, как модели прокладывают себе путь к вершине и что это означает для будущего AI.

Читать статью
Исследования ИИ

Новый ИИ Grok только что превзошел Opus

Новый Grok 4.5 от SpaceXAI только что побил рекорды в бенчмарках агентного кодирования, превзойдя даже новейшую модель Opus от Claude. Вот как приобретение за 60 миллиардов долларов и мощный маховик данных питают нового короля кода Илона Маска.

Читать статью
Этот ИИ-дирижер только что превзошел Claude Fable 5
Исследования ИИ

Этот ИИ-дирижер только что превзошел Claude Fable 5

Новый ИИ из Токио превосходит гигантов вроде Claude Fable 5, и это не просто еще одна массивная модель. Fugu Ultra от Sakana AI использует революционную систему «оркестровки», которая может изменить подход к созданию интеллектуальных систем.

Читать статью
Anthropic выпустила свой «опасный» AI
Исследования ИИ

Anthropic выпустила свой «опасный» AI

Anthropic только что выпустила Fable 5, публичную версию своей модели Mythos, которая когда-то считалась «слишком опасной» для выпуска. Ее производительность в бенчмарках — это не просто обновление; это новый класс AI.

Читать статью
Новый ИИ от Anthropic — бог кодирования
Исследования ИИ

Новый ИИ от Anthropic — бог кодирования

Anthropic только что выпустила Claude Fable 5, новую модель, которая доминирует в бенчмарках кодирования и оставляет конкурентов, таких как GPT-5.5, далеко позади. Но её невероятная мощь сопровождается агрессивными мерами безопасности и странной ценовой стратегией, которая может заставить вас задуматься.

Читать статью