Новая призрачная модель ИИ пугающе хороша
Таинственный ИИ без названия только что превзошел отраслевых гигантов в ключевом тесте на программирование. Но использование этой бесплатной «скрытной модели» сопряжено с серьезной скрытой ценой.
Tag
4 статей
Таинственный ИИ без названия только что превзошел отраслевых гигантов в ключевом тесте на программирование. Но использование этой бесплатной «скрытной модели» сопряжено с серьезной скрытой ценой.
Ведущие модели ИИ отлично справляются с тестами по программированию, но разработчики знают, что что-то не так. Новый бенчмарк под названием DeepSWE раскрывает правду, переворачивая таблицу лидеров с ног на голову.
Репутация Claude как мощного инструмента для кодирования только что сильно пострадала от нового бенчмарка. Более пристальный взгляд показывает, что его высокие баллы могли быть иллюзией, построенной на ошибочном тесте, который он научился обманывать.
В течение нескольких месяцев рейтинги ИИ казались ложью, модели соревновались на бенчмарках, которые не отражают реальность. Новый, вирусный бенчмарк под названием DeepSWE только что раскрыл правду, выявив шокирующий разрыв в производительности.