AI 연구
AI의 새로운 팬텀 모델, 놀라울 정도로 뛰어나다
이름 없는 미스터리한 AI가 주요 코딩 벤치마크에서 업계 거물들을 능가했습니다. 하지만 이 무료 '스텔스 모델'을 사용하는 데는 심각하고 숨겨진 대가가 따릅니다.
기사 읽기→
Tag
4 개 게시물
이름 없는 미스터리한 AI가 주요 코딩 벤치마크에서 업계 거물들을 능가했습니다. 하지만 이 무료 '스텔스 모델'을 사용하는 데는 심각하고 숨겨진 대가가 따릅니다.
최고의 AI 모델들이 코딩 테스트에서 만점을 받고 있지만, 개발자들은 무언가 잘못되었다는 것을 알고 있습니다. DeepSWE라는 새로운 벤치마크가 진실을 밝혀내며 순위표를 뒤집어 놓았습니다.
코딩 강자로서의 Claude의 명성이 새로운 벤치마크로 인해 큰 타격을 입었습니다. 자세히 살펴보면, Claude의 최고 점수는 결함 있는 테스트를 속여서 얻은 환상이었을 수 있습니다.
몇 달 동안 AI 리더보드는 현실을 반영하지 않는 벤치마크에서 모델들이 경쟁하며 거짓말처럼 느껴졌습니다. DeepSWE라는 새로운, 입소문 난 벤치마크가 방금 진실을 드러냈고, 충격적인 성능 격차를 밝혀냈습니다.