벤치마크의 혈투
Anthropic의 새로운 Opus 5는 AI 생태계를 극적으로 재편하며, 거의 모든 주요 벤치마크에서 자사의 플래그십 모델인 Fable 5를 예상치 못하게 앞질렀습니다. 이전의 중급 모델을 계승한 이 모델은 이제 새로운 표준을 정립하며 Claude 모델 제품군 내의 기존 서열에 도전하고 있습니다.
성능 향상은 뚜렷합니다. Opus 5는 에이전트 터미널 코딩을 위한 Frontier Bench에서 Fable 5의 33점 대비 43점을 기록하며 10점 상승했습니다. 실무 작업 벤치마크인 OpenAI의 GDP Val에서는 100점이라는 놀라운 향상을 보여주었습니다. 또한 Arc AGI 3에서도 기존 최고치인 약 8%에서 30%로 엄청난 도약을 기록했습니다.
그 역량을 더욱 강화하듯, Opus 5는 컴퓨터 사용을 위한 OS World에서 4점, Automation Bench에서 9점의 향상을 보였습니다. 또한 Browse Comp에서도 Fable 5를 근소하게 앞서며(90% 대 87%) 폭넓은 능력을 입증했습니다.
하지만 Opus 5는 특화된 능력 프로필을 보입니다. Deep Swee 벤치마크에서는 소폭 하락했고, 법률 벤치마크에서는 13.3에서 11.7로 감소했습니다. Health Bench Professional에서도 하락세를 보였는데, 이는 Opus 5가 많은 영역에서 뛰어나지만 그 강점이 모든 도메인에 균일하게 분포되어 있지는 않음을 시사합니다.
새로운 결론: 작업당 비용(Cost-Per-Task)
오랫동안 AI 유용성의 단순한 지표로 여겨졌던 토큰당 가격은 실제 운영 비용을 오해하게 만들 수 있습니다. 진정한 가치의 결정 요인은 토큰 가격과 모델 효율성을 모두 고려한 종합적인 측정치인 작업당 비용(cost-per-task)입니다. Kimmy K3가 경쟁사들과 비교했을 때 보여준 것처럼, 토큰당 가격이 절반인 모델이 두 배의 토큰을 소비한다면 실제 비용은 동일해질 수 있습니다.
OS World 및 Automation Bench와 같은 성능 대 비용 차트를 분석해보면 Opus 5의 우위가 명확히 드러납니다. Y축은 총점, X축은 작업당 비용을 나타내는 OS World 차트에서 Opus 5는 일관되게 더 높고 왼쪽으로 치우친 위치에 표시됩니다. 이는 Fable 5 및 Opus 4.8 대비 우수한 성능과 낮은 비용을 모두 나타냅니다.
GPT 5.6 Sol과 비교해도 Opus 5는 놀라운 경제적 효율성을 보여줍니다. GPT 5.6 Sol 사용자가 Opus 5와 동일한 성능을 내려면 두 배 이상의 비용이 들 수 있습니다. 이는 사용자에게 실질적인 혜택으로 이어집니다. 사용자는 동일하거나 더 적은 비용으로 작업을 더 안정적으로 완수하는 더 유능한 모델을 얻게 됩니다. Opus 5는 단순한 벤치마크 점수를 넘어 입증 가능한 가치를 제공함으로써 AI 경제적 생존 가능성의 중요한 도약을 상징합니다.
추론 능력의 비약적 발전
Opus 5의 가장 놀라운 발전은 원시 추론 능력에 있습니다. 이는 Arc AGI 3 벤치마크에서 기록한 전례 없는 30% 점수로 증명됩니다. 이는 기존 최고치였던 약 8%에서 기념비적인 도약을 의미합니다. Arc AGI 3 테스트는 순수한 제로샷 문제 해결 능력을 측정합니다. 모델은 지침이나 맥락 없이 작업 환경만을 제공받으며, 마치 완전히 새로운 퍼즐을 마주한 인간처럼 스스로 규칙을 추론하고 목표를 달성해야 합니다.
이러한 추론의 근본적인 도약은 복잡한 엔터프라이즈 애플리케이션의 향상된 기능으로 직접 이어집니다. Sponsor Box의 내부 조사 결과에 따르면, Opus 5는 까다로운 다단계 지식 작업에서 이전 모델들을 능가하며 상당한 성능 향상을 보였습니다. 이 모델은 다음과 같은 중요한 분석 작업에서 탁월한 성능을 입증합니다:
- 실사(Due diligence)
- 데이터 분석
- 데이터 기반 보고서 작성
이러한 철저한 분석은 다양한 산업 전반에 걸쳐 탄탄하고 실질적인 비즈니스 의사결정을 내리는 데 필수적입니다.
새로운 문제를 해결할 수 있는 모델은 더욱 자율적인 AI 에이전트로 나아가는 기초적인 단계입니다. AI가 컴퓨터를 제어하고 인터페이스와 상호작용(요소 식별, 버튼 클릭, 작업 실행 등)하는 능력을 평가하는 OS World와 같은 벤치마크에서 Opus 5가 기록한 향상된 점수는 정교한 에이전트 워크플로우(agentic workflows)를 수행할 준비가 되었음을 의미합니다. 이러한 기능은 AI가 단순한 작업 실행을 넘어 역동적인 환경에서 진정한 문제 해결을 수행하며 도구와 컴퓨터를 효과적으로 운영할 수 있게 합니다. 기능에 대한 자세한 내용은 Introducing Claude Opus 5 - Anthropic에서 확인하십시오.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
빼기를 통한 지능의 향상
Opus 5의 가장 역설적인 설계 결정은 의도적인 성능 제한(surgical nerf)이었습니다. 사이버 보안 익스플로잇 기능은 의도적으로 축소되었음에도 불구하고 전반적인 지능은 오히려 향상되었습니다. Opus 5는 여전히 "익스플로잇 개발 능력 면에서 Mythos 5보다 상당히 뒤처져" 있지만, 일반적인 사이버 보안 작업에서는 이전 모델인 Opus 4.8을 역설적으로 능가합니다. 이는 잠재적으로 유해하거나 부차적인 능력을 제한함으로써 핵심 추론 능력에 더 깊고 정교하게 집중할 수 있도록 한 전략적 가지치기(pruning)의 결과로 해석됩니다.
이러한 선택적 빼기는 안전 가드레일을 추가하면 모델의 일반적인 성능이 필연적으로 저하된다는 기존의 통념에 도전합니다. 대신, 이는 AI 정렬(AI alignment)에 대한 더욱 정교한 접근 방식을 시사합니다. 즉, 방해 요소를 제거하는 것과 마찬가지로 목표 지향적인 제약을 통해 리소스를 더 생산적인 인지 경로로 재할당함으로써 유익한 지능의 순증가를 도모할 수 있다는 것입니다.
Anthropic은 이러한 안전 우선 철학을 강화하기 위해 강력한 프로덕션 사용을 위한 새로운 개발자 중심 기능을 추가했습니다. 여기에는 안전 플래그가 지정된 요청에 대한 자동 API 폴백(fallback) 기능이 포함되어 있어, 민감한 콘텐츠가 감지되더라도 원활한 운영을 보장합니다. 또한, 대화 도중 도구를 변경할 수 있는 기능은 모델의 적응성과 신뢰성을 높여 개발자에게 애플리케이션에 대한 더 큰 제어력과 안정성을 제공합니다.
자주 묻는 질문(FAQ)
Claude Opus 5란 무엇인가요?
Claude Opus 5는 Anthropic의 최신 최고 사양 모델입니다. 놀랍게도 이전 플래그십 모델인 Fable 5보다 대부분의 벤치마크에서 더 뛰어난 성능을 보이면서도, 이전 모델인 Opus 4.8과 동일한 가격을 유지하고 있습니다.
Opus 5는 Fable 5보다 어떻게 더 나은가요?
Opus 5는 에이전트 코딩(Frontier Bench), 실무 작업 완료(GDP Val), 새로운 문제 해결(Arc AGI 3)과 같은 영역에서 Fable 5보다 상당한 성능 향상을 보입니다. 또한 작업당 비용을 낮추어 효율성까지 확보했습니다.
'작업당 비용(cost per task)'은 AI 모델에서 어떤 의미인가요?
작업당 비용은 토큰 가격과 필요한 토큰 수를 모두 고려하여 작업을 완료하는 데 드는 실제 비용을 의미합니다. 모델의 토큰 가격이 저렴하더라도 비효율적이라면 실제 비용은 높을 수 있습니다. Opus 5는 매우 효과적인 성능을 발휘하여 성공적인 작업당 전체 비용을 절감하는 데 탁월합니다.
Opus 5는 모든 면에서 뛰어난가요?
아니요. 전반적으로 더 뛰어난 성능을 보이지만, Opus 5는 법률(Legal Bench) 및 전문 의료(Health Bench Professional)와 같은 특정 전문 벤치마크에서는 성능이 약간 감소했습니다. 또한 사이버 보안 취약점 개발 능력은 의도적으로 제한되도록 설계되었습니다.

