Skip to content
comparisons

Claude이 패배했습니다. 그 이유는 다음과 같습니다.

우리는 최고 점수를 기록한 Claude Opus와 더 저렴한 오픈 웨이트 모델인 Qwen 3.8을 실제 코딩 대결에서 맞붙였습니다. 승리한 모델은 벤치마크가 예측한 모델이 아니었습니다.

Vera Cole
Claude이 패배했습니다. 그 이유는 다음과 같습니다.

벤치마크는 거짓말을 합니다. 테스트가 이를 증명합니다.

벤치마크는 종종 실제 활용도를 잘못 나타냅니다. 서류상으로 Claude Opus 5Artificial Analysis에서 63점을 기록하며 더 우월해 보입니다. 경쟁 모델인 Qwen 3.8은 58점으로 뒤처져 있습니다. 이 5점 차이는 Claude가 순수한 지능과 능력 면에서 확실한 승자여야 함을 시사합니다.

이 가정을 검증하기 위해 우리는 엄격한 테스트를 고안했습니다. 두 모델 모두에게 three.js를 사용하여 Temple Run에서 영감을 받은 완전하고 플레이 가능한 3D 엔드리스 러너 게임을 만들도록 지시했습니다. 매개변수는 엄격했습니다. 후속 지침이나 수정 없이 단 하나의 동일한 프롬프트에서 생성된 단일 HTML 파일이어야 했습니다.

결과는 극명했습니다. 더 낮은 벤치마크 점수에도 불구하고, '더 약한' Qwen 3.8이 훨씬 더 부드럽고 플레이하기 좋은 게임을 만들어냈습니다. 이 모델은 움직임, 충돌 감지, 절차적 경로 생성과 같은 중요한 영역에서 뛰어난 성능을 보였으며, 전반적으로 더 잘 구조화된 코드베이스를 제공했습니다.

Claude Opus 5는 코드를 빠르게 생성했지만, 완성도가 떨어지고 제어하기 어려운 게임을 결과물로 내놓았습니다. 이러한 실제 적용 사례는 중요한 격차를 드러냅니다. 벤치마크 점수는 순수한 지능을 나타낼 수는 있지만, 복잡하고 창의적인 작업에서 실질적인 유용성과 사용자 경험을 예측하는 데는 자주 실패합니다.

코딩을 서두르면 실패하는 이유

Claude Opus 5는 3D 엔드리스 러너를 위한 방대한 양의 JavaScript를 즉시 생성하기 시작했습니다. 이러한 빠른 출력은 three.js 장면과 플레이어 모델이 빠르게 형태를 갖추면서 빠른 진척이라는 착각을 불러일으켰습니다. 코드가 흘러나오는 것을 보았을 때, Claude는 초기 경주에서 이기고 있는 것처럼 느껴졌습니다.

Qwen 3.8은 완전히 다른 체계적인 전략을 채택했습니다. 게임 루프, 플레이어 상태, 충돌 감지, 절차적 생성 등 게임의 핵심 시스템을 꼼꼼하게 개요로 작성하는 것부터 시작했습니다. 이 포괄적인 아키텍처 단계가 완료될 때까지 기능적인 코드는 단 한 줄도 작성되지 않았습니다.

Qwen의 악명 높은 장황함과 "지나치게 깊게 생각하는" 경향은 이 복잡한 작업에서 결정적인 이점이 되었습니다. 이러한 신중하고 계획 중심적인 접근 방식은 움직임, 충돌, 게임 상태를 우수한 실행력으로 처리하여 강력하고 플레이 가능한 최종 제품을 보장했습니다. 반면 Claude의 빠른 속도는 깨지기 쉽고 플레이하기 어려운 게임을 만들어냈습니다.

결과는 중요한 차이를 강조했습니다. Claude는 대량의 JavaScript를 빠르게 전달했지만, Qwen의 초기 아키텍처적 선견지명은 훨씬 더 부드럽고 구축하기 쉬운 게임을 만들어냈습니다. 이 실질적인 결과는 Claude의 벤치마크 우위를 직접적으로 뒤흔들었습니다.

비용, 제어 및 컨텍스트

Qwen의 호스팅된 추론은 대규모 AI 배포를 위한 경제적 타당성을 재정의합니다. 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러라는 가격은 Claude와 같은 경쟁사보다 훨씬 저렴하여 대용량 에이전트 워크플로우를 위한 유일한 현실적인 선택지가 됩니다. 에이전트는 방대한 코드베이스를 읽고, 모델을 반복적으로 호출하고, 작업을 생성하고, 오류를 검사할 수 있는데, 이러한 작업에서 Claude의 높은 토큰당 비용은 빠르게 부담이 됩니다.

경제적 측면을 넘어, Qwen은 open weights를 통해 타의 추종을 불허하는 제어 기능을 제공합니다. 기업은 자체 인프라에 모델을 배포함으로써 데이터 프라이버시를 보장하고 궁극적인 맞춤화를 실현하는 전략적 이점을 얻을 수 있습니다. 전체 Qwen 3.8 2.4T-A95B 모델은 다중 노드 데이터 센터 하드웨어가 필요하여 대부분의 로컬 배포 환경에서는 사용하기 어렵지만, 실용적인 Qwen 3.8 27B 변형 모델은 24GB VRAM을 갖춘 소비자용 GPU에서 로컬로 실행할 수 있습니다. 이를 통해 Claude가 제공하지 않는 내부 실험 및 파인튜닝이 가능해집니다.

하지만 이러한 자유에는 분명한 상충 관계(trade-off)가 따릅니다. Artificial Analysis에 따르면 Qwen은 초당 약 47-48 토큰을 생성하는 다소 느린 속도로 작동하며, 이는 실시간 상호작용에 영향을 줄 수 있습니다. 또한, 이 모델은 지나치게 장황한 경향이 있어 간결한 해결책을 요구할 때조차 "작은 인생 이야기"를 늘어놓기도 합니다. 이러한 장황함은 깊은 문맥 이해가 필요한 복잡한 자율 에이전트에게는 유용할 수 있지만, 더 많은 인프라와 느리고 신중한 모델에 대한 높은 인내심을 요구합니다. 이는 비용이 전혀 들지 않는 자유가 아니라, 순수한 속도와 즉각적인 세련미를 포기하는 대신 제어권을 얻기 위한 전략적 투자입니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

새로운 AI 의사결정 매트릭스

이제 올바른 AI 모델을 선택하려면 단순히 벤치마크 점수가 아닌, 모델의 운영 프로필에 대한 정확한 이해가 필요합니다. 보편적인 "최고의" 모델 시대는 끝났습니다. 대신 개발자는 모델의 강점을 특정 프로젝트 요구 사항에 맞춰 조정해야 합니다.

즉각적인 코딩 작업, 빠른 수정, 또는 빠른 지능적 처리가 가장 중요한 경우에는 Claude Opus 5가 여전히 더 나은 선택입니다. Artificial Analysis에서 63점을 기록한 속도와 세련된 출력 결과는 프롬프트 처리 속도가 중요한 일상적인 대화형 문제 해결을 가속화합니다.

그러나 정교한 에이전트 워크플로우, 복잡한 시스템 설계 또는 예산에 민감한 프로젝트의 경우 Qwen 3.8이 확실한 선택입니다. 백만 토큰당 입력 2달러, 출력 6달러의 호스팅 가격은 Claude의 높은 비용과 달리 대규모 운영을 경제적으로 가능하게 합니다. 또한, Qwen의 open weights에 대한 접근 권한은 맞춤형 배포를 위한 타의 추종을 불허하는 제어와 유연성을 제공합니다.

이제 개발자에게 필수적인 기술은 이러한 미묘한 상충 관계를 마스터하는 것입니다. 성공은 속도, 비용, 맞춤형 배포 사이의 섬세한 균형을 이해하고 각 작업에 맞는 전문 도구를 선택하는 데 달려 있습니다. 이러한 적응형 접근 방식을 무시하면, 각 과제에 적합한 모델을 활용하는 경쟁자들에게 프로젝트가 빠르게 뒤처지는 것을 보게 될 것입니다.

자주 묻는 질문

게임 개발 테스트에서 Qwen 3.8이 Claude Opus 5보다 더 나은 성능을 보인 이유는 무엇인가요?

Qwen은 복잡한 작업에 대해 더 신중하고 계획 중심적인 접근 방식을 취했으며, 그 결과 더 응집력 있고 플레이 가능한 게임을 만들어냈습니다. 반면 Claude의 더 빠르고 코드 우선적인 접근 방식은 더 높은 벤치마크 점수에도 불구하고 기능적으로는 덜 완성된 결과를 낳았습니다.

Qwen 3.8과 같은 open-weight 모델의 주요 장점은 무엇인가요?

주요 장점은 제어와 비용입니다. Open weights를 사용하면 개발자가 모델을 직접 호스팅하고 사용자 지정할 수 있으며, 호스팅된 추론 가격이 독점 경쟁사보다 훨씬 저렴하여 대규모 작업이나 에이전트 작업에 이상적입니다.

Qwen 3.8은 Claude Opus 5보다 빠르나요, 느리나요?

Qwen 3.8은 일반적으로 더 느리며, 벤치마크상 초당 약 47-48 토큰을 처리하는 반면 Claude Opus 5는 초당 약 62 토큰을 처리합니다. 또한 Qwen의 장황한 특성 때문에 간단한 질문에도 더 느리게 느껴질 수 있습니다.

2.4조 개의 파라미터를 가진 Qwen 모델을 내 컴퓨터에서 실행할 수 있나요?

아니요, 전체 2.4T 모델을 실행하려면 멀티 노드 데이터 센터급 하드웨어가 필요합니다. 하지만 Qwen 3.8 27B 모델과 같은 더 작은 버전은 약 24GB의 VRAM을 갖춘 소비자용 GPU에서 로컬로 배포할 수 있도록 설계되었습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only