Skip to content
ai agents

Alibaba의 AI 에이전트, 10일간의 코딩 기록

새로운 오픈 웨이트 AI가 10일간의 코딩 마라톤을 완주하며 무에서 유를 창조하는 복잡한 앱을 구축했습니다. 이는 단순한 챗봇을 넘어 클로즈드 소스 거대 기업들에 대한 직접적인 도전이자, 자율 개발자의 미래를 엿볼 수 있는 사례입니다.

Sol Aguirre
Alibaba의 AI 에이전트, 10일간의 코딩 기록

AI가 10일 연속 코딩을 수행하다

Alibaba가 자율 AI 에이전트의 한계를 확장했습니다. 2.4조 개의 파라미터를 가진 새로운 플래그십 오픈 웨이트 모델인 Qwen 3.8 Max가 최근 10일 넘게 쉬지 않고 코딩을 수행하는 전례 없는 성과를 보여주었습니다. 빈 폴더에서 시작해 완전히 기능하는 코드 에이전트인 "O my CLI"를 자율적으로 구축하여 GitHub에 공개했으며, 이는 지속적이고 독립적인 개발 능력을 입증한 것입니다.

이 획기적인 데모는 Qwen 3.8 Max의 핵심 강점인 에이전트 코딩(agentic coding)을 강조합니다. 며칠 동안 작업을 유지하도록 설계된 이 기능은 모델이 복잡한 계획, 반복적인 실행, 지속적인 자기 교정이 필요한 장기 프로젝트를 인간의 개입 없이 처리할 수 있게 합니다. 100만 토큰의 컨텍스트 윈도우를 활용하여 프로젝트의 일관성을 유지하며 다일간의 프로그래밍 과제를 해결하는 데 탁월합니다.

자율성을 더욱 강화하기 위해 Qwen 3.8 Max는 네이티브 멀티모달 기능을 자랑합니다. 통합된 비전 시스템은 지속적인 피드백 루프 역할을 하여 모델이 자신의 진행 상황을 '보고', 출력을 분석하며, 계획을 동적으로 수정할 수 있게 합니다. 이러한 시각적 통찰력은 초기 개념부터 배포에 이르기까지 복잡한 소프트웨어 개발의 반복적인 특성을 탐색하는 데 필수적인 정교한 자기 교정 및 적응을 가능하게 합니다.

2.4조 파라미터 괴물의 내부

Alibaba의 Qwen 3.8 Max는 모델 아키텍처의 기념비적인 성과로, 2.4조 개의 파라미터를 가진 희소 Mixture-of-Experts (MoE) 시스템입니다. 이 설계는 추론 시 토큰당 약 950억 개의 파라미터만 영리하게 활성화하여 원시 컴퓨팅 성능과 운영 효율성 사이의 중요한 균형을 맞춥니다. 또한 100만 토큰의 컨텍스트 윈도우와 멀티모달 기능을 갖추어 이미지, 비디오, 텍스트를 포괄적으로 이해합니다.

이번 출시는 Alibaba의 심오한 전략적 변화를 의미하며, 가장 강력한 'Max' 등급 모델의 가중치를 처음으로 공개한 사례입니다. 이러한 공격적인 '오픈 웨이트' 행보는 독점적인 AI 거대 기업들에 대한 중대한 도전이며, 최첨단 에이전트 시스템의 경쟁 구도를 근본적으로 재편하고 있습니다. 이는 최고 수준의 AI 역량이 더욱 폭넓게 이용 가능한 미래를 시사합니다.

거대한 규모에도 불구하고 Alibaba는 폭넓은 접근성을 보장했습니다. 개발자들은 API를 통해 Qwen 3.8 Max를 사용할 수 있으며, 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 경쟁력이 있습니다. 또한 로컬 실험 및 개발을 위해 개인용 기기에서 효율적으로 실행되도록 설계된 더 작고 관리하기 쉬운 270억 파라미터 변형 모델도 출시했습니다. 이러한 이중 접근 방식은 고급 AI 에이전트 기능에 대한 접근을 민주화합니다.

GPT-5 및 Claude와의 벤치마크 경쟁

Qwen 3.8 Max는 자율적으로 코딩할 뿐만 아니라 주요 클로즈드 소스 모델들과 경쟁력 있는 벤치마크 결과를 보여줍니다. 에이전트 작업에서 OSWorld-Verified 점수 86.1을 기록하며 Claude Fable 5(약 85.0)와 GPT-5.6 Sol(83.2)를 앞섰습니다. 또한 연구 분석을 위한 PaperBench에서도 93.0점을 기록하여 GPT-5.6 Sol(90.5)과 Claude Fable 5(88.8)를 능가했습니다.

Terminal-Bench 2.1에서 Qwen 3.8 Max는 86.6점을 기록하여 Claude Opus 4.8과 Claude Fable 5(모두 84.6점)를 앞섰지만, GPT-5.6 Sol(88.8점)에는 미치지 못했습니다. 그러나 SWE-bench Pro의 복잡한 엔지니어링 작업에서는 67.7점을 기록하여 Claude Fable 5(80.0점)와 Claude Opus 4.8(69.2점)보다 낮은 점수를 보였습니다.

2.4조 개의 파라미터를 가진 시스템은 강력하고 균형 잡힌 프로필을 제시하며, Anthropic과 OpenAI의 폐쇄형 모델이 오랫동안 유지해 온 지배력에 직접적으로 도전합니다. 특히 에이전트 기반 사용 사례와 연구 재현에서 탁월한 성능을 발휘하며 강력한 올라운더로서의 입지를 다지고 있습니다.

10일간의 'O my CLI' 빌드 데모는 획기적이었지만, 이는 통제된 환경에서 작동한 결과이며 실제 배포 시에는 중요한 고려 사항이 됩니다. API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러입니다. 이 오픈 웨이트 모델은 며칠 동안 실행될 수 있어, 진화하는 AI 환경에서 비용 효율적인 강력한 대안을 제공합니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

폐쇄형 모델의 지배력은 끝났는가?

Alibaba의 Qwen 3.8 Max 출시로 글로벌 AI 역학 관계가 근본적으로 변화하고 있습니다. 중국에서 등장한 2.4조 파라미터 규모의 최상급 MoE 모델이 오픈 웨이트로 공개되면서, 서구권 거대 기술 기업들의 확고한 폐쇄형 모델 지배력에 정면으로 도전하고 있습니다. 이는 최첨단 AI를 구축하고 배포하려는 전 세계적인 경쟁을 심화시켜, 더욱 다변화된 경쟁 환경을 조성하고 있습니다.

중요한 점은 "오픈 웨이트(open-weight)"가 완전히 "오픈 소스(open-source)"와 동일한 것은 아니라는 것입니다. Alibaba는 모델 파라미터에 대한 접근 권한을 제공하여 폭넓은 실험과 개발을 가능하게 합니다. 그러나 향후 잠재적인 라이선스 제한이 상업적 배포를 규제할 수 있으며, 이는 기업용 애플리케이션에 대한 접근성의 진정한 경계를 결정짓게 될 것입니다.

업계 전반에 걸쳐, 이는 고성능 에이전트 AI에 대한 접근성을 민주화합니다. 개발자들은 며칠 동안 자율적인 코딩을 수행하도록 설계된 강력한 새로운 도구를 얻게 되었으며, 이는 혁신 주기를 획기적으로 가속화할 수 있습니다. 그러나 다양한 지정학적 배경을 가진 강력한 모델들이 널리 채택됨에 따라, 전 세계적으로 상업적 사용, 데이터 거버넌스, 윤리적 배포 표준에 대한 새로운 질문들이 제기되고 있습니다. AI 개발의 최전선은 이제 훨씬 더 개방적이면서도 복잡해졌습니다.

자주 묻는 질문

Qwen 3.8 Max란 무엇인가요?

Qwen 3.8 Max는 Alibaba에서 개발한 2.4조 파라미터 규모의 오픈 웨이트 AI 모델로, 에이전트 코딩과 같은 장기 자율 작업을 위해 특별히 설계되었습니다.

제 노트북에서 Qwen 3.8 Max를 실행할 수 있나요?

아니요, 2.4T 파라미터 모델은 상당한 컴퓨팅 자원이 필요합니다. 하지만 Alibaba는 개인용 기기에서 실행할 수 있도록 설계된 270억 파라미터 변형 모델인 Qwen 3.8-27B도 함께 출시했습니다.

Qwen 3.8 Max는 GPT나 Claude와 같은 모델과 비교하면 어떤가요?

매우 경쟁력이 있습니다. Qwen 3.8 Max는 에이전트 컴퓨터 사용 벤치마크(OSWorld-Verified)에서 Claude Fable 5나 GPT-5.6 Sol과 같은 모델을 능가하지만, 일부 복잡한 소프트웨어 엔지니어링 테스트(SWE-bench Pro)에서는 뒤처지는 모습을 보입니다.

Qwen 3.8 Max는 10일간의 데모에서 무엇을 만들었나요?

가장 인상적인 시연에서 이 모델은 빈 폴더를 제공받아 10일 동안 자율적으로 'O my CLI'를 구축했으며, 이는 현재 GitHub에서 사용할 수 있는 완전한 작동형 코드 에이전트입니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only