AIが10日間連続でコーディングを完遂
Alibabaが自律型AIエージェントの限界を押し広げました。同社の新しいフラッグシップモデルである「Qwen 3.8 Max」(2.4兆パラメータのオープンウェイトモデル)が、10日間連続でコーディングを行うという前例のない偉業を達成しました。空のフォルダを渡されたこのモデルは、自律的に「O my CLI」を構築しました。これは現在GitHubで公開されている完全機能型のコードエージェントであり、持続的かつ独立した開発能力を証明しています。
この画期的なデモは、Qwen 3.8 Maxの核心的な強みである「エージェント型コーディング」を浮き彫りにしています。数日間にわたってタスクを継続できるように設計されたこの機能により、モデルは複雑な計画、反復的な実行、そして絶え間ない自己修正を必要とする長期プロジェクトを、人間の絶え間ない介入なしに処理できます。100万トークンのコンテキストウィンドウを活用してプロジェクトの整合性を維持し、数日間にわたるプログラミングの課題を乗り越えることに長けています。
さらに自律性を高めるため、Qwen 3.8 Maxはネイティブな「マルチモーダル機能」を備えています。統合された視覚システムが継続的なフィードバックループとして機能し、モデルが自身の進捗状況を「視覚的」に把握し、出力を分析し、計画を動的に改善することを可能にします。この視覚的な洞察により、初期コンセプトからデプロイメントに至るまで、複雑なソフトウェア開発の反復的な性質を乗り越えるために不可欠な、高度な自己修正と適応が可能になります。
2.4兆パラメータの怪物の中身
AlibabaのQwen 3.8 Maxは、モデルアーキテクチャにおける記念碑的な成果です。これは2.4兆パラメータのスパースな「Mixture-of-Experts (MoE)」システムです。この設計は、推論時にトークンあたり約950億パラメータのみを巧みにアクティブ化することで、生の計算能力と運用効率の間の重要なバランスを保っています。また、このモデルは100万トークンのコンテキストウィンドウとマルチモーダル機能を備えており、画像、動画、テキストを処理して包括的な理解を実現します。
今回のリリースはAlibabaにとって深遠な戦略的転換を意味し、同社が最も強力な「Max」ティアモデルのウェイトを公開するのは今回が初めてです。この積極的な「オープンウェイト」への動きは、プロプライエタリなAIの巨人たちに対する重大な挑戦を示唆しており、最先端のエージェント型システムの競争環境を根本的に再構築するものです。これは、トップクラスのAI能力がより広く利用可能になる未来を示唆しています。
その巨大な規模にもかかわらず、Alibabaは幅広いアクセシビリティを確保しています。開発者はAPI経由でQwen 3.8 Maxにアクセスでき、価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルという競争力のある設定です。さらに、ローカルでの実験や開発のために、個人のマシンで効率的に動作するように設計された、より扱いやすい「270億パラメータ」のバリエーションもリリースされました。この二段構えのアプローチにより、高度なAIエージェント機能へのアクセスが民主化されます。
GPT-5およびClaudeとのベンチマーク対決
Qwen 3.8 Maxは自律的にコーディングするだけでなく、主要なクローズドソースモデルと競合するベンチマーク結果を出しています。エージェントタスクにおいてその真価を発揮し、「OSWorld-Verified」で86.1を記録し、Claude Fable 5(約85.0)やGPT-5.6 Sol(83.2)を上回りました。また、リサーチ分析においてもPaperBenchで93.0を記録し、GPT-5.6 Sol(90.5)やClaude Fable 5(88.8)をリードしています。
Terminal-Bench 2.1では、Qwen 3.8 Maxは86.6を記録し、Claude Opus 4.8およびClaude Fable 5(いずれも84.6)を上回りましたが、GPT-5.6 Sol(88.8)には及びませんでした。しかし、SWE-bench Proでの複雑なエンジニアリングタスクにおいては67.7を記録し、Claude Fable 5(80.0)やClaude Opus 4.8(69.2)の後塵を拝する結果となりました。
この2.4兆パラメータのシステムは、強力かつバランスの取れたプロファイルを備えており、AnthropicやOpenAIのクローズドソースモデルが長年維持してきた優位性に真っ向から挑むものです。特にエージェント的なユースケースや研究の再現において卓越しており、堅牢なオールラウンダーとしての地位を確立しています。
「O my CLI」を構築した10日間のデモは画期的でしたが、それは制御された環境下での動作であり、実環境への導入においては重要な考慮事項となります。API料金は入力トークン100万あたり2ドル、出力トークン100万あたり6ドルです。このオープンウェイトモデルは数日間稼働し続けることが可能で、進化するAI環境において、コスト意識の高い魅力的な代替手段を提供します。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
これはクローズドソースの優位性の終わりか?
AlibabaによるQwen 3.8 Maxのリリースは、世界のAIパワーバランスを根本から変えるものです。中国から登場したトップクラスの2.4兆パラメータMoEモデルがオープンウェイトで公開されたことで、欧米の巨大テック企業によるクローズドソースの優位性に直接的な挑戦状が叩きつけられました。これにより、フロンティアAIの開発と普及を巡る世界的な競争が激化し、より多様な競争環境が生まれています。
重要な点として、「オープンウェイト」は完全に「オープンソース」であることと同義ではありません。Alibabaはモデルのパラメータへのアクセスを提供し、広範な実験や開発を可能にしていますが、将来的なライセンス制限が商用展開を左右する可能性があり、エンタープライズ用途におけるアクセシビリティの真の境界線は依然として存在します。
業界全体にとって、これは極めて高性能なエージェント型AIへのアクセスを民主化するものです。開発者は、数日間にわたる自律的なコーディングのために設計された強力な新ツールを手に入れることになり、イノベーションのサイクルが劇的に加速する可能性があります。一方で、多様な地政学的背景を持つ強力なモデルが広く普及することは、商用利用、データガバナンス、そして世界的な倫理的展開基準に関する新たな問いを投げかけています。AI開発の最前線は、よりオープンであると同時に、より複雑なものとなっています。
よくある質問
Qwen 3.8 Maxとは何ですか?
Qwen 3.8 Maxは、Alibabaが開発した2.4兆パラメータのオープンウェイトAIモデルであり、エージェント的なコーディングのような長時間の自律タスクに特化して設計されています。
自分のノートパソコンでQwen 3.8 Maxを実行できますか?
いいえ、2.4Tパラメータのモデルには膨大な計算リソースが必要です。ただし、Alibabaは個人用マシンで実行できるように設計された270億パラメータのバリエーション、Qwen 3.8-27Bもリリースしています。
Qwen 3.8 MaxはGPTやClaudeと比べてどうですか?
非常に競争力があります。Qwen 3.8 Maxは、エージェントによるコンピュータ操作のベンチマーク(OSWorld-Verified)においてClaude Fable 5やGPT-5.6 Solを上回りますが、一部の複雑なソフトウェアエンジニアリングテスト(SWE-bench Pro)では後れを取っています。
Qwen 3.8 Maxは10日間のデモで何を構築しましたか?
最も印象的なデモンストレーションでは、空のフォルダを与えられたモデルが10日間かけて自律的に「O my CLI」を構築しました。これは現在GitHubで公開されている、完全に動作するコードエージェントです。

