IT Post

by Rice Studio Lab


記事を検索
文字サイズ
ふりがな
AI・生成AI

Qwen3.8-Maxが値段そのままで首位に、コーディング力は本当に上がったのか。0902アップデートの中身を確かめる

価格据え置きでCodeArena首位に立ったQwen3.8-Max-0902、22点伸びたスコアの中身と、それだけでは分からないことを仕分けた

30秒で分かる結論

中国アリババグループのAI開発チーム「Qwen(通義千問)」は2026年9月1日、最上位モデル「Qwen3.8-Max」の更新版「Qwen3.8-Max-0902」を公式X(旧Twitter)アカウントおよびAlibaba Cloudの公式告知ページで発表しました。パラメータ数(AIモデルの規模を示す指標)2兆4000億、コンテキストウィンドウ(一度に処理できる文章量の上限)100万トークンという基本仕様と、100万トークンあたり入力2ドル・出力6ドルという価格は据え置いたまま、コーディングと「Cowork」と呼ぶ協調作業タスクに絞って追加学習した「差し替え型」の更新です。ベンチマーク(AIの性能を測る基準となる試験)の一つ「CodeArena」のWebDev部門では、スコアが1669から1691へ上昇して首位となり、Claude Opus 5(Max)を3点、Kimi K3(Max)を17点上回ったと第三者運営元のArena.aiが発表しています。ただし、これは特定の試験での結果であり、あらゆる作業で他モデルより優れているという意味ではありません。

この記事の目次 8項目
出典を確認する(4件)
記事のテーマを表した生成イメージ
生成AIによるイメージ。実物や実際の画面ではありません。

まず初めに

スコアが22点上がりました、価格は据え置きです、以上——これだけでAI業界は今日も大盛り上がりである。もっとも、動かしているのはアリババというれっきとした元・白物家電の王国出身の企業で、白物家電からAIチップへと看板を掛け替えた身の軽さは大したものだ。ただ、こちらが知りたいのはリーダーボードの順位ではなく、実際にコードを書かせたときに何が変わるかである。得点表の1691という数字は立派だが、それが自分のプロジェクトの1行のバグを直すかどうかは、また別の話だ。※個人の感想です

グラフを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

何が起きているのか

Qwenの公式Xアカウントは2026年9月1日、「Qwen3.8-Max-0902」の提供開始を発表しました。今回の更新は、2026年8月14日に公開された最上位モデル「Qwen3.8-Max」の内部構成を差し替える「in-place upgrade」で、モデルの識別名としてqwen3.8-max-0902または日付形式のqwen3.8-max-2026-09-02が使われています。パラメータ規模は2兆4000億(実際の処理に使われるアクティブパラメータは約950億)、コンテキストウィンドウは100万トークンのまま変わらず、価格も100万トークンあたり入力2ドル・出力6ドルに据え置かれています。Alibaba Cloudの公式アップデート告知ページによると、追加学習の焦点はコーディングと、複数のツールを組み合わせて作業を進める「Cowork」型のエージェント業務に絞られています。

言ってしまえば値上げなしの無料アップデートだが、太っ腹という言葉を使うにはまだ早い。値段が同じなのは当然で、これは新モデルではなく既存モデルの中身の差し替えだからだ。

ベンチマーク面では、AIによるコーディング性能の評価サービス「CodeArena」を運営するArena.aiが公式Xアカウントで、WebDev部門(Webアプリ開発タスクに特化した評価区分)のスコアが更新前の1669から1691へと22点上昇し、首位を獲得したと発表しました。同社によれば、この数字はClaude Opus 5(Max)を3点、Moonshot AIの「Kimi K3」(Max)を17点上回っているとしています。ほかにも、ターミナル操作を評価する「TerminalBench」が11.3から29.0へ、ソフトウェア開発タスクの「DeepSWE」が56.6から69.3へ、「QwenSWEbench V2」が55.1から70.0へと、いずれも大きく伸びたと報告されています。

評価指標 更新前 更新後(0902)
CodeArena WebDev 1669点 1691点(首位)
TerminalBench 11.3 29.0
DeepSWE 56.6 69.3
QwenSWEbench V2 55.1 70.0

いずれの数値も、Qwen側またはArena.ai側の自社発表・自社運営する評価環境によるものである点には留意が必要です。第三者が独立に再現した結果ではありません。

なぜ重要なのか

この更新が注目される理由は、AI企業間の「ベンチマーク競争」が、もはや半年単位ではなく数週間単位のペースで動いている実例だからです。Qwen3.8-Maxの初版が公開されたのは2026年8月14日で、今回の0902版はわずか3週間弱での追加学習・再公開にあたります。米国のOpenAI・Anthropic・Googleに加え、中国勢のQwen・DeepSeek・Moonshot AI・Zhipuなどが、こうした短いサイクルでモデルを磨き上げ続けている状況が、今回の一件からもうかがえます。

また、Qwen3.8-Maxは、軽量版の「Qwen3.8-27B」がApache 2.0ライセンス(無償の商用利用も認める寛容なライセンス)でモデルの重み(学習結果そのもの)を公開しているのに対し、最上位の「Max」はクラウドAPI経由でのみ提供される非公開モデルです。ロイター通信の報道によれば、年間収益5000万ドルを超える大口の商用利用者には個別の商用ライセンス契約を求める方針も示されています。今回の0902更新でこの方針に変更があったという発表は確認できていません。

私たちへの影響

日本の読者の多くは、Qwen3.8-Maxを直接APIで呼び出すことは少ないと考えられます。ただし、AIを使ったコーディング支援ツールの中には、複数のAIモデルを切り替えて使える仕組みを持つものがあり、そうしたツール経由で今回の更新版を意識せず使うことになる利用者は一定数いるとみられます。価格が据え置かれたことは、こうしたツールを使う開発者・企業にとって、コスト増を心配せずに性能向上の恩恵を受けられる点で歓迎材料といえます。

とはいえ、ツール側がいつ0902版に切り替えるかは各サービス次第であり、今日から自動的に何かが速くなるわけではない。

一方で、企業がAIコーディング支援を業務に組み込む際の判断材料として、ベンチマークの順位だけを見て導入を決めるのは早計です。次の見出しで、この点をもう少し詳しく整理します。

初心者が知っておくべきこと

ベンチマークのスコアは、あらかじめ用意された特定の試験問題に対する成績であり、実際の業務で使うコードや文書のすべてを代表しているわけではありません。CodeArenaのWebDev部門は、Webアプリ開発というジャンルに特化した評価区分であり、そのほかの作業(たとえば日本語の文章作成や、業務システムの改修)での性能を直接示すものではない点に注意が必要です。

また、AIモデルの名前についている数字や日付(今回でいう「0902」)は、同じモデルの改良版であることを示す社内的な識別記号にすぎません。バージョン表記の付け方は企業ごとに異なり、統一されたルールがあるわけではないため、名前だけでモデル同士の優劣を判断することもできません。

よくある質問

Q. Qwen3.8-Max-0902は無料で使えますか? A. いいえ。軽量版の「Qwen3.8-27B」は無償の商用利用も可能なApache 2.0ライセンスで重みが公開されていますが、最上位の「Qwen3.8-Max」シリーズはクラウドAPI経由の有償提供のみで、モデルの重み自体は公開されていません。今回の0902版もこの提供形態を引き継いでいます。

Q. 日本語での性能は今回良くなったのですか? A. Alibaba Cloudの告知やArena.aiの発表は、いずれもコーディングと英語圏中心のベンチマーク結果を中心に説明しており、日本語の文章生成能力について具体的な数値は確認できていません。この点は今後の情報を待つ必要があります。

サーバーを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

IT Postの見方

IT Postでは、今回の0902更新を「よくできた模試の見直し」くらいの熱量で受け止めている。22点上昇、首位獲得、値段据え置き——見出しだけ並べれば立派な戦果だが、白物家電の看板を掛け替えて突っ走ってきた企業らしく、とにかく数字の更新が早い。3週間でこれだけ変えてくるくらいなら、次の3週間でまた何かが変わるだろう。

腹立たしいわけではない。むしろ、値上げせずに性能を上げてくるのは利用者にとって歓迎すべき話だ。ただし、この手のベンチマーク自慢話には共通の弱点がある。試験問題を作った側と、採点した側と、発表した側が、だいたい同じ会社だという点だ。CodeArenaは第三者運営とはいえ、Qwen側が「勝った」と言いたい試験で勝ったに決まっている。自分でテストを選んで、自分で満点を取って喜ぶのは、宿題を自分で丸付けする小学生と大差ない。

IT Postでは、この手の「差し替え型アップデート」が悪いとは考えていない。無料で強くなるなら結構なことだ。ただ、リーダーボードの順位表だけを見て「一番賢いAIが決まった」と早合点するのは危険だと考える。自分の仕事で本当に使えるかどうかは、結局、自分で試すまで分からない。※個人の感想です

今後どうなりそうか

Qwenチームは今回同様、数週間単位でのモデル改良を今後も続けるとみられます。米中のAI企業間では、コーディング性能を中心としたベンチマーク競争が引き続き活発化する見通しです。IT Postでは、日本語性能や実運用面での評価など、今回発表されていない情報が明らかになった場合には、あらためて取り上げます。

情報源

この記事を共有する

用語辞典へ