中国アリババグループのAI開発チーム「Qwen」は、2026年8月26日、新しい大規模言語モデル「Qwen3.8-Flash-Next」を公開しました。同社の次世代アーキテクチャ「Qwen4」を先取りした試作版という位置づけで、モデルの重み(パラメータ)を誰でも利用できる形で公開するオープンウェイトモデルです。総パラメータ数は125B(1250億)、動作時に実際に使われる(活性化される)パラメータは6B(60億)にとどまるMoE(専門家混合)型の構成に加え、単語の並び方を丸ごと記憶する「Nグラム埋め込み」という仕組みに51B(510億)パラメータを割り当てているのが特徴です。アリババの発表によると、学習コストは前モデル「Qwen3.7-Plus」の約9分の1に抑えつつ、プログラミングや事務作業関連のベンチマークで前モデルを上回る性能を示したとしています。同社が公開したベンチマーク結果では、コーディング能力を測る「SWE-bench Pro」で62.5点を記録し、Anthropicの「Claude Opus 4.6 Max」の53.4点を上回ったとされていますが、これはアリババ自身が公表した数値であり、2026年8月31日時点で第三者による独立した検証は確認されていません。
モデルの構成は、総パラメータ数125B(1250億)のうち、実際の推論時に使われるパラメータは6B(60億)にとどまるMoE(Mixture of Experts、専門家混合)型で、512個の「専門家」ネットワークと48層から成ります。これに加えて、直前の単語の並び(バイグラム・トライグラム)を丸ごとテーブルとして記憶する「Nグラム埋め込み」という仕組みに、別途51B(510億)パラメータを割り当てているのが特徴です。この仕組みにより、あらかじめ計算済みの単語の並びをテーブルから引き当てるだけで済むため、追加の計算コストをほとんどかけずに文脈理解の精度を高められるとされています。対応できる文章の長さ(コンテキストウィンドウ)は標準で262,144トークン(約26万トークン)、最大100万トークンまで拡張可能とされ、画像も扱えるマルチモーダル対応です。ライセンスは「Qwen Community 1.0」で、商用利用を含めて重みを公開しています。
生成AIによるイメージ。実物や実際の画面ではありません。
アリババの発表によると、学習コストは前モデル「Qwen3.7-Plus」のおよそ9分の1に抑えられたとしています。ベンチマーク結果では、Qwen3.7-Plus-Baseと比較した14種類のベンチマークのうち8種類で上回ったとし、コーディング関連のベンチマーク「SWE-bench Pro」では62.5点を記録、Anthropicの「Claude Opus 4.6 Max」の53.4点を上回ったと主張しています。同様に、業務遂行タスクを測る「CoWorkBench」でも73.9点対68.2点、「JobBench」でも55.7点対36.6点でClaude Opus 4.6 Maxを上回った一方、汎用的な知識・推論を問う「Humanity's Last Exam」では35.9点対40.0点とClaude側が上回ったとされています。これらの数値はいずれもアリババ自身が発表したものであり、2026年8月31日時点で第三者による独立した再現・検証は確認されていません。試作版の「Qwen3.8-Flash-Next」をもとに、より多くの実運用向け機能(標準で100万トークンの文脈長、公式の各種ツール連携など)を備えた製品版「Qwen3.8-Flash」も、あわせて提供されています。
「MoE(Mixture of Experts、専門家混合)」とは、AIモデルの内部に複数の専門的なネットワーク(専門家)を用意しておき、入力された内容に応じて、その都度必要な専門家だけを選んで計算させる仕組みです。全体のパラメータ数は大きくても、実際に動かす部分を絞り込むことで、計算にかかる負荷を抑えながら高い性能を狙うことができます。
IT Postの見方
IT Postでは、今回のQwen3.8-Flash-Nextの発表を、中国AI企業勢による「効率競争」がまた一段階進んだことを示す事例として受け止めています。
*とはいえ、「自社発表のベンチマークで大手モデルを撃破」というこの手のプレスリリースは、もはや様式美を通り越して定型文の域に入っている。*今回もアリババは、Claude Opus 4.6 Maxに対して「8割方勝った」という数字を並べてみせたが、負けた項目(Humanity's Last Exam)もきちんと発表している律儀さは評価したい一方、独立した第三者機関による検証が済むまでは、この手の数字を割り引いて眺めるくらいがちょうどいい。IT Postでは、パラメータの効率化やオープンウェイトの流れ自体は歓迎する立場ですが、ベンチマーク競争の数字合戦に振り回されず、実際に使ってみた開発者の評価が積み上がってから、あらためて評価を下すべきだと考えます。※個人の感想です