まず初めに
拡散モデルというのは、画像生成AIでおなじみの、ノイズだらけの砂嵐から少しずつ絵を彫り出してくるアレだ。あれを文章でやると言い出したのが、ヤンキー精神の国のスタートアップである。普通のAIは文章を左から順に一語ずつ吐き出す。律儀だ。真面目だ。そして遅い。Inceptionの言い分はこうだ——全部まとめて雑に下書きして、あとから一斉に直せばいいだろう、と。乱暴な理屈だが、毎秒1107トークンという数字を出されると、こちらも一旦は黙るしかない。ただし、その数字を測ったのも本人である。自分で採点した答案をそのまま提出してきた生徒の点数は、まあ、いつだって話半分で聞くのが世の常だ。※個人の感想です
何が起きているのか
Inceptionは2026年9月8日(米国時間)、同社の拡散型言語モデルの最新版となるMercury 2.5を公開しました。同社は自社ブログで、Mercury 2.5を「市場で最も高性能な拡散LLM」であり、「我々の知る限り、これまでに訓練された中で最大の拡散言語モデル」と説明しています。
公表されている主な仕様は次のとおりです。出力速度は広く流通しているNVIDIA製GPU上で毎秒1107トークン。コンテキストウィンドウは26万トークン。前世代のMercury 2は毎秒1009トークン・12万8000トークンだったため、速度は約1割の伸びにとどまる一方、一度に扱える文章量はおよそ2倍になった計算です。同社が最も強調しているのは速度ではなく「知能の40%向上」で、Mercury 2と同じ低遅延・低コストの提供条件を保ったまま品質を引き上げた点を訴えています。
つまり今回の主役は「速さ」ではなく「賢さ」の方だった、という話である。
機能面では、思考の深さを調整できる推論 (tunable reasoning)、複数のツールを同時に呼び出す並列ツールコール、指定した形式どおりに出力するスキーマ準拠のJSON出力に対応するとしています。いずれも、AIエージェントのように「AIが他のプログラムを呼び出しながら作業する」使い方を想定した機能です。
Mercury 2.5と同時に、Inceptionは2つの関連サービスのプレビューも発表しました。1つは音声エージェント向けに最適化した「Mercury Voice」で、最初のトークンが返ってくるまでの時間(TTFT)が170ミリ秒未満だとしています。もう1つは、入力された内容に応じて最適なモデルへ自動的に振り分ける「Mercury Router」です。
生成AIによるイメージ。実物や実際の画面ではありません。
拡散モデルはなぜ速いとされるのか
今回の記事で最も押さえておきたいのは、そもそも「拡散型の言語モデル」とは何が違うのか、という点です。
現在広く使われているChatGPTのような大規模言語モデルは、ほぼすべてが「自己回帰型」と呼ばれる方式です。これは、直前までに出した単語をもとに次の1トークン(単語や文字のかたまり)を予測し、それを繰り返して文章を組み立てていく仕組みです。文章の先頭から末尾へ、一方向に一語ずつ進みます。1トークン出すたびに計算が1回必要になるため、出力が長くなるほど時間がかかります。
これに対して拡散型は、画像生成AIで使われてきた考え方を文章に応用したものです。まず答え全体の「粗い下書き」を用意し、複数のトークンを並列に、何段階かに分けて磨き上げていきます。順番に1つずつ確定させるのではなく、文章全体を同時に少しずつ整えていくイメージです。1トークンごとに順番待ちが発生しないため、原理的には並列処理が効きやすく、同じGPUでも高い出力速度を出しやすいとされています。
順番に並ばずみんなで一斉に押し寄せる、と書くと途端に治安が悪く聞こえるが、計算機の世界ではそれが正義になることもある。
ただし、拡散型が万能というわけではありません。自己回帰型は長年にわたる改良の蓄積があり、最先端の性能を出しているモデルは現在も自己回帰型が中心です。Inception自身も、Mercury 2.5の品質について「最先端の最上位モデルと並んだ」とは主張しておらず、コストを抑えた実用モデルの水準に達したという位置づけで説明しています。
数字はどこまで確かめられているのか
Inceptionは、Mercury 2.5の評価としてエージェント的なツール利用(Tau3Bench Telecom)、科学分野の推論(GPQA Diamond)、コード生成(SciCode)、指示への追従(IFBench)、長文の読み取り(AA-LCR)、ターミナル上でのコーディング(TerminalBench)といった複数のベンチマークの結果を示しています。同社の公表値では、GPQA Diamondで79%、IFBenchで77%とされています。
また同社は、Mercury 2.5の品質が「GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5といったコスト最適化された最先端モデルに匹敵する」と説明しています。
ここで注意が必要なのは、これらの数値と比較のいずれもがInception自身による発表であり、独立した第三者機関による検証結果は現時点で確認できていない点です。「40%の知能向上」という表現についても、同社がどの指標をどう合成して算出したのかは公表資料からは読み取れません。IT Postは、これらを「同社の主張」として扱い、確定した性能評価とは区別して記載しています。
実際にどう使われているのか
Inceptionは、実際にMercuryを採用した企業の事例も公表しています。
AIコーディング支援を手がけるAugment Codeは、会話や作業履歴が長くなったときに内容を要約して圧縮する「コンテキスト圧縮」の処理をMercuryに切り替えました。同社ブログによると、この処理にかかる時間は従来の約150秒から27秒へ短縮され、コストは90%削減されたとされています。品質は維持されたと説明されています。
AI電話エージェントを提供するOpenCallの事例では、応答までの時間が約170ミリ秒まで短縮されたとしています。人と人との会話では、相手の返事が0.5秒遅れるだけで不自然に感じられるため、音声対話では応答速度が体験の質に直結します。
生成AIによるイメージ。実物や実際の画面ではありません。
これらの事例に共通しているのは、いずれも「最高の賢さ」ではなく「十分な賢さを、速く安く」求める用途だという点です。長い会話の要約、モデルの振り分け、ツールの検索といった、利用者の目に直接触れない裏方の処理を高速なモデルに任せ、本当に難しい判断だけを高価な最上位モデルに回す。こうした使い分けが、Mercuryが想定している立ち位置だと考えられます。
私たちへの影響
日本の一般利用者が、今すぐMercury 2.5を直接使う場面はそれほど多くないかもしれません。現時点での提供はAPI経由が中心で、日本語での対話アプリとして一般公開されているわけではないためです。
一方で、私たちが日常的に使うサービスの「裏側」には影響が及ぶ可能性があります。たとえばスマートフォンの音声アシスタント、カスタマーサポートの自動応答、会議の議事録作成といった機能では、返答が来るまでの待ち時間がそのまま使い勝手を左右します。裏方の処理に高速・低価格なモデルを使えるようになれば、同じ料金でも待ち時間の短いサービスが増える、あるいは同じ体験をより安く提供できるようになる、という形で恩恵が回ってくる可能性があります。
料金面も見逃せません。標準料金の出力100万トークンあたり0.75ドルは、GIGAZINEの円換算ではおよそ120円にあたります。100万トークンは日本語にすると原稿用紙で数千枚分に相当する分量です。生成AIを組み込んだサービスを個人や小規模な事業者が作る際、この価格帯の選択肢が増えることは、実験のしやすさに直結します。
とはいえ、8割引きのローンチ価格でうっかり事業計画を立ててしまうと、割引終了時に電卓を叩き直すことになるので注意したい。
よくある疑問
Q. 拡散型のAIは、自己回帰型より優れているのですか。
現時点では「用途による」というのが実情です。速度と価格の面では拡散型に利点があるとされていますが、最先端の性能を出しているモデルは依然として自己回帰型が中心です。Inception自身も、Mercury 2.5をコスト最適化されたモデルの層に位置づけています。
Q. 26万トークンのコンテキストウィンドウは、どのくらいの量ですか。
トークンは単語や文字のかたまりを数える単位で、日本語では1文字が1トークン以上になることもあります。26万トークンは、おおむね文庫本数冊分の文章を一度に読み込ませられる規模にあたります。長い契約書やソースコード全体をまとめて渡す用途で効いてきます。
Q. 日本語には対応していますか。
Inceptionの公表資料では、日本語性能に関する個別の評価は示されていません。日本語での実用性については、実際に試した第三者の検証を待つ必要があります。
Q. 無料で試せますか。
Mercury 2.5はOpenRouterやBasetenなどのAPI提供事業者経由で利用できますが、いずれも従量課金です。発表時点ではローンチ割引が案内されているものの、期間限定の価格である点には注意が必要です。
生成AIによるイメージ。実物や実際の画面ではありません。
IT Postの見方
はっきり言おう。今回のMercury 2.5で本当に評価すべきなのは、毎秒1107トークンという派手な数字ではない。前世代が1009トークンだったのだから、速度の伸びはたったの1割だ。見出しに使うには格好の数字だが、中身としては誤差の域を出ない。
面白いのはその隣にある、12万8000から26万へというコンテキスト長の倍増と、「知能が40%上がった」という主張の方だ。拡散型LLMはこれまで「速いのは分かった、で、賢いの?」という一点で足踏みしてきた技術である。その弱点を正面から埋めにきたのが今回だ、という構図なら筋が通る。速さは前作で証明済み。今回は賢さの番。順番として、実に真っ当だ。
ただし、その40%という数字が何を測ったものなのかは、公表資料をいくら読んでも出てこない。ベンチマークの一覧は並んでいる。GPQAで79%、IFBenchで77%という数字も出ている。だが「40%向上」がどの指標をどう束ねた結果なのかは書かれていない。自社発表で、自社計測で、算出方法は非公開。三拍子そろっている。
IT Postでは、こうした自己申告の性能値そのものを否定するつもりはないと考えます。新興企業が自社モデルの数字を強気に打ち出すのは業界の常であり、独立した検証はいずれ誰かがやる。問題は、その検証が出そろう前に「Haiku 4.5と同等」という言葉だけが独り歩きすることの方だ。同等かどうかを決めるのは、モデルを作った会社ではなく、実際に使った現場である。
その意味で、Augment Codeの150秒が27秒になったという事例は、40%という抽象的な数字よりよほど雄弁だ。長い会話の要約という、地味で、誰も褒めてくれなくて、しかし確実にコストを食う処理。そこを速いモデルに投げたら8割方の時間が消えた。派手さはないが、これこそが拡散型LLMの現実的な使い道だろう。最先端の玉座を狙うのではなく、最先端モデルが面倒くさがってやらない雑用を、猛烈な速さで片付ける。裏方に徹すると決めた技術は、案外強い。※個人の感想です
今後どうなりそうか
拡散型言語モデルをめぐっては、Inception以外にもGoogleが「Gemini Diffusion」を公表するなど、大手を含めた取り組みが進んでいます。今後は、第三者による独立したベンチマーク結果や、実際にMercury 2.5を組み込んだサービスからの評価が出てくるとみられます。日本語での性能についても、国内の開発者による検証が公開されれば、実用性の判断材料が増えることになります。IT Postでは、独立した検証結果が確認でき次第、あらためて取り上げます。