IT Post

by Rice Studio Lab


記事を検索
文字サイズ
ふりがな
AI・生成AI

Googleの音声AI「Gemini 3.8 Live」、首位の82.6点は伊達か。考えながら話す仕組みを確かめる

Googleが発表した音声対話AI「Gemini 3.8 Live」「同Extended Thinking」。Artificial Analysisの指標で首位となった仕組みと、提供範囲・価格を確かめた

30秒で分かる結論

  • Googleは2026年9月15日、リアルタイムの音声対話に特化したAIモデル「Gemini 3.8 Live」と、より高度な推論を組み込んだ上位版「Gemini 3.8 Live Extended Thinking」を発表しました。
  • Extended Thinkingの高性能設定は、AI性能評価機関Artificial Analysisの音声対話ベンチマーク「Speech to Speech Index」で82.6点を記録し、OpenAIやxAIのモデルを上回って首位に立ちました。
  • Gemini 3.8 LiveはGoogle検索の音声対話機能「Search Live」で全員が利用でき、Extended ThinkingはGemini Live・Gmail・Keep・Google Workspace(Docs、Google AI Pro/Ultra契約者向け)に順次組み込まれます。
この記事の目次 7項目
出典を確認する(3件)
記事のテーマを表した生成イメージ
生成AIによるイメージ。実物や実際の画面ではありません。

まず初めに

*「考えながら喋る」を機械にやらせるというのは、地味に見えて実はかなり厄介な注文である。*人間なら誰でも無意識にやっていることだが、AIにやらせようとすると「返事が遅れて気まずい沈黙が生まれる」か「考えなしに口が先に動く」かのどちらかになりがちだった。Googleが今回持ち出してきたのは、その中間を狙う話す前に「うーん」と相槌を挟みつつ、裏側でちゃんと考えているという、なんとも人間くさい芸当である。※個人の感想です

この記事の内容にちなんだ挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

何が起きているのか

Googleは2026年9月15日、音声によるリアルタイム対話に特化したAIモデル「Gemini 3.8 Liveじぇみないさんてんはちらいぶ」と、その上位版である「Gemini 3.8 Live Extended Thinking」を発表しました。同社はこの2モデルを、これまでで最も高性能な音声対話モデルと位置づけています。

Gemini 3.8 Liveは、低コスト・低遅延を重視したモデルで、自然な対話のなめらかさと、カメラ映像などを見ながら会話する「視覚グラウンディング」機能を両立させています。一方のExtended Thinkingは、複数の手順を踏む複雑な作業や、より高度な推論すいろん(AIが根拠を積み重ねて結論を導く処理)が必要な場面向けに設計されたモデルです。Extended Thinkingの特徴は、回答しながら同時に考える「Mind-Paced Speaking」的な挙動にあります。ユーザーの発言を受けて、まず自然な相槌で反応を返しつつ、裏側では複数手順の処理を進め、その進み具合を会話の中で説明していく仕組みです。

提供範囲は段階的です。開発者向けにはGemini APIとGoogle AI Studioで両モデルが利用できます。一般向けには、Gemini 3.8 LiveがGoogle検索の音声対話機能「Search Live」で全員に提供される一方、Extended Thinkingは音声アシスタント「Gemini Live」、文書作成ツール「Docs」(Google Workspace、Google AI Pro・Ultra契約者向け)、そしてGmail・Keep(Google AIの契約者向け)に組み込まれます。

なぜ重要なのか

今回の発表で注目すべきは、AI性能評価機関Artificial Analysisが算出する音声対話モデルの指標「Speech to Speech Index」で、Extended Thinkingの高性能設定(High)が82.6点を記録し、首位に立った点です。これは、OpenAIの「GPT-Live-1」(Astra、中設定)の81.5点、xAIの「Grok Voice Think Fast 2.0」(High設定)の81.3点、同じくGPT-Live-1(Sol、低設定)の80.1点を上回る結果です。加えて、複数の作業を音声だけでこなす能力を測る「τ-Voice」ベンチマークでも68.6%で首位、銀行業務を模した「τ-Voice-banking」で35.1%、音声理解の総合力を測る「Big Bench Audio」では97.7%を記録したと報告されています。

価格面でも特徴があります。Gemini 3.8 Liveは音声入力1時間あたり0.84ドルで、Speech to Speech Indexに掲載されるモデルの中で最も低価格とされています。Extended Thinking(High設定)は1時間あたり3.50ドルで、これはOpenAIのGPT-Live-1(Sol、低設定)の4.47ドルよりも低い水準です。性能面で首位級の評価を得つつ、価格面でも競合より安く抑えている点は、音声AIをサービスに組み込みたい開発者にとって見逃せない材料です。

私たちへの影響

一般の利用者にとって最も身近な変化は、Google検索の音声対話機能「Search Live」やスマートフォンの音声アシスタント「Gemini Live」で、より自然でスムーズな会話ができるようになる可能性がある点です。従来の音声AIは、複雑な質問をすると考え込んで無言になったり、逆に考えが浅いまま話し始めてしまったりすることがありましたが、Extended Thinkingは会話をしながら裏側の処理状況を説明する設計のため、待たされている感覚が和らぐことが期待されます。

Gmail・Keep・Google Docsといった日常的に使うツールに音声AI機能が組み込まれる点も見逃せません。たとえば、複数の下書きメールを整理する、長い文書の要点を音声で確認するといった、複数手順にまたがる作業を、声で指示しながら進められるようになる可能性があります。ただし、Extended ThinkingがWorkspace上のDocsで使えるのはGoogle AI Pro・Ultra契約者に限られるなど、機能ごとに対応プランが異なる点には注意が必要です。

初心者が知っておくべきこと

音声対話AIおんせいたいわえーあい」(Speech to Speech AI、S2Sモデル)とは、人間の音声を直接認識し、文字への変換を経ずに音声のまま応答を生成するAIモデルの総称です。従来型の音声アシスタントの多くは「音声→文字変換→AIが文字で回答を生成→音声合成」という複数の段階を踏んでいましたが、S2Sモデルはこの流れを一体化することで、より自然な間合いや抑揚での応答を目指しています。

ベンチマークべんちまーく」とは、AIモデルの性能を、あらかじめ決められた共通のテスト問題や評価基準で数値化し、他のモデルと比較できるようにする仕組みです。今回登場したArtificial Analysisの「Speech to Speech Index」も、複数のAI企業の音声対話モデルを同じ条件で比較するためのベンチマークの1つです。ベンチマークのスコアは開発企業とは独立した第三者機関が算出しているかどうかで信頼性が変わるため、どの評価機関によるものかを確認する視点が役立ちます。

IT Postの見方――「相槌を打ちながら考える」は、地味だけど効く一手

IT Postでは、今回の発表で最も注目すべきは、派手な新機能そのものよりも「待たされている感覚をどう減らすか」という、ユーザー体験の細部に手を入れてきた点だと考えます。

*音声AIの完成度は、賢さよりも「間の悪さ」で判断されることが多い。*どれだけ優れた回答を返せても、答えが出るまでの数秒間の気まずい沈黙で「使えない」という印象がついてしまうのが音声インターフェースの怖いところだ。今回Googleが力を入れた「考えながら相槌を打つ」設計は、ベンチマークの数字上位という宣伝文句よりも、実際に日々の会話で「ストレスが少ない」と感じられるかどうかで真価が問われるとIT Postでは考えます。Gmail・Keep・Docsといった仕事道具への組み込みが進むほど、この「間合い」の出来が業務効率に直結する場面も増えていくはずです。※個人の感想です

今後どうなりそうか

Googleは、Extended ThinkingのWorkspace(Docs)への組み込みを、現時点でGoogle AI Pro・Ultra契約者向けに限定しており、今後より幅広いプランへ対象が広がるかどうかは、今回参照した情報源の中では明らかにされていません。OpenAIやxAIなど競合各社も音声対話モデルの改良を続けており、Speech to Speech Indexの首位争いは今後も入れ替わりが予想されます。IT Postでは、日本語での対応状況や、Extended Thinkingの提供プランの広がりについて新たな情報があれば、あらためて取り上げます。

情報源

この記事を共有する

用語辞典へ