もう少し詳しく

音声対話AIおんせいたいわえーあい(Speech to Speech AI、S2Sモデル)とは、人間の話し声を直接認識し、文字への変換を経ないまま音声のまま応答を生成するAIモデルの総称です。従来型の音声アシスタントの多くは、「音声を文字に変換する」→「文字でAIが回答を考える」→「回答を音声に変換する」という複数の段階を経て応答していましたが、音声対話AIはこの流れを1つのモデルの中で一体的に処理します。

どこで使われるか

スマートフォンの音声アシスタントや、カーナビ・スマートスピーカーの対話機能、コールセンターの自動応答システムなどで使われています。近年は、Google・OpenAI・xAIといった大手AI企業が、それぞれ専用の音声対話AIモデルを開発し、性能を競い合っています。

身近な例

スマートフォンに話しかけて予定を確認したり、調べ物をしたりする音声アシスタント機能は、身近な音声対話AIの一例です。従来型に比べて、間の取り方や相槌といった、人間同士の会話に近い自然なやり取りができる点が、近年の音声対話AIの特徴として挙げられます。

注意点

音声対話AIは、会話の内容を処理するためにサーバー側で音声データを扱う仕組みが一般的です。プライバシーに関わる内容を話す際は、利用しているサービスが音声データをどのように保存・利用しているかを確認しておくと安心です。また、AIの回答は必ずしも常に正確とは限らないため、重要な判断を音声アシスタントの回答だけに頼らないことも大切です。