もう少し詳しく

マルチモーダルAIまるちもーだるえーあいとは、文章(テキスト)、画像、音声、動画といった、性質の異なる複数の種類(モード)の情報を、単独ではなくあわせて理解したり、生成したりできるAIのことです。従来のAIモデルの多くは、文章なら文章、画像なら画像というように、扱える情報の種類が限られていましたが、マルチモーダルAIは、これらを組み合わせた入力や出力に対応します。

どこで使われるか

写真や図表を見せて内容について質問できるAIアシスタントや、動画の内容を要約するサービス、音声での指示に応じて画像を生成するアプリなど、複数の情報の種類を横断する場面で活用されています。近年発表される主要なAIモデルの多くが、マルチモーダル対応を標準的な機能として備えるようになっています。

身近な例

スマートフォンのカメラで写した料理の写真をAIアシスタントに見せて、「このカロリーはどのくらい?」と尋ねると、写真の内容を認識したうえで答えてくれる、といった使い方が代表的です。手書きのメモを撮影して、その場でテキストデータに変換してもらう用途にも使われています。

注意点

マルチモーダルAIは便利な一方、画像や音声から個人を特定できる情報を読み取ってしまう可能性もあるため、写真や動画をAIサービスにアップロードする際には、写り込んでいる情報に注意を払うことが大切です。