AI・生成AIアリババの新型AI「Qwen3.8-Omni-Flash」はなぜそんなに安いのか。音声・動画コスト98%減の中身を確かめる
アリババのQwenチームが2026年9月18日、音声・動画を1つのモデルで扱う新型AI「Qwen3.8-Omni-Flash」を公開。100万トークンの文脈長と大幅なコスト削減の中身を確かめた
まず初めに
*「音声を聞かせるコストが98%引き下がりました」と言われても、多くの人にとっては「そもそも音声をAIに聞かせるのにそんなにお金がかかっていたのか」という驚きの方が先に立つはずだ。*とはいえ、テキスト・画像・音声・動画をまとめて扱えるAIが、じわじわと実用レベルの値段まで降りてきているのは事実である。オープンウェイト(モデルの重み公開)ではなくクラウド経由限定という商売っ気の出し方も含めて、中国AI勢の「性能はハイエンド、値段は庶民派」路線がここでも徹底されている。※個人の感想です
何が起きているのか
Qwenチームが公開した「Qwen3.8-Omni-Flash」は、テキスト・画像・音声・動画の4種類の情報を1つのモデルで受け付ける「オムニモーダル」モデルです。単に複数の種類の情報を理解できるだけでなく、内容を理解したうえで作業の計画を立て、必要なツールを実行し、結果をまとめて提示するという、AIエージェントとしての一連の流れを意識して設計されている点が特徴だとされています。
性能面では、コンテキストウィンドウが100万トークンに対応しました。トークンとは、AIが文章を処理する際の最小単位のことで、100万トークンあれば、長い会議の音声や動画、大量の文書をひとまとめにして一度に処理できる計算になります。
もう一つの特徴が、利用コストの大幅な引き下げです。アリババの発表によれば、前世代モデル「Qwen3.5-Omni-Plus」と比較して、音声だけを入力する際の利用コストは98%以上、音声と映像を組み合わせて入力する際のコストは93%以上、それぞれ引き下げられました。動画入力についても、前世代比で約89%のコスト削減が確認されています。
性能評価の面では、29種類のベンチマーク(評価基準)の平均スコアが前世代比で26%以上向上したとされています。特に、音声・映像を扱うエージェント向けの評価やコーディング、長時間の文脈を扱うタスクでの向上幅が大きいと説明されており、個別のベンチマークでは前世代から36.5ポイント、22.3ポイントといった伸びを記録した項目もあるとされています。
なお、Qwenチームがこれまで公開してきた一部のモデルとは異なり、Qwen3.8-Omni-Flashのモデルの重み(学習結果そのもの)は公開されていません。利用にはQwenCloudやAlibaba Cloud Model Studioなど、アリババが提供するクラウドサービス経由でのアクセスが必要です。
なぜ重要なのか
音声・動画を含む複数の種類の情報を扱うAIは、これまで処理コストが高く、実用的な用途への導入がテキスト専用AIほど進んでいませんでした。今回のような大幅なコスト削減が実現すると、コールセンターの通話記録の要約や、会議動画からの議事録作成、防犯カメラ映像の内容確認といった、音声・映像を伴う業務での活用のハードルが下がることが期待されます。
また、中国のAI開発企業が、性能とコストの両面で存在感を強めている点も見逃せません。海外の主要AI企業がテキスト中心の高性能モデルの開発競争を続ける一方、Qwenチームは音声・動画を含むオムニモーダル領域でも活発に新モデルを公開しており、AI開発競争の裾野の広がりを示す事例の一つといえます。
私たちへの影響
Qwen3.8-Omni-Flash自体は、一般の消費者が直接操作するアプリというより、企業や開発者がクラウド経由で自社サービスに組み込んで使う性質のAIモデルです。そのため、一般利用者が今すぐ何かを設定したり注意したりする必要はありません。
一方で、こうした音声・動画対応AIの低コスト化が進むと、企業のカスタマーサポートや会議の議事録作成サービスなど、間接的に私たちが日常で触れるサービスの裏側で使われる可能性があります。AIが処理した音声・動画の内容に誤りが含まれる可能性は引き続きあるため、AIが生成した要約や文字起こしをそのまま鵜呑みにせず、重要な場面では人が内容を確認する姿勢は変わらず必要です。
初心者が知っておくべきこと
「オムニモーダルAI」とは、テキストだけでなく、画像・音声・動画といった複数の種類(モダリティ)の情報を、1つのAIモデルでまとめて理解・生成できるAIのことです。似た言葉に「マルチモーダルAI」がありますが、こちらは複数の種類の情報を扱えるAI全般を指す、より広い言葉として使われます。
また、AIの利用コストが「トークン単位」で計算される点も基本として押さえておくとよいでしょう。文章だけでなく、音声や動画をAIに読み込ませる場合も、内部的にはトークンに変換されて処理されるため、扱う情報量が多いほど利用コストがかさみます。今回のような処理単価の引き下げは、AIを使ったサービスの利用料金にも間接的に影響する可能性があります。
IT Postの見方――値段のインパクトはでかいが、主戦場はまだ企業の裏側
IT Postでは、音声・動画入力のコストを9割超も引き下げてきた点は、AIを使ったサービスの裾野を広げるうえで素直にインパクトが大きい進化だと考えます。
*ただし、これは私たちが直接触るチャットアプリの話ではなく、企業がクラウド経由で組み込む「裏側の部品」としての進化だという点は忘れずにいたい。*派手な発表の割に、一般利用者が体感できる変化は「気づいたらコールセンターの対応が心なしか賢くなっていた」程度にとどまるだろう。IT Postでは、性能競争と同じくらい価格競争が激しくなっているAI業界の現状は、最終的に利用者が支払うサービス料金の引き下げという形で還元されるかどうかを注視すべきだと考えます。※個人の感想です
今後どうなりそうか
Qwenチームは今回の「Qwen3.8-Omni-Flash」に続き、今後もオムニモーダル領域での新モデル公開を続けるとみられます。今回参照した情報源の中では、日本国内のクラウド事業者による提供予定や、具体的な導入事例までは明らかにされていません。IT Postでは、新しい情報が確認され次第あらためて取り上げます。