中国のAI企業MiniMaxは2026年8月13日から14日にかけて、音楽生成AI「MiniMax Music 3」を公開しました。歌詞(VerseやChorusといった構成タグ付き)と、曲の雰囲気・ボーカル・楽器編成を説明する「構造化キャプション」の2つを入力するだけで、最大5分間の完成した楽曲を一度の生成で作り上げます。作詞・作曲だけでなく、演奏・ミックスまでを一括して行う設計で、日本語の歌唱を含む複数言語のボーカル生成にも対応しています。モデルの重みはHugging FaceとGitHubで無料公開されており、商用利用も可能なライセンスですが、年間売上高2,000万ドルを超える企業が利用する場合は別途許諾が必要です。有償のAPIも用意されていましたが、2026年8月20日以降は新規ユーザー向けの提供を終了しています。前身にあたる「MiniMax Music 2.6」から続くシリーズの最新版という位置づけで、MiniMax自身は動画生成・画像生成・音声合成など、音楽以外の分野でもオープンウェイトモデルを相次いで公開してきた実績があり、生成AIの複数分野を横断的に手掛ける企業として、開発者コミュニティでの知名度を着実に高めてきています。今回の音楽モデルも、こうした一連の公開戦略の延長線上にある取り組みと位置づけられます。
MiniMaxは2026年8月13日から14日にかけて、音楽生成モデル「MiniMax Music 3」をオープンウェイトとして公開しました。入力は、Verse(Aメロ)やChorus(サビ)といった構成タグを付けた歌詞と、曲のスタイル・雰囲気・ボーカルの特徴・楽器編成を言葉で説明する「構造化キャプション」の2つです。この2つの入力から、作詞・作曲・編曲・演奏・混合(ミックス)までを一度の生成でまとめて行い、最大5分間の完成した楽曲を出力します。
今回の公開が重要なのは、作詞から演奏・ミックスまでを一つのモデルで完結させる音楽生成AIが、無料で誰でも利用できる形で登場した点です。これまでの音楽生成AIの多くは、メロディーだけ、伴奏だけ、といった部分的な生成にとどまるか、有償のクラウドサービスとしてのみ提供されるケースが中心でした。MiniMax Music 3のように、重みファイル自体が公開され、自分のパソコンやサーバー上で動かせるようになると、音楽制作の裾野を広げる一方で、著作権や収益分配をめぐる議論も一段と現実味を帯びてきます。
「ミックス」とは、複数の楽器や歌声の音量・音質バランスを調整して、一つの完成された楽曲としてまとめ上げる作業のことです。通常は人間のエンジニアが手作業で行う工程ですが、MiniMax Music 3はこの工程もAIが自動で担っています。
「構造化キャプション」とは、生成してほしい内容の特徴を、あらかじめ決まった形式に沿って言葉で説明する入力方法のことです。MiniMax Music 3では、曲のスタイル・雰囲気・ボーカルの特徴・楽器編成などを構造化キャプションとして与えることで、あいまいな指示よりも狙った通りの楽曲を安定して生成しやすくなるとされています。
「大規模言語モデル(LLM)」とは、大量の文章データを学習することで、人間の言葉を理解したり生成したりできるようになったAIモデルの総称です。MiniMax Music 3では、曲全体の長期的な構成を担う部分に、この大規模言語モデルの技術が応用されています。文章を扱う技術がそのまま音楽という別の表現形式に応用されている点は、AI技術が特定の分野に閉じず、応用範囲を広げ続けていることを示す一例と言えます。
IT Postの見方
IT Postでは、歌詞さえあれば誰でも完成度の高い楽曲を作れるようになる技術的な進歩自体は、音楽制作のハードルを下げる面白い流れだと考えます。ただし、これだけ手軽に「それっぽい曲」が量産できるようになると、既存の音楽業界で活動するアーティストや作曲家の仕事の価値をどう位置づけるかという問題は避けて通れません。オープンウェイトで無料公開しつつ、大企業には別途許諾を求めるライセンス設計は、個人利用の裾野を広げながら、大口の商用利用ではしっかり収益を確保するという、なかなか抜け目のない商売設計だとIT Postでは見ています。技術の進歩そのものを止めることはできない以上、創作の現場に関わる人たちがAIをどう使いこなすかという発想の転換の方が、現実的には求められてくるだろうとIT Postでは考えます。少なくとも、聞き手が「この曲はAIが作ったのか、人間が作ったのか」を判断する手がかりを持てるよう、生成物の由来を明示する仕組みづくりが並行して進むことを期待したいとIT Postでは考えます。※個人の感想です