IT Post

by Rice Studio Lab


記事を検索
文字サイズ
ふりがな
AI・生成AI

MiniMax「Music 3」、歌詞から5分の完成曲を一発生成 中国発オープン音楽AIがついに本気を出してきた

歌詞と指示文だけで作詞・作曲・演奏・ミックスまで済ませる音楽生成AIをMiniMaxが公開。オープンウェイトでの提供と、日本語ボーカルの完成度を確かめた

30秒で分かる結論

中国のAI企業MiniMaxは2026年8月13日から14日にかけて、音楽生成AI「MiniMax Music 3」を公開しました。歌詞(VerseやChorusといった構成タグ付き)と、曲の雰囲気・ボーカル・楽器編成を説明する「構造化キャプション」の2つを入力するだけで、最大5分間の完成した楽曲を一度の生成で作り上げます。作詞・作曲だけでなく、演奏・ミックスまでを一括して行う設計で、日本語の歌唱を含む複数言語のボーカル生成にも対応しています。モデルの重みはHugging FaceとGitHubで無料公開されており、商用利用も可能なライセンスですが、年間売上高2,000万ドルを超える企業が利用する場合は別途許諾が必要です。有償のAPIも用意されていましたが、2026年8月20日以降は新規ユーザー向けの提供を終了しています。前身にあたる「MiniMax Music 2.6」から続くシリーズの最新版という位置づけで、MiniMax自身は動画生成・画像生成・音声合成など、音楽以外の分野でもオープンウェイトモデルを相次いで公開してきた実績があり、生成AIの複数分野を横断的に手掛ける企業として、開発者コミュニティでの知名度を着実に高めてきています。今回の音楽モデルも、こうした一連の公開戦略の延長線上にある取り組みと位置づけられます。

この記事の目次 7項目
出典を確認する(4件)
記事のテーマを表した生成イメージ
生成AIによるイメージ。実物や実際の画面ではありません。

まず初めに

結論から言う。歌詞とちょっとした指示文を放り込むだけで、5分間の完パケ楽曲がポンと出てくる時代がついに来た。しかも中国発、しかもオープンウェイトという太っ腹っぷり。作曲家やミュージシャンからすれば穏やかではいられない話だが、日本語ロックのデモが「ちゃんと日本語ロックに聞こえる」という完成度の高さは正直あなどれない。ただし太っ腹な無料公開の裏で、有償APIの新規受付は早々に締め切られており、「無料で遊ばせてから本命は別ルートへ誘導する」という商売っ気もしっかり見え隠れしている。5分間の完パケ楽曲がタダで手に入る時代に、街のスタジオでせっせと打ち込み作業をしていた人たちは、少しばかり複雑な気持ちになっているに違いない。※個人の感想です

何が起きているのか

MiniMaxは2026年8月13日から14日にかけて、音楽生成モデル「MiniMax Music 3」をオープンウェイトとして公開しました。入力は、Verse(Aメロ)やChorus(サビ)といった構成タグを付けた歌詞と、曲のスタイル・雰囲気・ボーカルの特徴・楽器編成を言葉で説明する「構造化キャプション」の2つです。この2つの入力から、作詞・作曲・編曲・演奏・混合こんごう(ミックス)までを一度の生成でまとめて行い、最大5分間の完成した楽曲を出力します。

AIを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

技術的には、曲全体の長期的な構成を担う80億パラメータの大規模言語モデルと、フレーム単位の音響の細部を担う6億パラメータの小規模言語モデル、そして連続れんぞく的な音声合成を行う仕組みを組み合わせた構成になっています。公開時のデモでは、日本語の歌詞を使ったロック楽曲が生成されており、言語をまたいだ歌唱表現にも力を入れていることがうかがえます。楽器の演奏音についても、実際に演奏しているかのような物理的な質感の再現に力を入れているとされ、単に音を並べるだけでなく、演奏者が意図を込めて音を出しているような表現の持続を重視した設計だと説明されています。ボーカルについても、合成音声特有の平坦さを避け、人間が実際に歌唱しているかのような抑揚や息づかいを再現することに重点が置かれており、従来の音楽生成AIでしばしば課題とされてきた「機械的に聞こえる歌声」からの脱却を狙った設計だとされています。

有償のAPIも当初は用意されており、1曲(最大5分)あたり0.15ドルという価格や、1分間に3回までの利用に制限された無料の入り口(music-3.0-free)も提供されていました。ただし、2026年8月20日以降はこれらの有償・無料APIともに新規ユーザー向けの提供を終了し、既存の有料契約者のみが引き続き利用できる形に切り替わっています。このほか、外部のクラウドコンピューティング基盤「Sogni Supernet」経由でも、1曲あたり約0.26ドル、または月額固定料金での使い放題プランとして利用できる仕組みが用意されており、MiniMax自身のAPI以外にも選択肢が広がっています。

なぜ重要なのか

今回の公開が重要なのは、作詞から演奏・ミックスまでを一つのモデルで完結させる音楽生成AIが、無料で誰でも利用できる形で登場した点です。これまでの音楽生成AIの多くは、メロディーだけ、伴奏だけ、といった部分的な生成にとどまるか、有償のクラウドサービスとしてのみ提供されるケースが中心でした。MiniMax Music 3のように、重みファイル自体が公開され、自分のパソコンやサーバー上で動かせるようになると、音楽制作の裾野を広げる一方で、著作権や収益分配をめぐる議論も一段と現実味を帯びてきます。

商用利用のライセンス条件として、製品の利用者インターフェース上に「MiniMax-Music3」の名称を明示することが求められ、年間売上高が2,000万ドルを超える事業者は別途MiniMaxからの書面による許諾が必要とされている点も、実務で導入を検討する企業にとっては見逃せない条件です。「元・白物家電の王国」だった中国のAI企業が、音楽という文化的な創作領域にまで無償のオープンウェイトモデルを持ち込んできたことは、テキストや画像の生成AIで先行していたオープン化の流れが、音楽制作の現場にも本格的に及び始めたことを示しています。これまで音楽生成AIの分野では、SunoやUdioといった有償クラウドサービスが先行して知名度を高めてきましたが、そこにオープンウェイトかつ無料で使える選択肢が加わったことで、利用者の選択肢は一段と広がりました。

私たちへの影響

AIを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

動画配信やSNS投稿用のBGMを自作したい個人クリエイターにとっては、著作権フリーの楽曲を、歌詞のイメージを伝えるだけで手早く用意できる選択肢が増えたことになります。これまで既存の音源を利用する際に気を配る必要があった著作権使用料や利用許諾の手続きを省ける点は、小規模な制作者にとって実務上のハードルを大きく下げる変化です。一方で、生成された楽曲を商用利用する場合は、ライセンス条件(表示義務や売上規模による許諾条件)を事前に確認しておく必要があります。既存のアーティストや作曲家、レコード会社にとっては、無料で高品質な楽曲が量産される状況が、音楽制作という職業そのものの価値や、著作権使用料の分配のあり方に影響を及ぼしかねない点も、今後の議論の対象になりそうです。教育現場や個人の学習用途でも、著作権を気にせずに使えるBGMを手軽に用意できる点は、動画授業やプレゼン資料づくりの負担を減らす実用的な変化と言えるでしょう。

有償APIについては、2026年8月20日以降、新規ユーザー向けの申し込みが停止されており、既存の有料契約者のみが引き続き利用できる状態です。これから音楽生成AIを試したい人は、オープンウェイト版をHugging Face上で試すか、MiniMax自身が提供する「MiniMax Audio」サービスを確認するのが現実的な選択肢になります。なお、Hugging Face上には無料のデモ環境(Spaces)も用意されているため、専門的な知識がなくても、ブラウザ上でどの程度の楽曲が作れるかを試しに確認することができます。

初心者が知っておくべきこと

「オープンウェイト」とは、AIモデルの学習済みデータ(重み)が公開され、誰でもダウンロードして自分の環境で動かせる状態のことです。音楽生成AIの分野でも、クラウドサービスとしてだけでなく、自分のパソコンで動かせるオープンウェイト版が増えてきています。

「ミックス」とは、複数の楽器や歌声の音量・音質バランスを調整して、一つの完成された楽曲としてまとめ上げる作業のことです。通常は人間のエンジニアが手作業で行う工程ですが、MiniMax Music 3はこの工程もAIが自動で担っています。

「構造化キャプション」とは、生成してほしい内容の特徴を、あらかじめ決まった形式に沿って言葉で説明する入力方法のことです。MiniMax Music 3では、曲のスタイル・雰囲気・ボーカルの特徴・楽器編成などを構造化キャプションとして与えることで、あいまいな指示よりも狙った通りの楽曲を安定して生成しやすくなるとされています。

「大規模言語モデル(LLM)」とは、大量の文章データを学習することで、人間の言葉を理解したり生成したりできるようになったAIモデルの総称です。MiniMax Music 3では、曲全体の長期的な構成を担う部分に、この大規模言語モデルの技術が応用されています。文章を扱う技術がそのまま音楽という別の表現形式に応用されている点は、AI技術が特定の分野に閉じず、応用範囲を広げ続けていることを示す一例と言えます。

IT Postの見方

IT Postでは、歌詞さえあれば誰でも完成度の高い楽曲を作れるようになる技術的な進歩自体は、音楽制作のハードルを下げる面白い流れだと考えます。ただし、これだけ手軽に「それっぽい曲」が量産できるようになると、既存の音楽業界で活動するアーティストや作曲家の仕事の価値をどう位置づけるかという問題は避けて通れません。オープンウェイトで無料公開しつつ、大企業には別途許諾を求めるライセンス設計は、個人利用の裾野を広げながら、大口の商用利用ではしっかり収益を確保するという、なかなか抜け目のない商売設計だとIT Postでは見ています。技術の進歩そのものを止めることはできない以上、創作の現場に関わる人たちがAIをどう使いこなすかという発想の転換の方が、現実的には求められてくるだろうとIT Postでは考えます。少なくとも、聞き手が「この曲はAIが作ったのか、人間が作ったのか」を判断する手がかりを持てるよう、生成物の由来を明示する仕組みづくりが並行して進むことを期待したいとIT Postでは考えます。※個人の感想です

今後どうなりそうか

MiniMaxは今後も、音楽生成分野での技術開発を続けていくとみられ、有償APIの提供体制を見直しつつ、オープンウェイト版のコミュニティ活用を促す戦略を取っているようです。今後、生成された楽曲の著作権の扱いや、既存の音楽配信プラットフォームでの取り扱いをめぐるルール整備が進むかどうかが、この技術が広く普及するかどうかの分かれ目になりそうです。

「元・白物家電の王国」だった中国発のAI企業が、テキストや画像に続いて音楽の分野でもオープンウェイトモデルを提示してきたことで、他の生成AI企業もこれに追随する動きを見せるかどうかが注目されます。日本国内では、音楽配信サービスがAI生成楽曲をどう扱うか、著作権を管理する団体がどのようなガイドラインを示すかといった論点が、今後具体的に問われてくることになりそうです。IT Postでは、国内での利用事例や、著作権をめぐる議論の進展が確認され次第、あらためて取り上げます。

情報源

この記事を共有する

用語辞典へ