30秒で分かる結論
NVIDIAの研究チームが公開したSol-H3では、MiniMax-H3による音声付き5秒動画を、B300 GPUを8基使って1.653秒で生成したと報告しています。2026年9月8日時点の公開資料で確認できる値です。モデルの読み込みや最終的なMP4ファイルへの変換は計測に含みません。また、比較対象から生成工程や近似処理の条件も変わっており、同じ画質を保ったまま実行ソフトだけで高速化したという結果ではありません。
NVIDIA研究チームのSol-H3が、音声付き動画で再生時間を下回る生成速度を報告。GPU台数、計測から除いた工程、画質との交換条件まで読むと、数字の本当の面白さが見えてくる
NVIDIAの研究チームが公開したSol-H3では、MiniMax-H3による音声付き5秒動画を、B300 GPUを8基使って1.653秒で生成したと報告しています。2026年9月8日時点の公開資料で確認できる値です。モデルの読み込みや最終的なMP4ファイルへの変換は計測に含みません。また、比較対象から生成工程や近似処理の条件も変わっており、同じ画質を保ったまま実行ソフトだけで高速化したという結果ではありません。

動画が再生されるより早く動画を作る。これは素直に面白い。待ち時間に入れたコーヒーが、まだ粉のまま仕事が戻ってくる世界だ。
ただし、小さな文字で「B300を8基」と書いてある。自宅のパソコンに新しいソフトを入れたら突然この速度になる、という話ではない。軽自動車で出せる速度かと思ったら、測定会場にレーシングチームが来ていた。それでも技術の価値は消えない。大事なのは、何を積んで、何を省いて、そのタイムを出したのかだ。※個人の感想です
Sol-H3はNVIDIA ResearchのEfficient AI TeamとSingapore Labによる推論用の仕組みです。学習済みのモデルを使って出力を作る処理を推論と呼びます。公開コードでは、文章から動画を作る処理、最初の画像から作る処理、参照情報から動画と音声を作る処理が用意されています。
公開された文章入力の測定は、1344×768の映像、毎秒24フレーム、ステレオ音声という条件です。8基のB300では5秒出力が1.653秒、10秒出力が3.732秒、15秒出力が6.612秒でした。一方、B300が1基の場合、5秒出力には13.745秒かかっています。
この違いからも、「Sol-H3はいつでも再生時間より速い」と一般化することはできません。処理を分担するGPUの台数が結果に影響しています。測定は準備運転の後に3回行い、その中央値を示しています。利用者が初めて起動した直後の待ち時間を測った数字ではありません。

今回の計測には、入力した文章を処理する工程、映像や音声を作る主要な計算、出力を復元する処理が含まれます。一方で、モデルの読み込み、コンパイルなどの準備、最終MP4への変換は対象外です。単にGPUの一部分だけを測った値ではありませんが、利用者がボタンを押して保存済みファイルを受け取るまでの全時間でもありません。
この区別は、動画生成に限らず性能測定を読むうえで重要です。たとえば料理の「調理時間」が、冷蔵庫から材料を出すところからなのか、下ごしらえ済みの材料を火にかけてからなのかで、実際の待ち時間は変わります。測定の始点と終点をそろえなければ、数字だけを比較できません。
オンラインサービスとして利用するときには、さらに通信や順番待ちが加わる場合があります。研究用の専用環境での処理速度から、混雑したサービスの待ち時間を直接求めることはできません。公開資料の数字は、その構成で処理が到達した速度として読む必要があります。
ストップウォッチは正直でも、どこで押したかは別途確認が要る。
プロジェクトは、GPU間の通信、計算処理のまとめ方、映像の復元など、複数の工程を最適化しています。計算機は計算そのものだけでなく、データの移動にも時間を使います。細かな処理をまとめたり、受け渡す量を減らしたりすることで、全体の待ち時間を短くする考え方です。
ただし、比較表の基本モデルとSol-H3では、生成に使う反復の回数も異なります。プロジェクト側は、50ステップの基本構成と4回の主要推論処理を使う構成の比較であり、Attention処理だけの変更ではないと明記しています。GitHubの説明でも、標準の高速構成は速度を優先し、情報の損失を伴う近似を使うとしています。
したがって、速度差をそのまま「同じ仕事を、同じ結果のまま何倍も速くした」と言い換えることはできません。生成物の品質、指示への忠実さ、動きの自然さを別に評価する必要があります。コードが公開されていることと、モデルのウェイトや第三者の部品が同じ利用条件であることも別です。

IT Postでは、今回の成果で最も期待したいのは、完成映像を自動で量産することより、作る途中のやり直しを増やせることだと考える。映像を一つ作るたびに長く待つと、少し違う案を試すのが面倒になる。待ち時間が短くなれば、構図や動きの違いを見比べながら作業しやすくなる。
たとえば、商品を紹介する短い映像なら、カメラを寄せる案と引く案で印象が変わる。背景が静かな案と動く案でも、商品への視線の集まり方が違う。これは実測の導入事例ではなく、IT Postが考える利用場面だ。生成が速ければ、その比較を頭の中だけで済ませずに試せる。
ただし、速い失敗を大量に作っても、仕事が速く終わるとは限らない。必要な形を保てない、音と動きが合わない、修正したい部分だけを変えられない。こうした問題が残れば、人が確認して捨てる時間が増える。工場のベルトコンベヤーを速くしても、不良品率まで一緒に上がっては困る。

IT Postでは、実用性は一回の最速タイムだけでなく、「採用できる映像を得るまでの時間」で比べるべきだと考える。生成の速さ、成功する割合、確認の時間、修正のしやすさを合わせて初めて、制作現場での利益が見える。GPUを何基使うかも、その計算に入る。
もう一つ見たいのは、同じ設備で複数の利用者をどう扱うかだ。一人の処理を最速にする構成と、多人数の依頼を効率よく処理する構成は、同じとは限らない。研究の最速構成が、そのまま安い商用サービスになるわけではない。しかし、処理の無駄を減らす研究は、その両方を考えるための土台になる。
IT Postでは、実用比較をするなら、動きの少ない商品映像と、複雑な動きのある映像を分けたい。同じ速度が出ても、目的に使える割合が違えば評価は変わる。さらに、同じ入力を複数回試して、最も良い一例だけで判断しない。発表ページに魅力的な映像があることと、毎回同じ水準が得られることも別だからだ。
音声付きなら、映像だけを見る評価では足りない。発生する音が場面に合うか、タイミングが自然か、不要な音がないか。生成後に音を差し替える前提なら、その作業時間も含める。こうした評価項目は、今回の仕組みを疑うためではなく、速さを制作の利益へつなげるために必要になる。
また、下書きには十分な品質と、公開する完成品に必要な品質は異なる。高速な構成で案を絞り、別の処理で仕上げる使い方にも意味はある。その場合は、速い方を完成品の品質で無理に褒めず、下書きを速くする道具として評価すればよい。道具の役割が明確なら、近似処理の存在も単なる欠点ではなく、選べる条件になる。
Sol-H3は、普通のPCが突然映像工場になるという発表ではない。それでも、動画を作ってから確認するまでの間隔を縮める方向を、条件付きの数値と公開コードで示した。派手な1.653秒を楽しみつつ、その下の測定条件まで読む。そこまで読むと、このニュースはむしろ面白くなる。
OpenAIが明かしたAstraの訓練規模はGPU10万基超。巨大な計算設備と、安全性を確かめるための追加計算。AIの入口が広がる一方で、その頭脳を作る側に必要な条件を考える
NVIDIAは2026年9月22日、GPUを使うロボット開発ツール群の最新版「Isaac ROS 5.0」を発表した。世界で約130万人とするROS利用者にAIエージェント機能などを提供
英国チャールズ国王主催のAI安全性サミットで、NvidiaのフアンCEOが半導体販売量を来年2倍に見込むと発言。安全性は自分たちで判断するという立場も示した
Anthropicが2026年9月10日、Alibaba・Moonshot AI・DeepSeekなど中国拠点のAI企業がClaudeの回答を無断で使い自社モデルを鍛えていたとする分析を公表。5件のキャンペーンで確認された約2億件のやり取りの中身を確かめた