AI・生成AIアブダビの研究機関が「史上最大のフルオープンAI」を掲げた。学習データもまるごと公開するK2 Horizonの中身を確かめる
アラブ首長国連邦MBZUAI傘下のIFMが2026年9月3日、重み・コード・学習データまで公開する6モデル「K2 Horizon」を発表。0.9B〜375Bの規模と、実際にはまだ全て揃っていない公開範囲の実態を確かめた
まず初めに
*「世界最大のフルオープンAI」と胸を張って発表しておきながら、目玉のはずの大型モデルの中身は「近日公開」——これではまるで、盛大なオープニングセレモニーをやったのに、肝心の建物の内装はまだ工事中というようなものだ。*言っていることは立派だし、方向性そのものは歓迎したい。だが「フルオープン」を名乗るなら、看板を掲げる前に中まで見せてほしいというのが、正直な感想である。※個人の感想です
何が起きているのか
Institute of Foundation Models(IFM)は、MBZUAIが2025年5月に設立した研究機関で、アブダビ・シリコンバレー・パリに拠点を持ちます。IFMは2026年9月3日、新しいAIモデル群「K2 Horizon(ケーツー・ホライズン)」を発表しました。
K2 Horizonは6種類のモデルで構成されています。内訳は、単一の構造で動く「密モデル」が0.9B・3.7B・7B・32Bの4種類、複数の専門部分を組み合わせて動く「MoE(専門家混合)」構造のモデルが36B-A4B(総パラメータ360億のうち、実際に動くのは40億)と375B-A23B(総パラメータ3750億のうち、実際に動くのは230億)の2種類です。IFMは、すべてのモデルと関連コードをApache 2.0という商用利用も可能な緩やかなライセンスのもとで公開すると発表しました。
利用面では、発表と同時に推論用ソフトウェアの「vLLM」「SGLang」「Ollama」に対応し、軽量な実行形式「GGUF」のビルドも用意されています。対応するハードウェアも、NVIDIA・AMD・Cerebrasの各社製品にまたがるとしています。
なぜ重要なのか
今回の発表で強調されているのは、単にモデルの重み(パラメータ)を公開するだけでなく、学習に使ったデータや、学習の手順そのもの(レシピ)、学習過程の途中経過(中間チェックポイント)まで含めて公開するという方針です。IFM側はこれを「史上最大の完全オープンAIモデル群」と位置づけています。
ただし、実際の公開状況にはモデルごとに差があります。比較的小さい3.7Bと7Bについては、学習データ・レシピ・コードまで含めて現時点で公開済みです。一方、目玉となる大型モデルの375B-A23Bと36B-A4Bは、モデルの説明資料(モデルカード)の中で、中間チェックポイントや学習データ・学習コードを「今後公開予定」としており、本稿執筆時点ではまだ揃っていません。32Bについても、最終版ではなく「第1段階(Stage 1)」のチェックポイントとして公開されている状態です。つまり「フルオープン」という看板と、実際に今すぐ手に入る中身の間には、現時点でまだ差があります。
性能面では、0.9B・3.7B・7Bの3モデルについて、それぞれの規模クラス(同程度のパラメータ数を持つ他社モデル)の中で最高水準の性能を達成したとIFMは説明しています。ただし、これはIFM自身による発表であり、第三者による独立した検証結果ではない点には注意が必要です。
私たちへの影響
一般の利用者がK2 Horizonを直接使う場面は多くありませんが、AIモデルを開発・研究する立場の人にとっては意味のある選択肢が増えることになります。学習データや学習手順まで公開されたモデルは、なぜそのような回答をするのかを追跡したり、特定の用途向けに手を加えたりする際の透明性が高く、研究用途や、独自のAIを作りたい企業にとって参考になります。
一方で、前述のとおり大型モデルの中身がまだ完全には揃っていないため、現時点でK2 Horizonの「フルオープン」という触れ込みを鵜呑みにして評価するのは早計です。今後、約束されている中間チェックポイントや学習データが実際に公開されるかどうかを見届ける必要があります。
初心者が知っておくべきこと
「オープンウェイト」とは、AIモデルの中身である無数の数値(パラメータ、重み)を誰でもダウンロードできる形で公開することを指します。ただし、重みだけを公開する場合と、今回のK2 Horizonのように学習データや学習コードまで公開する場合とでは、公開の度合いに大きな差があります。学習データまで公開されていれば、そのモデルがどんな情報をもとに学習したのかを第三者が確認できますが、重みだけの公開ではそこまでは分かりません。
「MoE(専門家混合)」は、1つの巨大なAIがすべての計算を担当するのではなく、内部にある複数の「専門家」と呼ばれる部分的なモデルのうち、質問の内容に応じて一部だけを選んで動かす設計です。総パラメータ数(モデル全体の大きさ)と、実際に1回の計算で動く「有効パラメータ数」が異なるのが特徴で、K2 Horizonの375B-A23Bでいえば、モデル全体は3750億パラメータありますが、1回の計算で実際に働くのは230億パラメータ分だけです。これにより、大きなモデルの性能を保ちながら、計算コストを抑えることができます。
IT Postの見方――「全部見せます」を名乗るなら、看板より先に中身を揃えてほしい
IT Postでは、K2 Horizonのように学習データや学習手順まで公開しようとする姿勢そのものは評価したいと考える。
*ただ、レストランの看板に「全メニュー原価公開!」と大きく書いておきながら、実際にレジで聞いたら「人気メニューの原価表は近日公開予定です」と言われたら、多くの客は拍子抜けするはずだ。*今回の発表も、小型モデルの中身はきちんと出しているものの、目玉であるはずの375Bクラスの大型モデルほど「今後公開予定」が多く残っている。IT Postでは、この手の「フルオープン」という言葉は、発表時点でのマーケティング文句としてではなく、実際に約束された中間チェックポイントや学習データがどこまで期限内に出そろうかで、最終的に評価されるべきだと考える。看板の掲げ方がうまいことと、中身がちゃんと伴っていることは別問題である。※個人の感想です
生成AIによるイメージ。実物や実際の画面ではありません。
今後どうなりそうか
IFMは、375B-A23Bと36B-A4Bの中間チェックポイントや学習データ、32Bの最終版チェックポイントを今後順次公開するとしています。IT Postでは、これらが実際に予定通り公開されるか、また公開後に外部の研究者らによる独立した性能検証が行われるかを、続報があらためて取り上げます。