30秒で分かる結論
Institute of Foundation Models(IFM)のK2 Horizonは、規模の異なるモデル群と、学習過程の透明性を打ち出したAIです。ただし、2026年9月8日時点の32Bモデルカードには「Stage1」とあり、最終チェックポイントや学習コード、データなどには今後公開するという説明が残っています。公開方針と、現時点で入手できる成果物を区別する必要があります。長い文章を扱える仕様も、その全文を正確に理解する保証ではありません。
IFMのK2 Horizonは、モデルだけでなく学習過程の公開も掲げる。ただし32BのモデルカードにはStage1と公開予定の注記。『開ける予定の扉』と『いま開いている扉』を分けて読む
Institute of Foundation Models(IFM)のK2 Horizonは、規模の異なるモデル群と、学習過程の透明性を打ち出したAIです。ただし、2026年9月8日時点の32Bモデルカードには「Stage1」とあり、最終チェックポイントや学習コード、データなどには今後公開するという説明が残っています。公開方針と、現時点で入手できる成果物を区別する必要があります。長い文章を扱える仕様も、その全文を正確に理解する保証ではありません。

AI業界の「Open」は便利な言葉だ。玄関が開いていても、窓が開いていても、とりあえず看板に書ける。こちらは台所を見たいのに、立派な玄関マットだけ見せられることもある。
K2 Horizonは、モデルの中身だけでなく、育て方まで見せる方向を掲げた。これは歓迎したい。ただし、見学会の案内と、見学できる状態は違う。「近日公開」の札がある棚を、もう全部埋まったことにして褒めるのは早い。まず現物を数えよう。※個人の感想です
IFMの発表は、一つの巨大モデルだけを扱うものではありません。小型から大型までのモデルを共通の設計や評価、運用の考え方でまとめたファミリーです。モデルの大きさを変えたときに何が変わるかを、比較しやすくする狙いがあります。
32B版は、モデルの計算に広く全体を使うDense型として説明されています。モデルカードが示す入力範囲は512K、正確には524,288トークンです。トークンはAIが文章を処理するときの単位で、日本語の一文字や一単語に固定対応するものではありません。「日本語を52万字読める」と置き換えることはできません。
また、モデルカードに掲載された評価値はStage1のものです。最終版の結果であるかのように扱ったり、今後の公開物にもそのまま同じ評価が当てはまると決めつけたりすることはできません。モデル名に同じ文字列が付いていても、どの時点の成果物を使っているかが重要です。

Hugging FaceにはK2-Horizon-32Bのリポジトリがあり、モデルカードとファイル一覧への入口が用意されています。ライセンス欄はApache-2.0です。一方、カード本文では最終チェックポイント、中間チェックポイント、学習データと手順、学習コードについて、今後公開する旨が記載されています。
なお、9月3日付の公式プレスリリースは、ウェイト、コード、データ、手法を含めてオープンだと説明しています。一方、32Bのモデルカードには将来形の記述が残っています。公式資料の表現にも差があるため、本記事では「全公開が完了した」とも「実ファイルがすべて未公開だ」とも断定せず、確認できた記述を区別しています。
ここでいうチェックポイントは、学習途中または学習後のモデルを保存したものです。途中の状態を複数比較できれば、ある能力がどの段階で変化したかを調べる材料になります。完成品だけを入手する場合とは、研究できる範囲が異なります。
ただし、データセット名がページ上に表示されていることと、必要なデータを取得して学習を再現できることも別です。名前、リンク、実ファイル、利用条件、手順がそろっているかを確認する必要があります。本記事では、学習用の全成果物をダウンロードして再学習を試したわけではありません。
公開状況は更新される可能性があります。そのため、今回の判断は9月8日に読めたモデルカードに基づくものです。「公開予定がある」という記述を、約束が守られない証拠として扱うこともしません。現時点の到達点と、今後確認する点を分けています。
入力できる量が大きければ、資料を細かく分割する手間を減らせる場合があります。しかし、文章が収まることと、必要な箇所を見落とさずに答えられることは同じではありません。情報が離れた位置にある場合や、互いに矛盾する説明がある場合には、別の評価が必要です。
たとえば、最初の章に原則があり、最後の付録に例外がある文書を考えます。全文が入力できても、例外を無視して原則だけ答えれば、利用者の目的は達成されません。入力上限は容器の大きさであり、回答の正確さは中身を扱う能力です。
運用手順にも注意が必要です。モデルカードから案内されるvLLMのレシピなどは、実行環境に応じた設定を示すものです。仕様上の最大入力長が、手元の機器でそのまま快適に使えるとは限りません。モデルを置くメモリーに加え、長い入力を処理するための作業領域も必要になります。

IT Postでは、K2 Horizonの面白さは順位表で一位を取ったかどうかより、性能が生まれる過程を検証する材料を増やそうとしている点にあると考える。完成したAIに質問を投げても、なぜその能力を持つようになったかは分からない。学習途中の状態や記録があれば、少なくとも比較できる場所が増える。
これは料理の完成写真と、材料表、調理記録の違いに近い。写真だけでも食欲は湧く。しかし、同じものを作りたい人や、特定の材料を避けたい人には、それだけでは足りない。AIでも、使ってみる人と、再現したり改良したりする人では、必要な公開範囲が異なる。
ただし、資料が大量にあれば透明性が完成するわけでもない。どのデータで、どの設定を使い、どの保存状態から結果を得たか。そのつながりを追えなければ、巨大な倉庫に段ボールを積んだだけになる。「全部ここにある。あとは頑張れ」では、開いているのは倉庫の扉だけだ。

IT Postでは、今後の確認を三段階で行うのがよいと考える。まず、公開予定とされたファイルが実際に入手できるようになったか。次に、そのファイル同士の対応が説明されているか。最後に、開発元以外が手順を追って、比較可能な結果を得られるかだ。宣言の強さと検証のしやすさを混同しないための順番である。
利用者側の評価も同じように具体化したい。社内文書の検索なら、実際の資料で根拠を示せるか。プログラミングなら、手元の課題を最後まで処理できるか。機密情報を扱うなら、許可した環境だけで運用できるか。一般的な順位表は参考になるが、自分の仕事で必要な合格条件の代わりにはならない。
IT Postでは、実際に試す開発者には、モデルの取得日だけでなく、使った版と設定を記録する意味が大きいと考える。同じ名前の公開ページでも、後からファイルや推奨設定が変わる可能性がある。昨日できた処理が今日違う結果になったとき、何を変えたのか追えなければ、比較の出発点を失う。
特に今回はStage1という段階が示されている。最終版が出たら、以前の評価を上書きして終わりにせず、同じ課題でどこが改善し、どこが変わったかを見たい。性能の上昇だけでなく、出力形式や道具の呼び出し方の変化も、組み込む側には影響する。
これは一般利用者にも無関係ではない。会社の業務AIがモデルを切り替えたとき、担当者が気付かないうちに回答の前提まで変わると困る。公開物の豊富さが、更新を説明する材料として活用されるなら、研究の透明性は運用の分かりやすさにもつながる。開いている資料を、実際に管理へ使える形にすることが次の課題だ。
オープンな選択肢を応援することと、確認を甘くすることは両立しない。むしろ期待するから、公開予定の棚も正確に数える。K2 Horizonに求めたいのは、強い形容詞の追加ではなく、第三者が追試できる材料の積み上げだ。それが進めば、「どこがOpenなんだ」という問いに、看板ではなく現物で答えられる。
アモディ、マスク、アルトマンのお家騒動はもうこりごりだ。CursorへのOpenAIモデル供給終了方針とWindsurfの前例から、利用者に回る移行の負担を問う
Google DeepMindが2026年9月8日、ヒトDNAに起こりうる一塩基変異90億通り全てについて影響を予測した無償データベース「AlphaGenome Atlas」を公開。データ量は約1ペタバイトでAlphaFold DBの30倍、臨床用途は非承認という現在地を確かめた
Anthropicが2026年9月10日、Alibaba・Moonshot AI・DeepSeekなど中国拠点のAI企業がClaudeの回答を無断で使い自社モデルを鍛えていたとする分析を公表。5件のキャンペーンで確認された約2億件のやり取りの中身を確かめた
DeepSeekが2026年9月10日、マルチモーダル対応の新型「V4.1 Flash」を公開。9月14日以降は上位モデル「V4 Pro」への通信も自動でV4.1 Flashへ切り替わる。値下げと性能向上の中身を確かめた