IT Post

by Rice Studio Lab


記事を検索
文字サイズ
ふりがな
AI・生成AI

オープンソースAI「Ornith-1.5」、ベンチマークでClaude Opus 4.8に4勝 難関の最前線ではまだ届かず

397Bパラメータの無料モデルがTerminal-Bench・SWE-bench等で商用トップモデルに肉薄、しかし本当に難しい課題では大差――自己改善ループで学習する新型オープンAIの実力を数字で確認

【関連解説・2026年9月7日追加】手元のPCで試したい人向けに、Ornith 1.5の9Bファイル容量と必要メモリーの見方LM Studioのオフライン利用と通信範囲を追加しました。公式仕様に基づく解説で、実機の性能測定ではありません。

30秒で分かる結論

米国の研究チーム「DeepReinforce」は2026年8月19日、オープンソースの大規模言語モデル「Ornith-1.5」を公開しました。397B(3970億)パラメータの最上位モデルを筆頭に、35B・9Bの3サイズを展開し、いずれもMITライセンスで商用利用も含めて無料公開されています。最大の特徴は、人間が用意した課題ではなく、モデル自身が新しい学習課題を考え、その課題を解くための手順(スキャフォールド)を作り、強化学習用のデータまで生成する「自己改善ループ」で訓練されている点です。397Bモデルはコーディング系ベンチマークの一部でAnthropicの商用モデル「Claude Opus 4.8」と同等かそれ以上のスコアを記録した一方、より難易度の高いベンチマークでは大きく水をあけられており、得意分野と苦手分野がはっきり分かれる結果となっています。

この記事の目次 7項目
出典を確認する(5件)
記事のテーマを表した生成イメージ
生成AIによるイメージ。実物や実際の画面ではありません。

まず初めに

「Claude Opus 4.8に勝った」なんて景気のいい見出しが世界中に踊ったが、じっくり数字を見ると話はそう単純じゃない。得意なテストだけ持ってきて「同点かちょい勝ち」と胸を張るのは、模試の一番できた科目だけを親に見せる子供と同じ手口だ。本当に難しい問題(Frontier-Bench、NL2Repo)を出した途端、Ornith-1.5はOpusに大差で置いていかれている。無料で公開してくれたことには拍手を送りたいが、比較表の見せ方だけは、いっぱしの営業マン顔負けの巧さである。※個人の感想です

何が起きているのか

DeepReinforceは、強化学習きょうかがくしゅうと自然言語処理の研究を専門とする研究チームです。創業者のジウェイ・リー氏はスタンフォード大学でコンピュータサイエンスの博士号を取得し、「MIT Technology Review」誌の「35歳未満のイノベーター」にも選出された人物で、以前にはNLPスタートアップ「Shannon.AI」を創業した経歴を持ちます。同チームは2026年6月、自ら課題ごとの実行手順を組み立てる「自己スキャフォールディング」という手法を採用した最初のモデル「Ornith-1.0」を公開しており、今回の「Ornith-1.5」はその後継にあたります。

ネットワークとAIを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

Ornith-1.5は、397B(混合専門家こんごうせんもんか型、MoE)、35B(MoE)、9B(密結合型)という3つの規模で提供されます。最上位の397Bモデルはbf16形式で約800GBのサイズがあり、動かすには高性能GPUを8基連携させる環境が必要になるなど、一般の利用者が手元のパソコンで動かせる代物ではありません。一方で最小の9Bモデルは量子化した軽量版がスマートフォン上でも動作するとされており、規模に応じて用途を分けられる設計になっています。すべてのモデルの重み(オープンウェイトおーぷんうぇいと)はHugging Face上でMITライセンスにより公開されており、企業が自社サービスに組み込むことも自由です。

なぜ重要なのか

Ornith-1.5最大のポイントは、訓練方法そのものにあります。従来の大規模言語モデルだいきぼげんごもでる(LLM)の多くは、人間が用意した問題集や作業手順(スキャフォールド)を土台に訓練されます。これに対しOrnith-1.5は、「現在の実力より少し難しい課題を自分で考え出す→その課題を解く手順を自分で組み立てる→実際に解いてみた結果を強化学習の材料にする」という一連のサイクルを、モデル自身が繰り返しながら性能を伸ばしていきます。難易度は「経験的な成功率が2割程度になる課題」を目安に自動調整されるとされ、人手による問題作成のボトルネックを減らす狙いがあるとみられます。

397Bモデルは、ソフトウェア開発の実務に近いベンチマークで存在感を示しました。ターミナル操作を評価する「Terminal-Bench 2.1」で86.1点(Claude Opus 4.8は85.0点)、実際のGitHub上のバグ修正課題を使う「SWE-bench Verified」で86点(同85.8点)、Web上の情報収集能力を測る「WideSearch」で80.8点(同72.9点)、「BrowseComp」で86.6点(同84.3点)と、いずれもOpus 4.8と同等かわずかに上回るスコアを記録しています。

一方で、より難易度の高いベンチマークでは差が開きます。自律的なソフトウェア開発力を測る「DeepSWE」は56.0点(同59.0点)、未知のリポジトリを扱う「NL2Repo」は59.5点(同69.7点)、さらに難しい実務課題を集めた「Frontier-Bench v0.1」では13.5点(同21.1点)と、いずれもOpus 4.8に大きく水をあけられました。前身のOrnith-1.0からDeepSWEのスコアが8点から56点へ大幅に伸びている点は成長の速さを示していますが、現状では「定型的なタスクは得意、未知の難問はまだ苦手」という傾向がはっきり出ています。

グラフを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

オープンソースであることの意味

397Bという規模のモデルが、商用トップクラスのモデルと同じ土俵で比較できるスコアを一部で出し、しかも無料で重みを公開したという点は、AI業界にとって軽視できない出来事です。これまで最先端の性能は、OpenAIやAnthropic、Googleといった大手が有料APIとして提供する商用モデルの専売特許という側面が強くありました。オープンソースのモデルが、限定的とはいえ商用トップモデルと張り合えるスコアを出したことは、企業が自社サーバー内でデータを外部に出さずに高性能なAIを動かしたい、というニーズに応える選択肢が増えたことを意味します。ただし397Bモデルを実際に動かすには高性能GPUを複数台そろえる必要があり、個人が気軽に試せる規模ではない点には注意が必要です。

初心者が知っておくべきこと

オープンウェイトおーぷんうぇいと」とは、AIモデルの中身である数値データ(重み)そのものを公開し、誰でもダウンロードして自分の環境で動かせるようにする公開方式のことです。OpenAIのChatGPTやAnthropicのClaudeのように、企業がサーバー上でモデルを動かし、利用者はAPIやアプリ経由でしか使えない「クローズドモデル」と対をなす概念です。

混合専門家こんごうせんもんか(MoE)」とは、1つの巨大なモデルの内部に、それぞれ得意分野が異なる複数の小さな「専門家」ネットワークを持たせ、入力内容に応じて必要な専門家だけを呼び出して計算する仕組みのことです。397B全体を毎回すべて計算するわけではないため、規模の割に計算コストを抑えられるという利点があります。

「ベンチマーク」とは、AIモデルの性能を客観的に比較するための標準化されたテストのことです。今回登場した「Terminal-Bench」はパソコンの操作、「SWE-bench」は実際のソフトウェアのバグ修正といったように、それぞれ異なる実務能力を測るよう設計されています。1つのベンチマークのスコアだけでモデル全体の実力を判断せず、複数のベンチマークを見比べることが大切です。

IT Postの見方

IT Postでは、Ornith-1.5がオープンソースの技術水準を確かに押し上げた成果だと評価します。ただし、公開直後から世界中に広まった「Claude Opus 4.8に勝った」という触れ込みは、都合のいいベンチマークだけを並べた「いいとこ取り」だというのがIT Postの見方です。本当に難易度の高いFrontier-Bench・NL2Repoでの大差負けを見れば、まだ商用トップモデルの背中は遠いというのが実態でしょう。とはいえ、後発の無料モデルが半年でDeepSWEのスコアを8点から56点まで伸ばした事実は素直に評価に値します。この伸び方が今後も続くなら、次のバージョンで本当に肩を並べる日も遠くないかもしれない、とIT Postでは考えます。派手な見出しに踊らされず、自分の用途に必要なベンチマークがどれかを見極めて評価してほしいというのがIT Postからの助言です。※個人の感想です

今後どうなりそうか

DeepReinforceは今後もOrnith系列のモデルを継続的に公開していくとみられ、次のバージョンでFrontier-Bench・NL2Repoのような難関ベンチマークの差がどこまで縮まるかが注目点になります。オープンソースモデルが商用トップモデルに一部で並んだことで、他の研究チームも同様の「自己改善ループ」を使った訓練手法を追随してくる可能性があります。IT Postでは、Ornith-1.5の実務での採用事例や、後継モデルの発表があり次第、あらためて取り上げます。

情報源

この記事を共有する

用語辞典へ