米国の研究チーム「DeepReinforce」は2026年8月19日、オープンソースの大規模言語モデル「Ornith-1.5」を公開しました。397B(3970億)パラメータの最上位モデルを筆頭に、35B・9Bの3サイズを展開し、いずれもMITライセンスで商用利用も含めて無料公開されています。最大の特徴は、人間が用意した課題ではなく、モデル自身が新しい学習課題を考え、その課題を解くための手順(スキャフォールド)を作り、強化学習用のデータまで生成する「自己改善ループ」で訓練されている点です。397Bモデルはコーディング系ベンチマークの一部でAnthropicの商用モデル「Claude Opus 4.8」と同等かそれ以上のスコアを記録した一方、より難易度の高いベンチマークでは大きく水をあけられており、得意分野と苦手分野がはっきり分かれる結果となっています。
「Claude Opus 4.8に勝った」なんて景気のいい見出しが世界中に踊ったが、じっくり数字を見ると話はそう単純じゃない。得意なテストだけ持ってきて「同点かちょい勝ち」と胸を張るのは、模試の一番できた科目だけを親に見せる子供と同じ手口だ。本当に難しい問題(Frontier-Bench、NL2Repo)を出した途端、Ornith-1.5はOpusに大差で置いていかれている。無料で公開してくれたことには拍手を送りたいが、比較表の見せ方だけは、いっぱしの営業マン顔負けの巧さである。※個人の感想です
IT Postでは、Ornith-1.5がオープンソースの技術水準を確かに押し上げた成果だと評価します。ただし、公開直後から世界中に広まった「Claude Opus 4.8に勝った」という触れ込みは、都合のいいベンチマークだけを並べた「いいとこ取り」だというのがIT Postの見方です。本当に難易度の高いFrontier-Bench・NL2Repoでの大差負けを見れば、まだ商用トップモデルの背中は遠いというのが実態でしょう。とはいえ、後発の無料モデルが半年でDeepSWEのスコアを8点から56点まで伸ばした事実は素直に評価に値します。この伸び方が今後も続くなら、次のバージョンで本当に肩を並べる日も遠くないかもしれない、とIT Postでは考えます。派手な見出しに踊らされず、自分の用途に必要なベンチマークがどれかを見極めて評価してほしいというのがIT Postからの助言です。※個人の感想です