---
title: "オープンソースAI「Ornith-1.5」、ベンチマークでClaude Opus 4.8に4勝 難関の最前線ではまだ届かず"
description: "397Bパラメータの無料モデルがTerminal-Bench・SWE-bench等で商用トップモデルに肉薄、しかし本当に難しい課題では大差――自己改善ループで学習する新型オープンAIの実力を数字で確認"
url: https://itpostjp.com/ai/ornith-1-5-open-source-model-claude-opus-rival/
category: "AI・生成AI"
published_at: 2026-08-21T09:00:00Z
updated_at: 2026-09-06T17:07:26Z
author: "IT Post編集部"
editor: "編集長 千田智也"
publisher: "IT Post by Rice Studio Lab"
language: ja-JP
ai_generated: true
ai_model: claude-sonnet-5
terms: ["MoE（専門家混合）", "オープンウェイト", "大規模言語モデル（LLM）"]
---

# オープンソースAI「Ornith-1.5」、ベンチマークでClaude Opus 4.8に4勝 難関の最前線ではまだ届かず

IT Post編集部 ＆ 編集長 千田智也

397Bパラメータの無料モデルがTerminal-Bench・SWE-bench等で商用トップモデルに肉薄、しかし本当に難しい課題では大差――自己改善ループで学習する新型オープンAIの実力を数字で確認

**【関連解説・2026年9月7日追加】手元のPCで試したい人向けに、[Ornith 1.5の9Bファイル容量と必要メモリーの見方](/ai/ornith-1-5-9b-gguf-memory-model-selection/)、[LM Studioのオフライン利用と通信範囲](/ai/lm-studio-offline-local-ai-network-boundaries/)を追加しました。公式仕様に基づく解説で、実機の性能測定ではありません。**

## 30秒で分かる結論

米国の研究チーム「DeepReinforce」は2026年8月19日、オープンソースの大規模言語モデル「Ornith-1.5」を公開しました。397B(3970億)パラメータの最上位モデルを筆頭に、35B・9Bの3サイズを展開し、いずれもMITライセンスで商用利用も含めて無料公開されています。最大の特徴は、人間が用意した課題ではなく、モデル自身が新しい学習課題を考え、その課題を解くための手順(スキャフォールド)を作り、強化学習用のデータまで生成する「自己改善ループ」で訓練されている点です。397Bモデルはコーディング系ベンチマークの一部でAnthropicの商用モデル「Claude Opus 4.8」と同等かそれ以上のスコアを記録した一方、より難易度の高いベンチマークでは大きく水をあけられており、得意分野と苦手分野がはっきり分かれる結果となっています。

## まず初めに

「Claude Opus 4.8に勝った」なんて景気のいい見出しが世界中に踊ったが、じっくり数字を見ると話はそう単純じゃない。得意なテストだけ持ってきて「同点かちょい勝ち」と胸を張るのは、模試の一番できた科目だけを親に見せる子供と同じ手口だ。本当に難しい問題(Frontier-Bench、NL2Repo)を出した途端、Ornith-1.5はOpusに大差で置いていかれている。無料で公開してくれたことには拍手を送りたいが、比較表の見せ方だけは、いっぱしの営業マン顔負けの巧さである。※個人の感想です

## 何が起きているのか

DeepReinforceは、強化学習と自然言語処理の研究を専門とする研究チームです。創業者のジウェイ・リー氏はスタンフォード大学でコンピュータサイエンスの博士号を取得し、「MIT Technology Review」誌の「35歳未満のイノベーター」にも選出された人物で、以前にはNLPスタートアップ「Shannon.AI」を創業した経歴を持ちます。同チームは2026年6月、自ら課題ごとの実行手順を組み立てる「自己スキャフォールディング」という手法を採用した最初のモデル「Ornith-1.0」を公開しており、今回の「Ornith-1.5」はその後継にあたります。

![ネットワークとAIを描いた挿絵](/images/articles/ornith-1-5-open-source-model-claude-opus-rival-inline-1.webp)

Ornith-1.5は、397B(混合専門家型、MoE)、35B(MoE)、9B(密結合型)という3つの規模で提供されます。最上位の397Bモデルはbf16形式で約800GBのサイズがあり、動かすには高性能GPUを8基連携させる環境が必要になるなど、一般の利用者が手元のパソコンで動かせる代物ではありません。一方で最小の9Bモデルは量子化した軽量版がスマートフォン上でも動作するとされており、規模に応じて用途を分けられる設計になっています。すべてのモデルの重み(オープンウェイト)はHugging Face上でMITライセンスにより公開されており、企業が自社サービスに組み込むことも自由です。

## なぜ重要なのか

Ornith-1.5最大のポイントは、訓練方法そのものにあります。従来の大規模言語モデル(LLM)の多くは、人間が用意した問題集や作業手順(スキャフォールド)を土台に訓練されます。これに対しOrnith-1.5は、「現在の実力より少し難しい課題を自分で考え出す→その課題を解く手順を自分で組み立てる→実際に解いてみた結果を強化学習の材料にする」という一連のサイクルを、モデル自身が繰り返しながら性能を伸ばしていきます。難易度は「経験的な成功率が2割程度になる課題」を目安に自動調整されるとされ、人手による問題作成のボトルネックを減らす狙いがあるとみられます。

397Bモデルは、ソフトウェア開発の実務に近いベンチマークで存在感を示しました。ターミナル操作を評価する「Terminal-Bench 2.1」で86.1点(Claude Opus 4.8は85.0点)、実際のGitHub上のバグ修正課題を使う「SWE-bench Verified」で86点(同85.8点)、Web上の情報収集能力を測る「WideSearch」で80.8点(同72.9点)、「BrowseComp」で86.6点(同84.3点)と、いずれもOpus 4.8と同等かわずかに上回るスコアを記録しています。

一方で、より難易度の高いベンチマークでは差が開きます。自律的なソフトウェア開発力を測る「DeepSWE」は56.0点(同59.0点)、未知のリポジトリを扱う「NL2Repo」は59.5点(同69.7点)、さらに難しい実務課題を集めた「Frontier-Bench v0.1」では13.5点(同21.1点)と、いずれもOpus 4.8に大きく水をあけられました。前身のOrnith-1.0からDeepSWEのスコアが8点から56点へ大幅に伸びている点は成長の速さを示していますが、現状では「定型的なタスクは得意、未知の難問はまだ苦手」という傾向がはっきり出ています。

![グラフを描いた挿絵](/images/articles/ornith-1-5-open-source-model-claude-opus-rival-inline-2.webp)

## オープンソースであることの意味

397Bという規模のモデルが、商用トップクラスのモデルと同じ土俵で比較できるスコアを一部で出し、しかも無料で重みを公開したという点は、AI業界にとって軽視できない出来事です。これまで最先端の性能は、OpenAIやAnthropic、Googleといった大手が有料APIとして提供する商用モデルの専売特許という側面が強くありました。オープンソースのモデルが、限定的とはいえ商用トップモデルと張り合えるスコアを出したことは、企業が自社サーバー内でデータを外部に出さずに高性能なAIを動かしたい、というニーズに応える選択肢が増えたことを意味します。ただし397Bモデルを実際に動かすには高性能GPUを複数台そろえる必要があり、個人が気軽に試せる規模ではない点には注意が必要です。

## 初心者が知っておくべきこと

「オープンウェイト」とは、AIモデルの中身である数値データ(重み)そのものを公開し、誰でもダウンロードして自分の環境で動かせるようにする公開方式のことです。OpenAIのChatGPTやAnthropicのClaudeのように、企業がサーバー上でモデルを動かし、利用者はAPIやアプリ経由でしか使えない「クローズドモデル」と対をなす概念です。

「混合専門家(MoE)」とは、1つの巨大なモデルの内部に、それぞれ得意分野が異なる複数の小さな「専門家」ネットワークを持たせ、入力内容に応じて必要な専門家だけを呼び出して計算する仕組みのことです。397B全体を毎回すべて計算するわけではないため、規模の割に計算コストを抑えられるという利点があります。

「ベンチマーク」とは、AIモデルの性能を客観的に比較するための標準化されたテストのことです。今回登場した「Terminal-Bench」はパソコンの操作、「SWE-bench」は実際のソフトウェアのバグ修正といったように、それぞれ異なる実務能力を測るよう設計されています。1つのベンチマークのスコアだけでモデル全体の実力を判断せず、複数のベンチマークを見比べることが大切です。

## IT Postの見方

IT Postでは、Ornith-1.5がオープンソースの技術水準を確かに押し上げた成果だと評価します。ただし、公開直後から世界中に広まった「Claude Opus 4.8に勝った」という触れ込みは、都合のいいベンチマークだけを並べた「いいとこ取り」だというのがIT Postの見方です。本当に難易度の高いFrontier-Bench・NL2Repoでの大差負けを見れば、まだ商用トップモデルの背中は遠いというのが実態でしょう。とはいえ、後発の無料モデルが半年でDeepSWEのスコアを8点から56点まで伸ばした事実は素直に評価に値します。この伸び方が今後も続くなら、次のバージョンで本当に肩を並べる日も遠くないかもしれない、とIT Postでは考えます。派手な見出しに踊らされず、自分の用途に必要なベンチマークがどれかを見極めて評価してほしいというのがIT Postからの助言です。※個人の感想です

## 今後どうなりそうか

DeepReinforceは今後もOrnith系列のモデルを継続的に公開していくとみられ、次のバージョンでFrontier-Bench・NL2Repoのような難関ベンチマークの差がどこまで縮まるかが注目点になります。オープンソースモデルが商用トップモデルに一部で並んだことで、他の研究チームも同様の「自己改善ループ」を使った訓練手法を追随してくる可能性があります。IT Postでは、Ornith-1.5の実務での採用事例や、後継モデルの発表があり次第、あらためて取り上げます。

## 情報源

- [Ornith-1.5: From Self-Scaffolding to Self-Improvement](https://ornith.ai/ornith_1_5.html) — Ornith / DeepReinforce（一次情報）
- [ornith-ai/Ornith-1.5-397B](https://huggingface.co/ornith-ai/Ornith-1.5-397B) — Hugging Face（一次情報）
- [The AI model 'Ornith-1.5' has been released, an open model that covers everything from large models like the Claude Opus 4.8 to lightweight models capable of running on smartphones](https://gigazine.net/gsc_news/en/20260820-ornith-1-5) — GIGAZINE
- [DeepReinforce Releases Open-Source Orinth 1.5 Family Of Models With Solid Benchmarks And MIT License](https://officechai.com/ai/deepreinforce-releases-open-source-orinth-1-5-family-of-models-with-solid-benchmarks-and-mit-license/) — OfficeChai
- [Ornith-1.5 open models launch in 397B, 35B, and 9 B sizes](https://www.testingcatalog.com/ornith-1-5-open-models-launch-in-397b-35b-and-9-b-sizes/) — TestingCatalog

## この記事に出てくるIT用語

- [MoE（専門家混合）](https://itpostjp.com/terms/mixture-of-experts-moe/): AIモデルを多数の「専門家」に分割し、入力内容に応じて一部だけを働かせることで、効率よく高い性能を実現する仕組みです。
- [オープンウェイト](https://itpostjp.com/terms/open-weights/): AIモデルの学習済みデータ(重み)そのものが公開され、誰でもダウンロードして自分の環境で動かせる状態のことです。
- [大規模言語モデル（LLM）](https://itpostjp.com/terms/large-language-model/): 大量の文章から言葉のつながりを学習した、文章を扱うAIの中核技術です。

---

この記事は、公開情報と出典URLの検証、文章作成の一部に生成AIを使用しています。内容の責任はIT Post by Rice Studio Labが負います。

出典表記: IT Post by Rice Studio Lab — https://itpostjp.com/ai/ornith-1-5-open-source-model-claude-opus-rival/
