30秒で分かる結論
米OpenAIが2026年9月3日に公開した新型AIモデル「GPT-6 Astra」は、9月5日にかけてChatGPTのPlus・Pro・Business・Enterprise各プラン、およびAPI・Amazon Web Services・Microsoft Azure経由での提供が順次広がっています。公開後に出そろった第三者の検証では、評価がはっきり割れています。ベンチマーク運営団体ARC Prizeの計測では、はじめて見るルールをその場で推論させる「ARC-AGI-3」という課題で、中立的な標準ハーネス(モデルの外側で対話履歴やメモを管理する実行環境)だと62.7%、OpenAI向けに用意された「プロバイダーアダプター」ハーネスだと99.9%と、同じモデル・同じ課題なのにスコアが大きく変わりました。一方、第三者機関Artificial Analysisの計測では、総合知能スコアは61点前後で前モデル「GPT-5.6 Sol」とほぼ横ばい・Anthropicの「Claude Fable 5.1」を下回るものの、同じ回答を出すのに使うトークン量はSolの約3分の1に減り、事実誤り(ハルシネーション)を測る指標では最大設定で誤答率が92%から51%へ下がりました。看板の数字ほど単純な話ではない、というのが公開2日後の実像です。
まず初めに
発表の翌日から、世界中のベンチマーク職人が寄ってたかってAstraを採点し始めた。そして出てきた表を見ると、同じモデルが片方の物差しで62点、もう片方で99.9点。占い師が2人がかりで正反対の運勢を告げてきたようなもので、どちらを信じればいいのか分からない。しかもよく見ると、低い点を出した「公平な」計測のほうが、高い点を出した計測より費用がかかっている。これはもう、点数を眺めるより採点方法の説明書を読んだほうが面白い。※個人の感想です
生成AIによるイメージ。実物や実際の画面ではありません。
何が起きているのか
IT Postは9月4日に、GPT-6 Astraの一般提供開始と、自社基準で史上初めてサイバー攻撃能力が「Critical(重大)」水準に達した経緯をOpenAIが新型「GPT-6 Astra」公開、史上初の「Critical」級サイバー能力は何をもたらすのかで取り上げました。本記事はその続報で、公開の翌日から週明けにかけて出そろってきた独立した第三者の性能検証と、提供範囲の広がりを扱います。
提供状況から整理します。OpenAIは公開時、まずサイバーセキュリティ用途向けの申請制プログラム「Daybreak」の参加組織へ先行提供し、その後「数日かけて」ChatGPTのPlus・Pro・Business・Enterprise利用者、およびAPI、AWS(Bedrock)、Microsoft Azure経由でも使えるようにすると説明していました。9月5日時点では、この段階的な展開が進行中で、利用者のアカウントやプランによって、モデル選択メニューにAstraが現れる時期に差がある状況です。OpenAIはあわせて、Astraを最大限に活かすにはChatGPTのデスクトップアプリを使うことを推奨しています。
新しく分かったのは、性能評価の中身です。AI開発企業は新モデルの発表時に自社で用意したベンチマーク結果を示しますが、その後、開発元とは独立した機関が同じモデルを自前の方法で測り直します。今回、その独立検証の結果が2つの方向から公開されました。一つはベンチマーク運営団体のARC Prize、もう一つは性能分析を専門とするArtificial Analysisです。
独立検証で見えてきたこと
ARC Prizeは、はじめて遭遇するゲーム環境のルールを手がかりから推論させる「ARC-AGI-3」という課題でAstraを計測しました。注目されたのは、実行環境(ハーネスと呼ばれる、モデルの外側で対話履歴・メモ・作業状態を管理する仕組み)の違いでスコアが激変した点です。すべての参加モデルを同じ条件で比べるための中立的な「標準ハーネス」では62.7%、費用は約2万6千ドル。これに対し、OpenAIが自社モデル向けに設計した文脈管理の仕組みをそのまま使う「プロバイダーアダプターハーネス」では99.9%、費用は約1万9千ドルでした。*公平な条件のほうが、点は低いのに高くついている。*ARC Prizeは、標準ハーネスでは推論の設定を変えると成績がおおむね17%から63%の幅で動くとしており、「普通にAPIを呼んだだけで99.9%のような挙動は見られない」と明記しています。なお、アダプター側の条件ではARC-AGI-3の各段階の96%で人間の成績を上回ったとされ、この課題自体が上限に近づいたという評価も同時に示されています。
Artificial Analysisの計測は別の絵を描きます。推論・知識・数学・コーディングなどを一本化した「Intelligence Index」でAstraは61点前後にとどまり、前モデルのGPT-5.6 Solと横ばい、Claude Fable 5.1(66点前後)を下回りました。この点は9月4日の既報と同じ結論です。一方で、同じ回答品質を得るのに使うトークン量はSolより約7割少なく、コーディング作業を自律的にこなす「Coding Agent Index」では67点で、Fable 5.1(別のツール環境で70点)には届かないものの、Claude Opus 5やFable 5と同程度をより低いコストで出したとされています。さらに、知識の正確さと作り話のしにくさを同時に測る「AA-Omniscience」では、最大の推論設定で誤答率が92%から51%へ下がり、しかも正答率は4ポイント上がりました。多くのモデルでは誤答を減らすと正答も減る傾向があるため、Artificial Analysisはこれを珍しい結果だとしています。ただし同機関は、この数値が「日常のChatGPT会話で51%間違える」という意味ではない、と注意を付けています。
料金面では、標準モードで入力100万トークンあたり10ドル・出力100万トークンあたり50ドルで、前モデルSolの2.5倍です。表面の単価はFable 5.1と同じですが、いったん読み込んだ文脈を再利用する「キャッシュ読み込み」はAstraが100万トークンあたり1ドル、Fable 5.1が0.25ドルと差があります。
なぜ重要なのか
一つは、ベンチマークの「看板の数字」がどれだけ実行環境に依存するかが、今回はっきり可視化されたことです。99.9%という数字は、モデル単体の賢さというより、OpenAIが用意した文脈管理の足場と、数万ドル規模の計算資源をかけた条件で初めて出るものでした。利用者が実際に手を動かして得られる結果は、この足場の有無で大きく変わり得ます。
もう一つは、Astraの評価が一面的ではないことです。総合知能スコアは横ばいでも、トークン効率とハルシネーション率という「使い勝手」に直結する部分では実測で改善が見られました。9月4日の既報でIT Postは「61点で同点」という要約を軸にしましたが、その後に出た詳細は、良い方向にも悪い方向にも幅があります。AI企業の発表も、それに対する「期待外れ」という反応も、どちらも急ぎすぎると実像を取り逃がします。
私たちへの影響
数日以内にChatGPTの各プランでAstraが選べるようになったとき、日本の利用者が確認すべきは次の点です。まず、他社モデルからの明確な乗り換え理由になるのは、いまのところコーディング支援やコンピュータ操作の自動化といった特定用途で、雑談や一般的な調べ物では前モデルや競合との体感差は小さい可能性があります。次に、Pro(月200ドル)やAPIでの利用を検討する場合、料金は前モデルの2.5倍なので、自分の使い方でトークン効率の改善が費用増を相殺するかは、実際に試して見積もる必要があります。
企業でAPIを使う場合は、キャッシュ読み込みの単価差(競合の4倍)が、長い文脈を繰り返し参照する使い方では効いてきます。また、社内の検証で「思ったより精度が出ない」と感じたときは、モデルの問題と決めつける前に、文脈管理や再試行の仕組み(ハーネス)を見直す価値があることを、今回のARC Prizeの結果は示しています。
生成AIによるイメージ。実物や実際の画面ではありません。
用語解説
ベンチマーク(性能評価) … 複数のAIモデルを共通の課題で採点し、比較できるようにした物差しです。開発企業が自社発表で使うものと、Artificial AnalysisやARC Prizeのような独立機関が運営するものがあり、後者のほうが客観性は高いとされます。
ハーネス … AIモデル本体の外側で、対話履歴・メモ・作業の途中経過などを管理し、モデルに課題を解かせる実行環境のことです。同じモデルでもハーネスの作りが違うと成績が変わるため、ベンチマークの数字を読むときは「どのハーネスでの値か」が重要になります。
ハルシネーション … AIが事実に反する内容を、もっともらしい体裁で出力してしまう現象です。誤答率を下げる工夫は各社が進めていますが、正答率とのバランスが課題になります。
よくある質問
Q. 結局、GPT-6 Astraは前モデルより賢くなったのですか?
A. 独立機関Artificial Analysisの総合知能スコアでは前モデルとほぼ横ばいです。ただし、同じ回答を出すのに使うトークン量や、事実誤りのしにくさといった個別の指標では改善が計測されています。「総合点は据え置き、使い勝手は部分的に向上」というのが公開直後の評価です。
Q. 99.9%というスコアは信じていいのですか?
A. ARC PrizeによればOpenAI向けの専用実行環境で数万ドル規模の計算をかけた条件での数字で、中立的な条件では62.7%でした。ARC Prize自身が「普通にAPIを呼んだだけでは99.9%のような挙動は見られない」と述べています。
Q. いま契約している他社のAIから乗り換えるべきですか?
A. コーディングやパソコン操作の自動化を主目的にするなら試す価値はありますが、料金は前モデルの2.5倍です。一般的な用途では競合との体感差が小さい可能性があり、実際に自分の使い方で試してから判断することをおすすめします。
IT Postの見方
IT Postでは、今回の独立検証を「Astraは特定用途では確かに強いが、看板の数字は実行環境ありきで、鵜呑みにすると自分の環境との落差にがっかりする」と受け止めています。
99.9%という数字は嘘ではない。だが、その数字を出すのに必要だったのは、OpenAIが自社モデル用にあつらえた文脈管理の足場と、個人では到底かけられない量の計算資源だった。*同じ看板を掲げた店でも、本社のショールームと街の支店では品揃えが違う、という話に近い。*一方で、トークン効率が7割改善し、誤答率が実測で半分近くまで下がったのは、地味だが利用者の作業に直接効く。派手なキャッチコピーより、こういう数字のほうが日々の使い勝手を左右する。
ここから引き出せる教訓は一つ。ベンチマークの高いスコアを見たら、まず「どのハーネスで測ったか」を確認すること。そして、自分が試して期待した成績が出なかったときは、モデルを見限る前に、与えている文脈や再試行のやり方を疑うこと。看板の数字と手元の結果がずれるのは、多くの場合モデルのせいではなく、その周りの足場のせいだ。※個人の感想です
今後どうなりそうか
当面は、ChatGPT各プランとAPIへの提供が完了し、より多くの利用者が実地で試せるようになる段階です。ARC-AGI-3が上限に近づいたことで、ARC Prize側は次世代の課題設計に動くとみられます。IT Postでは、独立機関による追加の検証結果や、Astraを組み込んだ実サービスでの評価、そして9月4日の既報で扱った「Critical」級サイバー能力の外部検証について、進展があればあらためて取り上げます。