IT Post

by Rice Studio Lab


記事を検索
文字サイズ
ふりがな
AI・生成AI

そのAIランキングの点数、何を測っているのか。Ai2が試験問題を1問ずつ解剖した

総合点が高い=自分の仕事に強い、とは限らない。100モデル・16試験・3万4000問超を1問単位で分析した手法と、安全性の試験が実は推論力を測っていた話を確かめる

30秒で分かる結論

米国の研究機関Ai2は2026年9月1日、AIの性能試験(ベンチマーク)を、1問ずつの単位で監査かんさする手法「BenchMIRT」を公開しました。教育心理学で使われてきた項目反応理論という考え方を土台に、複数の能力を分けて扱えるよう拡張したものです。100個のモデル、16種類のベンチマーク、3万4000問を超える設問を使って分析したところ、データからは「安全性」と「一般的な推論力」という2つの大きな軸が浮かび上がりました。そして、安全性の試験として分類されてきたいくつかのベンチマークが、実際には推論力のほうと強く結びついていたことが分かっています。コードとデータは公開されています。

この記事の目次 9項目
出典を確認する(2件)
記事のテーマを表した生成イメージ
生成AIによるイメージ。実物や実際の画面ではありません。

まず初めに

IT Postでは、AIのベンチマークというものを、長らく胡散臭うさんくさい目で見てきた。

毎週どこかの会社が新しいモデルを出す。棒グラフが出る。自社が一番高い。翌週、別の会社が別のグラフを出す。やはり自社が一番高い。全員が一番になれる不思議な世界だ。しかも、そのグラフの下にある試験が何を測っているのかを、真剣に検証した人はほとんどいない。テストの点数だけを延々と比べて、テスト自体は誰も採点しない。学校でそれをやったら大問題である。

今回のAi2の仕事は、そこへ手を入れた。答案ではなく、問題用紙のほうを疑っている。遅かったが、必要な作業だ。

※個人の感想です

虫めがねを描いた挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

何をした研究なのか

Ai2の解説によると、BenchMIRTは、ベンチマークを1つの塊としてではなく、個々の設問の水準で監査する手法です。

土台になっているのは、項目反応理論と呼ばれる考え方です。もともとは教育や心理の分野で、受験者の答え方の模様から能力や特性を測るために使われてきました。BenchMIRTは、これを多次元に拡張し、同じ設問に影響を及ぼしている複数の能力を分けて扱えるようにしています。

この理論では、1つの設問に対して2つの数値が求められます。

数値 意味
難易度 どの能力水準のモデルが、その設問に50%の確率で正解するか
識別力 その設問が、能力の違うモデルをどれだけ鋭く区別できるか

識別力が低い設問は、賢いモデルも、そうでないモデルも、同じように正解したり間違えたりします。つまり、その設問は順位づけの役に立っていません。総合点にはしっかり含まれているにもかかわらず、です。

分析で出てきた2つの軸

Ai2は、100個のモデルと16種類のベンチマーク、3万4000問を超える設問を使って分析しました。推論系のベンチマークが6本、安全性系が10本という構成です。名前が挙がっているものには、推論系にMMLU-Pro、GPQA、MATH、BBH、安全性系にHarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTestなどがあります。

分析の結果、データからは2つの支配的な次元が、あらかじめ指定することなく浮かび上がりました。安全性と、一般的な推論力です。

つまり、16本のベンチマークが16通りの別々の能力を測っていたのではなく、大きく2つの束に整理できてしまった、ということになります。

「安全性の試験」が推論力を測っていた

もっとも注目されるのは、分類と実態のずれです。

BBQは社会的な偏見へんけんを評価するベンチマークで、通常は安全性の仲間として扱われてきました。ところがBenchMIRTの分析では、安全性よりも一般的な推論力のほうと強く整合していました。Ai2は、BBQの点数が低いことは、安全性の振る舞いだけでなく、設問を理解したり筋道すじみちを立てて考えたりする難しさを部分的に反映している可能性がある、と説明しています。

WMDPについても同様に、安全性より一般的な推論力と強く関連していました。しかも、推論力が高いモデルほどWMDPの点数が低くなる関係でした。これは、危険な知識の提供を拒んだり答えなかったりすることが望ましい応答として数えられる試験の設計に由来します。

つまり、賢いほど点数が下がる試験である。学校なら苦情が来る。

コードとデータは公開

Ai2は、この手法のコードとデータを公開しています。GitHubのallenai/BenchMIRTと、Hugging Face上の収集物として提供されています。

第三者が同じ手順を再現さいげんできる形で出されている点は重要です。ベンチマークの妥当性だとうせいを問う研究そのものが検証できなければ、また別の権威が生まれるだけになるからです。

この記事の内容にちなんだ挿絵
生成AIによるイメージ。実物や実際の画面ではありません。

日本の読者にとって何が変わるのか

第一に、AIの比較記事の読み方が変わります。「総合点が高いモデル」は、その試験で測っている能力が高いモデルであって、あなたの仕事に強いモデルとは限りません。日本語での要約、社内文書の整理、接客文の作成といった作業は、多くのベンチマークが測っている対象そのものではないためです。

第二に、企業のAI選定への示唆しさです。ベンダーが示す棒グラフだけで決めるのではなく、自社の実際の業務データで小さく試すほうが確実だ、という当たり前の結論が、研究の側から裏付けられた形になります。

第三に、安全性の評価をめぐる議論です。安全性の試験だと思って使っていたものが、実は推論力を測っていたのだとすれば、「安全性の点数が高いから安心」という判断は成り立ちません。この点は、行政や企業がAIの調達基準を作るうえでも避けて通れません。

IT Postでは、同じモデルが測り方によって大きく違う点数を示した事例も別途扱っています。今回の研究は、その現象の根にある問題を、より体系的たいけいてきに説明するものだと考えます。

用語の整理

言葉 意味
ベンチマーク 性能を測るための共通の試験問題
項目反応理論 受験者の答え方の模様から、能力や設問の性質を推定する統計の手法
難易度 その設問に50%の確率で正解できる能力の水準
識別力 その設問が、能力差をどれだけ鋭く区別できるか
大規模言語モデル 大量の文章を学習し、文章を生成するAI

よくある疑問

これまでのAIランキングは全部嘘だったのか。 そうではありません。試験が何を測っているかの理解が不正確だった、という指摘です。点数そのものが捏造ねつぞうされていたという話ではありません。

どのベンチマークを見ればよいのか。 1本を選べばよい、という結論は示されていません。むしろ、総合点1つで判断しないことが、この研究からの実用的な教訓です。

一般の利用者に関係があるのか。 直接の操作は変わりません。ただし、AIの比較記事や広告の数字を、そのまま自分の用途に当てはめないための材料になります。

Ai2とはどのような組織か。 米国のAI研究機関で、モデルやデータを公開する取り組みを続けています。今回もコードとデータを公開しています。

IT Postの見方——採点する側を、誰も採点していなかった

IT Postでは、この研究を、この1か月で最も地味で最も厄介な発表だと考える。

AI業界の会話は、この2年ほど、ほぼ点数の話だった。何点だった。抜いた。抜かれた。まるでスポーツ中継である。だが競技には審判がいて、ルールブックがあり、それを疑う人もいる。AIのベンチマークには、それが無かった。試験問題は聖典扱いで、誰も中身を開かなかった。

そこへ、開けてみたら中身が違った、という報告が出た。安全性を測っていたはずの試験が、推論力を測っていた。しかも賢いほど点が下がる項目まであった。これは細かい瑕疵かしではない。測っているものが違うなら、その点数で作った順位も、その順位で書かれた記事も、その記事を読んで決めた導入判断も、全部が揺れる。

ただし、これを「ベンチマークは無意味だ」の話にするのは雑すぎる。無意味なのではない。読み方を間違えていたのだ。体重計に乗って身長を測ろうとしていた側にも、責任の一部はある。数字が出れば安心するのは人間の癖だが、その数字が何を数えているかは、別途確かめないといけない。

そして、この研究の本当の価値は、コードとデータを公開したところにある。「うちが調べたら、そうでした」で終わらせなかった。ベンチマークの権威を疑う仕事が、また新しい権威になっては意味がない。疑える形で出す。研究として当たり前だが、この分野では珍しいほど誠実だ。

IT Postでは、次に企業が棒グラフを見せてきたら、こう聞くことを勧める。その試験は、私の仕事の何を測っているのですか、と。答えられない相手は、たぶん自分でも分かっていない。

情報源

この記事を共有する

用語辞典へ