LLMベンチマークの課題とBenchMIRTの登場
大規模言語モデル(LLM)の能力を測るために、さまざまなベンチマークが利用されています。これらのベンチマークは通常、特定の能力(安全性、一般的な推論、指示の理解など)を評価する目的で設計されていますが、個々のタスクがその目的以外の能力にも依存しているケースが少なくありません。
例えば、モデルが社会的なステレオタイプに依存しているかをテストする BBQ ベンチマークでは、高齢者と孫が Uber を予約するシナリオが含まれており、年齢バイアスだけでなく、誰が誰であるかを追跡し、証拠に基づいて推論する能力も求められます。 (出典)
従来のベンチマークは特定の能力を測定するように設計されているものの、その内部のタスクは複数の潜在的な能力に依存している可能性があるという点が、BenchMIRTが解決しようとしている主要な課題です。
また、単一のベンチマーク内でも、異なる質問群が異なる能力を測定することがあります。WildJailbreak ベンチマークが良い例で、有害なジェイルブレイクプロンプトと、無害なリクエストを過度に拒否しないかをテストするプロンプトが混在しています。これらを単一のベンチマークスコアとして平均化してしまうと、それぞれのプロンプトが測定している能力の違いが曖昧になってしまいます。
こうした状況では、モデルの真の能力を正確に把握することは困難です。私の開発している個人プロダクトでもLLMの評価は非常に重要なので、このような多次元的な分析はぜひ取り入れたいと感じました。
BenchMIRTの仕組み—多次元項目応答理論(MIRT)
BenchMIRTは、心理測定学で用いられる項目応答理論(IRT)から着想を得ています。IRT は、テストの各質問が受験者の能力について異なる情報を提供するという考え方に基づいています。過去には単一次元の IRT が個々のベンチマークに適用されてきましたが、BenchMIRT はこれを多次元項目応答理論(MIRT)に拡張しています。
これにより、同じ質問に対するパフォーマンスに寄与する複数の能力を分離して分析することが可能になりました。(出典)
BenchMIRT は、モデルと質問の両方のレベルで IRT を適用します。特定のモデルに対しては、選択されたベンチマーク全体で反映される能力に対するそのモデルの強さを推定します。
一方、各質問に対しては、その質問の難易度と、特定の能力において強いモデルと弱いモデルをどれだけ区別できるかを推定します。(出典)
| 項目 | 単一次元 IRT | 多次元 IRT (MIRT) |
|---|---|---|
| 測定対象 | 単一の能力 | 複数の能力 |
| 適用範囲 | 個々のベンチマーク | 複数のベンチマーク、複合的な能力 |
| 特徴 | 質問の難易度・識別力を評価 | 各能力と質問の関連性を分離 |
Hugging Face が公開しているベンチマークデータセット「FineWeb-10B」のような大規模なデータセットを用いることで、さらに詳細な分析が可能になるでしょう。(出典)
BenchMIRTが明らかにした既存ベンチマークの真の姿
Allen Institute for AI は、16のベンチマークと34,000以上の質問にわたる100のLLMのベンチマーク結果を用いて BenchMIRT をトレーニングしました。彼らは BenchMIRT に、どのベンチマークがどの能力を測定しているかを事前に教えることなく分析を実施しました。その結果、BenchMIRT は独立して「安全性」と「一般的な推論」という2つの主要な能力次元を特定しました。
これは、分析を繰り返しても安定して現れる結果であり、このアプローチの信頼性を示唆しています。(出典)
BenchMIRTは、多くのベンチマークの意図された焦点を確認する一方で、一部の評価ではより複雑な実態を明らかにしました。
多くのベンチマークでは、BenchMIRT はその意図された焦点をほぼ確認しました。しかし、BBQ ベンチマークのように、社会的なバイアスを評価し、通常は安全性のベンチマークとして分類されるものが、BenchMIRT の分析では「一般的な推論」とより強く関連していることが判明しました。
これは、低い BBQ スコアが、モデルが特定の質問を理解したり推論したりすることの難しさの一部を反映している可能性があり、安全性の振る舞いだけではないことを意味します。(出典)
個人的には、これはかなり衝撃的なニュースです。これまで「安全性」を測っていると信じられていたベンチマークが、実は「推論能力」も強く反映していたというのは、LLMの評価手法全体に一石を投じるのではないでしょうか。特にスタートアップのエンジニアとして、限られたリソースの中でモデル選定を行う際に、このような多角的な視点は不可欠だと感じます。
WMDP ベンチマークも興味深く、生物学、化学、サイバーセキュリティなどの分野における危険なデュアルユース知識をテストするもので、他の安全性のベンチマークとは異なる振る舞いを見せているとのことです。(出典)
評価の透明性と精度向上への期待
BenchMIRT は、個々のプロンプトレベルでベンチマークを監査できるため、研究者がベンチマークスコアを実際に駆動しているシグナルを分離し、より明確に理解するのに役立ちます。これは、モデルの能力をより正確に評価し、意図しないバイアスや欠陥を早期に特定するために非常に重要なステップです。
AI の進化が加速する中で、評価手法の透明性と精度向上は、信頼できる AI システムを構築するための基盤となります。特に、ローカル LLM の性能評価や、クラウドサービス選定におけるモデル比較において、このような深い洞察は意思決定に大きく貢献するでしょう。