FuguReport

Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

著者 Nishant Balepur, Paiheng Xu, Wei Ai, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber
所属 New York University / Nanyang Technological University / University of Maryland
カテゴリ Evaluation / Model Evaluation / Multiple-choice scoring impact, Method / Evaluation Metrics / Alternative scoring schemes, Application / Educational Testing / MCQA assessment design
ライセンス CC BY 4.0

Abstractの概要

本論文では、標準的な正答数による正解率ではなく、代替的な採点スキームを用いて評価した場合に多肢選択式質問応答ベンチマークがどのように変化するかを調査しています。著者らは教育測定理論に着想を得て、棄権、誤答の排除、確信度のキャリブレーション、自己修正など、単純な正しさ以外の能力を対象とする6つのスキームを実装しました。プロンプトと指標の変更のみを用いて、ARC、MMLU、SuperGPQA上で31の大規模言語モデル(LLM)を評価しています。この分析は、これらのスキームがモデルの順位を変動させるか、人間の嗜好により良く適合するか、そして正解率だけでは見えにくい行動の違いを明らかにするかに焦点を当てています。

新規性

本論文の主な新規性は、採点スキームの設計そのものを自然言語処理における多肢選択式質問応答の重要な評価選択として扱い、教育分野に着想を得た6つのスキームを統一的なLLMベンチマークフレームワークへと適応させた点にあります。新しいデータセットやモデルを提案するのではなく、代替的な回答モードと採点ルールによって、基となるタスク入力を変更することなく異なる能力を浮き彫りにできることを示しています。

成果

排除ベースの採点、個人的な配点、および正解するまで回答を続ける方式は、プロンプト言い換えのベースラインよりもモデルの順位を大きく変動させ、正答数による正解率とは異なる能力を捉えていることが確認されました。正解するまで回答する方式は、LLM Arenaにおけるユーザー嗜好と最も強い相関を示しました。さらに、スキーム横断的な評価により、強力なGPTモデルはめったに棄権せずフィードバックに迅速に適応する一方、性能の劣るオープンウェイトモデルは頻繁に棄権したり選択肢の排除をためらったりするなど、行動特性が明らかになりました。

論文の注目点

  1. 本研究は、教育理論に基づく6つの採点スキームを適応し、多肢選択式ベンチマークにおいてLLMの棄権、排除的推論、確信度キャリブレーション、自己修正をテストした。
  2. 代替的な採点ルールは標準的な正解率と比較してモデルの順位を実質的に入れ替え、ベンチマーク結果が報奨対象となる特定の行動に強く依存することを示した。
  3. 正解するまで回答する方式はLLM Arenaにおける人間の嗜好と最も強く相関し、正答数による採点では隠れてしまうモデル特有の行動傾向を明らかにした。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。