論文の概要: Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices
- arxiv url: http://arxiv.org/abs/2610.08153v1
- Date: Tue, 06 Oct 2026 11:04:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.956752
- Title: Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices
- Title(参考訳): ペナルティフレーム非Valid-Option MCQA : 無効選択下でのLLM吸収の解析
- Abstract要約: 大規模言語モデルの評価には、MCQA(Multiple-choice Question answering)が一般的である。
実際のデプロイメントでは、ユーザまたは検索システムは、リストされた選択が正しくない無効なオプションセットを提供することができる。
我々は、この設定をペナルティフレームの無効オプションMCQAとして検討する。
- 参考スコア(独自算出の注目度): 1.1458853556386797
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multiple-choice question answering (MCQA) is commonly used to evaluate large language models under the assumption that one of the provided options is correct, typically using answer-selection accuracy. However, in real deployments, users or retrieval systems may provide invalid option sets in which none of the listed choices is correct, and selecting one of them may incur downstream cost. We study this setting as penalty-framed no-valid-option MCQA. Using the mathematics subset of MMLU-Pro, we remove the labeled correct option, allow models to either choose a remaining option or output ABSTAIN, and penalize invalid forced-choice responses. We further introduce correct-conditioned analysis, evaluating abstention only on instances that the model originally answered correctly. Experiments show that high MCQA accuracy does not fully guarantee abstention reliability: even under explicit no-valid-option-aware instructions and penalty-based scoring, models still produce invalid forced-choice responses for a subset of originally correct instances. These results show that penalty-framed no-valid-option MCQA reveals an aspect of model reliability not captured by standard answer-selection accuracy.
- Abstract(参考訳): MCQA(Multiple-choice Question answering)は、提供された選択肢の1つが正しいと仮定して、大きな言語モデルを評価するために一般的に用いられる。
しかし、実際のデプロイメントでは、ユーザまたは検索システムは、リストされた選択が正しくない無効なオプションセットを提供し、そのうちの1つを選択すると、ダウンストリームコストが発生する可能性がある。
我々は、この設定をペナルティフレームの無効オプションMCQAとして検討する。
MMLU-Proの数学部分集合を用いて、ラベル付き正しいオプションを除去し、モデルが残りのオプションを選択するか、ABSTAINを出力するか、無効な強制選択応答をペナルティ化することができる。
さらに、モデルが最初に正解したインスタンスに対してのみ、棄却を評価できる正条件解析を導入する。
実験により、MCQAの精度が高いことは、禁忌の信頼性を完全に保証していないことが示され、明示的な無効オプション対応命令やペナルティに基づくスコアリングの下でも、モデルは元の正しいインスタンスのサブセットに対して無効な強制選択応答を生成する。
これらの結果から, ペナルティフレームの無効オプションMCQAは, 標準回答選択精度によって獲得されないモデル信頼性の側面を明らかにする。
関連論文リスト
- When Models Defer to Wrong Answers: A Robustness Audit of Source-Attributed Cues in Multiple-Choice QA [2.347309464574674]
言語モデルは、他のソースが答えたことについてのクレームとともに、しばしば質問を受ける。
このような主張が複数の質問応答において解答を不安定化させるかどうかを検査する。
英語,ヒンディー語,ベンガル語,タミル語,テルグ語でMMLU-ProとIndicMMLU-Proの4つの命令追従モデルを評価する。
論文 参考訳(メタデータ) (2026-09-08T15:57:24Z) - Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach [13.829059542429876]
大規模言語モデル(LLM)の性能評価手法として,MCQ (Multiple Choice Questioning) が広く用いられている。
LLMはMCQタスクにおいて選択バイアスを示し、その選択は内容よりも答えの位置やオプション記号などの要因に影響される。
論文 参考訳(メタデータ) (2025-11-17T21:31:37Z) - Differentiating Choices via Commonality for Multiple-Choice Question Answering [54.04315943420376]
複数選択の質問応答は、正しい答えを選択するための貴重な手がかりを提供することができる。
既存のモデルでは、それぞれの選択を別々にランク付けし、他の選択によって提供されるコンテキストを見渡すことが多い。
本稿では,DCQAと呼ばれる共通性を識別・排除することで,選択を識別する新しいモデルを提案する。
論文 参考訳(メタデータ) (2024-08-21T12:05:21Z) - Large Language Models Are Not Robust Multiple Choice Selectors [117.72712117510953]
複数選択質問(MCQ)は、大規模言語モデル(LLM)の評価において、一般的なが重要なタスク形式として機能する。
この研究は、現代のLLMが、その固有の「選択バイアス」によるオプション位置変化に対して脆弱であることを示している。
そこで本研究では,オプションIDに対する事前バイアスを全体予測分布から分離するPriDeという,ラベルのない推論時間脱バイアス手法を提案する。
論文 参考訳(メタデータ) (2023-09-07T17:44:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。