論文の概要: Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
- arxiv url: http://arxiv.org/abs/2608.15428v1
- Date: Sat, 15 Aug 2026 22:11:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.297097
- Title: Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
- Title(参考訳): Gated against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
- Abstract要約: 複数選択のベンチマークは、モデルが正しい選択肢を選ぶかどうか、質問が必要なかどうかで評価される。
UA-JudgeExam: 11,990件の4つのオプション項目を公式キーで測定し、ウクライナの高等審査委員会(Higher Qualification Commission of Judges)が公表した。
11.8%のアイテムは、偶然に予想される0.2項目に対して、8つのオプションのすべてで盲目で答えられる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multiple-choice benchmarks are graded on whether a model picks the right option, not on whether it needed the question. Measuring that gap takes care: a model answering A to most items scores above chance wherever the key sits at A, and reads as recognition when it is not. We measure it on UA-JudgeExam: 11,990 four-option items with official keys, published by Ukraine's Higher Qualification Commission of Judges. Shown the options and no question, Claude Haiku 4.5 scores 0.383 against chance, and the leak is concentrated: 11.8% of items are answered blind on all eight option orders, against 0.2 items expected by chance. It is not quotation: search over 280,059 editions of Ukrainian legislation recovers 0.128. Gating those out retains 8,128 items, on which the gating model itself now scores 0.204, and GPT-5.6, which took no part in the selection, still answers 0.515 of them with the question hidden. Scoring twelve held-out models on the whole set and subtracting each one's answer-position habit, only two keep an excess: GPT-5.6 at +0.265, Sonnet 4.6 at +0.081. Without it the ranking misleads: Llama 3.1 8B scores 0.292 blind, above every model but those two, purely by answering A to 92% of items. The gate does select something real: on the items it rejected, eleven of twelve models score 0.518-0.789, every interval clear of what the same model scores on the items it kept. But that signal is one model's, and filtering on it does not transfer upward. Neither is visible on a 400-item sample, where nine models read as "statistically at chance". Rewriting distractors instead overshoots to 0.168, below chance and as exploitable. The same probe on LEXam returns chance: every option there points into the stem, none longer than 33 characters. Item format decides whether the problem can arise; capability decides how much is extracted. We release the corpus, the predictions and the harness.
- Abstract(参考訳): 複数選択のベンチマークは、モデルが正しい選択肢を選ぶかどうか、質問が必要なかどうかで評価される。
Aからほとんどの項目に答えるモデルは、キーがAにある場所よりも高い確率でスコアを獲得し、そうでない場合は認識として読みます。
UA-JudgeExam: 11,990件の4つのオプション項目を公式キーで測定し、ウクライナの高等審査委員会(Higher Qualification Commission of Judges)が公表した。
クロード・ハイク4.5はチャンスに対して0.383点、リークは集中しており、11.8%は偶然に予想される0.2点に対して8つの選択肢全てで盲目で答えられる。
ウクライナ法280,059版を検索すると0.128が回復する。
ゲーティングは8,128項目を保持しており、ゲーティングモデル自体のスコアは0.204であり、GPT-5.6は選択には関与していない。
集合全体の12の保留モデルとそれぞれの解答の習慣を減じて、GPT-5.6を+0.265とし、Sonnet 4.6を+0.081とした。
Llama 3.1 8Bは視力0.292で、どのモデルよりも高いが、これらの2つはAから92%のアイテムに答えている。
12モデルのうち11モデルが0.518-0.789点、同じモデルが保持しているアイテムのスコアの間隔をクリアする。
しかし、その信号は1つのモデルの信号であり、その上でのフィルタリングは上向きに転送されない。
どちらも400石のサンプルでは見られず、9つのモデルは「偶然に統計的に」と読まれている。
散逸器をオーバーシュートして0.168に書き直し、チャンスを減らし、悪用できる。
LEXamの同じプローブがチャンスを返します。すべてのオプションがステムを指し、33文字以上です。
アイテムフォーマットは問題が発生するかどうかを決定し、能力はどれだけ抽出されるかを決定する。
コーパス、予測、ハーネスを公開します。
関連論文リスト
- Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation [0.0]
回答オプションを追加することで、評価の妥当性を向上することなく、複数の選択のスコアを下げることができる。
トルコのMMLU Proは58のセクションで12,000のトルコ語ソースの質問を用いてこの区別を検証している。
論文 参考訳(メタデータ) (2026-09-14T12:28:09Z) - MedQA-MM: Shortcuts Behind Medical Visual Reasoning [45.333881843709804]
ベンチマークスコアは最終回答を信用するが、アイテムが答えられるルートではない。
医用マルチモーダル多重選択質問(MCQ)では、適切な回答が意図された画像発見によって支持されるため、この区別が重要である。
ここでは、ルートは、モデルの隠れた認識に関するクレームではなく、回答の選択をサポートすることができる観測可能な入力パスである。
論文 参考訳(メタデータ) (2026-09-03T01:40:19Z) - Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards [0.0]
評価ベンチマークはアノテータの採用によって構築され、それらのアノテータの同一性は実装の詳細として扱われる。
2,885件のMultiPrefアイテムには、両方のプールが全会一致で配置されているため、ネクタイ破りのコンベンションは一切ない。
しかし、両方のコーパスでは、結果のモデルリーダーボードはビット識別される: Kendall tau = 1.00 で、6つのモデルのうちゼロが置き換えられる。
論文 参考訳(メタデータ) (2026-08-17T00:19:52Z) - Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents [22.30468215041597]
ツール使用エージェントは別の言語で同じタスクを与えられるが、それでも同じステップを踏むだろうか?
アクションポリシーを,8つのモデル,6つの並列ベンチマーク,41の言語で測定対象とする。
論文 参考訳(メタデータ) (2026-08-11T16:18:34Z) - Explaining AI-Image Detection: What the Heatmap Actually Shows [65.01025489527173]
私たちは検出器を構築し、その証拠として属性マップを添付します。
私たちは、そのペアがコントロール下の186,527のイメージにもたらすものを測定します。
属性ランキングが存在するかどうかは、検出器が画像に反応するかどうかに依存する。
論文 参考訳(メタデータ) (2026-07-31T16:07:05Z) - Language Models Agree With Each Other, Not With Readers [1.8620637029128544]
我々は、その目的のために構築された誰もいない人間の参照に対する収束を測定する。
120のWebドキュメントに2,523のリードマークがある。
読者が読むものよりも確実に読者に同意するモデルはない。
論文 参考訳(メタデータ) (2026-07-31T10:44:10Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers [0.0]
大きな言語モデルがブランドを推奨するかどうかを測定するチームは、問題に直面します。
評価されたブランドスコアは、少なくとも4つの分離可能な理由(即時再サンプリング、フレーズのプロンプト、モデルアイデンティティ、クエリ言語)で動きます。
論文 参考訳(メタデータ) (2026-07-14T22:12:52Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。