論文の概要: Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation
- arxiv url: http://arxiv.org/abs/2608.05353v2
- Date: Tue, 11 Aug 2026 02:22:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.385828
- Title: Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation
- Title(参考訳): コミット前のエビデンスロック:LDM-as-Judge評価を低下させる凍結インターフェース
- Abstract要約: このワークフローは、中間レコードが後続の判断に必要な情報を保存していると仮定する。
推論可能なモデルの場合、可視場秩序は内部決定順序を明らかにしないので、観測可能な代替品を試す。
我々は、標準的なペアワイズ判定、構造化ワンコール判定、ツーコールエビデンスロック、および3コールポイントワイズロックを、Claude Sonnet 4.5 と GPT-5 で比較した。
- 参考スコア(独自算出の注目度): 0.6768558752130311
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM judges are often asked to extract criteria and evidence before choosing between candidate answers. This workflow assumes that the intermediate record preserves the information needed for a later verdict. For reasoning-capable models, visible field order does not reveal internal decision order, so we test an observable alternative: persist the evidence in one call and make it the exclusive input to the next. Across 24,000 judgments over HelpSteer3, FeedbackQA, and CoVal, we compare standard pairwise judging, structured one-call judging, two-call evidence locking, and three-call pointwise locking with Claude Sonnet 4.5 and GPT-5. Evidence locking reduces agreement with released human preferences by 4 to 6 percentage points and increases answer-order inconsistency by 8 to 10 points relative to structured one-call judging. Pointwise locking is also harmful, while structured evidence elicitation remains close to standard judging. The result holds for both judges and all three datasets. Persisted evidence can support auditability, but it should not replace the source answers at decision time.
- Abstract(参考訳): LLM審査員はしばしば、候補者の回答を選択する前に、基準と証拠を抽出するよう求められる。
このワークフローは、中間レコードが後続の判断に必要な情報を保存していると仮定する。
推論可能なモデルでは、可視界順序は内部決定順序を明らかにしないので、観測可能な代替品として、証拠を1回の呼び出しで持続し、それを次の呼び出しへの排他的な入力とする。
HelpSteer3, FeedbackQA, CoValに対する24,000件の判定において、標準的なペアワイド判定、構造化された1コール判定、2コールエビデンスロック、Claude Sonnet 4.5およびGPT-5による3コールポイントワイドロックを比較した。
エビデンス・ロックは、解放された人間の嗜好との一致を4~6ポイント削減し、構造化されたワンコール判定と比較して回答順序の不整合を8~10ポイント向上させる。
ポイントワイド・ロックもまた有害であるが、構造化された証拠は標準的な判断に近づいている。
結果は、審査員と3つのデータセットの両方に当てはまる。
パーシスタンスされた証拠は監査性を支持することができるが、決定時に元の回答を置き換えるべきではない。
関連論文リスト
- RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees [16.73004625486562]
LLMを審査員として使用することは、大規模にモデル出力を評価するための標準的なプラクティスとなっている。
基準回答がない場合、審査員はパラメトリック知識またはツール拡張を通じて事実の正しさを評価する。
提案するリスク管理フレームワークは,不確実性のしきい値の正当性を判定し,ユーザの特定レベル以下で検証できる。
論文 参考訳(メタデータ) (2026-08-18T16:42:02Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability [0.0]
LLM-as-judgeスコアは、単に評価器が変更されたため、候補応答が固定されたままでも移動することができる。
Qwen3の高密度なジャッジを1.7Bから32Bパラメータにスケーリングし、MiniMax M2-M2.7リリースのAPIを移動します。
Qwen3 1.7B から 4B へのアップグレードだけでは、MiniMax リリースはそうではない。
論文 参考訳(メタデータ) (2026-07-09T14:31:05Z) - How Sensitive Are Safety Benchmarks to Judge Configuration Choices? [5.94231111588812]
HarmBenchのような安全ベンチマークは、モデル応答を有害または安全と分類する判断に頼っている。
判定モデルと判定プロンプトの組み合わせは,一般に一定の実装の詳細として扱われる。
審査員モデルの定式化により, 評価された有害応答率を最大24.2%にシフトした。
論文 参考訳(メタデータ) (2026-04-27T05:59:59Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation [17.386684382460242]
大規模言語モデル(LLM)は、推論、質問応答、創造的記述といったタスクにおけるシステムの出力を評価するために、ますます使われてきている。
6つの判定モデルに対する評価プロンプトに挿入された制御キュー摂動合成メタデータラベルを用いて,この理想を検証した。
情報源,時間,年齢,性別,民族,教育的地位の6つのキュー族を調査する。
論文 参考訳(メタデータ) (2026-02-08T14:45:23Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。