論文の概要: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- arxiv url: http://arxiv.org/abs/2609.26550v1
- Date: Tue, 22 Sep 2026 15:05:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.718384
- Title: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- Title(参考訳): JEV-as-a-Judge: 確信があれば受け入れ、不確実であればエスカレートする
- Abstract要約: LLM-as-a-judgeは様々なタスクに対する評価を可能にするが、大規模では推論コストと信頼性が重要になる。
我々は、意思決定のみの裁判官が経済的第一パスを提供し、いつより強い評価が必要かを特定することができるかどうかを検討する。
- 参考スコア(独自算出の注目度): 8.817173484053148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-a-judge enables evaluation across diverse tasks, but inference cost and confidence reliability become critical at scale. We study whether a decision-only judge can provide an economical first pass and identify when stronger evaluation is needed. Comparing jev-as-a-judge with sixteen generative and reward-model judges, with blinded human adjudication, we find it within three percentage points of a state-of-the-art LLM judge, our strongest comparator, on ordinary preference and evidence-grounded factuality at 0.36% of the comparator's fee. Larger gaps arise when judgments require checking a derivation or resisting an elaborately written wrong answer. On several benchmarks, JEV's gap to this comparator is concentrated in low-confidence decisions. A frozen cascade that accepts confident verdicts and escalates uncertain ones retains 99% of the comparator's accuracy at lower cost.
- Abstract(参考訳): LLM-as-a-judgeは様々なタスクに対する評価を可能にするが、大規模では推論コストと信頼性が重要になる。
我々は、意思決定のみの裁判官が経済的第一パスを提供し、いつより強い評価が必要かを特定することができるかどうかを検討する。
ジェブ・ア・ジャッジ(Jev-as-a-judge)と16人のジェブ・ア・ジャッジ(en:Jev-as-a-judge)と、視覚障害者(en:Brained Human Adjudication)とを比較した。
より大きなギャップは、判断が導出を確認したり、精巧に書かれた間違った答えに抵抗する必要があるときに生じる。
いくつかのベンチマークでは、JEVのこのコンパレータとのギャップは低信頼の判断に集中している。
確実な判定を受け、不確実な判定をエスカレートする冷凍カスケードは、コンパレータの精度の99%を低コストで保持する。
関連論文リスト
- Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus [43.232837964609416]
オープンウェイトとフロンティアLLMの双方の判定において,かなりの誤差相関が認められた。
比較の最大28%では、共有エラーを無視することは、1つのシステムの方がはるかに優れているという結論につながる。
評価精度を推定し,共有誤りを同定するために,信頼された少数の例を用いるという,単純なアプローチを提案する。
論文 参考訳(メタデータ) (2026-09-18T19:20:40Z) - Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration [0.5294698352039444]
より現実的なユースケースを反映した絶対スコアリングタスクについて検討する。
モデルのタスク精度は、その判断精度を強く予測することを示す。
より有能な試験モデルは、すべての裁判官からより寛大な判断を受ける。
論文 参考訳(メタデータ) (2026-09-10T00:25:39Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems [2.9141470183751674]
スケーラブルでコンテキスト対応な評価のための動的学習ベースのフレームワークを提案する。
本手法は,LLM審査員が人間専門家といつ一致するかを評価するために,信頼度予測器のセットを訓練する。
要約およびRAGベンチマーク実験により,我々の動的陪審法は,単一判定基準と静的判定基準の両方よりも,人間の判断との相関が著しく高いことを示した。
論文 参考訳(メタデータ) (2025-12-01T15:26:20Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z) - J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization [69.23273504123941]
私たちは、より複雑な評価設定で生じる位置バイアスに対して堅牢であるように、裁判官を訓練します。
我々はReasoningJudgeBenchというベンチマークを紹介します。
EIS-GRPOで訓練を受けた7B判事であるReasoning判事(J4R)は、GPT-4oを6.7%、そして9%で上回ります。
論文 参考訳(メタデータ) (2025-05-19T16:50:35Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。