論文の概要: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- arxiv url: http://arxiv.org/abs/2609.26550v3
- Date: Tue, 29 Sep 2026 15:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.526723
- Title: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- Title(参考訳): JEV-as-a-Judge: 確信があれば受け入れ、不確実であればエスカレートする
- Abstract要約: テキストの代わりにラベルの確率を返却する判断専用判断器であるJEVを用いて評価を行う。
16人のジェネレーティブおよび報酬モデル判事に対して、視覚障害者はGPT-6の3点以内である。
しきい値が予め凍結されているため、確実な判定を受け、残りをエスカレートすることは、GPT-6よりも0.9ポイント正確である。
- 参考スコア(独自算出の注目度): 8.817173484053148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-a-judge scales evaluation, but reasoning judges are slow and costly. We study JEV-as-a-Judge: evaluation with JEV, a decision-only judge that returns label probabilities instead of text, and whose confidence decides whether to accept its verdict or escalate to a reasoning judge. Against sixteen generative and reward-model judges, with blinded human adjudication, JEV comes within three points of GPT-6 wherever a verdict can be read off the text, at 0.36% of its fee and a 0.15-second median latency, and falls behind where the verdict must be derived, as in math, code, and logic. Its confidence marks this boundary. With a threshold frozen in advance, accepting confident verdicts and escalating the rest is 0.9 points more accurate than GPT-6 on 1,610 held-out pairs at 41% of its fee, and in a pre-specified live test on two new workloads the cascade matches GPT-6's accuracy exactly. Confidence routing weakens on style-adversarial pairs and reference-free prose; we close with a simple recipe for validating thresholds locally.
- Abstract(参考訳): LLM-as-a-judgeは評価をスケールするが、推論判断は遅くてコストがかかる。
JEV-as-a-Judge: Evaluation with JEV, a decision-only judge that return label probabilities without text, and that confidence decides whether the verdict or escalate to a reasoning judge。
16人の生成的および報酬モデル判事に対して、人間の判断が盲目である場合、JEVはGPT-6の3点以内で、評定はテキストから読み取ることができ、その料金の0.36%と0.15秒の中央値のレイテンシで、数学、コード、論理のように、評定を導出しなければならない。
その自信はこの境界線を示す。
しきい値が事前に凍結され、確実な判定とエスカレートが1,610対の1,610対のGPT-6よりも0.9ポイント正確であり、2つの新しいワークロードでの事前のライブテストでは、カスケードはGPT-6の精度と正確に一致している。
信頼ルーティングは、スタイル-逆対と参照なしの散文を弱め、局所的なしきい値の検証のための簡単なレシピをクローズする。
関連論文リスト
- Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus [43.232837964609416]
オープンウェイトとフロンティアLLMの双方の判定において,かなりの誤差相関が認められた。
比較の最大28%では、共有エラーを無視することは、1つのシステムの方がはるかに優れているという結論につながる。
評価精度を推定し,共有誤りを同定するために,信頼された少数の例を用いるという,単純なアプローチを提案する。
論文 参考訳(メタデータ) (2026-09-18T19:20:40Z) - Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration [0.5294698352039444]
より現実的なユースケースを反映した絶対スコアリングタスクについて検討する。
モデルのタスク精度は、その判断精度を強く予測することを示す。
より有能な試験モデルは、すべての裁判官からより寛大な判断を受ける。
論文 参考訳(メタデータ) (2026-09-10T00:25:39Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems [2.9141470183751674]
スケーラブルでコンテキスト対応な評価のための動的学習ベースのフレームワークを提案する。
本手法は,LLM審査員が人間専門家といつ一致するかを評価するために,信頼度予測器のセットを訓練する。
要約およびRAGベンチマーク実験により,我々の動的陪審法は,単一判定基準と静的判定基準の両方よりも,人間の判断との相関が著しく高いことを示した。
論文 参考訳(メタデータ) (2025-12-01T15:26:20Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z) - J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization [69.23273504123941]
私たちは、より複雑な評価設定で生じる位置バイアスに対して堅牢であるように、裁判官を訓練します。
我々はReasoningJudgeBenchというベンチマークを紹介します。
EIS-GRPOで訓練を受けた7B判事であるReasoning判事(J4R)は、GPT-4oを6.7%、そして9%で上回ります。
論文 参考訳(メタデータ) (2025-05-19T16:50:35Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。