論文の概要: From Judgment Quality to Downstream Utility: Rethinking LLM-as-a-Judge for Open-Ended Tasks
- arxiv url: http://arxiv.org/abs/2609.37145v1
- Date: Tue, 29 Sep 2026 09:41:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.395001
- Title: From Judgment Quality to Downstream Utility: Rethinking LLM-as-a-Judge for Open-Ended Tasks
- Title(参考訳): 判断品質から下流ユーティリティへ:オープンエンディングタスクにおけるLCM-as-a-Judgeの再考
- Abstract要約: LLM-as-a-Judgeは、基調的な答えを欠くオープンエンドタスクに対する政策対応の評価にますます利用されている。
既存の作業は、しばしば、結果の判断を直接、政策訓練の報奨信号に変換する。
提案手法は,判断の誘引方法と使用方法の両方を検証し,判定品質と下流ユーティリティについて検討する。
- 参考スコア(独自算出の注目度): 16.975395517578924
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-as-a-Judge is increasingly used to evaluate policy responses on open-ended tasks that lack ground-truth answers. Existing work often directly converts the resulting judgments into reward signals for policy training, paying limited attention to intrinsic judgment quality and largely restricting the use of Judges to training-time supervision. We systematically investigate judgment quality and downstream utility by examining both how judgments are elicited and how they are used. For judgment elicitation, we vary the Judge protocol along three dimensions: verdict granularity, critique usage, and evaluation batching. For judgment usage, beyond policy training, we extend Judge to test-time inference through Best-of-N selection, Judge-guided revision, and beam search. We find that, (i) Surprisingly, judgment quality and downstream utility do not always align. (ii) Judge protocol design substantially affects both intrinsic judgment quality and downstream utility. (iii) Judge guidance effectively converts test-time compute into performance gains, with benefits varying across inference strategies. Our results call for a multifaceted evaluation of LLM Judges on open-ended tasks, encompassing intrinsic judgment quality, and downstream utility.
- Abstract(参考訳): LLM-as-a-Judgeは、基調的な答えを欠くオープンエンドタスクに対する政策対応の評価にますます利用されている。
既存の作業は、結果の判断を直接、政策訓練の報酬信号に変換し、本質的な判断の質に限られた注意を払い、審査員を訓練時の監督に利用することを大幅に制限する。
提案手法は,判断の仕方と使用方法の両方を検証し,判定品質と下流ユーティリティを体系的に検討する。
判断の導出については, 粒度の検証, 批判的使用, 評価バッチ化の3つの側面に沿って, 審査プロトコルを変化させる。
判断用として、政策訓練を超えて、審査員をBest-of-N選択、審査員誘導修正、ビームサーチによりテストタイム推論に拡張する。
私たちはそれを見つける。
一 意外なことに、判定品質及び下流ユーティリティが常に整合しているとは限らない。
二 判定プロトコルの設計は、本質的な判断品質と下流ユーティリティの両方に大きく影響する。
3 審査指導は、実効的にテストタイム計算をパフォーマンスゲインに変換し、推論戦略によって利点が変化する。
本研究は,本質的な判断品質と下流ユーティリティを含むオープンエンドタスクにおけるLLM審査員の多面的評価を求めるものである。
関連論文リスト
- Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization [9.980463738635718]
本研究は,LLM-as-a-Judge評価における自由テキスト法定質問応答における迅速な設計と判断選択の役割について検討する。
自動タスクプロンプト最適化が人間中心設計よりも優れているか, 判断フィードバックスタイルによって最適化の有効性が変化するか, 判断者間での転送が最適化されるかを検討する。
論文 参考訳(メタデータ) (2026-04-22T16:12:36Z) - Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization [44.252712888022835]
大規模言語モデル(LLM)に基づく審査員は、自動評価と報酬モデリングに広く採用されている。
LLMに基づく審査員のバイアスを系統的に定量化するためのベンチマークであるJiceBiasBenchを提案する。
我々は、生成的および差別的な裁判官の両方にまたがって実験を行い、現在の裁判官が有意かつ多様なバイアスパターンを示すことを明らかにした。
論文 参考訳(メタデータ) (2026-03-09T08:32:21Z) - J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization [69.23273504123941]
私たちは、より複雑な評価設定で生じる位置バイアスに対して堅牢であるように、裁判官を訓練します。
我々はReasoningJudgeBenchというベンチマークを紹介します。
EIS-GRPOで訓練を受けた7B判事であるReasoning判事(J4R)は、GPT-4oを6.7%、そして9%で上回ります。
論文 参考訳(メタデータ) (2025-05-19T16:50:35Z) - Verdict: A Library for Scaling Judge-Time Compute [5.468405526095168]
Verdictは、自動評価器の精度、信頼性、解釈性を高めるために、判断時間計算をスケールするためのオープンソースのライブラリである。
評決は、マグニチュードの大きな微調整された審査員との競争を成し遂げる。
論文 参考訳(メタデータ) (2025-02-25T09:26:44Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z) - From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks [11.01213914485374]
数学的推論タスクにおいて,大規模言語モデル (LLM) について検討する。
本分析により,判定性能と候補モデルタスク性能との間に強い相関関係が明らかになった。
その結果、音声の一部タグのような単純な特徴を用いて、LLM判断者の行動を予測することができるかどうかを検証した。
論文 参考訳(メタデータ) (2024-09-06T10:09:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。