論文の概要: Ask the Right Comparison:Bias-Aware Bayesian Active Top-$k$ Ranking with LLM Judges
- arxiv url: http://arxiv.org/abs/2607.02104v1
- Date: Thu, 02 Jul 2026 12:39:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.830997
- Title: Ask the Right Comparison:Bias-Aware Bayesian Active Top-$k$ Ranking with LLM Judges
- Title(参考訳): Ask the Right Comparison:Bias-Aware Bayesian Active Top-$k$ Ranking with LLM judges
- Authors: Jian Xu, Delu Zeng, John Paisley, Qibin Zhao,
- Abstract要約: 大規模言語モデル(LLM)は、候補出力をペアで比較する、安価でスケーラブルな判断器として、ますます使われている。
固定比較予算の下で,トップクアイテムを識別する実践的目標について検討する。
我々は,次の比較を選択し,不確実性を最大に低減する,トップク対応のアクティブな獲得ルールを導入する。
- 参考スコア(独自算出の注目度): 31.082191748525137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used as cheap, scalable judges that compare candidate outputs pairwise -- to rank responses, select models, or triage papers. Yet LLM judges are both noisy and systematically biased: they favor verbose or well-formatted answers and exhibit position effects, so simply aggregating their votes recovers a ranking of presentation, not of true quality. We study the practical goal of identifying the \topk{} items under a fixed comparison budget, and make two contributions. First, we cast judging as Bayesian inference over latent quality with explicit, judge-specific bias covariates (verbosity, position), regularized by a shrinkage prior so that the data decide which biases a given judge actually exhibits. Second, we introduce a \topk-aware active acquisition rule that chooses the next comparison to maximally reduce uncertainty about \topk{} \emph{membership}, rather than about the full ranking. On a controlled benchmark with known ground-truth quality, judged by sixteen real LLMs spanning open and proprietary families (Llama, Qwen, Phi-4, GPT-4o-mini/5.1/5.5, Gemini, DeepSeek, and Claude Haiku/Sonnet/Opus), naive aggregation plateaus at a wrong \topk{} on biased judges regardless of budget, while our bias-aware model recovers it; \topk-aware acquisition reaches this ceiling with far fewer comparisons than round-robin or a global-uncertainty (D-optimal) rule. Bias is real but heterogeneous and capability-dependent: cheap and mid-tier judges carry a strong verbosity bias that our model corrects (lifting recall from $\sim$$0.5$--$0.6$ to $0.84$--$1.0$), whereas the frontier judges we tested show little bias and already rank accurately, so bias-aware modeling changes little there.
- Abstract(参考訳): 大規模言語モデル(LLM)は、応答のランク付けやモデルの選択、トリアージ文書の取得など、候補出力をペアで比較する、安価でスケーラブルな判断手段として、ますます使われています。
しかし、LLMの審査員は騒々しく、体系的に偏りがある。彼らは口頭弁論や、よく形づくられた回答を好み、位置効果を示すため、投票を集計するだけで、真の品質ではなく、プレゼンテーションのランキングが回復する。
固定比較予算の下で, トピック{}項目を識別する実践的目標について検討し, 2つのコントリビューションを行う。
まず, 偏差が実際に現れるかを決定するために, ゆるやかな偏差(偏差, 位置, 偏差)を定式化して, 潜時品質に対するベイズ推定を行った。
第2に,次の比較を選択することで,全ランク付けではなく,最大で \topk{} \emph{membership} の不確実性を減らすことができる。
オープンおよびプロプライエタリなファミリー(Llama, Qwen, Phi-4, GPT-4o-mini/5.1/5, Gemini, DeepSeek, Claude Haiku/Sonnet/Opus)にまたがる16の実 LLM によって判断される、既知の基盤品質のベンチマークでは、予算に関わらず、偏見のある審査員に間違った値の集計プラトーを吐き出します。
安値と中値の裁判官は、我々のモデルが正すような強い冗長性バイアス($\sim$$0.5$--0.6$から$0.84$--1.0$へのリコール)を持ちます。
関連論文リスト
- Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings [30.711773754965986]
本研究では, 対比較によるモデルランキングは, 比較対象の真理が得られれば, 地中真理に基づく精度ランキングと強く一致することを示す。
いずれの解答も正解であるようなペアで発生する判断がほとんどであるにもかかわらず、スタイルと判断バイアスはモデルランキングに小さな影響しか与えないことがわかった。
論文 参考訳(メタデータ) (2026-06-08T12:26:54Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges [3.974554103907186]
ラベル付きキャリブレーションデータを用いたマルチジャッジ評価では、弱い判断を精度だけで破棄しないことが示されている。
本稿では, 適切なスコアリングルール下での最適校正リスクが, 付加的な判定信号が利用可能になった場合に増大しないことを示すオラクル分析による逆転について説明する。
論文 参考訳(メタデータ) (2026-05-10T18:49:58Z) - Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines [0.0]
4つのプロバイダファミリーの5つの審査モデルに対して,9つのデバイアスング戦略を比較した。
スタイルバイアスは支配的バイアス(全モデルで0.76-0.92)であり、位置バイアス(=0.04)をはるかに超えている。
統合予算戦略により、Claude Sonnet 4 は+11.2 pp (p 0.0001) に大幅に改善され、他のモデルの方向性に好意的な傾向が見られた。
論文 参考訳(メタデータ) (2026-04-25T07:18:30Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z) - Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data [14.95829896035971]
新たなデバイアスツールのファミリーは、いくつかの高品質なラベルを使用して多数のモデル判断をデバイアスすることで、問題を解決することを約束している。
本研究の主目的は,審査員が評価モデルに比較して精度が低い場合,デバイアス法が要求される地上の真実ラベルの量を半分以上減らすことができないことである。
論文 参考訳(メタデータ) (2024-10-17T08:49:42Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z) - The price of unfairness in linear bandits with biased feedback [62.25313751895011]
線形帯域フィードバックによる逐次意思決定の問題点について検討する。
その結果,不偏フィードバック下で得られたdT 1/2 log(T) の後悔率よりも最悪の後悔率が高いことがわかった。
興味深いことに、ギャップ依存率によって、問題はバイアスのないものほど難しくない非自明なインスタンスの存在が明らかになる。
論文 参考訳(メタデータ) (2022-03-18T08:03:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。