論文の概要: Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions
- arxiv url: http://arxiv.org/abs/2610.09229v1
- Date: Tue, 06 Oct 2026 23:46:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.64903
- Title: Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions
- Title(参考訳): 条件精度プロファイル:展開条件におけるLCM審査員の診断
- Abstract要約: textbfConditional Accuracy Profiling (CAP)を導入する。
CAPは、LLM-judgeの精度をコンテンツ感度、堅牢性、合理的品質の8つの条件に分解する。
CAPは、集計精度によって隠されたプロファイルの違いを公開する。
- 参考スコア(独自算出の注目度): 8.823652469689497
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-judge is now a standard tool for scalable evaluation, but judge performance is still often summarized by a single accuracy number. This aggregate view hides the deployment conditions under which a judge succeeds or fails. We introduce \textbf{Conditional Accuracy Profiling} (CAP), a post-hoc diagnostic framework that decomposes pairwise LLM-judge accuracy into eight conditions organized into content sensitivity, robustness, and rationale quality. CAP is benchmark-agnostic: it can be applied directly when a benchmark provides the required annotations, approximately through task-subset proxies, or through controlled augmentation when perturbation pairs can be generated. We instantiate CAP on seven LLM judges across six pairwise judging benchmarks, including \textsc{judgerEva-Standard}, a controlled testbed we created to support all eight conditions. CAP exposes profile differences hidden by aggregate accuracy: on \textsc{judgerEva}'s judge-independent Hard-Constructed subset, the two judges most sensitive to omitted qualifications rank in the bottom three of seven by overall accuracy, so omission sensitivity is not predicted by aggregate accuracy. Across benchmarks, Position Robustness shows the strongest rank stability (mean Spearman $\barρ{=}0.87$) but is itself fragile under JudgeBench-Pro adversarial stress, showing the largest mean accuracy drop among the shared conditions, though the dominant degradation channel varies by judge. Condition-level profiles provide a more actionable basis than aggregate accuracy for selecting LLM judges.
- Abstract(参考訳): LLM-as-judgeは現在、スケーラブルな評価のための標準的なツールであるが、判定性能は依然として1つの精度で要約されている。
この集合ビューは、裁判官が成功または失敗するデプロイメント条件を隠す。
コンテンツ感度, 堅牢性, 合理性品質の8つの条件に, LLM-judge の精度を分解するポストホック診断フレームワークである \textbf{Conditional Accuracy Profiling} (CAP) を導入する。
CAPはベンチマークに依存しない: ベンチマークが必要なアノテーションを提供する場合、タスク-サブセットプロキシを通じて、あるいは摂動ペアを生成する場合、制御された拡張を通じて、直接適用することができる。
8つの条件すべてをサポートするために作成した制御テストベッドであるtextsc{judgerEva-Standard} を含む6つのペアワイズ判定ベンチマークで、CAPを7つのLCM判事にインスタンス化する。
CAPは、集合的精度で隠されたプロファイルの違いを露呈する: \textsc{judgerEva}の判断非依存のハードコンストラクテッドサブセットでは、この2つの判断は、全体的な精度で7の下位3の省略された資格ランクに最も敏感であるため、省略感度は集合的精度によって予測されない。
ベンチマーク全体では、位置ロバストネスは最も高いランク安定性を示す(平均スピアマン$\barρ{=}0.87$)が、それ自身はジャッジベンチ=プロの逆ストレスの下で脆弱であり、共有条件の中で最大の平均精度低下を示すが、支配的な劣化チャネルは判断によって異なる。
条件レベルのプロファイルは、LCM審査員を選択するための集計精度よりも、より実用的な基礎を提供する。
関連論文リスト
- Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees [16.73004625486562]
LLMを審査員として使用することは、大規模にモデル出力を評価するための標準的なプラクティスとなっている。
基準回答がない場合、審査員はパラメトリック知識またはツール拡張を通じて事実の正しさを評価する。
提案するリスク管理フレームワークは,不確実性のしきい値の正当性を判定し,ユーザの特定レベル以下で検証できる。
論文 参考訳(メタデータ) (2026-08-18T16:42:02Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges [3.974554103907186]
ラベル付きキャリブレーションデータを用いたマルチジャッジ評価では、弱い判断を精度だけで破棄しないことが示されている。
本稿では, 適切なスコアリングルール下での最適校正リスクが, 付加的な判定信号が利用可能になった場合に増大しないことを示すオラクル分析による逆転について説明する。
論文 参考訳(メタデータ) (2026-05-10T18:49:58Z) - MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following [8.500414706731036]
本稿では,制約レベル判定のベンチマークであるMCJudgeBenchを紹介する。
各インスタンスには、命令、候補応答、明示的な制約リスト、Yes、部分的、ノー、制御された応答側の摂動を含む。
我々は、正確性と矛盾性の両方の指標を用いて、プロプライエタリかつオープンソースのLCM審査員を評価した。
論文 参考訳(メタデータ) (2026-05-05T15:20:42Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity [21.192000569821943]
我々は、厳密な目標と検証可能な構成がなければ、ベンチマークのランキングは、ほぼノイズの多い高信頼度ランキングを生成することができると論じる。
本稿では,Arena-Hard Autoが使用するELOスタイルのアグリゲーションが崩壊し,真のランキングの不確かさをマスクすることを示す。
我々の結果は、妥当性を損なう設計上の失敗を強調し、より良いスコープで信頼性に配慮したベンチマークを構築するための実用的な原則を提供する。
論文 参考訳(メタデータ) (2025-09-24T16:26:47Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。