論文の概要: JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems
- arxiv url: http://arxiv.org/abs/2604.23478v1
- Date: Sun, 26 Apr 2026 00:08:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.384726
- Title: JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems
- Title(参考訳): judgeSense: LLM-as-a-Judgeシステムにおけるプロンプト感度のベンチマーク
- Authors: Rohith Reddy Bellibatlu,
- Abstract要約: 大規模言語モデルは、他のモデルを評価するための自動判断器として、ますます多くデプロイされている。
我々は、判断感度スコア(JSS)を通じて、このプロパティを定量化するフレームワークとベンチマークであるJiceSenseを紹介します。
事実として、すべての審査員は、極性反転プロンプトアーティファクトによって駆動されるJSS付近に約0.63のクラスタをクラスタする。
コード、意思決定ログ、検証済みのパラフレーズデータセットをリリースし、標準化されたJSSレポートをサポートします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly deployed as automated judges for evaluating other models, yet the stability of their verdicts under semantically equivalent prompt paraphrases remains unmeasured. We introduce JudgeSense, a framework and benchmark for quantifying this property via the Judge Sensitivity Score (JSS), defined as the fraction of paraphrase pairs on which a judge returns an identical decision. Evaluating nine judge models on 494 validated paraphrase pairs, we find that coherence is the only task where judges meaningfully differ, with JSS ranging from 0.389 to 0.992. On factuality, all judges cluster near JSS about 0.63, driven by a polarity-inverted prompt artifact; after correction, factuality JSS rises to about 0.9. Pairwise tasks (preference and relevance) exhibit degenerate always-A behavior in 8 of 9 judges, indicating strong position bias. Model scale does not predict consistency. We release code, decision logs, and a validated paraphrase dataset to support standardized JSS reporting.
- Abstract(参考訳): 大規模言語モデルは、他のモデルを評価するための自動判断器としてますますデプロイされているが、意味論的に等価なプロンプトパラフレーズの下での検証の安定性は未測定のままである。
本稿では,判事が同じ判断を下すパラフレーズペアの分数として定義した判断感度スコア(JSS)を用いて,この特性を定量化するためのフレームワークおよびベンチマークであるJiceSenseを紹介する。
494のパラフレーズ対上での9つの判定モデルを評価すると,ジャッジが0.389から0.992の範囲で有意に異なるのはコヒーレンスのみであることがわかった。
事実について、すべての審査員は、極性反転したプロンプトアーティファクトによって駆動され、JSSの近傍に約0.63のクラスタを配置する。
ペアワイズタスク(前提と関連性)は、9人の審査員のうち8人の中で、常にAの振る舞いを示し、強い位置バイアスを示す。
モデルスケールは一貫性を予測しません。
コード、意思決定ログ、検証済みのパラフレーズデータセットをリリースし、標準化されたJSSレポートをサポートします。
関連論文リスト
- A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity [21.192000569821943]
我々は、厳密な目標と検証可能な構成がなければ、ベンチマークのランキングは、ほぼノイズの多い高信頼度ランキングを生成することができると論じる。
本稿では,Arena-Hard Autoが使用するELOスタイルのアグリゲーションが崩壊し,真のランキングの不確かさをマスクすることを示す。
我々の結果は、妥当性を損なう設計上の失敗を強調し、より良いスコープで信頼性に配慮したベンチマークを構築するための実用的な原則を提供する。
論文 参考訳(メタデータ) (2025-09-24T16:26:47Z) - Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators [66.83088028268318]
本稿では,テスト時間スケーリングベンチマークの判定評価について紹介する。
3つのタスク設定の下で、3つのドメイン(推論、コード生成、命令従)での判定性能を評価する。
我々のベンチマークは、審査員が再評価において結果報酬モデルと競合する一方で、ビームサーチにおけるプロセス報酬モデルよりも一貫して悪いことを示している。
論文 参考訳(メタデータ) (2025-04-21T17:33:23Z) - JudgeLM: Fine-tuned Large Language Models are Scalable Judges [48.053949045598344]
大規模言語モデル(LLM)をオープンなシナリオで評価することは、既存のベンチマークやメトリクスがそれらを包括的に測定できないため、難しい。
本稿では,拡張性のある審査員 (JudgeLM) としてLLMを微調整し,LLMを効率よく,かつ効率的に評価する手法を提案する。
我々は7B,13Bから33Bパラメータの異なるスケールでJiceLMを訓練し、その能力と振る舞いを体系的に分析する。
論文 参考訳(メタデータ) (2023-10-26T17:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。