論文の概要: Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations
- arxiv url: http://arxiv.org/abs/2604.15302v1
- Date: Thu, 16 Apr 2026 17:58:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:32.047499
- Title: Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations
- Title(参考訳): LLM判定信頼性の診断:等式予測セットと推移振動
- Authors: Manan Gupta, Dhruv Kumar,
- Abstract要約: LLM-as-judge フレームワークは NLG の自動評価にますます利用されているが、そのインスタンスごとの信頼性はよく分かっていない。
SummEvalに応用した2段階の診断ツールキットについて述べる。 $textbf(1)$ 推移性解析により,低集合的違反率で隠蔽されるインプット毎の不整合の広範性を明らかにする。
4人の審査員と4つの基準で、どちらの診断も一致している。
- 参考スコア(独自算出の注目度): 4.032680910442999
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-as-judge frameworks are increasingly used for automatic NLG evaluation, yet their per-instance reliability remains poorly understood. We present a two-pronged diagnostic toolkit applied to SummEval: $\textbf{(1)}$ a transitivity analysis that reveals widespread per-input inconsistency masked by low aggregate violation rates ($\barρ = 0.8$-$4.1\%$), with $33$-$67\%$ of documents exhibiting at least one directed 3-cycle; and $\textbf{(2)}$ split conformal prediction sets over 1-5 Likert scores providing theoretically-guaranteed $\geq(1{-}α)$ coverage, with set width serving as a per-instance reliability indicator ($r_s = {+}0.576$, $N{=}1{,}918$, $p < 10^{-100}$, pooled across all judges). Critically, prediction set width shows consistent cross-judge agreement ($\bar{r} = 0.32$-$0.38$), demonstrating it captures document-level difficulty rather than judge-specific noise. Across four judges and four criteria, both diagnostics converge: criterion matters more than judge, with relevance judged most reliably (avg. set size $\approx 3.0$) and coherence moderately so (avg. set size $\approx 3.9$), while fluency and consistency remain unreliable (avg. set size $\approx 4.9$). We release all code, prompts, and cached results.
- Abstract(参考訳): LLM-as-judge フレームワークは NLG の自動評価にますます利用されているが、そのインスタンスごとの信頼性はよく分かっていない。
SummEvalに適用された2段階の診断ツールキットを提示する: $\textbf{(1)}$ 推移性解析により、低集合的違反率 (\barρ = 0.8$-$4.1\%$) で隠蔽される幅広いインプット不整合(英語版)(英語版)を明らかにし、33$-$67\%$で少なくとも1つの有向3サイクルを示す文書と、$\textbf{(2)}$ 1-5以上の共形予測セットを分割する。
批判的に、予測セットの幅は一貫性のあるクロスジャッジ合意($0.32$-0.38$)を示し、判断固有のノイズよりも文書レベルの難しさを捉えている。
4人の審査員と4つの基準で、どちらの診断も一致している。
set size $\approx 3.0$) and coherencely so (avg.set size $\approx 3.0$)
set size $\approx 3.9$) が、フルーエンシと一貫性は信頼できないままである。
set size $\approx 4.9$)。
すべてのコード、プロンプト、キャッシュされた結果をリリースします。
関連論文リスト
- Context Over Content: Exposing Evaluation Faking in Automated Judges [8.404817247058698]
本報告では, 下流の判断モデルに対して, 判定結果が評価モデルの継続動作に系統的に悪影響を及ぼすような, 未測定の脆弱性について検討する。
LLMの安全性と品質の3つのベンチマークにまたがる1,520の応答に対して,評価内容を厳密に一定に保持する,制御された実験フレームワークを導入する。
一貫性のある$textitleniency bias$: 低いスコアがモデルの再トレーニングや廃止を引き起こすことを知らせると、判断が確実に軟化する。
論文 参考訳(メタデータ) (2026-04-16T16:55:53Z) - Criterion-referenceability determines LLM-as-a-judge validity across physics assessment formats [0.01116979912801043]
我々は、GPT-5.2、Grok 4.1、Claude Opus 4.5、DeepSeek-V3.2、Gemini Pro 3、および盲目、解答、偽解、そして模範的な条件下でのヒトマーカーに対する委員会集計を比較した。
n=771ドルのブラインド大学試験の質問に対して、モデルは差別的妥当性の強い分数平均絶対誤差(fMAE)$approx 0.22$を達成する。
$n=55$スクリプト全体において、盲目のAIマーキングは人間のマーキングよりも厳格で可変的であり、差別的妥当性はすでに貧弱である。
論文 参考訳(メタデータ) (2026-03-16T02:09:06Z) - Consistency-Guided Decoding with Proof-Driven Disambiguation for Three-Way Logical Question Answering [4.878198984786631]
3方向の論理的質問応答(QA)は、$True/False/Unknown$を前提セット$S$の仮説に割り当てる。
CGD-PDは1つの3ウェイ分類器を$H$と$H$の機械式の両方でクエリする軽量なテスト時間層である。
論文 参考訳(メタデータ) (2026-03-12T18:26:16Z) - Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs [2.125148574616104]
大規模言語モデル(LLM)は、しばしば同じプロンプトの異なる言い回しに直面したときに矛盾する答えを生成する。
Flip-Flop Consistency(F2C$)を提案する。
提案手法は4つのNLPタスクにまたがる11のデータセットに対して,データセット毎に4~15のばらつきが生じる。
論文 参考訳(メタデータ) (2025-10-16T02:54:01Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Probabilistically Tightened Linear Relaxation-based Perturbation Analysis for Neural Network Verification [83.25968588249776]
本稿では,LiRPAに基づく手法とサンプリングに基づく手法を組み合わせることで,厳密な中間到達性集合を計算できる新しいフレームワークを提案する。
無視可能な計算オーバーヘッドでは、$textttPT-LiRPA$は推定された到達可能な集合を利用し、ニューラルネットワークの出力の上下線形境界を著しく締め付ける。
論文 参考訳(メタデータ) (2025-07-07T18:45:53Z) - Backward Conformal Prediction [46.298122008420414]
我々は、予測セットのサイズを柔軟に制御しながら、コンフォーマルカバレッジを保証するメソッドである$textitBackward Conformal Prediction$を紹介した。
提案手法は,観測データに基づいて,予測セットサイズがどう振る舞うかを制約するルールを定義し,それに応じてカバレッジレベルを適応させる。
このアプローチは、医療診断のような大きな予測セットが実用的でないアプリケーションで特に有用である。
論文 参考訳(メタデータ) (2025-05-19T21:08:14Z) - Mind the Gap: A Causal Perspective on Bias Amplification in Prediction & Decision-Making [58.06306331390586]
本稿では,閾値演算による予測値がS$変化の程度を測るマージン補数の概念を導入する。
適切な因果仮定の下では、予測スコア$S$に対する$X$の影響は、真の結果$Y$に対する$X$の影響に等しいことを示す。
論文 参考訳(メタデータ) (2024-05-24T11:22:19Z) - Federated Linear Bandits with Finite Adversarial Actions [20.1041278044797]
我々は、M$のクライアントが中央サーバと通信し、線形文脈の帯域幅問題を解決するための連合線形帯域幅モデルについて検討する。
逆有限作用集合のユニークな問題に対処するため、FedSupLinUCBアルゴリズムを提案する。
我々は、FedSupLinUCBが$tildeO(sqrtd T)$の完全後悔を達成したことを証明している。
論文 参考訳(メタデータ) (2023-11-02T03:41:58Z) - How to Query An Oracle? Efficient Strategies to Label Data [59.89900843097016]
機械学習におけるデータセットのラベル付けに専門家の託宣を照会する際の基本的な問題について考察する。
本稿では,サンプルをラベル付けするために,ラウンド・バイ・ラウンドでランダム化されたバッチアルゴリズムを提案し,クエリレートが$O(fracNk2)$であることを示す。
さらに,適応型グリージークエリ方式を提案し,三重項クエリを用いたサンプルあたり平均$approx 0.2N$クエリを実現する。
論文 参考訳(メタデータ) (2021-10-05T20:15:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。