論文の概要: Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG
- arxiv url: http://arxiv.org/abs/2607.10626v1
- Date: Sun, 12 Jul 2026 07:39:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.48577
- Title: Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG
- Title(参考訳): Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM judges for Grounded RAG
- Authors: Sriram Selvam, Anneswa Ghosh,
- Abstract要約: 本稿では,ソースグラウンドRAGのための制御メタ評価プロトコルであるEval-Pair Matrixを紹介する。
GPT,Grok,Geminiモデルを用いた摂動通路から解答を生成し,視覚障害者と同じモデルを用いて各解答を元の解答に対して評価する。
実験には300個のコアレコード、897個のラベル付きジェネレータ出力、および2,683個の判定結果が含まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-a-judge evaluation is widely used for retrieval-augmented generation (RAG), but reusing the same model family as both generator and judge makes self-leniency difficult to identify. We introduce Eval-Pair Matrix, a controlled meta evaluation protocol for source-grounded RAG. Starting from GaRAGe questions and grounding passages, we induce one hidden answer-causal contradiction per record, generate answers from perturbed passages with GPT, Grok, and Gemini models, and then use the same models as blind judges to evaluate each answer against the original passages. The experiment contains 300 core records, 897 labeled generator outputs, and 2,683 judge verdicts in a crossed 3 x 3 matrix; the primary analysis uses 275 fully validated records. Instead of comparing diagonal and off-diagonal cells across different answers, we estimate same-model effects by pairing judges on the exact same candidate answer. This changes the interpretation: diagonal and off diagonal F1 are similar, and the paired same-model recall effect is near zero (-0.5 pp; 95% cluster bootstrap CI [-2.7, +1.7]). The only robust paired gap is lower matching-judge flagging for answers that avoided the induced claim (-4.3 pp). A targeted human evaluation finds that reviewed apparent false positives are alternate source-error detections, mistakes in labeling whether the induced claim was adopted, or unclear cases; none were adjudicated as genuine false alarms. The lesson is methodological: RAG judge studies should report full matrices, answer-paired effects, behavior strata, and label-task alignment.
- Abstract(参考訳): LLM-as-a-judge評価は、検索強化世代(RAG)に広く用いられているが、ジェネレータとジャッジの両方と同じモデルファミリを再利用することで、自己リエンスの識別が困難になる。
本稿では,ソースグラウンドRAGのための制御メタ評価プロトコルであるEval-Pair Matrixを紹介する。
GaRAGe質問と接地パスから、記録ごとに1つの隠れた回答因果矛盾を誘発し、GPT、Grok、Geminiモデルによる摂動通路から回答を生成し、その後、ブラインドジャッジと同じモデルを使用して、各回答を元のパスに対して評価する。
実験では、300コアレコード、897ラベル付きジェネレータ出力、2,683の判定結果が交差した3 x 3行列に含まれており、一次解析では275の完全検証レコードが使用されている。
対角細胞と対角細胞を異なる解法で比較する代わりに, 正の正の正の解答について, 対の判定者による同モデル効果を推定する。
対角 F1 と対角 F1 は類似しており、対の同モデルリコール効果はゼロに近い(-0.5 pp; 95% のクラスタブートストラップ CI [-2.7, +1.7])。
唯一のロバストなペアギャップは、引き起こされたクレーム(4.3 pp)を避けた答えに対するマッチング・ジャッジのフラグングである。
対象とする人間の評価では、レビューされた明らかな偽陽性は、代替のソースエラー検出、誘導されたクレームが採用されたかどうかのラベル付けミス、不明なケースであることがわかった。
RAG判事の研究は、完全な行列、回答対効果、行動層、ラベルとタスクのアライメントを報告すべきである。
関連論文リスト
- AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability [16.27940179594792]
AdversaBenchは、5つの構造化演算子でシードプロンプトをミュートするエンドツーエンドの赤チームパイプラインである。
本報告では, 推論, 指示追従, ツール利用の3つのカテゴリにまたがる45種の種子について実験を行った。
論文 参考訳(メタデータ) (2026-06-23T13:50:51Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs [0.0]
クレームを4方向のタイポロジー(接地,非接地,矛盾,相補的)に分割する基盤性フレームワークを提案する。
GSARは、明示的な計算予算の下で、結合された回復を伴うエビデンス型スコアリングを結合した最初の基盤フレームワークである。
論文 参考訳(メタデータ) (2026-04-25T16:20:28Z) - Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce [10.670366057920205]
対話型AIの評価には多次元対話評価が広く用いられている。
品質スコアが、彼らが提供しようとするダウンストリームの結果と結びついているかどうか、ほとんどテストされていないままです。
LLM-as-Judgeで実装した7次元評価ルーブリックを、検証されたビジネス変換に対して試験する。
論文 参考訳(メタデータ) (2026-03-11T04:47:42Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - LLMs Can Patch Up Missing Relevance Judgments in Evaluation [56.51461892988846]
我々は、大きな言語モデル(LLM)を使って、不確定な文書を自動的にラベル付けします。
TREC DLトラックの関連性判定から関連文書をランダムにドロップすることで,穴の度合いの異なるシナリオをシミュレートする。
Vicuna-7B と GPT-3.5 Turbo の平均値に対して,Kendall tau の0.87 と 0.92 の相関式が得られた。
論文 参考訳(メタデータ) (2024-05-08T00:32:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。