論文の概要: Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA
- arxiv url: http://arxiv.org/abs/2606.28050v1
- Date: Fri, 26 Jun 2026 12:52:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.487544
- Title: Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA
- Title(参考訳): LLMは生成より優れているか?-文脈内QAにおけるタスク非対称性、機械的解釈可能性、伝達可能性の評価
- Abstract要約: LLM-as-a-Judgeと自己評価パイプラインは、評価が生成よりも容易であると暗黙的に仮定する。
我々は、コンテキストパスが唯一の情報ソースであり、各モデルが生成した回答を判断する、制御されたコンテキスト内QA設定でこれをテストする。
- 参考スコア(独自算出の注目度): 29.72543819937029
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: LLM-as-a-Judge and self-evaluation pipelines implicitly assume that evaluation is easier than generation. We test this in a controlled in-context QA setting where a context passage is the sole information source and each model judges the answer it generated, removing the parametric-knowledge confound of open-domain comparisons. Across four benchmarks (SQuAD 2.0, DROP, HotpotQA, MuSiQue) and two models, evaluation is not uniformly easier: generation accuracy exceeds self-evaluation on three of four, with multi-hop MuSiQue the exception. Attention analysis reveals why: evaluation attends to context 3--5x less than generation does and barely reads the candidate answer. LoRA fine-tuning confirms the asymmetry is not a training artifact: generation fine-tuning induces over-acceptance and evaluation fine-tuning degrades generation. These findings challenge core assumptions in self-evaluation pipelines.
- Abstract(参考訳): LLM-as-a-Judgeと自己評価パイプラインは、評価が生成よりも容易であると暗黙的に仮定する。
我々は、コンテキストパスが唯一の情報ソースであり、各モデルが生成した回答を判断し、オープンドメイン比較のパラメトリック知識を除去する制御されたコンテキスト内QA環境でこれをテストする。
4つのベンチマーク(SQuAD 2.0、DROP、HotpotQA、MuSiQue)と2つのモデルにおいて、生成精度は4つのうち3つで自己評価を超え、MuSiQueは例外である。
注意分析は、なぜかを明らかにする: 評価は、世代よりも3~5倍少ない文脈に出席し、候補の答えをほとんど読まない。
LoRAファインチューニングは、非対称性がトレーニングアーティファクトではないことを確認し、ジェネレーションファインチューニングは過剰な受け入れを誘導し、微調整デグレードの生成を評価する。
これらの知見は自己評価パイプラインの中核的な仮定に挑戦する。
関連論文リスト
- The RAT: A Unified Bayesian Model for RAG Evaluation [8.650407684623714]
本稿では,検索成功,棄却行動,回答正当性を共同でモデル化するベイズ評価フレームワークを提案する。
フレームワークを3つのデータセット、3つのレトリバー、3つのジェネレータにわたる27のRAG構成に適用する。
我々は、LLM-as-a-judgeアノテーションをキャリブレーションされたノイズ観測として組み込むようモデルを拡張した。
論文 参考訳(メタデータ) (2026-08-25T15:54:30Z) - HarnessEval-W: Agentifying the Evaluation of Visual Worlds [149.63310396189317]
HarnessEval-Wは、世界モデルのベンチマークのためのエージェント化された評価パイプラインである。
HarnessEval-Wは固定ルーブリックを適用するのではなく、評価問題を測定可能なサブプロブレムに分解する。
330件の評価事例に対して,HarnessEval-Wを18の代表的な世界モデルに適用した。
論文 参考訳(メタデータ) (2026-08-17T17:43:24Z) - Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents [0.0]
単ターンUQ手法の3つの共通ファミリーが対話的軌道設定に遷移するかどうかを検討する。
転送はしばしば有用であるが、不均一であることがわかった。 トークン確率スコアは、各ターンで使用されるアグリゲータの選択に非常に敏感である。
ブラックボックスの自己整合性はしばしば最強のUQファミリーであり、軌跡等価性とアクションセットの整合性は変種の中では最高である。
論文 参考訳(メタデータ) (2026-08-12T01:39:28Z) - More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs [3.373200015661364]
本研究では,小言語モデル(SLM)の自己補正能力について検討する。
本稿では,SLMの初期回答を収集する最小3ステップの自己補正パイプラインを提案する。
本研究では,算術的および論理的推論ベンチマークを用いた実験装置において,様々な命令調整および推論SLMを評価した。
論文 参考訳(メタデータ) (2026-06-07T06:27:37Z) - The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation [17.386684382460242]
大規模言語モデル(LLM)は、推論、質問応答、創造的記述といったタスクにおけるシステムの出力を評価するために、ますます使われてきている。
6つの判定モデルに対する評価プロンプトに挿入された制御キュー摂動合成メタデータラベルを用いて,この理想を検証した。
情報源,時間,年齢,性別,民族,教育的地位の6つのキュー族を調査する。
論文 参考訳(メタデータ) (2026-02-08T14:45:23Z) - LogicScore: Fine-grained Logic Evaluation of Conciseness, Completeness, and Determinateness in Attributed Question Answering [29.294167109756042]
ローカルアセスメントからグローバルな推論の精査へとパラダイムをシフトさせる統合評価フレームワークであるtextscLogicScore を提示する。
提案手法は,テキスト完全性(論理的音声推論),テキスト簡潔性(非冗長性),テキスト決定性(一貫性解答包含)の3つの重要な推論次元を評価するために,後方検証機構を統合する。
論文 参考訳(メタデータ) (2026-01-21T14:52:03Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark [39.64489055580211]
実データと反実データからなる新しい評価ベンチマークであるCofCA(Step-wise Counterfactual benchmark)を導入する。
実験の結果,ウィキペディアをベースとした事実データと反事実データの間には,既存のベンチマークにおけるデータ汚染問題を推定し,大きな性能差があることが判明した。
論文 参考訳(メタデータ) (2024-02-19T08:12:30Z) - PEDANTS: Cheap but Effective and Interpretable Answer Equivalence [10.367359022491181]
我々は,Triviaコミュニティで採用されているマシンQAを評価するために,ルーリックとデータセットを提供する。
また、正確なマッチングとニューラルメソッド(BERTScore)よりも安定な、効率的で解釈可能なQA評価を提案する。
論文 参考訳(メタデータ) (2024-02-17T01:56:19Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - SQUARE: Automatic Question Answering Evaluation using Multiple Positive
and Negative References [73.67707138779245]
SQuArE (Sentence-level QUestion AnsweRing Evaluation) という新しい評価指標を提案する。
文レベルの抽出(回答選択)と生成(GenQA)の両方のQAシステムでSQuArEを評価する。
論文 参考訳(メタデータ) (2023-09-21T16:51:30Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。