論文の概要: CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2604.05467v1
- Date: Tue, 07 Apr 2026 06:05:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.650476
- Title: CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation
- Title(参考訳): CUE-R:Retrieval-Augmented Generationの最終回答を超える
- Authors: Siddharth Jain, Venkat Narayan Vedam,
- Abstract要約: CUE-Rは、単発RAGにおいて、エビデンス単位の操作性を測定するためのフレームワークである。
CUE-RはREMOVE、REPLACE、DUPLICATE演算子を介して個々の証拠項目を摂動し、3つのユーティリティ軸に沿って変化を測定する。
その結果,回答のみの評価は重要なエビデンス効果を見逃し,介入に基づくユーティリティ分析がRAG評価の実践的補完となることが示唆された。
- 参考スコア(独自算出の注目度): 0.996038809132083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As language models shift from single-shot answer generation toward multi-step reasoning that retrieves and consumes evidence mid-inference, evaluating the role of individual retrieved items becomes more important. Existing RAG evaluation typically targets final-answer quality, citation faithfulness, or answer-level attribution, but none of these directly targets the intervention-based, per-evidence-item utility view we study here. We introduce CUE-R, a lightweight intervention-based framework for measuring per-evidence-item operational utility in single-shot RAG using shallow observable retrieval-use traces. CUE-R perturbs individual evidence items via REMOVE, REPLACE, and DUPLICATE operators, then measures changes along three utility axes (correctness, proxy-based grounding faithfulness, and confidence error) plus a trace-divergence signal. We also outline an operational evidence-role taxonomy for interpreting intervention outcomes. Experiments on HotpotQA and 2WikiMultihopQA with Qwen-3 8B and GPT-5.2 reveal a consistent pattern: REMOVE and REPLACE substantially harm correctness and grounding while producing large trace shifts, whereas DUPLICATE is often answer-redundant yet not fully behaviorally neutral. A zero-retrieval control confirms that these effects arise from degradation of meaningful retrieval. A two-support ablation further shows that multi-hop evidence items can interact non-additively: removing both supports harms performance far more than either single removal. Our results suggest that answer-only evaluation misses important evidence effects and that intervention-based utility analysis is a practical complement for RAG evaluation.
- Abstract(参考訳): 言語モデルがシングルショットの回答生成からマルチステップの推論へと移行するにつれ、個々のアイテムの役割を評価することがより重要になる。
既存のRAG評価は、通常、最終回答の品質、引用忠実性、回答レベルの属性を目標としていますが、これらは、介入に基づく、実証単位のユーティリティビューを直接対象としていません。
CUE-Rは、浅い観測可能な検索用トレースを用いて、単発RAGにおける証拠単位の操作性を測定するための軽量な介入ベースフレームワークである。
CUE-Rは、REMOVE、REPLACE、DUPLICATE演算子を介して個々のエビデンスアイテムを摂動し、3つのユーティリティ軸(正確性、プロキシベースの基底忠実性、信頼度エラー)とトレース分割信号で変化を測定する。
また、介入結果の解釈のための運用上のエビデンス・ロール分類について概説する。
Qwen-3 8B と GPT-5.2 による HotpotQA と 2WikiMultihopQA の実験では、一貫したパターンが示されている。
ゼロ検索制御は、これらの効果が意味のある検索の劣化から生じることを確認している。
2つのサポートされたアブレーションは、マルチホップエビデンスアイテムが非付加的に相互作用できることをさらに示している。
その結果,回答のみの評価は重要なエビデンス効果を見逃し,介入に基づくユーティリティ分析がRAG評価の実践的補完となることが示唆された。
関連論文リスト
- Bounding Hallucinations: Information-Theoretic Guarantees for RAG Systems via Merlin-Arthur Protocols [40.19713302778418]
本稿では,RAGパイプライン全体をインタラクティブな証明システムとして扱うためのトレーニングフレームワークを提案する。
その結果,M/A訓練によるLLMは,基礎性,完全性,音性,拒否行動が改善された。
本研究は,自律型対話型防犯スタイルの監視が,信頼性の高いRAGシステムへの原則的かつ実践的な経路を提供することを示す。
論文 参考訳(メタデータ) (2025-12-12T14:50:38Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - Quantifying Document Impact in RAG-LLMs [9.10734114158633]
本稿では、検索した文書が生成した応答に与える影響を計測する部分情報分解に基づく新しい指標であるインフルエンススコア(IS)を紹介する。
まず、3つのデータセットにまたがる毒の攻撃シミュレーションでは、ISが悪意のある文書を86%のケースで最も影響力のある文書と正しく識別していることが示されている。
第2に、アブレーション研究では、上位文書のみを用いて生成された応答が、残りの文書から生成された応答よりも、元の応答と一貫して類似していることが示されている。
論文 参考訳(メタデータ) (2025-10-27T00:47:13Z) - PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents [24.502121097996294]
Retrieval-augmented Generation (RAG) エージェントは、外部ツールを通じて、自律的な情報検索機能を備えた大規模言語モデルを拡張する。
以前見過ごされた障害モードであるTool-Call Hacking(ツールコールハッキング)を識別します。
提案するProof-of-Use(PoU)フレームワークは,検索された証拠,推論トレース,最終回答間の因果関係の検証を行う。
論文 参考訳(メタデータ) (2025-10-13T02:45:37Z) - EviNote-RAG: Enhancing RAG Models via Answer-Supportive Evidence Notes [39.61443457073034]
EviNote-RAGは検索ノート・アンサーのワークフローに従うフレームワークである。
生の外部情報を直接推論する代わりに、モデルが最初にサポート・エビデンス・ノートを生成する。
EviNote-RAGは最先端のパフォーマンスを実現し、回答の正確性、トレーニングの安定性、堅牢性、効率性を向上する。
論文 参考訳(メタデータ) (2025-08-31T14:44:45Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。