論文の概要: A Hierarchical Consistency Framework for Auditing Retrieval-Augmented Generation Systems
- arxiv url: http://arxiv.org/abs/2609.07075v1
- Date: Mon, 07 Sep 2026 06:03:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.369116
- Title: A Hierarchical Consistency Framework for Auditing Retrieval-Augmented Generation Systems
- Title(参考訳): 検索・拡張生成システムに対する階層的整合性フレームワーク
- Abstract要約: 検索拡張生成(RAG)は、最終回答が正しいかどうかによって一般的に評価される。
本稿では、RAGプロセスの3つの異なるレベルのモデルに依存しない監査である階層一貫性フレームワーク(HCF)を提案する。
HCFはコーパスコンフリクトをソースリンクされた原子事実として表現し、それによって責任のあるドキュメントを識別する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation (RAG) is commonly evaluated by whether the final answer is correct. That test is insufficient: an answer can match its reference while the context that produced it contains a direct contradiction, leaving the contested evidence invisible to answer-only review and retrieval relevance scores. This paper presents the Hierarchical Consistency Framework (HCF), a post-hoc, model-agnostic audit of three distinct levels of a RAG process: the knowledge corpus, the final retrieved context, and the generated answer. HCF represents corpus conflicts as source-linked atomic facts, thereby identifying the documents responsible, and returns each Answer Consistency Score (ACS) with an explanation of supporting and contradictory contextual statements. We evaluate HCF on several controlled corpora spanning five domains and 100 query-corpus instances. A human evaluator compares every generated response with its supplied ground-truth response. The results show that the three diagnostic levels can dissociate: the corpus with the highest mean retrieval similarity has the lowest mean ACS, while a structurally degraded corpus performs worse at corpus level but better at answer level. Most importantly, HCF identifies contradictory retrieved evidence in several cases where the answer still matches the ground truth. HCF does not certify factual truth; it makes the evidence supporting and challenging an answer inspectable and attributable.
- Abstract(参考訳): 検索拡張生成(RAG)は、最終回答が正しいかどうかによって一般的に評価される。
回答は参照と一致し、生成したコンテキストには直接的な矛盾が含まれており、競合する証拠は、回答のみのレビューと検索関連スコアに見えないままである。
本稿では,RAGプロセスの3つの異なるレベル – 知識コーパス,最終的な検索コンテキスト,生成された回答 – に対する,ポストホックかつモデルに依存しない監査手法である階層一貫性フレームワーク(HCF)を提案する。
HCFはコーパスコンフリクトをソースリンクされた原子事実として表現し、それによってドキュメントを識別し、それぞれのアンサー一貫性スコア(ACS)を、サポートと矛盾するコンテキストステートメントの説明で返す。
我々は5つのドメインと100のクエリーコーパスインスタンスにまたがる複数の制御コーパスに対してHCFを評価する。
人間の評価器は、生成されたすべての応答を、供給された接地的応答と比較する。
その結果, 平均検索類似度の高いコーパスはACSが最も低く, 構造劣化コーパスはコーパスレベルでは低下するが, 回答レベルでは低下することがわかった。
最も重要な点として、HCFは、答えが依然として基礎的な真実と一致するいくつかのケースにおいて、矛盾した証拠を識別する。
HCFは事実の真実を証明していない。
関連論文リスト
- HarnessEval-W: Agentifying the Evaluation of Visual Worlds [149.63310396189317]
HarnessEval-Wは、世界モデルのベンチマークのためのエージェント化された評価パイプラインである。
HarnessEval-Wは固定ルーブリックを適用するのではなく、評価問題を測定可能なサブプロブレムに分解する。
330件の評価事例に対して,HarnessEval-Wを18の代表的な世界モデルに適用した。
論文 参考訳(メタデータ) (2026-08-17T17:43:24Z) - HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence [48.938290419832335]
我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
論文 参考訳(メタデータ) (2026-06-24T23:00:09Z) - Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG [8.86745721473138]
検索拡張生成(RAG)システムは、どのソースから取得するかによって、同じ質問に対して異なる回答を与えることができる。
情報源依存性はNLP評価の欠落軸であり,評価単位を回答の正しさからソース間関係へシフトさせることを意味する,と我々は主張する。
論文 参考訳(メタデータ) (2026-05-27T20:38:05Z) - A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness [1.029029220360574]
本稿では,ポリシーライクな文書のギャップと重複分析に焦点をあてる。
結果として得られるギャップ/オーバーラップの決定は、データ欠落ではなく、カバレッジと制限の真の違いによって引き起こされる。
本稿では,自然言語の契約文と公式なオントロジーとエビデンスにリンクされた真実を一致させる,実行可能で監査可能なベンチマークを提案する。
論文 参考訳(メタデータ) (2026-04-12T23:18:47Z) - Rethinking Atomic Decomposition for LLM Judges: A Prompt-Controlled Study of Reference-Grounded QA Evaluation [5.94231111588812]
我々は、自己分解型原子式判定器(単一プロンプト分解検証器)を、同じ入力と同様の詳細なルーリックを持つ、即時制御された全体的判定器と比較する。
我々の発見は、QAスタイルの3つのベンチマークで、それぞれ200のソース例で自己分解するシングルプロンプトパターンに特化しています。
論文 参考訳(メタデータ) (2026-03-30T03:55:26Z) - Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG [3.2327627739464635]
本稿では,文脈信頼度評価のための逆転型テストフレームワークRT4CHARTを提案する。
モデル出力を独立に検証可能なクレームに分解し、階層的で局所的な検証を行う。
全基準線のうち、最良回答レベル幻覚検出F1を実現する。
論文 参考訳(メタデータ) (2026-03-29T16:12:18Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - CORG: Generating Answers from Complex, Interrelated Contexts [57.213304718157985]
現実世界のコーパスでは、知識は文書間で頻繁に再帰するが、曖昧な命名、時代遅れの情報、エラーのためにしばしば矛盾を含む。
以前の研究では、言語モデルはこれらの複雑さに苦しむことが示されており、典型的には孤立した単一要因に焦点を当てている。
複数のコンテキストを個別に処理されたグループに整理するフレームワークであるContext Organizer (CORG)を紹介する。
論文 参考訳(メタデータ) (2025-04-25T02:40:48Z) - Evidence Contextualization and Counterfactual Attribution for Conversational QA over Heterogeneous Data with RAG Systems [4.143039012104666]
Retrieval Augmented Generation(RAG)は、会話質問回答(ConvQA)を介して企業のデータと対話するためのバックボーンとして機能する。
本研究では,RAGONITE(RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAAG,RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAAG,RAGONITE ,RAGONITE,RAGONITE,RAGONITE,RAAG,RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAGONITE,RAGO NITE)について述べる。
論文 参考訳(メタデータ) (2024-12-13T21:28:17Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。