論文の概要: Testing Retrieval-Augmented Generation Systems with Chunk Coverage
- arxiv url: http://arxiv.org/abs/2607.18155v1
- Date: Mon, 20 Jul 2026 16:53:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.714732
- Title: Testing Retrieval-Augmented Generation Systems with Chunk Coverage
- Title(参考訳): チャンク被覆を用いた検索拡張生成システムの試験
- Abstract要約: RAGベースのシステムは、正しい振る舞いが検索コンポーネントに依存するような、ハイテイクな設定でますます多くデプロイされている。
チャンクカバレッジ(英: Chunk Coverage、CC)は、RAGシステムの検索コンポーネントをテストするためのオラクルに依存しないテスト精度基準である。
本稿では,従来の未拡張検索領域の範囲を拡大するクエリを優先して,テスト選択と生成をCCでガイドする方法を示す。
- 参考スコア(独自算出の注目度): 7.72636722205447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-Augmented Generation (RAG)-based systems\footnote{For brevity, RAG-based systems are referred to as RAG systems throughout this paper.} are increasingly deployed in high-stakes settings where correct behaviour depends not only on the language model but also on the retrieval component that selects external documents at inference time. While existing RAG evaluation metrics assess retrieval and generation quality on a per-query basis, typically relying on query-level test oracles such as reference answers or relevance annotations, they provide limited insight into whether a test suite adequately exercises the retrieval behaviour of the system as a whole. In this paper, we introduce Chunk Coverage (CC), an oracle-independent test adequacy criterion for testing the retrieval component of RAG systems. CC measures the fraction of corpus chunks that are retrieved at least once across a test suite, providing a structural view of which parts of the retrieval space have been exercised. We further show how CC can be used to guide test selection and generation by prioritising queries that expand coverage of previously unexercised retrieval regions. We evaluate CC on clinical and financial RAG system scenarios. CC-guided testing reaches 50% of attainable coverage 1.7x faster than random selection and 4.2x faster than redundancy-biased strategies. Moreover, CC improves fault detection effectiveness (APFD) by 10% to 25% over random, indicating earlier discovery of distinct retrieval faults. These results show that CC captures retrieval diversity relevant to effective testing without requiring test oracles.
- Abstract(参考訳): 本稿では,RAG(Retrieval-Augmented Generation)ベースのシステム\footnote{略して,RAGベースのシステムをRAGシステムと呼ぶ。
適切な振る舞いは言語モデルだけでなく、推論時に外部ドキュメントを選択する検索コンポーネントにも依存する。
既存のRAG評価指標は、クエリ毎の検索と生成品質を評価し、典型的には参照回答や関連アノテーションのようなクエリレベルのテストオラクルに依存するが、テストスイートがシステム全体の検索動作を適切に実行しているかどうかについての限られた洞察を提供する。
本稿では,RAGシステムの検索コンポーネントをテストするためのオラクルに依存しないテスト精度基準であるChunk Coverage(CC)を紹介する。
CCは、少なくとも1回はテストスイート全体で検索されるコーパスチャンクの分数を計測し、検索空間のどの部分が運動されたかの構造ビューを提供する。
さらに,これまで未使用であった検索領域のカバレッジを拡大するクエリを優先することで,CCがテスト選択と生成をガイドする方法について述べる。
臨床および財務的なRAGシステムのシナリオにおけるCCの評価を行った。
CC誘導テストは、ランダムセレクションよりも1.7倍、冗長バイアス戦略より4.2倍、達成可能なカバレッジの50%に達する。
さらに、CCは異常検出効率(APFD)を10%から25%改善し、異なる検索障害の早期発見を示す。
これらの結果から,CCは精査に必要とせず,有効検査に関連する検索の多様性を把握できることがわかった。
関連論文リスト
- Pre-retrieval Query Clustering for Adaptive Top-k Document Retrieval in RAG Systems [7.440012812118169]
RAGシステムは通常、固定数の文書を基底生成に検索する。
単純なクエリは過剰検索(ノイズとコストを追加する)に悩まされ、複雑なクエリは未検索である。
本稿では,クエリ適応検索のための実用的,汎用的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-11T19:57:12Z) - Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis [1.0312968200748118]
本稿では,LongEval-RAGのための候補制約付き検索拡張生成システムを提案する。
プライマリ・オーガナイザ・アセスメントと補足的自己生成診断プロトコルを用いて,10種類のパイプライン変異を評価した。
論文 参考訳(メタデータ) (2026-07-04T20:07:57Z) - Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts [0.38597698994416435]
クラスタベースのセマンティックチャンキングは、固定サイズや再帰よりも検索と回答の品質を向上させる。
RAGAベースの忠実度は、この設定の信頼性に制限があることを示している。
論文 参考訳(メタデータ) (2026-07-02T08:12:35Z) - A Systems-Level Analysis of Sensitivity, Robustness, and Stability in Retrieval-Augmented Generation [0.0]
Retrieval-Augmented Generation (RAG) システムは最終回答精度を用いて評価されることが多い。
本稿では,56回の試験走行においてRAG感度,ロバスト性,安定性の制御実験を行った。
論文 参考訳(メタデータ) (2026-05-29T17:24:40Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - Controlled Retrieval-augmented Context Evaluation for Long-form RAG [58.14561461943611]
Retrieval-augmented Generation (RAG)は、外部知識ソースから取得したコンテキストを組み込むことで、大規模言語モデルを強化する。
我々は、レポート生成のような長期RAGタスクにおいて、包括的な検索強化コンテキストを提供することが重要であると論じる。
本稿では,検索拡張コンテキストを直接評価するフレームワークであるCRUXを紹介する。
論文 参考訳(メタデータ) (2025-06-24T23:17:48Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - XRAG: eXamining the Core -- Benchmarking Foundational Components in Advanced Retrieval-Augmented Generation [36.84847781022757]
Retrieval-augmented Generation (RAG) は、Large Language Models (LLMs) の生成能力と関連するデータの検索を相乗化する
我々は,高度なRAGモジュールの基本コンポーネントの性能を徹底的に評価する,オープンソースのモジュールであるXRAGを紹介する。
論文 参考訳(メタデータ) (2024-12-20T03:37:07Z) - Unanswerability Evaluation for Retrieval Augmented Generation [74.3022365715597]
UAEval4RAGは、RAGシステムが解答不能なクエリを効果的に処理できるかどうかを評価するために設計されたフレームワークである。
我々は、6つの未解決カテゴリを持つ分類を定義し、UAEval4RAGは、多様で挑戦的なクエリを自動的に合成する。
論文 参考訳(メタデータ) (2024-12-16T19:11:55Z) - CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models [49.16989035566899]
Retrieval-Augmented Generation (RAG)は、大規模言語モデル(LLM)の能力を高める技術である。
本稿では,大規模かつ包括的なベンチマークを構築し,様々なRAGアプリケーションシナリオにおけるRAGシステムのすべてのコンポーネントを評価する。
論文 参考訳(メタデータ) (2024-01-30T14:25:32Z) - Are We There Yet? A Decision Framework for Replacing Term Based
Retrieval with Dense Retrieval Systems [35.77217529138364]
いくつかの高密度検索(DR)モデルは、項ベース検索と競合する性能を示した。
DRはクエリとドキュメントを高密度なベクトル空間に投影し、(近似した)近接探索によって結果を検索する。
将来DRがユビキタスになるかどうかを予測することは不可能だが、この方法の1つは意思決定プロセスの繰り返し適用を通じて可能である。
論文 参考訳(メタデータ) (2022-06-26T23:16:05Z) - Generalizing Cross-Document Event Coreference Resolution Across Multiple
Corpora [63.429307282665704]
クロスドキュメントイベントコア参照解決(CDCR)は、文書の集合全体にわたってイベントの特定とクラスタ化を行う必要があるNLPタスクである。
CDCRは、下流のマルチドキュメントアプリケーションに利益をもたらすことを目標としているが、CDCRの適用による改善はまだ示されていない。
これまでのCDCRシステムは,1つのコーパスでのみ開発,トレーニング,テストが行われた。
論文 参考訳(メタデータ) (2020-11-24T17:45:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。