論文の概要: A Systems-Level Analysis of Sensitivity, Robustness, and Stability in Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.28337v1
- Date: Fri, 29 May 2026 17:24:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.584631
- Title: A Systems-Level Analysis of Sensitivity, Robustness, and Stability in Retrieval-Augmented Generation
- Title(参考訳): 検索・拡張生成における感度・ロバスト性・安定性のシステムレベル解析
- Abstract要約: Retrieval-Augmented Generation (RAG) システムは最終回答精度を用いて評価されることが多い。
本稿では,56回の試験走行においてRAG感度,ロバスト性,安定性の制御実験を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) systems are often evaluated using final answer accuracy, even though their failures can originate from preprocessing, retrieval, context packing, or generation. This paper presents a controlled empirical study of RAG sensitivity, robustness, and stability across 56 experimental runs. We evaluate how chunk size, retrieval depth (top k), embedding-based reranking, probabilistic retrieval noise, and repeated seeded runs affect retrieval, context packing, and generation behavior. Using a fixed 500-question QA subset mapped to 20,958 unique corpus contexts, we analyze both final answer metrics and intermediate failure modes. Across these experiments, retrieval-oriented metrics improved under broader retrieval settings, while downstream exact-match and F1 scores often behaved non-monotonically. We also observe preprocessing-induced answer loss under smaller chunk sizes, progressive degradation under retrieval corruption, and higher observed variance in broader retrieval regimes. These findings suggest that RAG evaluation should include sensitivity, robustness, stability, and multi-stage failure analysis rather than relying only on final answer accuracy.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) システムは、前処理、検索、コンテキストパッキング、あるいは生成から失敗が生じたとしても、最終的な応答精度を用いて評価されることが多い。
本稿では,56回の試験走行においてRAG感度,ロバスト性,安定性の制御実験を行った。
我々は,チャンクサイズ,検索深度(トップk),埋め込みベースリランク,確率的検索ノイズ,繰り返しシード実行が検索,コンテキストパッキング,生成行動にどのように影響するかを評価する。
固定された500問QAサブセットを20,958のユニークなコーパスコンテキストにマッピングし、最終回答のメトリクスと中間失敗モードの両方を分析する。
これらの実験全体を通して、より広い検索条件下では検索指向の指標が改善し、下流の正確なマッチングとF1スコアは非単調に振る舞うことが多かった。
また, より小さなチャンクサイズでの事前処理による解答損失, 検索汚職による進行劣化, より広範囲な検索体制での偏差の増大も観察した。
これらの結果から,RAG評価は最終回答の精度にのみ依存するのではなく,感度,頑健性,安定性,多段階故障解析を含むことが示唆された。
関連論文リスト
- Testing Retrieval-Augmented Generation Systems with Chunk Coverage [7.72636722205447]
RAGベースのシステムは、正しい振る舞いが検索コンポーネントに依存するような、ハイテイクな設定でますます多くデプロイされている。
チャンクカバレッジ(英: Chunk Coverage、CC)は、RAGシステムの検索コンポーネントをテストするためのオラクルに依存しないテスト精度基準である。
本稿では,従来の未拡張検索領域の範囲を拡大するクエリを優先して,テスト選択と生成をCCでガイドする方法を示す。
論文 参考訳(メタデータ) (2026-07-20T16:53:05Z) - When Poison Fails After Retrieval: Revisiting Corpus Poisoning under Chunking and Reranking Pipelines [13.701523553327116]
Retrieval-Augmented Generation (RAG) システムは、悪質な知識注入を通じて下流モデル出力を操作するコーパス中毒攻撃に対して脆弱である。
既存の研究では、文書チャンキング、密集検索、再ランク付け、接地生成を含む実用的なRAGパイプラインを見越して、簡易な検索設定下での中毒の評価が主である。
我々は,検索関連性,リランカの整合性,およびチャンク境界の堅牢性を共同で最適化する中毒治療フレームワークであるChunk-aware and Rerank-Consistent Poisoning (CRCP)を提案する。
論文 参考訳(メタデータ) (2026-06-09T04:45:28Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Variational Rectification Inference for Learning with Noisy Labels [74.85528327499662]
損失関数の適応的補正を定式化するために, 変分補正推論(VRI)を提案する。
VRIは、補正ベクトルを潜在変数として扱うことによって階層ベイズとして構成される。
VRIで変分項を導入することにより、条件付き後部を正確に推定し、ディラックデルタ関数への崩壊を避ける。
論文 参考訳(メタデータ) (2026-03-18T01:25:08Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering [0.2796197251957245]
我々は,同期反復検索と推論が,理想化された静的上界(Gold Context)RAGを超えることができるかどうかを考察した。
我々は,<i>No Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Iterative RAG</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>Gold Context</i>,<i>I。
モデル全体では、Iterative RAGはゴールドコンテキストを一貫して上回り、特に非推論では最大25.6ポイントまで上昇する。
論文 参考訳(メタデータ) (2026-01-27T17:35:05Z) - Investigating the Robustness of Retrieval-Augmented Generation at the Query Level [4.3028340012580975]
推論中に外部知識を動的に組み込むソリューションとして、検索拡張生成(RAG)が提案されている。
その約束にもかかわらず、RAGシステムは実際的な課題に直面し、特に、正確な検索のために入力クエリの品質に強く依存する。
論文 参考訳(メタデータ) (2025-07-09T15:39:17Z) - RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems [33.389969814185214]
Retrieval-Augmented Generation (RAG)は、回答の正確性と事実性を高める。
既存の評価では、RAGシステムが現実世界のノイズ、内部と外部の取得したコンテキストの衝突、あるいは急速に変化する事実にどれくらいうまく対処しているかを検査することはめったにない。
本稿では,動的で時間に敏感なコーパス上でのストレステストクエリと文書摂動を共同で行う,統一されたフレームワークと大規模ベンチマークであるRetrieval-Aware Robustness Evaluation (RARE)を紹介する。
論文 参考訳(メタデータ) (2025-06-01T02:42:36Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z) - RAGGED: Towards Informed Design of Scalable and Stable RAG Systems [51.171355532527365]
Retrieval-augmented Generation (RAG)は、外部知識を統合することで言語モデルを強化する。
RAGGEDは、RAGシステムを体系的に評価するためのフレームワークである。
論文 参考訳(メタデータ) (2024-03-14T02:26:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。