論文の概要: RAGStress: A controlled benchmark for evaluating retrieval-augmented generation under knowledge-base degradation
- arxiv url: http://arxiv.org/abs/2610.04691v1
- Date: Sat, 03 Oct 2026 18:07:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:42:38.101349
- Title: RAGStress: A controlled benchmark for evaluating retrieval-augmented generation under knowledge-base degradation
- Title(参考訳): RAGStress:知識ベース劣化下での検索増強生成の評価のための制御されたベンチマーク
- Abstract要約: RAGStress(RAGStress)は、ストレステストを行うRAGシステムの制御された評価ベンチマークである。
ベンチマークの意図された使用、サポートされたクレーム、制限を文書化し、生成スクリプト、汚職プロンプト、メタデータスキーマ、評価コードを含むアーティファクトバンドルを提供する。
- 参考スコア(独自算出の注目度): 5.443663111285487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) is typically evaluated under the implicit assumption that the underlying knowledge base (KB) is clean, leaving the behaviour of RAG systems under realistic KB degradation poorly characterised. We introduce RAGStress, a controlled evaluation benchmark for stress-testing RAG systems under systematic KB corruption. The benchmark pairs four naturalistic corruption types (factual corruption, numeric typo, relevance poisoning, and contradiction injection) with three severity levels (subtle, moderate, and obvious) over a single-KB, metadata-filtered experimental design built from 57 MMLU subjects and 182,546 documents. Across 52,500 model-question-condition evaluations, RAGStress reveals that clean retrieval can mask robustness differences, semantic-fidelity corruptions are substantially more harmful than signal-utility perturbations, no-retrieval accuracy does not predict corrupted-retrieval robustness, and mixed-KB accuracy should not be treated as worst-case robustness. We document the benchmark's intended use, supported claims, and limitations, and provide an artifact bundle including generation scripts, corruption prompts, metadata schema, and evaluation code. RAGStress is intended as a controlled stress test for RAG robustness under KB corruption, not as a general model leaderboard.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) は通常、基礎となる知識ベース(KB)がクリーンであるという暗黙の仮定の下で評価され、RAGシステムの振る舞いは現実的なKBの劣化に欠ける。
本稿では,ストレステスト型RAGシステムの系統的KB破損に対する評価ベンチマークであるRAGStressを紹介する。
このベンチマークは、57 MMLUの被験者と182,546の文書から作られたメタデータをフィルタリングした実験的な設計に対して、4つの自然主義的な汚職タイプ(実際の汚職、数値型、関連性中毒、矛盾注入)と3つの深刻度レベル(部分、適度、明白)を組み合わせている。
RAGStressは52,500件のモデルクエスト条件の評価において、クリーン検索はロバスト性の違いを隠蔽しうること、セマンティックフィデリティの破損は信号ユーティリティの摂動よりも著しく有害であること、非検索精度は破損した検索ロバスト性を予測せず、混合KBの精度は最悪のケースロバスト性として扱うべきではないことを明らかにした。
ベンチマークの意図された使用、サポートされたクレーム、制限を文書化し、生成スクリプト、汚職プロンプト、メタデータスキーマ、評価コードを含むアーティファクトバンドルを提供する。
RAGStressは、一般的なモデルリーダーボードではなく、KBの汚職下でのRAG堅牢性の制御されたストレステストとして意図されている。
関連論文リスト
- Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs [0.0]
小作農の絵ベースの農業保険では、被害検出の欠落は誤報よりもかなり高いコストがかかる。
本稿では,2段階のカスケードアーキテクチャであるCascadeCropNetを提案する。
軽量のセンチネルモデルでは2値の健康トリアージを行い、キャリブレーションされた損傷確率閾値タウを超えるサンプルを専門家モデルにエスカレーションして詳細な診断を行う。
論文 参考訳(メタデータ) (2026-07-28T09:01:27Z) - Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning [0.0]
RAGシステムは知識ベース中毒に弱いが、既存の攻撃はほとんどバニラレトリプタン生成パイプラインに対して評価されている。
我々は,921の自然質問QAペアに対して,制御された単一文書中毒の4つのRAGアーキテクチャ(vanilla RAG, agentic RAG, MADAM-RAG, Recursive Language Models)を評価した。
論文 参考訳(メタデータ) (2026-05-07T03:36:14Z) - Benchmarking Corruption Robustness of LVLMs: A Discriminative Benchmark and Robustness Alignment Metric [49.393713730706445]
汚損の堅牢性を評価するための識別サンプルを強調したベンチマークであるBench-Cを紹介する。
本稿では,ロバストネスアライメントスコア(RAS)を提案する。
論文 参考訳(メタデータ) (2025-11-24T12:07:56Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals [5.605770511387228]
RAGuardは、不正検索に対するRAGシステムの堅牢性を評価する最初のベンチマークである。
合成ノイズに依存する以前のベンチマークとは異なり、ファクトチェックデータセットは自然に発生する誤報をキャプチャする。
論文 参考訳(メタデータ) (2025-02-22T05:50:15Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z) - Certifiably Adversarially Robust Detection of Out-of-Distribution Data [111.67388500330273]
我々は,OOD点における信頼度を低くすることで,OOD検出の証明可能な最悪のケースを保証することを目的としている。
トレーニング時に見られるOODデータセットを超えて一般化されたOODデータの信頼性の非自明な境界が可能であることを示す。
論文 参考訳(メタデータ) (2020-07-16T17:16:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。