論文の概要: Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents
- arxiv url: http://arxiv.org/abs/2608.17153v1
- Date: Mon, 17 Aug 2026 21:37:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.136818
- Title: Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents
- Title(参考訳): システム2思考が可能なエージェントだけが信頼できないドキュメントにアクセスできる「サファーRAG」を目指して
- Authors: Mehrdad Ghassabi,
- Abstract要約: Retrieval-Augmented Generation (RAG) は大規模言語モデルの性能を大幅に向上させた。
RAGは、検索された文書の誤報がモデルの最終的な出力に影響を与えるような、知識汚染攻撃に弱い。
我々は,信頼性の低い文書にアクセス可能なシステム2推論能力を持つエージェントにのみ,厳格なセキュリティ原則を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Retrieval-Augmented Generation (RAG) has significantly enhanced the performance of large language models (LLMs), yet these systems remain vulnerable to knowledge-poisoning attacks, in which misinformation in retrieved documents can influence the model's final outputs. Notably, an LLM may correctly detect that a document contains incorrect information while nevertheless being influenced by it. Prior work has addressed this vulnerability through the Cordon Principle, which prevents models responsible for final answer synthesis from directly accessing raw evidence. Although effective, this strict isolation can introduce substantial computational overhead. In this work, we propose a refined security principle: only agents capable of deliberative System 2 reasoning may access untrusted documents. To evaluate this principle, we introduce novel metrics that quantify the discrepancy between misinformation detection and downstream influence. We then empirically compare state-of-the-art reasoning language models with standard language models across these metrics. Our results show that reasoning-capable models are substantially more robust to corrupted evidence, without requiring the strict isolation imposed by the Cordon Principle. These findings provide empirical support for our refined principle and suggest a more practical foundation for secure RAG system design.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) は、大規模言語モデル(LLM)の性能を大幅に向上させたが、これらのシステムは、検索された文書の誤情報をモデルの最終出力に影響を及ぼすような、知識汚染攻撃に弱いままである。
特に、LCMは、文書が不正な情報を含んでいることを正確に検出するが、それでも影響を受けない。
これは、最終回答合成に責任があるモデルが生の証拠に直接アクセスすることを防ぐ。
この厳密な分離は有効ではあるが、かなりの計算オーバーヘッドをもたらす可能性がある。
本研究は,システム2推論を検証可能なエージェントだけが信頼できない文書にアクセス可能な,高度なセキュリティ原則を提案する。
この原理を評価するために、誤報検出と下流の影響の差を定量化する新しい指標を提案する。
次に、最先端の推論言語モデルとこれらのメトリクスの標準言語モデルとを実証的に比較します。
以上の結果から,コードン原理による厳密な隔離を必要とせず,推論可能なモデルの方が,破損した証拠に対して極めて堅牢であることが示唆された。
これらの知見は、我々の洗練された原理に対する実証的な支持を提供し、安全なRAGシステム設計のためのより実践的な基礎を示唆している。
関連論文リスト
- Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models [53.279391576560755]
大規模言語モデル(LLM)は、広範囲のNLPタスクにおいて顕著な流速と汎用性を示してきたが、実際的な不正確さと制限が伴う傾向にある。
これは、信頼と妥当性が最優先される医療、法律、科学コミュニケーションといった、高リスク領域に重大なリスクをもたらす。
LLM出力の事実的信頼性と解釈可能性を高めるために設計されたDAVinCI - Dual Attribution and Verificationフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-04-23T01:37:50Z) - AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning [115.3243260783674]
Retrieval-augmented Generation (RAG) は、外部文書を取得することにより、大きな言語モデル(LLM)推論を強化する。
攻撃者が悪意のあるコンテンツを検索コーパスに注入するRAGにおける知識ベース中毒攻撃について検討した。
AdversarialCoTは、コーパス内の1つのドキュメントだけを毒化するクエリ固有の攻撃である。
論文 参考訳(メタデータ) (2026-04-14T02:10:23Z) - Verifiable Reasoning for LLM-based Generative Recommendation [106.7765000777685]
大規模言語モデル(LLM)における推論は、最近、生成的レコメンデーションの強化に強い可能性を示している。
本稿では,信頼性の高いフィードバックを提供するために,検証と推論をインターリーブする新しいTextbftextitreason-verify-recommendパラダイムを提案する。
4つの実世界のデータセットの実験は、VRecが効率を損なうことなく、推奨の有効性とスケーラビリティを大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-03-08T16:55:45Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Quantifying Document Impact in RAG-LLMs [9.10734114158633]
本稿では、検索した文書が生成した応答に与える影響を計測する部分情報分解に基づく新しい指標であるインフルエンススコア(IS)を紹介する。
まず、3つのデータセットにまたがる毒の攻撃シミュレーションでは、ISが悪意のある文書を86%のケースで最も影響力のある文書と正しく識別していることが示されている。
第2に、アブレーション研究では、上位文書のみを用いて生成された応答が、残りの文書から生成された応答よりも、元の応答と一貫して類似していることが示されている。
論文 参考訳(メタデータ) (2025-10-27T00:47:13Z) - ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search [69.60882125603133]
本稿では,検索した文書の信頼性情報を明確に活用する,敵対的堅牢性のためのフレームワークであるReliabilityRAGを提案する。
我々の研究は、RAGの回収されたコーパスの腐敗に対するより効果的で確実に堅牢な防御に向けた重要な一歩である。
論文 参考訳(メタデータ) (2025-09-27T22:36:42Z) - TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation [31.231916859341865]
TrustRAGは、生成のために取得される前に、悪意のある、無関係なコンテンツを体系的にフィルタリングするフレームワークである。
TrustRAGは、検索精度、効率、攻撃抵抗を大幅に改善する。
論文 参考訳(メタデータ) (2025-01-01T15:57:34Z) - Trust but Verify: Assigning Prediction Credibility by Counterfactual
Constrained Learning [123.3472310767721]
予測信頼性尺度は統計学と機械学習において基本的なものである。
これらの措置は、実際に使用される多種多様なモデルを考慮に入れるべきである。
この研究で開発されたフレームワークは、リスクフィットのトレードオフとして信頼性を表現している。
論文 参考訳(メタデータ) (2020-11-24T19:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。