論文の概要: RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2608.23965v1
- Date: Tue, 25 Aug 2026 01:44:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.745579
- Title: RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation
- Title(参考訳): RAGSentinel:ロバスト検索拡張ジェネレーションのための認証幾何コンセンサス
- Abstract要約: 我々は,ブラックボックスRAGシステムのための,トレーニング不要でラベルのない防衛システムであるRAGSentinelを提案する。
RaGSentinelは、競争精度を維持しながら、攻撃の成功率の低下を一貫して達成する。
- 参考スコア(独自算出の注目度): 9.458292549037155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation (RAG) improves the factuality of large language models by grounding responses in external documents, but it also exposes a critical security vulnerability: adversarial documents injected into the knowledge database can enter the context window and steer the model toward targeted incorrect answers. Existing post-retrieval defenses rely on instruction following, parametric knowledge, or text-level consistency, all of which can be imitated or optimized against by adaptive attackers. We propose RAGSentinel, a training-free, label-free defense for black-box RAG systems. RAGSentinel uses a surrogate encoder to measure query-conditioned hidden-state shifts induced by retrieved documents, removes shared topic directions, and filters poisoned documents as geometric outliers from a robust majority consensus. We prove that, under an honest-majority assumption and a representation-level separation condition, RAGSentinel exactly recovers a poison-free majority-sized context. Experiments across three question-answering datasets, three LLM families, and multiple poisoning attacks show that RAGSentinel consistently achieves low attack success rates while preserving competitive accuracy and remaining effective against adaptive attacks with full pipeline knowledge.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) は、外部文書への応答を根拠として、大規模な言語モデルの事実性を向上するが、重大なセキュリティ上の脆弱性も露呈する。
既存の戦前の防御は、指示に従うこと、パラメトリック知識、あるいはテキストレベルの一貫性に依存しており、これら全ては適応攻撃者によって模倣または最適化される。
我々は,ブラックボックスRAGシステムのための,トレーニング不要でラベルのない防衛システムであるRAGSentinelを提案する。
RAGSentinelはサロゲートエンコーダを使用して、検索されたドキュメントによって引き起こされるクエリ条件付き隠れ状態シフトを測定し、共有トピックの方向を削除し、ロバストな多数決から幾何学的なアウトリーとして有毒なドキュメントをフィルタリングする。
RAGSentinelは, 素性の仮定と表現レベルの分離条件の下で, 無毒な多数派サイズの文脈を正確に回復することを示した。
3つの問合せデータセット、3つのLLMファミリー、および複数の毒殺攻撃による実験により、RAGSentinelは、競争精度を維持しつつ、完全なパイプライン知識を持つ適応攻撃に対して有効でありながら、継続的に低い攻撃成功率を達成することが示された。
関連論文リスト
- Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems [15.82084371924438]
検索強化世代(RAG)システムに悪意のある知識を注入すると、検索された証拠を操作でき、下流生成を誤解させる。
本稿では、RAGにおける悪意ある知識注入のためのモデル中心の検索攻撃フレームワークであるCAREATTACKを提案する。
論文 参考訳(メタデータ) (2026-06-16T09:17:56Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning [115.3243260783674]
Retrieval-augmented Generation (RAG) は、外部文書を取得することにより、大きな言語モデル(LLM)推論を強化する。
攻撃者が悪意のあるコンテンツを検索コーパスに注入するRAGにおける知識ベース中毒攻撃について検討した。
AdversarialCoTは、コーパス内の1つのドキュメントだけを毒化するクエリ固有の攻撃である。
論文 参考訳(メタデータ) (2026-04-14T02:10:23Z) - ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning [5.725082598014574]
Retrieval-Augmented Generation (RAG) は、検索された証拠に生成を基礎づけることで、大規模言語モデルの信頼性を向上させる。
相手がパスを注入または編集して、ターゲットクエリのTop-K$結果にランク付けし、下流生成に影響を与えるようにします。
本稿では,高密度レトリバーRAGのためのポストホック,トレーニングフリーレトリバーサイドディフェンスであるProGRankを提案する。
論文 参考訳(メタデータ) (2026-03-24T08:29:15Z) - RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation [43.85099769473328]
Retrieval-Augmented Generation (RAG)は、大規模言語モデルを強化するための有望なパラダイムとして登場した。
近年の研究では、悪意のある文書を検索コーパスに注入し、モデル出力を操作できるRAGパイプラインコーパス中毒の致命的な脆弱性が明らかにされている。
本稿では、RAGPartとRAGMaskの2つの相補的な検索ステージディフェンスを提案する。
論文 参考訳(メタデータ) (2025-12-30T14:43:57Z) - Secure Retrieval-Augmented Generation against Poisoning Attacks [10.964269668142151]
大規模言語モデル (LLM) は自然言語処理 (NLP) を変換した。
RaGuardは、有毒テキストを特定するために設計された検出フレームワークである。
大規模データセットの実験は、毒殺攻撃を検出し緩和する効果を実証している。
論文 参考訳(メタデータ) (2025-10-28T22:54:19Z) - ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search [69.60882125603133]
本稿では,検索した文書の信頼性情報を明確に活用する,敵対的堅牢性のためのフレームワークであるReliabilityRAGを提案する。
我々の研究は、RAGの回収されたコーパスの腐敗に対するより効果的で確実に堅牢な防御に向けた重要な一歩である。
論文 参考訳(メタデータ) (2025-09-27T22:36:42Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals [5.605770511387228]
RAGuardは、不正検索に対するRAGシステムの堅牢性を評価する最初のベンチマークである。
合成ノイズに依存する以前のベンチマークとは異なり、ファクトチェックデータセットは自然に発生する誤報をキャプチャする。
論文 参考訳(メタデータ) (2025-02-22T05:50:15Z) - TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation [31.231916859341865]
TrustRAGは、生成のために取得される前に、悪意のある、無関係なコンテンツを体系的にフィルタリングするフレームワークである。
TrustRAGは、検索精度、効率、攻撃抵抗を大幅に改善する。
論文 参考訳(メタデータ) (2025-01-01T15:57:34Z) - Certifiably Robust RAG against Retrieval Corruption [58.677292678310934]
Retrieval-augmented Generation (RAG) は、回復汚職攻撃に弱いことが示されている。
本稿では,ロバストRAGを検索汚職攻撃に対する最初の防御フレームワークとして提案する。
論文 参考訳(メタデータ) (2024-05-24T13:44:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。