論文の概要: DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
- arxiv url: http://arxiv.org/abs/2608.02678v1
- Date: Sun, 02 Aug 2026 20:33:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.884945
- Title: DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
- Title(参考訳): DenialRAG: 埋め込みパラメトリックデニアルによる単一文書RAG中毒
- Authors: Abay Zhurekbay, Tao Liu, Fan Li,
- Abstract要約: EmphDenialRAGは,正しい回答を明示し,それを否定し,攻撃者による説明を提示する単一文書中毒攻撃である。
DenialRAGは、コンフリクトを直接ジェネレータが見るコンテキストに埋め込む。
我々はDenialRAGを3つのオープンドメイン質問回答データセットにまたがる4つの単一文書中毒攻撃に対して評価した。
- 参考スコア(独自算出の注目度): 7.434105792757549
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) systems are vulnerable to corpus poisoning: an attacker who inserts a crafted document into the retrieval corpus can steer the underlying large language model (LLM) toward an attacker-chosen wrong answer. Prior single-document attacks typically avoid explicitly naming and refuting the correct answer inside the poisoned passage. In this paper, we examine a complementary design and propose \emph{DenialRAG}, a single-document poisoning attack that explicitly names the correct answer, denies it, and presents an attacker-controlled explanation for favoring the wrong answer. By placing both the correct answer and the corresponding poisoned answer inside the same retrieved passage, DenialRAG embeds the conflict directly into the context seen by the generator. We evaluate DenialRAG against four published single-document poisoning attacks across three open-domain question-answering datasets, eight target LLMs from four vendors, and five inference-time defenses. The results show that attack effectiveness is strongly model-dependent: DenialRAG achieves the highest attack success rate (ASR) on all three Mistral-7B datasets and remains effective on several other target LLMs, while other attacks dominate in some model regimes. Defense results show meaningful ASR reductions but non-uniform protection, with each defense leaving residual ASR in some settings. Component-level and cross-model analyses further identify the embedded denial as the most influential tested component and show that different poisoning mechanisms lose effectiveness at different rates across model groups. Together, these results show that RAG poisoning risk cannot be fully characterized by a single attack family or a single target model.
- Abstract(参考訳): 検索コーパスに文書を挿入する攻撃者は、その基盤となる大きな言語モデル(LLM)を、アタッカー・チョーゼンの誤った答えに向けて操ることができる。
以前の単一文書攻撃は、通常、毒殺された通路内の正しい答えを明示的に命名したり否定したりするのを避ける。
本稿では, 補体設計を検証し, 正解を明示的に命名し, 否定する単一文書中毒攻撃である \emph{DenialRAG} を提案する。
正しい解答とそれに対応する有毒な解答の両方を同じ回収された通路に配置することで、DenialRAGはコンフリクトを直接ジェネレータが見るコンテキストに埋め込む。
我々はDenialRAGを、オープンドメインの質問応答データセット3つ、ベンダー4社の目標LLM8つ、推論時防御5つにまたがる4つの単一文書中毒攻撃に対して評価した。
DenialRAGは3つのMistral-7Bデータセットで最高攻撃成功率(ASR)を達成し、他の複数のLLMに対して有効であり、他の攻撃はいくつかのモデル体制において支配的である。
防御効果は有意なASR低下を示すが、一様でない防御効果を示し、各防衛力はいくつかの設定で残りのASRを残した。
成分レベルおよびクロスモデル解析により, 組込み否定を最も有効な検査成分として同定し, 異なる毒性機構がモデル群間で異なる速度で効果を失うことを示した。
これらの結果から,RAG中毒リスクは1つの攻撃ファミリーや1つの標的モデルで完全には評価できないことが明らかとなった。
関連論文リスト
- KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems [6.635259626949818]
最近のエージェントRAGシステムは、反復的に検索と推論を行うため、中毒攻撃に対してより堅牢である。
我々は、エージェントの多段階推論チェーンをハイジャックするシーケンシャルな毒殺攻撃であるKidnapRAGを提案する。
論文 参考訳(メタデータ) (2026-07-01T04:32:17Z) - AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning [115.3243260783674]
Retrieval-augmented Generation (RAG) は、外部文書を取得することにより、大きな言語モデル(LLM)推論を強化する。
攻撃者が悪意のあるコンテンツを検索コーパスに注入するRAGにおける知識ベース中毒攻撃について検討した。
AdversarialCoTは、コーパス内の1つのドキュメントだけを毒化するクエリ固有の攻撃である。
論文 参考訳(メタデータ) (2026-04-14T02:10:23Z) - KEPo: Knowledge Evolution Poison on Graph-based Retrieval-Augmented Generation [13.66721444009715]
グラフベースのRetrieval-Augmented Generation (GraphRAG)は、外部データベースから知識グラフを構築する。
既存の研究は主に従来のRAGシステムへの攻撃に焦点を当てている。
本稿では,GraphRAGに特化して設計された新しい毒殺法であるKEPo(Knowledge Evolution Poison)を提案する。
論文 参考訳(メタデータ) (2026-03-12T03:40:30Z) - RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation [43.85099769473328]
Retrieval-Augmented Generation (RAG)は、大規模言語モデルを強化するための有望なパラダイムとして登場した。
近年の研究では、悪意のある文書を検索コーパスに注入し、モデル出力を操作できるRAGパイプラインコーパス中毒の致命的な脆弱性が明らかにされている。
本稿では、RAGPartとRAGMaskの2つの相補的な検索ステージディフェンスを提案する。
論文 参考訳(メタデータ) (2025-12-30T14:43:57Z) - Defending Against Knowledge Poisoning Attacks During Retrieval-Augmented Generation [9.625480143413405]
Retrieval-Augmented Generation (RAG)は,大規模言語モデル(LLM)の能力向上のための強力なアプローチとして登場した。
そのような攻撃の1つはPoisonedRAGで、注入された敵のテキストがモデルを操り、ターゲットの質問に対する攻撃長応答を生成する。
我々は,PoisonedRAG攻撃を緩和するために,新しい防御手法であるFilterRAGとML-FilterRAGを提案する。
論文 参考訳(メタデータ) (2025-08-04T19:03:52Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - Practical Poisoning Attacks against Retrieval-Augmented Generation [9.320227105592917]
大規模言語モデル(LLM)は、印象的な自然言語処理能力を示しているが、幻覚や時代遅れの知識といった課題に直面している。
Retrieval-Augmented Generation (RAG)は、これらの問題を緩和するための最先端のアプローチとして登場した。
我々は、攻撃者が1つの有毒テキストだけを注入するRAGシステムに対する実用的な中毒攻撃であるCorruptRAGを提案する。
論文 参考訳(メタデータ) (2025-04-04T21:49:42Z) - MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks [104.50239783909063]
Retrieval Augmented Generation (RAG) を用いた多モーダル大規模言語モデルは、多モーダル質問応答のようなかなり高度なタスクを持つ。
この外部知識への依存は、知識中毒攻撃(英語版)という、危険だが未発見の安全リスクを引き起こす。
マルチモーダルRAGにおける知識中毒を体系的に設計する最初のフレームワークであるMM-PoisonRAGを提案する。
論文 参考訳(メタデータ) (2025-02-25T04:23:59Z) - DALA: A Distribution-Aware LoRA-Based Adversarial Attack against
Language Models [64.79319733514266]
敵攻撃は入力データに微妙な摂動をもたらす可能性がある。
最近の攻撃方法は比較的高い攻撃成功率(ASR)を達成することができる。
そこで本研究では,分散ロラをベースとしたDALA(Adversarial Attack)手法を提案する。
論文 参考訳(メタデータ) (2023-11-14T23:43:47Z) - IDEA: Invariant Defense for Graph Adversarial Robustness [60.0126873387533]
敵攻撃に対する不変因果判定法(IDEA)を提案する。
我々は,情報理論の観点から,ノードと構造に基づく分散目標を導出する。
実験によると、IDEAは5つのデータセットすべてに対する5つの攻撃に対して、最先端の防御性能を達成している。
論文 参考訳(メタデータ) (2023-05-25T07:16:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。