論文の概要: KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems
- arxiv url: http://arxiv.org/abs/2607.00422v1
- Date: Wed, 01 Jul 2026 04:32:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.715493
- Title: KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems
- Title(参考訳): KidnapRAG: エージェント検索拡張生成システムにおけるハイジャック推論のためのブラックボックス攻撃
- Abstract要約: 最近のエージェントRAGシステムは、反復的に検索と推論を行うため、中毒攻撃に対してより堅牢である。
我々は、エージェントの多段階推論チェーンをハイジャックするシーケンシャルな毒殺攻撃であるKidnapRAGを提案する。
- 参考スコア(独自算出の注目度): 6.635259626949818
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) systems are vulnerable to poisoning attacks that inject malicious documents into the retrieval process to manipulate model outputs. Recent Agentic RAG systems are more robust to such attacks because they iteratively perform retrieval and reasoning, allowing them to ignore weakly relevant poisoned documents and preserve the reasoning chain induced by the user query. However, existing attacks on Agentic RAG systems often assume white-box access to system prompts, reasoning traces, retrievers, or model parameters, limiting their applicability in realistic settings. In this paper, we study black-box poisoning attacks against Agentic RAG systems, where the attacker can only publish externally retrievable poisoned documents. We propose KidnapRAG, a sequential poisoning attack that hijacks the agent's multi-step reasoning chain using three role-specific documents: Bait, Chain-Link, and Mal-Ins, which attract initial retrieval, induce query reformulation, and provide attacker-controlled evidence, respectively. Experiments across multiple Agentic RAG frameworks, LLM backbones, and benchmarks show that KidnapRAG consistently outperforms existing poisoning baselines under black-box conditions. Further analyses show that KidnapRAG progressively weakens the original retrieval intent, redirects retrieval behavior, and increases reliance on attacker-controlled evidence. Our code is publicly available at https://github.com/chanwoochoi316/KidnapRAG.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) システムは、悪意のあるドキュメントを検索プロセスに注入し、モデル出力を操作する攻撃に対して脆弱である。
最近のエージェントRAGシステムは、検索と推論を反復的に行い、弱い関係の有毒な文書を無視し、ユーザクエリによって引き起こされる推論連鎖を保存できるため、このような攻撃に対してより堅牢である。
しかしながら、エージェントRAGシステムに対する既存の攻撃は、システムプロンプトへのホワイトボックスアクセス、トレース、レトリバー、モデルパラメーターを前提としており、現実的な設定で適用性を制限する。
本稿では,エージェントRAGシステムに対するブラックボックス中毒攻撃について検討する。
そこで我々は,3つのロール固有文書(Bait, Chain-Link, Mal-Ins)を用いてエージェントのマルチステップ推論チェーンをハイジャックするシーケンシャルな毒殺攻撃KidnapRAGを提案する。
複数のAgenic RAGフレームワーク、LLMバックボーン、ベンチマークの実験は、KidnapRAGがブラックボックス条件下で既存の中毒ベースラインを一貫して上回っていることを示している。
さらに分析したところ、KidnapRAGは、元の検索意図を徐々に弱め、検索行動をリダイレクトし、攻撃者による規制された証拠への依存を高めることが示されている。
私たちのコードはhttps://github.com/chanwoochoi316/KidnapRAG.comで公開されています。
関連論文リスト
- InceptionRAG: Stealthy Poisoning Attack Against Retrieval-Augmented Generation [23.65420330011369]
InceptionRAGは、標準的な攻撃パラダイムを覆すステルス攻撃機構である。
インセプションRAGは厳格な敵対的制約の下でも80%以上の攻撃成功率を達成する。
LLMの強い推論能力は、推論に基づく中毒攻撃に対する脆弱性を増大させる。
論文 参考訳(メタデータ) (2026-09-15T08:22:10Z) - Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework [61.79960727298522]
ビザンチン耐性協調RAGフレームワークSecureCollaRAGを提案する。
提案手法により,エージェントシステムは動的GNNによる信頼性スコアリングにより,文書の証明を確実に行うことができる。
本研究では,SecureCollaRAGが非IIDデータ配信における攻撃者に対する堅牢性を維持していることを示す。
論文 参考訳(メタデータ) (2026-08-05T02:13:37Z) - MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning [115.3243260783674]
Retrieval-augmented Generation (RAG) は、外部文書を取得することにより、大きな言語モデル(LLM)推論を強化する。
攻撃者が悪意のあるコンテンツを検索コーパスに注入するRAGにおける知識ベース中毒攻撃について検討した。
AdversarialCoTは、コーパス内の1つのドキュメントだけを毒化するクエリ固有の攻撃である。
論文 参考訳(メタデータ) (2026-04-14T02:10:23Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning [23.957879891712306]
本稿では,ターゲットRAGシステムをブラックボックスとして扱うエンドツーエンド攻撃パイプラインを提案する。
本手法は,ほとんどの複雑なRAGシステムに対する毒性攻撃を効果的に実行できることを実証する。
論文 参考訳(メタデータ) (2025-10-11T04:23:20Z) - Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning [14.419943772894754]
Retrieval-Augmented Generation (RAG)は,大規模言語モデル(LLM)の信頼性向上のための標準アプローチとなっている。
本稿では,現代のLSMの強力なテクスト自己補正能力(SCA)によって,このような攻撃を軽減できることを明らかにする。
我々は,新しい中毒パラダイムであるtextscDisarmRAG を導入し,レトリバー自体を妥協してSCAを抑止し,アタッカー・チョーゼン出力を強制する。
論文 参考訳(メタデータ) (2025-08-27T17:49:28Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models [4.620537391830117]
大型言語モデル(LLM)は幻覚の影響を受けやすいため、誤った結果や誤解を招く可能性がある。
Retrieval-augmented Generation (RAG) は、外部知識源を活用することで幻覚を緩和する有望なアプローチである。
本稿では,POISONCRAFTと呼ばれるRAGシステムに対する中毒攻撃について検討する。
論文 参考訳(メタデータ) (2025-05-10T09:36:28Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - Traceback of Poisoning Attacks to Retrieval-Augmented Generation [18.902988029537365]
研究によると、RAGの毒殺攻撃に対する感受性が明らかとなり、攻撃者は知識データベースに有毒なテキストを注入した。
既存の防衛は、主に推論時間の緩和に焦点を当てており、高度な攻撃に対して不十分であることが証明されている。
本稿では,RAGの最初のトレースバックシステムであるRAGForensicsを紹介し,攻撃に責任を持つ知識データベース内の有毒テキストを識別する。
論文 参考訳(メタデータ) (2025-04-30T14:10:02Z) - The RAG Paradox: A Black-Box Attack Exploiting Unintentional Vulnerabilities in Retrieval-Augmented Generation Systems [16.437675264334942]
RAGパラドックスに基づく現実的なブラックボックス攻撃を導入する。
文書検索性の改善に重点を置く以前の作業とは異なり,攻撃手法は検索可能性とユーザ信頼の両方を明示的に考慮している。
本手法は, 内部アクセスのないシステム性能を著しく低下させるとともに, 自然に見える有毒な文書を生成する。
論文 参考訳(メタデータ) (2025-02-28T12:32:53Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。