論文の概要: TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG
- arxiv url: http://arxiv.org/abs/2607.20437v1
- Date: Mon, 11 May 2026 17:46:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.160927
- Title: TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG
- Title(参考訳): TopoGuard: グラフ理論に基づくRAG攻撃に対する防御
- Authors: Chahana Dahal, Zuobin Xiong,
- Abstract要約: Production Retrieval Augmented Generation (RAG) システムは複雑なクエリに応答するために外部文書の集約に依存している。
検索されたドキュメントには新たな脅威サーフェスが導入され,スプリット・ナレッジ・アタックの起動に利用することができる。
本稿は、LlamaGuardのような既存のドキュメント単位のフィルタでは、新しい攻撃は構造的に見えないことを示す。
RAGでこの問題に対処するために、この研究はTopoGuardを導入している。
- 参考スコア(独自算出の注目度): 5.328366903719861
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production Retrieval Augmented Generation (RAG) systems rely on aggregating multiple external documents to answer complex queries. However, the retrieved documents introduce a new threat surface that can be exploited to launch split-knowledge attacks. In this attack, the adversary injects documents that are individually benign but create false associations when combined and fed to language models. This paper shows that the new attack is structurally invisible to existing per-document filters, like LlamaGuard. To address this issue in RAG, this work introduces TopoGuard, a family of graph theory-based methods specifically targeting the split-knowledge attacks by building a semantic similarity graph from retrieved documents and detecting contexts with malicious topology. Grounded on the theoretical analysis, the TopoGuard family has been proven to be effective and robust even with noisy inputs. Extensive experiments are conducted on two retrieval datasets and compared with multiple baseline methods. Specifically, the TopoGuard-$λ_2$+Entity catches 21$\times$ more attacks than LlamaGuard-2-8B at 1\% FPR (32.6\% vs 1.5\% recall) on the HotpotQA dataset. Compared with production RAG detection systems using large language models, the proposed TopoGuard variants run efficiently at sub-millisecond latency and stay robust under adaptive adversaries and benign cross-domain queries.
- Abstract(参考訳): Production Retrieval Augmented Generation (RAG) システムは、複雑なクエリに応答するために複数の外部文書を集約することに依存している。
しかし、検索された文書には新たな脅威サーフェスが導入され、スプリット・ナレッジ・アタックの起動に利用することができる。
この攻撃では、敵は個別に良性である文書を注入するが、言語モデルに組み合わされたときに偽の関連を生じさせる。
本稿は、LlamaGuardのような既存のドキュメント単位のフィルタでは、新しい攻撃は構造的に見えないことを示す。
RAGでこの問題に対処するために、TopoGuardは、検索した文書から意味的類似性グラフを構築し、悪意のあるトポロジでコンテキストを検出することで、分割知識攻撃を特に対象とするグラフ理論ベースの手法のファミリーである。
理論的解析に基づいて、TopoGuardファミリーはノイズのある入力でも効果的で堅牢であることが証明されている。
2つの検索データセットに対して大規模な実験を行い、複数のベースライン法と比較した。
具体的には、TopoGuard-$λ_2$+Entityは、HotpotQAデータセット上の1\% FPR(32.6\%対1.5\%リコール)において、LlamaGuard-2-8Bよりも21$\times$多くの攻撃をキャッチする。
大規模言語モデルを用いた実運用RAG検出システムと比較して,提案したTopoGuard変種はミリ秒以下のレイテンシで効率よく動作し,適応的な敵やドメイン間クエリで堅牢に動作する。
関連論文リスト
- PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering [57.89576196160413]
大規模言語モデル (LLM) はマルチホップ質問応答 (MHQA) において脆弱のままである。
textbfPlanned Active Retrieval and Reasoning RAG (PAR$2-RAG)を提案する。
論文 参考訳(メタデータ) (2026-03-30T23:52:54Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation [18.098228823748617]
本稿では,RAGデータストア内の文書を対象としたメンバシップ推論手法であるInterrogation Attack (IA)を提案する。
ステルス性を維持しながら、たった30クエリで推論に成功したことを実証します。
我々は,様々なRAG構成に対する事前推論攻撃に対して,TPR@1%FPRの2倍の改善が観察された。
論文 参考訳(メタデータ) (2025-02-01T04:01:18Z) - Attack-in-the-Chain: Bootstrapping Large Language Models for Attacks Against Black-box Neural Ranking Models [111.58315434849047]
本稿では,アタック・イン・ザ・チェーン(Attack-in-the-Chain)という新しいランキングアタックフレームワークを紹介する。
大型言語モデル(LLMs)とニューラルランキングモデル(NRMs)の相互作用をチェーン・オブ・ソートに基づいて追跡する。
2つのWeb検索ベンチマークによる実験結果から,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-12-25T04:03:09Z) - Rag and Roll: An End-to-End Evaluation of Indirect Prompt Manipulations in LLM-based Application Frameworks [12.061098193438022]
Retrieval Augmented Generation (RAG) は、分散知識を欠くモデルによく用いられる手法である。
本稿では,RAGシステムのエンドツーエンドの間接的なプロンプト操作に対する安全性について検討する。
論文 参考訳(メタデータ) (2024-08-09T12:26:05Z) - Corpus Poisoning via Approximate Greedy Gradient Descent [48.5847914481222]
本稿では,HotFlip法をベースとした高密度検索システムに対する新たな攻撃手法として,近似グレディ・グラディエント・Descentを提案する。
提案手法は,複数のデータセットと複数のレトリバーを用いて高い攻撃成功率を達成し,未知のクエリや新しいドメインに一般化可能であることを示す。
論文 参考訳(メタデータ) (2024-06-07T17:02:35Z) - BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models [18.107026036897132]
大規模言語モデル(LLM)は時代遅れの情報と誤ったデータを生成する傾向によって制約される。
Retrieval-Augmented Generation (RAG) は、検索手法の強みと生成モデルを組み合わせることで、これらの制限に対処する。
RAG は LLM に対する新たな攻撃面を導入している。特に RAG データベースは Web などの公開データからしばしば引き出されるためである。
論文 参考訳(メタデータ) (2024-06-03T02:25:33Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z) - ADC: Adversarial attacks against object Detection that evade Context
consistency checks [55.8459119462263]
文脈整合性チェックさえも、適切に構築された敵の例に対して脆弱であることを示す。
このような防御を覆す実例を生成するための適応型フレームワークを提案する。
我々の結果は、コンテキストを堅牢にモデル化し、一貫性をチェックする方法はまだ未解決の問題であることを示している。
論文 参考訳(メタデータ) (2021-10-24T00:25:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。