論文の概要: Retrieval Pivot Attacks in Hybrid RAG: Measuring and Mitigating Amplified Leakage from Vector Seeds to Graph Expansion
- arxiv url: http://arxiv.org/abs/2602.08668v1
- Date: Mon, 09 Feb 2026 13:55:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-10 20:26:25.258598
- Title: Retrieval Pivot Attacks in Hybrid RAG: Measuring and Mitigating Amplified Leakage from Vector Seeds to Graph Expansion
- Title(参考訳): ハイブリッドRAGにおける検索軸攻撃:ベクトルシードからグラフ展開への増幅漏れの測定と緩和
- Abstract要約: ハイブリッド検索-拡張生成(RAG)パイプラインは、ベクトル類似性探索と知識グラフ拡張を組み合わせたマルチホップ推論である。
ベクター検索した"シード"チャンクがエンティティリンクを介してセンシティブなグラフ近傍にピボットできることを示し、テナント間のデータ漏洩を引き起こす。
ベクトル-グラフ境界を利用する7つの検索型Pivotアタックを提示し、逆噴射は不要であることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Hybrid Retrieval-Augmented Generation (RAG) pipelines combine vector similarity search with knowledge graph expansion for multi-hop reasoning. We show that this composition introduces a distinct security failure mode: a vector-retrieved "seed" chunk can pivot via entity links into sensitive graph neighborhoods, causing cross-tenant data leakage that does not occur in vector-only retrieval. We formalize this risk as Retrieval Pivot Risk (RPR) and introduce companion metrics Leakage@k, Amplification Factor, and Pivot Depth (PD) to quantify leakage magnitude and traversal structure. We present seven Retrieval Pivot Attacks that exploit the vector-to-graph boundary and show that adversarial injection is not required: naturally shared entities create cross-tenant pivot paths organically. Across a synthetic multi-tenant enterprise corpus and the Enron email corpus, the undefended hybrid pipeline exhibits high pivot risk (RPR up to 0.95) with multiple unauthorized items returned per query. Leakage consistently appears at PD=2, which we attribute to the bipartite chunk-entity topology and formalize as a proposition. We then show that enforcing authorization at a single location, the graph expansion boundary, eliminates measured leakage (RPR near 0) across both corpora, all attack variants, and label forgery rates up to 10 percent, with minimal overhead. Our results indicate the root cause is boundary enforcement, not inherently complex defenses: two individually secure retrieval components can compose into an insecure system unless authorization is re-checked at the transition point.
- Abstract(参考訳): ハイブリッド検索-拡張生成(RAG)パイプラインは、ベクトル類似性探索と知識グラフ拡張を組み合わせたマルチホップ推論である。
ベクター検索された「シード」チャンクは、エンティティリンクを介してセンシティブなグラフ近傍にピボットし、ベクトルのみの検索では発生しないテナントデータのリークを引き起こす。
本稿では、このリスクをRPR(Retrieval Pivot Risk)として定式化し、漏洩の大きさとトラバース構造を定量化するために、Leakage@k、Amplification Factor、Pivot Depth (PD)を導入している。
本稿では,ベクトル-グラフ境界を利用する7つの検索型Pivot攻撃について述べる。
合成マルチテナントエンタープライズコーパスとEnron Eメールコーパス全体で、未定義のハイブリッドパイプラインは、クエリ毎に複数の未許可アイテムが返される高いピボットリスク(RPR:RPR)を示す。
漏れは PD=2 に一貫して現れるが、これは二分的チャンクエンティトポロジーに起因し、命題として形式化される。
次に、グラフ展開境界である単一位置での認証の強制は、両方のコーパス、全ての攻撃変種、ラベルの偽造率を最小限のオーバーヘッドで、計測されたリーク(RPRを0付近で除去することを示した。
2つのセキュアな検索コンポーネントは、移行時点で認証が再チェックされない限り、安全でないシステムに構成できる。
関連論文リスト
- Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense [49.05879299987137]
言語モデリングの損失の低減は、より有用なモデルを生み出します。
本研究は,このメカニズムの安全性について,独立した相互作用を通じて,良質なサブクエリが要求され,後に禁忌の対象へと再帰される,エンフクロス・セッション分解攻撃(enmphcross-session decomposition attack)における研究である。
我々は、この設定をEmphcompositional safety riskとして定式化し、条件付きリスク-転送境界を証明する。
論文 参考訳(メタデータ) (2026-08-28T05:39:29Z) - When Global Gating Is Enough: Admission-Time Hubness Control in Anisotropic Vector Retrieval Systems [0.0]
挿入前,各候補をセンチネルクエリに対してスコアリングし,ハブライクな文書を隔離し,入場時間制御について検討した。
2つの10万のドキュメントコーパス、5つのエンコーダ、そして接続不能な攻撃者およびディフェンダークエリセットにまたがって、グローバルゲートは決定的な埋め込みスペースポイントでリコール1.0を達成する。
HNSWでは、摂取遅延が約3.1%増加し、スコアは106ベクトルに一定であり、決定の1.2%は近似インデックス化の下で反転する。
論文 参考訳(メタデータ) (2026-06-18T01:40:36Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - VectorSmuggle: Steganographic Exfiltration in Embedding Stores and a Cryptographic Provenance Defense [0.0]
現代の検索拡張生成システム(RAG)は、センシティブなコンテンツを高次元の埋め込みに変換し、それらをベクトルデータベースに格納し、結果の数値的アーティファクトを不透明なものとして扱う。
これはステガノグラフィー・エクスプロイト・アタックのクラスを開放することを示している。
入力パイプラインへの書き込みアクセスを持つアタッカーは、埋め込み内にペイロードデータを隠蔽することができる。
論文 参考訳(メタデータ) (2026-05-13T16:44:20Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning [5.725082598014574]
Retrieval-Augmented Generation (RAG) は、検索された証拠に生成を基礎づけることで、大規模言語モデルの信頼性を向上させる。
相手がパスを注入または編集して、ターゲットクエリのTop-K$結果にランク付けし、下流生成に影響を与えるようにします。
本稿では,高密度レトリバーRAGのためのポストホック,トレーニングフリーレトリバーサイドディフェンスであるProGRankを提案する。
論文 参考訳(メタデータ) (2026-03-24T08:29:15Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Beyond Input Guardrails: Reconstructing Cross-Agent Semantic Flows for Execution-Aware Attack Detection [32.301679396929536]
静的な入力フィルタリングから実行対応分析へ、防御パラダイムをシフトするフレームワークであるSysNameを提案する。
SysNameは断片化された操作プリミティブを連続した行動軌跡に合成し、システムアクティビティの全体像を可能にする。
実証的な評価により、SysNameは10以上の異なる複合攻撃ベクトルを効果的に検出し、それぞれノードレベルとパスレベルのエンドツーエンド攻撃検出に対して85.3%と66.7%のF1スコアを達成した。
論文 参考訳(メタデータ) (2026-03-04T01:59:16Z) - Breaking the Static Graph: Context-Aware Traversal for Robust Retrieval-Augmented Generation [12.71443292660797]
堅牢なRAGのためのコンテキスト認識トラバーサルであるCatRAGを提案する。
CatRAGはHippoRAG 2アーキテクチャ上に構築され、静的なKGをクエリ適応ナビゲーション構造に変換する。
4つのマルチホップベンチマークの実験では、CatRAGはアートベースラインの状態を一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-02T11:13:38Z) - Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs [26.288357188171265]
MAMA(Multi-Agent Memory Attack)は、ネットワーク構造がどのように漏洩を形作るかを測定するフレームワークである。
我々は,攻撃剤出力から回収した地絡PIIの割合として漏洩を定量化する。
結果は、アーキテクチャ上の選択から測定可能なプライバシリスクへの最初の体系的なマッピングを提供する。
論文 参考訳(メタデータ) (2025-12-04T11:00:49Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation [18.098228823748617]
本稿では,RAGデータストア内の文書を対象としたメンバシップ推論手法であるInterrogation Attack (IA)を提案する。
ステルス性を維持しながら、たった30クエリで推論に成功したことを実証します。
我々は,様々なRAG構成に対する事前推論攻撃に対して,TPR@1%FPRの2倍の改善が観察された。
論文 参考訳(メタデータ) (2025-02-01T04:01:18Z) - AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning [93.77763753231338]
CLIP画像エンコーダを微調整し、2つの中間対向クエリに対して同様の埋め込みを抽出するために、ACPT(Adversarial Contrastive Prompt Tuning)を提案する。
我々は,ACPTが7つの最先端クエリベースの攻撃を検出できることを示す。
また,ACPTは3種類のアダプティブアタックに対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-08-04T09:53:50Z) - Corpus Poisoning via Approximate Greedy Gradient Descent [48.5847914481222]
本稿では,HotFlip法をベースとした高密度検索システムに対する新たな攻撃手法として,近似グレディ・グラディエント・Descentを提案する。
提案手法は,複数のデータセットと複数のレトリバーを用いて高い攻撃成功率を達成し,未知のクエリや新しいドメインに一般化可能であることを示す。
論文 参考訳(メタデータ) (2024-06-07T17:02:35Z) - BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models [18.107026036897132]
大規模言語モデル(LLM)は時代遅れの情報と誤ったデータを生成する傾向によって制約される。
Retrieval-Augmented Generation (RAG) は、検索手法の強みと生成モデルを組み合わせることで、これらの制限に対処する。
RAG は LLM に対する新たな攻撃面を導入している。特に RAG データベースは Web などの公開データからしばしば引き出されるためである。
論文 参考訳(メタデータ) (2024-06-03T02:25:33Z) - To Make Yourself Invisible with Adversarial Semantic Contours [47.755808439588094]
逆セマンティック・コンター(英: Adversarial Semantic Contour、ASC)は、物体の輪郭の前に騙されたスパース・アタックのベイズ的定式化の見積もりである。
ASCは、異なるアーキテクチャを持つ9つの近代検出器の予測を損なう可能性があることを示す。
我々は、様々なアーキテクチャを持つ物体検出器の共通弱点である輪郭について注意を払って結論付けた。
論文 参考訳(メタデータ) (2023-03-01T07:22:39Z) - How Does Pseudo-Labeling Affect the Generalization Error of the
Semi-Supervised Gibbs Algorithm? [73.80001705134147]
擬似ラベル付き半教師付き学習(SSL)におけるGibsアルゴリズムによる予測一般化誤差(ゲンエラー)を正確に評価する。
ゲンエラーは、出力仮説、擬ラベルデータセット、ラベル付きデータセットの間の対称性付きKL情報によって表現される。
論文 参考訳(メタデータ) (2022-10-15T04:11:56Z) - Toward Adversarial Robustness via Semi-supervised Robust Training [93.36310070269643]
アドリラルな例は、ディープニューラルネットワーク(DNN)に対する深刻な脅威であることが示されている。
R_stand$ と $R_rob$ の2つの異なるリスクを共同で最小化することで、新しい防御手法であるロバストトレーニング(RT)を提案する。
論文 参考訳(メタデータ) (2020-03-16T02:14:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。