論文の概要: PURPOSE: Poisoning Conflict Resolution in RAG via Proxy-Fact-Grounded Updates
- arxiv url: http://arxiv.org/abs/2608.04756v1
- Date: Wed, 05 Aug 2026 12:23:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.917941
- Title: PURPOSE: Poisoning Conflict Resolution in RAG via Proxy-Fact-Grounded Updates
- Title(参考訳): PURPOSE: Proxy-Fact-Grounded UpdatesによるRAGの紛争解決
- Authors: Zijian Wang, Yubo Zhu, Muzhi Dong, Yanjun Lou, Yisheng Li, ZiLiang Zhang, Wei Tong, Yuan Zhang, Jingyu Hua, Sheng Zhong,
- Abstract要約: 我々は、抗弁論としてではなく、対立を最小限に抑えるアップデートとして、インジェクションを再設定する厳格なブラックボックス中毒攻撃を提案する。
3つのQAベンチマーク、5つのジェネレータ、3つのコンフリクト解決方法において、PURPOSEは45設定中35の攻撃成功率(ASR)を達成している。
以上の結果から,本法はRAGの競合解消に有効であり,非接触注射は中毒攻撃を増強するための実用的な方法であると考えられた。
- 参考スコア(独自算出の注目度): 10.748336834513855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Retrieval-Augmented Generation (RAG), post-retrieval conflict resolution arbitrates among noisy or contradictory retrieved passages. However, the robustness of this safeguard against knowledge poisoning has not been adequately studied. Existing black-box poisoning methods all assert the target answer in frontal contradiction with what the resolver treats as settled, the very signal these methods are built to detect. We propose PURPOSE, a strict black-box poisoning attack that reframes the injection as an update that minimizes conflict, rather than as a counter-claim. PURPOSE extracts query-related facts approximating the resolver's possible reference, then grounds a pivot event in them to keep the injection consistent with what the resolver might verify while steering the generator toward the target answer. Across three QA benchmarks, five generators, and three conflict-resolution methods, PURPOSE attains the highest attack success rate (ASR) in 35 of 45 settings and exceeds the strongest prior attack with +9.7 mean ASR points. These results show that our poisoning method is effective against conflict resolution in RAG and identify non-contradicting injection as a practical mode to enhance poisoning attack.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG)では、検索後の競合解決は、ノイズまたは矛盾した検索されたパス間で仲裁する。
しかし、この知識中毒に対する保護の堅牢性は十分に研究されていない。
既存のブラックボックス中毒法は、すべて、リゾルバが落ち着いたものとして扱うものと相反するターゲットの答えを主張するものであり、これらの方法が検出するために構築されるシグナルである。
PURPOSEは厳格なブラックボックス中毒攻撃であり、反訴としてではなく、紛争を最小限に抑えるアップデートとしてインジェクションを再設定する。
PURPOSEは、リゾルバの可能な参照を近似したクエリ関連事実を抽出し、その中にピボットイベントを置き、リゾルバがターゲットの応答に向けてジェネレータを操りながら、インジェクションが検証するものと一致し続ける。
3つのQAベンチマーク、5つのジェネレータ、3つのコンフリクト解像度の手法で、PURPOSEは45設定中35の攻撃成功率(ASR)を達成し、+9.7の平均的なASRポイントを持つ最強の攻撃を超える。
以上の結果から,本法はRAGの競合解消に有効であり,非接触注射は中毒攻撃を増強するための実用的な方法であると考えられた。
関連論文リスト
- DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial [7.434105792757549]
EmphDenialRAGは,正しい回答を明示し,それを否定し,攻撃者による説明を提示する単一文書中毒攻撃である。
DenialRAGは、コンフリクトを直接ジェネレータが見るコンテキストに埋め込む。
我々はDenialRAGを3つのオープンドメイン質問回答データセットにまたがる4つの単一文書中毒攻撃に対して評価した。
論文 参考訳(メタデータ) (2026-08-02T20:33:05Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control [22.814552066611597]
既存の防衛は、毒物検出が害を防いでいると仮定している。
モデルは監視と制御のギャップを示す。
コードン原理を導入します -- 最終的な合成が可能なエージェントは、信頼できない自然言語の証拠にアクセスできません。
論文 参考訳(メタデータ) (2026-05-26T09:27:19Z) - Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict [7.091145002779077]
文脈駆動分解(英: Context-Driven Decomposition、CDD)は、推論時に動作する信念分解プローブである。
制御された検索競合の介入メカニズムとして機能する。
これら3つのパターンは、標準的なRAGを探索できる構造軸としてコンテキスト準拠を識別する。
論文 参考訳(メタデータ) (2026-05-14T07:14:19Z) - Uncertainty-Aware Jamming Mitigation with Active RIS: A Robust Stackelberg Game Approach [65.06640919319413]
本稿では,アクティブリコンフィギュアブルインテリジェントサーフェス(ARIS)を利用したジャミング緩和について検討する。
正当側と敵側の戦略的相互作用をモデル化するために,Stackelbergゲーム定式化を採用する。
まず、ロバストなアンチジャミング設計のための正当側最適化に組み込む、従者のベストレスポンスとして最適なジャミングポリシーを導出する。
論文 参考訳(メタデータ) (2026-02-20T12:02:01Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks [104.50239783909063]
Retrieval Augmented Generation (RAG) を用いた多モーダル大規模言語モデルは、多モーダル質問応答のようなかなり高度なタスクを持つ。
この外部知識への依存は、知識中毒攻撃(英語版)という、危険だが未発見の安全リスクを引き起こす。
マルチモーダルRAGにおける知識中毒を体系的に設計する最初のフレームワークであるMM-PoisonRAGを提案する。
論文 参考訳(メタデータ) (2025-02-25T04:23:59Z) - AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning [93.77763753231338]
CLIP画像エンコーダを微調整し、2つの中間対向クエリに対して同様の埋め込みを抽出するために、ACPT(Adversarial Contrastive Prompt Tuning)を提案する。
我々は,ACPTが7つの最先端クエリベースの攻撃を検出できることを示す。
また,ACPTは3種類のアダプティブアタックに対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-08-04T09:53:50Z) - RECESS Vaccine for Federated Learning: Proactive Defense Against Model Poisoning Attacks [20.55681622921858]
モデル中毒は、フェデレートラーニング(FL)の適用を著しく阻害する
本研究では,モデル中毒に対するRECESSという新しいプロアクティブ・ディフェンスを提案する。
各イテレーションをスコアする従来の方法とは異なり、RECESSはクライアントのパフォーマンス相関を複数のイテレーションで考慮し、信頼スコアを見積もる。
論文 参考訳(メタデータ) (2023-10-09T06:09:01Z) - Stealthy Backdoor Attack via Confidence-driven Sampling [49.72680157684523]
バックドア攻撃は、悪質なトリガをDNNモデルに過剰に挿入することを目的としており、テストシナリオ中に不正な制御を許可している。
既存の方法では防衛戦略に対する堅牢性が欠如しており、主に無作為な試薬を無作為に選別しながら、引き金の盗難を強化することに重点を置いている。
信頼性スコアの低いサンプルを選別し、これらの攻撃を識別・対処する上で、守備側の課題を著しく増大させる。
論文 参考訳(メタデータ) (2023-10-08T18:57:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。