論文の概要: DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption
- arxiv url: http://arxiv.org/abs/2608.16536v1
- Date: Mon, 17 Aug 2026 13:11:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.707083
- Title: DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption
- Title(参考訳): DSプロンプト:M-RAG破壊に対するソフトプロンプトの動的防御
- Abstract要約: M-RAG(Multimodal Retrieval Augmented Generation)は、敵の攻撃に対して脆弱である。
本稿では,検索パイプラインを変更することなく,検索者の埋め込みセマンティクスを再評価するフレームワークDSPromptを提案する。
- 参考スコア(独自算出の注目度): 29.57772851388111
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Retrieval Augmented Generation (M-RAG) is increasingly vulnerable to adversarial attacks where malicious data are crafted to produce embeddings that align with benign entries in the vector space, deceiving retrieval and inducing harmful outputs. Existing defenses primarily operate at query time, relying on auxiliary detectors, similarity re-ranking, or feature-consistency checks. However, these approaches suffer from non-trivial inference overhead, generalize poorly to unseen attack strategies, and often assume specific attack distributions. To address this, we propose DSPrompt, a Dynamic Soft Prompt defense framework that directly reshapes the retriever's embedding semantics, without modifying the retrieval pipeline. It inserts few learnable soft prompts into each layer of the visual and textual encoders of a frozen retriever, utilizing a shallow-to-deep length schedule that is adaptive to the capacity in the model layers. These prompts are trained under a dynamic min-max scheme: an online multimodal attacker continually crafts hard adversarial documents against the current retriever, while the defender is updated to push such documents out of the top-k while preserving the ranking and diversity of benign evidence. Because the defended encoder can be pre-computed and indexed exactly as in standard dense retrieval, DSPrompt incurs no additional per-query optimization and introduces fewer than 1% additional parameters. Extensive experiments across four benchmarks and three representative poisoning attacks show that DSPrompt substantially reduces the attack success rate and poison retrieval rate while maintaining near-lossless retrieval utility and generation fidelity, consistently outperforming existing defense baselines at a fraction of their computational cost.
- Abstract(参考訳): M-RAG(Multimodal Retrieval Augmented Generation)は、悪質なデータがベクトル空間内の良質なエントリと整合した埋め込みを生成し、検索と有害な出力を誘導する敵攻撃に対して、ますます脆弱である。
既存の防御は、主にクエリ時に動作し、補助検出器、類似性の再ランク、機能整合性チェックに依存する。
しかしながら、これらのアプローチは、非自明な推測オーバーヘッドに悩まされ、目に見えない攻撃戦略を一般化し、しばしば特定の攻撃分布を仮定する。
そこで本研究では,動的ソフト・プロンプト・ディフェンス・フレームワークであるDSPromptを提案する。
冷凍レトリバーの視覚的およびテキスト的エンコーダの各層に学習可能なソフトプロンプトを挿入し、モデル層のキャパシティに適応する浅層から深層までのスケジュールを利用する。
これらのプロンプトは動的min-maxスキームで訓練される: オンラインマルチモーダル攻撃者は、常に、現在のレトリバーに対してハードな敵の文書を制作し、ディフェンダーは、それらの文書をトップkから押し出し、良心的な証拠のランクと多様性を保ちながら、それらの文書をプッシュするように更新する。
防御されたエンコーダは、標準的な高密度検索と同じようにプリコンパイルおよびインデックス化できるため、DSPromptは、追加のクエリごとの最適化を行わず、1%未満の追加パラメータを導入する。
4つのベンチマークと3つの代表的な毒殺攻撃による広範囲な実験により、DSPromptは攻撃成功率と毒殺率を著しく低減し、ほぼ無害な検索ユーティリティと生成忠実さを維持しながら、既存の防衛基準線を計算コストのごく一部で一貫して上回っていることが示されている。
関連論文リスト
- Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts [14.233668486426795]
大規模言語モデル(LLM)は推論や知識集約的なタスクに優れるが、迅速なレベルの敵攻撃には弱いままである。
意味的に整合しているが難解なプロンプトを生成するためのフレームワークである,A* にインスパイアされた Factual Error Injection Framework を提案する。
我々は、即時書き直しが契約の繰り返しに続くことを証明し、$$が減少するにつれて意味的な崩壊につながることを証明した。
論文 参考訳(メタデータ) (2026-05-31T20:20:53Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection [9.898508403320438]
本稿では,テキストの逆転を検知する新しいブラックボックスフレームワークRTD-Guardを紹介する。
我々の重要な洞察は、敵攻撃における単語置換摂動は、置換トークン検出識別器が識別するために事前訓練されている「置換トークン」によく似ているということである。
プロセス全体では、敵データ、モデルチューニング、内部モデルアクセスは必要とせず、2つのブラックボックスクエリのみを使用する。
論文 参考訳(メタデータ) (2026-03-13T02:30:56Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Defenses Against Prompt Attacks Learn Surface Heuristics [40.392588465939106]
大規模言語モデル(LLM)は、セキュリティに敏感なアプリケーションにますますデプロイされている。
LLMは、ユーザクエリや検索されたコンテンツに逆命令が現れるとき、意図したロジックをオーバーライドすることができる。
最近の防衛は、良心と悪意のあるラベルによる監督された微調整に依存している。
論文 参考訳(メタデータ) (2026-01-12T04:12:48Z) - Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification [52.63017280231648]
人物再識別(ReID)は、歩行者軌道追跡などの現実の多くの応用において、基本的な課題である。
Person ReIDモデルは、歩行者画像に対する知覚不能な摂動が完全に誤った予測を引き起こすような、敵の攻撃に非常に敏感である。
本稿では,2つの相からなる二重不変防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-13T03:56:40Z) - PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance [10.105673138616483]
大規模言語モデル(LLM)は、仮想アシスタントから自律エージェントに至るまで、現実のアプリケーションにますます統合されている。
攻撃者がパラフレーズ、難読化、マルチタスクのインジェクション戦略で進化するにつれて、既存のベンチマークは、出現する脅威の全スペクトルを捉えるのに十分ではない。
PromptSleuthは,表面的特徴ではなくタスクレベルの意図を推論することで,迅速なインジェクションを検出するセマンティック指向の防衛フレームワークである。
論文 参考訳(メタデータ) (2025-08-28T15:19:07Z) - DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection [0.9499594220629591]
アドリシャル・プロンプト・アタックは、レトリーバル・アフュージョンド・ジェネレーション(RAG)システムの信頼性を大きく変える可能性がある。
本稿では, RAGに基づく質問応答に対して, 対角的プロンプト接尾辞を最適化するために, 微分進化(DE)を適用した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-07-20T16:48:20Z) - Auto-Prompt Generation is Not Robust: Prompt Optimization Driven by Pseudo Gradient [50.15090865963094]
PertBenchは、幅広い入力摂動を含む包括的なベンチマークデータセットである。
我々の分析は、既存の即時生成戦略における重大な脆弱性を明らかにしている。
PGOは、摂動型を擬似次数次信号として活用する、勾配のないプロンプト生成フレームワークである。
論文 参考訳(メタデータ) (2024-12-24T06:05:08Z) - Meta Invariance Defense Towards Generalizable Robustness to Unknown Adversarial Attacks [62.036798488144306]
現在の防衛は主に既知の攻撃に焦点を当てているが、未知の攻撃に対する敵意の強固さは見過ごされている。
メタ不変防衛(Meta Invariance Defense, MID)と呼ばれる攻撃非依存の防御手法を提案する。
MIDは高レベルの画像分類と低レベルの頑健な画像再生における攻撃抑制において,知覚不能な逆方向の摂動に対して同時に頑健性を実現する。
論文 参考訳(メタデータ) (2024-04-04T10:10:38Z) - Noise-Robust Dense Retrieval via Contrastive Alignment Post Training [89.29256833403167]
Contrastive Alignment POst Training (CAPOT) は、指数再生を必要とせず、モデルロバスト性を改善する高効率な微調整法である。
CAPOTはドキュメントエンコーダを凍結することで堅牢な検索を可能にし、クエリエンコーダはノイズの多いクエリを修正されていないルートに整列させる。
MSMARCO、Natural Questions、Trivia QAパス検索のCAPOTノイズ変動を評価し、CAPOTがオーバーヘッドを伴わないデータ増大に類似した影響があることを発見した。
論文 参考訳(メタデータ) (2023-04-06T22:16:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。