論文の概要: COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense
- arxiv url: http://arxiv.org/abs/2608.19982v1
- Date: Thu, 20 Aug 2026 12:52:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.566894
- Title: COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense
- Title(参考訳): COPA: アダプティブ・プロンプト・インジェクション・ディフェンスのための継続的優先最適化
- Authors: Roshan Sood, Onat Gungor, Tajana Rosing,
- Abstract要約: 本稿では,生涯学習問題として即時噴射防御を扱う,生涯優先最適化フレームワークCOPAを提案する。
我々は,COPAによる攻撃成功率の平均は6.3倍,4.4倍にまで低下することを示した。
- 参考スコア(独自算出の注目度): 9.772864559539084
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs remain vulnerable to prompt injection attacks, where adversarial instructions embedded in user inputs or external content manipulate model behavior and bypass safeguards. Existing defenses are predominantly static, relying on fixed alignment objectives or attack-specific filtering mechanisms that require redesign as new attack strategies emerge. While recent lifelong alignment methods address shifting user preferences, they do not account for adaptive adversaries that continually evolve to exploit weaknesses in previously learned defenses. This limitation is particularly important in real-world deployments, where evolving attack distributions necessitate continual adaptation without sacrificing robustness to previously encountered threats. We present COPA, a continual preference optimization framework that treats prompt-injection defense as a lifelong learning problem. Instead of one-time alignment, COPA incrementally incorporates feedback from newly observed attacks via GRPO-based optimization and uses margin-weighted experience replay to retain defenses against prior attack classes. This enables continuous adaptation to emerging threats while mitigating catastrophic forgetting and preserving general-purpose model capabilities. Across lifelong prompt injection attack streams, COPA reduces attack success rate by up to 6.3x and 4.4x on average compared to state-of-the-art defenses. These results highlight continual preference optimization as an effective paradigm for defending LLMs against adaptive adversaries.
- Abstract(参考訳): LLMは、ユーザ入力や外部コンテンツに埋め込まれた敵の命令がモデル動作を操作し、セーフガードをバイパスするインジェクション攻撃に対して脆弱なままである。
既存の防御は、主に静的であり、新しい攻撃戦略が出現するにつれて再設計を必要とする、固定されたアライメントの目的や攻撃固有のフィルタリングメカニズムに依存している。
近年のアライメント手法は, ユーザの好みの変化に対処するが, 従来学習されていた防御力の弱さを活かすために, 常に進化する適応的敵を考慮に入れない。
この制限は、以前に遭遇した脅威に対して堅牢性を犠牲にすることなく、進化する攻撃分布が継続的な適応を必要とする現実世界の展開において特に重要である。
本稿では,生涯にわたる学習問題として,インジェクション防衛を取り扱う継続的優先最適化フレームワークCOPAを提案する。
1回のアライメントの代わりに、COPAはGRPOベースの最適化を通じて新たに観測された攻撃からのフィードバックをインクリメンタルに取り入れ、前回の攻撃クラスに対する防御を維持するためにマージン重み付きエクスペリエンスリプレイを使用する。
これにより、新たな脅威への継続的な適応を可能にし、破滅的な忘れ込みを緩和し、汎用的なモデル機能を維持することができる。
COPAは、生涯にわたるインジェクション攻撃ストリームを通じて、最先端の防御よりも平均して6.3倍と4.4倍の攻撃成功率を低下させる。
これらの結果は、適応的敵に対するLLMの防御に有効なパラダイムとして、連続的な選好最適化を強調している。
関連論文リスト
- Prompt-Unknown Promotion Attacks against LLM-based Sequential Recommender Systems [51.504307822017985]
大規模言語モデルを用いたシーケンシャルレコメンデータシステム(LLM-SRS)は,最近顕著な性能を示した。
本稿では, LLM-SRSにおけるアイテムプロモーション攻撃について, 攻撃者に対してシステムプロンプトと被害者モデルの両方が未知な状況下で, より現実的な状況下で検討する。
論文 参考訳(メタデータ) (2026-04-26T10:09:26Z) - Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks [3.206339985805037]
ダッシュラインディフェンス(Dashed Line Defense, DLD)は、適応的なクエリ戦略に対処するために設計された、プラグアンドプレイのポストプロセッシング手法である。
DLDは、観測された損失がどのように真の敵の強さを反映しているかの曖昧さを導入することで、攻撃者がクエリを確実に分析し、適応することを防ぐ。
我々は,DLDの防御能力を理論的に保証し,ImageNetの実験を通じてその有効性を検証する。
論文 参考訳(メタデータ) (2026-02-09T14:02:32Z) - The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections [74.60337113759313]
現在のジェイルブレイクとプロンプトインジェクションに対する防御は、通常、有害な攻撃文字列の静的セットに対して評価される。
我々は,この評価プロセスに欠陥があることを論じる。代わりに,攻撃戦略を明示的に修正したアダプティブアタッカーに対する防御を,防衛設計に対抗して評価すべきである。
論文 参考訳(メタデータ) (2025-10-10T05:51:04Z) - CyGATE: Game-Theoretic Cyber Attack-Defense Engine for Patch Strategy Optimization [73.13843039509386]
本稿では,攻撃と防御の相互作用をモデル化するゲーム理論フレームワークCyGATEを提案する。
CyGATEはサイバー・キル・チェーン(Cyber Kill Chain)の段階にわたって、サイバー紛争を部分的に観察可能なゲーム(POSG)として捉えている。
フレームワークの柔軟なアーキテクチャは、マルチエージェントシナリオの拡張を可能にする。
論文 参考訳(メタデータ) (2025-08-01T09:53:06Z) - Minimal Cascade Gradient Smoothing for Fast Transferable Preemptive Adversarial Defense [17.603114590159553]
Minimal Sufficient Preemptive Defense (MSPD)は、ターゲットモデルやグラデーションにアクセスせずに将来の攻撃を防御する高速フレームワークである。
MSPDは0.02s/image (CIFAR-10) と 0.26s/image (ImageNet) で動作し、事前プリエンプティブメソッドよりも28-1696倍高速である。
Preemptive Reversionは、フルアクセス下でプリエンプティブ摂動をキャンセルする最初のホワイトボックス診断攻撃である。
論文 参考訳(メタデータ) (2024-07-22T10:23:44Z) - Mutual-modality Adversarial Attack with Semantic Perturbation [81.66172089175346]
本稿では,相互モダリティ最適化スキームにおける敵攻撃を生成する新しい手法を提案する。
我々の手法は最先端の攻撃方法より優れており、プラグイン・アンド・プレイ・ソリューションとして容易にデプロイできる。
論文 参考訳(メタデータ) (2023-12-20T05:06:01Z) - Avoid Adversarial Adaption in Federated Learning by Multi-Metric
Investigations [55.2480439325792]
Federated Learning(FL)は、分散機械学習モデルのトレーニング、データのプライバシの保護、通信コストの低減、多様化したデータソースによるモデルパフォーマンスの向上を支援する。
FLは、中毒攻撃、標的外のパフォーマンス劣化とターゲットのバックドア攻撃の両方でモデルの整合性を損なうような脆弱性に直面している。
我々は、複数の目的に同時に適応できる、強い適応的敵の概念を新たに定義する。
MESASは、実際のデータシナリオで有効であり、平均オーバーヘッドは24.37秒である。
論文 参考訳(メタデータ) (2023-06-06T11:44:42Z) - Guided Adversarial Attack for Evaluating and Enhancing Adversarial
Defenses [59.58128343334556]
我々は、より適切な勾配方向を見つけ、攻撃効果を高め、より効率的な対人訓練をもたらす標準損失に緩和項を導入する。
本稿では, クリーン画像の関数マッピングを用いて, 敵生成を誘導するGAMA ( Guided Adversarial Margin Attack) を提案する。
また,一段防衛における最先端性能を実現するためのGAT ( Guided Adversarial Training) を提案する。
論文 参考訳(メタデータ) (2020-11-30T16:39:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。