論文の概要: CoRL: Co-Evolutionary Reinforcement Learning for Adaptive Indirect Prompt-Injection Attacks and Defenses
- arxiv url: http://arxiv.org/abs/2609.07529v1
- Date: Mon, 07 Sep 2026 14:09:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.441303
- Title: CoRL: Co-Evolutionary Reinforcement Learning for Adaptive Indirect Prompt-Injection Attacks and Defenses
- Title(参考訳): CoRL:Adaptive Indirect Prompt-Injection Attacks and Defensesのための共進化強化学習
- Abstract要約: ツール拡張言語エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である
検証器を用いた3段階の共進化・補修フレームワークを提案する。
ディフェンダー当たり1,514点のクリーン、固定テンペレート、適応実行で、CoRLはASR全体の0.0%に38.5点を減らし、有効性を13.1点を76.3%に引き上げている。
- 参考スコア(独自算出の注目度): 19.128257554975104
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-augmented language agents are vulnerable to indirect prompt injection (IPI). Unlike direct prompt injection, IPI hides adversarial instructions in untrusted tool outputs and can covertly alter the execution of a legitimate task. Defenses trained on fixed attacks may fail as an attacker changes its strategy, injection site, and payload. To address this problem, we formulate adaptive IPI as an asymmetric, partially observable, general-sum Markov game: a multi-turn attacker adapts payloads at reached tool-return sites from the public trajectory, while a tool-using defender must block the injected objective and complete the user task. We propose CoRL, a verifier-grounded co-evolution and repair framework with three stages: Attacker SFT initializes multi-turn attacks from successful trajectories; bilateral Co-PPO jointly trains both agents with role-specific rewards and historical opponent populations; and Defender SFT consolidates verifier-accepted teacher repairs for population-discovered failures. Across 1,514 clean, fixed-template, and adaptive executions per defender, CoRL reduces overall ASR by 38.5 points to 0.0% and raises utility by 13.1 points to 76.3%. Stage-wise and controlled ablations show positive contributions from online Co-PPO and population-mined repair, while external-benchmark evaluation indicates transfer in attack resistance. The defender balances safety and task utility under the evaluated attacks, while the retained attackers provide candidates for adaptive red-team evaluation.
- Abstract(参考訳): ツール拡張言語エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である。
直接のプロンプトインジェクションとは異なり、IPIは非信頼のツール出力に敵の命令を隠蔽し、正当なタスクの実行を隠蔽的に変更することができる。
攻撃者が戦略、インジェクションサイト、ペイロードを変更すると、固定攻撃で訓練された防御は失敗する可能性がある。
この問題を解決するために、適応型IPIを非対称で部分的に観測可能な一般的なマルコフゲームとして定式化し、マルチターン攻撃者は到達したツールリターンサイトのペイロードを公共軌道から適応させ、ツールを使用するディフェンダーは注入対象をブロックし、ユーザタスクを完了させる。
攻撃者SFTは、成功した軌道からのマルチターン攻撃を初期化し、Co-PPOは、役割特異的報酬と歴史的反対者の双方のエージェントを共同で訓練し、Defender SFTは、検証者受け入れ型教師の集団的障害に対する修復を統合化する。
ディフェンダー当たり1,514点のクリーン、固定テンペレート、適応実行で、CoRLはASR全体の0.0%に38.5点を減らし、有効性を13.1点を76.3%に引き上げている。
段階的および制御された改善は、オンラインCo-PPOと人口削減による修復から肯定的な貢献を示し、外部ベンチマーク評価は攻撃抵抗の移動を示している。
ディフェンダーは、評価された攻撃下での安全性とタスクユーティリティのバランスを保ち、保持された攻撃者は適応的なレッドチーム評価の候補を提供する。
関連論文リスト
- Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection [17.713444943152506]
ツール利用大型言語モデル(LLM)エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である
既存のアダプティブアタックのほとんどは、ターゲットエージェントに対する繰り返しクエリと精製に依存している。
本研究では,攻撃適応を試験時間からオフライン戦略蒸留に移行するSAVORを提案する。
論文 参考訳(メタデータ) (2026-08-09T16:19:05Z) - Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment [25.752599132396437]
間接的なプロンプトインジェクションは、エージェントがタスク実行中に検索するサードパーティデータに悪意のある命令を埋め込むことによって、LLMベースのエージェントをハイジャックする。
既存のディフェンスでは、静的なベンチマークでほぼゼロの攻撃成功率を報告しているが、最近のアダプティブ評価では、攻撃者がデプロイされたディフェンスに対して最適化を許せば、これらの結果は崩壊する。
本稿では,攻撃者が制御するデータではなく,ユーザタスクに対する防衛判断を基礎としたトレーニングベースのRETAを提案する。
論文 参考訳(メタデータ) (2026-06-13T19:15:44Z) - Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO [2.714570887733442]
Adv GRPOは、密集したマルチチャネル報酬を使用してアタッカーとディフェンダーを最適化するコトレーニングフレームワークである。
提案手法は,高能率かつ移動可能な攻撃を発生させることができ,また,協調訓練されたディフェンダーが安全ベンチマークのベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-08T16:21:36Z) - CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning [11.739543857396775]
ブラックボックス攻撃者と安全に配慮したディフェンダーを共同開発するチームリングフレームワークであるCHASEを紹介する。
CHASEカットはStrongREJECTスコアを43.2%削減し、良心的なプロンプトで0%の偽りを拒否する。
見出し結果の他に、CHASEはテンプレートのないRL探索が、機械的に異なる攻撃ファミリー間で転送される潜在攻撃プリミティブを回復することを示している。
論文 参考訳(メタデータ) (2026-06-04T00:06:13Z) - CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks [31.582651893036683]
CoopGuardは、協調エージェントに基づくステートフルなマルチラウンドLLM防衛フレームワークである。
補助的なラウンドレベル戦略のために3つの特殊エージェントを雇用している。
実験によると、CoopGuardは最先端の防御に対して攻撃の成功率を78.9%削減している。
論文 参考訳(メタデータ) (2026-04-05T11:06:13Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Hammer and Anvil: A Principled Defense Against Backdoors in Federated Learning [19.849567299082306]
フェデレートラーニング(Federated Learning)は、複数のクライアントが協力して機械学習モデルをトレーニングする分散ラーニング技術である。
本研究では,まず,既存の敵の能力を超える適応的敵を考案する。
そして、基本原理に2つの防御を組み合わせた、原則化された防衛アプローチであるハマーとアンビルを提示する。
論文 参考訳(メタデータ) (2025-09-09T18:54:31Z) - Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models [64.47869632167284]
従来の言語モデル(LM)の安全性アライメントは、リアクティブで非結合な手順に依存している。
このシーケンシャルなアプローチはミスマッチを生み出し、攻撃者は時代遅れの防御に過度に適合する一方、守備側は出現する脅威に常に遅れをとどめている。
我々は,攻撃者と防御エージェントが継続的なインタラクションを通じて共進化するオンラインセルフプレイ強化学習アルゴリズムであるSelf-RedTeamを提案する。
論文 参考訳(メタデータ) (2025-06-09T06:35:12Z) - On the Difficulty of Defending Contrastive Learning against Backdoor
Attacks [58.824074124014224]
バックドア攻撃が、特有のメカニズムによってどのように動作するかを示す。
本研究は, 対照的なバックドア攻撃の特異性に合わせて, 防御の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2023-12-14T15:54:52Z) - Improving the Adversarial Robustness for Speaker Verification by Self-Supervised Learning [95.60856995067083]
この研究は、特定の攻撃アルゴリズムを知らずにASVの敵防衛を行う最初の試みの一つである。
本研究の目的は,1) 対向摂動浄化と2) 対向摂動検出の2つの視点から対向防御を行うことである。
実験の結果, 検出モジュールは, 約80%の精度で対向検体を検出することにより, ASVを効果的に遮蔽することがわかった。
論文 参考訳(メタデータ) (2021-06-01T07:10:54Z) - What Doesn't Kill You Makes You Robust(er): Adversarial Training against
Poisons and Backdoors [57.040948169155925]
敵対的なトレーニングフレームワークを拡張し、(訓練時間)中毒やバックドア攻撃から防御します。
本手法は, トレーニング中に毒を発生させ, トレーニングバッチに注入することにより, ネットワークを中毒の影響に敏感化する。
この防御は、適応攻撃に耐え、多様な脅威モデルに一般化し、以前の防御よりも優れた性能のトレードオフをもたらすことを示す。
論文 参考訳(メタデータ) (2021-02-26T17:54:36Z) - Guided Adversarial Attack for Evaluating and Enhancing Adversarial
Defenses [59.58128343334556]
我々は、より適切な勾配方向を見つけ、攻撃効果を高め、より効率的な対人訓練をもたらす標準損失に緩和項を導入する。
本稿では, クリーン画像の関数マッピングを用いて, 敵生成を誘導するGAMA ( Guided Adversarial Margin Attack) を提案する。
また,一段防衛における最先端性能を実現するためのGAT ( Guided Adversarial Training) を提案する。
論文 参考訳(メタデータ) (2020-11-30T16:39:39Z) - On Adaptive Attacks to Adversarial Example Defenses [123.32678153377915]
本稿では、敵の事例に対して、防御に対する適応攻撃を行うために必要な方法論とアプローチを概説する。
これらの分析が、敵の事例に対して適切な防御攻撃を行うためのガイダンスとして役立てられることを期待している。
論文 参考訳(メタデータ) (2020-02-19T18:50:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。