論文の概要: CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement
- arxiv url: http://arxiv.org/abs/2609.07529v2
- Date: Tue, 15 Sep 2026 17:40:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.05065
- Title: CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement
- Title(参考訳): CoER:Adaptive Indirect Prompt Injectionに対して,Adversarial Co-Evolution and Refinementによる防御
- Abstract要約: 言語モデルエージェントは、ツール使用中に間接的プロンプトインジェクション(IPI)に対して脆弱である。
検証器を用いた共進化・改良フレームワークであるCoERを提案する。
主要な7ドメイン評価では、CoERは全体的な攻撃成功を38.5%から0.2%に削減した。
- 参考スコア(独自算出の注目度): 19.128257554975104
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language-model agents are vulnerable to indirect prompt injection (IPI) during tool use: adversarial instructions hidden in untrusted tool outputs can covertly redirect legitimate task execution. Existing work often trains and evaluates defenses against fixed attacks that do not adapt to the defender's behavior, so the resulting defenses may struggle against adaptive attacks. We combine adaptive attacker-defender co-training with subsequent refinement: continued interaction improves both roles, while learned attackers provide training challenges for further gains in defender safety and task utility. We therefore model adaptive IPI as a general-sum Markov game: the defender advances the task through successive tool calls, while the attacker can inject multiple times within the same task and adapt subsequent attacks to the defender's responses. Building on this formulation, we propose CoER, a verifier-grounded co-evolution and refinement framework. After initializing the attacker from successful trajectories, Co-PPO retains historical policies from both roles as opponent populations and mixes current and historical opponents for bilateral reinforcement learning, extending training beyond the latest matchup. Attackers from these populations are then reused to challenge teacher agents, and only demonstrations verified for both safety and task completion are used to fine-tune the co-evolved defender. In our main seven-domain evaluation, CoER reduces observed overall attack success from 38.5% to 0.2% and raises task utility from 63.2% to 76.3%, with improved attack resistance on external benchmarks.
- Abstract(参考訳): 言語モデルエージェントは、ツール使用中に間接的なプロンプトインジェクション(IPI)に対して脆弱である。
既存の作業は、しばしば、防御者の行動に適応しない固定攻撃に対する防御を訓練し評価するので、結果として生じる防御は適応攻撃と戦う可能性がある。
我々は、アダプティブアタッカーとディフェンダーの共同トレーニングと、その後の改善を組み合わせ、継続的なインタラクションは両方の役割を改善し、学習したアタッカーはディフェンダーの安全性とタスクユーティリティのさらなる向上のためにトレーニング課題を提供する。
そこで我々は,アダプティブIPIを汎用マルコフゲームとしてモデル化し,攻撃者は連続するツールコールによってタスクを進行させ,攻撃者は同一タスク内に複数回注入し,その後の攻撃をディフェンダーの応答に適応させることができる。
この定式化に基づいて,検証器を用いた共進化・改良フレームワークであるCoERを提案する。
攻撃者を成功した軌道から初期化した後、Co-PPOは、対立する集団としての歴史的政策を維持し、二元的強化学習のために現在と歴史的な対立者を混在させ、最新のマッチングを超えて訓練を延長する。
これらの集団からの攻撃者は、教師エージェントに挑戦するために再利用され、安全とタスク完了の両方で検証されたデモのみが、共進化したディフェンダーを微調整するために使用される。
主要な7ドメイン評価では、CoERは、全体的な攻撃成功を38.5%から0.2%に削減し、タスクユーティリティを63.2%から76.3%に引き上げ、外部ベンチマークに対する攻撃耐性を改善した。
関連論文リスト
- Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection [17.713444943152506]
ツール利用大型言語モデル(LLM)エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である
既存のアダプティブアタックのほとんどは、ターゲットエージェントに対する繰り返しクエリと精製に依存している。
本研究では,攻撃適応を試験時間からオフライン戦略蒸留に移行するSAVORを提案する。
論文 参考訳(メタデータ) (2026-08-09T16:19:05Z) - Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment [25.752599132396437]
間接的なプロンプトインジェクションは、エージェントがタスク実行中に検索するサードパーティデータに悪意のある命令を埋め込むことによって、LLMベースのエージェントをハイジャックする。
既存のディフェンスでは、静的なベンチマークでほぼゼロの攻撃成功率を報告しているが、最近のアダプティブ評価では、攻撃者がデプロイされたディフェンスに対して最適化を許せば、これらの結果は崩壊する。
本稿では,攻撃者が制御するデータではなく,ユーザタスクに対する防衛判断を基礎としたトレーニングベースのRETAを提案する。
論文 参考訳(メタデータ) (2026-06-13T19:15:44Z) - Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO [2.714570887733442]
Adv GRPOは、密集したマルチチャネル報酬を使用してアタッカーとディフェンダーを最適化するコトレーニングフレームワークである。
提案手法は,高能率かつ移動可能な攻撃を発生させることができ,また,協調訓練されたディフェンダーが安全ベンチマークのベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-08T16:21:36Z) - CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning [11.739543857396775]
ブラックボックス攻撃者と安全に配慮したディフェンダーを共同開発するチームリングフレームワークであるCHASEを紹介する。
CHASEカットはStrongREJECTスコアを43.2%削減し、良心的なプロンプトで0%の偽りを拒否する。
見出し結果の他に、CHASEはテンプレートのないRL探索が、機械的に異なる攻撃ファミリー間で転送される潜在攻撃プリミティブを回復することを示している。
論文 参考訳(メタデータ) (2026-06-04T00:06:13Z) - CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks [31.582651893036683]
CoopGuardは、協調エージェントに基づくステートフルなマルチラウンドLLM防衛フレームワークである。
補助的なラウンドレベル戦略のために3つの特殊エージェントを雇用している。
実験によると、CoopGuardは最先端の防御に対して攻撃の成功率を78.9%削減している。
論文 参考訳(メタデータ) (2026-04-05T11:06:13Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Hammer and Anvil: A Principled Defense Against Backdoors in Federated Learning [19.849567299082306]
フェデレートラーニング(Federated Learning)は、複数のクライアントが協力して機械学習モデルをトレーニングする分散ラーニング技術である。
本研究では,まず,既存の敵の能力を超える適応的敵を考案する。
そして、基本原理に2つの防御を組み合わせた、原則化された防衛アプローチであるハマーとアンビルを提示する。
論文 参考訳(メタデータ) (2025-09-09T18:54:31Z) - Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models [64.47869632167284]
従来の言語モデル(LM)の安全性アライメントは、リアクティブで非結合な手順に依存している。
このシーケンシャルなアプローチはミスマッチを生み出し、攻撃者は時代遅れの防御に過度に適合する一方、守備側は出現する脅威に常に遅れをとどめている。
我々は,攻撃者と防御エージェントが継続的なインタラクションを通じて共進化するオンラインセルフプレイ強化学習アルゴリズムであるSelf-RedTeamを提案する。
論文 参考訳(メタデータ) (2025-06-09T06:35:12Z) - On the Difficulty of Defending Contrastive Learning against Backdoor
Attacks [58.824074124014224]
バックドア攻撃が、特有のメカニズムによってどのように動作するかを示す。
本研究は, 対照的なバックドア攻撃の特異性に合わせて, 防御の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2023-12-14T15:54:52Z) - Improving the Adversarial Robustness for Speaker Verification by Self-Supervised Learning [95.60856995067083]
この研究は、特定の攻撃アルゴリズムを知らずにASVの敵防衛を行う最初の試みの一つである。
本研究の目的は,1) 対向摂動浄化と2) 対向摂動検出の2つの視点から対向防御を行うことである。
実験の結果, 検出モジュールは, 約80%の精度で対向検体を検出することにより, ASVを効果的に遮蔽することがわかった。
論文 参考訳(メタデータ) (2021-06-01T07:10:54Z) - What Doesn't Kill You Makes You Robust(er): Adversarial Training against
Poisons and Backdoors [57.040948169155925]
敵対的なトレーニングフレームワークを拡張し、(訓練時間)中毒やバックドア攻撃から防御します。
本手法は, トレーニング中に毒を発生させ, トレーニングバッチに注入することにより, ネットワークを中毒の影響に敏感化する。
この防御は、適応攻撃に耐え、多様な脅威モデルに一般化し、以前の防御よりも優れた性能のトレードオフをもたらすことを示す。
論文 参考訳(メタデータ) (2021-02-26T17:54:36Z) - Guided Adversarial Attack for Evaluating and Enhancing Adversarial
Defenses [59.58128343334556]
我々は、より適切な勾配方向を見つけ、攻撃効果を高め、より効率的な対人訓練をもたらす標準損失に緩和項を導入する。
本稿では, クリーン画像の関数マッピングを用いて, 敵生成を誘導するGAMA ( Guided Adversarial Margin Attack) を提案する。
また,一段防衛における最先端性能を実現するためのGAT ( Guided Adversarial Training) を提案する。
論文 参考訳(メタデータ) (2020-11-30T16:39:39Z) - On Adaptive Attacks to Adversarial Example Defenses [123.32678153377915]
本稿では、敵の事例に対して、防御に対する適応攻撃を行うために必要な方法論とアプローチを概説する。
これらの分析が、敵の事例に対して適切な防御攻撃を行うためのガイダンスとして役立てられることを期待している。
論文 参考訳(メタデータ) (2020-02-19T18:50:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。