論文の概要: Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
- arxiv url: http://arxiv.org/abs/2608.05108v1
- Date: Wed, 05 Aug 2026 17:44:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.06374
- Title: Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
- Title(参考訳): エージェント対エージェント: 自動プロンプトインジェクションレッドチームのためのエージェントシステム
- Authors: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia,
- Abstract要約: 我々はインジェクション・リピートのためのエージェントシステムであるPIMinerを開発した。
トレーニング中、PIMinerは(データセット、ターゲットモデル)ペアのシーケンスでトレーニングされる。
テスト時には、学習した戦略ライブラリを直接、未確認の目標LLMに転送することができる。
- 参考スコア(独自算出の注目度): 19.85522880335499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt injection poses significant security risks to LLM agents. Efficient and effective red-teaming is therefore critical, both for evaluating these risks and for collecting training data to improve defenses. Existing state-of-the-art prompt injection red-teaming methods primarily rely on reinforcement learning (RL), producing attacker models that often generalize poorly to new target LLMs. In this work, we develop PIMiner, an agentic system for prompt injection red-teaming. During training, PIMiner is trained on a sequence of (dataset, target model) pairs and builds a strategy library from scratch. At test time, the learned strategy library can be directly transferred to a previously unseen target LLM without additional training. PIMiner requires only a small number of queries to a target agent (e.g., 10) per test sample. Experimental results demonstrate that PIMiner achieves strong performance. On IPIArena, it attains a 76.2% ASR against Gemini-2.5-Pro, 61.9% ASR against GPT-5.1, and 42.9% ASR against Claude-Sonnet-4.5. On AgentDojo, it achieves an 86.7% ASR against Gemini-2.5-Pro, 53.3% ASR against GPT-5.1, and 40.0% ASR against Claude-Sonnet-4.5.
- Abstract(参考訳): プロンプト注入はLLMエージェントに重大なセキュリティリスクをもたらす。
したがって、これらのリスクの評価と、防御を改善するためのトレーニングデータ収集の両方において、効率的で効果的なレッドチーム化が重要である。
既存の最先端のプロンプト・インジェクション・リピート方式は、主に強化学習(RL)に依存しており、しばしば新しい目標のLSMに悪影響を及ぼす攻撃モデルを生成する。
本研究では,インジェクション・リピートを行うエージェントシステムであるPIMinerを開発した。
トレーニング中、PIMinerは(データセット、ターゲットモデル)ペアのシーケンスでトレーニングされ、スクラッチから戦略ライブラリを構築する。
テスト時には、学習した戦略ライブラリを、追加のトレーニングを必要とせずに、未確認の目標LLMに直接転送することができる。
PIMinerは、テストサンプル毎にターゲットエージェント(例、10)に少数のクエリしか必要としない。
実験の結果,PIMinerは高い性能を示した。
IPIArenaでは、Gemini-2.5-Proに対して76.2%、GPT-5.1に対して61.9%、Claude-Sonnet-4.5に対して42.9%のASRを達成した。
AgentDojoでは、Gemini-2.5-Proに対する86.7%のASR、GPT-5.1に対する53.3%のASR、Claude-Sonnet-4.5に対する40.0%のASRを達成する。
関連論文リスト
- Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare [0.0]
本稿では,医療報告生成アプリケーションにAI Trust, Risk, and Security Management (TRiSM) フレームワークを適用する。
これは、安全でないエージェントワークフローが、セキュリティに配慮したエージェントワークフローにどのように変換されるかを示す。
論文 参考訳(メタデータ) (2026-06-27T01:00:39Z) - SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning [18.219912912964812]
我々は、任意のブラックボックスLLMエージェントのための一般的なレッドチームフレームワークであるSIRAJを紹介する。
エージェント定義から始まり、多様なシードテストケースを生成する動的2段階プロセスを採用する。
それは、以前の試みの実行軌跡に基づいて、モデルベースの敵攻撃を反復的に構築し、洗練する。
論文 参考訳(メタデータ) (2025-10-30T00:32:58Z) - Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People [81.63702981397408]
限られたリソースを前提として、言語モデル(LM)に基づいたエージェントは、どの程度合理的に行動するのか?
エージェント情報探索をベンチマークし,強化する手法を開発し,人間の行動から洞察を抽出する。
Spotterエージェントでは、LMのみのベースラインよりも14.7%の精度で精度を向上し、Captainエージェントでは、期待情報ゲイン(EIG)を0.227ビット(達成可能なノイズ天井の94.2%)まで引き上げる。
論文 参考訳(メタデータ) (2025-10-23T17:57:28Z) - Adversarial Reinforcement Learning for Large Language Model Agent Safety [20.704989548285372]
大きな言語モデル(LLM)エージェントは、複雑なタスクを完了するためにGoogle Searchのようなツールを利用することができる。
現在の防衛戦略は、既知の攻撃のデータセットに精巧なLLMエージェントを頼っている。
対戦型強化学習(RL)を両プレイヤーゼロサムゲームとして定式化して活用する新しいフレームワークであるエージェント安全のための敵強化学習(ARLAS)を提案する。
論文 参考訳(メタデータ) (2025-10-06T23:09:18Z) - AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems? [71.21547572568655]
AgenTracer-8Bは、マルチグラニュラ強化学習で訓練された軽量障害トレーサである。
Who&Whenベンチマークでは、AgenTracer-8BはGemini-2.5-ProやClaude-4-Sonnetのような巨大なLLMを最大18.18%上回っている。
AgenTracer-8BはMetaGPTやMAASのような市販のマルチエージェントシステムに4.8-14.2%の性能向上をもたらす。
論文 参考訳(メタデータ) (2025-09-03T13:42:14Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy [47.42940885853956]
A$3$TはAutonomousを実現するフレームワークである。
法律の様式における代理人軌道の
AlfWorldでは、A$3$Tで訓練されたエージェントが1発成功率96%、100%成功率4回を達成している。
論文 参考訳(メタデータ) (2024-03-21T17:43:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。