論文の概要: RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
- arxiv url: http://arxiv.org/abs/2608.27439v1
- Date: Thu, 27 Aug 2026 17:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.520366
- Title: RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
- Title(参考訳): RedEvoAgent: 経験駆動スキル進化を伴う自動レッドチームエージェント
- Abstract要約: 我々は,クロスケース攻撃軌跡を簡潔で可読な攻撃技術に蒸留するブラックボックスレッドピーピングエージェントであるRedEvoAgentを提案する。
実験の結果、RedEvoAgentは固定ベースラインとエージェントベースラインを上回り、ツール効率を改善し、アタッカーモデルとターゲット実行ハーネス間で転送することがわかった。
- 参考スコア(独自算出の注目度): 41.956444145058335
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents are increasingly deployed in product-level execution harnesses, where jailbreaks can trigger harmful tool use and persistent state changes, creating greater risks than unsafe text generation alone. Existing automatic red-teaming methods often rely on fixed attacks, while recent agentic attackers coordinate multiple jailbreak tools and show stronger potential through trajectory-based retrieval. However, such retrieval can reuse misleading experiences due to retrieval bias and unclear tool credit, and full trajectories add context overhead while reducing interpretability. We propose RedEvoAgent, a black-box red-teaming agent that distills cross-case attack trajectories into a concise, human-readable attack skill. The attack skill adaptively evolves through tool-effectiveness profiling and Deciding-Tool Attribution for skill updates, and a validation ratchet that retains only updates improving validation performance. Experiments on multiple benchmarks, target models, and target execution harnesses show that RedEvoAgent outperforms fixed and agentic baselines, improves tool efficiency, and transfers across attacker models and target execution harnesses.
- Abstract(参考訳): LLMベースのエージェントは、製品レベルの実行ハーネスにますますデプロイされ、Jailbreakは有害なツールの使用と永続的な状態変更を引き起こし、安全でないテキスト生成よりも大きなリスクを生み出す。
既存の自動リピート方式は、しばしば固定攻撃に依存するが、最近のエージェント攻撃は、複数のジェイルブレイクツールを調整し、トラジェクトリベースの検索によってより強力なポテンシャルを示す。
しかし、そのような検索は、検索バイアスやツールクレジットの不明確さによる誤解を招く経験を再利用することができ、完全なトラジェクトリは、解釈可能性の低減を図りながら、コンテキストオーバーヘッドを増大させる。
我々は,クロスケース攻撃軌跡を簡潔で可読な攻撃技術に蒸留するブラックボックスレッドピーピングエージェントであるRedEvoAgentを提案する。
攻撃スキルは、スキル更新のためのツール有効性プロファイリングと決定ツール属性を通じて適応的に進化し、バリデーション性能を改善する更新のみを保持するバリデーションラチェットである。
複数のベンチマーク、ターゲットモデル、ターゲット実行ハーネスの実験では、RedEvoAgentは固定ベースラインとエージェントベースラインを上回っ、ツール効率を改善し、アタッカーモデルとターゲット実行ハーネスをまたいで転送する。
関連論文リスト
- Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming [8.592488240217625]
本研究では, 1 つのエージェント研究環境を用いて, 生産用 LLM エージェントの自動リピートについて検討した。
脆弱性仮説を提案し、ファルシファイアを構築し、有効な攻撃をインスタンス化し、サンドボックス化されたハーネスで実行し、検証された結果をVulnerability Concept Graph(VCG)にプロモートする。
直接および間接的な攻撃をカバーする3つのシナリオに関するClude CodeとCodexの裏側で、発見された概念は、モデルとエージェント間で再利用可能な脆弱性コアを明らかにしている。
論文 参考訳(メタデータ) (2026-07-13T15:31:04Z) - SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents [52.758563996979596]
言語モデルエージェントは、マルチターンツールの使用によって現実的なタスクを解決するのにますます効果的である。
SENTINELは障害駆動型強化学習フレームワークで,障害のロールアウトを目標とするトレーニングタスクに変換する。
Tau2-Bench Retail with Qwen3-4B-Thinking-2507では、SENTINELはPass1を66.4から74.9に改善し、Passkメトリクス全体にわたる一般的な合成タスクにおいてRLを上回っている。
論文 参考訳(メタデータ) (2026-06-11T05:06:50Z) - PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections [51.8246149916068]
大きな言語モデル(LLM)は、外部のツールや環境と相互作用するエージェントシステムへと急速に進化しています。
LLMエージェントのプロアクティブな脆弱性暴露のための自動エージェント監査フレームワークPI-Hunterを提案する。
論文 参考訳(メタデータ) (2026-06-10T22:57:02Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Adversarial Reinforcement Learning for Large Language Model Agent Safety [20.704989548285372]
大きな言語モデル(LLM)エージェントは、複雑なタスクを完了するためにGoogle Searchのようなツールを利用することができる。
現在の防衛戦略は、既知の攻撃のデータセットに精巧なLLMエージェントを頼っている。
対戦型強化学習(RL)を両プレイヤーゼロサムゲームとして定式化して活用する新しいフレームワークであるエージェント安全のための敵強化学習(ARLAS)を提案する。
論文 参考訳(メタデータ) (2025-10-06T23:09:18Z) - RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents [70.24175620901538]
コードエージェントは、強力なコード生成機能とコードインタプリタとの統合により、広く採用されている。
現在の静的安全性ベンチマークとレッドチームツールは、出現する現実世界のリスクシナリオを特定するのに不十分である。
我々はRedCodeAgentを提案する。RedCodeAgentは、多様なコードエージェントの脆弱性を体系的に発見するように設計された、最初の自動リピートエージェントである。
論文 参考訳(メタデータ) (2025-10-02T22:59:06Z) - AdvAgent: Controllable Blackbox Red-teaming on Web Agents [22.682464365220916]
AdvAgentは、Webエージェントを攻撃するためのブラックボックスのレッドチームフレームワークである。
強化学習に基づくパイプラインを使用して、敵のプロンプトモデルをトレーニングする。
慎重な攻撃設計では、エージェントの弱点を効果的に活用し、ステルス性と制御性を維持する。
論文 参考訳(メタデータ) (2024-10-22T20:18:26Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。