論文の概要: On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
- arxiv url: http://arxiv.org/abs/2605.11882v1
- Date: Tue, 12 May 2026 09:56:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.780885
- Title: On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
- Title(参考訳): エージェントセーフティアライメントのための障害軌道によるオンデマンド自己進化
- Authors: Bo Yin, Qi Li, Xinchao Wang,
- Abstract要約: 既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
- 参考スコア(独自算出の注目度): 54.30690671490447
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using LLM agents fail through trajectories rather than only final responses, as they may execute unsafe tool calls, follow injected instructions, comply with harmful requests, or over-refuse benign tasks despite producing a seemingly safe answer. Existing safety-alignment signals are largely response-level or off-policy, and often incur a safety-utility trade-off: improving agent safety comes at the cost of degraded task performance. Such sparse and single-objective rewards severely limit real-world usability. To bridge this gap, we propose FATE, an on-policy self-evolving framework that transforms verifier-scored failures into repair supervision without expert demonstrations. For each failure, the same policy proposes repair candidates, which are then re-scored by verifiers and filtered across security, utility, over-refusal control, and trajectory validity. This dense trajectory-level information is then used as a supervision signal for agent self-evolution. During this process, we further introduce Pareto-Front Policy Optimization (PFPO), combining supervised warmup with Pareto-aware policy optimization to preserve safety-utility trade-offs. Experiments on AgentDojo, AgentHarm, and ATBench show that FATE improves safety across different models and scales while preserving useful behavior. Compared with strong baselines, FATE reduces attack success rate by 33.5%, harmful compliance by 82.6%, and improves external trajectory-safety diagnosis by 6.5%. These results suggest that failed trajectories can provide structured repair supervision for safer self-evolving agents.
- Abstract(参考訳): ツールを使用するLLMエージェントは、最終応答だけではなく、トラジェクトリを通じて失敗する。これは、安全でないツールコールを実行したり、インジェクション命令をフォローしたり、有害な要求に従ったり、あるいは、安全と思われる回答を生成しながら良質なタスクを過度に再利用できるためである。
既存のセーフティアライメント信号は、主に応答レベルまたはオフ・ポリティクスであり、しばしば安全ユーティリティトレードオフを引き起こす: エージェントの安全性の改善は、タスクパフォーマンスの劣化によって生じる。
このようなスパースで単目的的な報酬は、現実世界のユーザビリティを著しく制限します。
このギャップを埋めるために、検証済みの障害を専門家によるデモンストレーションなしに修復管理に変換する、政治上の自己進化フレームワークであるFATEを提案する。
それぞれの障害に対して、同じポリシーが修復候補を提案し、検証者によって再検査され、セキュリティ、ユーティリティ、過剰な拒絶制御、軌道上の妥当性にまたがってフィルタリングされる。
この密度の高い軌道レベルの情報は、エージェントの自己進化の監視信号として使用される。
本プロセスでは,PFPO(Pareto-Front Policy Optimization)とPareto-Aware Policy Optimization(Pareto-Aware Policy Optimization)を組み合わせることで,安全ユーティリティトレードオフの保全を図る。
AgentDojo、AgentHarm、ATBenchの実験では、FATEは有用な振る舞いを保ちながら、さまざまなモデルとスケールにわたる安全性を改善している。
強力なベースラインと比較して、FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
これらの結果から, 軌道の故障により, より安全な自己進化剤の補修管理が可能であることが示唆された。
関連論文リスト
- Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios [0.2578242050187029]
ROMEは、既知の安全でないトラジェクトリを偽評価インスタンスに書き換える、制御されたベンチマーク構築パイプラインである。
ARISEは、外部アナログベースからReActスタイルのアナログ安全軌道を抽出し、それらを構造化推論例として注入する検索誘導推論時間拡張である。
論文 参考訳(メタデータ) (2026-05-05T00:21:00Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety [2.7030665672026846]
大規模言語モデル(LLM)エージェントは、現実の結果を伴う複雑な環境でますます運用される。
信頼性に欠ける状況からLLMエージェントが認識・撤退するための、シンプルで効果的な行動機構として「クイッティング」を用いることを提案する。
論文 参考訳(メタデータ) (2025-10-18T13:22:19Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation [4.29885665563186]
LATENTGUARDは、行動アライメントと教師付き潜在空間制御を組み合わせて、解釈可能で正確な安全操縦を行うフレームワークである。
本研究は, 実用性を損なうことなく, 安全性制御性と応答解釈性の両方を向上することを示す。
論文 参考訳(メタデータ) (2025-09-24T07:31:54Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models [23.916663925674737]
これまでの研究によると、現在のLSMベースのエージェントは攻撃を受けなくても多くの悪意あるタスクを実行している。
本稿では,安全なアライメントデータ合成の媒体として抽象的行動連鎖を利用する新しいフレームワークであるAgentAlignを提案する。
本フレームワークは,複雑なマルチステップのダイナミックスを捕捉しながら,高精度かつ実行可能な命令の生成を可能にする。
論文 参考訳(メタデータ) (2025-05-29T03:02:18Z) - Agent-SafetyBench: Evaluating the Safety of LLM Agents [72.92604341646691]
我々は,大規模言語モデル(LLM)の安全性を評価するベンチマークであるAgent-SafetyBenchを紹介する。
Agent-SafetyBenchは349のインタラクション環境と2,000のテストケースを含み、安全リスクの8つのカテゴリを評価し、安全でないインタラクションで頻繁に発生する10の一般的な障害モードをカバーする。
16 名の LLM エージェントを評価した結果,いずれのエージェントも 60% 以上の安全性スコアを達成できないことがわかった。
論文 参考訳(メタデータ) (2024-12-19T02:35:15Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。