論文の概要: SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
- arxiv url: http://arxiv.org/abs/2609.02786v1
- Date: Wed, 02 Sep 2026 16:19:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.468844
- Title: SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
- Title(参考訳): SafeEvolve: 安全アライメントのためのエージェントエクスペリエンスからのハーネス・ポリティクスの共進化
- Authors: Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu,
- Abstract要約: エージェント安全アライメントのための経験駆動型フレームワークであるSafeEvolveを提案する。
我々は、完了したオン・ポリティィ・トラジェクトリから安全経験を活用して、ハーネス・ポリティ共進化の継続ループを駆動する。
Qwen3.5-4B の場合、SafeEvolve は AgentDojo の 3 倍の ASR 削減を実現し、良質なユーティリティを 59.79% から 61.86% に改善した。
- 参考スコア(独自算出の注目度): 51.263370090136696
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The performance of LLM-based agents is jointly shaped by the base model and the harness used when interacting with the environment. This exposes them to safety risks in both harmful final responses and multi-step execution trajectories. Existing safety alignment mechanisms often rely on either external harness updates or policy optimization, yet applying either paradigm in isolation fails to bridge runtime control with intrinsic safety. We propose SafeEvolve, an experience-driven self-evolving framework for agent safety alignment. SafeEvolve leverages safety experience from completed on-policy trajectories to drive a continual loop of harness-policy co-evolution. On the harness side, SafeEvolve converts trajectory-level safety evidence into bounded, component-level updates across safety prompt and hierarchical skills, yielding auditable and reversible harness artifacts. On the policy side, SafeEvolve follows a two-stage SFT-RL paradigm, where harness-use SFT bootstraps the policy to actively leverage evolved harness artifacts, and harness-augmented RL further shapes autonomous safety behaviors during multi-step exploration via verifier-decomposed rewards. Through harness-policy co-evolution, SafeEvolve converts safety experience into an evolved runtime harness and improved policy behavior. Experiments on agentic safety benchmarks show that SafeEvolve achieves a stronger safety-utility tradeoff than existing baselines. For Qwen3.5-4B, SafeEvolve achieves a $3\times$ ASR reduction on AgentDojo while improving benign utility from 59.79% to 61.86%.
- Abstract(参考訳): LLMをベースとしたエージェントの性能は、ベースモデルと環境との相互作用に使用されるハーネスによって共同で形成される。
これにより、有害な最終応答と多段階実行軌跡の両方において、安全リスクにさらされる。
既存の安全アライメントメカニズムは、しばしば外部ハーネス更新またはポリシー最適化に頼っているが、分離されたパラダイムを適用すると、実行時の制御を本質的な安全性でブリッジできない。
エージェント安全アライメントのための体験駆動型自己進化型フレームワークであるSafeEvolveを提案する。
SafeEvolveは、完成したオン・ポリティィ・トラジェクトリーの安全体験を活用して、ハーネス・ポリティ共進化の継続ループを駆動する。
ハーネス側では、SafeEvolveは軌道レベルの安全証拠を、安全プロンプトと階層的なスキルにわたる境界付きコンポーネントレベルの更新に変換し、監査可能で可逆的なハーネスアーティファクトを生成する。
政策面では、SafeEvolveは、2段階のSFT-RLパラダイムに従っており、このパラダイムでは、ハーネス利用のSFTブートストラップが、進化したハーネスアーティファクトを積極的に活用するためのポリシーを積極的に活用し、ハーネス拡張されたRLは、検証器分解された報酬を通じて多段階の探索において、自律的な安全行動をさらに形成する。
ハーネスと政治の共進化を通じてSafeEvolveは、安全エクスペリエンスを進化したランタイムハーネスに変換し、ポリシーの振る舞いを改善します。
エージェント安全性ベンチマークの実験は、SafeEvolveが既存のベースラインよりも強力な安全ユーティリティトレードオフを実現していることを示している。
Qwen3.5-4B の場合、SafeEvolve は AgentDojo の ASR を 3 ドル削減し、良質なユーティリティを 59.79% から 61.86% に改善した。
関連論文リスト
- SHE: Trajectory-driven Safety Harness Evolution for LLM Agents [63.74895225415523]
既存の安全メカニズムは、ハーネスを固定されたデプロイメントアーティファクトとして扱い、新興リスクで進化する能力を制限する。
我々は、ロールアウト軌道から安全な境界を進化させるフレームワークであるSafety Harness Evolutionを提案する。
Agent-SafetyBenchの実験では、SHEはハーネスの進化を通じて安全性を効果的に向上し、静的なSafeHarnessと比較して3.1倍のASR削減を実現している。
論文 参考訳(メタデータ) (2026-08-10T17:35:08Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards [23.15178050525514]
セーフ強化学習(Safe Reinforcement Learning, セーフRL)は、RLエージェントをトレーニングして、安全性の制約を守りながら、実環境におけるパフォーマンスを最大化することを目的としている。
本稿では,安全なポリシ関数学習を可能にする,SMPO(Safety Modulated Policy Optimization)と呼ばれる新しい安全なRL手法を提案する。
論文 参考訳(メタデータ) (2025-04-03T21:35:22Z) - Safe Reinforcement Learning with Learned Non-Markovian Safety Constraints [15.904640266226023]
我々は、安全に関する部分的状態行動軌跡の貢献を評価するために、信用割当を行う安全モデルの設計を行う。
学習された安全モデルを用いて安全なポリシーを最適化する有効なアルゴリズムを導出する。
安全報酬と安全コンプライアンスのトレードオフ係数を動的に適用する手法を考案する。
論文 参考訳(メタデータ) (2024-05-05T17:27:22Z) - Safeguarded Progress in Reinforcement Learning: Safe Bayesian
Exploration for Control Policy Synthesis [63.532413807686524]
本稿では、強化学習(RL)におけるトレーニング中の安全維持の問題に対処する。
探索中の効率的な進捗と安全性のトレードオフを扱う新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-12-18T16:09:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。