論文の概要: RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards
- arxiv url: http://arxiv.org/abs/2608.24275v2
- Date: Thu, 27 Aug 2026 06:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.799111
- Title: RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards
- Title(参考訳): Repolicy: エージェントセーフガードにおける安全政策実行のための強化学習
- Abstract要約: 本稿では,強化学習を通じて安全政策の実践を学習するエージェントセーフガードであるRePolicyを提案する。
エージェントの軌跡と動的ポリシーライブラリが与えられた後、RePolicyは適用可能なポリシーを起動し、そのコンテンツを使用してポリシーに基づく合理性と安全性の判断を生成する。
- 参考スコア(独自算出の注目度): 31.437761312893667
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safeguarding language model agents requires assessing complete execution trajectories under context-dependent safety policies. Existing policy-aware safeguards mainly rely on prompting or supervised fine-tuning, limiting their ability to adapt to unseen trajectories and changing policy contexts. We propose RePolicy, an agent safeguard that learns safety-policy invocation through reinforcement learning. Given an agent trajectory and a dynamic policy library, RePolicy invokes the applicable policy and uses its content to produce a policy-grounded rationale and safety judgment. We construct PolicyTraj-20K to support supervised initialization, followed by GRPO with verifiable rewards and policy-context perturbation. Experiments across six agent safety benchmarks show that RePolicy achieves strong overall safety-detection performance and robust policy invocation under varying policy contexts.
- Abstract(参考訳): 言語モデルエージェントの保護には、コンテキスト依存の安全ポリシーの下で完全な実行軌跡を評価する必要がある。
既存の政策対応型セーフガードは、主に微調整の促進または監督に依存し、目に見えない軌道に適応し、政策状況を変える能力を制限する。
本稿では,強化学習を通じて安全政策の実践を学習するエージェントセーフガードであるRePolicyを提案する。
エージェントの軌跡と動的ポリシーライブラリが与えられた後、RePolicyは適用可能なポリシーを起動し、そのコンテンツを使用してポリシーに基づく合理性と安全性の判断を生成する。
我々は、教師付き初期化をサポートするために、ポリシーTraj-20Kを構築し、続いて、検証可能な報酬とポリシーコンテキストの摂動を持つGRPOを構築した。
6つのエージェント安全ベンチマークの実験により、RePolicyは、さまざまなポリシーコンテキストの下で、強い全体的な安全性検出性能と堅牢なポリシー実行を達成することが示された。
関連論文リスト
- PolicyMem: Geometric Policy Memory for LLM Governance [72.04962480384322]
我々は、自然言語ポリシーを再利用可能な幾何学的メモリオブジェクトとして外部化する幾何学的ポリシーメモリであるPhysicalMemを紹介する。
メモリライターは、自然言語ポリシーをポリシーメモリスロットにコンパイルし、クエリ応答ペアはプロジェクションエネルギーを介してポリシーメモリを読み取る。
得られた政策証拠プロファイルは、安全判断を直接仲介し、政策帰属および事後検証のために再利用される。
論文 参考訳(メタデータ) (2026-09-12T06:07:43Z) - PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models [19.807112285121715]
現実世界のデプロイメントでは、新たな安全要件が自然言語ポリシーとして指定されることが多い。
これにより、急速に進化する安全ポリシーと従来のデータ駆動アライメント手法のミスマッチが生じる。
我々は,大規模言語モデルと安全ポリシーを直接整合するフレームワークであるPhysalignを提案する。
論文 参考訳(メタデータ) (2026-06-24T06:10:33Z) - Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought [5.251527748612469]
大きな言語モデル(LLM)は、静的で一大の安全ポリシーのため、基本的な安全性のトレードオフに直面します。
我々は、明示的でリスクを意識した推論による動的安全制御のためのフレームワーク、textbfPACT(Prompt-Thought Action via Chain-of-Thought)を提案する。
論文 参考訳(メタデータ) (2026-02-06T12:20:01Z) - A universal policy wrapper with guarantees [0.0]
強化学習エージェントのためのユニバーサルポリシーラッパーを導入する。
我々のラッパーは、高性能ベースポリシーとフォールバックポリシーを選択的に切り替える。
追加のシステム知識やオンライン制約付き最適化を必要としない。
論文 参考訳(メタデータ) (2025-05-18T10:37:27Z) - SPoRt -- Safe Policy Ratio: Certified Training and Deployment of Task Policies in Model-Free RL [54.022106606140774]
本研究では,モデルフリーでエピソードな環境において,新しいタスク固有ポリシーの安全性特性に違反する確率に制約を課す理論的結果を示す。
この境界は、時間的に拡張された性質(安全性の他に)や堅牢な制御問題にも適用できる。
本研究は,このトレードオフを実証し,経験的違反率から得られる理論的境界と後続境界とを比較した実験結果である。
論文 参考訳(メタデータ) (2025-04-08T19:09:07Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - Bounded Robustness in Reinforcement Learning via Lexicographic
Objectives [54.00072722686121]
強化学習における政策の堅牢性は、いかなるコストでも望ましいものではないかもしれない。
本研究では,任意の観測ノイズに対して,政策が最大限に頑健になる方法について検討する。
本稿では,どのような政策アルゴリズムにも適用可能なロバストネス誘導方式を提案する。
論文 参考訳(メタデータ) (2022-09-30T08:53:18Z) - Boolean Decision Rules for Reinforcement Learning Policy Summarisation [16.969788244589388]
我々は、溶岩グリッドワールドを用いたエージェントのポリシーのルールベースの要約を作成する。
本稿では、このルールベースモデルによって生成されたルールを、エージェントのポリシーに課される制約として利用することにより、RLエージェントのポリシーに安全性を導入する可能性について論じる。
論文 参考訳(メタデータ) (2022-07-18T14:51:24Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z) - SAFER: Data-Efficient and Safe Reinforcement Learning via Skill
Acquisition [59.94644674087599]
安全制約下での複雑な制御タスクにおけるポリシー学習を高速化するアルゴリズムであるSAFEty skill pRiors (SAFER)を提案する。
オフラインデータセットでの原則的なトレーニングを通じて、SAFERは安全なプリミティブスキルの抽出を学ぶ。
推論段階では、SAFERで訓練されたポリシーは、安全なスキルを成功のポリシーに組み込むことを学ぶ。
論文 参考訳(メタデータ) (2022-02-10T05:43:41Z) - Learning Goal-oriented Dialogue Policy with Opposite Agent Awareness [116.804536884437]
本稿では,目標指向対話における政策学習のための逆行動認識フレームワークを提案する。
我々は、その行動から相手エージェントの方針を推定し、この推定を用いてターゲットエージェントを対象ポリシーの一部として関連づけて改善する。
論文 参考訳(メタデータ) (2020-04-21T03:13:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。