論文の概要: AdaGuard: An Adaptive Guard Model with User-defined Policies
- arxiv url: http://arxiv.org/abs/2609.34241v1
- Date: Mon, 28 Sep 2026 03:48:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:40:58.049145
- Title: AdaGuard: An Adaptive Guard Model with User-defined Policies
- Title(参考訳): AdaGuard: ユーザ定義ポリシを備えたアダプティブガードモデル
- Abstract要約: 10,939のトレーニング例と1000のテスト例からなるデータセットであるAdaptiveSafetyを紹介します。
説明的推論と最終判断のバランスを保ちながら、違反識別を精査する強化学習アルゴリズムであるSafePOを提案する。
我々の4Bモデルは、AdaptiveSafetyで89.30%、DynaBenchで71.82%のバイナリ精度を実現している。
- 参考スコア(独自算出の注目度): 18.459674288426665
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Guard models support the safe deployment of language model agents, but fixed risk taxonomies limit their ability to accommodate requirements that vary across applications and tasks. Under user-defined policies, detecting violations requires interpreting both the applicable rules and the agent's behavior, since identical actions can receive different judgments under different policies. To support learning this capability, we introduce AdaptiveSafety, a dataset of 10,939 training examples and 1,000 test examples covering policies with 1--100 rules. The dataset combines trajectories from multiple sources with policy and behavioral counterfactuals, pairing each example with an explanation and the complete set of violated rules. These counterfactuals expose changes that alter compliance, while structural augmentations provide supervision for consistency under rule reordering and identifier remapping. Building on this supervision, we propose SafePO, a reinforcement learning algorithm for refining violation identification while balancing explanatory reasoning and final verdicts. SafePO uses structured rewards to assess prediction correctness, retains group-relative advantages at the response level, and employs a separately trained value model to modulate token weights within explanation and verdict regions. Separate normalization controls their relative contribution to training despite differences in length. Through supervised initialization followed by SafePO, we develop AdaGuard, a family of 0.6B, 4B, and 8B guard models that assess agent trajectories under policies supplied at inference time. Our 4B model achieves binary accuracies of 89.30\% on AdaptiveSafety and 71.82\% on DynaBench. The project repository is available at https://github.com/Yunhao-Feng/AdaGuard
- Abstract(参考訳): Guardモデルは、言語モデルエージェントの安全なデプロイをサポートするが、固定されたリスク分類は、アプリケーションやタスクによって異なる要件を満たす能力を制限する。
ユーザ定義のポリシーでは、同一のアクションが異なるポリシーの下で異なる判断を受けることができるため、違反を検出するには、適用可能なルールとエージェントの振る舞いの両方を解釈する必要がある。
この能力の学習を支援するために,1-100ルールのポリシをカバーする10,939のトレーニング例と1,000のテスト例のデータセットであるAdaptiveSafetyを紹介した。
このデータセットは、複数のソースからのトラジェクトリとポリシーと行動上のカウンターファクトを組み合わせ、各サンプルに説明と違反したルールの完全なセットをペアリングする。
これらのカウンターファクトはコンプライアンスを変更する変更を公開し、構造的拡張はルールの順序変更と識別子の再マッピングの下での一貫性の監視を提供する。
本研究は,説明的推論と最終判断のバランスを保ちながら,違反識別を精査する強化学習アルゴリズムであるSafePOを提案する。
SafePOは、予測の正確性を評価するために構造化された報酬を使用し、応答レベルでグループ相対的な優位性を保ち、説明と検証領域内のトークンの重みを調整するために、個別に訓練された値モデルを採用している。
異なる正規化は、長さの違いにもかかわらず、トレーニングに対する相対的な貢献を制御する。
AdaGuardは0.6B、4B、8Bガードモデルであり、エージェントの軌道を推定時に供給されたポリシーに基づいて評価する。
我々の4Bモデルは、AdaptiveSafetyで89.30\%、DynaBenchで71.82\%のバイナリ精度を実現している。
プロジェクトリポジトリはhttps://github.com/Yunhao-Feng/AdaGuardで入手できる。
関連論文リスト
- EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - Shieldstral [183.97744446582863]
Shieldstralはポリシー適応型マルチモーダル安全分類器で、テキスト安全性ベンチマークで約7$timesのモデルに適合または性能を向上する。
本稿では、約54.1Mサンプルのキュレーションと生成をカバーしたデータ構築レシピと、政策適応性を評価するためのきめ細かい評価セットを提案する。
論文 参考訳(メタデータ) (2026-07-28T15:27:53Z) - SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning [0.0]
マルチモーダル会話における安全評価のためのポリシー適応型ガードレールモデルファミリーである textbfSingGuard を提案する。
SingGuardはアクティブポリシーをランタイム入力として扱う。
ターゲットコンテンツをアクティブポリシールールに対してルールでチェックし、安全ラベルとトリガルールの両方を予測する。
論文 参考訳(メタデータ) (2026-06-22T05:37:43Z) - Structural Distinguishability of Static and Adaptive Policy Regimes in Agent-Based Regulatory Simulation [0.0]
本稿では,新しい汎用フレームワークではなく,制御されたシミュレーションベンチマークに寄与する。
本研究は, ナイーブな固定ポリシー, トラッキング対応の固定ポリシ, および, セットポイント, 安全マージン, 片側制御の3つの適応コントローラを評価する。
このコントリビューションは、スカラーインジケータ、キャップ相対的なシンボル診断、軌跡モチーフ、視覚検査によって、平均的な結果が類似しているように見える場合でも、どのように規制の結論が異なるかを共同で明らかにする。
論文 参考訳(メタデータ) (2026-06-15T10:06:32Z) - Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure [2.124730017640531]
非決定論的エージェント基盤を管理するためのコントロールプレーンプリミティブであるQuorum Semantic Assurance(SQA)を紹介する。
SQAは暗号エビデンスチェーンに縛られた宣言的実行契約として提案を表現し、それを読み取り専用でサンドボックス化されたバリデータエージェントのさまざまなパネルにルーティングする。
インフラにインスパイアされた500の突然変異シナリオでは、曖昧なシナリオを除く安全/安全でない試験の安全性が報告され、SQAはシングルエージェント検証の18.5%から0.3%まで安全でない承認を減じている。
論文 参考訳(メタデータ) (2026-06-06T07:31:04Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - Towards Policy-Compliant Agents: Learning Efficient Guardrails For Policy Violation Detection [25.53228630260007]
PolicyGuardBenchは、エージェントのトラジェクトリにおけるポリシー違反を検出するための約60kのサンプルのベンチマークである。
PolicyGuard-4Bは軽量のガードレールモデルであり、すべてのタスクに対して強力な検出精度を提供する。
PolicyGuardBench と PolicyGuard-4B は、Webエージェントのトラジェクトリにおけるポリシーコンプライアンスを研究するための、最初の包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-03T20:03:19Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - SPoRt -- Safe Policy Ratio: Certified Training and Deployment of Task Policies in Model-Free RL [54.022106606140774]
本研究では,モデルフリーでエピソードな環境において,新しいタスク固有ポリシーの安全性特性に違反する確率に制約を課す理論的結果を示す。
この境界は、時間的に拡張された性質(安全性の他に)や堅牢な制御問題にも適用できる。
本研究は,このトレードオフを実証し,経験的違反率から得られる理論的境界と後続境界とを比較した実験結果である。
論文 参考訳(メタデータ) (2025-04-08T19:09:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。