論文の概要: PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- arxiv url: http://arxiv.org/abs/2607.05910v1
- Date: Tue, 07 Jul 2026 07:04:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.427802
- Title: PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Title(参考訳): PolicyShiftGuard: ポリシー適応型イメージガードレールのベンチマークと改善
- Authors: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li,
- Abstract要約: 本研究では,現在供給されているポリシーに違反しているか否かをモデルが判断しなければならない,ポリシー適応型イメージガードレールについて検討する。
2,000のポリシー識別インスタンスを265以上の画像にまとめた総合ベンチマークである PolicyShiftBench を紹介する。
次に、2段階のトレーニングレシピでトレーニングされたコンパクトなポリシー条件付きガードレールであるPhysalShiftGuardを提案する。
- 参考スコア(独自算出の注目度): 24.489215914160813
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image guardrails are typically trained and evaluated under a fixed safety policy, implicitly treating safety as an intrinsic property of an image. Real deployments are different: the same image may be allowed in one product, restricted in another, and newly disallowed when a policy boundary changes. We study policy-adaptive image guardrailing, where a model must decide whether an image violates the currently supplied policy and generalize to held-out policy definitions. We introduce PolicyShiftBench, a comprehensive benchmark with 2,000 policy-discriminative instances over 265 images, where each image is paired with 7.55 policy-conditioned prompts on average to test whether models adapt to the active policy rather than relying on image-level safety priors. We then propose PolicyShiftGuard, a compact policy-conditioned guardrail trained with a two-stage training recipe that combines Randomized Policy SFT (RP-SFT) with Boundary-Pair Policy Adaptation (BP-Adapt). BP-Adapt trains matched prompts for the same image and risk category using standard label supervision and a pairwise comparison loss that separates blocking policies from passing policies. Experiments show that existing VLMs and specialized guardrails remain brittle under policy shifts, while PolicyShiftGuard substantially improves policy-sensitive performance. The 7B model achieves SOTA performance of 76.9 Avg. F1 and 72.1 Avg. PSS on PolicyShiftBench, transfers well to UnSafeBench and SafeEditBench, and improves the latency-performance trade-off with a concise output format. Ablations confirm that matched pass/block boundary pairs are essential for stable policy adaptation.
- Abstract(参考訳): イメージガードレールは通常、固定された安全ポリシーの下で訓練され評価され、画像の本質的な性質として安全を暗黙的に扱う。
1つの製品で同じイメージが許可され、別の製品で制限され、ポリシー境界が変更されたときに新たに許可される可能性がある。
本研究では,現在供給されている方針に違反するか否かをモデルで判断し,保留方針定義に一般化する政策適応型イメージガードレールについて検討する。
このベンチマークでは、各画像が平均7.55のポリシー条件のプロンプトとペアリングされ、画像レベルの安全性に頼らず、モデルがアクティブなポリシーに適応するかどうかをテストする。
次に、Randomized Policy SFT(RP-SFT)とBundary-Pair Policy Adaptation(BP-Adaptation)を組み合わせた2段階のトレーニングレシピで訓練された、コンパクトなポリシー条件付きガードレールであるPhysalShiftGuardを提案する。
BP-アダプティブの列車は、標準ラベルの監督と、ブロックポリシーとパスポリシーを分離するペアワイズ比較損失を使用して、同じイメージとリスクカテゴリのプロンプトにマッチした。
実験の結果、既存のVLMと特別なガードレールは、政策シフトの下でも不安定であり、ポリシシフトガードは、政策に敏感なパフォーマンスを大幅に改善することが示された。
7Bモデルは76.9AvgのSOTA性能を達成する。
F1と72.1Avg。
PolicyShiftBench上のPSSは、UnSafeBenchとSafeEditBenchにうまく移行し、簡潔な出力フォーマットでレイテンシパフォーマンスのトレードオフを改善する。
アブレーションは、整合したパス/ブロック境界対が安定なポリシー適応に不可欠であることを確認した。
関連論文リスト
- PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models [19.807112285121715]
現実世界のデプロイメントでは、新たな安全要件が自然言語ポリシーとして指定されることが多い。
これにより、急速に進化する安全ポリシーと従来のデータ駆動アライメント手法のミスマッチが生じる。
我々は,大規模言語モデルと安全ポリシーを直接整合するフレームワークであるPhysalignを提案する。
論文 参考訳(メタデータ) (2026-06-24T06:10:33Z) - LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails [41.04710068888387]
我々は,動的政策に関する世俗的な潜在政策検討を学習するガードレールフレームワークである潜在政策ガードレール(LPG)を紹介した。
政策ガードレールのベンチマークでは、LPG-4Bの平均安全性は84.5%、F1は77.9%に達した。
論文 参考訳(メタデータ) (2026-05-17T08:35:38Z) - Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL [2.2592563948275486]
ポリシーを改善するためには、更新されたポリシーの状態視認分布について、値関数を正確にする必要がある。
保守的な更新はこの問題を解決しますが、ポリシー更新を縮小するコストがかかります。
本稿では,次世代政策サンプリング(ANPS)の代替手法について検討する。
トレーニングデータの分布が次のポリシと近似した場合、ANPSは満足する。
論文 参考訳(メタデータ) (2026-05-06T22:02:35Z) - Towards Policy-Adaptive Image Guardrail: Benchmark and Method [21.041111216560545]
ヴィジュアル言語モデル(VLM)は動的安全ガードレールのより適応的で一般化可能な基盤を提供する。
既存のVLMベースの保護方法は、通常、固定された安全ポリシーのみの下で訓練され、評価される。
本稿では,ロバストなアンセーフイメージガードレールに対する報酬を検証可能な強化学習ベース手法であるSafeGuard-VLを紹介する。
論文 参考訳(メタデータ) (2026-03-01T18:59:21Z) - Towards Policy-Compliant Agents: Learning Efficient Guardrails For Policy Violation Detection [25.53228630260007]
PolicyGuardBenchは、エージェントのトラジェクトリにおけるポリシー違反を検出するための約60kのサンプルのベンチマークである。
PolicyGuard-4Bは軽量のガードレールモデルであり、すべてのタスクに対して強力な検出精度を提供する。
PolicyGuardBench と PolicyGuard-4B は、Webエージェントのトラジェクトリにおけるポリシーコンプライアンスを研究するための、最初の包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-03T20:03:19Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - SPoRt -- Safe Policy Ratio: Certified Training and Deployment of Task Policies in Model-Free RL [54.022106606140774]
本研究では,モデルフリーでエピソードな環境において,新しいタスク固有ポリシーの安全性特性に違反する確率に制約を課す理論的結果を示す。
この境界は、時間的に拡張された性質(安全性の他に)や堅牢な制御問題にも適用できる。
本研究は,このトレードオフを実証し,経験的違反率から得られる理論的境界と後続境界とを比較した実験結果である。
論文 参考訳(メタデータ) (2025-04-08T19:09:07Z) - Convergence of Policy Mirror Descent Beyond Compatible Function Approximation [66.4260157478436]
我々は,より弱い変動支配を前提とした理論的PMD一般政策クラスを開発し,最良クラス政策への収束を得る。
我々の主観念は、占有度-勾配測度によって誘導される局所ノルムによって誘導される新しい概念を活用する。
論文 参考訳(メタデータ) (2025-02-16T08:05:46Z) - Memory-Constrained Policy Optimization [59.63021433336966]
政策勾配強化学習のための制約付き最適化手法を提案する。
我々は、過去の幅広い政策を表す別の仮想ポリシーの構築を通じて、第2の信頼領域を形成します。
そして、我々は、新しいポリシーをバーチャルポリシーに近づき続けるよう強制する。
論文 参考訳(メタデータ) (2022-04-20T08:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。