論文の概要: A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)
- arxiv url: http://arxiv.org/abs/2608.00180v2
- Date: Tue, 04 Aug 2026 02:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.413964
- Title: A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)
- Title(参考訳): データ効率の良いRLアライメント(C-Guard)のためのコンスティチューショングリッド
- Authors: Xianling Zhang,
- Abstract要約: 安全ガードをRLで訓練することは、対立する2つの目標を最適化することを意味します。
本稿では、RLトレーニングデータを生成するコンスティチューショングリッドであるC-Guardと、各セルの動きを決定するセルごとの学習可能性スコアであるC-LIMについて述べる。
- 参考スコア(独自算出の注目度): 2.132096006921048
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conflicting objectives are general in RL alignment, and training on them data-efficiently is hard. Training a safety guard with RL means optimizing two objectives that conflict: catch real harm, and do not refuse benign prompts. Our finding is that over-refusal improves 22.4% to 12.8%, while under-refusal on adversarial attacks silently worsens 0.27 to 0.33. We present C-Guard, a constitution-grid instrument that generates the RL training data, and C-LIM, a per-cell learnability score that decides each cell's move: prune, densify, amend, expand. C-LIM flags the dead-weight data region before any training budget is spent: 187 untargeted rows had bought zero gain, and our method lifts the same region's learning impact 0.733 to 0.80. Code and the constitution are open-sourced.
- Abstract(参考訳): 競合する目的は、RLアライメントにおいて一般的であり、データ効率のよいトレーニングは難しい。
安全ガードをRLで訓練することは、対立する2つの目標を最適化することを意味します。
我々の発見によると、過剰な拒絶は22.4%から12.8%に改善し、敵の攻撃に対する拒絶は0.27から0.33に静かに悪化している。
本稿では、RLトレーニングデータを生成するコンスティチューショングリッドであるC-Guardと、各セルの動きを決定するセルごとの学習可能性スコアであるC-LIMについて述べる。
C-LIMは、トレーニング予算が費やされる前に、デッドウェイトなデータ領域にフラグを立てる:187行の未目標の行がゼロゲインを獲得し、我々の方法は、同じ領域の学習効果0.733から0.80に上昇する。
コードと憲法はオープンソース化されている。
関連論文リスト
- DECAF: De-Clustering for Adaptive Representational Unlearning [13.298390892944221]
本稿では,DeCAF(De-Clustering for Adaptive Forgetting)を提案する。
ResNet-18を搭載したCIFAR-10では、DECAFは0.10%の精度で、79.4%は精度を維持し、AUSは0.88で、他の全てのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-07-27T02:11:58Z) - The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL [19.556118547263928]
識別器誘導RL(DRL)は、事前訓練された表現空間内のベースモデルサンプルからデータを分離するために識別器を訓練する。
ガイダンスのないFID(例:SiTで9.38ドルから2.62ドル)と意味空間FD(例:SiTでDINOv3で8.2ドルから19.3ドル)を減らす。
また、後続の嗜好ベースのポストトレーニングでは、好みの報酬とイメージの忠実度の間のフロンティアも向上する。
論文 参考訳(メタデータ) (2026-06-17T15:01:33Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - Yes, Q-learning Helps Offline In-Context RL [69.26691452160505]
本研究では,オフラインのテキスト内強化学習フレームワークにおけるRL目標の統合について検討する。
RL目標の最適化は、広く採用されているアルゴリズム蒸留(AD)と比較して、平均で約30%向上することを示した。
私たちの結果は、バリュー学習中に保守性を追加することで、テストされたほぼすべての設定にさらなる改善がもたらされることも示しています。
論文 参考訳(メタデータ) (2025-02-24T21:29:06Z) - Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone [72.17534881026995]
ポリシーに依存しないRL(PA-RL)と呼ばれるオフラインおよびオンラインの微調整手法を開発する。
オンラインRLファインチューニングアルゴリズムであるCal-QLを用いて、7BジェネラリストロボットポリシーであるOpenVLAのファインチューニングに成功した最初の結果を示す。
論文 参考訳(メタデータ) (2024-12-09T17:28:03Z) - ReRoGCRL: Representation-based Robustness in Goal-Conditioned
Reinforcement Learning [29.868059421372244]
Goal-Conditioned Reinforcement Learning (GCRL) は注目されているが、敵の摂動に対するアルゴリズム的堅牢性はいまだ解明されていない。
まず,敵対的コントラスト攻撃に触発されたセミコントラスト表現攻撃を提案する。
次に,セミコントラスト・アジュメンテーションと感性認識正規化器を組み合わせた適応表現手法を提案する。
論文 参考訳(メタデータ) (2023-12-12T16:05:55Z) - Offline RL Policies Should be Trained to be Adaptive [89.8580376798065]
ベイズ的意味において、オフラインRLで最適に振る舞うには暗黙のPOMDPを解く必要があることを示す。
結果として、オフラインRLの最適ポリシーは、現在の状態だけでなく、評価中にこれまで見られたすべての遷移に依存して適応されなければならない。
本稿では、この最適適応ポリシーを近似するモデルフリーアルゴリズムを提案し、オフラインRLベンチマークにおける適応ポリシーの学習の有効性を実証する。
論文 参考訳(メタデータ) (2022-07-05T17:58:33Z) - Continuous Doubly Constrained Batch Reinforcement Learning [93.23842221189658]
環境とのオンラインインタラクションではなく、固定されたオフラインデータセットのみを使用して効果的なポリシーを学ぶバッチRLのアルゴリズムを提案する。
バッチRLにおける制限されたデータは、トレーニングデータに不十分に表現された状態/動作の値推定に固有の不確実性をもたらす。
この分散を減らすための政策制約と、過度に楽観的な見積もりを妨げる価値制約という2つの簡単な罰則によってこの問題を軽減することを提案する。
論文 参考訳(メタデータ) (2021-02-18T08:54:14Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。