論文の概要: Mitigating Reward Hacking via Information-Theoretic Reward Modeling
- arxiv url: http://arxiv.org/abs/2402.09345v3
- Date: Fri, 16 Feb 2024 07:48:27 GMT
- ステータス: 処理完了
- システム内更新日: 2024-02-19 12:38:46.556426
- Title: Mitigating Reward Hacking via Information-Theoretic Reward Modeling
- Title(参考訳): 情報理論リワードモデリングによるリワードハッキングの軽減
- Authors: Yuchun Miao, Sen Zhang, Liang Ding, Rong Bao, Lefei Zhang, Dacheng Tao
- Abstract要約: 本稿では,報酬モデリングのための汎用的で堅牢なフレームワークであるInfoRMを提案する。
我々は,潜伏空間における過最適化と外れ値の相関を同定し,報酬過最適化を検出するための有望なツールとしてInfoRMを確立した。
- 参考スコア(独自算出の注目度): 70.26019860948114
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the success of reinforcement learning from human feedback (RLHF) in
aligning language models with human values, reward hacking, also termed reward
overoptimization, remains a critical challenge, which primarily stems from
limitations in reward modeling, i.e., generalizability of the reward model and
inconsistency in the preference dataset. In this work, we tackle this problem
from an information theoretic-perspective, and propose a generalizable and
robust framework for reward modeling, namely InfoRM, by introducing a
variational information bottleneck objective to filter out irrelevant
information and developing a mechanism for model complexity modulation.
Notably, we further identify a correlation between overoptimization and
outliers in the latent space, establishing InfoRM as a promising tool for
detecting reward overoptimization. Inspired by this finding, we propose the
Integrated Cluster Deviation Score (ICDS), which quantifies deviations in the
latent space, as an indicator of reward overoptimization to facilitate the
development of online mitigation strategies. Extensive experiments on a wide
range of settings and model scales (70M, 440M, 1.4B, and 7B) support the
effectiveness of InfoRM. Further analyses reveal that InfoRM's overoptimization
detection mechanism is effective, potentially signifying a notable advancement
in the field of RLHF. Code will be released upon acceptance.
- Abstract(参考訳): 人的フィードバック(rlhf)からの強化学習が言語モデルと人間の価値の整合に成功しても、報酬ハッキングは報酬過剰最適化(reward overoptimization)とも呼ばれ、主に報酬モデリングの制限、すなわち報酬モデルの一般化可能性と選好データセットの一貫性の欠如に起因する重要な課題である。
そこで本研究では,情報理論のパースペクティブからこの問題に取り組み,無関係な情報をフィルタリングし,モデル複雑性変調のメカニズムを開発するための変分的情報ボトルネック目標を導入することで,報奨モデリングの一般化とロバストな枠組みを提案する。
特に,潜伏空間における過最適化と外れ値の相関関係を更に同定し,報酬過最適化を検出するための有望なツールとしてInfoRMを確立した。
この発見にインスパイアされたICDS(Integrated Cluster Deviation Score)は,オンライン緩和戦略の開発を促進するための報酬過度最適化の指標として,潜在空間における偏差を定量化する。
幅広い設定とモデルスケール(70M, 440M, 1.4B, 7B)に関する大規模な実験はInfoRMの有効性を支持する。
さらに分析した結果,InfoRMの過度な最適化検出機構が有効であることが判明した。
コードは受理時にリリースされる。
関連論文リスト
- Overcoming Reward Overoptimization via Adversarial Policy Optimization
with Lightweight Uncertainty Estimation [50.0151082930949]
AdvPO(Adversarial Policy Optimization)は、人間からの強化学習における報酬過度最適化の問題に対する新しい解決策である。
本稿では,報酬モデルの最後の層埋め込みにのみ依存して,報酬の不確実性を定量化する軽量な手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T09:20:12Z) - Secrets of RLHF in Large Language Models Part II: Reward Modeling [134.97964938009588]
本稿では,データセットにおける不正確で曖昧な嗜好の影響を軽減するために,一連の新しい手法を紹介する。
また、選択された応答と拒否された応答を区別する報酬モデルの有用性を高めるために、対照的な学習を導入する。
論文 参考訳(メタデータ) (2024-01-11T17:56:59Z) - Spatial Attention-based Distribution Integration Network for Human Pose
Estimation [0.8052382324386398]
本研究では,空間アテンションに基づく分布統合ネットワーク(SADI-NET)を提案する。
我々のネットワークは、受容強化モジュール(RFM)、空間融合モジュール(SFM)、分散学習モジュール(DLM)の3つの効率的なモデルで構成されている。
我々のモデルは、MPIIテストデータセットで920.10%の精度を得、既存のモデルよりも大幅に改善され、最先端のパフォーマンスが確立された。
論文 参考訳(メタデータ) (2023-11-09T12:43:01Z) - QualEval: Qualitative Evaluation for Model Improvement [86.29905469151566]
モデル改善のための手段として,自動定性評価による定量的スカラー指標を付加するQualEvalを提案する。
QualEvalは強力なLCM推論器と新しいフレキシブルリニアプログラミングソルバを使用して、人間の読みやすい洞察を生成する。
例えば、その洞察を活用することで、Llama 2モデルの絶対性能が最大15%向上することを示す。
論文 参考訳(メタデータ) (2023-11-06T00:21:44Z) - Enhancing Multiple Reliability Measures via Nuisance-extended
Information Bottleneck [77.37409441129995]
トレーニングデータに制限がある現実的なシナリオでは、データ内の多くの予測信号は、データ取得のバイアスからより多く得る。
我々は,相互情報制約の下で,より広い範囲の摂動をカバーできる敵の脅威モデルを考える。
そこで本研究では,その目的を実現するためのオートエンコーダベーストレーニングと,提案したハイブリッド識別世代学習を促進するための実用的なエンコーダ設計を提案する。
論文 参考訳(メタデータ) (2023-03-24T16:03:21Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - CausalAgents: A Robustness Benchmark for Motion Forecasting using Causal
Relationships [8.679073301435265]
既存のデータに摂動を適用することにより、モデルロバスト性の評価と改善のための新しいベンチマークを構築する。
我々はこれらのラベルを使用して、現場から非因果的エージェントを削除することでデータを摂動する。
非因果摂動下では, minADE の相対的な変化は, 原型と比較して25$-$38%である。
論文 参考訳(メタデータ) (2022-07-07T21:28:23Z) - Active Feature Acquisition with Generative Surrogate Models [11.655069211977464]
本研究では,アクティブ機能獲得(AFA)を行うモデルについて検討し,未観測機能に対する環境問合せを行う。
我々の研究は、AFA問題を生成的モデリングタスクとして根底にあるマルコフ決定プロセス(MDP)を再構築する。
本稿では,入力特徴間の依存関係を捕捉し,取得から得られる潜在的な情報を評価する生成代理モデル(GSM)の学習を提案する。
論文 参考訳(メタデータ) (2020-10-06T02:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。