論文の概要: When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient
- arxiv url: http://arxiv.org/abs/2604.25872v1
- Date: Tue, 28 Apr 2026 17:10:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.971246
- Title: When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient
- Title(参考訳): エラーが利益になる時--政策グラディエントに対する不完全なリワードの分類
- Authors: Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin,
- Abstract要約: 強化学習による言語モデルの訓練は、しばしば不完全なプロキシ報酬に依存する。
格付け精度などのプロキシ報酬の品質を評価するための標準指標は、誤った報酬を厳格に有害とみなす。
我々は、真理報酬の増加に対する報酬誤差の影響に応じて、報酬誤差を分類する。
- 参考スコア(独自算出の注目度): 28.276272279321578
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training language models via reinforcement learning often relies on imperfect proxy rewards, since ground truth rewards that precisely define the intended behavior are rarely available. Standard metrics for assessing the quality of proxy rewards, such as ranking accuracy, treat incorrect rewards as strictly harmful. In this work, however, we highlight that not all deviations from the ground truth are equal. By theoretically analyzing which outputs attract probability during policy gradient optimization, we categorize reward errors according to their effect on the increase in ground truth reward. The analysis establishes that reward errors, though conventionally viewed as harmful, can also be benign or even beneficial by preventing the policy from stalling around outputs with mediocre ground truth reward. We then present two practical implications of our theory. First, for reinforcement learning from human feedback (RLHF), we develop reward model evaluation metrics that account for the harmfulness of reward errors. Compared to standard ranking accuracy, these metrics typically correlate better with the performance of a language model after RLHF, yet gaps remain in robustly evaluating reward models. Second, we provide insights for reward design in settings with verifiable rewards. A key theme underlying our results is that the effectiveness of a proxy reward function depends heavily on its interaction with the initial policy and learning algorithm.
- Abstract(参考訳): 強化学習による言語モデルの訓練は、意図した振る舞いを正確に定義する基礎的真理報酬がほとんど利用できないため、しばしば不完全なプロキシ報酬に依存する。
格付け精度などのプロキシ報酬の品質を評価するための標準指標は、誤った報酬を厳格に有害とみなす。
しかし、本研究では、根本真理からの偏差がすべて等しいわけではないことを強調する。
政策勾配最適化中にどの出力が確率を引き付けるかを理論的に分析することにより、基底真理報酬の増加に対する影響に応じて報酬誤差を分類する。
この分析は、報酬の誤りは、従来は有害と見られていたが、厳密な根拠のある真理の報酬で、政策がアウトプットの周りに行き詰まるのを防ぎ、良心的あるいは有益であることも証明している。
次に、我々の理論の実践的な意味を2つ提示する。
まず、人間フィードバック(RLHF)からの強化学習のために、報酬誤差の有害性を考慮した報酬モデル評価指標を開発する。
標準的なランキングの精度と比較すると、これらの指標はRLHF後の言語モデルのパフォーマンスとよく相関するが、報酬モデルの堅牢な評価にはギャップが残っている。
第2に、検証可能な報酬を持つ設定において、報酬設計のための洞察を提供する。
この結果の背景にある重要なテーマは、プロキシ報酬関数の有効性が初期ポリシーと学習アルゴリズムとの相互作用に大きく依存していることである。
関連論文リスト
- Factored Causal Representation Learning for Robust Reward Modeling in RLHF [40.483487519518896]
大きな言語モデルを人間の好みに合わせるためには、信頼できる報酬モデルが不可欠である。
標準的な報酬モデルは、人間のラベルと因果関係のない刺激的な特徴に影響を受けやすい。
これは、高い予測された報酬がより良い行動に変換されないような、報酬のハッキングにつながる可能性がある。
論文 参考訳(メタデータ) (2026-01-29T07:18:45Z) - Probabilistic Uncertain Reward Model [27.40414952747553]
本稿では、優先データから生じる報酬分布を学習するための確率的不確実リワードモデル(PURM)を提案する。
PURMは従来の手法よりも精度が高く,不確実性も高いことを示す。
論文 参考訳(メタデータ) (2025-03-28T14:39:52Z) - What Makes a Reward Model a Good Teacher? An Optimization Perspective [82.73297593767181]
報酬モデルがどの程度正確であるかに関わらず、低報酬分散を誘導した場合、RLHFの目的は平坦な景観に悩まされる。
さらに、ある言語モデルでうまく機能する報酬モデルが、低い報酬分散を誘発し、したがって、別の言語モデルに対して平坦な客観的景観をもたらすことを示す。
論文 参考訳(メタデータ) (2025-03-19T17:54:41Z) - Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners [15.25763345316458]
強化学習エージェントは、彼らが学んだ報酬関数の品質によって、基本的に制限されている。
本稿では, 人的利害関係者の軌道分布ランキングと, 与えられた報酬関数によって誘導されるものとの類似性を定量化するために, トラジェクティブアライメント係数を導入する。
論文 参考訳(メタデータ) (2025-03-08T00:38:17Z) - The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret [64.04721528586747]
報奨モデルの十分に低いテスト誤差は、最悪の場合の後悔を確実にすることを示す。
次に、ポリシー正則化技術を用いても、同様の問題が持続することを示す。
論文 参考訳(メタデータ) (2024-06-22T06:43:51Z) - Hindsight PRIORs for Reward Learning from Human Preferences [3.4990427823966828]
嗜好に基づく強化学習(PbRL)では、政策行動に対する嗜好フィードバックから報酬を学習することで報酬関数を手渡す必要がなくなる。
PbRLへの現在のアプローチは、行動のどの部分が優先に最も寄与しているかを決定することに固有の信用割当問題に対処しない。
我々は、世界モデルを用いて軌道内の状態重要度を近似し、報酬を国家重要度に比例するように誘導する信用割当戦略(Hindsight PRIOR)を導入する。
論文 参考訳(メタデータ) (2024-04-12T21:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。