論文の概要: Reward Inflation: A Healthy Stimulus for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02545v1
- Date: Thu, 01 Oct 2026 22:33:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.112665
- Title: Reward Inflation: A Healthy Stimulus for Reinforcement Learning
- Title(参考訳): Reward Inflation:強化学習のための健康的な刺激
- Abstract要約: 我々は、報酬インフレーションが強化学習の健全な刺激となることを示した。
ポリシーが飽和するにつれて勾配信号を維持することにより、報酬インフレーションは休眠ニューロンの出現を抑制し、可塑性を維持するのに役立つ。
我々は、ハエのインフレレベルを調節する適応的な変種であるFedを導入し、固定されたインフレ率を改善することがしばしばあることに気付きました。
- 参考スコア(独自算出の注目度): 22.859084042159427
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward serves as the primary learning signal in reinforcement learning (RL). However, while reward magnitudes are typically held fixed throughout training, their temporal modulation remains underexplored. In this paper, we propose reward inflation, a gradual scaling of rewards over the course of training, and show that it can act as a healthy stimulus for RL. Theoretically, reward inflation induces an implicit recency weighting that upweights recent transitions during policy updates, enabling faster adaptation. We further show that, by sustaining gradient signals as the policy saturates, reward inflation suppresses the emergence of dormant neurons and helps preserve plasticity. Empirical results on ALE games and MuJoCo tasks corroborate these findings, showing that an appropriate level of reward inflation benefits a broad range of tasks. Finally, we introduce Fed, an adaptive variant that adjusts the inflation level on the fly, and find that it often improves upon fixed inflation.
- Abstract(参考訳): リワードは強化学習(RL)における第一の学習信号として機能する。
しかしながら、報酬の等級は訓練を通して固定されるのが一般的であるが、その時間的変調は未定のままである。
本稿では,報酬の段階的スケーリングである報奨インフレーションを提案し,RLの健全な刺激として機能することを示す。
理論的には、報酬のインフレーション(英語版)は、政策更新中の最近の遷移の重み付けを暗黙の傾向重み付けし、より高速な適応を可能にする。
さらに、ポリシーが飽和するにつれて勾配信号を維持することにより、報酬インフレーションは休眠ニューロンの出現を抑制し、可塑性の維持に役立つことを示す。
ALEゲームとMuJoCoタスクの実証結果がこれらの結果を裏付け、適切な報酬インフレーションのレベルが幅広いタスクに利益をもたらすことを示す。
最後に、Fedを紹介します。これは、フライ時のインフレレベルを調整する適応的な変種で、固定インフレによってしばしば改善されることに気付きます。
関連論文リスト
- ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning [53.48426046511836]
検証可能な報酬(RLVR)からの強化学習は、複数のポリシー更新のロールアウトを頻繁に再利用する。
本稿では,クリッピングをスムーズな2分岐シーケンスレベルカーネルに置き換えるReSPO(Reshaped Sequence Policy Optimization)を提案する。
本研究では,ReSPO が早期訓練中に長い肯定的推論軌道から効果的に学習できることを実証する。
論文 参考訳(メタデータ) (2026-09-28T15:38:29Z) - EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning [54.99968863245366]
EvoRSは自己進化型RLフレームワークで、報酬体系を政治上の経験から進化させる。
執筆とロールプレイを通じて、EvoRSは3人の審査員全員の下で最高の品質を達成する。
論文 参考訳(メタデータ) (2026-09-11T05:40:59Z) - NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning [42.29085249260694]
強化学習(RL)は、フローベースジェネレータの報酬アライメントを改善するが、しばしば知覚品質を低下させる。
3つのポストトレーニング法(NFT, AWM, DPO)にまたがるこのドリフトの単純な構造的シグネチャを同定する。
RLファインチューニングは、基準に対してステップごとの速度ノルムを$|v_|$で$5%から$5%$で膨らませる。
論文 参考訳(メタデータ) (2026-06-26T06:56:54Z) - Learning Process Rewards via Success Visitation Matching for Efficient RL [54.67547527674048]
本稿では,スパース結果報酬を高密度プロセス報酬に変換するための簡単な手法を提案する。
我々のアプローチは、以前の成功と失敗のエピソードを区別するために差別者を訓練することに依存しています。
この報酬は、タスクの成功に対応するものだけでなく、すべての州への訪問に対応するポリシーをインセンティブにすることで、タスク完了に向けた進捗が進められているかどうかについての深いフィードバックを提供する。
論文 参考訳(メタデータ) (2026-06-22T17:30:24Z) - Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning [74.5532558466687]
群 Relative Reward Rescaling (GR$3$) は、一般的な、連続かつ報酬に依存したゲーティング機構である。
GR$3$は、標準のGRPOに匹敵するトレーニングダイナミクスとダウンストリームのパフォーマンスを維持する。
それは長さのインフレーションを著しく軽減し、最先端の長周期正規化ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-03-11T08:41:34Z) - Hindsight PRIORs for Reward Learning from Human Preferences [3.4990427823966828]
嗜好に基づく強化学習(PbRL)では、政策行動に対する嗜好フィードバックから報酬を学習することで報酬関数を手渡す必要がなくなる。
PbRLへの現在のアプローチは、行動のどの部分が優先に最も寄与しているかを決定することに固有の信用割当問題に対処しない。
我々は、世界モデルを用いて軌道内の状態重要度を近似し、報酬を国家重要度に比例するように誘導する信用割当戦略(Hindsight PRIOR)を導入する。
論文 参考訳(メタデータ) (2024-04-12T21:59:42Z) - Maximally Forward-Looking Core Inflation [0.0]
私たちは、その目標を達成するために明示的に設計された新しいコアインフレーションシリーズを作成します。
先進国と後進国の両方で中長期のインフレ進展をシグナル化するための実質的な改善を見出した。
この指標は、早くも2020年半ばにインフレに対する初の上昇圧力を示し、2022年には急速に転換点を捉えた。
論文 参考訳(メタデータ) (2024-04-08T05:39:41Z) - Reinforcement Learning from Bagged Reward [46.16904382582698]
強化学習(RL)では、エージェントが取るアクション毎に即時報奨信号が生成されることが一般的である。
多くの実世界のシナリオでは、即時報酬信号の設計は困難である。
本稿では,双方向の注意機構を備えた新たな報酬再分配手法を提案する。
論文 参考訳(メタデータ) (2024-02-06T07:26:44Z) - Internally Rewarded Reinforcement Learning [22.01249652558878]
政策学習の報奨信号が内部報酬モデルによって生成される強化学習のクラスについて検討する。
提案した報奨関数は,報奨音の影響を低減し,トレーニング過程を一定に安定化させることができることを示す。
論文 参考訳(メタデータ) (2023-02-01T06:25:46Z) - Transferable Reward Learning by Dynamics-Agnostic Discriminator Ensemble [8.857776147129464]
専門家によるデモンストレーションから報酬関数を復元することは、強化学習における根本的な問題である。
本研究では、状態行動と状態のみの報酬関数の両方を学習できる動的非依存型識別器・アンサンブル報酬学習法を提案する。
論文 参考訳(メタデータ) (2022-06-01T05:16:39Z) - Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping [71.214923471669]
リワード整形は、ドメイン知識を強化学習(RL)に組み込む効果的な手法である
本稿では,所定の整形報酬関数を適応的に活用する問題を考察する。
スパース逆カートポールとMuJoCo環境の実験は、我々のアルゴリズムが有益な整形報酬を完全に活用できることを示している。
論文 参考訳(メタデータ) (2020-11-05T05:34:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。