論文の概要: A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.08158v1
- Date: Sat, 08 Aug 2026 14:35:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.704341
- Title: A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning
- Title(参考訳): 強化学習における動的リワード整形のための統一フレームワーク
- Abstract要約: 本研究では,動的報酬形成と周辺適応報酬機構を比較するための統合分析フレームワークを提案する。
これは、最適性を保証する条件が、現代的な深層強化学習パイプラインを生き残ることを強調する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse, delayed, and weakly informative rewards remain central obstacles to efficient reinforcement learning. Reward shaping addresses these limitations by supplementing the task reward with an auxiliary signal that can accelerate learning while, in the classical setting, the original objective remains the evaluation criterion. Established theory guarantees safety for fixed shaping signals: potential-based reward shaping preserves optimal policies when the auxiliary term is the discounted difference of a time-invariant potential. In contemporary reinforcement learning systems, however, both the learner and the information available for guidance evolve during training: value estimates improve, novelty diminishes, feedback shifts, and predictive models are refined. Adaptive reward mechanisms occur across exploration, Bayesian inference, human-in-the-loop learning, automated reward design, and foundation-model-based approaches. This study introduces a unified analytical framework for comparing dynamic reward shaping and neighbouring adaptive reward mechanisms. The proposed framework distinguishes parametric revision from state-dependent variation, separates additive shaping from reward replacement and reward-adjacent guidance, and organises existing methods along temporal, informational, and theoretical dimensions. Using this framework, twelve method families are comparatively analysed. The framework further highlights the conditions under which optimality guarantees survive contemporary deep reinforcement learning pipelines, replay buffers, bootstrapped critics, and reward normalisation, while exposing the unresolved relationship between adaptation rate and learner stability.
- Abstract(参考訳): スパース、遅延、弱情報的な報酬は、効率的な強化学習の中心的な障害のままである。
Reward Shapingは、古典的な環境では、本来の目的が評価基準のままでありながら、学習を加速できる補助信号でタスク報酬を補うことでこれらの制限に対処する。
ポテンシャルに基づく報酬形成は、補助項が時間不変ポテンシャルの割引された差である場合に最適なポリシーを保存する。
しかし、現代の強化学習システムでは、学習者と指導用情報の両方が訓練中に進化し、価値見積が向上し、新規性が低下し、フィードバックシフトが減少し、予測モデルが洗練される。
適応的な報酬メカニズムは、探索、ベイジアン推論、人間のループ学習、自動報酬設計、基礎モデルに基づくアプローチにまたがる。
本研究では,動的報酬形成と周辺適応報酬機構を比較するための統合分析フレームワークを提案する。
提案フレームワークは, 状態依存的変化とパラメトリックリビジョンを区別し, 報酬代替と報酬隣接誘導から付加的シェーピングを分離し, 時間的, 情報的, 理論的次元に沿って既存の手法を整理する。
この枠組みを用いて、12のメソッドファミリーを相対的に分析する。
この枠組みは、適応率と学習者の安定性の間の未解決の関係を露呈しつつ、現代的な深層強化学習パイプライン、リプレイバッファ、ブートストラップされた批評家、報酬正規化を維持できる条件をさらに強調する。
関連論文リスト
- Explicit Critic Guidance for Aligning Diffusion Models [27.6704888666835]
拡散後学習のための状態整列型アクター批判フレームワークを提案する。
提案手法は, グループリレーショナルRLとアクタークリティックベースラインを, シングルリワード, マルチリワードベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-05-26T22:20:51Z) - Alternating Reinforcement Learning with Contextual Rubric Rewards [2.1172256884504588]
Reinforcement Learning with Rewards (RLRR)は、従来の強化学習を人間のフィードバックから拡張するフレームワークである。
RLRRの既存のアプローチは、固定重み付きスカラー報酬に線形に圧縮されたベクトル報酬に限られる。
本研究は,報酬アグリゲーションの限界を克服するために,報酬付き強化学習(ARL-RR)を提案する。
論文 参考訳(メタデータ) (2026-03-04T04:18:39Z) - Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training [29.56905427210088]
Gragient-ARMは、好みのフィードバックから強化学習を使用するルーリックジェネレータとジャッジを共同で最適化するフレームワークである。
ベンチマークのベースライン間で、勾配-ARMは最先端のパフォーマンスを達成し、オフラインおよびオンラインの強化学習設定において、ダウンストリームポリシーアライメントを大幅に改善することを示す。
論文 参考訳(メタデータ) (2026-02-02T00:50:53Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Latent Chain-of-Thought for Visual Reasoning [53.541579327424046]
大型視覚言語モデル(LVLM)の解釈可能性および信頼性向上には,チェーン・オブ・シント(CoT)推論が不可欠である
我々は,LVLMにおける推論を後部推論として再構成し,償却変分推論に基づくスケーラブルなトレーニングアルゴリズムを提案する。
提案手法は,7つの推論ベンチマークにおいて,最先端のLVLMを強化することを実証的に実証する。
論文 参考訳(メタデータ) (2025-10-27T23:10:06Z) - OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment [55.59322229889159]
我々は,マルチタスク品質推論を連続的かつ解釈可能な報酬信号に変換する統一報酬モデリングフレームワークOmniQuality-Rを提案する。
我々は、推論強化報酬モデルデータセットを使用して、教師付き微調整のための信頼性の高いチェーンオブ思考データセットを構築します。
OmniQuality-Rは,美的品質評価,技術的品質評価,テキスト画像アライメントという3つの重要なIQAタスクで評価する。
論文 参考訳(メタデータ) (2025-10-12T13:46:28Z) - Reinforcement Learning for Durable Algorithmic Recourse [49.54997446851335]
提案手法は,提案手法を用いて,候補集団が推薦に応じてどのように適応するかを明示的にモデル化する。
また、環境の進化的ダイナミクスをキャプチャするRLベースのリコースアルゴリズムも導入する。
論文 参考訳(メタデータ) (2025-09-26T09:24:12Z) - Temporal-Difference Variational Continual Learning [77.92320830700797]
複数の先行推定の正則化効果を統合する新たな学習目標を提案する。
提案手法は, 変分CL法より優れたカタストロフィックフォーミングを効果的に緩和する。
論文 参考訳(メタデータ) (2024-10-10T10:58:41Z) - On Reward Structures of Markov Decision Processes [4.13365552362244]
マルコフ決定過程は、遷移カーネルと報酬関数によってパラメータ化することができる。
ロボット応用の需要に触発された強化学習に関連する様々な「コスト」について検討する。
単一状態値を推定するためのインスタンス固有のエラーを$tildeO(sqrtfractau_sn)$にバインドした新しい推定器を開発する。
論文 参考訳(メタデータ) (2023-08-28T22:29:16Z) - Robust Reinforcement Learning with Distributional Risk-averse
formulation [1.2891210250935146]
リスク・アバースの近似式を用いて,ロバスト強化学習を$Phi$-divergenceで制約する。
古典的強化学習の定式化は、目的の標準偏差ペナル化を用いて堅牢化できることを示す。
論文 参考訳(メタデータ) (2022-06-14T13:33:58Z) - Learning Domain Adaptive Object Detection with Probabilistic Teacher [93.76128726257946]
確率的教師(PT)と呼ばれる,シンプルで効果的な枠組みを提案する。
PTは、段階的に進化する教師から未ラベルの目標データの不確実性を捉え、相互に有利な方法で生徒の学習を指導することを目的としている。
また,不確実性誘導型自己学習を促進するために,新しいエントロピー・フォカル・ロス(EFL)を提案する。
論文 参考訳(メタデータ) (2022-06-13T16:24:22Z) - Temporal-Logic-Based Reward Shaping for Continuing Learning Tasks [57.17673320237597]
継続タスクにおいて、平均回帰強化学習は、より一般的な割引報酬の定式化よりも適切な問題定式化である可能性がある。
本稿では,平均回帰学習のための最初の報酬形成フレームワークを提案する。
これは、標準的な仮定の下では、元の報酬関数の下での最適ポリシーを復元できることを証明している。
論文 参考訳(メタデータ) (2020-07-03T05:06:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。