論文の概要: EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.12459v1
- Date: Fri, 11 Sep 2026 05:40:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.634236
- Title: EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning
- Title(参考訳): EvoRS: オープンエンディング強化学習のためのリワードシステムのオンライン自己進化
- Authors: Weiyuan Li, Aili Chen, Xintao Wang, Yikai Zhang, Qingqing Dong, Jinghan Xu, Hongru Hou, Wenxuan Zhao, Chengkun Lang, Jun Gao, Yuanli Guo, Hongcheng Guo, Yanghua Xiao, Deqing Yang,
- Abstract要約: EvoRSは自己進化型RLフレームワークで、報酬体系を政治上の経験から進化させる。
執筆とロールプレイを通じて、EvoRSは3人の審査員全員の下で最高の品質を達成する。
- 参考スコア(独自算出の注目度): 54.99968863245366
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-ended reinforcement learning often relies on rubric-based rewards for tasks without directly verifiable answers. Yet the policy and reward system form a dynamic feedback loop: as the policy optimizes the current reward, an initially useful reward system may become unreliable due to reward hacking or reduced response discriminability. The reward system should therefore evolve rather than remain fixed during training. Existing dynamic-rubric methods adapt evaluation criteria, but reward failures can also arise from scoring mechanisms or signal composition. We introduce EvoRS, a self-evolving RL framework that evolves the reward system from on-policy experience, representing it as an executable Reward-DAG. Specifically, an agentic designer updates this system from on-policy rollouts and reward traces to maintain train-time reliability. Across writing and roleplay, EvoRS achieves the best quality under all three judges, outperforming the policy by \(2.107\) and \(4.767\) points, respectively, while reducing reward hacking and coverage failures and preserving reward informativeness. Ablations confirm that a comprehensive fixed reward system cannot remain reliable in open-ended tasks and must evolve throughout training.
- Abstract(参考訳): オープンエンド強化学習は、直接的に検証できないタスクに対するルーブリックベースの報酬に依存することが多い。
しかし、ポリシーと報酬システムは動的フィードバックループを形成し、現在の報酬を最適化するにつれて、報酬のハッキングや応答の識別性の低下によって、初期有用な報酬システムは信頼性が低下する可能性がある。
したがって、報酬体系は訓練中に固定されるよりも進化すべきである。
既存の動的ルーブリック法は評価基準に適合するが、報酬の失敗はスコアリング機構や信号合成からも生じうる。
本稿では、自己進化型RLフレームワークであるEvoRSを紹介し、報酬システムを政治経験から進化させ、それを実行可能なReward-DAGとして表現する。
具体的には、エージェント・デザイナがこのシステムを、オン・ポリシーのロールアウトと報酬のトレースからアップデートし、列車の時間的信頼性を維持する。
執筆とロールプレイ全体を通じて、EvoRSは3人の審査員の中で最高の品質を達成し、それぞれ((2.107\)と(4.767\)の点でポリシーを上回り、報酬のハッキングとカバレッジの失敗を減らし、報酬の伝達力を維持する。
アブレーションは、包括的固定報酬システムは、オープンエンドのタスクにおいて信頼性を保つことができず、トレーニングを通して進化しなければならないことを確認します。
関連論文リスト
- Learning Process Rewards via Success Visitation Matching for Efficient RL [54.67547527674048]
本稿では,スパース結果報酬を高密度プロセス報酬に変換するための簡単な手法を提案する。
我々のアプローチは、以前の成功と失敗のエピソードを区別するために差別者を訓練することに依存しています。
この報酬は、タスクの成功に対応するものだけでなく、すべての州への訪問に対応するポリシーをインセンティブにすることで、タスク完了に向けた進捗が進められているかどうかについての深いフィードバックを提供する。
論文 参考訳(メタデータ) (2026-06-22T17:30:24Z) - When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study [77.64957118012423]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデル推論において大きな進歩をもたらした。
最近の研究は、多数決や信頼に基づくスコアなど、モデル自身の信号から報酬を導き出すことによって、この問題に対処している。
本稿では,コード生成における本質的な報酬手法の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-06-18T19:15:50Z) - Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning [18.80588864499134]
Grad2Rewardは、ジャッジのモデル推論プロセスから直接、単一の後方パスを介して、密集したプロセス報酬を抽出する。
Grad2Rewardはグラデーションベースの属性を利用することで、正確なトークンレベルのクレジット割り当てを可能にする。
Grad2Rewardで最適化されたポリシーは、様々なオープンエンドタスクで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-02T08:13:13Z) - Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards [13.70228195630989]
本稿では,マルチターンインタラクション,dockerベースの実行,カスタマイズ可能な報酬関数をサポートする統合システムであるSWE指向RLフレームワークを紹介する。
Gated Reward Accumulation (G-RA) も提案する。これは,高位(長期)の報酬が予め定義された閾値を満たす場合にのみ,即時報酬を蓄積する新しい手法である。
論文 参考訳(メタデータ) (2025-08-14T11:37:02Z) - Adversarial Training of Reward Models [74.17196154247964]
本稿では,対戦型学習フレームワークAdv-RMについて紹介する。
強化学習を活用することで、Adv-RMは、大規模な最先端の報酬モデルにおける脆弱性を明らかにするポリシーを訓練する。
本稿では,Adv-RMが従来の報酬訓練よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-08T15:38:25Z) - Deceptive Sequential Decision-Making via Regularized Policy Optimization [54.38738815697299]
我々は,自律的なシステムをマルコフ決定プロセスとしてモデル化し,逆強化学習を用いて報酬関数を復元する。
本稿では,システム報酬に対する敵意を積極的に欺く政策合成問題に対する3つの規則化戦略を示す。
我々は,その最適かつ非知覚的価値の少なくとも97%の累積報酬を達成しつつ,反逆的,標的的,公平な詐欺が虚偽の信念に逆らうことを示している。
論文 参考訳(メタデータ) (2025-01-30T23:41:40Z) - ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization [41.074747242532695]
Online Reward Selection and Policy Optimization (ORSO) は、オンラインモデル選択問題としてシェーピング報酬関数の選択を枠組みとした、新しいアプローチである。
ORSOは、整形報酬関数を評価するのに必要なデータ量を著しく削減し、データ効率と計算時間(最大8倍)の大幅な削減をもたらす。
ORSOは、従来の手法よりも50%以上優れた高品質の報酬関数を一貫して識別し、平均的にポリシーを、ドメインの専門家が手作業で設計した報酬関数を使って学んだものと同様に、パフォーマンスとして識別する。
論文 参考訳(メタデータ) (2024-10-17T17:55:05Z) - Distributional Reward Estimation for Effective Multi-Agent Deep
Reinforcement Learning [19.788336796981685]
実効的マルチエージェント強化学習(DRE-MARL)のための分散逆推定フレームワークを提案する。
本研究の目的は,安定トレーニングのための多行動分岐報酬推定と政策重み付け報酬アグリゲーションを設計することである。
DRE-MARLの優位性は,有効性とロバスト性の両方の観点から,SOTAベースラインと比較して,ベンチマークマルチエージェントシナリオを用いて実証される。
論文 参考訳(メタデータ) (2022-10-14T08:31:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。