論文の概要: SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.03092v1
- Date: Tue, 04 Aug 2026 04:08:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.026701
- Title: SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
- Title(参考訳): SMOPD: 高度オンライン政策蒸留によるマルチリワード強化学習
- Authors: Wen Wang, Jiahua Bao, Tu Yongsiqi, Yihao Liu, Haotian Zhou, Haoxuan Ma, Mengyu Zhou, Wenkui Fan, Junwei He, Xiaoxi Jiang, Guanjun Jiang,
- Abstract要約: マルチリワード最適化のための2段階学習手法を提案する。
SMOPD (Specialize-and-Merge Online Policy Distillation) は、GDPOを1.5B、3B、7Bのバックボーンで上回っている。
- 参考スコア(独自算出の注目度): 11.769607068698855
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We aim to improve model performance in multi-reward reinforcement learning training process. Existing Group reward-Decoupled Normalization Policy Optimization (GDPO) has mitigated the issue of reward signals masking one another during direct scalarization by normalizing each reward dimension separately before aggregation. However, our experiments show that GDPO still struggles to balance reward signals with different granularities. Specifically, in some particular training tasks, the model may receive a dense reward that assigns fine-grained scores ranging from 0.1 to 1.0, together with a sparse reward that provides only binary feedback of either 0 or 1. In such cases, we find that the sparse reward may provide an insufficient optimization signal, preventing its corresponding capability from being effectively reinforced. Therefore, how can we strengthen the optimization signal from the sparse reward without sacrificing the capability already learned from the fine-grained reward? To overcome this limitation, we propose Specialize-and-Merge Online Policy Distillation (SMOPD), a two-stage training method for multi-reward optimization. Stage1-Specialize: SMOPD first employs reward-priority configurations to train multiple reward-specialized teachers, allowing each reward to be learned under conditions where its signal can effectively drive optimization. Stage2-Merge: SMOPD then utilizes online policy distillation to combine the reward-specialized capabilities of these teachers into a single student policy, while maintaining balanced task-level optimization. To validate our method, we conduct experiments on two multi-reward settings: complementary rewards(tool-calling accuracy and format) and conflicting rewards (helpful and harmless rewards). Based on above settings, SMOPD outperforms GDPO across 1.5B, 3B and 7B backbones.
- Abstract(参考訳): マルチリワード強化学習学習プロセスにおけるモデル性能の向上を目指す。
既存のグループ報酬分離正規化政策最適化(GDPO)は、アグリゲーション前に各報酬次元を個別に正規化することにより、直接スカラー化中に互いにマスクする報酬信号の問題を軽減する。
しかし, 実験の結果, GDPOは相変わらず, 報酬信号と異なる粒度のバランスをとるのに苦戦していることがわかった。
具体的には、特定のトレーニングタスクにおいて、モデルには0.1から1.0までの細かいスコアを割り当てる厳密な報酬と、0または1のバイナリフィードバックのみを提供するスパース報酬が与えられる。
このような場合、スパース報酬が不十分な最適化信号を与える可能性があり、対応する能力が効果的に強化されるのを防ぐことができる。
したがって、精細な報酬から学んだ能力を犠牲にすることなく、スパース報酬からの最適化信号をどのように強化できるか。
この制限を克服するために,マルチリワード最適化のための2段階学習手法SMOPDを提案する。
ステージ1-特殊化: SMOPDは、最初に報酬優先の構成を使用して、複数の報酬特化教師を訓練し、その信号が効果的に最適化を推進できる条件下で各報酬を学習できるようにする。
Stage2-Merge: SMOPDは、オンラインポリシーの蒸留を利用して、これらの教師の報酬特化能力を、バランスの取れたタスクレベルの最適化を維持しながら、単一の学生ポリシーに組み合わせます。
提案手法を検証するため,相補的報酬(tool-calling accuracy, format)と相反する報酬(helpful, harmless reward)の2つのマルチリワード設定実験を行った。
上記の設定に基づいて、SMOPDはGDPOを1.5B、3B、7Bのバックボーンで上回っている。
関連論文リスト
- RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents [24.215311212134882]
本稿では,高密度なプロセス報酬から得られる豊富な情報を活用して,結果報酬によるトレーニングを容易にするために,Reward-Swap Policy Optimization (RSPO)を提案する。
RSPOは、最適化目標と真の結果報酬との整合性を確保しつつ、サンプル軌跡の多様性を保証する。
論文 参考訳(メタデータ) (2026-07-06T06:32:39Z) - TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment [52.570581883709345]
本稿では,報酬を人間レベルの報酬分布マッチングに置き換えるトラジェクティブマッチングポリシバランス最適化(TMPO)を提案する。
TMPOは最先端の手法に対する生成的多様性を9.1%向上させ、下流および効率の指標で競合性能を達成する。
大規模フロープレフィックスのマルチトラックトレーニング時間を短縮するため、TMPOはDynamic Tree Smplingモデルを導入し、動的にスケジュールされたステップでトラジェクトリがdenoisingとブランチを共有する。
論文 参考訳(メタデータ) (2026-05-09T04:41:02Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - GOPO: Policy Optimization using Ranked Rewards [12.100854296428524]
Group Ordinal Policy Optimization (GOPO) は報酬のランク付けのみを使用し、その規模を廃止する。
さまざまなタスクとモデルサイズで一貫した改善を示します。
論文 参考訳(メタデータ) (2026-02-01T22:07:11Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - Process Reinforcement through Implicit Rewards [94.09453548052862]
複雑なプロセス報酬は、大きな言語モデル(LLM)の推論時間スケーリングにおいて、スパースな結果レベルの報酬よりも効果的な選択肢であることが証明されている。
ディエンス報酬は、その微粒な報酬が結果報酬の固有の問題に対処する可能性があるため、LLMの強化学習(RL)に魅力的な選択を与える。
これは主に、高品質なプロセスラベルの収集が違法に高価であるオンラインのトレーニングプロセス報酬モデル(PRM)の課題に起因する可能性がある。
提案するPRIMEは,ポリシロールアウトと結果ラベルのみを用いて,インプットプロセス報酬によるオンラインPRM更新を可能にする。
論文 参考訳(メタデータ) (2025-02-03T15:43:48Z) - Distributional Reward Estimation for Effective Multi-Agent Deep
Reinforcement Learning [19.788336796981685]
実効的マルチエージェント強化学習(DRE-MARL)のための分散逆推定フレームワークを提案する。
本研究の目的は,安定トレーニングのための多行動分岐報酬推定と政策重み付け報酬アグリゲーションを設計することである。
DRE-MARLの優位性は,有効性とロバスト性の両方の観点から,SOTAベースラインと比較して,ベンチマークマルチエージェントシナリオを用いて実証される。
論文 参考訳(メタデータ) (2022-10-14T08:31:45Z) - Self-Supervised Online Reward Shaping in Sparse-Reward Environments [36.01839934355542]
自己監督型オンライン報酬形成を行う新しい強化学習フレームワークを提案する。
提案するフレームワークは、ポリシーの更新と報酬関数の推測を交互に行う。
いくつかのスパースワード環境における実験結果は、提案アルゴリズムが最先端のベースラインよりもはるかにサンプル効率が高いことを示している。
論文 参考訳(メタデータ) (2021-03-08T03:28:04Z) - DORB: Dynamically Optimizing Multiple Rewards with Bandits [101.68525259222164]
政策に基づく強化学習は、言語生成タスクにおいて、微分不可能な評価指標を最適化するための有望なアプローチであることが証明されている。
We use the Exp3 algorithm for bandit and formulate two approach for bandit rewards: (1) Single Multi-reward Bandit (SM-Bandit), (2) Hierarchical Multi-reward Bandit (HM-Bandit)
我々は,2つの重要なNLGタスクにおいて,様々な自動計測と人的評価を通じて,我々のアプローチの有効性を実証的に示す。
論文 参考訳(メタデータ) (2020-11-15T21:57:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。