論文の概要: Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.26481v1
- Date: Thu, 27 Aug 2026 00:12:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.205064
- Title: Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning
- Title(参考訳): 共有アクターは批判を共有する必要はない:並列強化学習における価値ミスマッチの効果
- Authors: Zhenya Liu, Yang Meng, Zhuokai Zhao, Xuefeng Liu, Yuxin Chen,
- Abstract要約: ひとつのポリシーは、同じタスクの複数の環境を並行してトレーニングする。
異なる環境は、異なる期待したリターンを、批評家に見える同じ入力に割り当てることができる。
環境情報のない批評家は、異なる価値目標を調整しなければならない。
- 参考スコア(独自算出の注目度): 19.18319839728467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a single policy is trained in parallel across multiple environments of the same task, such as procedurally generated levels, randomized dynamics, or curricula, implementations commonly use one critic across all sampled environments. Yet different environments can assign different expected returns to the same input visible to the critic. A critic without environment information must then reconcile distinct value targets, systematically shifting the sampled advantages within individual environments. Using illustrative bandit models with multiple environments and a common optimal arm, we characterize how this value mismatch redistributes sampled policy updates, reinforcing unhelpful actions while attenuating or even reversing useful ones. The oracle processes using no baseline, the shared value, or the value specific to the sampled environment have the same mean logit update at a fixed policy and converge to the same optimal policy, yet their realized learning paths can differ sharply. The analysis motivates a minimal intervention: give only a logged environment index to the critic so that it can separate the value targets. Controlled CartPole and MuJoCo experiments expose the predicted shifted values, advantages, and performance gaps. In the more complex BipedalWalker and Procgen settings, the same intervention yields more stable learning and higher returns. Across all $16$ Procgen games, the multihead conditional critic improves aggregate normalized return on $600$ unseen levels per game by $40.8\%$. In conclusion, the theory identifies value mismatch as a direct mechanism through which critic sharing can degrade stochastic learning dynamics, not captured by scalar estimator variance alone, and the experiments show that conditioning on an index is broadly effective in parallel reinforcement learning.
- Abstract(参考訳): 1つのポリシーが、手続き的に生成されたレベル、ランダム化されたダイナミクス、あるいはカリキュラムなど、同じタスクの複数の環境にわたって並列にトレーニングされる場合、実装は通常、すべてのサンプル環境で1つの批判を使用する。
しかし、異なる環境は、異なる期待したリターンを、批評家に見える同じ入力に割り当てることができます。
環境情報のない批評家は、異なる価値目標を整理し、個々の環境内でサンプル化された利点を体系的にシフトしなければならない。
複数の環境と共通の最適アームを持つイラストレーター型バンディットモデルを用いて、この値のミスマッチが、サンプル化されたポリシー更新を再分割し、有用なものを減らしたり、反転させたりしながら、不愉快な行動を補強する様子を特徴付ける。
基準線、共有値、サンプル環境固有の値を使用しないオラクルプロセスは、固定されたポリシーで同じ平均ロジット更新を持ち、同じ最適ポリシーに収束するが、それらの実現された学習経路は、急激な違いがある。
分析は最小限の介入を動機付け、ログ化された環境インデックスのみを批評家に与え、価値目標を分離できるようにする。
制御されたCartPoleとMuJoCoの実験は、予測されたシフトした値、アドバンテージ、パフォーマンスギャップを明らかにする。
より複雑なBipedalWalkerとProcgenの設定では、同じ介入がより安定した学習とより高いリターンをもたらす。
16ドルのProcgenゲーム全体で、マルチヘッド条件付き批評家は、ゲーム当たり600ドル(約6万6000円)のノーマライズリターンを40.8ドル(約4万7000円)で改善している。
結論として、この理論は、スカラー推定器の分散だけでは捉えられず、批判共有が確率的学習のダイナミクスを劣化させる直接的なメカニズムとして価値ミスマッチを同定し、この実験により、インデックスの条件付けが並列強化学習に広く有効であることが示されている。
関連論文リスト
- Best Practice Critic Optimization [23.2221736020451]
批判に基づくトレーニングのレシピは、しばしば不安定である。
DPPO,報酬範囲に束縛された値予測,モンテカルロ値の目標,非正規化ポリシの優位性,長さ適応型汎用的優位性推定を組み合わせたレシピを開発した。
論文 参考訳(メタデータ) (2026-08-24T17:59:39Z) - Relative Value Learning [10.063075560468798]
相対値学習(Relative Value Learning)は、反対称関数 $(s_i, s_j) = V(s_i) - V(s_j)$ を通じて直接値差を学習するフレームワークである。
絶対的な批判に対して,相対値推定が効果的な代替手段であることを示す。
論文 参考訳(メタデータ) (2026-07-23T09:55:45Z) - Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning [14.145365060331516]
逆強化学習は、人間のフィードバックから目的を推測する原則的な方法を提供する。
フィードバックモダリティの違いが報酬を制限していることを示し、無制限データ体制では、比較は他のモダリティよりも厳密なグローバル制約を課していることを示す。
複数のMDPで動作する報酬学習のための階層型機械学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-07-09T16:18:16Z) - VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - The Lie of the Average: How Class Incremental Learning Evaluation Deceives You? [48.83567710215299]
クラスインクリメンタルラーニング(CIL)では、モデルが学習済みのクラスを忘れずに、新しいクラスを継続的に学習する必要がある。
我々は、ロバストなCIL評価プロトコルは、性能分布全体を正確に特徴付け、推定するべきであると論じる。
我々は,タスク間類似度を用いて,極端なクラスシーケンスを適応的に識別し,サンプリングする評価プロトコルEDGEを提案する。
論文 参考訳(メタデータ) (2025-09-26T17:00:15Z) - Collaborative Value Function Estimation Under Model Mismatch: A Federated Temporal Difference Analysis [55.13545823385091]
フェデレーション強化学習(FedRL)は、エージェント間のデータ交換を防止し、データのプライバシを維持しながら協調学習を可能にする。
現実世界のアプリケーションでは、各エージェントは若干異なる遷移ダイナミクスを経験し、固有のモデルミスマッチを引き起こす。
情報共有の適度なレベルでさえ、環境固有のエラーを著しく軽減することを示す。
論文 参考訳(メタデータ) (2025-03-21T18:06:28Z) - Probably Approximately Precision and Recall Learning [60.00180898830079]
機械学習における重要な課題は、一方的なフィードバックの頻度である。
本稿では,確率的近似(PAC)フレームワークを導入し,各入力をラベルの集合にマッピングする仮説を定めている。
我々は、正のデータのみから学習する新しいアルゴリズムを開発し、実現可能な場合において最適なサンプル複雑性を実現する。
論文 参考訳(メタデータ) (2024-11-20T04:21:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。