論文の概要: Single or Multiple Policies for Phase-Structured Reinforcement Learning?
- arxiv url: http://arxiv.org/abs/2610.03475v1
- Date: Fri, 02 Oct 2026 15:48:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.459249
- Title: Single or Multiple Policies for Phase-Structured Reinforcement Learning?
- Title(参考訳): 位相構造強化学習のための単一・複数政策
- Abstract要約: 共有政策は理論的に任意のマルチポリティクスソリューションの性能を達成可能であることを示す。
そこで本研究では,どのポリシーがより優れた性能を提供できるかを特定するために,レギュラーベースの位相分解法を提案する。
- 参考スコア(独自算出の注目度): 4.413246337852144
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many reinforcement-learning (RL) problems are non-stationary yet structured and can be decomposed into phases, each with its own transition probabilities and reward functions. When the phase sequence is known, the common solution augments the state with information to satisfy the Markovian property and applies standard RL techniques. However, prior work finds that the multi-policy approach for different phases can outperform a single state-augmented policy shared among the phases, for reasons that remain unclear. In this work, we first show that the shared policy can theoretically achieve performance of any multi-policy solution. However, whether a multi-policy solution can perform better than the corresponding single shared policy in practice depends on function approximation, learning and optimization processes, as well as, for multi-policy solutions, the sample efficiency and loss of continuity from one policy to another. We propose a regime-based phase decomposition method to identify which policy can provide better performance. The method is based on consideration of the duration of transient system dynamics relative to the duration of the quasi-stationary period. Numerical experiments are conducted with different non-stationary RL problems to validate our four major hypotheses: (a) longer phase durations favor multi-policies, (b) the heterogeneity between phases increases the burden on single policy, (c) multi-policies need sufficient data for each phase, and (d) environment-specific transition dynamics between phases can affect which policy is preferable.
- Abstract(参考訳): 多くの強化学習(RL)問題は非定常構造であり、相に分解可能であり、それぞれがそれぞれの遷移確率と報酬関数を持つ。
位相列が知られているとき、共通解はマルコフの性質を満たす情報を加え、標準のRL技術を適用する。
しかし、以前の研究では、異なるフェーズに対するマルチ政治アプローチが、相間で共有される単一のステート拡張ポリシーよりも優れていることが判明した。
本研究では,共有政策が理論的に任意のマルチ政治ソリューションの性能を達成できることを最初に示す。
しかし、実際には、マルチ政治ソリューションが、機能近似、学習、最適化プロセス、そして、マルチ政治ソリューションに対して、あるポリシーから別のポリシーへの継続性のサンプル効率と損失に依存している。
そこで本研究では,どのポリシーがより優れた性能を提供できるかを特定するために,レギュラーベースの位相分解法を提案する。
本手法は,準定常期間に対する過渡系力学の持続時間を考慮したものである。
4つの主要な仮説を検証するために、異なる非定常RL問題を用いて数値実験を行った。
a) より長い期間は、多国間を好む。
b) 相間の不均一性は単一政策の負担を増大させる。
(c)複数自治体は各段階に十分なデータを必要とし、
(d) 相間の環境特異的な遷移ダイナミクスは、どのポリシーが望ましいかに影響を与える可能性がある。
関連論文リスト
- Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling [3.6266846456338695]
最大エントロピー強化学習(MaxEnt RL)がシーケンシャル意思決定の標準フレームワークとなっている。
本稿では,ハイブリッド決定論的確率論的アーキテクチャに基づくフレームワークであるTrncated Rectified Flow Policyを提案する。
論文 参考訳(メタデータ) (2026-04-10T09:44:28Z) - Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization [2.595968385299781]
多目的強化学習は、複数の、しばしば矛盾する目標のバランスをとる政策を学ぼうとする。
PPOベースのフレームワークである$D3PO$を導入し、これらの問題に直接対処するために、多目的ポリシー最適化を再編成する。
D3PO$は、分解された最適化パイプラインを通じてオブジェクトごとの学習信号を保存し、安定化後にのみ好みを統合する。
論文 参考訳(メタデータ) (2026-02-08T01:45:01Z) - Offline Multi-agent Reinforcement Learning via Score Decomposition [51.23590397383217]
オフライン協調型マルチエージェント強化学習(MARL)は、分散シフトによる固有の課題に直面している。
この作業は、オフラインとオンラインのMARL間の分散ギャップを明示的に解決する最初の作業である。
論文 参考訳(メタデータ) (2025-05-09T11:42:31Z) - Continual Multimodal Contrastive Learning [99.53621521696051]
MCL(Multimodal Contrastive Learning)は、異なるモダリティを整列し、関節空間におけるマルチモーダル表現を生成する。
マルチモーダルデータは単一のプロセスで収集されることはめったになく、スクラッチからのトレーニングは計算コストがかかる。
本稿では, 安定性と塑性の2つの原理によりCMCLを定式化する。
理論的には、二辺から部分空間への勾配の更新を計画する、新しい最適化に基づく手法を導出する。
論文 参考訳(メタデータ) (2025-03-19T07:57:08Z) - Non-Stationary Policy Learning for Multi-Timescale Multi-Agent
Reinforcement Learning [9.808555135836022]
マルチタイムスケールのマルチエージェント強化学習では、エージェントは異なる時間スケールで相互作用する。
マルチスケールMARLのための非定常ポリシーを学習するための簡単なフレームワークを提案する。
グリッドワールドとエネルギー管理環境の構築において,マルチタイム・ポリシーを効果的に学習するフレームワークの能力を検証する。
論文 参考訳(メタデータ) (2023-07-17T19:25:46Z) - DEFT: Diverse Ensembles for Fast Transfer in Reinforcement Learning [1.111018778205595]
高いマルチモーダル環境下での強化学習のための新しいアンサンブル法であるDEFT(Diverse Ensembles for Fast Transfer in RL)を提案する。
このアルゴリズムは、アンサンブルメンバーの訓練と、アンサンブルメンバーの合成(または微調整)という2つの主要なフェーズに分けられる。
論文 参考訳(メタデータ) (2022-09-26T04:35:57Z) - Mitigating Off-Policy Bias in Actor-Critic Methods with One-Step
Q-learning: A Novel Correction Approach [0.0]
我々は,このような不一致が継続的制御に与える影響を軽減するために,新しい政策類似度尺度を導入する。
本手法は、決定論的政策ネットワークに適用可能な、適切な単一ステップのオフ・ポリシー補正を提供する。
論文 参考訳(メタデータ) (2022-08-01T11:33:12Z) - Latent-Variable Advantage-Weighted Policy Optimization for Offline RL [70.01851346635637]
オフラインの強化学習メソッドは、新しいトランジションを環境に問い合わせる必要なしに、事前にコンパイルされたデータセットから学習ポリシーを保証します。
実際には、オフラインデータセットは、しばしば異種、すなわち様々なシナリオで収集される。
より広範な政策分布を表現できる潜在変数ポリシーを活用することを提案する。
提案手法は,次回のオフライン強化学習法の性能を,異種データセット上で49%向上させる。
論文 参考訳(メタデータ) (2022-03-16T21:17:03Z) - Constructing a Good Behavior Basis for Transfer using Generalized Policy
Updates [63.58053355357644]
そこで我々は,優れた政策集合を学習する問題を考察し,組み合わせることで,目に見えない多種多様な強化学習タスクを解くことができることを示した。
理論的には、独立したポリシーのセットと呼ぶ、特定の多様なポリシーのセットにアクセスできることによって、ハイレベルなパフォーマンスを即時に達成できることが示される。
論文 参考訳(メタデータ) (2021-12-30T12:20:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。