論文の概要: Personalized Federated Reinforcement Learning via Model-Agnostic Meta-Learning: Convergence of Exact and Hessian-Free Meta-Policy Gradients
- arxiv url: http://arxiv.org/abs/2609.22833v1
- Date: Sat, 19 Sep 2026 07:11:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.569141
- Title: Personalized Federated Reinforcement Learning via Model-Agnostic Meta-Learning: Convergence of Exact and Hessian-Free Meta-Policy Gradients
- Title(参考訳): モデル非依存型メタラーニングによる個人化フェデレーション強化学習--厳密かつヘッセンフリーなメタポリティクスの収束
- Abstract要約: 個人化強化連合学習について検討し、$n$エージェントがサーバを介して協調して共有MAMLスタイルのポリシーを学習する。
本稿では,Per-FedAvg-PGを提案する。
- 参考スコア(独自算出の注目度): 5.977181405597602
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study personalized federated reinforcement learning, in which $n$ agents, each acting in its own Markov decision process, collaborate through a server to learn a shared MAML-style policy initialization that becomes effective for an individual agent once that agent adapts it with a single local policy-gradient step. We propose Per-FedAvg-PG, in which agents take $τ$ local stochastic meta-policy-gradient steps between communication rounds, and prove that it reaches an $\varepsilon$-approximate first-order stationary point of the personalized objective in $K=\mathcal O(\varepsilon^{-3/2})$ rounds with $τ=Θ(\varepsilon^{-1/2})$ local steps. The analysis rests on a structural feature of the reinforcement learning setting: under standard policy-class regularity, the per-agent objectives have uniformly bounded gradients and Hessians with explicit constants, so the bounded-gradient and bounded-heterogeneity conditions imposed by the supervised theory hold automatically and no separate heterogeneity assumption is needed. The exact meta-gradient requires the inner-loop policy Hessian, which our experiments identify as the practical bottleneck. We therefore analyze the Hessian-free variant, bound its bias, and exhibit fixed points at which the meta-gradient is nonzero and of order $α$, showing that the resulting stationarity floor is a property of the method rather than of the bound. Experiments on tabular and neural navigation confirm the predicted behavior and show transfer to unseen agents at an order of magnitude lower sample cost than independent training. Together these results identify the adaptation step size as a tunable personalization knob and the curvature estimate as the quantity that governs whether exact meta-gradients are affordable.
- Abstract(参考訳): 我々は、各エージェントが独自のマルコフ決定プロセスで行動するパーソナライズされた強化学習について研究し、各エージェントが一つのローカルポリシー段階のステップでそれを適用すると、共有MAMLスタイルのポリシー初期化を学習するためにサーバを介して協調する。
Per-FedAvg-PG は、エージェントが通信ラウンド間の局所確率的メタ政治の段階的なステップを$τ$で受け取り、それがパーソナライズされた目的の1次定常点である $K=\mathcal O(\varepsilon^{-3/2})$ラウンドに$τ=\(\varepsilon^{-1/2})$ローカルステップで$\varepsilon$-approximate に達することを証明する。
この分析は強化学習環境の構造的特徴に依拠する: 標準方針クラス正規性の下では、エージェントごとの目的は一様に有界な勾配と明示的な定数を持つヘッセンを持つため、教師付き理論によって課される有界次数的および有界次数的不均一性条件は自動的に保持され、別個の異種性仮定は不要である。
正確なメタグラディエントは内部ループポリシーであるHessianを必要とします。
したがって、Hessian-free バリアントを解析し、そのバイアスを束縛し、メタ勾配が 0 で次数$α$ の固定点を示す。
表状および神経ナビゲーションの実験は、予測された振る舞いを確認し、独立したトレーニングよりもサンプルコストの桁違いに、見知らぬエージェントへの転送を示す。
これらの結果は、適応ステップサイズを調整可能なパーソナライズノブ、および曲率推定を、正確なメタグラディエントが手頃な価格であるか否かを規定する量として同定する。
関連論文リスト
- Hierarchical Grading in Large Language Models [0.0]
GLLM( Graded Large Language Models)を紹介する。
GLLMは変換器の表現空間に階調を付与するフレームワークである。
この構造は、階調ニューラルネットワークと階調変換器の理論を自己回帰言語モデルに拡張する。
論文 参考訳(メタデータ) (2026-07-23T20:14:48Z) - Inverting the Bellman Equation: From $Q$-Values to World Models [57.827849584133425]
我々は、十分に豊富な報酬関数のセットで訓練された価値に基づくエージェントが、ユニークで正確な世界モデルを暗黙的にエンコードしていることを証明した。
ttReacherエージェントの暗黙の世界モデルにのみ訓練されたポリシーは、位置のみのトレーニングにもかかわらず、分布外、速度に基づく目標に準最適であることがわかった。
論文 参考訳(メタデータ) (2026-06-19T07:26:14Z) - Civilizational Metamaterials: Engineering Coordination Under Capability Gradients and Structural Turbulence [0.0]
ガバナンスは規範的な規律からエンジニアリングの規律に移行しなければなりません。
メタマテリアルの物理にインスパイアされた形式的な枠組みを開発し、この遷移を定量的かつ検証可能にする。
論文 参考訳(メタデータ) (2026-05-29T18:10:00Z) - Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic [13.674509321097311]
エージェントが共通の線形部分空間表現を共有する,連合型アクター批判フレームワークについて考察する。
エージェントは、共通部分空間、地域批評家の頭、および地域政策(アクター)を反復的に見積もる。
批判誤差は $tildemathcalO (1/()6sqrtTK)$ で 0 に収束し、ポリシー勾配ノルムは $tildemathcalO (1/()6sqrtTK) で 0 に収束することを示す。
論文 参考訳(メタデータ) (2026-05-14T06:10:31Z) - C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning [54.705168477975384]
推論モデル学習のためのグループシーケンスポリシーグラディエント(GSPG)フレームワーク。
C$2$GSPGは、自信過剰を抑えながら推論性能を同時に向上させる。
論文 参考訳(メタデータ) (2025-09-27T05:24:51Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - Policy Mirror Descent Inherently Explores Action Space [10.772560347950053]
1/epsilon2)$tildemathcalO($tildemathcalO)を,探索戦略を使わずに,オンラインポリシグラデーションメソッドのサンプル複雑性を初めて確立しました。
新しいポリシー勾配法は、最適なポリシーを探す際に、潜在的にリスクの高い行動に繰り返しコミットするのを防ぐことができる。
論文 参考訳(メタデータ) (2023-03-08T05:19:08Z) - The Role of Baselines in Policy Gradient Optimization [83.42050606055822]
Emphstateのバリューベースラインが、オン・ポリティクスを可能にしていることを示す。
世界的な最適な政策勾配(NPG)に収束する。
O (1/t) レート勾配でのポリシー。
値ベースラインの主な効果は、その分散ではなく、更新のアグレッシブさをthabfreduceすることにある。
論文 参考訳(メタデータ) (2023-01-16T06:28:00Z) - MDPGT: Momentum-based Decentralized Policy Gradient Tracking [29.22173174168708]
マルチエージェント強化学習のための運動量に基づく分散型ポリシー勾配追跡(MDPGT)を提案する。
MDPGTは、グローバル平均の$N$ローカルパフォーマンス関数の$epsilon-stationaryポイントに収束するために$mathcalO(N-1epsilon-3)$の最良のサンプル複雑性を実現する。
これは、分散モデルレス強化学習における最先端のサンプル複雑さよりも優れています。
論文 参考訳(メタデータ) (2021-12-06T06:55:51Z) - Zeroth-order Deterministic Policy Gradient [116.87117204825105]
ゼロ階決定主義政策グラディエント(ZDPG)を紹介する。
ZDPGは、$Q$関数の2点評価によりポリシー逆勾配を近似する。
ZDPGの新たな有限サンプル複雑性境界は、既存の結果を最大2桁改善する。
論文 参考訳(メタデータ) (2020-06-12T16:52:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。