論文の概要: Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces
- arxiv url: http://arxiv.org/abs/2607.18554v1
- Date: Mon, 20 Jul 2026 22:41:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.260426
- Title: Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces
- Title(参考訳): 連続状態空間を用いたネットワーク型マルチエージェント強化学習のためのスケーラブルなポリシー最適化
- Abstract要約: 本研究では,連続状態と行動空間を有するネットワーク決定過程における協調的強化学習のためのアルゴリズムを開発する。
各エージェントは、グラフ近傍に局所的なアクターを保持し、局所化された時間差評価批評家は、切り捨てられた作用値関数を評価する。
- 参考スコア(独自算出の注目度): 16.43184149906767
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We develop the Continuous Distributed Coupled Policy Gradient (CDCPG) algorithm for cooperative reinforcement learning in networked Markov decision processes with continuous state and action spaces. Each agent maintains a local actor over a bounded graph neighborhood, and a localized least-squares temporal-difference critic evaluates a truncated action-value function through a spectral random-feature representation of the local transition kernel. The analysis makes four contributions. First, the truncated action-value function is constructed as a conditional expectation over the neighborhood, yielding a well-posed localized Bellman theory that removes the continuation-kernel mismatch of naive truncation arguments. Second, we expose a dimensional obstruction to temporal-difference stability for normalized random features and prove an unconditional excitation bound that reduces stability to a symmetric persistence-of-excitation condition, monitorable through an online matrix-concentration certificate. Third, under exponential spatial decay of agent interactions, the excitation condition, and smoothness of the objective, CDCPG drives an averaged per-agent stationarity measure to within any excess $ε$ of an explicitly characterized approximation floor using $\widetilde{\mathcal{O}}(ε^{-2})$ shared-oracle samples, and the excess dependence matches the smooth nonconvex first-order rate; per-agent computation and communication are governed by the neighborhood size rather than the network size. Fourth, an adaptive-locality rule selects the radius that balances truncation and graph-decay residuals against the target accuracy. Experiments on a networked linear-quadratic benchmark corroborate the locality and feature-dimension predictions.
- Abstract(参考訳): 連続状態と行動空間を有するマルコフ決定過程における協調的強化学習のための連続分散結合ポリシー勾配(CDCPG)アルゴリズムを開発した。
各エージェントは、有界グラフ近傍に局所的なアクターを保持し、局所化された最小二乗時間差分批判は、局所遷移カーネルのスペクトルランダムな表現を通して、トランケートされた作用値関数を評価する。
分析には4つの貢献がある。
第一に、トランケートされた作用値関数は近傍の条件付き期待値として構成され、局所化されたベルマン理論が成り立つ。
第二に、正規化されたランダムな特徴に対する時間差安定性に対する次元的障害を露呈し、オンライン行列集中証明によって監視可能な対称的持続-励振条件への安定性を低下させる無条件励振境界を証明した。
第3に, エージェント相互作用の指数的空間減衰, 励起条件, 目的の滑らかさの下で, CDCPGは, $\widetilde{\mathcal{O}}(ε^{-2})$ Share-oracle sampleを用いて, 明らかに特徴付けられた近似フロアのε$の任意の過剰な値に平均的なエージェントごとの定常度測定を駆動し, 余剰依存はスムーズな非凸1次速度と一致し, エージェントごとの計算と通信はネットワークサイズよりも近傍サイズによって制御される。
第4に、適応的局所性規則は、目標精度に対してトランケーションとグラフデカイ残差のバランスをとる半径を選択する。
ネットワーク化された線形四元数ベンチマークの実験は、局所性と特徴次元予測を相関させる。
関連論文リスト
- Spectral Dynamics of Semantic Drift in Clinical Multi-Agent Language Model Networks [0.0]
局所的な高密度傾斜角は、ハロゲン化データを閉じ込め、大域的なコンセンサスを防ぎ、恒久的なエントロピー飽和しきい値に向かってシステムを強制することを示す。
動的スペクトルモニタリングを$mathcalO(N3)$時間複雑さで導入することにより,グローバルな状態拡散を保証する数学的に厳密な手法を提案する。
論文 参考訳(メタデータ) (2026-07-23T20:20:45Z) - Radial Interaction Tomography: Recognizing Non-Transitive Evolutionary Games from One Range-Expansion Image [0.2864713389096699]
コンピュータビジョン逆問題(英語版)を定式化する: 付加多形展開の一端画像から、半径インデクシングされた対境界流場を復元する。
オブザーバブルは、対数極座標におけるセクター境界曲線から抽出される幾何学的信号である。
論文 参考訳(メタデータ) (2026-07-01T03:23:47Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Learning Transferable Predictability Representations [2.1505812656718795]
予測可能性条件の順序付き連続体上の位置を反映した短い軌跡窓にスカラースコアを割り当てる問題について検討する。
我々はこれを5段階の予測可能性はしご上での順序推定として定式化し、システム間のあいまいさの構造的源を特定する。
GON(Gauge-Fixed Ordinal Network)は,レベルワイドスコアをピン留めして目標座標を共有するアンカー・アンド・ディスラプティビティで訓練された時間的畳み込みモデルである。
論文 参考訳(メタデータ) (2026-05-28T21:38:49Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Central Limit Theorem for Two-Time-Scale Approximate Distributionally Robust RL [8.809468023364703]
堅牢な強化学習アルゴリズムの設計は根本的な課題を生んでいる。
本稿では、関連するロバスト関数の1次展開に基づく近似DRRLフレームワークを提案する。
この近似方程式の定点を学習するために,平均変数近似(MVSA)を提案する。
論文 参考訳(メタデータ) (2026-05-08T19:24:28Z) - Decentralized Proximal Stochastic Gradient Langevin Dynamics [4.385194124090593]
凸領域に制約された対数凹面確率分布からのサンプリングのための分散近位ランゲヴィンダイナミクス(DE-PSGLD)。
制約領域に対する最初の分散化アプローチとして、アルゴリズムは高速な後部濃度と高い予測精度を示す。
論文 参考訳(メタデータ) (2026-05-01T15:11:06Z) - Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs [55.77845440440496]
プッシュベースの分散通信は、情報交換が非対称である可能性のある通信ネットワークの最適化を可能にする。
我々は、グラディエント・プッシュ(SGP)アルゴリズムのための統一的な一様安定性フレームワークを開発する。
重要な技術的要素は、2つの量に束縛された不均衡認識の一般化である。
論文 参考訳(メタデータ) (2026-02-24T05:32:03Z) - Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation [46.48569176651487]
オフ・プライシ・データにおいても,ブートストラップ値推定の収束条件が弱くなることを証明する。
計算結果をトラジェクトリによる学習に拡張し、小さな修正を施した全てのタスクに対して収束が達成可能であることを示す。
論文 参考訳(メタデータ) (2024-05-31T17:36:16Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Beyond the Edge of Stability via Two-step Gradient Updates [49.03389279816152]
Gradient Descent(GD)は、現代の機械学習の強力な仕事場である。
GDが局所最小値を見つける能力は、リプシッツ勾配の損失に対してのみ保証される。
この研究は、2段階の勾配更新の分析を通じて、単純だが代表的でありながら、学習上の問題に焦点をあてる。
論文 参考訳(メタデータ) (2022-06-08T21:32:50Z) - On the Convergence of Stochastic Extragradient for Bilinear Games with
Restarted Iteration Averaging [96.13485146617322]
本稿では, ステップサイズが一定であるSEG法の解析を行い, 良好な収束をもたらす手法のバリエーションを示す。
平均化で拡張した場合、SEGはナッシュ平衡に確実に収束し、スケジュールされた再起動手順を組み込むことで、その速度が確実に加速されることを証明した。
論文 参考訳(メタデータ) (2021-06-30T17:51:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。