論文の概要: Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies
- arxiv url: http://arxiv.org/abs/2607.11005v1
- Date: Mon, 13 Jul 2026 02:10:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.300835
- Title: Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies
- Title(参考訳): 決定論的ポリシを用いた拡張平均場制御のためのアクタ・クリティカルラーニング
- Abstract要約: 本稿では,連続時間拡張平均場制御問題に対するモデルフリー強化学習フレームワークを開発した。
我々は、国家法を推し進めるために、国家の行動分布を直接誘導する決定論的フィードバックポリシーを採用する。
Cucker-Smaleコンセンサス制御と貿易クラウドによる最適清算実験は,提案手法の効率,安定性,堅牢性を示す。
- 参考スコア(独自算出の注目度): 11.230955775247997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper develops a model-free reinforcement learning framework for continuous--time extended mean field control problems, where both the dynamics and reward may depend on the joint distribution of states and controls. We adopt deterministic feedback policies, under which the state--action distribution is induced directly as a push--forward of the state law. This avoids optimization over stochastic kernels and bypasses key limitations of existing approaches in extended mean field settings. We first establish a model--free sensitivity formula for parameterized McKean--Vlasov dynamics and use it to derive a deterministic policy gradient formula expressed through an advantage--rate function on the Wasserstein space. We then refine this formula by introducing local value and advantage--rate representations that depend on the state, action, and joint state--action distribution, yielding a policy gradient that includes both action derivatives and measure--derivative terms with respect to the control distribution. These characterizations lead to a martingale--based learning principle and motivate a continuous--time deep deterministic policy gradient algorithm combining particle approximations, measure--dependent neural networks, temporal--difference learning, and exploration in either action or parameter space. Numerical experiments on stochastic Cucker--Smale consensus control and optimal liquidation with trade crowding demonstrate the efficiency, stability, and robustness of the proposed method, including problems with explicit dependence on the control distribution.
- Abstract(参考訳): 本稿では,状態-作用分布を直接状態法則のプッシュフォワードとして誘導する決定論的フィードバックポリシを採用する。これにより,拡張平均場設定における既存のアプローチの鍵となる制限を回避し,パラメータ化されたマッケイン・ヴラソフ力学のモデルフリー感度式を構築し,ワッセルシュタイン空間上の有利度関数で表される決定論的ポリシー勾配式を導出する。
そこで我々は, 状態, 行動, 共同状態-行動分布に依存する局所的な値と利得-レートの表現を導入し, 制御分布に関する行動微分と測度-導出項の両方を含む政策勾配を導出した。これらの特徴は, 粒子近似, 測度依存ニューラルネットワーク, 時間差学習, いずれかのアクションやパラメータ空間における探索を組み合わせた, 連続時間深層決定的政策勾配アルゴリズムの動機付けにつながる。 確率的クッカー-スモールのコンセンサス制御と, 貿易の集束による最適流動化に関する数値実験により, 提案手法の効率, 安定性, 堅牢性など, 制御分布の明示的な依存を含む問題を含む。
関連論文リスト
- Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy [51.31164293751206]
Q-Flowは、フローダイナミクスの決定論的性質を利用して、ポリシーによって引き起こされるフローに沿って遅延状態を明確に伝播するフレームワークである。
OGBenchスイートのオフライン学習環境でのQ-Flowの評価では,最先端のベースラインを平均10.6ポイント上回っている。
論文 参考訳(メタデータ) (2026-05-13T12:31:02Z) - An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows [10.996737071400004]
時間的不均一なジャンプ拡散ダイナミクスによる連続的な時間制御は、金融と経済の中心である。
エントロピー規則化制御問題やジャンプを伴うゲームに対して,メッシュフリーな解法として機能するアクタ批判フレームワークを提案する。
本稿では,時間不均一な線形四元数制御,メルトンポートフォリオ最適化,マルチエージェントポートフォリオゲームについて検証する。
論文 参考訳(メタデータ) (2026-04-07T03:49:08Z) - An Optimal Control Approach To Transformer Training [7.136933021609078]
重要な構造的制約を尊重するトランスフォーマートレーニングに対する厳密な最適制御理論アプローチを開発する。
確率測度に引き上げることによって、完全に観測されたマルコフ決定過程(MDP)が生成されることを示す。
トランスフォーマーを訓練するために,状態空間,確率測度,行動空間を定量化することにより,昇降型MDPの3次元量子化訓練手順を提案する。
論文 参考訳(メタデータ) (2026-03-10T12:17:48Z) - Model-free policy gradient for discrete-time mean-field control [1.1470070927586018]
本研究では,有限状態空間とコンパクトな行動空間を持つ平均場制御問題に対するモデル自由政策学習について検討する。
我々は,MFCのモデルフリーポリシー勾配アルゴリズムであるMF-REINFORCEを開発し,そのバイアスと平均二乗誤差に明確な定量的境界を確立する。
論文 参考訳(メタデータ) (2026-01-16T11:49:25Z) - Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes [59.27926064817273]
我々はC-PGと呼ばれる探索非依存のアルゴリズムを導入し,支配的仮定の下でのグローバルな最終点収束保証を享受する。
制約制御タスクにおいて,アクションベース(C-PGAE)とパラメータベース(C-PGPE)の両方を実証的に検証する。
論文 参考訳(メタデータ) (2025-06-06T10:29:05Z) - Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPs [82.34567890576423]
我々は,非漸近収束を伴う最適決定主義政策を求めるための決定主義的政策勾配原始双対法を開発した。
D-PGPDの一次-双対反復は、最適正則化原始-双対にサブ線形速度で収束することが証明された。
これは連続空間制約型MDPに対する決定論的ポリシー探索法を提案する最初の研究である。
論文 参考訳(メタデータ) (2024-08-19T14:11:04Z) - Sequential Representation Learning via Static-Dynamic Conditional Disentanglement [58.19137637859017]
本稿では,ビデオ中の時間非依存要因と時間変化要因を分離することに着目し,逐次的データ内での自己教師付き不整合表現学習について検討する。
本稿では,静的/動的変数間の因果関係を明示的に考慮し,それらの因子間の通常の独立性仮定を破る新しいモデルを提案する。
実験により、提案手法は、シーンのダイナミックスが内容に影響されるシナリオにおいて、従来の複雑な最先端技術よりも優れていることが示された。
論文 参考訳(メタデータ) (2024-08-10T17:04:39Z) - On the Sample Complexity and Metastability of Heavy-tailed Policy Search
in Continuous Control [47.71156648737803]
強化学習(Reinforcement learning)は、システムダイナミクスモデルなしで、時間をかけてインセンティブを順次明らかにする、インタラクティブな意思決定のためのフレームワークである。
定義された連鎖を特徴付け、テールインデックスのレヴィプロセスに関連するポリシーがより広いピークに収まることを識別する。
論文 参考訳(メタデータ) (2021-06-15T20:12:44Z) - Implicit Distributional Reinforcement Learning [61.166030238490634]
2つのディープジェネレータネットワーク(DGN)上に構築された暗黙の分布型アクター批判(IDAC)
半単純アクター (SIA) は、フレキシブルなポリシー分布を利用する。
我々は,代表的OpenAI Gym環境において,IDACが最先端のアルゴリズムより優れていることを観察する。
論文 参考訳(メタデータ) (2020-07-13T02:52:18Z) - Cautious Reinforcement Learning via Distributional Risk in the Dual
Domain [45.17200683056563]
マルコフ決定過程(MDP)によって定義される強化学習問題において,状態と行動空間が可算有限である場合のリスク感受性ポリシーの推定について検討する。
本稿では,強化学習の線形プログラミング(LP)の2つの目的に付加されるペナルティ関数として,新たなリスク定義を提案する。
論文 参考訳(メタデータ) (2020-02-27T23:18:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。