論文の概要: A Self-Evolving Default Action for Cooperative Tasks with Continuous Action Space
- arxiv url: http://arxiv.org/abs/2607.18597v2
- Date: Thu, 23 Jul 2026 08:21:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.738857
- Title: A Self-Evolving Default Action for Cooperative Tasks with Continuous Action Space
- Title(参考訳): 連続行動空間を有する協調作業に対する自己進化型デフォルトアクション
- Abstract要約: 継続的協調作業のための新しい枠組みであるSAFEを提案する。
それは、各エージェントの経験バッファからサンプリングされた自己進化のデフォルトアクションに条件付けられた反ファクトのベースラインを使用する。
協調車載作業の実験は、SAFEが常に最先端のモデルより優れていることを示した。
- 参考スコア(独自算出の注目度): 1.5229257192293202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Counterfactual credit assignment has proven effective in multi-agent reinforcement learning (MARL) for discrete action spaces, yet its extension to continuous-action cooperative tasks remains challenging. Existing methods that approximate the counterfactual baseline via Monte Carlo sampling often introduce bias into policy gradients and fail to guarantee convergence to local optima, as the sampled actions may not have been sufficiently trained. To address these limitations, we propose SAFE, a novel MARL framework that employs a counterfactual baseline conditioned on a self-evolving default action sampled from each agent's experience buffer. This design naturally extends to continuous action spaces without relying on additional simulations, reward models, or environment-specific prior knowledge. The baseline accurately quantifies each agent's contribution, and introduces no bias into the deterministic policy gradient, ensuring convergence to local optima. Extensive experiments on cooperative vehicular tasks demonstrate that SAFE consistently outperforms state-of-the-art models.
- Abstract(参考訳): 離散的な行動空間に対するマルチエージェント強化学習(MARL)において、対実的クレジット割り当てが有効であることが証明されているが、継続的な協調作業への拡張は依然として困難である。
モンテカルロサンプリングによるカウンターファクトのベースラインを近似する既存の手法は、しばしば政策勾配に偏りを導入し、サンプリングされたアクションが十分に訓練されていないため、局所最適への収束を保証するのに失敗する。
これらの制約に対処するため,各エージェントの体験バッファからサンプリングした自己進化的デフォルトアクションを前提とした,対実的ベースラインを用いた新しいMARLフレームワークであるSAFEを提案する。
この設計は、追加のシミュレーション、報酬モデル、環境固有の事前知識に頼ることなく、自然に連続的な行動空間に拡張する。
基準線は各エージェントの貢献を正確に定量化し、決定論的政策勾配に偏りを導入せず、局所最適への収束を保証する。
協調車両作業に関する大規模な実験は、SAFEが常に最先端のモデルより優れていることを示した。
関連論文リスト
- Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning [31.44259732617169]
我々は、多様性は報酬の不確実性に対する合理的な応答としてより自然に理解されていると論じる。
本稿では,スカラー報酬を報酬関数上の分布に置き換えることで,RL目標の根本的な再構成を提案する。
論文 参考訳(メタデータ) (2026-06-02T17:50:14Z) - Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning [57.10440766103372]
Trajectory Regularized Merging (TRM) は、拡張されたトラジェクトリ部分空間内の最適化プロセスとしてマージフェーズを再構成するフレームワークである。
本フレームワークは,タスクアライメント,予測整合性,勾配応答性といった3つの相乗的目標を統合し,統合モデルの履歴安定性と再活性化最適化のダイナミクスを同時に保存する。
論文 参考訳(メタデータ) (2026-05-08T14:07:32Z) - Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models [35.088440282359024]
行動基礎モデル(BFM)は、未知の報酬やタスクに適応する能力を持つエージェントを生成する。
これらの手法は、既存の状態特徴の範囲内にある報酬関数に対して、ほぼ最適にポリシーを作成できるのみである。
本稿では,ゼロショットRLに対して,最先端の複雑な表現学習手法に適合または超越可能なRLDP(Regularized Latent Dynamics Prediction)を提案する。
論文 参考訳(メタデータ) (2026-03-16T19:39:27Z) - Robust Optimization with Diffusion Models for Green Security [49.68562792424776]
グリーンセキュリティでは、効果的パトロールを計画するためには、密猟、違法伐採、違法漁などの敵の行動を予測する必要がある。
本稿では,その強い分布適合性を利用した逆挙動モデリングのための条件付き拡散モデルを提案する。
混合戦略の混合戦略を導入し, 正確なサンプリングを行うために, ツイスト型シークエンシャルモンテカルロ (SMC) サンプリング装置を用いる。
論文 参考訳(メタデータ) (2025-02-19T05:30:46Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Generative Slate Recommendation with Reinforcement Learning [49.75985313698214]
強化学習アルゴリズムは、レコメンデータシステムのユーザエンゲージメントを最適化するために使用することができる。
しかし、RLアプローチはスレートレコメンデーションシナリオでは難解である。
この設定では、アクションはアイテムの組み合わせを含むことができるスレートに対応する。
本研究では,変分オートエンコーダによって学習された連続低次元ラテント空間におけるスレートの符号化を提案する。
我々は、(i)以前の作業で要求される仮定を緩和し、(ii)完全なスレートをモデル化することで、アクション選択の品質を向上させることができる。
論文 参考訳(メタデータ) (2023-01-20T15:28:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。