論文の概要: Revisiting Action Factorization for Complex Action Spaces
- arxiv url: http://arxiv.org/abs/2606.26574v1
- Date: Thu, 25 Jun 2026 03:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.153804
- Title: Revisiting Action Factorization for Complex Action Spaces
- Title(参考訳): 複合行動空間における行動要因の再検討
- Authors: Timothy Flavin, Sandip Sen,
- Abstract要約: 本稿では、4つの軽量環境(Platform、Hybrid-LunarLander、Hybrid-Shoot、CoopPush)上の3つの作用空間(離散化、ハイブリッド化、連続化)にまたがる3種類のアルゴリズム(PPO、SAC、DQN)のそれぞれに対する分解方法の断面的研究について述べる。
分岐デュエルアーキテクチャは計算と性能のバランスを最も効果的に保ち、オート・レグレッシブ・アクションは全体の最高性能に達し、ネイティブな連続SACは離散的およびハイブリッドなアルゴリズムより優れており、どちらも計算コストが増大している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many real-world control problems involve hybrid discrete-continuous action spaces. For example, steering and signaling in autonomous driving, and aiming and firing in robotics or video-games. Despite real-world hybrid factorization and reinforcement learning framework support for complex action spaces (e.g., Gymnasium, PettingZoo, TorchRL, SeedRL, Mujoco, etc), the default environments within those frameworks often implement uniform action space configurations (LunarLander, Walker2D, Cheetah, SMAC, SUMO, Ant, Atari). Landmark hybrid-action benchmarks (RoboCup 2D HFO, SC2LE, Platform, CARLA, etc) are mostly heavyweight or archival implementations originating from papers which test one or a small number of competing factorization methods on one kind of control. This article provides a cross-sectional study of factorization methods [independent networks, shared encoder, VDN, QPLEX, Joint, Auto-Regressive] on each of three families of algorithms [PPO, SAC, DQN] across three action spaces [discretized, hybrid, continuous] over four lightweight environments [Platform, hybrid-LunarLander, Hybrid-Shoot, CoopPush]. Accounting for some invalid pairings such as joint-continuous, we are left with 220 configurations to analyze each method. We provide two new C++ parallel gymnasium and petting-zoo compliant environments [CoopPush, Hybrid-Shoot] to isolate particular challenges such as state-dependent inter-action dependence. Finally, we introduce VDN-PPO and PPO-MIX which use a branching critic to assign credit to multi-headed PPO. These variants out-perform all other tested PPO factorizations. Our results suggest that branching dueling architectures balance compute and performance most effectively, with Auto-Regressive actions reaching the highest performance overall and native continuous SAC outperforming discrete and hybrid algorithms, albiet both at increased computational cost.
- Abstract(参考訳): 多くの実世界の制御問題は、ハイブリッド離散連続作用空間を含む。
例えば、自動運転におけるステアリングとシグナリング、ロボット工学やビデオゲームにおける目標と発射などです。
複雑なアクション空間(例えば、Gymnasium、PettingZoo、TorchRL、SeedRL、Mujocoなど)に対する実世界のハイブリッドファクタ化と強化学習フレームワークのサポートにもかかわらず、これらのフレームワークのデフォルト環境は、統一されたアクション空間構成(LunarLander、Walker2D、Cheetah、SMAC、SUMO、Ant、Atari)を実装することが多い。
ランドマークハイブリッドアクションベンチマーク(RoboCup 2D HFO, SC2LE, Platform, CARLAなど)は、主に1つまたは少数の競合因数分解法を1種類の制御でテストする論文から派生した、ヘビー級またはアーカイバルな実装である。
本稿では、4つの軽量環境(Platform, hybrid-LunarLander, Hybrid-Shoot, CoopPush)上の3つのアクション空間(離散化、ハイブリッド化、連続化)にわたるアルゴリズムの3つのファミリー(PPO, SAC, DQN)について、因子化手法(独立ネットワーク, 共有エンコーダ, VDN, QPLEX, Joint, Auto-Regressive)を横断的に検討する。
関節連続性などの無効なペアリングを考慮に入れた上で,各手法を解析するための220の構成を留意する。
我々は2つの新しいC++並列体育館とペット動物園に準拠した環境(CoopPush、Hybrid-Shoot)を提供し、状態依存の相互依存のような特定の課題を分離する。
最後に,VDN-PPOとPPO-MIXを紹介する。
これらの変種は、他の全てのテストされたPPO分解より優れる。
その結果, 分岐デュエルアーキテクチャは計算と性能のバランスを最も効果的に保ち, オートレグレッシブ動作は全体のパフォーマンスが最も高く, ネイティブ連続SACは離散的およびハイブリッドなアルゴリズムよりも優れており, 計算コストが増大していることが示唆された。
関連論文リスト
- Rethinking Air-Ground Collaboration: A Progressive Cross-Task Benchmark and Socialized Learning Framework [12.881497228808078]
社会的共知覚(Socialized Co-Perception, SCP)は、航空的グローバルローカライゼーションからグラウンドターゲット・アソシエーション、アイデンティティ・アウェア・パーシングまで、段階的にコラボレーションを組織する。
SCPは3.73%の進化的増加と7.86%のダウンストリーム性能向上を実現している。
論文 参考訳(メタデータ) (2026-06-17T09:17:55Z) - Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space [2.4382430407654767]
本稿では、パラメータ化されたハイブリッドアクション空間を原則的に処理するTD3(Twin Delayed Deep Deterministic Policy Gradient)の拡張であるHybrid TD3を提案する。
我々は,ハイブリッド行動設定における過大評価バイアスの理論的解析を行い,双極的アーキテクチャの下での形式的境界を導出する。
本稿では、離散的な行動分布を極小化して、標準的なクリッピング最小化に等価なバイアス低減を実現する重み付きQ-ラーニングターゲットを提案する。
論文 参考訳(メタデータ) (2026-03-01T22:16:27Z) - Multi-Agent DRL for V2X Resource Allocation: Disentangling Challenges and Benchmarking Solutions [51.22818149833102]
マルチエージェント強化学習(MARL)は、車間通信(C-V2X)ネットワークにおける無線リソース割り当ての有望なアプローチとして登場した。
しかし、MARLに固有の多面的課題はしばしば絡み合っており、車載環境における個々の影響を理解することは困難である。
我々は, C-V2X RRA を, 複雑さが徐々に増大する多エージェント干渉ゲーム列として定式化し, このギャップを埋める。
論文 参考訳(メタデータ) (2026-02-18T14:46:56Z) - CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learning in Parameterized Action Space [9.192754462575218]
ハイブリッド行動空間問題を解決するために,textbfCooperative Hybrid Diffusion Policies (CHDP) フレームワークを提案する。
CHDPは、それぞれ離散的および連続的な拡散ポリシーを利用する2つの協調エージェントを採用している。
挑戦的なハイブリッドアクションベンチマークでは、CHDPは最先端の手法を最大19.3%の成功率で上回っている。
論文 参考訳(メタデータ) (2026-01-09T09:50:47Z) - UniMPR: A Unified Framework for Multimodal Place Recognition with Heterogeneous Sensor Configurations [14.975915291012983]
マルチモーダル位置認識のための統合フレームワークUniMPRを提案する。
訓練された1つのモデルのみを使用して、共通の知覚的モダリティの組み合わせにシームレスに適応することができる。
7つのデータセットの実験は、UniMPRが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-12-20T09:01:18Z) - QoS-Aware Hierarchical Reinforcement Learning for Joint Link Selection and Trajectory Optimization in SAGIN-Supported UAV Mobility Management [52.15690855486153]
宇宙空間統合ネットワーク (SAGIN) がユビキタスUAV接続を実現するための重要なアーキテクチャとして登場した。
本稿では,SAGINにおけるUAVモビリティ管理を制約付き多目的関節最適化問題として定式化する。
論文 参考訳(メタデータ) (2025-12-17T06:22:46Z) - Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive [58.0729162588429]
インタラクティブセグメンテーションは、ユーザプロンプトからターゲット領域をセグメンテーションすることで、アノテーション効率を向上させる。
現在のアプローチは重要なトレードオフに直面している。密度の高いメソッドは精度が向上するが、CPUデバイスでの処理が著しく遅くなる。
そこで我々は,高密度な処理における計算割り当てを最適化することで,この問題に対処するInter2Formerを提案する。
論文 参考訳(メタデータ) (2025-07-13T12:33:37Z) - Reinforcement learning with combinatorial actions for coupled restless bandits [62.89013331120493]
提案するSEQUOIAは,動作空間に対する長期報酬を直接最適化するRLアルゴリズムである。
我々は,複数介入,経路制約,二部間マッチング,容量制約という,制約を伴う4つの新しいレスレス・バンディット問題に対して,SEQUOIAを実証的に検証した。
論文 参考訳(メタデータ) (2025-03-01T21:25:21Z) - Benchmarking Smoothness and Reducing High-Frequency Oscillations in Continuous Control Policies [3.224364956163198]
強化学習(RL)ポリシは、特に現実世界のハードウェアにデプロイする場合、高周波の発振を引き起こす。
深部RLにおける高周波発振を緩和することを目的とした文献からの手法を同定し,分類し,比較する。
最適性能のハイブリッドは,他の手法よりも優れており,ベースラインよりも26.8%スムーズ性の向上が期待できる。
論文 参考訳(メタデータ) (2024-10-22T02:21:30Z) - Maximize to Explore: One Objective Function Fusing Estimation, Planning,
and Exploration [87.53543137162488]
我々はtextttMEX というオンライン強化学習(オンラインRL)フレームワークを提案する。
textttMEXは、自動的に探索エクスプロイトのバランスをとりながら、見積もりと計画コンポーネントを統合する。
様々な MuJoCo 環境では,ベースラインを安定的なマージンで上回り,十分な報酬を得られる。
論文 参考訳(メタデータ) (2023-05-29T17:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。