論文の概要: IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control
- arxiv url: http://arxiv.org/abs/2606.26575v1
- Date: Thu, 25 Jun 2026 03:49:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.154176
- Title: IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control
- Title(参考訳): IDEA:マルチエージェント制御におけるSim-to-Real転送のためのエフェクトアライメントによる動的ミスマッチの非感性
- Abstract要約: 本研究では,マルチエージェント制御のためのsim-to-real法を提案する。
提案手法は,ランダムな環境構造と閉ループ制御による個別の意味行動を組み合わせることで,政策学習をセマンティック・抽象化のレベルに引き上げる。
- 参考スコア(独自算出の注目度): 9.294981970003892
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Complex multi-agent control tasks remain challenging for traditional rule-based and model-based approaches, motivating the adoption of learning-based methods. However, learning-based methods often struggle with sim-to-real transfer because they rely on accurate dynamics modeling or system identification and learn policies in low-level control spaces that are highly sensitive to dynamics mismatch, making them costly and fragile in complex environments. To address this issue, we propose a sim-to-real method for multi-agent control, which is insensitive to dynamics mismatch via effect alignment. Our method combines random environmental structure with discrete semantic actions through closed-loop control, elevating policy learning to a semantic abstraction level. Additionally, we develop an action synchronization mechanism that mitigates inter-agent action timing mismatches, thereby enhancing the temporal consistency of the system. Experiments on four multi-agent navigation tasks demonstrate that our method substantially improves training efficiency over mainstream transfer methods and achieves higher success rates in real-world scenarios, thereby improving the robustness and deployment stability of multi-agent systems under dynamics mismatch.
- Abstract(参考訳): 複雑なマルチエージェント制御タスクは、従来のルールベースおよびモデルベースアプローチでは依然として困難であり、学習ベースの手法の採用を動機付けている。
しかし、学習ベースの手法は、正確な動的モデリングやシステム識別に依存し、ダイナミックスミスマッチに非常に敏感な低レベルの制御空間でポリシーを学ぶため、複雑な環境でコストがかかり、壊れやすいため、シム・トゥ・リアル・トランスファーに苦慮することが多い。
この問題に対処するために,マルチエージェント制御のためのsim-to-real法を提案する。
提案手法は,ランダムな環境構造と閉ループ制御による個別の意味行動を組み合わせることで,政策学習をセマンティック・抽象化のレベルに引き上げる。
さらに、エージェント間動作タイミングのミスマッチを軽減し、システムの時間的一貫性を高めるアクション同期機構を開発する。
4つのマルチエージェントナビゲーションタスクの実験により、本手法は主流転送方式よりもトレーニング効率を大幅に向上し、実世界のシナリオにおいて高い成功率を達成し、動的ミスマッチ下でのマルチエージェントシステムの堅牢性とデプロイメント安定性を向上することを示した。
関連論文リスト
- Topology-Driven Anti-Entanglement Control for Soft Robots [3.223232489699093]
本稿では,トポロジ駆動型マルチエージェント強化学習(TD-MARL)フレームワークを提案する。
具体的には、クリティカルネットワークは集中型学習を採用しており、各知能体は他の知能体の戦略を知覚することができる。
統合トポロジカルセキュリティ層は、トポロジカル不変量を用いて、戦略が局所的な困難に陥るのを避けるために、絡み合いのリスクを正確に評価し軽減する。
論文 参考訳(メタデータ) (2026-05-01T06:08:44Z) - A Hierarchical Hybrid AI Approach: Integrating Deep Reinforcement Learning and Scripted Agents in Combat Simulations [0.0]
本稿では,スクリプトエージェントの信頼性と予測性をRLの動的適応学習能力と相乗化する,階層型ハイブリッド人工知能(AI)アプローチを提案する。
提案手法は,AIシステムを階層的に構築することにより,日常的かつ戦術的な意思決定にスクリプトエージェント,高レベルの戦略的意思決定にRLエージェントを活用することを目的としている。
論文 参考訳(メタデータ) (2025-11-28T23:50:29Z) - Grounded Test-Time Adaptation for LLM Agents [75.62784644919803]
大規模言語モデル(LLM)ベースのエージェントは、新規で複雑な環境への一般化に苦慮している。
環境特化情報を活用することで, LLMエージェントを適応するための2つの戦略を提案する。
論文 参考訳(メタデータ) (2025-11-06T22:24:35Z) - Multi-Modal Manipulation via Multi-Modal Policy Consensus [62.49978559936122]
本稿では,ロボット操作のための多様な感覚モダリティを統合するための新しいアプローチを提案する。
提案手法は,それぞれが単一の表現に特化している拡散モデルの集合にポリシーを分解する。
我々は、RLBenchにおけるシミュレーション操作タスクと、隠蔽対象のピック、手作業のスプーン再配向、パズル挿入といった実世界のタスクについて評価した。
論文 参考訳(メタデータ) (2025-09-27T19:43:04Z) - Learning to Move in Rhythm: Task-Conditioned Motion Policies with Orbital Stability Guarantees [45.137864140049814]
我々は,学習した微分型エンコーダと超臨界ホップ分岐を結合したフレームワークであるOrbitally Stable Motion Primitives (OSMPs)を紹介する。
提案手法は,多種多様なロボットプラットフォームにまたがる広範囲なシミュレーションと実世界の実験によって検証される。
論文 参考訳(メタデータ) (2025-07-12T17:10:03Z) - Dynamic Manipulation of Deformable Objects in 3D: Simulation, Benchmark and Learning Strategy [88.8665000676562]
従来の手法は、しばしば問題を低速または2D設定に単純化し、現実の3Dタスクに適用性を制限する。
データ不足を軽減するため、新しいシミュレーションフレームワークと、低次ダイナミクスに基づくベンチマークを導入する。
本研究では,シミュレーション前トレーニングと物理インフォームドテスト時間適応を統合するフレームワークであるDynamics Informed Diffusion Policy (DIDP)を提案する。
論文 参考訳(メタデータ) (2025-05-23T03:28:25Z) - An Adaptive Fuzzy Reinforcement Learning Cooperative Approach for the
Autonomous Control of Flock Systems [4.961066282705832]
この研究は、群集システムの自律制御に適応的な分散ロバスト性技術を導入している。
比較的柔軟な構造は、様々な目的を同時に狙うオンラインファジィ強化学習スキームに基づいている。
動的障害に直面した場合のレジリエンスに加えて、アルゴリズムはフィードバック信号としてエージェントの位置以上のものを必要としない。
論文 参考訳(メタデータ) (2023-03-17T13:07:35Z) - Safe Multi-agent Learning via Trapping Regions [89.24858306636816]
我々は、動的システムの定性理論から知られているトラップ領域の概念を適用し、分散学習のための共同戦略空間に安全セットを作成する。
本稿では,既知の学習力学を持つシステムにおいて,候補がトラップ領域を形成することを検証するための二分分割アルゴリズムと,学習力学が未知のシナリオに対するサンプリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-02-27T14:47:52Z) - Active Learning of Discrete-Time Dynamics for Uncertainty-Aware Model Predictive Control [46.81433026280051]
本稿では,非線形ロボットシステムの力学を積極的にモデル化する自己教師型学習手法を提案する。
我々のアプローチは、目に見えない飛行条件に一貫して適応することで、高いレジリエンスと一般化能力を示す。
論文 参考訳(メタデータ) (2022-10-23T00:45:05Z) - Learning Robust Policy against Disturbance in Transition Dynamics via
State-Conservative Policy Optimization [63.75188254377202]
深層強化学習アルゴリズムは、ソースとターゲット環境の相違により、現実世界のタスクでは不十分な処理を行うことができる。
本研究では,前もって乱れをモデル化せずにロバストなポリシーを学習するための,モデルフリーなアクター批判アルゴリズムを提案する。
いくつかのロボット制御タスクの実験では、SCPOは遷移力学の乱れに対する堅牢なポリシーを学習している。
論文 参考訳(メタデータ) (2021-12-20T13:13:05Z) - Efficient Model-Based Multi-Agent Mean-Field Reinforcement Learning [89.31889875864599]
マルチエージェントシステムにおける学習に有効なモデルベース強化学習アルゴリズムを提案する。
我々の理論的な貢献は、MFCのモデルベース強化学習における最初の一般的な後悔の限界である。
コア最適化問題の実用的なパラメトリゼーションを提供する。
論文 参考訳(メタデータ) (2021-07-08T18:01:02Z) - MAPPER: Multi-Agent Path Planning with Evolutionary Reinforcement
Learning in Mixed Dynamic Environments [30.407700996710023]
本稿では,進化的強化学習法(MAPPER)を用いた分散部分観測可能なマルチエージェントパス計画を提案する。
我々は、長距離ナビゲーションタスクを、グローバルプランナーの指導の下で、より簡単なサブタスクに分解する。
提案手法は,イメージベース表現を用いて動的障害物の挙動をモデル化し,均質性の仮定を伴わない混合動的環境におけるポリシーを訓練する。
論文 参考訳(メタデータ) (2020-07-30T20:14:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。