論文の概要: Learning Multi-Agent Task Assignment and Navigation in the Factory: from Simulation to Real Robots
- arxiv url: http://arxiv.org/abs/2609.14567v1
- Date: Sun, 13 Sep 2026 14:53:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.854129
- Title: Learning Multi-Agent Task Assignment and Navigation in the Factory: from Simulation to Real Robots
- Title(参考訳): 工場におけるマルチエージェントタスク割り当てとナビゲーションの学習:シミュレーションから実ロボットへ
- Abstract要約: 強化学習(Reinforcement Learning, RL)はロボットによる意思決定に有望だが, 産業環境における物理的マルチロボットシステムへのマルチエージェントRL(MARL)の展開は依然として困難である。
本稿では,FMAPPO(Feature-fusion Multi-Agent Proximal Policy Optimization)を提案する。
- 参考スコア(独自算出の注目度): 5.3871099789895665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has shown considerable promise for robotic decision-making, yet deploying multi-agent RL (MARL) on physical multi-robot systems in industrial environments remains challenging. This paper investigates the real-world applicability of decentralized MARL for multi-robot multi-machine tending. We propose Feature-fusion Multi-Agent Proximal Policy Optimization (FMAPPO), which fuses 2D LiDAR measurements with task-specific state information to enable safe decentralized multi-robot task assignment and navigation. A complete simulation-to-reality pipeline was developed using high-fidelity robotic simulation and ROS2 and deployed on physical mobile-manipulator platforms operating under realistic real-world conditions, with the robotic arms disabled during the experiments. We further investigate the sensitivity of the learned policy to command update frequency, an important consideration for real-world deployment. Comparative evaluation in simulation demonstrated that FMAPPO significantly outperformed state-of-the-art baselines with a large effect size, achieving improvements of 106\% and 21\% in parts delivery and 48\% and 11\% in parts collection over MAPPO and SMAPPO, respectively. FMAPPO also increased machine utilization by 31 and 10 percentage points, respectively, while reducing collisions by 18\% and 15\% and increasing the safety score by 14 and 6 percentage points compared with MAPPO and SMAPPO, respectively. Furthermore, real-world experiments demonstrated that the learned decentralized policies can coordinate multiple robots to service multiple machines while maintaining safe operation under real-world sensing and control constraints. Videos of the real-world experiment are available online https://anonymouspapers123.github.io/FMAPPO/.
- Abstract(参考訳): 強化学習 (Reinforcement Learning, RL) はロボットによる意思決定に大いに期待されているが, 産業環境における物理的マルチロボットシステムへのマルチエージェント RL (MARL) の展開は依然として困難である。
本稿では,マルチロボット・マルチマシン・トレーディングにおける分散MARLの現実的適用性について検討する。
本稿では,FMAPPO(Feature-fusion Multi-Agent Proximal Policy Optimization)を提案する。
高忠実度ロボットシミュレーションとROS2を用いて完全なシミュレーション・トゥ・リアリティーパイプラインを開発し、実世界の現実的な条件下で動く物理移動マニピュレータプラットフォームに展開し、実験中にロボットアームを無効にした。
さらに、実世界の展開において重要な考慮事項である更新頻度を指令する学習ポリシーの感度について検討する。
シミュレーションによる評価の結果,FMAPPOは各部位の供給において106\%,21\%,48\%,SMAPPOよりも111\%向上した。
また, FMAPPOは, 衝突率を18%, 衝突率を18%, 安全率を14%, SMAPPOを6ポイント, 機械利用率を31ポイント, 機械利用率を10ポイント向上させた。
さらに、実世界の実験では、学習された分散化されたポリシーは、実世界のセンシングと制御の制約の下で安全な操作を維持しながら、複数のロボットを複数のマシンにサービスするように調整できることを示した。
実世界の実験のビデオはhttps://anonymouspapers123.github.io/FMAPPO/.comで公開されている。
関連論文リスト
- Bridging Language and Physics: Automated Design of Continuum Robots with Large Language Models [44.55124556245543]
LLMデザイナのための構造化フィードバックにシミュレータオブザーバ物理状態を変換することで閉ループを確立する多層フレームワーク AID-SR を提案する。
我々は,手を伸ばし,つかみ,移動し,操作する14のタスクのベンチマークにおいて,腱駆動型連続ロボットに対するアプローチを評価した。
AID-SRの3つの設計されたロボットを製作し、実世界でそのタスクを完了させた。
論文 参考訳(メタデータ) (2026-09-08T04:02:59Z) - HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone [19.886495773199023]
移動式UMIデータ生成システムであるHiFi-UMIについて述べる。
実ロボットに直接デプロイするHiFi-UMIの実証にのみ焦点を絞った、ゼロロボットのポストトレーニングを実証する。
我々はHiFi-UMI-2Kをオープンソースとして公開し、2000時間のマイクロ同期、超広汎FoVデモをロボット学習コミュニティの大規模かつ高忠実なリソースとして公開しました。
論文 参考訳(メタデータ) (2026-07-28T15:52:02Z) - Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning [56.240199425429445]
マルチロボットモーションプランニングでは、各ロボットが局所的な観測から衝突のない軌道を生成する必要がある。
既存のほとんどのプランナは、ローカル観測の静的スナップショットからトラジェクトリを生成する。
本稿では,制約対応拡散モデルに基づく分散フレームワークであるSimulation-Informed Diffusion (SID)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T21:17:53Z) - JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy [90.77129709149574]
JoyAI-RAは、汎用的なロボット操作に適した、視覚言語対応の基盤モデルである。
JoyAI-RAは、特に人間の操作とロボット制御の間において、具体化のギャップを埋める。
シミュレーションと実世界のベンチマークの両方で最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2026-04-22T01:51:48Z) - Hybrid Framework for Robotic Manipulation: Integrating Reinforcement Learning and Large Language Models [0.688204255655161]
本稿では,強化学習(RL)と大規模言語モデル(LLM)を組み合わせてロボット操作タスクを改善するハイブリッドフレームワークを提案する。
提案フレームワークは,ロボットシステムにおける低レベルの実行と高レベルの推論を効果的に結合する。
このフレームワークは、Franka Emika Pandaロボットアームを使用して、PyBulletベースのシミュレーション環境でテストされる。
論文 参考訳(メタデータ) (2026-03-31T17:19:34Z) - ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation [66.02142169323521]
Vision-Language-ActionモデルとWorld Modelは最近、汎用ロボットインテリジェンスのための有望なパラダイムとして登場した。
既存のベンチマークは、主にシミュレータ中心であり、制御性を提供するが、知覚ノイズによって引き起こされる現実のギャップを捉えることができない。
シミュレーションと実世界の実行を橋渡しする標準化された評価フレームワークであるManipArenaを紹介する。
論文 参考訳(メタデータ) (2026-03-30T15:06:41Z) - RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation [68.7948300643741]
ロボットの異常検出と介入をリアルタイムに監視するロボット・コンディションド・ノーマライゼーション・フロー(RC-NF)を提案する。
RC-NFは、正規化フロー内のタスク認識ロボットとオブジェクト状態の処理を分離する。
従来のロボットタスクの監視方法と比較して、あらゆる異常なタイプで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T10:14:37Z) - RoboRAN: A Unified Robotics Framework for Reinforcement Learning-Based Autonomous Navigation [15.548637925166986]
多様なロボットプラットフォームと運用環境にまたがって、RLベースのナビゲーションポリシーをトレーニング、評価、デプロイするためのマルチドメインフレームワークを提案する。
本研究は,(1)シームレスなロボットタスク交換性と再現可能なトレーニングパイプラインを実現するスケーラブルでモジュール化されたフレームワーク,(2)複数のロボットによる実世界実験を通じて実世界へのトランスファーを実証するsim-to-real,(3)Isaac Labがトレーニングしたポリシーを実際のロボットに展開する最初のオープンソースAPIのリリース,の4つの重要な貢献について述べる。
論文 参考訳(メタデータ) (2025-05-20T15:48:23Z) - RoboScript: Code Generation for Free-Form Manipulation Tasks across Real
and Simulation [77.41969287400977]
本稿では,コード生成を利用したデプロイ可能なロボット操作パイプラインのためのプラットフォームである textbfRobotScript を提案する。
自由形自然言語におけるロボット操作タスクのためのコード生成ベンチマークも提案する。
我々は,Franka と UR5 のロボットアームを含む,複数のロボットエボディメントにまたがるコード生成フレームワークの適応性を実証した。
論文 参考訳(メタデータ) (2024-02-22T15:12:00Z) - AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents [109.3804962220498]
AutoRTは、人間の監督を最小限に抑えて、完全に見えないシナリオで運用ロボットの展開をスケールアップするシステムである。
われわれはAutoRTが複数の建物にまたがる20以上のロボットに指示を提示し、遠隔操作と自律ロボットポリシーを通じて77万個の実ロボットエピソードを収集するデモを行った。
実験により,AutoRTが収集した「未使用データ」は極めて多種多様であり,AutoRTのLLMを使用することで,人間の好みに合わせることができるデータ収集ロボットの指示が可能であることを実証した。
論文 参考訳(メタデータ) (2024-01-23T18:45:54Z) - From Multi-agent to Multi-robot: A Scalable Training and Evaluation
Platform for Multi-robot Reinforcement Learning [12.74238738538799]
マルチエージェント強化学習(MARL)は、過去数十年間、学術や産業から広く注目を集めてきた。
これらの手法が実際のシナリオ、特にマルチロボットシステムでどのように機能するかは未だ分かっていない。
本稿では,マルチロボット強化学習(MRRL)のためのスケーラブルなエミュレーションプラットフォームSMARTを提案する。
論文 参考訳(メタデータ) (2022-06-20T06:36:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。