論文の概要: PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3
- arxiv url: http://arxiv.org/abs/2608.04905v1
- Date: Wed, 05 Aug 2026 14:33:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.96135
- Title: PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3
- Title(参考訳): PRIMAL3: 強化と模倣によるマルチエージェント学習によるパスフィニング - LaCAM3の活用
- Authors: Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps, Fangyuan Wang, Yuhong Cao, Jiankai Sun, Ge Sun, Mac Schwager, Guillaume Sartoretti,
- Abstract要約: PRIMAL3はマルチエージェントパスフィンディング(MAPF)のための超大規模フレームワーク
強化学習、トポロジ対応通信、LaCAM3誘導訓練、PIBTベースの行動改善を統合している。
実験により、PRIMAL3は最先端の学習ベースラインを大幅に上回っていることが示された。
- 参考スコア(独自算出の注目度): 19.66694371656982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present PRIMAL3, an ultra-large-scale learning-based framework for multi-agent pathfinding (MAPF) that integrates reinforcement learning, topology-aware communication, LaCAM3-guided training, and PIBT-based action refinement. PRIMAL3 targets failures at topologically critical states, where agents must coordinate decisively around bottlenecks, dead ends, and persistent conflicts. Each agent is represented using features derived from cut vertices, dead-end regions, shortest-path distances, and blocking estimates. Two complementary graphs capture agent interactions: a same-direction following graph propagates multihop context along compatible paths, while a different-direction conflict graph differentiates agents competing for shared space through masked attention and relative features. During training, we propose to let policy entropy identify uncertain agents, for which LaCAM3 provides confidence-triggered action interventions and label-smoothed imitation targets. During execution, a priority-aware PIBT module refines the proposed joint actions using persistent, learned, and distance-aware priorities together with policy-aware fallback preferences while maintaining collision-free execution. The resulting framework combines learned exploration with structured expert guidance without requiring LaCAM3 at inference. Experiments demonstrate that PRIMAL3 substantially outperforms state-of-the-art learning-based baselines and scales to ultra-large instances with up to city-level 100,000 agents. Real-world experiments further demonstrate the feasibility of deploying PRIMAL3 on physical robotic systems and ablation studies validate the individual contributions the components we proposed. Project page: https://marmotlab.github.io/PRIMAL3/
- Abstract(参考訳): PRIMAL3は、多エージェントパスフィニング(MAPF)のための超大規模学習ベースのフレームワークで、強化学習、トポロジ対応通信、LaCAM3誘導トレーニング、PIBTベースのアクションリファインメントを統合している。
PRIMAL3は、トポロジ上重要な状態の障害をターゲットとしており、エージェントはボトルネック、デッドエンド、永続的なコンフリクトに対して決定的に調整しなければならない。
各エージェントは、カットされた頂点、デッドエンド領域、最短パス距離、およびブロッキング推定から派生した特徴を用いて表現される。
2つの補完グラフはエージェントの相互作用を捉え、同じ方向のグラフは互換性のある経路に沿ってマルチホップコンテキストを伝播し、異なる方向の競合グラフはマスキングされた注意と相対的な特徴を通して共有空間を競合するエージェントを区別する。
トレーニング中,LaCAM3が信頼度の高い行動介入とラベルスムースな模倣ターゲットを提供する不確実なエージェントを,政策エントロピーで識別することを提案する。
実行中、優先度対応PIBTモジュールは、衝突のない実行を維持しながら、ポリシー対応のフォールバック設定とともに、永続的、学習的、距離対応の優先度を用いて、提案された共同動作を洗練する。
結果として得られたフレームワークは、学習した探索と構造化された専門家のガイダンスを組み合わせることで、推論にLaCAM3を必要としない。
実験により、PRIMAL3は最先端の学習ベースラインを大幅に上回り、都市レベルの10000のエージェントを持つ超大規模インスタンスにスケールすることが示された。
実世界の実験は、PRIMAL3を物理ロボットシステムに展開する可能性をさらに実証し、アブレーション研究により、提案したコンポーネントの個々の貢献を検証した。
プロジェクトページ: https://marmotlab.github.io/PRIMAL3/
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search [49.99459363244884]
提案手法は, 対向的プロンプトの発見を導くために, 実行トラジェクトリを利用するトラジェクトリ対応の進化探索手法であるT-MAPを提案する。
本手法は,安全ガードレールをバイパスするだけでなく,実際のツールインタラクションによる有害な目標を確実に実現するための攻撃の自動生成を可能にする。
論文 参考訳(メタデータ) (2026-03-21T12:33:34Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching [60.886768806064936]
Tool-Integrated Reasoningは、外部ツールのインタラクションと推論ステップをインターリーブすることで、大規模な言語モデルで複雑なタスクに対処することを可能にする。
既存の強化学習法は、結果や軌道レベルの報酬に依存し、軌道内のすべてのステップに一様の利点を割り当てる。
両部間マッチングに基づくターンレベルの報酬割当と二重レベルの優位性推定によるきめ細かい監視を実現するフレームワークであるMatchTIRを提案する。
論文 参考訳(メタデータ) (2026-01-15T18:59:23Z) - VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction [4.4382802228131455]
マルチエージェント軌道予測のための目標条件変換器 VISTA を提案する。
高密度のMADRASベンチマークでは、VISTAは最先端の精度を実現し、衝突は大幅に少ない。
これらの結果から, VISTAは社会的に適合し, 目標を意識し, 解釈可能な軌道を生成することがわかった。
論文 参考訳(メタデータ) (2025-11-13T11:17:01Z) - Robustifying 3D Perception via Least-Squares Graphs for Multi-Agent Object Tracking [43.11267507022928]
本稿では,3次元LiDARシーンにおける対向雑音に対する新たな緩和フレームワークを提案する。
我々は最小二乗グラフツールを用いて各検出の遠心点の位置誤差を低減する。
実世界のV2V4Realデータセットに関する広範な評価研究は、提案手法がシングルエージェントとマルチエージェントの両方のトラッキングフレームワークよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2025-07-07T08:41:08Z) - AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation [8.603450327406879]
AnchorDP3は、デュアルアームロボット操作のための拡散ポリシーフレームワークである。
大規模で手続き的に生成されたシミュレーションデータに基づいて訓練される。
RoboTwinベンチマークの平均成功率は98.7%に達する。
論文 参考訳(メタデータ) (2025-06-24T03:03:26Z) - USER: Unified Semantic Enhancement with Momentum Contrast for Image-Text
Retrieval [115.28586222748478]
Image-Text Retrieval (ITR) は、与えられたクエリに意味のあるターゲットインスタンスを、他のモダリティから検索することを目的としている。
既存のアプローチは通常、2つの大きな制限に悩まされる。
論文 参考訳(メタデータ) (2023-01-17T12:42:58Z) - Ret3D: Rethinking Object Relations for Efficient 3D Object Detection in
Driving Scenes [82.4186966781934]
Ret3Dと呼ばれるシンプルで効率的で効果的な2段階検出器を導入する。
Ret3Dの中核は、新しいフレーム内およびフレーム間関係モジュールの利用である。
無視できる余分なオーバーヘッドにより、Ret3Dは最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-08-18T03:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。