論文の概要: Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
- arxiv url: http://arxiv.org/abs/2609.35965v1
- Date: Mon, 28 Sep 2026 18:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.912707
- Title: Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
- Title(参考訳): マルチエージェント型視覚・言語ナビゲーション:定式化,ベンチマーク,方法
- Abstract要約: VLN(Vision-and-Language Navigation)は、単一の命令に従う単一のエージェントに重点を置いている。
多くの現実世界のアプリケーションは、ロボットのチームが、個々のエージェントの能力を超えたタスクに取り組む必要がある。
本稿では,制約付きコーディネーション問題として,マルチエージェントVLNの最初の体系的形式化を実現するための,マルチエージェント・ビジョン・ランゲージナビゲーションを提案する。
- 参考スコア(独自算出の注目度): 7.219635114837754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-and-Language Navigation (VLN) has largely focused on a single agent following a single instruction, yet many real-world applications require teams of robots to tackle tasks beyond the capabilities of any individual agent. We present Systematic Multi-Agent Vision-and-Language Navigation, providing, to our knowledge, the first systematic formalization of multi-agent VLN as a constrained coordination problem: each mission consists of subtasks carrying dependency and resource constraints (presence locks and holding chains). A verified four-stage crafting pipeline instantiates the task as MAVLN, comprising 11,724 episodes across 145 scenes with teams of up to four agents under three instruction regimes, accompanied by tailored constraint-aware metrics. We further present TRISS, a coordination-ready navigation system coupling an LLM-based subtask scheduler, a shared topological memory that turns each agent's exploration into team knowledge, and a conflict-aware execution mechanism that realizes simultaneous intentions as collision-free routes. Extensive experiments establish TRISS as a comprehensive baseline and reveal substantial room for improvement across scheduling, planning, and execution, highlighting the challenges of coordinating under MAVLN task constraints. Project page: https://xyz9911.github.io/mavln.
- Abstract(参考訳): VLN(Vision-and-Language Navigation)は、単一の命令に従う単一のエージェントに重点を置いているが、現実のアプリケーションの多くは、個々のエージェントの能力を超えたタスクに取り組むためにロボットのチームを必要とする。
本稿では, 制約付き協調問題として, マルチエージェントVLNを初めて体系的に定式化し, それぞれのミッションは, 依存とリソースの制約(プレゼンスロックと保持チェーン)を持つサブタスクから構成される。
検証された4段階のクラフトパイプラインは、タスクをMAVLNとしてインスタンス化し、145のシーンで11,724回、最大4人のエージェントが3つの命令体制の下で、調整された制約対応メトリクスを伴って実行された。
さらに, TRISS, LLMベースのサブタスクスケジューラと, 各エージェントの探索をチーム知識に変換する共有トポロジカルメモリと, 衝突のない経路として同時意図を実現するコンフリクト対応実行機構を結合した協調対応ナビゲーションシステムについて述べる。
大規模な実験は、TRISSを包括的なベースラインとして確立し、スケジューリング、計画、実行にまたがる改善の余地を明らかにし、MAVLNタスク制約の下でコーディネートすることの課題を強調している。
プロジェクトページ: https://xyz9911.github.io/mavln.com
関連論文リスト
- Benchmarking Open-Ended Multi-Agent Coordination in Language Agents [48.1363632826625]
Alemは、手続き的に生成されたコーディネーションタスク、ソフトな特殊化、コミュニケーション、制御可能なコーディネーションの難しさを、長い水平サバイバルの世界に埋め込む。
Craftaxライクなダイナミックス上に構築されたオープンなマルチエージェント協調のためのJAXベースのベンチマークである$alem$を紹介します。
論文 参考訳(メタデータ) (2026-06-06T21:13:43Z) - Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs [52.26652574704317]
大規模言語モデル(LLM)はますますチームにデプロイされているが、既存のコーディネーションアプローチは2つの極端な部分を占めることが多い。
本稿では,Language Agent Teams for Task Evolution (LATTE)を紹介した。
論文 参考訳(メタデータ) (2026-05-07T14:19:17Z) - CORAL: Scalable Multi-Task Robot Learning via LoRA Experts [49.759823970016974]
実世界のロボット工学におけるビジョン・ランゲージ・アクション(VLA)モデルは、コアマルチタスク学習の課題を露呈する。
タスク毎に個別の完全なチェックポイントを維持することは、しばしばストレージとデプロイメントの禁止である。
主にマルチタスク干渉を軽減するために設計されたバックボーンおよび非依存のフレームワークであるCORALを提案する。
論文 参考訳(メタデータ) (2026-03-10T07:28:41Z) - MA-CoNav: A Master-Slave Multi-Agent Framework with Hierarchical Collaboration and Dual-Level Reflection for Long-Horizon Embodied VLN [1.7508558850131373]
Vision-Language Navigation (VLN) は、ロボットが不慣れな環境で長距離ナビゲーションを行う能力を高めることを目的としている。
本稿では,マルチエージェント協調ナビゲーションフレームワークMA-CoNavを提案する。
論文 参考訳(メタデータ) (2026-03-03T14:16:02Z) - UV-M3TL: A Unified and Versatile Multimodal Multi-Task Learning Framework for Assistive Driving Perception [71.19234323863314]
運転者の行動、運転者の感情、車両の行動、交通状況を同時に認識する枠組みを提案する。
本フレームワークは,デュアルブランチ空間チャネルのマルチモーダル埋め込みと適応的特徴分離型マルチタスク損失の2つのコアコンポーネントを組み込んでいる。
提案手法をAIDEデータセット上で評価し,UV-M3TLが4つのタスクすべてにおいて最先端の性能を達成することを示す実験結果を得た。
論文 参考訳(メタデータ) (2026-02-02T03:35:24Z) - TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making [90.18833928208333]
Task-Preferenced Multi-Demand-Driven Navigation (TP-MDDN)は、複数のサブオンデマンドと明示的なタスク嗜好を含む長距離ナビゲーションのための新しいベンチマークである。
空間記憶のために,3次元点雲蓄積と2次元意味マッピングを組み合わせたMASMapを設計した。
本手法は,認識精度とナビゲーションの堅牢性の両方において,最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-11-21T13:12:13Z) - Verification-Aware Planning for Multi-Agent Systems [35.82875628010279]
We present VeriMAP, a framework for multi-agent collaboration with verification-aware planning。
プランナーはタスクを分解し、サブタスクの依存関係をモデル化し、プランナー定義のパス基準をエンコードする。
検証対応計画がマルチエージェントシステムにおける信頼性の高い協調と反復的改善を実現する方法を示す。
論文 参考訳(メタデータ) (2025-10-20T02:54:29Z) - Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation [12.753472502707153]
Minecraftにおけるマルチエージェント組織のための階層的自動組織ナビゲーションシステムを設計する。
Minecraft環境では、探索や探索を含む一連のナビゲーションタスクも設計しています。
私たちは、具体的AIの境界を押し進め、より人間的な組織構造へと移行する、具体的組織の開発を目指しています。
論文 参考訳(メタデータ) (2024-03-13T06:22:17Z) - Fast Inference and Transfer of Compositional Task Structures for
Few-shot Task Generalization [101.72755769194677]
本稿では,タスクがサブタスクグラフによって特徴づけられる,数発の強化学習問題として定式化する。
我々のマルチタスクサブタスクグラフ推論器(MTSGI)は、トレーニングタスクから、まず、サブタスクグラフの観点から、一般的なハイレベルなタスク構造を推測する。
提案手法は,2次元グリッドワールドおよび複雑なWebナビゲーション領域において,タスクの共通基盤構造を学習し,活用し,未知のタスクへの適応を高速化する。
論文 参考訳(メタデータ) (2022-05-25T10:44:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。