論文の概要: D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments
- arxiv url: http://arxiv.org/abs/2607.29009v1
- Date: Fri, 31 Jul 2026 04:20:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.589078
- Title: D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments
- Title(参考訳): D-VLC: 未知環境下での不均一なマルチロボットシステムのための分散ビジョンランゲージコラボレーション
- Authors: Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo zhu, Xin Zhou, Yuze Wu, Fei Gao,
- Abstract要約: マルチロボットシステムは、並列協調と補完機能によって複雑なタスク実行の効率を向上させることができる。
本稿では,分散非同期推論,軽量情報共有,機能意識の協調,統一されたアクションインターフェースを組み合わせたフレームワークを提案する。
様々なシナリオと複数のVLMにわたる実験では、成功率は70%を超え、完成までの時間は幾何学的なグリーディベースラインに比べて55.8%も短縮された。
- 参考スコア(独自算出の注目度): 10.393866368123946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-robot systems, particularly heterogeneous robot swarms, can improve the efficiency of complex task execution through parallel collaboration and complementary capabilities. However, conventional rule-based methods rely on predefined task models and specialized decision making programs, making it difficult to understand complex semantic instructions and coordinate heterogeneous robots. LLMs introduce strong language understanding and task reasoning capabilities, allowing multi-robot systems to interpret instructions, decompose tasks, and assign roles according to task semantics. VLMs further incorporate visual perception, enabling robots to reason about objects, regions, and spatial relationships in physical environments. Nevertheless, existing LLM/VLM based methods often depend on known maps, centralized and synchronized decision making, limiting their generalization to heterogeneous robots and unseen tasks. We therefore propose a framework that combines decentralized asynchronous reasoning, lightweight information sharing, capability aware collaboration, and a unified action interface, enabling general purpose VLMs to generate robot specific actions executed by learning free experts without task or robot specific training. Experiments across diverse scenarios and multiple VLMs show success rates above 70\%, with completion time reduced by up to 55.8\% relative to the geometric greedy baseline.
- Abstract(参考訳): マルチロボットシステム、特に異種ロボット群は、並列協調と補完機能によって複雑なタスク実行の効率を向上させることができる。
しかし、従来のルールベースの手法は、事前に定義されたタスクモデルと特別な意思決定プログラムに依存しており、複雑な意味的命令を理解し、異種ロボットを協調することは困難である。
LLMは強力な言語理解とタスク推論機能を導入し、マルチロボットシステムは命令を解釈し、タスクを分解し、タスクのセマンティクスに従って役割を割り当てる。
VLMはさらに視覚的知覚を取り入れており、ロボットは物理的環境における物体、領域、空間的関係を推論することができる。
それでも、既存のLLM/VLMベースの手法は、しばしば既知の地図、中央集権的かつ同期的な意思決定に依存し、その一般化を異種ロボットに限定し、目に見えないタスクに制限する。
そこで本研究では,分散非同期推論,軽量情報共有,機能意識協調,統合されたアクションインターフェースを組み合わせたフレームワークを提案する。
様々なシナリオと複数のVLMにわたる実験では、成功率は70\%を超え、完成までの時間は幾何学的なグリードベースラインと比較して55.8\%まで短縮された。
関連論文リスト
- DynaHMRC: Decentralized Heterogeneous Multi-Robot Collaboration for Dynamic Tasks with Large Language Models [22.32105733545791]
大規模言語モデル(LLM)は、よりリッチなタスク理解と適応性を備えたロボットを提供する。
この可能性にもかかわらず、いくつかの課題は未解決のままである。
本研究では,各ロボットが役割認識型LLMエージェントとして機能する分散フレームワークDynaHMRCを提案する。
論文 参考訳(メタデータ) (2026-06-12T18:41:30Z) - Heterogeneous Robot Collaboration in Unstructured Environments with Grounded Generative Intelligence [54.91177026001217]
大規模言語モデル(LLM)対応のチーム化手法は、よく構造化された既知の環境を前提とするのが一般的である。
異種ロボットチームにおけるLCMの推論能力を基盤として,これらの制約に対処するフレームワークであるSPINE-HTを提案する。
我々のフレームワークは、従来のLLM対応の不均一なチームリング手法と比較して、ほぼ2倍の成功率を達成する。
論文 参考訳(メタデータ) (2025-10-30T18:24:38Z) - RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation [90.81956345363355]
RoBridgeは、一般的なロボット操作のための階層的なインテリジェントアーキテクチャである。
大規模事前学習型視覚言語モデル(VLM)に基づくハイレベル認知プランナー(HCP)で構成されている。
強化学習の手続き的スキルを解き放ち、認知と実行のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2025-05-03T06:17:18Z) - EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents [33.77674812074215]
異種ロボット間の効果的な協調を実現するための新しいマルチエージェントフレームワークを提案する。
エージェントがロボットURDFファイルを理解し、ロボットキネマティクスツールを呼び出し、その物理能力の記述を生成する。
Habitat-MASベンチマークは、マルチエージェントフレームワークがエンボディメント認識推論を必要とするタスクをどのように処理するかを評価するように設計されている。
論文 参考訳(メタデータ) (2024-10-30T03:20:01Z) - COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models [49.24666980374751]
COHERENTは、異種マルチロボットシステムの協調のための新しいLCMベースのタスク計画フレームワークである。
提案-実行-フィードバック-調整機構は,個々のロボットに対して動作を分解・割り当てするように設計されている。
実験の結果,我々の研究は,成功率と実行効率の面で,従来の手法をはるかに上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2024-09-23T15:53:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。