論文の概要: Multi-Agent Robotic Control with Onboard Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.07403v1
- Date: Wed, 08 Jul 2026 13:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.395867
- Title: Multi-Agent Robotic Control with Onboard Vision-Language Models
- Title(参考訳): 車載ビジョンランゲージモデルを用いたマルチエージェントロボット制御
- Abstract要約: ビジョン言語モデル(VLM)とビジョン言語アクション(VLA)モデルは、ロボット制御において有望であることを示している。
説明可能性、一般化、計算要求に関する重大な課題に直面している。
本稿では,ハードウェア上に特殊なエージェントを配置することで,これらの制約に対処するマルチエージェントシステム(MAS)アーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 38.78172334790013
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Language Models (VLMs) and Vision Language Action (VLA) models have shown promise in robotic control. Yet, they face significant challenges regarding explainability, generalization, and compute requirements. This paper presents a Multi-Agent System (MAS) architecture that addresses these limitations by deploying specialized agents on onboard hardware - eliminating dependence on external compute. The system controls a multi-purpose autonomous mobile manipulator in a simulated industrial warehouse, fulfilling five task categories: safety inspection, warehouse maintenance, warehouse search, package quality verification, and responding to human requests. Compact VLMs (3-20B parameters) are used throughout, with fine-tuning applied to improve package inspection accuracy. A novel "Megamind" orchestration agent mitigates context retention issues inherent to long-horizon planning with smaller models. The system was validated in a hardware-in-the-loop simulation using an AMD Ryzen(TM) AI mini PC. Results demonstrate that a fully onboard MAS architecture is a viable, cost-efficient alternative to cloud-dependent deployments, with strong potential for real-world transfer. The simulation environment has been released as open source under the Apache 2.0 licence.
- Abstract(参考訳): ビジョン言語モデル(VLM)とビジョン言語アクション(VLA)モデルは、ロボット制御において有望であることを示している。
しかし、説明可能性、一般化、計算要求に関する重大な課題に直面している。
本稿では,ハードウェア上に特別なエージェントを配置することで,これらの制約に対処するマルチエージェントシステム(MAS)アーキテクチャを提案する。
シミュレーションされた産業倉庫内の多目的自律移動マニピュレータを制御し、安全検査、倉庫保守、倉庫捜索、パッケージ品質検証、人的要求への対応の5つのタスクカテゴリを遂行する。
小型のVLM(3-20Bパラメータ)は、パッケージ検査精度を向上させるために微調整が適用されている。
新たな "Megamind" オーケストレーションエージェントは,より小さなモデルによる長期計画に固有のコンテキスト保持問題を緩和する。
このシステムはAMD Ryzen(TM) AIミニPCを用いたハードウェア・イン・ザ・ループシミュレーションで検証された。
結果として、完全にオンボードのMASアーキテクチャは、クラウドに依存したデプロイメントの代替として実現可能でコスト効率が高いことが示され、現実世界の移行の可能性が強い。
シミュレーション環境はApache 2.0ライセンスの下でオープンソースとしてリリースされた。
関連論文リスト
- Show-Harness: Just a VLM Agent Can Play Robots [53.80887083886227]
身体的視覚言語モデル(VLM)は世界に関する幅広い知性を示すが、この知性をロボット制御に翻訳することは依然として困難である。
本稿では,動作意図をリンクするコンパクトなセマンティックインターフェースを通じて,VLMがロボットを「プレイ」することを可能にする,身体的ハーネスであるShow-Harnessを紹介する。
GUMIはGUIベースのデモコレクションに同じセマンティックアクション空間を拡張し、人間やエージェントが特殊な遠隔操作ハードウェアを使わずにエボディメントをまたいでロボットを「プレイ」することができる。
論文 参考訳(メタデータ) (2026-09-09T17:53:38Z) - Decoupling the Declarative from the Procedural in Vision-Language-Action Models [65.22639791239932]
オブジェクト固有のデモから振る舞いをクローンするように訓練されたポリシーは、そのオブジェクトを超えて一般化されなければならない。
情報フローを再構成した新しいビジョン・ランゲージ・アクションモデルであるw$2$VLAを提案する。
最先端のVLAとは異なり、我々のモジュラーアプローチは知識表現の分離に成功している。
論文 参考訳(メタデータ) (2026-06-19T14:43:58Z) - PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs [4.022353603224729]
低レベルの制御から高レベルのミッション計画を切り離すPX4ベースのドローンのプランナー・エグゼクタエージェントを提案する。
大きな言語モデルはシングルパスタスクプランニングを実行し、実行は構造化されたROS 2ツールコールインターフェースによって処理される。
その結果,LLM制御に比べて説明可能性,制約強制性,LLM呼び出しの短縮性が向上した。
論文 参考訳(メタデータ) (2026-05-26T10:03:22Z) - GAMMS: Graph based Adversarial Multiagent Modeling Simulator [15.681127447904322]
GAMMS(Graph based Adrial Multiagent Modeling Simulator)は軽量かつスケーラブルなシミュレーションフレームワークである。
GAMMSはスケーラビリティ、使いやすさ、統合ファーストアーキテクチャ、高速な視覚化フィードバック、現実世界の接地という5つの目標を強調している。
都市道路網や通信システムといった複雑な領域の効率的なシミュレーションを可能にする。
論文 参考訳(メタデータ) (2026-02-04T22:38:51Z) - AgenticLab: A Real-World Robot Agent Platform that Can See, Think, and Act [27.922630781100864]
本稿では,モデルに依存しないロボットエージェントプラットフォームであるAgenticLabと,オープンワールド操作のためのベンチマークについて紹介する。
我々は、非構造環境における実ロボットタスクに最先端のVLMベースのエージェントをベンチマークする。
私たちのベンチマークでは、オフラインの視覚言語テストがキャプチャーに失敗するいくつかの障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-02-02T05:30:14Z) - OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis [70.39500621448383]
オープンワールドのモバイル操作タスクは、オープンエンドの命令や環境への一般化が必要なため、依然として課題である。
本稿では,多視点のシーンフレームとエージェント状態を維持した新しいマルチモーダルエージェントアーキテクチャを提案する。
我々は,グローバルなシーン理解,ロボットの状態追跡,マルチモーダルアクション生成を統一モデルで実現した,モバイルマニピュレータのための基礎モデルであるOWMM-VLMについて紹介する。
論文 参考訳(メタデータ) (2025-06-04T17:57:44Z) - General-Purpose Aerial Intelligent Agents Empowered by Large Language Models [9.603293922137965]
本稿では,オープンワールドタスク実行が可能な,初の航空知的エージェントを提案する。
私たちのハードウェアとソフトウェアの共同設計システムは、2つの基本的な制限に対処します。
本システムは,コミュニケーション制約のある環境におけるタスク計画とシーン理解の信頼性を示す。
論文 参考訳(メタデータ) (2025-03-11T11:13:58Z) - DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution [114.61347672265076]
実世界のロボットのためのMLLMの開発は、ロボットプラットフォームで利用可能な計算能力とメモリ容量が典型的に限られているため、難しい。
活性化MLLMのサイズを自動的に調整するロボットビジョンランゲージ・アクション・モデル(DeeR)の動的早期実行フレームワークを提案する。
DeeR は LLM の計算コストを 5.2-6.5x に削減し、GPU のメモリを 2-6x に削減した。
論文 参考訳(メタデータ) (2024-11-04T18:26:08Z) - BEHAVIOR Vision Suite: Customizable Dataset Generation via Simulation [57.40024206484446]
我々は、コンピュータビジョンモデルの体系的評価のために、完全にカスタマイズされた合成データを生成するためのツールと資産のセットであるBEHAVIOR Vision Suite(BVS)を紹介する。
BVSはシーンレベルで多数の調整可能なパラメータをサポートする。
アプリケーションシナリオを3つ紹介する。
論文 参考訳(メタデータ) (2024-05-15T17:57:56Z) - RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language
Models [4.4173427917548524]
MLLM(Multimodal Large Language Models)は、様々な下流タスクのための新しいバックボーンとして登場した。
我々は、ARMBenchチャレンジにおける視覚的認識タスクに対処するため、BEiT-3バックボーンを備えたRoboLLMフレームワークを紹介した。
論文 参考訳(メタデータ) (2023-10-16T09:30:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。