論文の概要: Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
- arxiv url: http://arxiv.org/abs/2609.01404v1
- Date: Tue, 01 Sep 2026 15:27:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.797985
- Title: Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
- Title(参考訳): 汎用ビジョンランゲージ・アクションエージェントとしてのマルチモーダルLCMの評価:指揮・接近・追跡・探索
- Authors: Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim,
- Abstract要約: 小さなオープンモデルはしばしばフロンティアモデルよりも成功半径に確実に移動するが、到着時期を早めるか全く宣言しないかでエピソードを失う。
我々はMLLMが交換可能なコンポーネントであるアーキテクチャであるDroneCATS-Agentと、モデルを独立変数として扱うベンチマークであるDroneCATSを紹介する。
- 参考スコア(独自算出の注目度): 23.780648709989777
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) are strong perceivers of images and video. We ask how far that reach extends into acting: dropping an MLLM directly into a drone's control loop, with its entire action space declared solely in the prompt. Recent systems approach this setting but increasingly narrow the model's decision-making. We widen it back. We introduce DroneCATS-Agent, an architecture where the MLLM is a swappable component, and DroneCATS, a benchmark treating the model as the independent variable. Beyond merely flying toward a pixel, our agent entrusts the model to yaw and search, deliberate when unsure, and self-declare arrival---all without fine-tuning or function-calling schemas. Evaluating frontier and open models across four core capabilities---approaching a visible target, tracking a moving one, searching outside the initial view, and commanding a multi-drone fleet---reveals that even the simplest embodied settings are far from solved. Crucially, to identify what breaks first at the edge, our roster scales down to 2B parameters. The findings expose a stark paradox: it is not the flying that fails. Small open models often navigate into the success radius more reliably than frontier models, yet lose the episode by declaring arrival prematurely or not at all. Multi-drone commanding amplifies this divide, with small models failing by blindly copying a single coordinate across distinct views. Viewed as vision-language-action agents, the models' spatial perception holds up, but their action protocol does not. What separates a deployable edge model from a frontier model is not navigation, but the discipline to sustain a declared protocol and emit the correct terminating action. The open problem is closing this gap at onboard compute costs---yielding a fast model that plans persistently and knows exactly when it is done---and DroneCATS is built to measure that distance.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、画像やビデオの強力な知覚者である。
MLLMを直接ドローンの制御ループに落とし、アクション空間全体がプロンプトでのみ宣言される。
最近のシステムは、この設定にアプローチするが、モデルの意思決定をますます狭めている。
私たちはそれを広げた。
我々はMLLMが交換可能なコンポーネントであるアーキテクチャであるDroneCATS-Agentと、モデルを独立変数として扱うベンチマークであるDroneCATSを紹介する。
単にピクセルに向かって飛んでいるだけでなく、我々のエージェントはモデルにヨーとサーチ、不確実な場合には意図的に、そして自己宣言的な到着を、すべて微調整や関数呼び出しのスキーマなしで委任します。
4つのコア機能にわたるフロンティアとオープンモデルの評価 - 可視的ターゲットの承認、移動中のターゲットの追跡、初期ビューの外側の探索、マルチドローンフリートの指揮 - 最も単純な実施設定でさえ解決できないことの確認。
重要なのは、エッジで最初に何が壊れるかを特定するために、我々のロースターは2Bパラメータにスケールダウンすることです。
この発見は、星空のパラドックスを露呈している。
小さなオープンモデルはしばしばフロンティアモデルよりも成功半径に確実に移動するが、到着時期を早めるか全く宣言しないかでエピソードを失う。
マルチドローンのコマンドはこの分割を増幅し、小さなモデルは異なるビューに1つの座標を盲目的にコピーすることで失敗する。
視覚言語アクションエージェントと見なすと、モデルの空間的知覚は保たれるが、それらのアクションプロトコルは保持しない。
デプロイ可能なエッジモデルをフロンティアモデルから切り離すのはナビゲーションではなく、宣言されたプロトコルを保持し、正しい終了アクションを発行する規律である。
オープンな問題は、計算コストのこのギャップを埋めること — 永続的に計画し、いつ完了するかを正確に知る高速モデルを得る — であり、DroneCATSはその距離を測定するために構築されている。
関連論文リスト
- Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution [51.519325778407016]
世界モデルは、ロボットが未来を想像することを可能にするが、リアルタイム制御にこの能力を活用することは、表現のミスアライメントによってボトルネックとなる。
我々は、このギャップを埋める個別のワールドアクションモデルであるHydraを紹介します。
Hydraは、目標指向の計画において最先端の世界モデルよりも優れており、主要なリアクティブ基盤ポリシーのクローズドループ実行能力にマッチまたは超越している。
論文 参考訳(メタデータ) (2026-08-29T01:58:19Z) - Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos [62.42252327381627]
言語誘導型空中認識は、複雑な無人航空機(UAV)のシーンにおいて、ユーザ特定された小さなターゲットを理解することを目的としている。
実際のUAV配備では、UAVは飛行中に応答しなければならないため、そのような認識はオンラインストリーミング形式で実行され、フレームが順次到着し、モデルが将来のフレームにアクセスせずに相互に応答する。
データとメソッドの両方の観点から、小さなオブジェクトとストリーミングの課題に対処します。
論文 参考訳(メタデータ) (2026-07-22T07:45:50Z) - UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation [42.39025692205837]
ゼロショットオープン語彙ラストマイルナビゲーションのためのフレームワークであるUniLM-Navを提案する。
UniLM-Navは、ラストマイルナビゲーションをビューセレクション、タスク条件付きアベイランスグラウンド、基本目的推論に分解する。
OVMMベンチマークでUniLM-Navを評価し,従来の最先端手法であるMoToを3.13ポイント上回る性能を示した。
論文 参考訳(メタデータ) (2026-07-07T17:42:08Z) - World Action Models: A Survey [100.95337034529263]
ワールドアクションモデル(World Action Models, WAM)は、将来を予測できる予測モデルである。
近年のWAMは大規模なビデオ生成モデルを再利用しており、並列線はビデオ生成コアを持たない言語や視覚言語によるバックボーンに依存している。
この調査は、フィールドに共通の説明を与えます。まず、これらの境界を明確にし、2つの補完的な視点で既存の作業を整理します。
論文 参考訳(メタデータ) (2026-06-18T17:05:19Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs [4.022353603224729]
低レベルの制御から高レベルのミッション計画を切り離すPX4ベースのドローンのプランナー・エグゼクタエージェントを提案する。
大きな言語モデルはシングルパスタスクプランニングを実行し、実行は構造化されたROS 2ツールコールインターフェースによって処理される。
その結果,LLM制御に比べて説明可能性,制約強制性,LLM呼び出しの短縮性が向上した。
論文 参考訳(メタデータ) (2026-05-26T10:03:22Z) - WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents [18.115492558482995]
WildRoadBenchを紹介します。
視覚フィードバックモデルによる直接的な視覚的接地と、LCM駆動エージェントによる自律的な研究とエンジニアリングを結合する。
我々は、複数のフロンティアLPM駆動エージェントとともに、クローズドソースフロンティアモデルとオープンソースVLMの広範なプールをベンチマークする。
論文 参考訳(メタデータ) (2026-05-19T15:08:34Z) - ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation [53.95797153529148]
身体的エージェントは、主に部分的な自我中心の観測に依存するため、効率的なナビゲーションに苦しむことが多い。
本稿では,マルチモーダル大規模言語モデル(MLLM)と決定論的プランナを結合することにより,この理由に基づくパラダイムを運用する,人間にインスパイアされたフレームワークであるReasonNaviを紹介する。
論文 参考訳(メタデータ) (2026-01-26T19:09:20Z) - Sports-Traj: A Unified Trajectory Generation Model for Multi-Agent Movement in Sports [53.637837706712794]
任意の軌道をマスク入力として処理する統一軌道生成モデルUniTrajを提案する。
具体的には,空間特徴抽出のためのトランスフォーマーエンコーダ内に埋め込まれたゴースト空間マスキング(GSM)モジュールを紹介する。
バスケットボールU,サッカーU,サッカーUの3つの実践的スポーツデータセットをベンチマークして評価を行った。
論文 参考訳(メタデータ) (2024-05-27T22:15:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。