論文の概要: AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- arxiv url: http://arxiv.org/abs/2606.28049v1
- Date: Fri, 26 Jun 2026 12:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.487046
- Title: AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- Title(参考訳): AirGroundBench:不均一な多視点共生下でのマルチモーダル大モデルにおける空間知能の探索
- Abstract要約: UAV-UGVコラボレーションにおける多視点空間インテリジェンス評価のための診断ベンチマークであるAirGroundBenchを提案する。
AirGroundBenchは、11の高忠実なシミュレート環境と1,021のシンクロナイズドエアグラウンド観測ペアで構成されている。
10のタスクタイプを4つの段階的に要求される機能ディメンションに分類する。
- 参考スコア(独自算出の注目度): 22.635145889984273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In recent years, multimodal large language models (MLLMs) have shown strong potential for embodied intelligence, yet their ability to maintain geometrically consistent spatial understanding across heterogeneous views remains under-evaluated. Existing benchmarks largely focus on single-agent, single-view perception, leaving a gap in the systematic assessment of collaborative air-ground settings, where multi-scale observations are complementary but introduce scale mismatch, asymmetric occlusion, and reference-frame inconsistencies. We present AirGroundBench, a diagnostic benchmark for evaluating multi-view spatial intelligence in heterogeneous UAV-UGV collaboration. AirGroundBench is built from 11 high-fidelity simulated environments with 1,021 synchronized air-ground observation pairs, yielding approximately 62,000 dual-view, four-option single-choice visual question answering instances and 115 closed-loop vision-language navigation episodes. It covers 10 task types organized into four progressively demanding capability dimensions: spatial perception, cross-view alignment, spatial transformation and reasoning, and embodied decision-making. To support geometry-grounded evaluation and analysis, we provide structured spatial annotations, including cross-view object identities and metric 2D and 3D bounding boxes. Evaluations of 13 representative MLLMs under UAV-only, UGV-only, and dual-view input settings reveal consistent bottlenecks: models perform relatively well on spatial perception but struggle with cross-view alignment and transformation-intensive reasoning, and these deficits propagate to sequential decision-making in vision-language navigation. Although dual-view inputs provide measurable gains over single-view variants, a persistent gap from human performance remains, highlighting geometric consistency as a key limitation of current embodied MLLMs.
- Abstract(参考訳): 近年,マルチモーダルな大言語モデル (MLLM) は知性を具現化するための強力な可能性を示しているが,不均質な視点をまたいで幾何学的に一貫した空間的理解を維持する能力はいまだ十分に評価されていない。
既存のベンチマークは、主にシングルエージェント、シングルビューの知覚に焦点を当てており、複数スケールの観測を補完するがスケールミスマッチ、非対称オクルージョン、参照フレームの不整合を導入し、協調的な地上設定の体系的な評価にギャップを残している。
異種UAV-UGVコラボレーションにおける多視点空間インテリジェンス評価のための診断ベンチマークであるAirGroundBenchを提案する。
AirGroundBenchは、11の高忠実なシミュレートされた環境と1,021の同期された地上観測ペアから構築され、約62,000の双対ビュー、4つの選択された単一選択の視覚的質問応答インスタンス、115の閉ループ視覚言語ナビゲーションエピソードを生成する。
10のタスクタイプを,空間知覚,クロスビューアライメント,空間変換と推論,具体的意思決定という,段階的に要求される4つの能力次元に分類した。
幾何学的評価と解析を支援するため,クロスビューオブジェクトのアイデンティティやメトリック2Dおよび3D境界ボックスなど,構造化された空間アノテーションを提供する。
UAVオンリー、UGVオンリー、デュアルビュー入力設定下での13の代表的なMLLMの評価は、空間的知覚において比較的よく機能するが、クロスビューアライメントと変換集約的推論に苦しむという一貫したボトルネックを明らかにし、これらの欠陥は視覚言語ナビゲーションにおけるシーケンシャルな意思決定へと伝播する。
デュアルビュー入力は、シングルビューのバリエーションよりも測定可能なゲインを提供するが、人間のパフォーマンスとの永続的なギャップは残っており、現在のMLLMの鍵となる制約として幾何的整合性を強調している。
関連論文リスト
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs [40.317798580235]
VLMの最近のベンチマークは、単一の視点または限られた視点の知覚を主に評価し、視点をまたいだ観察を一貫性のある世界中心の(偏心的な)3Dメンタルモデルに統合するコア認知能力を未検証のまま残している。
我々は,総合的な3Dシーン理解のためのマルチビュー統合を評価するための診断ベンチマークであるMultiView-Benchを紹介する。
情報的視点を積極的に選択し、知覚し、多視点エビデンスを融合するマルチエージェントフレームワークであるViewNavigatorを提案する。
論文 参考訳(メタデータ) (2026-07-09T22:22:42Z) - IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning [30.654858163397662]
I-Benchは,室内の3次元レイアウトをモデル化するために視覚言語モデルを必要とする評価スイートである。
I-BenchはCLEVRスタイルの単純な幾何学的プリミティブを超えて、画像空間の差が空間的推論のみを反映するようにしている。
論文 参考訳(メタデータ) (2026-07-03T22:04:42Z) - Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models [50.6415287154632]
Embodied3DBenchは3D環境における低レベル空間インテリジェンスをターゲットにしたロボット中心のベンチマークである。
ベンチマークは12のサブカテゴリにまたがり、21万以上の高品質な質問応答ペアを含んでいる。
論文 参考訳(メタデータ) (2026-05-27T20:28:56Z) - Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence [107.79496500634691]
LinkS$2$Benchは、ダイナミックUAV映像の1,022分を200km$2$の高解像度衛星画像とリンクする。
LMMを用いたパイプラインと厳密な人間のアノテーションを用いて17.9kの高品質な質問応答ペアを構築した。
評価は、人間のベースラインとはかなりの差を示し、正確なクロスビューのダイナミックアライメントを重要なボトルネックと特定する。
論文 参考訳(メタデータ) (2026-04-02T13:22:57Z) - VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations [47.94531550391802]
多視点視覚推論は、スパースと離散的な視点から複雑な環境を理解する必要があるインテリジェントシステムにとって不可欠である。
現実のシナリオでは、ビュー間の推論は、明示的なガイダンスなしで部分的な観察を統合する必要がある。
我々は物理基底シミュレーションを利用して、ビュー毎の正確なメタデータを持つ多種多様な高忠実な3Dシーンを構築する。
論文 参考訳(メタデータ) (2026-03-17T13:36:30Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - SpatialViz-Bench: An MLLM Benchmark for Spatial Visualization [44.427830927596204]
SpaceViz-Benchは4つのサブ能力にまたがる12のタスクを持つ空間視覚化のための総合的なベンチマークである。
33種類の最先端MLLMを評価した結果,多彩な性能の変動がみられ,反直感的な結果が得られた。
論文 参考訳(メタデータ) (2025-07-10T10:27:20Z) - InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models [59.7084864920244]
InternSpatialは視覚言語モデル(VLM)における空間推論のための最大のオープンソースデータセットである
InternSpatialは、シングルビューとマルチビューの両方にまたがる1200万のQAペアで構成されている。
InternSpatial-Benchは、多様な命令形式で空間的理解を評価するために設計された評価ベンチマークである。
論文 参考訳(メタデータ) (2025-06-23T08:17:22Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。