論文の概要: MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- arxiv url: http://arxiv.org/abs/2607.08970v1
- Date: Thu, 09 Jul 2026 22:22:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.749885
- Title: MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- Title(参考訳): MultiView-Bench: VLMにおける世界中心のマルチビュー統合のための診断ベンチマーク
- Authors: Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang,
- Abstract要約: VLMの最近のベンチマークは、単一の視点または限られた視点の知覚を主に評価し、視点をまたいだ観察を一貫性のある世界中心の(偏心的な)3Dメンタルモデルに統合するコア認知能力を未検証のまま残している。
我々は,総合的な3Dシーン理解のためのマルチビュー統合を評価するための診断ベンチマークであるMultiView-Benchを紹介する。
情報的視点を積極的に選択し、知覚し、多視点エビデンスを融合するマルチエージェントフレームワークであるViewNavigatorを提案する。
- 参考スコア(独自算出の注目度): 40.317798580235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent benchmarks for VLMs largely assess single- or limited-view perception, leaving untested the core cognitive ability to integrate observations across viewpoints into a coherent, world-centric (allocentric) 3D mental model. We introduce MultiView-Bench, a diagnostic benchmark expressly designed to evaluate multi-view integration for holistic 3D scene comprehension. Unlike existing datasets that focus on pixel-level mapping or camera-relative navigation, MultiView-Bench requires models to decouple object positioning from transient perspectives and ground them in a fixed global coordinate system. This capability serves as a prerequisite for VLMs before being deployed for downstream tasks such as mechanical part assembly. Our systematic evaluation of frontier VLMs reveals consistent failure modes: strong performance on 2D planar relations from a single image, but marked difficulty with 3D spatial relations and with aggregating information across views. We further identify biases in VLMs, such as struggles with unconventional axis directions and sensitivity to object colorways and texture variations. Acknowledging these limitations, we propose ViewNavigator, a multi-agent framework that actively selects informative viewpoints, perceives, and fuses multi-view evidence, improving diverse base models on MultiView-Bench even under a strict budget-matched comparison (and by 3-5x for the full agent).
- Abstract(参考訳): VLMの最近のベンチマークは、単一の視点または限られた視点の知覚を主に評価し、視点をまたいだ観察を一貫性のある世界中心の(偏心的な)3Dメンタルモデルに統合するコア認知能力を未検証のまま残している。
我々は,総合的な3Dシーン理解のためのマルチビュー統合を評価するための診断ベンチマークであるMultiView-Benchを紹介する。
ピクセルレベルのマッピングやカメラ相対ナビゲーションに重点を置く既存のデータセットとは異なり、MultiView-Benchでは、オブジェクトの位置を過渡的な視点から切り離し、固定されたグローバル座標系に配置するモデルが必要である。
この機能は、機械部品組み立てなどの下流タスクにデプロイする前に、VLMの前提条件として機能する。
一つの画像から2次元平面関係を強く評価するが、3次元空間関係では困難であり、視界をまたいだ情報の集約が困難である。
また,VLMの非伝統的な軸方向との闘いや,物体の色調やテクスチャの変化に対する感受性など,バイアスも同定する。
このような制約を認識し、情報的視点を積極的に選択し、知覚し、多視点エビデンスを融合するマルチエージェントフレームワークであるViewNavigatorを提案し、厳格な予算整合比較(およびフルエージェントの3~5倍)の下でも、マルチビューベンチの多様なベースモデルを改善する。
関連論文リスト
- CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark [77.29150285469736]
空間知能は、単一視点の知覚と理性を超えるためにマルチモーダルな大言語モデル(MLLM)を必要とする。
CrossView Suiteは、CrossViewSet、CrossViewBench、CrossViewerの3つの協調コンポーネントで開発しています。
提案手法は, 適応型空間領域トークンーザを備え, 微細なオブジェクト表現をキャプチャし, マルチビューオブジェクトを明示的にアライメントする。
論文 参考訳(メタデータ) (2026-05-18T16:31:31Z) - EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models [39.77362541405281]
EPIC-Benchは、大規模視覚言語モデル(VLM)の基盤ベンチマークである。
実環境におけるVLMの視覚知覚能力を体系的に評価する。
論文 参考訳(メタデータ) (2026-05-16T16:38:51Z) - Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis [38.10984626023432]
本稿では, 微調整を必要とせず, 濃密な視覚的特徴の質を直接的に調査する, コンテキスト内3Dシーン理解のための新しいベンチマークを提案する。
我々は8つの最先端基盤モデルをベンチマークし、DINOベースのエンコーダが大きな視点シフトで競争力を維持することを示す。
論文 参考訳(メタデータ) (2025-12-12T14:03:16Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering [106.96097136553105]
3次元質問回答(3D QA)では、テキストによって記述された位置の3Dシーンを理解し、周囲の環境を判断し、その状況下での質問に答える必要がある。
既存の手法は通常、純粋な3次元点雲からのグローバルなシーン認識に依存しており、マルチビュー画像からのリッチな局所テクスチャの詳細の重要性を見落としている。
本稿では,DSPNet(Dual-vision Scene Perception Network)を提案する。
論文 参考訳(メタデータ) (2025-03-05T05:13:53Z) - MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations [55.022519020409405]
本稿では,マルチモーダルな3Dシーンデータセットと階層型言語アノテーションを用いたベンチマーク,MMScanを構築した。
結果として得られたマルチモーダルな3Dデータセットは、109kオブジェクトと7.7kリージョン上の1.4Mメタアノテーション付きキャプションと、3Dビジュアルグラウンドと質問応答ベンチマークのための3.04M以上の多様なサンプルを含んでいる。
論文 参考訳(メタデータ) (2024-06-13T17:59:30Z) - ViewFormer: Exploring Spatiotemporal Modeling for Multi-View 3D Occupancy Perception via View-Guided Transformers [9.271932084757646]
3Dの占有は、前景と背景を物理的空間で区別することなく、全体のシーンをグリッドマップに表現する。
本稿では,効果的な多視点特徴集約のための学習優先視点アテンション機構を提案する。
既存の高品質データセットの上に構築されたベンチマークであるFlowOcc3Dを紹介します。
論文 参考訳(メタデータ) (2024-05-07T13:15:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。