論文の概要: ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA
- arxiv url: http://arxiv.org/abs/2607.28442v1
- Date: Thu, 30 Jul 2026 16:14:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.654706
- Title: ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA
- Title(参考訳): ViewMind3D: Modular View-Aware Inference for Training-free 3D-QA
- Abstract要約: textbfViewMind3Dは、シーンを多視点で観察する3次元空間推論のための、完全にトレーニング不要でモジュラーなフレームワークである。
ViewMind3Dは,事前のトレーニング不要および微調整3D-LLMと比較して,競争性能が向上することを示す。
- 参考スコア(独自算出の注目度): 26.947027118604368
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in large language models (LLMs) and vision-language models (VLMs) have enabled new possibilities for 3D question answering (3D-QA), a key capability for embodied AI and robotic perception. However, most existing methods rely on 3D-specific training or fine-tuning with costly annotations, limiting their scalability and real-world applicability. We present \textbf{ViewMind3D}, a fully training-free and modular framework for 3D spatial reasoning over multi-view observations of a scene without requiring complete 3D reconstruction. The framework decomposes the 3D-QA task into four interpretable components: (1) question-driven multi-view selection, (2) guided visual grounding with language-conditioned object cues, (3) spatial context encoding via a bird's-eye-view (BEV) viewpoint indicator, and (4) structured answer generation through role-based reasoning. This design enables structured, robust, and interpretable reasoning without requiring model tuning. Experimental results on ScanQA and SQA3D show that ViewMind3D achieves competitive performance compared to prior training-free and fine-tuned 3D-LLMs. In particular, our method improves performance on spatially grounded question types, such as ``What'' questions in SQA3D, while maintaining strong overall accuracy (50.8\%) and achieving 73.4 CIDEr on ScanQA. These results demonstrate that effective 3D reasoning can be achieved through modular orchestration of general-purpose LLMs and VLMs for robotic perception in real-world environments.
- Abstract(参考訳): 大規模言語モデル(LLM)と視覚言語モデル(VLM)の最近の進歩は、AIとロボット知覚を具現化する重要な能力である3次元質問応答(3D-QA)の新たな可能性を可能にしている。
しかし、既存のほとんどのメソッドは3D特有のトレーニングや、コストのかかるアノテーションによる微調整に依存しており、スケーラビリティと実世界の適用性を制限している。
完全3次元再構成を必要とせず、シーンの多視点観察による3次元空間推論のための完全トレーニングフリーでモジュラーなフレームワークである \textbf{ViewMind3D} を提示する。
本フレームワークは,3D-QAタスクを,(1)質問駆動型多視点選択,(2)言語条件付きオブジェクトキューによる視覚的ガイド,(3)鳥眼視(BEV)視点指示による空間的コンテキスト符号化,(4)役割ベース推論による構造化された回答生成の4つの解釈可能なコンポーネントに分解する。
この設計は、モデルチューニングを必要とせず、構造化され、堅牢で、解釈可能な推論を可能にする。
ScanQA と SQA3D の実験結果から,ViewMind3D は事前のトレーニング不要および微調整3D-LLM と比較して,競争性能が向上することが示された。
具体的には,ScanQA 上での 73.4 CIDEr を高い総合精度 (50.8\%) を維持しながら,SQA3D における ``What''' 質問のような空間的根拠付き質問型の性能を向上させる。
これらの結果から,実環境におけるロボット認識のための汎用LLMとVLMのモジュール編成により,効果的な3次元推論が達成できることが示唆された。
関連論文リスト
- Do 3D Large Language Models Really Understand 3D Spatial Relationships? [80.64317885117704]
3次元大言語モデルは3次元世界、特に物体間の空間的関係を理解していると主張している。
テキストのみの質問応答ペア上での言語モデルの微調整は、3D入力を使わずにSQA3Dベンチマークでこれらの手法を相容・超越することができる。
本稿では,より厳密な評価ベンチマークであるReal-3DQAを紹介する。
論文 参考訳(メタデータ) (2026-03-06T16:04:34Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - Aligning Text, Images, and 3D Structure Token-by-Token [8.521599463802637]
構造化3次元シーンにおける自己回帰モデルの可能性について検討する。
言語,画像,3Dシーンを整合させる統一LLMフレームワークを提案する。
実世界の3Dオブジェクト認識タスクにおけるモデルの有効性を示す。
論文 参考訳(メタデータ) (2025-06-09T17:59:37Z) - 3D Question Answering via only 2D Vision-Language Models [87.41421075243103]
大規模視覚言語モデル(LVLM)は、多くの分野を進歩させた。
代表的な例として,3次元質問応答(3D-QA)を用いた3次元シーン理解タスクの活用について検討する。
具体的には、3Dポイントクラウドから2Dビューをサンプリングし、2Dモデルにフィードして、与えられた質問に答える。
我々は3D-QAのための重要かつ多様なビューを自動的に選択する新しいアプローチであるcdViewsを提案する。
論文 参考訳(メタデータ) (2025-05-28T09:04:39Z) - VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction [86.82819259860186]
本稿では,視覚言語モデル(VLM)のための統合フレームワークであるVLM-3Rについて紹介する。
VLM-3Rは、空間的理解を表す暗黙の3Dトークンを導出する幾何学エンコーダを用いて、モノクロビデオフレームを処理する。
論文 参考訳(メタデータ) (2025-05-26T17:56:30Z) - Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-Analysis [65.42684641776931]
3Dビジョン言語(3D-VL)ベンチマークは、3D-VLモデルの評価に不足している。
我々は3D-VLグラウンドとQAタスクのベンチマークであるBeacon3Dを提案する。
論文 参考訳(メタデータ) (2025-03-28T13:32:29Z) - 3D-Aware Visual Question Answering about Parts, Poses and Occlusions [20.83938624671415]
本稿では,視覚シーンの3次元構造に対して構成的推論を必要とする課題に焦点を当てた3次元認識型VQAの課題を紹介する。
本稿では、3D対応VQAモデルであるPO3D-VQAを提案する。このモデルでは、推論のための確率的ニューラルシンボルプログラム実行と、堅牢な視覚認識のためのオブジェクトの3D生成表現を備えたディープニューラルネットワークの2つの強力なアイデアをマージする。
実験の結果,PO3D-VQAは既存の手法よりも優れていたが,2D VQAベンチマークと比較すると大きな性能差がみられた。
論文 参考訳(メタデータ) (2023-10-27T06:15:30Z) - Multi-CLIP: Contrastive Vision-Language Pre-training for Question
Answering tasks in 3D Scenes [68.61199623705096]
一般的な言語知識と視覚概念を2次元画像から3次元シーン理解に適用するためのトレーニングモデルは、研究者が最近探求を始めたばかりの有望な方向である。
そこで本研究では,モデルによる3次元シーンポイントクラウド表現の学習を可能にする,新しい3次元事前学習手法であるMulti-CLIPを提案する。
論文 参考訳(メタデータ) (2023-06-04T11:08:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。