論文の概要: GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding
- arxiv url: http://arxiv.org/abs/2608.00518v1
- Date: Sat, 01 Aug 2026 08:28:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.73294
- Title: GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding
- Title(参考訳): GuideGround:3DビジュアルグラウンドのためのVLM誘導セマンティック理解と視点認識推論
- Authors: Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao,
- Abstract要約: 3Dビジュアルグラウンドは、自然言語クエリからターゲットオブジェクトを3Dシーンにローカライズすることを目的としている。
本稿では,タスク固有のグラウンドモデルを置き換えるのではなく,補完する VLM 誘導フレームワークである GuideGround を提案する。
- 参考スコア(独自算出の注目度): 11.915446160398625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D visual grounding aims to localize the target object in a 3D scene from a natural language query, requiring both fine-grained semantic understanding and viewpoint-dependent spatial reasoning. Existing methods typically formulate semantic understanding as an auxiliary closed-set object classification task and rely on multi-view feature aggregation for viewpoint reasoning, limiting semantic generalization and weakening viewpoint-specific evidence. We observe that vision-language models naturally provide complementary capabilities through open-vocabulary semantic understanding and global scene perception. Based on this insight, we propose GuideGround, a VLM-guided framework that complements rather than replaces task-specific grounding models by leveraging VLMs for semantic enhancement and viewpoint-specific hypothesis verification. Specifically, we replace auxiliary closed-set object classification with VLM-generated object semantic descriptions to enhance semantic understanding. Meanwhile, instead of directly aggregating multi-view representations, we preserve viewpoint-specific grounding hypotheses through per-view grounding and explicitly verify them using VLMs across candidate viewpoints. Extensive experiments on the ReferIt3D benchmark demonstrate that GuideGround consistently outperforms previous state-of-the-art methods. Comprehensive ablation studies further confirm the effectiveness of both the proposed semantic understanding and viewpoint reasoning strategies.
- Abstract(参考訳): 3Dビジュアルグラウンドティングは、自然言語クエリからターゲットオブジェクトを3Dシーンにローカライズすることを目的としており、微粒なセマンティック理解と視点に依存した空間推論の両方を必要とする。
既存の手法は、通常、セマンティック理解を補助的なクローズドセットオブジェクト分類タスクとして定式化し、視点推論、意味一般化の制限、視点固有の証拠の弱化に多視点特徴集約に依存している。
視覚言語モデルは,オープン語彙意味理解とグローバルシーン認識を通じて,自然に相補的な機能を提供する。
この知見に基づいて,VLM のセマンティックエンハンスメントと視点特異的仮説検証に VLM を活用することで,タスク固有の基盤モデルを置き換えるのではなく,補完的な VLM 誘導フレームワークである GuideGround を提案する。
具体的には、補助的なクローズドセットオブジェクト分類をVLM生成オブジェクト意味記述に置き換え、セマンティック理解を強化する。
一方、複数視点表現を直接集約するのではなく、視点ごとの接地仮説を保存し、候補視点をまたいだVLMを用いて明確に検証する。
ReferIt3Dベンチマークの大規模な実験では、GuideGroundが従来の最先端の手法を一貫して上回っていることが示されている。
包括的アブレーション研究は、提案した意味理解と視点推論戦略の有効性をさらに確認する。
関連論文リスト
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis [59.527737790821305]
本稿では,3次元シーングラフを用いてオープンな3次元理解を促進する関係認識フレームワークを提案する。
本手法は,物体関係の推測に視覚言語推論を活用することで,多視点観測からリレーショナルシーングラフを構築する。
ScanNetV2、ScanNet200、ScanNet$++$、Replicaの実験は、強力なパフォーマンスと一般化能力を示している。
論文 参考訳(メタデータ) (2026-07-06T17:29:49Z) - EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models [39.77362541405281]
EPIC-Benchは、大規模視覚言語モデル(VLM)の基盤ベンチマークである。
実環境におけるVLMの視覚知覚能力を体系的に評価する。
論文 参考訳(メタデータ) (2026-05-16T16:38:51Z) - VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection [12.835071167163607]
VirProは適応型マルチモーダル事前トレーニングパラダイムであり、様々な弱い教師付き単分子3D検出フレームワークにシームレスに統合することができる。
我々は、さまざまな学習可能なインスタンス条件のプロンプトを生成し、それらをAPB(Adaptive Prompt Bank)に格納する。
論文 参考訳(メタデータ) (2026-03-18T08:23:55Z) - Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation [52.605647992080485]
空間的推論は視覚的知覚から意味的理解へと視覚言語モデルを前進させる。
物体中心の青写真という認知概念を空間的推論に統合する。
我々の手法は既存の視覚言語モデルより一貫して優れている。
論文 参考訳(メタデータ) (2026-01-05T10:38:26Z) - Point What You Mean: Visually Grounded Instruction Policy [42.52502990975079]
Point-VLAは、言語命令を明示的な視覚的手がかりで拡張し、参照の曖昧さを解決するためのプラグアンドプレイポリシーである。
我々は,多種多様な実世界の参照タスクにおいてポイントVLAを評価し,テキストのみの命令VLAよりも一貫して強靭なパフォーマンスを観察する。
論文 参考訳(メタデータ) (2025-12-22T00:44:19Z) - A Multimodal Depth-Aware Method For Embodied Reference Understanding [56.30142869506262]
Embodied Reference Understandingでは、言語命令とポインティングキューの両方に基づいて、視覚的なシーンで対象のオブジェクトを識別する必要がある。
本稿では,データ拡張,深度マップのモダリティ,深度認識決定モジュールを共同で活用する新しいERUフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T14:32:21Z) - ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning [68.4209681278336]
Open-vocabulary 3D visual grounding and reasoningは、暗黙の言語記述に基づくシーン内のオブジェクトのローカライズを目的としている。
現在の方法は、3Dアノテーションとマスクの提案による微調整に大きく依存しているため、苦労している。
適応グルーピングのための階層型3次元特徴ガウス場を用いたLVLM誘導フレームワークであるReasonGrounderを提案する。
論文 参考訳(メタデータ) (2025-03-30T03:40:35Z) - Oh-A-DINO: Understanding and Enhancing Attribute-Level Information in Self-Supervised Object-Centric Representations [9.949149600332836]
自己教師付き視覚モデルとスロットベース表現はエッジ由来の幾何学の同定に優れるが、幾何学的でない表面レベルの手がかりを保存できない。
VAE正則化はコンパクトで不整合なオブジェクト中心の表現を強制し、これらの欠落した属性を復元する。
論文 参考訳(メタデータ) (2025-03-12T21:57:41Z) - VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion [35.34118012715217]
カメラベースの3Dセマンティックシーン補完(SSC)は、自律運転のための密集した幾何学的およびセマンティックな知覚を提供する。
既存の手法では、オブジェクト間の明示的なセマンティックモデリングが欠如しており、3Dセマンティックコンテキストに対する認識が制限されている。
VLScene: Vision-Language Guidance Distillation for Camera-based 3D Semantic Scene Completionを提案する。
論文 参考訳(メタデータ) (2025-03-08T13:40:52Z) - LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models [57.92316645992816]
空間的推論は人間の認知の基本的側面であり、三次元空間における物体の直感的な理解と操作を可能にする。
視覚言語モデル(VLM)のセマンティック知識を活用するフレームワークおよびシーンレイアウト表現であるLayoutVLMを紹介する。
本稿では,既存のシーンデータセットから抽出したシーンレイアウト表現を用いた微調整VLMによる推論性能の向上を実証する。
論文 参考訳(メタデータ) (2024-12-03T06:15:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。