論文の概要: Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs
- arxiv url: http://arxiv.org/abs/2610.05417v1
- Date: Sun, 04 Oct 2026 17:58:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:53:04.620101
- Title: Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs
- Title(参考訳): Render to Reason: VLMにおける空間的理解を改善する新しい視点のセマンティック予測
- Abstract要約: 最近の研究は、幾何学的信号が空間的推論を促進することを期待して、事前訓練された3次元モデルから幾何学的特徴を持つ視覚言語モデルを強化している。
幾何学的特徴と標準的な空間的QAの訓練を単純に融合させることで、高レベルマルチホップタスクの限界改善しか得られないことがわかった。
本研究では,非観測視点のセマンティックレイアウトを予測するためにモデルを必要とする補助訓練タスクとして,textbfnovelviewセマンティックレンダリングを提案する。
- 参考スコア(独自算出の注目度): 34.812828115660174
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent works augment Vision-Language Models with geometry features from pretrained 3D models, expecting that the geometric signal will boost spatial reasoning. However, we find that simply fusing geometry features and training on standard spatial QA yields only marginal improvements on high-level multi-hop tasks. We attribute this gap to a training-signal problem: standard spatial QA can be largely answered from visual features and language priors, so the geometry pathway receives weak gradients and fails to integrate with the visual features. To provide a training signal that requires geometry, we propose \textbf{novel-view semantic rendering} as an auxiliary training task that requires the model to predict the semantic layout of an unobserved viewpoint, inspired by humans' ability to mentally simulate novel viewpoints during spatial reasoning. This task encourages joint use of both pathways: geometry provides pose-dependent visibility, while vision provides semantic content. Our auxiliary task yields consistent improvements over the geometry-augmented baseline across all three benchmarks (up to +1.6 on VSI-Bench, +2.2 on ReVSI, +2.9 on our 3D-Point-QA dataset) and our full model surpasses prior open-source methods on VSI-Bench and on ReVSI. Project page: https://yuqunw.github.io/Render2Reason/.
- Abstract(参考訳): 最近の研究は、幾何学的信号が空間的推論を促進することを期待して、事前訓練された3次元モデルから幾何学的特徴を持つ視覚言語モデルを強化している。
しかし、幾何学的特徴の融合と標準的な空間的QAの訓練によって、高レベルマルチホップタスクの限界改善しか得られないことがわかった。
標準的な空間QAは、視覚的特徴や言語先行から大きく答えられるので、幾何学経路は弱い勾配を受け取り、視覚的特徴と統合できない。
空間的推論における新たな視点を精神的にシミュレートする能力にインスパイアされた、観測されていない視点のセマンティックなレイアウトを予測するためのモデルを必要とする補助的な訓練課題として、幾何学を必要とする訓練信号を提案する。
幾何学はポーズ依存の可視性を提供し、視覚は意味のある内容を提供する。
我々の補助的タスクは3つのベンチマーク(VSI-Benchの+1.6、ReVSIの+2.2、我々の3D-Point-QAデータセットの+2.9)にまたがって、幾何拡張ベースラインに対して一貫した改善をもたらす。
プロジェクトページ:https://yuqunw.github.io/Render2Reason/。
関連論文リスト
- Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning [24.251128353444713]
VLM(Vision-Language Models)は、しばしば堅牢な3次元空間推論に苦しむ。
GASP(Geometric Aware Spatial Priors)は,LLMのトランスフォーマー層に直接,基本的な幾何学的事前を注入するフレームワークである。
GASPは、すべての層にまたがる深い監視信号として応用された小さな対応ヘッドを使用し、地上の映像シーンを活用する2つの目的で訓練されている。
論文 参考訳(メタデータ) (2026-05-28T17:00:52Z) - Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation [75.85672467847631]
本稿では,3次元のコンパクトな特徴表現であるGeometry-Aware BEV (GA-BEV)を紹介する。
視覚的特徴を3次元空間に投影することで,RGB-D入力からBEV空間マップを構築する。
我々は,BEV空間に事前訓練された3Dファンデーションモデルの特徴を取り入れ,大規模3D再構築作業から学んだ構造的先行を注入する。
論文 参考訳(メタデータ) (2026-05-21T06:20:17Z) - First Shape, Then Meaning: Efficient Geometry and Semantics Learning for Indoor Reconstruction [23.174056594526494]
FSTMは2段階のプロセスを通して幾何学と意味学を学習するための統一的なアプローチである。
合成および実世界の屋内データセットを用いた実験により,本手法がマルチSDF手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-05-05T07:50:36Z) - XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments [26.90783926543698]
クラウドパイプラインは、幾何学的推論やドメインセマンティクスに欠ける汎用視覚言語モデル(VLM)に依存している。
我々は,本質的な3次元幾何学的認識を伴うVLMを実現するクラウドサイド基盤モデルであるXEmbodiedを提案する。
XEmbodiedは18の公開ベンチマークで堅牢なパフォーマンスを示しながら、一般的な能力を保っている。
論文 参考訳(メタデータ) (2026-04-20T16:37:16Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - Make Geometry Matter for Spatial Reasoning [62.61667611352403]
視覚言語モデル(VLM)は、強いイメージと映像理解を実現するが、静的シーンとダイナミックビデオの両方で空間的推論を行う能力は限られている。
近年の進歩は、事前訓練された3次元基礎モデルから幾何学トークンをVLMに注入することで、この制限に対処しようとしている。
我々は、VLMが幾何トークンで積極的に推論するように促すことにより、幾何学的問題を作るためのフレームワークGeoSRを提案する。
論文 参考訳(メタデータ) (2026-03-27T17:45:12Z) - Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models [79.18306680174011]
DSR Suiteは、データセット、ベンチマーク、モデルの各面にギャップを埋める。
そこで本研究では,DSRビデオから複数問合せペアを生成する自動パイプラインを提案する。
パイプラインは、カメラポーズ、局所点雲、オブジェクトマスク、向き、および3Dトラジェクトリを含む、豊富な幾何学的および運動的な情報を抽出する。
論文 参考訳(メタデータ) (2025-12-23T17:56:36Z) - Geometric-aware Pretraining for Vision-centric 3D Object Detection [77.7979088689944]
GAPretrainと呼ばれる新しい幾何学的事前学習フレームワークを提案する。
GAPretrainは、複数の最先端検出器に柔軟に適用可能なプラグアンドプレイソリューションとして機能する。
BEVFormer法を用いて, nuScenes val の 46.2 mAP と 55.5 NDS を実現し, それぞれ 2.7 と 2.1 点を得た。
論文 参考訳(メタデータ) (2023-04-06T14:33:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。