論文の概要: Disentangling 3D Modeling from Spatial Reasoning
- arxiv url: http://arxiv.org/abs/2608.05242v2
- Date: Fri, 07 Aug 2026 00:33:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.070519
- Title: Disentangling 3D Modeling from Spatial Reasoning
- Title(参考訳): 空間共振による3次元モデリング
- Abstract要約: 本研究では,空間的推論から3次元知覚を明示的に切り離すことにより,空間的推論のための代替パラダイムを探求する。
我々のキーとなる観察は、現代の知覚モデルが連続した3次元幾何学を推定するのに優れているのに対して、大きな言語モデル(LLM)は特に構成的および記号的推論に有効であるということである。
これらの相補的な強みに感銘を受けて、ディスタングル空間共振器(DiSR)を提案する。
DiSRは、この明示的な幾何学的証拠のみを推論するために、既製の専門家の知覚モデルとLLMをLoRAで微調整することで、物理世界を構造化された3Dエビデンスに再構成する。
- 参考スコア(独自算出の注目度): 56.3819096070689
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we explore an alternative paradigm for spatial reasoning by explicitly disentangling 3D perception from reasoning, rather than jointly acquiring implicit 3D perception and reasoning through large-scale training. Our key observation is that modern perception models excel at estimating continuous 3D geometry, whereas large language models (LLMs) are particularly effective at compositional and symbolic reasoning. Motivated by these complementary strengths, we propose the Disentangled Spatial Reasoner (DiSR), a simple yet effective framework that reconstructs the physical world into structured 3D evidence using off-the-shelf expert perception models and fine-tunes an LLM with LoRA to perform reasoning solely over this explicit geometric evidence. Without large-scale 3D VQA training or complex tool-use policies, DiSR achieves competitive performance on popular spatial reasoning benchmarks. Beyond its strong performance, DiSR offers improved interpretability, modularity, and computational efficiency, demonstrating that explicit separation of perception and reasoning is a scalable and effective alternative paradigm to end-to-end modeling for spatial intelligence.
- Abstract(参考訳): 本研究では,大規模学習を通じて暗黙的な3次元知覚と推論を共同で獲得する代わりに,空間的推論のための代替パラダイムについて検討する。
我々のキーとなる観察は、現代の知覚モデルが連続した3次元幾何学を推定するのに優れているのに対して、大きな言語モデル(LLM)は特に構成的および記号的推論に有効であるということである。
これらの相補的な強みに触発され、本論文では、この明示的な幾何学的証拠のみを推論するために、既成の専門家認識モデルとLLMを用いた微調整を用いて、物理世界を構造化された3Dエビデンスに再構成する、シンプルで効果的なフレームワークであるディスタングル空間共振器(DiSR)を提案する。
大規模な3D VQAトレーニングや複雑なツール使用ポリシーがなければ、DiSRは一般的な空間推論ベンチマーク上での競合性能を達成する。
強力な性能に加えて、DiSRは解釈可能性、モジュラリティ、計算効率を改善し、空間知性のためのエンドツーエンドモデリングに対するスケーラブルで効果的な代替パラダイムである知覚と推論の明確な分離を実証している。
関連論文リスト
- Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning [63.07529952817935]
視覚言語モデル(VLM)は2次元投影を解釈するために訓練されているが、真の空間的推論は潜時的な3次元幾何学と時間的連続性の回復を要求する。
本稿では,視覚的投影によって崩壊した次元を明示的に解釈する因子強化学習フレームワークであるFactoSRを提案する。
論文 参考訳(メタデータ) (2026-09-03T12:01:02Z) - SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments [75.60795462502949]
SpaceEvoは3D空間推論のための自己進化型フレームワークである。
16の空間推論タスクカテゴリを明示的な幾何学的検証規則で定式化する。
注釈のない3Dシーンをゼロノイズのインタラクティブなオラクルに変換し、モデルコンセンサスを客観的な物理的フィードバックに置き換える。
論文 参考訳(メタデータ) (2026-04-15T17:59:12Z) - World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models [25.135316296678187]
既存の手法は、3Dグラウンドデータを介して統計的ショートカットを過度に適合させるか、2Dの視覚的知覚に限定される。
トレーニング不要な空間情報ツールキット World2Mind を提案する。
我々はWorld2MindがGPT-5.2のようなフロンティアモデルの性能を5%18%向上させることを示した。
論文 参考訳(メタデータ) (2026-03-10T15:12:14Z) - CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning [40.654048754955404]
CamReasonerは、カメラムーブメントの理解を構造化推論プロセスとして再構築するフレームワークである。
我々は、この領域における論理的アライメントにRLを初めて採用し、運動推論が物理幾何学に基礎を置いていることを保証する。
論文 参考訳(メタデータ) (2026-01-30T04:45:43Z) - CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence [6.2150701899678635]
CoRe3Dは、意味的および空間的抽象化を共同で操作する統合された3D理解および生成推論フレームワークを導入している。
CoRe3Dは、セマンティック・チェーン・オブ・セマンティック・チェーン・推論と構造的空間的推論を密結合することにより、強い局所的な一貫性と言語記述との忠実な整合性を示す3D出力を生成する。
論文 参考訳(メタデータ) (2025-12-14T17:05:11Z) - Video Spatial Reasoning with Object-Centric 3D Rollout [58.12446467377404]
我々は,ロバストなビデオ空間推論を実現するために,OCR(Object-Centric 3D Rollout)を提案する。
OCRは、トレーニング中に選択した物体の3次元形状に構造的摂動を導入する。
OCRはモデルを補完し、全体にわたって論理的にソートする。
論文 参考訳(メタデータ) (2025-11-17T09:53:41Z) - MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Experts [50.37005070020306]
MoREは、Mixture-of-Experts (MoE)アーキテクチャに基づいた、密集した3Dビジュアル基盤モデルである。
MoREは、幾何推定を安定させ、洗練する信頼に基づく深度補正モジュールを組み込んでいる。
高忠実な表面正規予測のために,高密度なセマンティック特徴とグローバルな3Dバックボーン表現を統合する。
論文 参考訳(メタデータ) (2025-10-31T06:54:27Z) - Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing [62.447497430479174]
空間における推論への描画は、視覚空間における基本的な描画操作を通じてLVLMを推論できる新しいパラダイムである。
我々のモデルはVILASRと呼ばれ、様々な空間推論ベンチマークで既存の手法より一貫して優れています。
論文 参考訳(メタデータ) (2025-06-11T17:41:50Z) - SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning [23.6011224506759]
本稿では3次元空間推論に対処する新しい大規模視覚言語モデル(LVLM)を提案する。
明示的な3D表現は、高度な3D空間推論をサポートするコヒーレントインターフェースを提供する。
その結果,SpatialReasonerは,様々な空間推論ベンチマークの性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-04-28T17:48:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。