論文の概要: SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
- arxiv url: http://arxiv.org/abs/2609.07064v1
- Date: Mon, 07 Sep 2026 05:41:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.367385
- Title: SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
- Title(参考訳): 空間ブロック:合成ブロックスタック問題によるLVLMの空間知性向上
- Abstract要約: LVLM(Large Vision-Language Models)は、様々な視覚的タスクにおいて強力なパフォーマンスを実現している。
しかし、2次元画像に描かれたシーンの3次元構造を再構築し、解析する能力は依然として限られている。
本稿では,人間の認知発達にインスパイアされた,構造化ブロック操作タスクによる基礎的空間スキルの学習という,新しいパラダイムを提案する。
- 参考スコア(独自算出の注目度): 40.48570356491105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) have achieved strong performance on diverse visual tasks, yet their ability to reconstruct and reason about the 3D structure of the scene depicted in 2D images -- referred to as spatial intelligence -- remains limited. Existing approaches attempt to address this gap by using real-scene spatial question answering datasets that require dense geometric annotations. However, constructing such labels is costly, time-consuming, and often noisy due to reliance on external perception modules. In this work, we propose a novel paradigm inspired by human cognitive development: learning foundational spatial skills through structured block-manipulation tasks. We introduce SpatialBlock-15k, a synthetic dataset of 15,000 block-stacking problems covering 3D-to-2D projection, viewpoint transformation, and structural combination. The dataset further incorporates controlled color modulation as visual cues to encourage anchor-based reasoning in visually complex conditions. Experiments demonstrate that LVLMs trained on our dataset through either direct answering or reasoning-based prediction significantly outperform baselines and generalize to real-world spatial tasks, despite the dataset's synthetic and compact nature. Code and data are available at https://github.com/rsoohyun/SpatialBlock.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、様々な視覚的タスクにおいて強力なパフォーマンスを達成しているが、空間知能と呼ばれる2次元画像に描かれたシーンの3D構造を再構築し、推論する能力は依然として限られている。
既存のアプローチでは、密集した幾何学的アノテーションを必要とするデータセットを用いて、このギャップに対処しようと試みている。
しかし、そのようなラベルを構築するのはコストがかかり、時間がかかり、外部の知覚モジュールに依存するため、しばしばうるさい。
本研究では,人間の認知発達にインスパイアされた,構造化ブロック操作タスクによる基礎空間スキルの学習という,新しいパラダイムを提案する。
本研究では,3次元から2次元の投影,視点変換,構造結合を含むブロックスタッキング問題の合成データセットであるSpatialBlock-15kを紹介する。
このデータセットはさらに、制御された色変調を視覚的手がかりとして組み込んで、視覚的に複雑な条件下でアンカーベースの推論を促進する。
実験では、データセットの合成とコンパクト性にもかかわらず、直接応答または推論に基づく予測によってトレーニングされたLVLMが、ベースラインを著しく上回り、実際の空間タスクに一般化することを示した。
コードとデータはhttps://github.com/rsoohyun/SpatialBlock.comで公開されている。
関連論文リスト
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision [12.336413790708738]
大規模言語モデル(MLLM)の空間知能は,3次元世界を理解する上で重要である。
本研究では,MLLMの内部で頑健な3次元空間認識を実現するためのフレームワークであるSpatialSVを提案する。
論文 参考訳(メタデータ) (2026-06-18T08:09:32Z) - SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes [105.8644620467576]
Stextscurprise3Dは複雑な3次元シーンにおける言語誘導空間推論のセグメンテーションを評価するために設計された新しいデータセットである。
Stextscurprise3Dは、ScanNet++ v2から900以上の詳細な屋内シーンにわたる200k以上の視覚言語ペアで構成されている。
データセットには、オブジェクト名なしで意図的に作成される89k以上の人間アノテーション付き空間クエリが含まれている。
論文 参考訳(メタデータ) (2025-07-10T14:01:24Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence [13.168559963356952]
純粋に2次元の観察から空間的推論を行う新しいフレームワークであるSpatial-MLLMを提案する。
我々の重要な洞察は、フィードフォワード視覚幾何学基礎モデルに先立って、強い構造を解き放つことである。
コネクタは、両方の機能を統合された視覚トークンに統合し、空間的理解を強化する。
論文 参考訳(メタデータ) (2025-05-29T17:59:04Z) - Spatial Knowledge Graph-Guided Multimodal Synthesis [78.11669780958657]
本稿では,空間知識グラフによって導かれる新しいマルチモーダル合成手法を提案する。
実験では、方向や距離を含む多様な空間知識から合成されたデータにより、MLLMの空間知覚と推論能力が著しく向上する。
知識に基づくデータ合成のアイデアが空間知性の発展を促進することを願っている。
論文 参考訳(メタデータ) (2025-05-28T17:50:21Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z) - Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。
次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文 参考訳(メタデータ) (2025-03-25T14:34:06Z) - Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning [36.588008658084895]
視覚言語モデル(VLM)は多くのタスクでうまく機能するが、しばしば空間的推論では失敗する。
評価の結果, 現状のVLMでは, 複合空間問題に対する不正確な答えが得られていることがわかった。
VLMにおける2次元空間推論は,基本空間能力のみに基づいて訓練することで向上する。
論文 参考訳(メタデータ) (2024-10-21T16:26:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。