論文の概要: SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.01899v1
- Date: Mon, 03 Aug 2026 08:36:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.411969
- Title: SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models
- Title(参考訳): SpatioLM:ビジョンランゲージモデルにおける一般物理空間知能を目指して
- Abstract要約: パラメータ効率の良いtextittextbfSpatio-vision textbfLanguage bftextModels (SpatioLM) を提案する。
我々は,VLMに固有の空間的知識を取り入れた,プラグアンドプレイで非侵襲的なモジュールを設計する。
実験の結果,空間認識や理解などの多様なタスクにおいて,SpatioLMは顕著な改善を実現していることがわかった。
- 参考スコア(独自算出の注目度): 19.19065314413351
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-Language Models (VLMs) perform well on commonsense reasoning tasks but struggle with visual spatial reasoning. Most existing solutions introduce extra 3D prior inputs or external spatial encoders, which increase complexity and degrade the underlying VLMs' general-purpose capabilities after spatial fine-tuning. To this end, we propose a parameter-efficient \textit{\textbf{Spatio}-vision \textbf{L}anguage \textbf{M}odels (SpatioLM)}, that enhances spatial intelligence without extra 3D prior inputs or third-party spatial encoders. Concretely, we design a plug-and-play and non-invasive spatio-vision module that elicits the spatial knowledge inherent in VLMs. Furthermore, we innovatively leverage pseudo depth and camera information as supervision to guide the model in learning physically coherent representations. Extensive experiments show that SpatioLM achieves significant improvements in diverse tasks, including spatial perception and understanding while effectively limiting the degradation of general capabilities. Notably, the model achieves an impressive score of 71.6 on the VSI-Bench (the first model to surpass 70). In addition, it attains competitive performance when transferred to embodied manipulation tasks. Code is available at \href{https://github.com/xiaomi-research/spatio-lm}{\faGithub~spatio-lm}.
- Abstract(参考訳): VLM(Vision-Language Models)は、視覚的空間的推論に苦しむコモンセンス推論タスクでよく機能する。
既存のソリューションの多くは、空間的微調整後のVLMの汎用能力を低下させ、複雑さを増大させる3D事前入力や外部空間エンコーダを導入している。
この目的のために,パラメータ効率の高い \textit{\textbf{Spatio}-vision \textbf{L}anguage \textbf{M}odels (SpatioLM)} を提案する。
具体的には、VLMに固有の空間知識を取り入れた、プラグアンドプレイで非侵襲的な空間分割モジュールを設計する。
さらに,物理コヒーレント表現の学習におけるモデル指導の指導として,疑似深度情報とカメラ情報を革新的に活用する。
広汎な実験により、空間認識や理解を含む様々なタスクにおいて、SpatioLMが大幅な改善を達成し、一般的な能力の劣化を効果的に抑制していることが示された。
特筆すべきは、VSI-Bench(70を超える最初のモデル)で71.6という印象的なスコアを達成したことだ。
さらに、操作タスクを具体化する際の競争性能も向上する。
コードは \href{https://github.com/xiaomi-research/spatio-lm}{\faGithub~spatio-lm} で公開されている。
関連論文リスト
- Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models [16.417990770250146]
本研究では,空間表現を明示した視覚言語モデルを備えた軽量でアーキテクチャに依存しないフレームワークであるSpace Tokensを紹介する。
シーンレベルの3次元形状とオブジェクト中心の空間特性を連続的な潜在トークンに蒸留することにより、これらのモダリティをチェーンオブ思考の推論プロセスに直接組み込むことができる。
その結果、連続的な空間トークンは、幾何学的推論を大きな視覚言語モデルに統合する効果的な、解釈可能な、計算的に効率的なメカニズムを提供することが示された。
論文 参考訳(メタデータ) (2026-08-10T22:20:07Z) - SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision [12.336413790708738]
大規模言語モデル(MLLM)の空間知能は,3次元世界を理解する上で重要である。
本研究では,MLLMの内部で頑健な3次元空間認識を実現するためのフレームワークであるSpatialSVを提案する。
論文 参考訳(メタデータ) (2026-06-18T08:09:32Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning [43.746951848993035]
空間知能は、明示的な空間的インストラクションチューニングによって課されるのではなく、2次元視覚のみから現れる。
本稿では,未提示のマルチビュー画像から直接,空間表現の統一化を学習する,自己教師型フレームワークであるSpa3Rを紹介する。
実験では、Spa3-VLMが3D VQAで58.6%の最先端の精度を達成し、従来の方法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2026-02-24T18:37:34Z) - SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion [23.86761713752287]
MLLM(Multimodal large language model)は、画像および言語タスクにおいて大きな進歩を遂げている。
ほとんどのMLLMは、空間的配置を3次元空間で解釈し推論する限られた空間的推論能力に悩まされている。
幾何学と意味論の階層的融合に基づく新しい視覚エンコーダを提案し,空間認識型視覚埋め込みを生成する。
論文 参考訳(メタデータ) (2025-11-21T15:24:33Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - Visual Spatial Tuning [98.96397681943255]
視覚空間調整(VST)は視覚言語モデル(VLM)を人間に似た視覚空間能力で培養する包括的フレームワークである。
特に,基礎的な空間知識を構築するための微調整を指導し,さらに空間推論能力を向上させるための強化学習を行う。
その結果、ビジョン・ランゲージ・アクションモデルが空間的チューニングのパラダイムによって大幅に拡張され、より物理的に接地されたAIへの道が開けることが判明した。
論文 参考訳(メタデータ) (2025-11-07T18:59:16Z) - Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence [13.168559963356952]
純粋に2次元の観察から空間的推論を行う新しいフレームワークであるSpatial-MLLMを提案する。
我々の重要な洞察は、フィードフォワード視覚幾何学基礎モデルに先立って、強い構造を解き放つことである。
コネクタは、両方の機能を統合された視覚トークンに統合し、空間的理解を強化する。
論文 参考訳(メタデータ) (2025-05-29T17:59:04Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction [86.82819259860186]
本稿では,視覚言語モデル(VLM)のための統合フレームワークであるVLM-3Rについて紹介する。
VLM-3Rは、空間的理解を表す暗黙の3Dトークンを導出する幾何学エンコーダを用いて、モノクロビデオフレームを処理する。
論文 参考訳(メタデータ) (2025-05-26T17:56:30Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z) - Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning [36.588008658084895]
視覚言語モデル(VLM)は多くのタスクでうまく機能するが、しばしば空間的推論では失敗する。
評価の結果, 現状のVLMでは, 複合空間問題に対する不正確な答えが得られていることがわかった。
VLMにおける2次元空間推論は,基本空間能力のみに基づいて訓練することで向上する。
論文 参考訳(メタデータ) (2024-10-21T16:26:09Z) - SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning
Capabilities [59.39858959066982]
空間的関係についての理解と推論は、視覚質問応答(VQA)とロボット工学の基本的な能力である。
我々は,1000万枚の実画像に対して,最大20億個のVQAサンプルをスケール可能な3次元空間VQAデータ自動生成フレームワークを開発した。
このようなデータに基づいてVLMを訓練することにより、定性的空間的VQAと定量的空間的VQAの両方において、その能力を大幅に向上する。
論文 参考訳(メタデータ) (2024-01-22T18:01:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。