論文の概要: SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
- arxiv url: http://arxiv.org/abs/2603.22057v1
- Date: Mon, 23 Mar 2026 14:54:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.73629
- Title: SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
- Title(参考訳): SpaceBoost: 言語誘導推論による視覚表現の強化
- Authors: Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin,
- Abstract要約: 本稿では,言語記述に表現された3次元空間知識を注入することにより,事前学習した視覚エンコーダの空間認識を高める枠組みを提案する。
中心となる考え方は、2D画像から高密度な3次元空間情報を言語表現に変換することである。
我々は、密集空間知識を段階的に取り入れ、階層的空間理解を構築するマルチターン・チェーン・オブ・ソート推論プロセスを採用する。
- 参考スコア(独自算出の注目度): 54.63188577755209
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite the remarkable success of large-scale pre-trained image representation models (i.e., vision encoders) across various vision tasks, they are predominantly trained on 2D image data and therefore often fail to capture 3D spatial relationships between objects and backgrounds in the real world, constraining their effectiveness in many downstream applications. To address this, we propose SpatialBoost, a scalable framework that enhances the spatial awareness of existing pre-trained vision encoders by injecting 3D spatial knowledge expressed in linguistic descriptions. The core idea involves converting dense 3D spatial information from 2D images into linguistic expressions, which is then used to inject such spatial knowledge into vision encoders through a Large Language Model (LLM). To this end, we adopt a multi-turn Chain-of-Thought (CoT) reasoning process that progressively incorporates dense spatial knowledge and builds hierarchical spatial understanding. To validate effectiveness, we adapt SpatialBoost to state-of-the-art vision encoders such as DINOv3, and evaluate its performance gains on a wide range of benchmarks requiring both 3D perception and general vision abilities. For instance, SpatialBoost improves DINOv3 performance from 55.9 to 59.7 mIoU on ADE20K, achieving state-of-the-art performance with 3.8% gain over the pre-trained DINOv3.
- Abstract(参考訳): 様々な視覚タスクにおける大規模な事前学習画像表現モデル(ビジョンエンコーダ)の成功にもかかわらず、それらは主に2次元画像データに基づいて訓練されており、現実世界のオブジェクトと背景の間の3次元空間的関係を捉えることができず、多くの下流アプリケーションにおいてその効果を制限している。
そこで本稿では,言語記述に表現された3次元空間知識を注入することにより,既存の学習済み視覚エンコーダの空間認識を高めるスケーラブルなフレームワークであるSpatialBoostを提案する。
中心となる考え方は、高密度な3次元空間情報を2次元画像から言語表現に変換することである。
この目的のために,高密度空間知識を段階的に取り入れ,階層的な空間理解を構築するマルチターン・チェーン・オブ・ソート(CoT)推論プロセスを採用する。
DINOv3のような最先端の視覚エンコーダにSpatialBoostを適用し、3次元認識と一般的な視覚能力の両方を必要とする幅広いベンチマークにおいて、その性能向上を評価する。
例えば、SpatialBoostはADE20K上でDINOv3の性能を55.9mIoUから59.7mIoUに改善し、事前訓練されたDINOv3よりも3.8%向上した。
関連論文リスト
- Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding [11.482339306296204]
本稿では、3次元の視覚的手がかりを有効視知覚と投影によって活用し、正確で堅牢な視覚言語理解を実現する枠組みを提案する。
具体的には、HSENetは、グローバルなボリュームコンテキストと微細な解剖学的詳細の両方を知覚するために、デュアル3Dビジョンエンコーダを使用している。
また,高分解能な3次元空間領域をコンパクトな視覚的トークン集合に凝縮する効率的なマルチモーダルプロジェクタであるSpatial Packerを提案する。
論文 参考訳(メタデータ) (2025-06-11T11:46:57Z) - VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction [86.82819259860186]
本稿では,視覚言語モデル(VLM)のための統合フレームワークであるVLM-3Rについて紹介する。
VLM-3Rは、空間的理解を表す暗黙の3Dトークンを導出する幾何学エンコーダを用いて、モノクロビデオフレームを処理する。
論文 参考訳(メタデータ) (2025-05-26T17:56:30Z) - BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence [11.91274849875519]
画像中心の3次元知覚モデルBIP3Dを導入し,点中心の手法の限界を克服する。
我々は、事前学習された2次元視覚基盤モデルを利用して意味理解を強化し、空間理解を改善するために空間拡張モジュールを導入する。
我々の実験では、BIP3Dは、EmbodiedScanベンチマークで現在の最先端結果より優れており、3D検出タスクでは5.69%、視覚的グラウンドタスクでは15.25%の改善が達成されている。
論文 参考訳(メタデータ) (2024-11-22T11:35:42Z) - CLIP$^2$: Contrastive Language-Image-Point Pretraining from Real-World
Point Cloud Data [80.42480679542697]
現実シナリオにおける3Dポイントクラウド表現の伝達を学習するために,Contrastive Language-Image-Point Cloud Pretraining (CLIP$2$)を提案する。
具体的には、2Dおよび3Dシナリオで自然に存在する対応を利用して、それらの複雑なシナリオから、適切に整列されたインスタンスベースのテキストイメージポイントプロキシを構築します。
論文 参考訳(メタデータ) (2023-03-22T09:32:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。