論文の概要: Geometric Encoding for Spatial Reasoning in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.34148v1
- Date: Mon, 28 Sep 2026 02:29:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 06:26:58.654173
- Title: Geometric Encoding for Spatial Reasoning in Vision-Language Models
- Title(参考訳): 視覚言語モデルにおける空間推論のための幾何学的エンコーディング
- Abstract要約: VLM(Vision-Language Models)は、その空間的および時間的特性を推論するよりも、ビデオに現れるものを認識する方がはるかに信頼性が高い。
ビデオから空間構造を明示的に計算する,知覚と幾何学のパイプラインであるGeometric Codeを提案する。
- 参考スコア(独自算出の注目度): 2.399370258616979
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) are far more reliable at recognizing what appears in a video than at reasoning about its spatial and temporal properties, such as metric distances, object dimensions, and consistent object identities across frames. We present Geometric Code, a perception-to-geometry pipeline that computes explicit spatial structure from video and supplies it to VLMs as context to augment reasoning. A perception layer segments and classifies objects and recovers depth, camera pose, and intrinsics from monocular RGB video. A deterministic geometric engine then back-projects, merges, and cleans these outputs into a spatial code, including per-object positions, dimensions, counts, inter-object distances, appearance order, and room geometry. The code is serialized into VLMs' prompts, either alongside the video or replacing it entirely. Specifically, there is no component trained or fine-tuned in our approach. On VSI-Bench, augmenting 2B and 4B open models with the spatial code improves average accuracy by +4.1 points over the frames-only baseline, with the largest gains on numeric estimation tasks such as absolute distance (+24.1 points). The results suggest that explicitly computed geometry, delivered through the language channel, recovers spatial competence that small VLMs cannot extract from pixels alone.
- Abstract(参考訳): VLM(Vision-Language Models)は、距離距離、オブジェクト次元、フレーム全体にわたる一貫したオブジェクトのアイデンティティなど、その空間的および時間的特性について推論するよりも、ビデオに現れるものを認識する方がはるかに信頼性が高い。
本稿では,映像から空間構造を明示的に計算し,拡張推論のコンテキストとしてVLMに供給する,知覚と幾何学のパイプラインであるGeometric Codeを提案する。
知覚層は、物体をセグメント化し分類し、モノクロRGBビデオから深度、カメラポーズ、内在を復元する。
決定論的幾何学エンジンは、これらの出力を、オブジェクトごとの位置、寸法、カウント、オブジェクト間距離、外観順、部屋形状を含む空間コードに、バックプロジェクトし、マージし、クリーン化する。
コードはVLMのプロンプトにシリアライズされ、ビデオと一緒に、あるいは完全に置き換えられる。
具体的には、このアプローチでトレーニングされたコンポーネントや微調整されたコンポーネントはありません。
VSI-Benchでは、2Bと4Bのオープンモデルを空間コードで拡張することで、フレームのみのベースライン上で平均精度を+4.1ポイント向上させ、絶対距離(+24.1ポイント)のような数値推定タスクで最大のゲインを得る。
結果から,言語チャネルを通して提供される明示的に計算された幾何学は,小さなVLMが画素のみから抽出できないような空間的能力を取り戻すことが示唆された。
関連論文リスト
- G$^2$TAM: Geometry Grounded Track Anything Model [49.05553245076823]
本稿では,RGB画像やビデオのみを用いて,3次元のインスタンス追跡を高速化するための統一的なフレームワークを提案する。
G$2$TAMは空間的に整列した幾何学的表現を暗黙記憶として使用し、安定したインスタンス識別とフレームとビュー間のローカライゼーションを保証する。
中心となるのは、視覚的およびテキスト的プロンプトを共有幾何学空間に統合し、エンドツーエンドの空間再構成とインスタンス一貫性マスク予測を可能にするクロスモーダル空間エンコーダである。
論文 参考訳(メタデータ) (2026-07-04T09:32:13Z) - Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation [17.44364775825169]
テキスト駆動の参照ビデオオブジェクト(RVOS)は、自然言語で指定されたビデオ内の対象物を特定し、セグメント化することを目的としている。
既存のモデルは、通常、2D画像またはビデオデータセットに基づいて、単純なセグメンテーション損失でトレーニングされる。
テキスト駆動ビデオセグメンテーションを強化するために,GeoLaV(Geometry-enhanced Language-Guided Video segmentation)を提案する。
論文 参考訳(メタデータ) (2026-06-23T11:57:08Z) - Thinking with Spatial Code for Physical-World Video Reasoning [27.397518169065634]
空間コードによる思考は、RGB動画を明示的で時間的に整合した3D表現に変換するフレームワークである。
提案する空間エンコーダは,映像を3次元有界ボックスとセマンティックラベルで構造化された空間コードに解析できるという経験的発見を強調した。
論文 参考訳(メタデータ) (2026-03-05T19:00:02Z) - Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models [79.18306680174011]
DSR Suiteは、データセット、ベンチマーク、モデルの各面にギャップを埋める。
そこで本研究では,DSRビデオから複数問合せペアを生成する自動パイプラインを提案する。
パイプラインは、カメラポーズ、局所点雲、オブジェクトマスク、向き、および3Dトラジェクトリを含む、豊富な幾何学的および運動的な情報を抽出する。
論文 参考訳(メタデータ) (2025-12-23T17:56:36Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z) - 3D Part Segmentation via Geometric Aggregation of 2D Visual Features [57.20161517451834]
監督された3D部分分割モデルは、固定されたオブジェクトと部品のセットに合わせて調整されており、それらの転送可能性は、オープンセットの現実世界のシナリオに制限される。
近年、視覚言語モデル(VLM)を多視点レンダリングとテキストプロンプトを用いてオブジェクト部品の識別に活用する研究が進められている。
これらの制約に対処するために,視覚概念から抽出した意味論と3次元幾何学をブレンドし,対象部品を効果的に同定するCOPSを提案する。
論文 参考訳(メタデータ) (2024-12-05T15:27:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。