論文の概要: DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- arxiv url: http://arxiv.org/abs/2607.12319v1
- Date: Tue, 14 Jul 2026 03:52:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.031841
- Title: DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- Title(参考訳): DM-KG:ストリートビュー画像における視覚言語モデルの空間認知を高める新しい方法
- Abstract要約: 本研究では,ストリートビュー画像のための地上空間表現フレームワークであるDM-KG(Direction-Metric Knowledge Graph)を提案する。
単一の2次元画像から物体間の方向的および距離的関係を明示的に抽出することにより、空間的推論精度を高める。
実験の結果、DM-KGは距離推定における平均絶対誤差(MAE)を31.1%、方向判定における平均角誤差を65.8%削減することが示された。
- 参考スコア(独自算出の注目度): 29.356253148114135
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As vision-language models (VLMs) are increasingly deployed in geospatial question answering and visual scene understanding, improving their spatial cognition capability on street view imagery for complex logical reasoning has emerged as a key research priority. However, existing VLMs frequently suffer from "spatial semantic hallucinations" when perceiving object locations, distances, and directions in real-world street view scenes. Furthermore, such errors are often recalcitrant to tracing and calibration, posing a critical bottleneck for their practical deployment in geospatial tasks. To address this pressing challenge, this study proposes DM-KG (Direction-Metric Knowledge Graph), a structurally grounded spatial representation framework for street view imagery. By explicitly extracting directional and metric relationships between entities from a single 2D image, this framework enhances the spatial reasoning accuracy of VLMs through a structured knowledge graph. Specifically, we integrate panoptic segmentation with metric depth estimation to robustly compute entity-level 3D spatial coordinates. Subsequently, we encode the clock azimuths and Euclidean distances of entity pairs into a JSON-formatted knowledge graph, which is injected into the VLM as an explicit geometric prior to guide spatial reasoning. Experimental results on public spatial question-answering (QA) benchmarks demonstrate that DM-KG reduces the mean absolute error (MAE) in distance estimation by 31.1% and the mean angular error in direction judgment by 65.8%, while simultaneously maintaining a high QA success rate. By establishing a complete, augmented reasoning pipeline, this research significantly improves the spatial cognitive capabilities of VLMs in street view scenarios, thereby providing a flexible, generalized, and interpretable framework for geographic visual question answering (GeoVQA) in open environments.
- Abstract(参考訳): 視覚言語モデル(VLM)が地理空間的質問応答や視覚的シーン理解にますます導入されるにつれて、複雑な論理的推論のためのストリートビュー画像における空間認識能力の向上が重要な研究の優先事項となっている。
しかしながら、既存のVLMは、現実世界のストリートビューシーンにおける物体の位置、距離、方向を知覚する際に「空間意味幻覚」に悩まされることが多い。
さらに、このようなエラーはトレーシングやキャリブレーションに敏感であり、地理空間的タスクへの実践的な展開において重大なボトルネックとなる。
そこで本研究では,街路画像のための構造的基盤空間表現フレームワークであるDM-KG(Direction-Metric Knowledge Graph)を提案する。
単一の2次元画像から物体間の方向的および距離的関係を明示的に抽出することにより、構造化知識グラフを通してVLMの空間的推論精度を高める。
具体的には、立体レベルの空間座標を頑健に計算するために、パノプティカルセグメンテーションとメートル法深度推定を統合する。
次に,時刻方位とユークリッド距離をJSON形式の知識グラフにエンコードし,空間的推論を導く前に,VLMに明示的な幾何学的図形として注入する。
公共空間質問応答(QA)ベンチマーク実験の結果、DM-KGは距離推定における平均絶対誤差(MAE)を31.1%減らし、方向判断における平均角誤差を65.8%減らし、高いQA成功率を維持した。
本研究は, ストリートビューシナリオにおけるVLMの空間認知能力を大幅に向上させ, 空間的視覚的質問応答(GeoVQA)の柔軟性, 一般化, 解釈可能なフレームワークを提供する。
関連論文リスト
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming [13.534076118011603]
CVSBenchは、衛星とストリートのペアによる空間的推論を評価するための大規模なベンチマークである。
このベンチマークは、クロスビューVQA、クロスビューグラウンド、視点識別など、複数のタスクをサポートする。
言語のみの推論は,視覚空間の想像力を3次元シーンの想像パイプラインに組み込むことで,視線間の推論を大幅に改善する一方で,限界的な改善をもたらすことを示した。
論文 参考訳(メタデータ) (2026-06-21T12:35:43Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - Thinking with Geometry: Active Geometry Integration for Spatial Reasoning [68.59084007360615]
我々は,能動的知覚にパラダイム・パッシブ・フュージョンをシフトさせるフレームワークであるGeoThinkerを提案する。
特徴混合の代わりに、GeoThinkerはモデルが内部の推論要求に応じて条件付けられた幾何学的証拠を選択的に検索することを可能にする。
その結果,次世代の空間知能には,空間構造を積極的に統合する能力が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-02-05T18:59:32Z) - EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence [10.889641815961133]
空間知能アプローチは通常、2D推論パイプラインやブラックボックス再構成モジュールを備えたMLLMに3Dキューを付加する。
本稿では,マクロ認識とマイクロ検証による進行的空間認知のためのフレームワークであるEagleVisionを提案する。
論文 参考訳(メタデータ) (2025-12-17T07:51:36Z) - Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning [19.549136366694572]
Video2は、ビデオからメートル法で配置された空間レイアウトを再構築するためのフレームワークである。
このフレームワークは、オブジェクト間の物理サイズとオブジェクトサイズを定量化するために、連続的なオブジェクト境界座標を使用する。
我々のモデルであるV2LO-7Bは、グリッドマップで訓練されたモデルよりも平均4.92%向上した。
論文 参考訳(メタデータ) (2025-11-20T08:57:14Z) - Dynamic Contrastive Learning for Hierarchical Retrieval: A Case Study of Distance-Aware Cross-View Geo-Localization [20.868592923432843]
既存のディープラーニングを用いたクロスビュージオローカライズ手法は主に、クロスドメイン画像マッチングの精度向上に重点を置いている。
特徴表現を階層的空間的マージンに応じて段階的に整列させる新しいフレームワークである動的コントラスト学習(DyCL)を提案する。
論文 参考訳(メタデータ) (2025-06-29T03:57:01Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。
次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文 参考訳(メタデータ) (2025-03-25T14:34:06Z) - Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas [69.56484419619919]
機械的解釈可能性のレンズによる空間的推論の課題について検討する。
空間的推論の成功は、実際の物体の位置と注意を一致させるモデルの能力と強く相関している。
本研究の目的は,ADAPTVISを用いて,信頼性の高い地域への注意を喚起することである。
論文 参考訳(メタデータ) (2025-03-03T17:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。