論文の概要: Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes
- arxiv url: http://arxiv.org/abs/2609.25841v1
- Date: Tue, 22 Sep 2026 08:09:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.280957
- Title: Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes
- Title(参考訳): Metric-Bench:室内シーン用VLMにおけるコンテキスト内空間メトリック推論の探索
- Abstract要約: メトリック推論は視覚言語モデル(VLM)にとって重要かつ困難な課題である
本稿では,文脈情報を用いた距離空間推論を導くためのベンチマークであるMetric-Benchを紹介する。
また,タスク適応型強化微調整法であるMetricerについて紹介する。
- 参考スコア(独自算出の注目度): 47.63212977244944
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Metric reasoning is a critical and challenging task for Vision Language Models (VLMs), playing a pivotal role in embodied AI tasks such as robotic manipulation and autonomous navigation. However, current spatial reasoning remains bottlenecked by rigid pixel-level supervision; such localized optimization often compromises general multimodal intelligence, triggering performance degradation or catastrophic forgetting of broad reasoning capabilities. To address these limitations, we introduce Metric-Bench, a focused benchmark designed to guide metric-spatial reasoning using contextual information. By incorporating in-image reference objects with known physical dimensions, Metric-Bench guides models to implicitly learn the 2D-to-3D mapping without camera intrinsics. We further present MetricReasoner, a task-adapted reinforcement fine-tuning recipe for reference-grounded metric reasoning, using structured prompts and verifiable numerical rewards. Extensive experiments on Metric-Bench demonstrate that our approach significantly enhances spatial metric understanding, outperforming existing and even larger proprietary models by 43.1\%, while improving downstream embodied performance over a spatial-specialized counterpart by 30.4\% on RoboSpatial overall accuracy and 9.3\% on ERQA, and additionally delivering consistent gains on general benchmarks (15.9\% on V$\star$Bench, 88.9\% on BLINK), indicating that the proposed adaptation does not necessarily compromise general VLM capabilities.
- Abstract(参考訳): メトリック推論はビジョン言語モデル(VLM)にとって重要な課題であり、ロボット操作や自律ナビゲーションといったAIタスクにおいて重要な役割を果たす。
しかし、現在の空間的推論は、厳密なピクセルレベルの監督によってボトルネックが残っており、そのような局所的な最適化は一般的なマルチモーダルインテリジェンスを損なうことが多く、性能劣化や広い推論能力の破滅的な忘れを招きかねない。
これらの制約に対処するために,文脈情報を用いた距離空間推論を導くためのベンチマークであるMetric-Benchを導入する。
画像内の参照オブジェクトを既知の物理次元に組み込むことで、Metric-Benchはカメラの内在性のない2Dから3Dマッピングを暗黙的に学習するモデルをガイドする。
さらに,タスク適応型強化微調整法であるMetricReasonerについて,構造化プロンプトと検証可能な数値報酬を用いて紹介する。
Metric-Bench での大規模な実験により、我々のアプローチは空間的メートル法理解を著しく向上させ、既存のおよびさらに大きなプロプライエタリモデルよりも43.1\%向上し、一方、RoboSpatial の全体的な精度は 30.4\%、ERQA は 9.3\%向上し、一般ベンチマークでは 15.9\%、BLINK では 88.9\% 向上した。
関連論文リスト
- Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models [16.417990770250146]
本研究では,空間表現を明示した視覚言語モデルを備えた軽量でアーキテクチャに依存しないフレームワークであるSpace Tokensを紹介する。
シーンレベルの3次元形状とオブジェクト中心の空間特性を連続的な潜在トークンに蒸留することにより、これらのモダリティをチェーンオブ思考の推論プロセスに直接組み込むことができる。
その結果、連続的な空間トークンは、幾何学的推論を大きな視覚言語モデルに統合する効果的な、解釈可能な、計算的に効率的なメカニズムを提供することが示された。
論文 参考訳(メタデータ) (2026-08-10T22:20:07Z) - SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs [65.04549036809557]
我々は、ステレオカメラ、LiDAR、IMU/GPSセンサーで撮影された歩行者の視線映像から構築したベンチマークを紹介する。
このデータセットは、計量的に正確な3D情報を提供し、空間的推論質問の自動生成を可能にする。
評価の結果、構造化屋内ベンチマークで観測された性能向上は、オープンワールド環境では消滅することが明らかとなった。
論文 参考訳(メタデータ) (2025-12-22T18:58:12Z) - Video Spatial Reasoning with Object-Centric 3D Rollout [58.12446467377404]
我々は,ロバストなビデオ空間推論を実現するために,OCR(Object-Centric 3D Rollout)を提案する。
OCRは、トレーニング中に選択した物体の3次元形状に構造的摂動を導入する。
OCRはモデルを補完し、全体にわたって論理的にソートする。
論文 参考訳(メタデータ) (2025-11-17T09:53:41Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models [15.50826328938879]
視覚言語モデル(VLM)の空間的推論能力を評価するためのベンチマークであるSURDSを紹介する。
nuScenesデータセットに基づいて構築されたSURDSは、41,080の視覚要求回答トレーニングインスタンスと9,250の評価サンプルで構成されている。
本研究では,空間的に接地された報酬信号を利用した強化学習に基づくアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-11-20T08:14:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。