論文の概要: Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications
- arxiv url: http://arxiv.org/abs/2607.27145v1
- Date: Wed, 29 Jul 2026 17:20:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.761493
- Title: Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications
- Title(参考訳): 多モードLLMにおける説明可能かつ資源効率の良い空間推論
- Authors: Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi,
- Abstract要約: MLLM(Multimodal Large Language Models)は、ロボット工学、組み込みAI、安全監視といった決定クリティカルなパイプラインに、ますます多くデプロイされている。
MLLMは強い推論を示すが、しばしば微細な空間理解と物体幻覚に苦しむ。
ByDeWay-V2を提案する。
- 参考スコア(独自算出の注目度): 7.911287368927542
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Multimodal Large Language Models (MLLMs) are increasingly deployed in decision-critical pipelines such as robotics, embodied AI, and safety monitoring, the opacity of their spatial judgments limits operator trust and auditability. MLLMs demonstrate strong reasoning but often struggle with fine-grained spatial understanding and object hallucination. Prior work, ByDeWay, introduced Layered-Depth-Based Prompting (LDP), a training-free framework that mitigates hallucinations by structuring prompts using monocular depth estimation. However, coarse depth layering falls short in resolving object-to-object spatial relationships within the same geometric plane, such as projective ("left of", "above") and topological ("inside", "touching") relations. We propose ByDeWay-V2, which integrates explicit spatial relational context alongside depth cues, expressed as human-readable predicates that serve as auditable evidence for downstream decision support. Using an open-vocabulary object detector (YOLO-World-L), our framework computes pairwise geometric relations between detected objects and injects them as structured spatial predicates into the MLLM prompt, bridging 3D scene depth and 2D spatial semantics without any training. We evaluate ByDeWay-V2 on the Visual Spatial Reasoning (VSR) and BLINK benchmarks across multiple MLLMs, with hallucination grounding assessed via POPE. On the BLINK spatial subset, ByDeWay-V2 achieves a 46 percent relative F1 improvement over LDP for Qwen2.5-VL, and recovers BLIP-Base's spatial reasoning on VSR from near-random performance to a competitive F1 of 0.53. Our lightest configuration operates under a strict 40-token context budget on CPU, showing the framework's suitability for resource-constrained, real-time decision-support settings.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、ロボット工学、組み込みAI、安全監視といった決定クリティカルなパイプラインにますます導入されているため、空間的判断の不透明さにより、オペレータの信頼と監査性が制限される。
MLLMは強い推論を示すが、しばしば微細な空間理解と物体幻覚に苦しむ。
ByDeWay氏は以前、単眼深度推定を使用してプロンプトを構造化することによって幻覚を緩和するトレーニング不要のフレームワークであるLayered-Depth-Based Prompting (LDP)を紹介した。
しかし、粗い深さ層は、射影的(左、上)や位相的(内)な(タッチする)関係など、同じ幾何学的平面内でオブジェクトとオブジェクトの空間関係を解く際には不足する。
そこで我々は,ByDeWay-V2を提案する。このByDeWay-V2は,人間の読みやすい述語として表現され,下流の意思決定支援のための監査可能な証拠となる。
オープンボキャブラリオブジェクト検出器(YOLO-World-L)を用いて,検出対象間の相互幾何学的関係を計算し,構造化空間述語としてMLLMプロンプトに注入し,3次元シーン深度と2次元空間意味論をトレーニングなしでブリッジする。
視覚空間推論 (VSR) と BLINK ベンチマークにおける ByDeWay-V2 の評価を行った。
BLINK空間部分集合では、ByDeWay-V2 は Qwen2.5-VL の LDP よりも 46% の相対 F1 改善を実現し、BLIP-Base の VSR 上の空間的推論をほぼランダムな性能から 0.53 の競合 F1 に回復する。
最も軽量な設定は、CPU上で厳格な40のコンテキスト予算の下で動作し、リソース制約のあるリアルタイムな意思決定支援設定にフレームワークが適していることを示しています。
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs [36.84953281346447]
EgoMindはChainof-Thoughtフレームワークで、RolePlay Captionを通じて幾何学のない空間推論を可能にする。
5Kサンプルと20K RLサンプルだけで、EgoMindはMLLMBenchs、SITEBench、SPBenchで有効である。
論文 参考訳(メタデータ) (2026-04-01T15:28:13Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration [16.651645602449577]
大規模言語モデル(LLM)を利用した視覚・言語ナビゲーション(VLN)エージェントは、一般化が優れているが、空間認識が不十分である。
本稿では,これらの課題を克服するための知覚誘導探索フレームワークであるSpatial-VLNを提案する。
論文 参考訳(メタデータ) (2026-01-19T06:53:02Z) - SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion [23.86761713752287]
MLLM(Multimodal large language model)は、画像および言語タスクにおいて大きな進歩を遂げている。
ほとんどのMLLMは、空間的配置を3次元空間で解釈し推論する限られた空間的推論能力に悩まされている。
幾何学と意味論の階層的融合に基づく新しい視覚エンコーダを提案し,空間認識型視覚埋め込みを生成する。
論文 参考訳(メタデータ) (2025-11-21T15:24:33Z) - SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards [37.39035418889281]
構造的空間接地と多段階推論を統合するためにRLで訓練された3D対応MLLMであるSpatialThinkerを紹介する。
このモデルは,タスク関連オブジェクトと空間関係のシーングラフを構築し,密集した空間報酬による回答への推論を行うことにより,人間のような空間知覚をシミュレートする。
論文 参考訳(メタデータ) (2025-11-10T18:52:47Z) - FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning [62.11389260206383]
textscFineRSは、非常に小さなオブジェクトをセグメント化するための2段階のMLLMベースの強化学習フレームワークである。
textscFineRS-4kは,属性レベルの推論に基づくMLLMの評価と,微妙で小規模なターゲットに対する画素レベルのセグメンテーションのための新しいデータセットである。
論文 参考訳(メタデータ) (2025-10-24T10:14:17Z) - A Multimodal Depth-Aware Method For Embodied Reference Understanding [56.30142869506262]
Embodied Reference Understandingでは、言語命令とポインティングキューの両方に基づいて、視覚的なシーンで対象のオブジェクトを識別する必要がある。
本稿では,データ拡張,深度マップのモダリティ,深度認識決定モジュールを共同で活用する新しいERUフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T14:32:21Z) - Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding [8.202861909913791]
基礎モデルにおけるオブジェクト中心空間推論のベンチマークを示す。
グラウンディングディーノやOWLv2のような検出器は、リレーショナル推論に制限のある正確なボックスを提供する。
本研究は,地域化と真の空間理解のギャップを強調し,地域社会における空間認識基盤モデルの必要性を指摘する。
論文 参考訳(メタデータ) (2025-09-26T06:06:19Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。