論文の概要: Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2608.04759v1
- Date: Wed, 05 Aug 2026 12:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.918737
- Title: Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
- Title(参考訳): トレース,検証,修正:マルチモーダルLLMにおける空間推論のための学習自由フレームワーク
- Authors: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin,
- Abstract要約: 空間的推論の検証と修正のためのモジュラーおよびトレーニング不要なフレームワークを提案する。
このフレームワークは、Chain-of-Thought推論から抽出された原子空間的証拠と、視覚的実体、空間的関係、ソースステップ、および視覚的証拠とを関連付ける。
15のモデルデータセット設定で平均68.94%の精度を達成し、比較基準線を8.55ポイント上回った。
- 参考スコア(独自算出の注目度): 11.359645786865359
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although Multimodal Large Language Models (MLLMs) have made substantial progress, their spatial reasoning may still produce intermediate judgments inconsistent with the input image, allowing errors to propagate through the reasoning chain and affect the final answer. Existing methods mainly improve spatial reasoning through training or additional spatial information, without considering whether the reasoning process itself is faithful to the model input. Our study shows that unfaithful reasoning chains significantly reduce final-answer accuracy. To address this issue, we propose a modular and training-free framework for spatial reasoning verification and correction. The framework constructs a Spatial Evidence Graph (SEG), which associates atomic spatial evidence extracted from Chain-of-Thought reasoning with visual entities, spatial relations, source steps, and visual evidence. Spatial Evidence Reliability Assessment (SERA) evaluates the reliability of visual evidence based on object existence, localization, and geometric measurements. The framework then identifies the earliest spatial evidence unit contradicted by reliable visual evidence and guides the original MLLM to revise the subsequent reasoning and final answer. Across 15 model-dataset settings, our method achieves an average accuracy of 68.94%, outperforming the compared baselines by 8.55 percentage points on average. Our code will be open-sourced.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は大きな進歩を遂げているが、空間的推論は入力画像と矛盾しない中間的な判断を導出し、エラーが推論チェーンを介して伝播し、最終的な答えに影響を与える可能性がある。
既存の手法は主に、推論プロセス自体がモデル入力に忠実かどうかを考慮せずに、トレーニングや追加の空間情報を通じて空間推論を改善する。
本研究は,不誠実な推論連鎖が最終回答精度を著しく低下させることを示す。
この問題に対処するために,空間的推論の検証と修正のためのモジュール式でトレーニング不要なフレームワークを提案する。
このフレームワークは空間エビデンスグラフ(SEG)を構築し、このグラフは、チェーン・オブ・サート(Chain-of-Thought)から抽出された原子空間証拠と、視覚的実体、空間的関係、ソースステップ、および視覚的証拠とを関連付ける。
空間的エビデンス信頼性評価(SERA)は、物体の存在、局所化、幾何学的測定に基づいて、視覚的証拠の信頼性を評価する。
フレームワークは、信頼性のある視覚的証拠によって矛盾した最も初期の空間的証拠単位を特定し、元のMLLMをガイドし、その後の推論と最終回答を改訂する。
15のモデルデータセット設定で平均68.94%の精度を達成し、比較ベースラインを平均8.55ポイント上回った。
私たちのコードはオープンソースになります。
関連論文リスト
- RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought [50.36951914894845]
身体的推論は、物理的環境におけるタスク関連オブジェクトや空間を知覚するモデルを必要とする。
現在の視覚言語モデルは、テキストのみまたはコーディネートで拡張されたチェーン・オブ・思想に依存している。
我々は、あらゆる推論ステップを視覚的証拠にピン留めする構造化推論パラダイムであるPinned Chain-of-Thoughtを提案する。
論文 参考訳(メタデータ) (2026-06-14T11:30:42Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning [11.05919811646786]
本稿では,事前学習型MLLM計算の互換性拡張として遅延推論を開発する空間意味的基盤となるRIS(Retrieve,Integrate,Synthesize)を提案する。
RISは潜伏トークンを空間的および意味的な証拠の両方に固定し、進行的な注意ボトルネックを通じて因果的役割を強制し、翻訳された潜伏状態から語彙に整合した復号に戻すために短い言語遷移トークンを導入する。
論文 参考訳(メタデータ) (2026-05-08T01:33:58Z) - See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs [24.90876091319589]
視覚的マルチモーダル推論のための反復的,トレーニング不要,プラグアンドプレイフレームワークを提案する。
私たちのキーとなるアイデアは、視覚的なエビデンスでテスト時の各推論ステップを監督することです。
本手法はTreeBenchを16.5%-29.5%改善し,RH-AUCを13.7%向上させる。
論文 参考訳(メタデータ) (2026-02-25T02:13:59Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - Towards Inference-time Scaling for Continuous Space Reasoning [55.40260529506702]
推論時間スケーリングは、大規模言語モデルにおけるテキストベースの推論に有効であることが証明されている。
本稿では,そのような確立された手法が連続空間における推論にうまく適応できるかどうかを考察する。
本研究では,ドロップアウト型サンプリングによる多種多様な推論経路の実現可能性を示す。
論文 参考訳(メタデータ) (2025-10-14T05:53:41Z) - Implicit Reasoning in Large Language Models: A Comprehensive Survey [67.53966514728383]
大規模言語モデル(LLM)は、幅広いタスクにまたがる強力な一般化を実証している。
最近の研究は、暗黙の推論に拍車をかけた、明示的な思考の連鎖から注意を向けている。
本調査では,表現形式から計算戦略へ焦点を移し,実行パラダイムを中心とした分類を紹介した。
論文 参考訳(メタデータ) (2025-09-02T14:16:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。