論文の概要: From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- arxiv url: http://arxiv.org/abs/2606.26535v1
- Date: Thu, 25 Jun 2026 02:18:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.145782
- Title: From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- Title(参考訳): 幻覚から接地へ:CRISPによる視覚空間知能の診断
- Abstract要約: CRISPは、一貫性を通して視覚空間知能を評価する構造診断的評価パラダイムである。
従来のブラックボックスのQAとは異なり、CRISPはメトリクス3Dシーングラフとオラクル介入プロトコルを使用して、潜在推論能力を知覚的ボトルネックから切り離す。
- 参考スコア(独自算出の注目度): 4.927307029246322
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current VLM evaluations often conflate language priors with genuine spatial reasoning. To address this, we introduce CRISP, a novel structural-diagnostic evaluation paradigm that assesses visual spatial intelligence through consistency, the alignment between implicit perception and explicit reasoning. Unlike traditional black-box QA, CRISP utilizes metric 3D Scene Graphs and an oracle intervention protocol to decouple latent reasoning capabilities from perceptual bottlenecks. This granular diagnosis uncovers a systematic perception-reasoning disconnect. Crucially, we reveal that while proprietary models possess robust latent reasoning engines, they suffer from inaccurate metric estimation and a critical failure to leverage their implicit structural representations. Conversely, open-source models remain fundamentally bottlenecked by their lack of multi-hop compositional reasoning. By shifting the focus from merely ``guessing correctly'' via language priors to genuinely ``perceiving, verifying, and reasoning,'' CRISP offers a rigorous roadmap for multimodal alignment beyond end-to-end post-training. The code and dataset are available at https://github.com/iiyamayuki/CRISP-Bench.
- Abstract(参考訳): 現在のVLM評価は、しばしば、真の空間的推論と言語先行を記述している。
そこで本研究では,一貫性,暗黙的知覚と明示的推論の整合性を通じて視覚空間知能を評価する,構造診断的評価パラダイムであるCRISPを紹介する。
従来のブラックボックスのQAとは異なり、CRISPはメトリクス3Dシーングラフとオラクル介入プロトコルを使用して、潜在推論能力を知覚的ボトルネックから切り離す。
この粒状診断により、系統的な知覚障害が発見される。
重要なことは、プロプライエタリなモデルは頑健な潜在推論エンジンを持っているが、不正確な計量推定と、その暗黙的な構造的表現を活用するための致命的な失敗に悩まされていることを明らかにする。
逆に、オープンソースのモデルは、マルチホップ構成的推論の欠如によって、基本的にボトルネックになっている。
単に‘guessing correct’から‘perceive, confirmeding, and reasoning’へとフォーカスを移すことで、CRISPはエンドツーエンドのポストトレーニングを超えて、マルチモーダルアライメントのための厳格なロードマップを提供する。
コードとデータセットはhttps://github.com/iiyamayuki/CRISP-Bench.comから入手できる。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs [44.74237674161132]
MLLM(Multimodal Large Language Models)における推論は、きめ細かい視覚認識と厳密な論理推論の両方を必要とする。
明示的なテキストベースのChain-of-Thought (CoT) は計算に高価であり、視覚幻覚を起こしやすい。
既存の潜在的推論手法は、通常、コストのかかる訓練を必要とする。
論文 参考訳(メタデータ) (2026-08-04T10:46:10Z) - Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models [61.89854422423702]
視覚言語モデル(VLM)は多くのタスクで優れるが、重要な情報が直接観測できない場合、空間的推論に苦慮する。
Inaginative Perception Tokens (IPT) は、VLMが知覚する空間構成を外部化する中間的知覚表現である。
IPTの監督は、空間的推論を一貫して改善し、しばしば思考訓練のテキスト連鎖よりも優れる。
論文 参考訳(メタデータ) (2026-06-02T17:59:17Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning [11.05919811646786]
本稿では,事前学習型MLLM計算の互換性拡張として遅延推論を開発する空間意味的基盤となるRIS(Retrieve,Integrate,Synthesize)を提案する。
RISは潜伏トークンを空間的および意味的な証拠の両方に固定し、進行的な注意ボトルネックを通じて因果的役割を強制し、翻訳された潜伏状態から語彙に整合した復号に戻すために短い言語遷移トークンを導入する。
論文 参考訳(メタデータ) (2026-05-08T01:33:58Z) - When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models [4.309108879640932]
VLM(Vision-Language Models)は、より強力な高感度アプリケーションである。
定期的に幻覚を呈し、入力に存在しない内容について自信を持って記述する。
これらの障害モードを幾何学的オーバーアライメントにトレースする。
本稿では,トレーニングフリー推論戦略とバイアス対応微調整パラダイムの2つの補完策を提案する。
論文 参考訳(メタデータ) (2026-05-07T10:09:18Z) - DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models [17.5535076530203]
オブジェクトレベルの幻覚は、視覚言語モデルにとって依然として中心的な信頼性の課題である。
構造的介入によりソースを分離する制御診断ベンチマークであるDO-Benchを紹介する。
対象幻覚は,集合的精度を超える不均一な機構に依存した障害パターンを反映していることを示す。
論文 参考訳(メタデータ) (2026-04-18T06:54:02Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs [65.04549036809557]
我々は、ステレオカメラ、LiDAR、IMU/GPSセンサーで撮影された歩行者の視線映像から構築したベンチマークを紹介する。
このデータセットは、計量的に正確な3D情報を提供し、空間的推論質問の自動生成を可能にする。
評価の結果、構造化屋内ベンチマークで観測された性能向上は、オープンワールド環境では消滅することが明らかとなった。
論文 参考訳(メタデータ) (2025-12-22T18:58:12Z) - Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective [17.592210658831902]
空間推論は、人間の知性の中核的な側面であり、3D環境における知覚、推論、計画を可能にする。
現在の視覚言語モデル(VLM)は、多視点設定における空間的推論のための幾何学的コヒーレンスとクロスビュー整合性を維持するのに苦労している。
本稿では,VLMが相補的な視点で空間的メンタルモデルを構築し,調整し,維持する方法を評価するための,認知的基盤を持つベンチマークであるReMindView-Benchを紹介する。
論文 参考訳(メタデータ) (2025-12-02T02:21:29Z) - Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas [69.56484419619919]
機械的解釈可能性のレンズによる空間的推論の課題について検討する。
空間的推論の成功は、実際の物体の位置と注意を一致させるモデルの能力と強く相関している。
本研究の目的は,ADAPTVISを用いて,信頼性の高い地域への注意を喚起することである。
論文 参考訳(メタデータ) (2025-03-03T17:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。