論文の概要: See2Think: Do Multimodal Models Really Use Intermediate Visual States?
- arxiv url: http://arxiv.org/abs/2607.26769v1
- Date: Wed, 29 Jul 2026 11:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.64763
- Title: See2Think: Do Multimodal Models Really Use Intermediate Visual States?
- Title(参考訳): See2Think: マルチモーダルモデルは中間的なビジュアルステートを実際に使っているか?
- Authors: Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang,
- Abstract要約: See2ThinkBenchとVisual Action-of-Thought (VAoT)を組み合わせた統合評価フレームワークであるSeee2Thinkを紹介する。
VAoTは4つの制御された推論設定の下で、テキストの思考、視覚行動、レンダリングされた状態、およびその後の推論を記録する。
視覚的推論はモデルに依存し、環境に依存しており、タスク間で一貫した1つの設定が支配的でないことが分かっています。
- 参考スコア(独自算出の注目度): 12.082470543980422
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models increasingly use sketches, annotations, tools, and intermediate images during reasoning, but it remains unclear whether they truly rely on these visual states. Existing benchmarks are limited both by task collections with narrow coverage or partially text-solvable samples and by evaluations that emphasize final answers without diagnosing how intermediate visual states are generated, rendered, and used. We introduce See2Think, a unified evaluation framework comprising See2ThinkBench and Visual Action-of-Thought (VAoT). See2ThinkBench contains 1,200 open-ended, visually dependent problems across 12 task categories spanning 2D structured, 3D scene, and real-world reasoning. VAoT records textual thoughts, visual actions, rendered states, and subsequent reasoning under four controlled inference settings. Evaluating representative proprietary and open-source multimodal models, we find that visual reasoning is strongly model- and environment-dependent, with no single setting consistently dominating across tasks. Process analysis further shows that models usually select relevant visual operations, while faithful rendering remains the clearest bottleneck and high feedback uptake does not necessarily translate into accuracy gains. Under task-relevant corrupted feedback, models exhibit behavioral dependence on visual states, with accuracy dropping by over 10 percentage points in controlled interventions.
- Abstract(参考訳): マルチモーダルな大規模言語モデルは、推論中にスケッチ、アノテーション、ツール、中間画像を使用する傾向にあるが、それらが真の視覚状態に依存しているかどうかは不明である。
既存のベンチマークは、カバー範囲が狭いタスクコレクションや部分的なテキスト解決可能なサンプル、中間的な視覚状態の生成、レンダリング、使用の診断なしに最終回答を強調する評価の両方によって制限されている。
See2ThinkBenchとVisual Action-of-Thought (VAoT)を組み合わせた統合評価フレームワークであるSeee2Thinkを紹介する。
See2ThinkBenchには、1200のオープンエンドで視覚的に依存する問題があり、2D構造化、3Dシーン、現実世界の推論にまたがる12のタスクカテゴリにまたがっている。
VAoTは4つの制御された推論設定の下で、テキストの思考、視覚行動、レンダリングされた状態、およびその後の推論を記録する。
代表的なプロプライエタリおよびオープンソースマルチモーダルモデルを評価すると、視覚的推論はモデルに依存し、環境に依存しており、タスク間で一貫した一貫した設定が存在しないことが分かる。
プロセス分析は、モデルが通常、関連する視覚的操作を選択することを示しているが、忠実なレンダリングは依然として最も明確なボトルネックであり、高いフィードバックの獲得は必ずしも精度の向上に変換されない。
タスク関連フィードバックの下では、モデルが視覚状態への行動依存を示し、制御された介入において精度が10パーセント以上低下する。
関連論文リスト
- Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models [14.5102059776721]
MLLM(Multimodal Large Language Models)は、事前訓練された言語モデルの豊富な事前情報と視覚入力を統合することで、高い性能を達成する。
しかし、視覚的な証拠が事前訓練された知識と矛盾する場合、視覚中心のタスクでは失敗することが多い。
2つの診断パラダイムを用いてこれらの障害を探索する。(1)視覚情報が利用可能かどうかの探索、(2)画像再構成、(2)マルチモーダルコンテキスト感度の測定である。
論文 参考訳(メタデータ) (2026-07-28T22:52:34Z) - Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)? [72.2500547961037]
空間推論は視覚言語モデル(VLM)が現実世界の環境に展開する基本的な能力である。
対象情報を隠蔽するオクルージョン(Occlusion)と、誤解を招く視覚的手がかりを生成する視点曖昧性(spective ambiguity)の2つのタイプの観察課題を紹介した。
各構成について、クリーンな観察では答えられるが、導入した課題では無視する必要がある空間的質問を設計する。
論文 参考訳(メタデータ) (2026-05-28T20:44:47Z) - Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images [34.324634481264034]
我々は、忠実な視覚的推論を評価するために設計されたプロセス検証可能なベンチマークであるViEBenchを提案する。
専門家による視覚的エビデンスを含む200個の高解像度画像を合成し、ViEBenchは難易度でタスクを知覚と推論の次元に分類する。
実験の結果,(1)VLMは無関係な領域に接するにもかかわらず,正しい最終回答を導き出すことができ,(2)正しい証拠を見つけることはできるが,正確な結論に至らなかった。
論文 参考訳(メタデータ) (2026-01-14T07:25:15Z) - When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought [118.71264263478083]
MIRAは,中間画像の生成が推論の成功に不可欠であるシナリオにおいて,モデルを評価するために設計された新しいベンチマークである。
546のマルチモーダル問題を含み、中間画像と最終回答が注釈付きである。
論文 参考訳(メタデータ) (2025-11-04T18:00:51Z) - BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception [67.89135437537179]
我々は視覚中心の推論ベンチマークであるBLINK-Twiceを紹介した。
外部の知識に頼るのではなく、私たちのタスクは視覚的コンテンツのみから推論するモデルを必要とします。
事前の知覚ベンチマークと比較すると、浅い知覚を超越し、きめ細かい観察と分析的推論を必要とする。
論文 参考訳(メタデータ) (2025-10-10T13:14:13Z) - SpatialViz-Bench: An MLLM Benchmark for Spatial Visualization [44.427830927596204]
SpaceViz-Benchは4つのサブ能力にまたがる12のタスクを持つ空間視覚化のための総合的なベンチマークである。
33種類の最先端MLLMを評価した結果,多彩な性能の変動がみられ,反直感的な結果が得られた。
論文 参考訳(メタデータ) (2025-07-10T10:27:20Z) - Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit Maps [56.76175383189738]
MLLMの詳細な視覚的理解と空間的推論能力を評価するためのベンチマークであるReasonMapを紹介する。
ReasonMapには、13か国30都市からの高解像度のトランジットマップが含まれており、2つの質問タイプと3つのテンプレートにまたがる1008の質問応答ペアが含まれている。
基本および推論変種を含む15種類のMLLMの包括的評価は、直感的パターンを示す。
論文 参考訳(メタデータ) (2025-05-24T12:33:52Z) - VHELM: A Holistic Evaluation of Vision Language Models [75.88987277686914]
視覚言語モデル(VHELM)の全体的評価について述べる。
VHELMは、視覚的知覚、知識、推論、バイアス、公平性、多言語性、堅牢性、毒性、安全性の9つの側面の1つ以上をカバーするために、さまざまなデータセットを集約する。
私たちのフレームワークは軽量で自動で、評価の実行が安価で高速に行えるように設計されています。
論文 参考訳(メタデータ) (2024-10-09T17:46:34Z) - LOIS: Looking Out of Instance Semantics for Visual Question Answering [17.076621453814926]
画像中のオブジェクトの意味論の因果関係を理解するために,ボックス境界のないモデルフレームワークを提案する。
我々は、インスタンスオブジェクトと背景情報の間のより洗練された、より深い視覚的意味関係をモデル化するための相互関係注意モジュールを実装した。
提案するアテンションモデルにより,重要な単語関連質問に焦点をあてることで,より健全な画像領域を解析することができる。
論文 参考訳(メタデータ) (2023-07-26T12:13:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。