論文の概要: Visual Access Boundaries in Vision-Language Model Reasoning
- arxiv url: http://arxiv.org/abs/2607.12815v2
- Date: Sat, 18 Jul 2026 02:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.40069
- Title: Visual Access Boundaries in Vision-Language Model Reasoning
- Title(参考訳): 視覚言語モデル推論における視覚的アクセス境界
- Abstract要約: チェーン・オブ・ソート(CoT)プロンプトは視覚言語モデル(VLM)のテスト時間スケーリング戦略として広く利用されている。
我々は,CoTは推論トレース全体を通して直接画像へのアクセスを長くすることで,主に性能を向上しないことを示す。
また、CoTゲインは知覚的読み出しによって制約されていることも示している。
- 参考スコア(独自算出の注目度): 23.49046016297019
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-Thought (CoT) prompting is widely used as a test-time scaling strategy for Vision-Language Models (VLMs), but it remains unclear what is extended when VLMs generate longer reasoning traces. We ask whether CoT requires continued access to image tokens, or whether it mainly operates over visual information already made available earlier in the forward pass. We introduce Visual Access Sweep, a causal intervention that masks attention from generated-token queries to image-token keys along layer depth and generation time, and define the Visual Access Boundary (VAB) as the minimal access region that preserves task accuracy. Across six model configurations from Qwen2.5-VL and InternVL3, both no-CoT direct answering and CoT prompting exhibit finite VABs. In Qwen2.5-VL-32B and InternVL3 at 14B and 38B scales, when CoT is evaluated against the no-CoT full-access target, its VAB layer differs from the no-CoT boundary by at most two layers, despite substantially longer generations. This suggests that CoT does not primarily improve performance by prolonging direct image-token access throughout the reasoning trace, but by extending language-side computation over image-derived hidden-state information. We further show that CoT gains are constrained by perceptual readout. CoT helps when the queried visual attribute can be reliably read out by the model, but not when that readout is unreliable. A symbolic-attribute oracle shows that CoT can improve counting once ground-truth attributes are supplied as text, while a single-object probe-vs-decode check shows that hard attributes can be linearly recoverable from hidden states yet difficult for the model itself to output. Together, these analyses place the bottleneck at readout rather than counting.
- Abstract(参考訳): チェーン・オブ・ソート(CoT)のプロンプトはビジョン・ランゲージ・モデル(VLM)のテスト時間スケーリング戦略として広く用いられているが、VLMが長い推論トレースを生成する際に何を拡張するのかは定かではない。
我々はCoTが画像トークンへの継続的なアクセスを必要としているのか、それとも前方パスで既に利用可能になっている視覚情報に対して主に動作するのかを問う。
本稿では,生成したクエリから層深度と生成時間に沿ってイメージトークンキーへの注意を隠蔽する因果的介入であるVisual Access Sweepを紹介し,タスクの正確性を維持する最小アクセス領域としてVisual Access境界(VAB)を定義する。
Qwen2.5-VLとInternVL3の6つのモデル構成のうち、No-CoT直接応答とCoTプロンプトの両方が有限VABを示す。
14Bと38BのQwen2.5-VL-32BとInternVL3では、CoTが非CoTのフルアクセスターゲットに対して評価されると、そのVAB層は実質的に長い世代にもかかわらず、少なくとも2つの層で非CoT境界と異なる。
これは、CoTが推論トレース全体を通して直接画像へのアクセスを長くするだけでなく、画像由来の隠れ状態情報よりも言語側での計算を拡張することによって、パフォーマンスを向上していることを示唆している。
さらに、CoTゲインは知覚的読み出しによって制約されていることを示す。
CoTは、クエリされたビジュアル属性をモデルによって確実に読み出すことができるが、その読み出しが信頼できない場合に役立ちます。
シンボル属性のオラクルは、CoTが1つの基本構造属性がテキストとして供給されたときのカウントを改善することができることを示しているが、一方、単一オブジェクトのプローブ-vs-デコードチェックは、ハード属性が隠れ状態から線形に回復可能であるが、モデル自体の出力が困難であることを示している。
これらの分析は、カウントするのではなく、リードアウトでボトルネックを発生させる。
関連論文リスト
- GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning [27.232897918541067]
連鎖推論は多モーダルな大言語モデルの問題解決能力を大幅に改善した。
しかし、微細な視覚的証拠は、テキストベースの推論ステップをまたいだ保存と再利用が難しいままである。
GLaQは、逐次ラテントロールアウトをコンテキスト条件付きクエリの固定セットに置き換える、接地型ラテントクエリフレームワークである。
論文 参考訳(メタデータ) (2026-08-16T04:01:08Z) - LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - Reading Between the Dots: Decoding Hidden Computation across Filler Tokens [7.203846680259872]
LLMはドットや数列のようなコンテンツフリーのフィラートークンに対して多段階の推論を実行でき、目に見えるチェーン・オブ・シークレット(CoT)を使わずに正しい回答を生成することができる。
これは行動監視の限界ケースであり、表面トークンは基礎となる推論に関する情報を一切持っていない。
隠れ状態のみを入力として取り出し、80~95%の精度で中間値を復元する教師なし復号パイプラインを導入する。
論文 参考訳(メタデータ) (2026-07-03T17:18:34Z) - Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference [13.079143204091705]
本研究は,解答可視的視点から視覚情報について検討し,解答可視的表現にはほとんど影響を与えず,後期視覚情報更新は大きいままであることを示す。
本稿では,余分な注意,FFN,あるいはその両方を選択的に回避しながら,完全な視覚情報シーケンスを保存する演算子レベルの視覚情報スキッピングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-30T16:08:29Z) - ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both [55.182037225013836]
ATLASは、単一の独立した「ワード」を機能トークンと呼び、エージェント操作と潜在視覚推論ユニットの両方として機能するフレームワークである。
ATLASは、明確な解釈可能性を維持しながら、挑戦的なベンチマークで優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T17:59:55Z) - ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models [59.94664910790462]
ResPruneは、大規模な視覚言語モデルのためのトレーニング不要のビジュアルトークンプルーニングフレームワークである。
視覚トークンのコンパクトだが情報に富むサブセットを選択する。
これは、計算、メモリ消費、推論遅延を効果的に削減する。
論文 参考訳(メタデータ) (2026-03-22T07:44:45Z) - All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs [43.80391827200227]
ディープレイヤでは、既存のトレーニングフリープルーニング手法はランダムプルーニングに勝る。
ビジュアルトークンは、ネットワーク深度の増加に伴い、徐々にサリエンスを失う。
深層層での単純なランダムプルーニングは性能と効率のバランスを効果的に表す。
論文 参考訳(メタデータ) (2025-12-08T14:16:01Z) - SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference [49.84148668264725]
SparseVILAは効率的なVLM推論のための新しいパラダイムであり、前処理と復号の段階で視覚空間を疎結合する。
AWQ最適化推論パイプライン上に構築されたSparseVILAは、プリフィルの最大4.0倍、デコーディングの2.5倍、長文ビデオタスクの2.6倍のエンドツーエンド高速化を実現している。
論文 参考訳(メタデータ) (2025-10-20T17:35:47Z) - Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization [69.29207684569695]
CoT推論は多モーダル大言語モデル(MLLM)の解釈可能性と問題解決能力を大幅に向上させる
既存のアプローチはテキストCoTに重点を置いており、視覚的手がかりを活用する能力を制限する。
本稿では、優先最適化による画像レベルのCoT推論のための新しいフレームワークであるUnsupervised Visual CoT (UV-CoT)を紹介する。
論文 参考訳(メタデータ) (2025-04-25T14:48:18Z) - QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension [86.0749609778104]
既存の大規模ビデオ言語モデルを拡張した,アンテホックなトレーニングフリーモジュールQuoTAを提案する。
QuoTAは、クエリ関連性に基づいて、フレームレベルの重要度スコアを戦略的に割り当てる。
クエリをChain-of-Thoughts推論で切り離し、より正確なLVLMベースのフレーム重要度スコアリングを容易にする。
論文 参考訳(メタデータ) (2025-03-11T17:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。