論文の概要: The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning
- arxiv url: http://arxiv.org/abs/2607.11436v2
- Date: Fri, 17 Jul 2026 15:34:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.115724
- Title: The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning
- Title(参考訳): マルチモーダルフォーカスの Ebb とフロー: 接地型 VLM 推論のためのビジュアルリレーウィンドウのスケジューリング
- Abstract要約: 視覚言語モデルはマルチモーダル推論ベンチマークでますます成功するが、言語スタックに入ると視覚的証拠が不安定になることが多い。
本稿では,軽量な学習モジュールを用いたタスク適応型推論時間制御フレームワークTRACEを提案する。
4つのオープンウェイトなVLMバックボーンと7つのベンチマークで、TRACEはグラウンドに敏感な設定で大きく向上している。
- 参考スコア(独自算出の注目度): 82.58503785830632
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models increasingly succeed on multimodal reasoning benchmarks, yet their visual evidence often becomes unstable once it enters the language stack, weakening evidence-grounded reasoning. To understand this fragility, we examine the internal dynamics of VLMs through a mechanistic lens and uncover a stable three-stage redistribution of multimodal attention focus across depth: an early question-conditioned organization, a critical middle visual-dominant relay, and a late return to answer formation. We operationalize the middle phase as the Visual Relay Window (VRW), and show that its geometry varies with task demand, is causally tied to grounded generation, and distinguishes unsupported answers from stronger reasoning trajectories. Guided by this internal rhythm, we propose TRACE, a task-adaptive inference-time control framework with lightweight trained modules. It reshapes relay allocation during prefill and preserves assembled visual support after handoff during decoding. Across four open-weight VLM backbones and seven benchmarks, TRACE delivers large gains on grounding-sensitive settings, improving them by 4.33 points on average and by up to 6.6 points, while also improving reasoning-heavy tasks. These results show that explicitly controlling multimodal focus across depth offers a unified and effective mechanism for strengthening evidence-grounded multimodal reasoning.
- Abstract(参考訳): 視覚言語モデルは多モーダル推論ベンチマークでますます成功するが、言語スタックに入ると視覚的エビデンスが不安定になり、エビデンスに基づく推論が弱まる。
この不安定性を理解するため, メカニスティックレンズを用いてVLMの内部動態を解析し, 早期質問条件付き組織, 重要な中級視覚優位リレー, 解答の遅返化という, マルチモーダル・アテンション・フォーカスの安定な3段階再分配を明らかにする。
我々は、中間フェーズをVisual Relay Window (VRW) として運用し、その幾何はタスク要求に応じて変化し、グラウンドドジェネレーションに因果的に結びついていることを示す。
この内部リズムによって導かれるTRACEは、軽量なトレーニングモジュールを備えたタスク適応型推論時間制御フレームワークである。
プリフィル中のリレーアロケーションを再設定し、デコード時のハンドオフ後に組み立てられた視覚的サポートを保存する。
4つのオープンウェイトなVLMバックボーンと7つのベンチマークで、TRACEはグラウンドに敏感な設定で大幅に改善し、平均4.33ポイント、最大6.6ポイントまで改善した。
これらの結果から,深度を横断するマルチモーダル焦点を明示的に制御することは,エビデンスに基づくマルチモーダル推論を強化する統一的かつ効果的なメカニズムをもたらすことが示唆された。
関連論文リスト
- Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds [12.841957617988148]
本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
論文 参考訳(メタデータ) (2026-08-21T14:40:26Z) - Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions? [34.294060886423985]
Reasoning Vision-Language Models (VLM) は複雑なマルチモーダルタスクにおいて高い性能を達成する。
我々はtextbfDistract-Bench を導入した。これは、textbfsemantic visual distraction に対する VLM の堅牢性を評価するベンチマークである。
以上の結果から,Distract-Benchは視力低下とは異なる堅牢性障害を呈することが明らかとなった。
論文 参考訳(メタデータ) (2026-06-08T00:40:32Z) - Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention [41.546578522790114]
検証可能な報奨付き強化学習(RLVR)は,大規模言語モデルにおける複雑な推論を促進するための有望なパラダイムとして登場した。
忠実なマルチモーダル推論の両面に対処するために,視覚的注意を固定し,強化するトレーニングフレームワークであるFithful-MR1を提案する。
論文 参考訳(メタデータ) (2026-05-21T07:10:18Z) - CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning [13.024838183478858]
視覚的推論のための視覚的エビデンスのためのCredit Assignment (CAVE)を提案する。
CAVEは3つの相補的推論プロセス信号を介して、アクションレベルでの中間ステップの寄与を評価する。
TRACER-Benchは4つの非局所的かつ意味論的に不確定な推論次元を包含する。
論文 参考訳(メタデータ) (2026-05-13T16:50:24Z) - Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning [65.15766304205657]
In-context Learning (ICL) は、大規模なモデルをいくつかの例を使ってタスクに適応させるが、視覚言語モデル(VLM)への拡張は脆弱である。
我々の分析によると、基本的な限界は帰納的ギャップにあり、モデルはしばしば欠陥のある推論から正しい答えを導き出す。
帰納的帰納的プロセスとしてマルチモーダル ICL を再構成する枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-04T09:18:19Z) - Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification [55.357038267439684]
Visual Re-Examination (VRE)は、MLLMが視覚的な入力を追加することなく推論中に自律的に視覚的イントロスペクションを実行することができる自己進化型トレーニングフレームワークである。
VREは推論精度と知覚信頼性を継続的に改善し、特にロングチェーン環境では幻覚を著しく低減する。
論文 参考訳(メタデータ) (2026-03-27T12:22:13Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs [55.61018839017648]
CoT(Chain-of- Thought)推論は、複雑な推論タスクにおいて、MLLM(Multimodal large language model)を大幅に改善した。
既存のアプローチは、主に長いテキスト推論軌道に依存し、安定した視覚的注意ポリシーを学ぶための限られたメカニズムを提供する。
地域レベルの視覚的注意に基づく報酬を導入する強化学習フレームワークを用いて訓練された視覚的推論モデルであるSAYOを提案する。
論文 参考訳(メタデータ) (2026-02-09T03:33:23Z) - Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning [53.790502697674754]
本稿では、画像入力を重要な推論段階に移行する戦略であるTake-Allong Visual Conditioning (TVC)を提案する。
TVCは、推論を通して視覚的なコンポーネントへの注意を維持するのに役立つ。
提案手法は,5つの数学的推論ベンチマークにおいて,最先端の性能を平均で達成する。
論文 参考訳(メタデータ) (2025-03-17T16:45:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。