論文の概要: Pathways of Visual Information Flow in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.03358v1
- Date: Fri, 03 Jul 2026 14:15:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.597865
- Title: Pathways of Visual Information Flow in Vision-Language Models
- Title(参考訳): 視覚言語モデルにおける視覚情報の流れ
- Authors: Israfel Salazar, Stella Frank, Dan Oneata, Desmond Elliott, Constanza Fierro,
- Abstract要約: 視覚言語モデル(VLM)における視覚情報の経路について検討する。
モデルは視覚的タスクを解決するために2つの異なる経路に依存している。
- 参考スコア(独自算出の注目度): 22.018918502334923
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study how visual information is routed in vision-language models (VLMs). Using causal patching on controlled synthetic and natural datasets, we find that models rely on two distinct pathways to solve visual tasks: A direct pathway, where visual information is retained in image token representations and read out by the final token at later layers, and a text-mediated pathway, where visual information is first transferred to the query tokens and then read out by the final token. Across three visual tasks, we show that pathway selection is task-dependent, and that data distribution and prompt design can also modulate which pathway is used to solve the image-based query. Moreover, using attention knockouts and corrupted-input patching, we find that these pathways are flexible, under certain interventions, models can rely on the text-mediated pathway as a fallback when the usual pathway is ablated. This behavior unifies findings in prior work and shows that ablation-based interventions can reveal what models could do rather than what they normally do. Together, our results provide a mechanistic characterization of visual information flow in VLMs and highlight the flexibility of their internal mechanisms under intervention.
- Abstract(参考訳): 視覚情報がどのように視覚言語モデル(VLM)にルートされるかを検討する。
直接経路 – 画像トークン表現に視覚情報が保持され、後層で最終トークンによって読み出される経路, およびテキスト経由経路 – 視覚情報が最初にクエリトークンに転送され、最後にトークンによって読み出される経路 – である。
3つの視覚的タスクにわたって、経路選択はタスク依存であり、また、データ分散とプロンプト設計は、どの経路を用いて画像ベースのクエリを解くかも調節可能であることを示す。
さらに、注意ノックアウトと破損した入力パッチを用いて、これらの経路はフレキシブルであり、ある介入の下では、通常の経路が廃止されるときのフォールバックとしてテキスト媒介経路に依存することができる。
この行動は、事前の作業における発見を統一し、アブレーションに基づく介入が、通常よりもモデルにできることを明らかにすることができることを示す。
本研究は,VLMにおける視覚情報フローの力学的特徴と介入時の内部機構の柔軟性を明らかにするものである。
関連論文リスト
- Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking [53.08526613328243]
教師なしの視覚的オブジェクト追跡は、地味なアノテーションをトレーニングすることなく、任意のターゲットをビデオで追従する必要がある難しいタスクである。
我々はテキストから画像への拡散モデルを構築し、事前訓練されたモデルに符号化されたリッチな意味知識を活用する。
我々の方法Diff-Trackingは、初期プロンプト学習者とオンラインプロンプト更新者という2つの主要コンポーネントから構成されている。
論文 参考訳(メタデータ) (2026-05-26T12:26:56Z) - Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow [9.561772135477883]
LVLM(Large Vision-Language Models)は同じアーキテクチャに従っており、視覚情報は徐々に意味表現に統合される。
我々は,モデルの注意分布が意味表現に十分に重点を置いていないことを観察する。
このミスアライメントはモデルの視覚的理解能力を損なうものであり、幻覚に寄与する。
論文 参考訳(メタデータ) (2025-05-20T12:10:13Z) - Top-Down Guidance for Learning Object-Centric Representations [30.06924788022504]
Top-Down Guided Network (TDGNet)は、オブジェクト中心の表現を改善するためのトップダウンパスである。
TDGNetは、様々な複雑さを持つ複数のデータセットにおいて、現在のオブジェクト中心モデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2024-05-17T07:48:27Z) - VISIT: Visualizing and Interpreting the Semantic Information Flow of
Transformers [45.42482446288144]
近年の解釈可能性の進歩は、トランスフォーマーベース言語モデルの重みと隠れ状態を語彙に投影できることを示唆している。
LMアテンションヘッドとメモリ値、モデルが与えられた入力を処理しながら動的に生成し、リコールするベクトルについて検討する。
対話型フローグラフとして生成事前学習変換器(GPT)の前方通過を可視化するツールを作成する。
論文 参考訳(メタデータ) (2023-05-22T19:04:56Z) - Can Pre-trained Vision and Language Models Answer Visual
Information-Seeking Questions? [50.29862466940209]
情報検索に適した視覚的質問応答データセットであるInfoSeekを紹介する。
事前学習した様々な視覚的質問応答モデルを分析し,その特徴について考察する。
関連文書を検索することでInfoSeekの性能を向上させるために,正確な視覚的実体認識が利用できることを示す。
論文 参考訳(メタデータ) (2023-02-23T00:33:54Z) - Interpretable agent communication from scratch(with a generic visual
processor emerging on the side) [29.722833768572805]
我々は、2つのディープネットをスクラッチからトレーニングし、教師なし緊急通信を通じて現実的な参照識別を行う。
ほぼ解釈可能な創発的プロトコルにより、トレーニング時に見なかったオブジェクトタイプであっても、ネットがうまく通信できることが示される。
以上の結果から,従来考えられていたよりも現実的な状況下での(解釈可能な)深層ネット通信の実現可能性に関する具体的な証拠が得られた。
論文 参考訳(メタデータ) (2021-06-08T11:32:11Z) - Transductive Zero-Shot Learning by Decoupled Feature Generation [30.664199050468472]
本稿では,未確認のクラスからの未表示の視覚データを利用できるトランスダクティブ・セッティングに着目する。
本稿では,現実的な視覚的特徴を生成し,意味的属性を視覚的手がかりに変換するタスクを分離することを提案する。
本研究は,提案手法の有効性を解明する上で,関連する最先端技術に対する優位性を実証するための詳細なアブレーション研究である。
論文 参考訳(メタデータ) (2021-02-05T16:17:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。