論文の概要: Large Vision-Language Models Get Lost in Attention
- arxiv url: http://arxiv.org/abs/2605.05668v1
- Date: Thu, 07 May 2026 04:45:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.520199
- Title: Large Vision-Language Models Get Lost in Attention
- Title(参考訳): 大型ビジョンランゲージモデル、注意を逸脱
- Authors: Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang,
- Abstract要約: 本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
- 参考スコア(独自算出の注目度): 51.851592109135716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite the rapid evolution of training paradigms, the decoder backbone of large vision--language models (LVLMs) remains fundamentally rooted in the residual-connection Transformer architecture. Therefore, deciphering the distinct roles of internal modules is critical for understanding model mechanics and guiding architectural optimization. While prior statistical approaches have provided valuable attribution-based insights, they often lack a unified theoretical basis. To bridge this gap, we propose a unified framework grounded in information theory and geometry to quantify the geometric and entropic nature of residual updates. Applying this unified framework reveals a fundamental functional decoupling: Attention acts as a subspace-preserving operator focused on reconfiguration, whereas FFNs serve as subspace-expanding operators driving semantic innovation. Strikingly, further experiments demonstrate that replacing learned attention weights with predefined values (e.g., Gaussian noise) yields comparable or even superior performance across a majority of datasets relative to vanilla models. These results expose severe misallocation and redundancy in current mechanisms, suggesting that state-of-the-art LVLMs effectively ``get lost in attention'' rather than efficiently leveraging visual context.
- Abstract(参考訳): 訓練パラダイムの急速な進化にもかかわらず、大規模な視覚言語モデル(LVLM)のデコーダバックボーンは、残差接続トランスフォーマーアーキテクチャに根ざしている。
したがって、内部モジュールの異なる役割を解読することは、モデル力学を理解し、アーキテクチャ最適化を導く上で重要である。
それまでの統計学的アプローチは、価値ある帰属に基づく洞察を与えてきたが、それらはしばしば統一された理論的基盤を欠いている。
このギャップを埋めるために,情報理論と幾何に基づく統一的な枠組みを提案し,残差更新の幾何学的・エントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース保存演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース拡張演算子として機能します。
興味深いことに、学習された注意重みを事前定義された値(例えばガウスノイズ)に置き換えることによって、バニラモデルに対するほとんどのデータセットで同等またはそれ以上のパフォーマンスが得られることが、さらなる実験で示されている。
これらの結果から,現状のLVLMは視覚的文脈を効果的に活用するよりも,効果的に「注意を失う」ことが示唆された。
関連論文リスト
- Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models [51.45122910254346]
強化学習(RL)に基づくポストトレーニングは、トレーニングドメインを超えた大規模言語モデルの推論性能を改善することが多い。
Supervised Fine-tuning (SFT) はしばしば一般的な忘れる能力をもたらす。
制御された実験装置を用いてRL一般化を探索する特徴レベル力学解析手法を提案する。
論文 参考訳(メタデータ) (2026-04-27T21:22:34Z) - Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory [0.0]
この論文は、現代のディープラーニング、信頼性、効率性において、永続的で密接に関連する2つの課題に対処する。
層と入力間の隠れアクティベーションの固有値ダイナミクスを解析することにより、スペクトル統計学がモデル挙動にコンパクトで安定で解釈可能なレンズを提供することを示す。
このフレームワーク内では、最初のコントリビューションであるEigenTrackが、大規模言語と視覚言語モデルにおける幻覚とアウト・オブ・ディストリビューションの振る舞いをリアルタイムに検出する手法を導入した。
第二の貢献である RMT-KD は、ランダム行列理論知識蒸留によるディープネットワークの圧縮に対する原則的なアプローチを示す。
論文 参考訳(メタデータ) (2026-02-25T19:11:56Z) - Deep Neural Networks as Iterated Function Systems and a Generalization Bound [2.7920304852537536]
2つの重要なディープアーキテクチャは、場所に依存したIFSとみなすことができるか、あるいは正統に関連付けられるかを示す。
データ分布と画像間のコラージュ型近似誤差を制御する生成モデリングのためのワッサーシュタイン境界を導出する。
論文 参考訳(メタデータ) (2026-01-27T07:32:49Z) - CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems [29.385460126069386]
我々は、キュレートされたデータセットと認知駆動型質問応答アノテーションを統合した新しいベンチマーク、CogRailを紹介した。
このベンチマークに基づいて、我々は最先端のビジュアル言語モデルの体系的な評価を行う。
本稿では,3つの中核的タスク,位置知覚,移動予測,脅威分析を統合したファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-14T16:36:26Z) - Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning [9.233407096706744]
本研究では, 動的ヘッドの自己保持機構に, 構造的インダクティブ先行を導入する。
Atari 100kベンチマークの実験では、ほとんどの効率向上がガウス以前の結果から生じることが示されている。
論文 参考訳(メタデータ) (2025-11-10T10:53:16Z) - Weight Spectra Induced Efficient Model Adaptation [54.8615621415845]
微調整された大規模な基礎モデルは、計算コストを禁ずる。
微調整が最上位特異値を大きく増幅する一方で,残りはほとんど無傷であることを示す。
本稿では,トップ特異方向の学習可能な再スケーリングを利用する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-05-29T05:03:29Z) - Mechanistic Interpretability of GPT-like Models on Summarization Tasks [2.4022340214033915]
本稿では,GPTライクなモデルが要約タスクにどのように適応するかを解析するための解釈可能性フレームワークを提案する。
重要な変換を行う特定のレイヤとアテンションヘッドを識別することにより、モデルアーキテクチャ内の"要約回路"を見つける。
論文 参考訳(メタデータ) (2025-05-20T02:15:11Z) - Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition [89.50068130832635]
自己改善認知 (SIcog) は、マルチモーダル知識によって次世代のMLLMを構築するための自己学習フレームワークである。
ステップバイステップの視覚的理解のためのChain-of-Descriptionを提案し、詳細なマルチモーダル推論をサポートするために構造化されたChain-of-Thought(CoT)推論を統合する。
実験は、マルチモーダル認知を増強したMLLMの開発におけるSIcogの有効性を示す。
論文 参考訳(メタデータ) (2025-03-16T00:25:13Z) - Interpreting and Improving Attention From the Perspective of Large Kernel Convolution [51.06461246235176]
本稿では,LKCA(Large Kernel Convolutional Attention)について紹介する。
LKCAは、特にデータ制約のある設定において、様々な視覚的タスク間での競合性能を達成する。
論文 参考訳(メタデータ) (2024-01-11T08:40:35Z) - INFOrmation Prioritization through EmPOWERment in Visual Model-Based RL [90.06845886194235]
モデルベース強化学習(RL)のための修正目的を提案する。
相互情報に基づく状態空間モデルに,変分エンパワーメントにインスパイアされた用語を統合する。
本研究は,視覚に基づくロボット制御作業における自然な映像背景を用いたアプローチの評価である。
論文 参考訳(メタデータ) (2022-04-18T23:09:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。