論文の概要: Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2607.02593v1
- Date: Wed, 01 Jul 2026 08:03:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.343658
- Title: Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation
- Title(参考訳): マルチモーダルLDMの知識蒸留のためのトークンレベル対応視覚的注意誘導
- Abstract要約: token-level Response-visual Attention Guidance (TRAG)を紹介する。
TRAGは、フォーカスをレスポンス・ツー・ビジョンの信号にシフトし、トークン固有の目的を使用する。
複数のベンチマークによる実験結果から,TRAGは蒸留前のベースラインを著しく上回ることがわかった。
- 参考スコア(独自算出の注目度): 36.9736177938003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While knowledge distillation (KD) is widely adopted for training lightweight models by leveraging supervision from larger teacher models, relying solely on output token distributions has proven insufficient for compressing Multimodal Large Language Models (MLLMs). Since output tokens are a byproduct of the model attending to visual inputs, prior works have explored explicitly distilling attention to provide a direct supervisory signal. While promising, the precise utility of which attention signals to distill remains under-explored. In this work, we challenge the conventional reliance on prompt-to-vision attention by revealing that downstream performance correlates strongly with response-to-vision attention similarity to the teacher, but negligibly with that of prompt-conditioned attention. Furthermore, we observe that attention distributions exhibit significant variance across individual tokens, indicating that a uniform distillation objective is suboptimal. To this end, we introduce Token-level Response-visual Attention Guidance (TRAG), a distillation objective that 1) shifts the focus to response-to-vision signals and 2) employs token-specific objectives by adaptively weighting the Kullback-Leibler divergence based on attention entropy, effectively guiding the student to mirror the teacher's precise visual focus. Extensive experimental results on multiple benchmarks demonstrate that TRAG significantly outperforms prior distillation baselines.
- Abstract(参考訳): 知識蒸留(KD)は、より大きな教師モデルからの指導を活かして軽量モデルの訓練に広く採用されているが、出力トークン分布のみに依存することは、MLLM(Multimodal Large Language Models)の圧縮には不十分であることが証明されている。
出力トークンは視覚入力に対応するモデルの副産物であるため、先行研究は直接監督信号を提供するために注意を明示的に蒸留することを模索してきた。
有望な一方で、蒸留のための注意信号の正確な有用性は未調査のままである。
本研究は,教師と教師の対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物対物関係が強く関連していることを明らかにすることで,従来の対物対物対物対物対応に挑戦する。
さらに,注目分布は個々のトークン間で有意なばらつきを示し,一様蒸留目標が最適以下であることが示唆された。
この目的のために, 蒸留目標であるTOG(Token-level Response-visual Attention Guidance)を導入する。
1) 焦点をレスポンス・ツー・ビジョン信号にシフトし、
2) 注意エントロピーに基づくKulback-Leiblerの分岐を適応的に重み付けし, 学生に効果的に教師の正確な視覚的焦点を反映させることにより, トークン固有の目的を取り入れた。
複数のベンチマークによる実験結果から,TRAGは蒸留前のベースラインを著しく上回ることがわかった。
関連論文リスト
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression [50.454633334898396]
大規模視覚言語モデル(LVLM)は、強い推論能力を示すが、長い水平デコーディング中に視覚的忘れを被る。
本稿では,推論中の視覚的注意軌跡と視覚的トークン内注意分布を制御した後学習フレームワークLASERを提案する。
8つのベンチマークデータセットの実験は、LASERが強いベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-02T04:59:56Z) - Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction [42.23525789989544]
MLLM(Multimodal Large Language Models)において、しばしば注意がモデルによって引き起こされる。
我々は,タスク条件付き注意をモデル誘発前と区別するために,事前補正トークン削減(PriorTR)を提案する。
PriorTRは、強いトレーニングのないベースラインよりも精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-06-23T05:24:50Z) - From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning [72.4876727619987]
推論性能は視覚注意スコア(VAS)と強く相関していることがわかった。
その因果的役割を検証するため、推論中の注意配分を直接調整する訓練不要な介入を設計する。
本研究では、視覚的アンコールデータ合成、注意誘導目的、視覚的アンコール報酬形成を統合した総合的なコールドスタートフレームワークである注意誘導視覚アンコールとリフレクションを提案する。
論文 参考訳(メタデータ) (2026-03-04T08:22:27Z) - A Statistical Theory of Gated Attention through the Lens of Hierarchical Mixture of Experts [80.98474052840929]
ゲーテッドアテンションは、標準アテンションにおける低ランクマッピングの表現性を高めることを実証的に実証されている。
有向注意行列や多頭部自己注意行列の各項目は、専門家の階層的な混合として記述できることを示す。
論文 参考訳(メタデータ) (2026-02-01T22:22:13Z) - Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning [62.23671919314693]
大規模言語モデル (LLM) は文脈理解において著しく改善されている。
しかし、長いコンテキストの推論と生成の間に真に重要な情報に出席する能力は、まだペースの遅れています。
本稿では,2段階のフレームワークであるLearning to Focus(LeaF)を導入し,コンバウンディング要因を緩和する。
論文 参考訳(メタデータ) (2025-06-09T15:16:39Z) - Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models [32.71672086718058]
CoT (Few-shot Chain-of-Thought) は大規模言語モデル (LLM) の推論能力を著しく向上させる
我々は、COTのデモで分離されたセグメント、単語、トークンが、予期せずLCMの生成過程を乱す可能性があることを観察する。
デモの注意パターンを動的に解析し,これらのトークンを正確に識別するFew-shot Attention Intervention法(FAI)を提案する。
論文 参考訳(メタデータ) (2025-03-14T07:46:33Z) - Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration [15.36841874118801]
我々は,大規模言語モデル(LLM)における注意シンクの存在をより深く理解することを目的としている。
本研究では,入力適応方式で推論中のハエの注意分布を自動的に最適化する訓練自由注意法(ACT)を提案する。
ACTは、Llama-30Bに適用した場合、異なるデータセット間で平均7.30%の精度向上を達成する。
論文 参考訳(メタデータ) (2024-06-22T07:00:43Z) - Using Early Readouts to Mediate Featural Bias in Distillation [30.5299408494168]
ディープネットワークは、現実世界の教師付き学習タスクにおいて、突発的な特徴ラベル相関を学習する傾向がある。
本稿では,従来のネットワーク層からの表現を用いてラベルを予測しようとする新しい早期読み出し機構を提案する。
論文 参考訳(メタデータ) (2023-10-28T04:58:15Z) - SparseBERT: Rethinking the Importance Analysis in Self-attention [107.68072039537311]
トランスフォーマーベースのモデルは、その強力な能力のために自然言語処理(NLP)タスクに人気がある。
事前学習モデルの注意マップの可視化は,自己着脱機構を理解するための直接的な方法の一つである。
本研究では,sparsebert設計の指導にも適用可能な微分可能アテンションマスク(dam)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-02-25T14:13:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。