論文の概要: LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- arxiv url: http://arxiv.org/abs/2607.01707v1
- Date: Thu, 02 Jul 2026 04:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.676921
- Title: LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- Title(参考訳): レーザー:視覚注意保存とシンク抑制によるLVLM用矯正レンズ
- Abstract要約: 大規模視覚言語モデル(LVLM)は、強い推論能力を示すが、長い水平デコーディング中に視覚的忘れを被る。
本稿では,推論中の視覚的注意軌跡と視覚的トークン内注意分布を制御した後学習フレームワークLASERを提案する。
8つのベンチマークデータセットの実験は、LASERが強いベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 50.454633334898396
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large vision-language models (LVLMs) exhibit strong reasoning ability but suffer from visual forgetting during long-horizon decoding, where attention progressively drifts away from visual evidence. Existing methods largely treat this issue as a late-stage attention decay problem or attempt to mitigate it through heuristic reminders or post-hoc attention lifting. Through systematic empirical analysis, we find that performance degradation under visual forgetting is largely driven by two overlooked factors: early-stage attention decay disrupts evidence acquisition, and attention concentration on a subset of task-irrelevant visual sink tokens. Motivated by these insights, we propose LASER, a post-training framework that regulates both the visual attention trajectory and intra-visual token attention distribution during reasoning. Technically, LASER introduces two complementary rewards: a Visual Grounding Reward, which encourages the model to maintain attention on semantically salient visual tokens throughout decoding, and a Sink Suppression Reward, which penalizes excessive attention concentration on visual sink tokens. Together, these rewards preserve early-stage grounding while preventing attention collapse onto uninformative regions. Extensive experiments on eight benchmark datasets demonstrate that LASER consistently outperforms strong baselines, validating attention-aware training as an effective remedy for visual forgetting.
- Abstract(参考訳): 大規模視覚言語モデル(LVLM)は、強い推論能力を示すが、長い水平デコーディング中に視覚的忘れを被る。
既存の方法は、この問題を後期の注意崩壊問題として扱うか、ヒューリスティックなリマインダーやポストホックな注意喚起によって緩和しようとするものである。
系統的な実証分析により、視覚的忘れ込みによる性能劣化は、早期の注意減衰が証拠取得を阻害し、タスク非関連の視覚的シンクトークンのサブセットに注意集中が集中する2つの見落された要因によって大きく引き起こされていることが判明した。
これらの知見に触発されて、推論中の視覚的注意軌跡と視覚的トークン内注意分布の両方を規制する後学習フレームワークLASERを提案する。
技術的に、LASERは2つの補完的な報酬を導入する: 視覚的グラウンドング・リワード(Visual Grounding Reward)は、デコード全体を通して意味論的に健全な視覚的トークンに注意を向けることを奨励するモデルと、視覚的シンクトークンに過度な注意集中を罰するシンク抑制・リワード(Sink Suppression Reward)である。
これらの報酬は、未発達領域への注意崩壊を防ぎつつ、早期の接地を維持できる。
8つのベンチマークデータセットに対する大規模な実験は、LASERが強いベースラインを一貫して上回り、視覚的忘れの効果的な治療法として注意認識トレーニングを検証していることを示している。
関連論文リスト
- See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory [24.777344301465064]
幻覚は人のような注意をそらす現象と強く結びついている。
本稿では,注目度向上による注意の注意散らしを補正する,改善されたイメージ知覚のための注意焦点付きアプローチを提案する。
論文 参考訳(メタデータ) (2026-05-23T14:36:06Z) - LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models [8.039490357019801]
VLM(Vision-Language Models)は近年,視覚的理解と推論において顕著な能力を示した。
また、長い視覚的シーケンス入力による計算負荷も大きい。
近年の研究では、重要でない視覚トークンを抽出し、計算量を大幅に削減することでこの問題に対処している。
論文 参考訳(メタデータ) (2026-04-27T01:56:59Z) - Visually-Guided Policy Optimization for Multimodal Reasoning [60.035908460318126]
本稿では,VGPO(Visually-Guided Policy Optimization)を提案する。
VGPOは当初、視覚的類似性を活用して視覚的手がかりをローカライズし増幅する視覚的注意補償機構を導入した。
VGPOは、数学的多モーダル推論や視覚依存タスクにおいて、より優れた視覚的活性化と優れた性能を実現する。
論文 参考訳(メタデータ) (2026-04-10T14:22:38Z) - Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models [8.304027910542446]
大規模視覚言語モデル(LVLM)における視覚エンコーダの内部的注意ダイナミクスについて検討する。
分析の結果,幻覚の挙動は集中期において注目度が低いトークンに特に敏感であることが判明した。
本稿では、フォーカスフェーズにおいて、このようなトークンを選択的に抑制する軽量な推論時間介入を提案する。
論文 参考訳(メタデータ) (2026-04-04T02:46:58Z) - Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation [50.51650162235191]
本稿では,認知的推論を視覚的注意の動的応答性としてモデル化することにより,この慣性パターンを破る訓練のない慣性認識型視覚興奮(IVE)法を提案する。
IVEは様々な基礎MLLMと複数の幻覚ベンチマーク、特に認知幻覚に有効である。
論文 参考訳(メタデータ) (2026-04-02T12:51:07Z) - Attention to details, logits to truth: visual-aware attention and logits enhancement to mitigate hallucinations in LVLMs [12.578567672069601]
本稿では,タスク関連トークンの注意力を高めるための学習自由注意介入アルゴリズムを提案する。
視覚的トークンの寄与を高めるため,ビーム探索復号法に視覚的注意値を注入し,より高い視覚的注意力を持つ解を同定する。
論文 参考訳(メタデータ) (2026-02-10T08:26:50Z) - Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning [79.34909830834464]
VLM(Vision-Language Models)は様々な視覚的タスクで顕著な成功を収めているが、複雑な視覚環境では性能が低下している。
視覚的複雑性は、注意エントロピーと強く相関し、推論性能に悪影響を及ぼすことを示す。
本稿では,CARVE(Contrastive Attention Refinement for Visual Enhancement)を提案する。
論文 参考訳(メタデータ) (2025-09-08T09:20:04Z) - Attention Hijackers: Detect and Disentangle Attention Hijacking in LVLMs for Hallucination Mitigation [123.54980913741828]
LVLM(Large Vision-Language Models)は幻覚に弱い。
AID(Attention HIjackers Detection and Disentanglement)と呼ばれる新しい非トレーニング型戦略を提案する。
AIDは、命令駆動の視覚的サリエンスを計算することによって、意図的ヒジャッカーを特定する。
次に、これらの特定されたヒジャッカーの視覚的注意を隠蔽するために注意散らし機構を提案する。
Re-Disentanglementは、過剰なマスキング効果を避けるために、命令駆動と画像駆動の視覚的サリエンスの間のバランスを再計算する。
論文 参考訳(メタデータ) (2025-03-11T09:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。