論文の概要: Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2606.30168v1
- Date: Mon, 29 Jun 2026 11:44:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.207948
- Title: Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルにおける視覚冗長性低減のための潜時雑音マスク
- Authors: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li,
- Abstract要約: MLLM(Multimodal large language model)は、しばしば細粒度の視覚的推論において失敗する。
質問条件付き視覚的エビデンス浄化フレームワークであるLatEnt Noise maSk (Lens)を提案する。
視覚トークンが現在の質問をサポートし、復号時にそれらを保存するレンズスコア。
- 参考スコア(独自算出の注目度): 56.11961584000622
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) often fail in fine-grained visual reasoning, as question-relevant visual cues are diluted by dense and redundant image tokens. Recent multimodal reasoning methods usually extend chain-of-thought from language models into visual or latent spaces, seeking to add intermediate reasoning states while overlooking the negative impact of redundant visual tokens. We propose LatEnt Noise maSk (Lens), a question-conditioned visual evidence purification framework that empowers MLLMs to reason with cleaner visual cues in latent space. Lens introduces a lightweight Lens Evidence Token (LET) to score which visual tokens support the current question and preserve them during decoding. Guided by the LET scores, it injects adaptive latent noise into low-relevance tokens, softly suppressing distractors without changing the model backbone or token sequence. With only one temporary learnable control token and a lightweight noise generator, Lens adds minimal overhead while improving the base MLLM by 2.4-6.4 points on most VQA datasets and by 4.1-6.4 points on grounding tasks. These results show that multimodal reasoning can benefit more directly from cleaner question-relevant visual evidence than from simply extending the reasoning trace.
- Abstract(参考訳): マルチモーダル大言語モデル (MLLM) は、密集した冗長な画像トークンによって問題関連の視覚的手がかりが希薄になるため、細粒度の視覚的推論では失敗することが多い。
最近のマルチモーダル推論手法は、通常、言語モデルから視覚的または潜在的な空間へのチェーン・オブ・シントを拡張し、冗長な視覚トークンの負の影響を見落としながら中間的推論状態を追加しようとする。
そこで我々は,MLLM に潜伏空間におけるよりクリーンな視覚的手がかりによる推論を可能にする質問条件付き視覚的エビデンス浄化フレームワーク LatEnt Noise maSk (Lens) を提案する。
Lensは軽量のLens Evidence Token (LET)を導入し、視覚トークンが現在の質問をサポートし、復号時にそれらを保存する。
LETスコアによってガイドされ、適応潜時ノイズを低関連トークンに注入し、モデルバックボーンやトークンシーケンスを変更することなく、気晴らしをソフトに抑制する。
1つの一時的な学習可能な制御トークンと軽量ノイズ発生器だけで、Lensは最小限のオーバーヘッドを追加し、ほとんどのVQAデータセットでは2.4-6.4ポイント、接地タスクでは4.1-6.4ポイント改善した。
これらの結果から,マルチモーダル推論は,推論トレースを単に拡張することよりも,よりクリーンな質問関連視覚的証拠の恩恵を受ける可能性が示唆された。
関連論文リスト
- Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Latent Visual Reasoning [40.347006722601975]
視覚埋め込み空間に直接自己回帰推論を可能にする新しいパラダイムであるLatent Visual Reasoning(LVR)を紹介する。
その結果,LVRは細粒度視認と知覚を著しく改善し,MMVPでは71.67%,Qwen2.5-VLでは66.67%であった。
論文 参考訳(メタデータ) (2025-09-29T03:52:01Z) - Token Activation Map to Visually Explain Multimodal LLMs [23.774995444587667]
本稿では,文脈の干渉を軽減し,高品質なMLLM記述を実現するための因果推論手法を提案する。
本稿では,トークン間の相互作用を考慮に入れたToken Activation Map (TAM) と呼ぶ。
我々のTAM法は既存のSoTA法を著しく上回り、高品質な可視化結果を示す。
論文 参考訳(メタデータ) (2025-06-29T14:50:45Z) - Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning [53.790502697674754]
本稿では、画像入力を重要な推論段階に移行する戦略であるTake-Allong Visual Conditioning (TVC)を提案する。
TVCは、推論を通して視覚的なコンポーネントへの注意を維持するのに役立つ。
提案手法は,5つの数学的推論ベンチマークにおいて,最先端の性能を平均で達成する。
論文 参考訳(メタデータ) (2025-03-17T16:45:12Z) - What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph [15.364317811275344]
本稿では,G-Prune と呼ばれる学習自由な視覚トークンプルーニングのためのグラフベースの手法を提案する。
G-Pruneは視覚トークンをノードとみなし、それらの意味的類似性に基づいて接続を構築する。
実験結果から,G-Pruneは粗いタスクと微粒なタスクの両方で高い性能を維持しながら,計算オーバーヘッドを大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2025-01-04T12:14:42Z) - Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings [66.04061083611863]
既存のMultimoal Large Language Models (MLLM) における視覚トークンの過剰使用は、しばしば明らかな冗長性を示し、非常に高価な計算をもたらす。
DyVTE(Dynamic visual-token exit)と呼ばれるMLLMの効率を改善するための簡易かつ効果的な手法を提案する。
DyVTEは軽量なハイパーネットワークを使用して、テキストトークンの状態を認識し、特定のレイヤの後にすべてのビジュアルトークンを削除する。
論文 参考訳(メタデータ) (2024-11-29T11:24:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。