論文の概要: FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.22883v1
- Date: Mon, 24 Aug 2026 07:09:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.928457
- Title: FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding
- Title(参考訳): FOVEA:キャッシュフレンドリーなマルチモーダル投機デコードのためのオンデマンドビジュアルエビデンス適応
- Abstract要約: マルチモーダル投機的復号化は、軽量なドラフトモデルにより、より大きなターゲットモデルによる並列検証のための候補トークンを提案することにより、視覚言語モデルを加速させる。
既存の方法は通常、事前に定義された視覚的な予算や静的な圧縮表現のような、固定されたビジュアルインターフェースにドラフトを条件付けする。
本稿では、再利用可能なビジュアルメモリを構築し、ドラフト状態の有界サブセットを動的に検索するキャッシュフレンドリーなアプローチであるFOVEAを提案する。
- 参考スコア(独自算出の注目度): 42.559533294854134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal speculative decoding accelerates vision-language models by allowing a lightweight draft model to propose candidate tokens for parallel verification by a larger target model. Existing methods typically condition the drafter on a fixed visual interface, such as a predefined visual-token budget or a static compressed representation. However, our controlled visual-budget analysis shows that visual demand varies substantially across tasks and decoding stages, which means more visual input is not always beneficial. Actually, insufficient evidence may weaken visual grounding, while excessive context adds overhead and may disrupt drafting. We propose FOVEA (Focused On-demand Visual Evidence Adaptation), a cache-friendly approach that builds a reusable visual memory and dynamically retrieves a bounded subset for a draft state. A cumulative-mass rule determines both how many and which entries are selected. The selected entries are aggregated into a visual readout and fused with the current draft hidden state through a lightweight gated residual correction. Rather than inserting visual tokens into the autoregressive context, the correction modifies only the representation passed to the language-model head. Experiments across multiple vision-language backbones and multimodal benchmarks show that FOVEA improves draft acceptance and end-to-end decoding speed, achieving up to $2.13\times$ speedup over autoregressive decoding. These results demonstrate that state-conditioned evidence retrieval is an effective alternative to reusing a fixed visual representation throughout multimodal generation.
- Abstract(参考訳): マルチモーダル投機的復号化は、軽量なドラフトモデルにより、より大きなターゲットモデルによる並列検証のための候補トークンを提案することにより、視覚言語モデルを加速させる。
既存の方法は通常、事前に定義された視覚的な予算や静的な圧縮表現のような、固定されたビジュアルインターフェースにドラフトを条件付けする。
しかし、制御された視覚予算分析により、視覚的な要求はタスクやデコード段階によって大きく異なることが分かる。
実際、不十分な証拠は視覚的根拠を弱め、過度なコンテキストはオーバーヘッドを増し、起草を妨害する可能性がある。
FOVEA(Focused On-demand Visual Evidence Adaptation)は、再利用可能なビジュアルメモリを構築し、ドラフト状態の有界サブセットを動的に取得するキャッシュフレンドリーなアプローチである。
累積質量法則は、どのエントリが選択されたかを決定する。
選択されたエントリを視覚的読み出しに集約し、軽量ゲート残差補正により現在のドラフト隠蔽状態と融合する。
自動回帰コンテキストに視覚トークンを挿入するのではなく、言語モデルヘッドに渡される表現のみを修正する。
複数の視覚言語によるバックボーンとマルチモーダルベンチマークの実験により、FOVEAはドラフトの受け入れとエンドツーエンドのデコード速度を改善し、オートレグレッシブデコードよりも最大2.13\times$スピードアップを達成した。
これらの結果は、状態条件付きエビデンス検索が、マルチモーダル生成を通して固定された視覚表現を再利用する有効な代替手段であることを示している。
関連論文リスト
- State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models [49.57973975600996]
文書解析は、きめ細かい視覚知覚に強い要求を与える。
既存の視覚言語モデル(VLM)に基づく解析手法は、グローバルに圧縮された視覚トークンに依存している。
自己回帰復号における状態条件付き視覚的エビデンス検索(SCVER)として認識を定式化する。
論文 参考訳(メタデータ) (2026-08-27T12:56:45Z) - TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding [8.451420931444215]
投機的復号化は、ドラフト作成者がより大きなターゲットモデルで検証された複数のトークンを提案することによって自己回帰生成を加速させる。
テキスト条件付き vIsual GatEd フレームワーク TIGER を提案する。
我々は,TIGERが精度の高い検証側投機的復号化の下で,許容プレフィックス長と投機的高速化で一貫した利得が得られることを示す。
論文 参考訳(メタデータ) (2026-07-13T06:06:27Z) - Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification [80.62512020268626]
UniARは統合された自己回帰フレームワークであり、単一のビジュアルトークン化器が理解と生成の鍵となる。
UniARは、マルチレベル特徴融合とルックアップフリービットワイド量子化スキームを備えた事前訓練されたビジョンエンコーダを適応する。
拡散に基づく視覚デコーダは、離散的な視覚トークンで高忠実度画像をデコードする。
論文 参考訳(メタデータ) (2026-06-16T17:59:22Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - RECODE: Reasoning Through Code Generation for Visual Question Answering [68.86938437188964]
我々は、検証可能な視覚的推論のための新しいモダリティとして、視覚を実行可能コードにリバースエンジニアリングするプロセスであるデレンダリングを活用することを提案する。
我々の研究は、実行可能コードにおける視覚的認識の基盤が、より正確で検証可能なマルチモーダル推論への新たな道を提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T17:05:37Z) - HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models [23.98782884568504]
視覚言語モデル(HiViS)における投機的復号化のためのドナーからの視覚トークンの隠蔽を提案する。
HiViSは、視覚言語モデルにおける投機的復号化の非効率性を緩和する明示的単純入力分解フレームワークである。
提案手法は, プリフィルシーケンス長を目標VLM入力の0.7%-1.3%に圧縮する。
論文 参考訳(メタデータ) (2025-09-28T15:05:21Z) - CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models [75.88232735646018]
LVLM(Large Vision-Language Models)は、画像やビデオから抽出されたテキストトークンとビジョントークンからなるマルチモーダル入力を処理する。
既存の手法は冗長な視覚トークンを創りだそうとしており、視覚表現のかなりの冗長性を明らかにしている。
我々は,LVLMで処理される前に冗長な視覚トークンを予測・削除するために,Plug-and-Play Pruning Module (PPM) を用いるレイヤワイズなコンテキスト対応型視覚トークンプルーニング手法であるCoViPALを提案する。
論文 参考訳(メタデータ) (2025-08-24T07:47:00Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding [5.71478837100808]
LVLM(Large Vision-Language Models)は、存在しないオブジェクトや既存のオブジェクトを誤って含むことによって、視覚的コンテンツを不正確に反映する記述を生成する。
本稿では,入力画像をサブイメージに分割し,アテンションマップを通じて重みを割り当てることでロジット分布を結合する新しい戦略であるEnsemble Decoding (ED)を提案する。
提案手法は,提案手法の有効性を検証し,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-05-23T06:35:43Z) - D-Attn: Decomposed Attention for Large Vision-and-Language Models [29.611769371733672]
大規模視覚・言語モデル(LVLM)のためのより柔軟な注意アーキテクチャである分解注意アーキテクチャ(D-Attn)を提案する。
D-AttnはLVLMの1次元因果自認を視覚的・視覚的・視覚的・テキスト的・テキスト的に分解する。
実験と解析によりD-Attnの有効性が検証され、複数の画像ベンチマークで大幅な改善が示された。
論文 参考訳(メタデータ) (2025-02-04T00:46:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。