論文の概要: Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.26580v1
- Date: Thu, 27 Aug 2026 03:46:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.235553
- Title: Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models
- Title(参考訳): 拡散多モード大言語モデルのための視覚情報誘導並列デコーディング
- Abstract要約: 拡散型マルチモーダル大言語モデル (dMLLM) は、マルチモーダル生成のための新しいデコードパラダイムとして登場した。
画像トークンへの注目度に基づいてトークンを優先順位付けするVIG-Samplerを提案する。
3つのオープンソースdMLLMを用いた7つのキャプションとVQAベンチマークの実験は、VIG-Samplerの有効性を示している。
- 参考スコア(独自算出の注目度): 20.55764219638966
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion multimodal large language models (dMLLMs) have recently emerged as a new decoding paradigm for multimodal generation. Starting from a fully masked sequence, dMLLMs progressively decode the sequence by unmasking a subset of the remaining masked positions at each step. Since the selected tokens serve as the prediction context for subsequent steps, deciding which tokens to decode is crucial to the quality of the final output. The most common strategy prioritizes tokens based on a certainty measure that tends to favor tokens frequently observed in the training data. Recent approaches instead order tokens according to their influence on subsequent predictions, but do not explicitly account for the input image. We propose the Visual Information-Guided Sampler (VIG-Sampler), which prioritizes tokens based on their attention to image tokens. We further impose a constraint that penalizes candidate tokens whose image-attention distributions are similar to those of previously selected tokens, thereby increasing the information gain of the decoded subset. Extensive experiments on 7 captioning and VQA benchmarks with 3 open-source dMLLMs demonstrate the effectiveness of VIG-Sampler, which outperforms the Info-Gain Sampler by an average of 19.3 CIDEr points across the captioning benchmarks and surpasses it on COCO Caption while using only half as many decoding steps.
- Abstract(参考訳): 拡散型マルチモーダル大言語モデル(dMLLM)は近年,マルチモーダル生成のための新しいデコードパラダイムとして登場している。
完全にマスクされたシーケンスから始めて、dMLLMは各ステップで残りのマスクされた位置のサブセットをアンマキングすることで、シークエンスを段階的にデコードする。
選択されたトークンはその後のステップの予測コンテキストとして機能するため、どのトークンをデコードするかが最終的な出力の品質に不可欠である。
最も一般的な戦略は、トレーニングデータでよく見られるトークンを優先する傾向にある確実性尺度に基づいてトークンを優先順位付けする。
近年のアプローチでは、トークンがその後の予測への影響に応じて順序付けされているが、入力画像は明示的に説明されていない。
本稿では,視覚情報誘導型サンプラー(VIG-Sampler)を提案する。
さらに、予め選択したトークンとイメージアテンション分布が類似している候補トークンをペナルティ化する制約を課し、デコードされたサブセットの情報ゲインを増大させる。
3つのオープンソースdMLLMを使った7つのキャプションとVQAベンチマークの大規模な実験は、VIG-Samplerの有効性を示している。
関連論文リスト
- Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models [9.95016675032699]
拡散に基づく多モード多言語モデル(dMLLM)は、複数のマスキング位置のトークンを並列に反復的に予測することでデコードする。
既存の信頼に基づく復号化ランクは、独立して位置を隠蔽し、トップKの位置をコミットし、コミットされたトークンが補完的な視覚的根拠を提供するかどうかを無視する。
本稿では,視覚的に相補的な位置を優先するためにトークン・ツー・イメージ・アテンションを用いたトレーニング不要な推論時間復号法である視覚冗長制御復号法(VRCD)を提案する。
論文 参考訳(メタデータ) (2026-05-25T13:16:51Z) - Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models [52.40742159500277]
強化学習(RL)を通して拡散多モード大言語モデル(dMLLM)を最適化する方法を示す。
弊社のアプローチでは、Sketch-Then-Paintトレーニングスキームにより、アップデートをグローバル、構造、洗練の3つのステージに編成する。
MMaDAとLumina-DiMOOの2つの人気のあるdMLLMバックボーンを用いた実験は、GenEvalとDPGのベンチマークで大幅に向上した。
論文 参考訳(メタデータ) (2026-05-16T06:59:54Z) - Bottleneck Tokens for Unified Multimodal Retrieval [16.707536543758344]
マルチモーダル検索のためのデコーダのみのマルチモーダル大言語モデル(MLLM)の適用には、2つの構造的ギャップがある。
まず、既存のメソッドは暗黙のプーリングに依存しており、シーケンスレベルの表現として標準語彙トークンの隠れた状態をオーバーロードする。
第二に、コントラスト的な微調整は、埋め込みが一致すべきものを特定するが、どのように情報を圧縮すべきかについてのトークンレベルのガイダンスは提供しない。
本稿では,Bottleneck Tokens(BToks)を紹介した。これは,固定容量明示的なプール機構として機能する,学習可能なトークンの小さなセットである。
論文 参考訳(メタデータ) (2026-04-13T07:12:12Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - FoPru: Focal Pruning for Efficient Large Vision-Language Models [11.36025001578531]
本稿では、視覚エンコーダから導出される注目に基づくトークンの重要度に基づいて、視覚トークンを抽出する訓練不要なFocal Pruning(FoPru)を提案する。
提案手法は,高い精度を維持しつつ多数の冗長トークンを抽出し,推論効率を大幅に向上させる。
論文 参考訳(メタデータ) (2024-11-21T14:22:38Z) - FIRP: Faster LLM inference via future intermediate representation prediction [54.897493351694195]
FIRPはデコードステップ毎に1つではなく複数のトークンを生成する。
いくつかのモデルとデータセットで1.9x-3xのスピードアップ比を示す広範な実験を行った。
論文 参考訳(メタデータ) (2024-10-27T15:53:49Z) - SEP: Self-Enhanced Prompt Tuning for Visual-Language Model [93.94454894142413]
SEP(Self-Enhanced Prompt Tuning)という新しいアプローチを導入する。
SEPは、テキストレベルの埋め込みと視覚レベルの埋め込みの両方を強化するために、差別的な事前知識を明示的に取り入れている。
様々なベンチマークやタスクの総合的な評価は、プロンプトチューニングにおけるSEPの有効性を確認している。
論文 参考訳(メタデータ) (2024-05-24T13:35:56Z) - Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration [54.897493351694195]
本稿では,複数連続するトークンを1つのフォワードパスで同時に復号する,新しい並列復号法,すなわちthithidden Transferを提案する。
加速度測定では,Medusa や Self-Speculative decoding など,単モデル加速技術よりも優れています。
論文 参考訳(メタデータ) (2024-04-18T09:17:06Z) - Leveraging per Image-Token Consistency for Vision-Language Pre-training [52.825150269820696]
クロスモーダルマスク言語モデリング(CMLM)は視覚言語事前学習には不十分である。
視覚言語事前学習のためのEPIC(Leveraging Per Image-Token Consistency)を提案する。
提案手法は, 事前学習法と容易に組み合わせることができる。
論文 参考訳(メタデータ) (2022-11-20T12:10:53Z) - Data Efficient Masked Language Modeling for Vision and Language [16.95631509102115]
Masked Language Modeling (MLM) は視覚言語訓練における重要なサブタスクの1つである。
クロスモーダル設定では、文中のトークンはランダムにマスキングされ、モデルは画像とテキストが与えられたマスキングトークンを予測する。
これらの欠点に対処するクロスモーダル設定に特有な代替マスキング戦略について検討する。
論文 参考訳(メタデータ) (2021-09-05T11:27:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。