論文の概要: Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation
- arxiv url: http://arxiv.org/abs/2607.14557v1
- Date: Thu, 16 Jul 2026 04:37:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.986319
- Title: Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation
- Title(参考訳): ステップゼロで終端を見る: MLPスポーシティ対応トラニケーションによる拡散MLLMの高速化
- Authors: Qicheng Zhao, Qi Sun, Zheyu Yan,
- Abstract要約: Seerはトレーニング不要のフレームワークで、アクティベーション空間のシフトを通じて、第1ステップで有効なセマンティック境界を検出する。
実験の結果,Seerは水田廃棄物を効果的に除去し,スループットを最大$sim$31$times$に向上することがわかった。
- 参考スコア(独自算出の注目度): 6.796779304354568
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Multimodal Large Language Models (DMLLMs) are highly effective for multimodal reasoning, yet their inference efficiency is significantly hindered by fixed-length generation constraints. Since the actual output length is unknown, output sequences are padded to a predefined maximum length, resulting in substantial redundant computation over unnecessary [EOS] tokens. In this work, we discover that DMLLMs implicitly reveal their valid semantic boundary at the very first denoising step through a distinct shift in MLP activation sparsity. Leveraging this observation, we propose Seer, a training-free framework that detects this boundary using a Signal-to-Noise Ratio (SNR)-based criterion and performs one-shot truncation of the redundant suffix for all subsequent computations. To preserve these theoretical gains during batched serving, Seer incorporates a hybrid execution strategy that maximizes throughput while seamlessly accommodating dynamic sequence lengths. Experimental results demonstrate that Seer effectively eliminates padding waste, accelerating throughput by up to $\sim$31$\times$. Across 9 benchmarks, Seer robustly maintains overall performance and even improves accuracy on complex visual tasks by mitigating noise leakage (e.g., DocVQA score increases from 63.52 to 63.66), offering a highly efficient, plug-and-play solution for DMLLM acceleration.
- Abstract(参考訳): 拡散多モーダル大言語モデル (DMLLM) は多モーダル推論に非常に有効であるが、その推論効率は固定長生成制約によって著しく阻害される。
実際の出力長が不明であるため、出力シーケンスは予め定義された最大長にパディングされるため、不要な[EOS]トークンに対してかなりの冗長な計算が行われる。
本研究では, DMLLM が, MLP アクティベーション空間の明瞭な変化を通じて, その意味境界を第1段階において暗黙的に明らかにすることを明らかにする。
本稿では,SNR(Signal-to-Noise Ratio)ベースの基準を用いてこの境界を検知し,その後の全ての計算に対して冗長接尾辞のワンショット切り出しを行う,トレーニング不要なフレームワークであるSeerを提案する。
バッチ配信中のこれらの理論的利益を維持するため、Sierは動的シーケンス長をシームレスに調整しながらスループットを最大化するハイブリッド実行戦略を取り入れている。
実験により,Seerは水田廃棄物を効果的に除去し,スループットを最大$\sim$31$\times$に向上することを示した。
例えば、DocVQAスコアは63.52から63.66まで上昇し、DMLLMアクセラレーションのための高効率なプラグアンドプレイソリューションを提供する。
関連論文リスト
- Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - SVD Contextual Sparsity Predictors for Fast LLM Inference [0.0]
本稿では,大規模言語モデル(LLM)におけるReGLUベースのフィードフォワードネットワーク(FFN)の推論を高速化するためのフレームワークを提案する。
実験では、複雑な数学やコード生成を含むタスクにおけるベンチマークスコアの1%未満の劣化を維持しながら、エンドツーエンドのデコーディング時間を1.8倍に削減した。
論文 参考訳(メタデータ) (2026-03-14T20:36:13Z) - DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention [2.7422645382944935]
そこで我々はDyLLMを提案する。DyLLMは正規トークンのみを選択的に計算することでデコーディングを高速化する学習自由推論フレームワークである。
DyLLMは様々な推論とコード生成ベンチマークで最大9.6倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-03-09T07:02:01Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models [82.87985794856803]
大規模言語モデル(LLM)は、幅広い自然言語処理(NLP)タスクにおいて最先端のパフォーマンスを達成した。
最近、Diffusion Language Models (DLM) が有望な代替アーキテクチャとして登場した。
論文 参考訳(メタデータ) (2025-10-05T10:50:52Z) - Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models [74.15250326312179]
拡散大言語モデルは効率的な並列生成とグローバルモデリングを提供する。
DLLMの主流の応用は、静的に事前定義された生成長の必要性によって妨げられている。
DAEDALは,動的適応長拡張を可能にする新しい学習自由化戦略である。
論文 参考訳(メタデータ) (2025-08-01T17:56:07Z) - FFN-SkipLLM: A Hidden Gem for Autoregressive Decoding with Adaptive Feed Forward Skipping [49.66872823080736]
自己回帰型大規模言語モデル(LLaMa, GPT)は、言語理解と生成において顕著な成功を収めている。
発生時に発生する過負荷を軽減するため、いくつかの早期退避および層下降戦略が提案されている。
本稿では,入力適応型フィードフォワードスキップ戦略であるFFN-SkipLLMを提案する。
論文 参考訳(メタデータ) (2024-04-05T02:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。