論文の概要: Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques
- arxiv url: http://arxiv.org/abs/2607.12829v1
- Date: Tue, 14 Jul 2026 14:48:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.174253
- Title: Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques
- Title(参考訳): マスケ拡散大言語モデルの高速化:効率的な推論手法の検討
- Abstract要約: 拡散大言語モデル(dLLM)は、標準自己回帰モデルよりも並列生成に理論的優位性をもたらす。
この効率を実現するには、拡散対応キャッシングや再利用のような特別な推論機構が必要である。
我々は,これらの要因を解消し,実際のデプロイメントにおける推論速度への影響を分析するために,dLLM用の統合遅延分解フレームワークを導入する。
- 参考スコア(独自算出の注目度): 45.003333444832656
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion large language models (dLLMs) offer a theoretical advantage in parallel generation over standard autoregressive models. However, parallel generation alone does not guarantee practical speedups. Realizing this efficiency requires specialized inference mechanisms, such as diffusion-aware caching and reuse. Consequently, as inference efficiency becomes a prerequisite for practical deployment, recent research has actively explored acceleration techniques across algorithms, architectures, and systems. However, rigorous comparisons remain difficult, as end-to-end latency stems from intricate trade-offs between algorithmic, architectural, and system-level factors that are often conflated in existing benchmarks. In this survey, we introduce a unified latency decomposition framework for dLLMs to disentangle these factors and analyze their impact on inference speed in real deployments. Guided by this framework, we categorize acceleration techniques along three axes covering algorithmic innovations, architectural and system optimizations, and inference-time scaling. Finally, we provide guidelines for reproducible benchmarking and highlight open challenges for realizing the full potential of parallel generation.
- Abstract(参考訳): 拡散大言語モデル(dLLM)は、標準自己回帰モデルよりも並列生成に理論的優位性をもたらす。
しかし、並列生成だけでは実用的なスピードアップは保証されない。
この効率を実現するには、拡散対応キャッシングや再利用のような特別な推論機構が必要である。
その結果、推論効率が現実的な展開の前提となるため、最近の研究ではアルゴリズム、アーキテクチャ、システム間の加速技術について積極的に研究している。
しかし、エンドツーエンドのレイテンシは、アルゴリズム、アーキテクチャ、システムレベルの要素間の複雑なトレードオフに起因するため、しばしば既存のベンチマークで混同されるため、厳密な比較は依然として困難である。
本稿では,これらの要因を解消し,実際のデプロイメントにおける推論速度への影響を分析するため,dLLMのための統合遅延分解フレームワークを提案する。
このフレームワークにより、アルゴリズムの革新、アーキテクチャとシステムの最適化、推論時間スケーリングを含む3つの軸に沿った加速度テクニックを分類する。
最後に、再現可能なベンチマークのガイドラインを提供し、並列生成の完全な可能性を実現するためのオープンな課題を強調します。
関連論文リスト
- FLARE: Diffusion for Hybrid Language Model [72.60770374799634]
FLAREは、ハイブリッドアテンションな大規模言語モデルのための体系的な変換フレームワークである。
トークン平等なAR/拡散目標、ハードウェア対応カーネル、統一推論を組み合わせることで、ひとつのチェックポイントがARスタイルの検証された復号化と拡散スタイルの並列復号化の両方をサポートすることができる。
この結果から,実際のdLLMは復号化アルゴリズムだけでなく,データ品質や現在のブロック拡散目標のトレーニング非効率によって制限されていることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T06:58:15Z) - Deep Unfolding: Recent Developments, Theory, and Design Guidelines [99.63555420898554]
この記事では、最適化アルゴリズムを構造化されたトレーニング可能なMLアーキテクチャに変換するフレームワークであるDeep Unfoldingのチュートリアルスタイルの概要を提供する。
推論と学習のための最適化の基礎を概観し、深層展開のための4つの代表的な設計パラダイムを導入し、その反復的な性質から生じる特有なトレーニングスキームについて議論する。
論文 参考訳(メタデータ) (2025-12-03T13:16:35Z) - Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models [64.92045568376705]
コヒーレントコンテキストデコーディング(Coherent Contextual Decoding, CCD)は、2つのコアイノベーションに基づいて構築された新しい推論フレームワークである。
CCDは、歴史的文脈を活用してシーケンスコヒーレンスを高める軌道修正機構を採用している。
拡散ステップに基づく厳密なアロケーションの代わりに,各ステップのアンマスク予算を動的に調整する適応型サンプリング戦略を導入する。
論文 参考訳(メタデータ) (2025-11-26T09:49:48Z) - A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation [15.689880312464004]
拡散モデルは、異常な生成品質と制御性のために、現代の生成AIの基盤となっている。
Diffusion Cachingは、トレーニングのない、アーキテクチャに依存しない、効率的な推論パラダイムを提供する。
計算機能レベルのクロスステップの再利用と層間スケジューリングを有効にすることにより、モデルパラメータを変更することなく削減できる。
論文 参考訳(メタデータ) (2025-10-22T16:46:05Z) - How Efficient Are Diffusion Language Models? A Critical Examination of Efficiency Evaluation Practices [81.85465545346266]
拡散言語モデル(DLM)は、長期支配的自己回帰(AR)パラダイムに代わる有望な代替として登場した。
しかし、現在のオープンソースのDLMは、しばしばARの速度よりも優れており、現実のユーティリティを制限している。
本研究はDLMの効率に関する系統的研究であり, 先行評価手法の問題点を同定する。
論文 参考訳(メタデータ) (2025-10-21T10:00:32Z) - READER: Retrieval-Assisted Drafter for Efficient LLM Inference [0.0386965802948046]
自己回帰言語モデルはトークンシーケンスよりも分解された確率をインスタンス化するが、その厳密なシーケンシャルなデコーディングプロセスは、遅延推論に固有の低いバウンドを課す。
このボトルネックは、大規模生成モデルのスケーラブルなデプロイにおける中心的な障害として現れています。
本稿では,補助的ドラフトモデルのトレーニングを回避した投機的復号化フレームワークREADERを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:47:48Z) - Inference Acceleration of Autoregressive Normalizing Flows by Selective Jacobi Decoding [12.338918067455436]
正規化フローは、理論的厳密性、分析的対数類似性、エンドツーエンドトレーニングなどの利点を持つ有望な生成モデルである。
近年の進歩は自己回帰モデリングを活用し、表現力と生成品質を大幅に向上させた。
並列反復最適化により自己回帰推論を高速化する選択的ヤコビ復号法(SeJD)を提案する。
論文 参考訳(メタデータ) (2025-05-30T16:53:15Z) - Faster Diffusion Action Segmentation [9.868244939496678]
時間的行動分類(TAS)はビデオ解析において不可欠な課題であり、連続したフレームを別のアクションセグメントに分割し分類することを目的としている。
拡散モデルの最近の進歩は、安定したトレーニングプロセスと高品質な生成能力により、TASタスクにおいて大きな成功を収めている。
本稿では,効率的かつ高性能なTASアルゴリズムであるEffiDiffActを提案する。
論文 参考訳(メタデータ) (2024-08-04T13:23:18Z) - Inference Optimization of Foundation Models on AI Accelerators [68.24450520773688]
トランスフォーマーアーキテクチャを備えた大規模言語モデル(LLM)を含む強力な基礎モデルは、ジェネレーティブAIの新たな時代を支えている。
モデルパラメータの数が数十億に達すると、実際のシナリオにおける推論コストと高いレイテンシーが排除される。
このチュートリアルでは、AIアクセラレータを用いた補完推論最適化テクニックに関する包括的な議論を行っている。
論文 参考訳(メタデータ) (2024-07-12T09:24:34Z) - Consistency Models for Scalable and Fast Simulation-Based Inference [9.27488642055461]
シミュレーションベース推論(SBI)のための新しい条件付きサンプルであるCMPEの整合性モデルを提案する。
CMPEは基本的に連続した確率フローを蒸留し、制約のないアーキテクチャで高速な数発の推論を可能にする。
実験により,CMPEは高次元のベンチマークで最先端のアルゴリズムより優れるだけでなく,より高速なサンプリング速度で競合性能を達成できることを示した。
論文 参考訳(メタデータ) (2023-12-09T02:14:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。