論文の概要: Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling
- arxiv url: http://arxiv.org/abs/2609.16450v1
- Date: Tue, 15 Sep 2026 00:12:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.273309
- Title: Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling
- Title(参考訳): 初期バードデコーディング:学習可能なブロックサイズと並列サンプリングによる拡散LDMの高速化
- Abstract要約: 拡散大言語モデル(dLLM)は、自己回帰生成の代替として有望な並列デコードパラダイムを提供する。
同様に低いエントロピーを持つトークンがクラスタ化される傾向にあるという観察から動機付けられた「アーリーバード(EB)」デコーディングフレームワークを提案する。
EB-Decodeは,(1)類似の不確実性のあるトークンを,固定ブロックサイズに依存するのではなく,可変長ブロックに適応的にグループ化する学習可能なネットワーク,(2)予測された可変長ブロック内の復号ステップを減らして,並列でトークンをアンマスクする位置認識型サンプリング,という2つの重要なイネーラを統合する。
- 参考スコア(独自算出の注目度): 11.823547220829083
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion large language models (dLLMs) offer a promising parallel decoding paradigm as an alternative to autoregressive generation through iterative unmasking. However, dLLMs typically require many steps before token confidence reaches the decoding threshold, resulting in inefficient inference even with block-wise KV caching. To accelerate dLLM inference, we for the first time propose an "early-bird (EB)" decoding framework, motivated by the observation that tokens with similarly low entropy tend to cluster and can be jointly decoded earlier, before reaching the confidence threshold. In particular, our EB-Decode framework integrates two key enablers: (1) a learnable network that adaptively groups tokens with similar uncertainty into variable-length blocks, rather than relying on fixed block sizes; (2) a position-aware sampler that learns to unmask tokens in parallel using fewer decoding steps within predicted variable-length blocks. Both components are developed without modifying pretrained dLLM weights and can therefore be directly deployed as plug-ins during serving, with negligible training and inference overhead. Extensive experiments across three models and four benchmarks consistently validate our observation and the effectiveness of EB-Decode, achieving 3.53-18.76$\times$ higher throughput than the vanilla decoding method and up to 1.58$\times$ higher throughput over the strongest baseline, Fast-dLLM, with comparable accuracy.
- Abstract(参考訳): 拡散大言語モデル(dLLM)は、反復的アンマキングによる自己回帰生成の代替として、有望な並列デコードパラダイムを提供する。
しかし、dLLMはトークンの信頼度が復号しきい値に達する前に多くのステップを必要とするため、ブロックワイズKVキャッシングでさえ非効率な推論をもたらす。
同様に低エントロピーのトークンがクラスタ化される傾向があり、信頼しきい値に達する前に、より早く共同で復号化可能であることを観察することによって、我々は初めて「アーリーバード(EB)」復号化フレームワークを提案する。
特に,我々のEB-Decodeフレームワークは,(1)類似の不確実性を持つトークンを,固定ブロックサイズに頼るのではなく,可変長ブロックに適応的にグループ化する学習可能なネットワーク,(2)予測された可変長ブロック内でより少ない復号ステップを用いて,並列でトークンをアンマスクする位置認識サンプリング,という2つの重要なイネーラを統合している。
両方のコンポーネントは、事前訓練されたdLLM重みを変更することなく開発され、そのため、サービス中にプラグインとして直接デプロイすることができ、トレーニングや推論のオーバーヘッドが無視できる。
3つのモデルと4つのベンチマークにわたる大規模な実験は、EB-Decodeの観測と有効性を一貫して検証し、バニラ復号法よりも3.53-18.76$\times$高いスループット、最強のベースラインであるFast-dLLMよりも1.58$\times$高いスループットを実現した。
関連論文リスト
- Trajectory-Level Speculative Decoding for Diffusion Language Models [16.97093186372498]
拡散ベースの言語モデル (dLLM) は反復的復号化による並列トークン生成を可能にするが、既存の復号化戦略は信頼性の低い単一トークン生成に崩壊する。
そこで我々は,信頼層木探索による起草軌道構築のためのトラジェクトリレベルの投機フレームワークを開発した。
我々のフレームワークはデノーミングを30~40%削減し、トークン単位のステップを2.6から4.3に増やし、バニラdLLMを7~14倍、Fast-dLLMを1.3倍、推論とコードベンチマークを1%未満で高速化する。
論文 参考訳(メタデータ) (2026-08-27T09:42:20Z) - SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - Cluster-Level Attention-Guided Parallel Decoding for Masked Diffusion Language Models [13.325071163425621]
マスク付き拡散言語モデル (MDLM) は、各デノナイジングステップにおける全てのマスキング位置を予測することで並列デコードを可能にする。
我々は、この粒度を再考し、信頼できる予測が連続した高信頼のスパンとしてしばしば現れることを観察する。
自己アテンションマップを用いてクラスタ間の依存関係を推定し、並列コミットのための相互互換CICのコンフリクト対応の選択を可能にする。
論文 参考訳(メタデータ) (2026-05-28T08:42:39Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection [35.2079721755684]
LEAP(Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding)を紹介する。
LEAPは、将来のコンテキストフィルタリングとマルチシーケンス重ね合わせを利用して早期収束トークンを検出する、トレーニングフリーのプラグアンドプレイ方式である。
GSM8Kデータセットでは、LEAPとdParallelを組み合わせることで、モデル精度を維持しながら、ステップ毎に7.2トークンにデコードが高速化される。
論文 参考訳(メタデータ) (2026-05-09T03:26:23Z) - Residual Context Diffusion Language Models [90.07635240595926]
Residual Context Diffusion (RCD) は、捨てられたトークン表現をコンテキスト残留に変換し、次のデノイングステップでそれらを注入するモジュールである。
RCDは、最小限の計算オーバーヘッドで、5-10ポイントの精度でフロンティアdLLMを一貫して改善する。
論文 参考訳(メタデータ) (2026-01-30T13:16:32Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size [7.442463267121892]
拡散に基づく大規模言語モデル (dLLM) は並列デコードに固有の能力で注目を集めている。
本稿では,セミARデコードにおける固定ブロックサイズの仮定に挑戦する最初の体系的な研究を提案する。
AdaBlock-dLLMは,実行中のブロックサイズを調整することで,ブロック境界とセマンティックステップを適応的に調整する,トレーニング不要のプラグイン・アンド・プレイスケジューラである。
論文 参考訳(メタデータ) (2025-09-30T15:53:56Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Sequential Diffusion Language Models [110.06562906987052]
拡散言語モデル(DLM)は理論効率が強いが、固定長の復号化とキー値キャッシュとの非互換性によって制限される。
次点と次点の予測を統一するNext Sequence Prediction (NSP)を導入する。
本稿では,事前学習した自己回帰言語モデル(ALM)を最小限のコストで再現可能な逐次拡散言語モデル(SDLM)を提案する。
論文 参考訳(メタデータ) (2025-09-28T17:59:15Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。