論文の概要: FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.17652v1
- Date: Mon, 20 Jul 2026 08:05:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.542877
- Title: FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models
- Title(参考訳): FlowBlock: 自己修正拡散言語モデルのためのウェーブフロント並列デコーディング
- Authors: Bing Tian, Haikun Liu, Xiaocheng Zhong, Zhuohui Duan, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Xiaofei Liao,
- Abstract要約: ブロックワイド拡散大言語モデル (dLLM) はブロックレベルで逐次デコードし、ブロック間で有効なKVキャッシュの再利用を可能にするが、ブロック間デコーディングを厳密にシリアライズする。
2つのメカニズム上に構築されたトレーニング不要な並列デコーディングフレームワークである textbfflowblock を提案する。
LLaDA-2.1とLLaDA-2.0の2つのシリアルブロック単位のdLLMを最大2.95$times$と4.01$times$に改善し、レイテンシを最大53.6%、77.1%削減した。
- 参考スコア(独自算出の注目度): 16.404926372068047
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Block-wise diffusion large language models (dLLMs) decode sequentially at the block level, enabling effective KV-cache reuse across blocks but making inter-block decoding strictly serial. Prior work has attempted to unlock inter-block parallelism through post-training methods, but achieves only modest speedups and often degrades accuracy. We observe that self-correcting dLLMs offer a training-free alternative: token-to-token (T2T) editing can repair tokens drafted with a slightly stale upstream context, so a downstream block requires only an informative draft rather than a finalized predecessor. This turns block finality from a hard dependency into a scheduling resource. We propose \textbf{\flowblock{}}, a training-free parallel decoding framework built on two mechanisms. (i) \emph{Gated Wavefront Decoding} admits blocks into a bounded wavefront only when a readiness gate is satisfied, jointly refines active blocks via T2T editing, and commits blocks in order under a windowed block-causal mask that preserves exact frozen-prefix KV caches reuse. (ii) \emph{Heterogeneous Wavefront Packing} assigns each request an independent wavefront while packing asynchronous windows into dense, shape-stable batched forwards. Across different benchmarks, \flowblock{} improves tokens per second (TPS) over LLaDA-2.1 and LLaDA-2.0, two serial block-wise dLLMs, by up to 2.95$\times$ and 4.01$\times$, while reducing latency by up to 53.6\% and 77.1\%, respectively. It also improves average accuracy by 1.3 points. Compared with D2F, a training-based inter-block-parallel baseline, \flowblock{} achieves higher accuracy and up to 16$\times$ higher batched serving throughput.
- Abstract(参考訳): ブロックワイド拡散大言語モデル (dLLM) はブロックレベルで順次デコードし、ブロック間で有効なKVキャッシュの再利用を可能にするが、ブロック間デコーディングを厳密にシリアライズする。
以前の作業では、ポストトレーニング手法でブロック間並列性をアンロックしようとしたが、わずかなスピードアップしか達成せず、しばしば精度を低下させる。
トークン・ツー・トケン(T2T)編集は、わずかに古い上流コンテキストでドラフトされたトークンを修復するので、下流ブロックは最終的な前任者ではなく、情報的なドラフトのみを必要とする。
これにより、ブロックのファイナリティがハード依存からスケジューリングリソースに変わります。
本稿では,2つのメカニズム上に構築されたトレーニング不要の並列デコーディングフレームワークである‘textbf{\flowblock{}}を提案する。
i) \emph{Gated Wavefront Decoding} は、準備ゲートが満たされた場合にのみ、有界波面にブロックを許可し、T2T編集を介してアクティブブロックを共同で洗練し、正確な凍結前KVキャッシュの再利用を保存するウィンドウ付きブロック因果マスクの下でブロックを順番にコミットする。
(ii) \emph{Heterogeneous Wavefront Packing} は各リクエストに独立したウェーブフロントを割り当て、非同期ウィンドウを密集した、整形可能なバッチフォワードにパックする。
異なるベンチマークで、 \flowblock{} は LLaDA-2.1 と LLaDA-2.0 の2つのシリアルブロック単位の dLLM を最大2.95$\times$ と 4.01$\times$ に改善し、レイテンシを 53.6\% と 77.1\% に削減した。
また、平均精度も1.3ポイント向上する。
D2Fと比較して、トレーニングベースのブロック-並列間のベースラインである \flowblock{} は、高い精度と最大16$\times$高いバッチサービススループットを実現している。
関連論文リスト
- BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference [15.424211656458453]
拡散言語モデルは、複数のトークン位置を並列に反復的に認知することでテキストを生成する。
小さなブロックはローカル条件を保存するが、多くのデノーミングステップを必要とするが、大きなブロックはより並列性を公開するが、早期のコミットとキャッシュエラーを蓄積することができる。
バッチ転送パス内で同じリクエストに対して複数のブロックサイズのブランチを実行する,トレーニング不要なオンライン推論フレームワークであるBlockBatchを提案する。
論文 参考訳(メタデータ) (2026-05-28T01:48:29Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - DMax: Aggressive Parallel Decoding for dLLMs [77.24184219948337]
効率的な拡散言語モデル(dLLM)のための新しいパラダイムであるDMaxを提案する。
並列デコードにおけるエラーの蓄積を軽減し、生成品質を維持しながらアグレッシブデコードを可能にする。
当社のアプローチの核心は、マスクと均一なdLLMを効率的に統合する新しいトレーニング戦略であるOn-Policy Uniform Trainingである。
論文 参考訳(メタデータ) (2026-04-09T14:35:42Z) - S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation [22.303253139413286]
ブロック拡散言語モデルはブロックワイド自己回帰復号とブロック内並列復号を結合する。
この問題に対処する既存のアプローチでは、追加のトレーニングが必要か、追加のテストタイム計算が必要になります。
ブロック拡散言語モデルのための訓練不要な自己投機的デコーディングフレームワークであるS2D2を提案する。
論文 参考訳(メタデータ) (2026-03-26T17:48:50Z) - Residual Context Diffusion Language Models [90.07635240595926]
Residual Context Diffusion (RCD) は、捨てられたトークン表現をコンテキスト残留に変換し、次のデノイングステップでそれらを注入するモジュールである。
RCDは、最小限の計算オーバーヘッドで、5-10ポイントの精度でフロンティアdLLMを一貫して改善する。
論文 参考訳(メタデータ) (2026-01-30T13:16:32Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing [14.22753953706955]
Diffusion Large Language Models (dLLMs) は、テキスト生成のための自動回帰(AR) LLM に代わる有望な代替品として登場した。
本稿では、離散拡散強制(D2F)と呼ばれる単純かつ効果的な戦略に基づいて、この障壁を破る。
このようにして、バニラdLLMは効率的な推論のためにAR拡散ハイブリッドパラダイムに再構成される。
論文 参考訳(メタデータ) (2025-08-08T04:51:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。