論文の概要: xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.02438v1
- Date: Mon, 03 Aug 2026 16:18:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.701905
- Title: xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- Title(参考訳): xPress: 投機的復号化における拡散減算のための並列リファインメント
- Abstract要約: ブロック拡散型ドラフトラは、1つのフォワードパスで、ドラフトトークンのブロック全体を生成する。
拡散型ドラフトラにおいて欠落した因果関係を復元する手段としてxPressを提案する。
- 参考スコア(独自算出の注目度): 15.519504114030221
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Block-diffusion drafters like dFlash generate an entire block of draft tokens in a single forward pass, drastically reducing the overhead of multiple-token drafting in speculative decoding. The crucial final step of the single-pass discrete denoising process involves using the logit distribution at each position to sample conditionally independent tokens. The resulting draft is thus a set of per-position marginals, rather than a joint distribution: no draft token is guaranteed to depend on its predecessors. Such independently sampled marginals tend to produce sequences with tokens that are individually likely, but jointly improbable under the target model's distribution, which verifies each token conditionally. This can cause early rejection and limits acceptance length. To address this, we propose xPress as a means to restore the missing causality in diffusion drafters. xPress is a lightweight causal refiner that reconciles the whole diffusion block at once through parallel refinement, restoring and propagating causal dependencies across the draft without a token-by-token loop. On Qwen3-8B, across seven math, code, and chat benchmarks, xPress raises acceptance length by about 30% on average (up to +56%) and its end-to-end decoding throughput by about 1.3 on average (up to 1.7) compared to the original dFlash diffusion drafter.
- Abstract(参考訳): dFlashのようなブロック拡散ドラフトラは、単一のフォワードパスでドラフトトークンのブロック全体を生成し、投機的デコーディングにおける多重トークンドラフトのオーバーヘッドを大幅に削減する。
単一パス離散化過程における決定的な最終段階は、各位置におけるロジット分布を用いて条件付き独立トークンをサンプリングすることである。
結果として得られたドラフトは、共同配布ではなく、配置ごとの限界の集合である: ドラフトトークンは、前任者に依存することが保証されない。
このような独立にサンプリングされた辺縁は、個々の確率で異なるトークンを持つシーケンスを生成する傾向にあるが、それぞれのトークンを条件付きで検証するターゲットモデルの分布の下では、共同で不可能である。
これは早期の拒絶と受容長の制限を引き起こす可能性がある。
そこで本研究では,拡散型ドラフトラにおいて欠落した因果関係を復元する手段として,xPressを提案する。
xPressは軽量な因果分解器で、トークン・バイ・トークンのループを使わずに、パラレルな洗練、復元、ドラフト全体の因果依存性の伝播を通じて、拡散ブロック全体を一度に調整する。
Qwen3-8Bでは、7つの数学、コード、チャットのベンチマークで、xPressは受け入れ期間を平均で約30%(+56%)、エンドツーエンドの復号スループットを平均で約1.3(最大1.7)引き上げている。
関連論文リスト
- A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models [0.6916773850242582]
サンプルのガウス雑音場によってマスクの埋め込みが乱れてしまうと、離散マスクモデルが1パスでブロック全体をコミットできるかどうかを問う。
本研究では,目標側エンコーダや自己回帰教師を使わずに,そのようなモデルをゼロから訓練するCONDORを提案する。
制御されたTinyStories設定では、このレシピはノイズによって異なるコヒーレントなワンパス継続を生成する。
論文 参考訳(メタデータ) (2026-09-06T01:09:14Z) - LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding [20.199505845822745]
投機的復号化は、ターゲットモデルが並列に検証する将来のトークンを起草することで言語モデル推論を加速する。
リリコラー(LiLiCorr)は、リレーダが既に生成している配置ごとの限界分布を相関する軽量な類似モデルである。
LiLiCorrは72設定中70のスループットを提供する。
論文 参考訳(メタデータ) (2026-08-20T19:43:02Z) - DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding [26.72775347772003]
対象サンプリング分布のエントロピーが増加するにつれて,受理されたドラフト長が劣化することを示す。
本稿では,トークン位置上での低ランク遅延混合に基づいて,受入指向の学習目標を補完する依存ブロック起草手法を提案する。
論文 参考訳(メタデータ) (2026-08-05T22:49:54Z) - AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling [60.04959047453115]
AURORA-LMは、デオード可能なテキスト表現の構築と、その分布のモデル化を分離した連続ラテント言語モデルである。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
論文 参考訳(メタデータ) (2026-08-03T17:59:50Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - Teaching Diffusion to Speculate Left-to-Right [3.205247598097648]
大規模言語モデル(LLM)は、幅広いタスクにわたって顕著なパフォーマンスを達成するが、その自己回帰的復号処理は、かなりの推論コストを発生させる。
投機的復号化はこのボトルネックに対処するため、軽量なドラフトモデルを使用して、後により大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案する。
最近の研究は、拡散言語モデルがこの設定に適しており、パラレルでドラフトトークンのブロック全体を生成できることを実証している。
論文 参考訳(メタデータ) (2026-06-10T01:21:56Z) - D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models [27.44373450962651]
最近の拡散ベースのドラフトラはトークンのブロック全体を並列に生成するが、通常は検証毎に単一のドラフトシーケンスにコミットする。
D2SDは,候補を信頼誘導プレフィックスツリーに整理する,二重拡散ドラフト投機的復号化フレームワークである。
結果として得られた共有誘導候補は、カスケードの注意を通して共同で検証される。
論文 参考訳(メタデータ) (2026-06-03T04:48:00Z) - TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding [32.75269650141292]
投機的復号化のためのワンショットブロックのドラフトは、1つのフォワードパスで完全なドラフトを生成する。
それぞれのドラフトトークンはプレフィックスコンテキストのみに条件付けされ、以前のドラフトトークンに依存しない。
この非自己回帰条件は、ドラフトの深さが大きくなるにつれて、検証者の真の自己回帰分布からドラフトの分布が分岐する。
そこで我々は,この問題に対処するために,プロダクタの隠蔽状態とそれ以前のトークンに条件付きレイヤを組み込んで,自己回帰分布を近似するTreeFlashを提案する。
論文 参考訳(メタデータ) (2026-06-02T16:00:18Z) - PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding [32.667256256847246]
拡散大言語モデル (dLLMs) は、マスク付きトークンシーケンスを反復的に記述することでテキストを生成する。
両軸に沿って推論を共同で改善するトレーニングフリーフレームワークであるParallel Speculative Decoding (PSD)を提案する。
論文 参考訳(メタデータ) (2026-05-15T04:43:02Z) - Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models [21.699371484195865]
我々は,dLLMの最終隠れ状態にアタッチする軽量依存予測器DEMASKを提案する。
実証的に、DEMASKはDream-7Bで1.7-2.2$times$ Speedupを達成し、信頼性ベースのベースラインやKLベースのベースラインと比較して精度が向上した。
論文 参考訳(メタデータ) (2026-04-02T22:21:24Z) - Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference [58.189320101488725]
DLLMは高速な非自己回帰推論を約束するが、並列デコーディングにおいて厳しい品質と速度のトレードオフを被る。
我々は、連続表現を離散デコードプロセスに統合することでこの問題に対処する。
本稿では,初期マスキング状態と最終復号化トークン状態の中間として,新しい連続混合状態を導入するフレームワークであるReMixを提案する。
論文 参考訳(メタデータ) (2026-02-26T11:08:11Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion [61.03681839276652]
拡散強制(Diffusion Forcing)は、拡散モデルをトレーニングし、トークンの集合に独立した音レベルを付与する、新たなトレーニングパラダイムである。
因果的次トーケン予測モデルを訓練して1つまたは複数の未来のトークンを生成することで、シーケンス生成モデルに拡散強制を適用する。
論文 参考訳(メタデータ) (2024-07-01T15:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。