論文の概要: WaveFront Decoding: Parallelized Self-Speculative Decoding for Looped Language Models
- arxiv url: http://arxiv.org/abs/2609.23033v2
- Date: Sat, 26 Sep 2026 09:59:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.570774
- Title: WaveFront Decoding: Parallelized Self-Speculative Decoding for Looped Language Models
- Title(参考訳): WaveFrontデコーディング:ループ言語モデルのための並列化された自己スペクトルデコーディング
- Abstract要約: Wavefront Decoding (WFD) は、ループ言語モデル用に設計されたトレーニング不要の自己投機的デコーディングフレームワークである。
WFDは2つの特性を利用する: 中間繰り返し出力は効果的なドラフト予測を提供し、ウェイトシェアリングは異なる位置におけるトークン状態と繰り返し深さを1回のバッチ・リカレント・ブロック呼び出しで処理することを可能にする。
- 参考スコア(独自算出の注目度): 8.374784970639263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped language models repeatedly apply a weight-shared block to increase effective depth without increasing parameter count, but the resulting T sequential recurrent-block calls per generated token substantially increase decoding latency. To address the issue, we introduce Wavefront Decoding (WFD), a training-free self-speculative decoding framework designed for looped language models. WFD exploits two properties of these architectures: intermediate recurrence outputs provide effective draft predictions, and weight sharing allows token states at different positions and recurrence depths to be processed in one batched recurrent-block call. WFD organizes these mixed-depth states into a diagonal wavefront, continuously drafting new positions at shallow depth while advancing earlier positions toward full-depth verification. Unlike the phase-separated draft-then-verify schedule, WFD therefore concurrently batches drafting and verification within the same recurrent calls, while rejected drafts are corrected using full-depth predictions. Across six Spec-Bench task categories, WFD achieves 2.42x speedup on Ouro-2.6B and 3.54x on Huginn-3.5B over autoregressive decoding, consistently outperforming draft-then-verify. Cross-recurrence KV sharing further reduces wavefront KV traffic and increases WFD's speedup to 4.81x on Huginn-3.5B. The code is available at https://github.com/summerbro-hhj/wavefront-decoding.
- Abstract(参考訳): ループ言語モデルは、パラメータ数を増やすことなく効果的な深さを高めるために重み付きブロックを繰り返し適用するが、結果として生成されたトークン毎のTシーケンシャルなリカレントブロック呼び出しはデコード遅延を大幅に増加させる。
この問題に対処するために、ループ言語モデル用に設計されたトレーニング不要な自己投機的デコーディングフレームワークであるWavefront Decoding (WFD)を紹介する。
WFDはこれらのアーキテクチャの2つの特性を利用する: 中間繰り返し出力は効果的なドラフト予測を提供する。
WFDはこれらの混合深度状態を対角波面に整理し、浅い深度で新しい位置を継続的に起草し、より早い位置を全深度検証に向けて前進させる。
フェーズ分離されたドラフト-then-verifyスケジュールとは異なり、WFDは同一の繰り返し呼び出し内でドラフトと検証を同時にバッチし、削除されたドラフトは全深度予測を用いて修正する。
6つのSpec-Benchタスクカテゴリで、WFDはOuro-2.6Bで2.42倍、Huginn-3.5Bで3.54倍、自動回帰デコードで、一貫してドラフト-then-verifyを上回っている。
クロスリカレンスKV共有は波面KVトラフィックをさらに減少させ、Huginn-3.5BでWFDの速度を4.81倍に向上させる。
コードはhttps://github.com/summerbro-hhj/wavefront-decoding.comで公開されている。
関連論文リスト
- Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Teaching Diffusion to Speculate Left-to-Right [3.205247598097648]
大規模言語モデル(LLM)は、幅広いタスクにわたって顕著なパフォーマンスを達成するが、その自己回帰的復号処理は、かなりの推論コストを発生させる。
投機的復号化はこのボトルネックに対処するため、軽量なドラフトモデルを使用して、後により大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案する。
最近の研究は、拡散言語モデルがこの設定に適しており、パラレルでドラフトトークンのブロック全体を生成できることを実証している。
論文 参考訳(メタデータ) (2026-06-10T01:21:56Z) - FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration [21.05266483397106]
FlexDraftは投機的デコードフレームワークで、3つの重要な設計を通じて様々なバッチサイズに対応します。
Attention Tuningは、マスクトークン上の最後の数層の注意プロジェクタのみをチューニングすることで、ブロック拡散のドラフトを可能にする。
Bonus-guidedは、解決されたボーナストークンに軽量な条件を付け、ドラフトロジットを校正する。
論文 参考訳(メタデータ) (2026-05-19T15:48:16Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes [10.877713536966601]
Longestahead Prefix(LSP)スケジューラは、モノリシックプレフィックスの吸収に基づく、トレーニング不要でモデルに依存しない推論パラダイムである。
LSPは1つのフォワードパスを介してトークンの安定性を評価し、安定な予測の連続した左整列ブロックを動的に識別する。
原子のコミットメントの前に、言語や構造的受容の境界を画定する。
論文 参考訳(メタデータ) (2026-03-05T18:25:26Z) - SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding [48.96349422252313]
投機的復号化は,Large Language Model (LLM)推論の高速化のための標準手法となっている。
自動回帰デコーディングの遅延を回避し、印象的なスピードアップを実現するために、損失のないドラフト検証手順を利用する。
本稿では,これら2つのボトルネックに共同で対処する新しいフレームワークであるSpecDiff-2を提案する。
論文 参考訳(メタデータ) (2025-11-01T16:12:56Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。