論文の概要: Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
- arxiv url: http://arxiv.org/abs/2605.30852v1
- Date: Fri, 29 May 2026 05:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.398781
- Title: Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
- Title(参考訳): 投機的パイプラインデコーディング:パイプライン並列性による高精度およびゼロバブル投機
- Abstract要約: 投機的パイプラインデコーディング(SPD)はパイプライン並列性の本当の可能性を解き放つ画期的なフレームワークである。
実験の結果,SPDは主流のベースラインに比べて理論的なスピードアップがかなり高いことがわかった。
- 参考スコア(独自算出の注目度): 18.740761250499848
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Speculative Decoding (SD) accelerates low-concurrency LLM inference by employing a draft-then-verify paradigm. However, mainstream methods typically rely on multi-token prediction, which introduces escalating prediction difficulty and serial drafting latency. To address these, we propose Speculative Pipeline Decoding (SPD), a groundbreaking framework that unlocks the true potential of pipeline parallelism. By partitioning the target LLM into $n$ pipeline stages, SPD allows LLM to process $n$ tokens in parallel to accelerate decoding. To continuous fill the pipeline in single sequence decoding, a speculation module aggregates intermediate features across different pipeline depths to predict the next token, executing strictly in parallel with the target model's pipeline step, to realize bounded difficulty, higher acceptance rates, and zero latency bubbles. Our experiments demonstrate that SPD achieves a significantly higher theoretical speedup compared to mainstream baselines, offering a highly scalable solution for LLM decoding acceleration. Our code is available at https://github.com/yuyijiong/speculative_pipeline_decoding
- Abstract(参考訳): 投機的復号(SD)は、ドラフト・then-verifyパラダイムを用いることで、低コンカレンシーLLM推論を加速する。
しかし、主流の手法は一般的に、エスカレーション予測の難しさと連続的な起草遅延をもたらすマルチトークン予測に依存している。
このような問題に対処するため,パイプライン並列化の本当の可能性を解き放つ基盤となるフレームワークであるSPD(Speculative Pipeline Decoding)を提案する。
ターゲットのLLMを$n$パイプラインステージに分割することで、SPDは並列に$n$トークンを処理し、デコーディングを高速化する。
単一シーケンスのデコーディングでパイプラインを連続的に埋めるために、投機モジュールは、異なるパイプライン深さの中間機能を集約して次のトークンを予測する。
我々の実験は、SPDが主流のベースラインよりもはるかに高い理論的高速化を実現し、LLM復号高速化のための高度にスケーラブルなソリューションを提供することを示した。
私たちのコードはhttps://github.com/yuyijiong/speculative_pipeline_decodingで利用可能です。
関連論文リスト
- Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding [53.46134917935135]
Lookahead PArallel Decoding LoPAは、訓練不要のプラグイン・アンド・プレイアルゴリズムで、優れたToken Filling Order(TFO)を識別する。
LoPAは並列ブランチを通じて、異なる候補TFOを同時に探索し、ブランチの信頼性に基づいて、将来の並列性に対して最も高い可能性を持つものを選択する。
特に,LoPAはD2F-DreamのTPFをGSM8K上で10.1に向上させ,Dreamベースラインよりも優れた性能を維持した。
論文 参考訳(メタデータ) (2025-12-18T06:22:01Z) - Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference [11.957170239588535]
投機的復号化は、ドラフトモデルを使用して推測を加速する。
事前の方法は、ドラフトコストを部分的に削減するが、受け入れを低下させるか、スケーリングを制限するオーバーヘッドを導入する。
本稿では,遅延受容トレードオフを破る推論アルゴリズムであるMirror Speculative Decoding(Mirror-SD)を提案する。
論文 参考訳(メタデータ) (2025-10-15T05:22:57Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding [21.609237262034636]
大規模言語モデル(LLM)における自己回帰復号には、$n$トークンに対して$mathcalO(n)$シーケンシャルステップが必要である。
本稿では,並列デコード学習(Learn2PD)を提案する。これは軽量かつ適応的なフィルタモデルをトレーニングし,各トークン位置に対して,現在の予測が最終出力と一致するかどうかを予測するフレームワークである。
この学習されたフィルタは、正しく予測された場合にのみトークンをアンマスクするオラクル並列復号法を近似する。
論文 参考訳(メタデータ) (2025-09-29T17:59:54Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z) - PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding [4.734824660843965]
PipeSpecは、投機的デコーディングを階層的なパイプラインに配置された$k$モデルに一般化するフレームワークである。
PipeSpecは2.54$times$の高速化を実現し、最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-05-02T20:29:31Z) - SpecPipe: Accelerating Pipeline Parallelism-based LLM Inference with Speculative Decoding [33.55718885446209]
パイプラインに投機トークンをステップバイステップで埋めるSpecPipeを紹介します。
ハードウェア利用の最大化によって、SpecPipeはパイプライン毎に1つのトークンを理想的にデコードする。
SpecPipe-DB はシングルリクエストとマルチリクエストの推論のために SpecPipe-DB を用いて動的ワークロードで実装する。
論文 参考訳(メタデータ) (2025-04-05T08:31:10Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - Fast Chain-of-Thought: A Glance of Future from Parallel Decoding Leads to Answers Faster [61.83949316226113]
FastCoTは並列デコーディングに基づくモデルに依存しないフレームワークである。
我々は、FastCoTが通常のアプローチと比較して、無視できる性能低下だけで、推論時間を20%近く削減できることを示します。
論文 参考訳(メタデータ) (2023-11-14T15:56:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。