論文の概要: LongSpark: Efficient speculative decoding with a fixed-cost parallel drafter
- arxiv url: http://arxiv.org/abs/2609.37029v1
- Date: Tue, 29 Sep 2026 08:42:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.33735
- Title: LongSpark: Efficient speculative decoding with a fixed-cost parallel drafter
- Title(参考訳): LongSpark: 固定コストのパラレルドラフトによる効率的な投機的デコーディング
- Abstract要約: LongSparkは、複数のモデルスケールにわたる最先端のエンドツーエンド効率を達成する、ブロック拡散ドラフトラである。
長いコンテキストタスクに対して最小の時間単位のコンテキストを提供すると同時に、ドラフトアのコンテキスト状態を桁違いに削減します。
- 参考スコア(独自算出の注目度): 21.532092822766504
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Speculative decoding accelerates autoregressive inference by verifying multiple draft tokens in a single target forward pass. However, as the context grows, existing state-of-the-art drafters become increasingly expensive, eroding the very efficiency advantage they are designed to provide. We argue that this scaling is unnecessary. A standalone language model must grow with its prefix because it is solely responsible for every token it produces. A drafter, by contrast, only proposes candidates; the target catches and corrects every error before any token is committed. The drafter's decoding cost can therefore be made entirely independent of the prefix length. We introduce LongSpark, a block-diffusion drafter that achieves this by extracting fixed-size, multiscale views from the target's verification pass, thereby eliminating the need for a growing persistent state. Extensive evaluations demonstrate that LongSpark achieves state-of-the-art end-to-end efficiency across multiple model scales and realistic serving conditions. Notably, it delivers the lowest time-per-output-token on long-context tasks while reducing the drafter's context state by several orders of magnitude.
- Abstract(参考訳): 投機的復号化は、1つのターゲットフォワードパスで複数のドラフトトークンを検証することで自己回帰推論を加速する。
しかし、状況が大きくなるにつれて、既存の最先端のドラフト作成者はますます高価になり、提供するように設計された非常に効率的な利点を損なうことになる。
このスケーリングは不要である、と私たちは主張する。
スタンドアロンの言語モデルは、生成するトークンにのみ責任を持つため、プレフィックスで成長しなければなりません。
対照的に、ドラフト作成者は候補のみを提案し、ターゲットはトークンがコミットされる前にすべてのエラーをキャッチして修正する。
従って、起草者の復号コストはプレフィックスの長さから完全に独立させることができる。
本稿では,固定サイズのマルチスケールビューを対象の検証パスから抽出し,永続状態の増大を回避し,これを実現するブロック拡散ドラフトラであるLongSparkを紹介する。
大規模な評価では、LongSparkは複数のモデルスケールと現実的なサービス条件で最先端のエンドツーエンド効率を達成する。
特に、長いコンテキストタスクに対して、アウトプット当たりの最低時間を提供しながら、ドラフトアのコンテキスト状態を桁違いに削減します。
関連論文リスト
- Beyond the Target: From Imitation to Collaboration in Speculative Decoding [23.603110768087973]
投機的復号(SPD)は、より小さなドラフトモデルに、より大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案することによって、大きな言語モデル(LLM)推論を加速させる。
支配的なSPDパラダイムは、ターゲットモデルを唯一信頼できる教師として扱い、ターゲット予測と正確に一致する場合にのみドラフトトークンを受け入れる。
我々は、SPDの一般化である textbfCollaborative Decoding (CoSpec) を導入し、ターゲットモデルを唯一のトークンレベルの権威として扱わなくなった。
論文 参考訳(メタデータ) (2026-05-24T00:34:53Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models [13.242009624334996]
DynaSpecは動的ショートリスト機構で、堅牢で、ドラフトをスピードアップし、さまざまなタスクにまたがって一般化する。
Llama-3-8Bでは許容される平均長を98.2%まで改善した。
文脈依存の選択を利用することで、DynaSpecは生成トークンの最大2.18倍、固定語彙アプローチの1.91倍を達成する。
論文 参考訳(メタデータ) (2025-10-11T19:38:07Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - ParallelSpec: Parallel Drafter for Efficient Speculative Decoding [62.68430939686566]
提案するParallelSpecは,最先端の投機的復号化手法における自己回帰的起草戦略の代替となる。
投機段階における自己回帰的起草とは対照的に,効率的な投機モデルとして機能する並列投機を訓練する。
論文 参考訳(メタデータ) (2024-10-08T01:05:08Z) - PEARL: Parallel Speculative Decoding with Adaptive Draft Length [12.166703341906242]
本稿では,適応dRaft Length(PEARL)を用いた投機的復号化(Parallel speculative decoding)を促進するための,概念的にシンプルでフレキシブルで汎用的なフレームワークを提案する。
PEARLは、ドラフトフェーズ中に事前に最初のドラフトトークンを検証し、検証フェーズ中により多くのドラフトトークンを生成するための後検証を提案する。
各種テキスト生成ベンチマークの実験では、PEARLの有効性が実証されており、自動回帰復号法とバニラ投機復号法と比較して、パフォーマンスが4.43$times$と1.50$times$に向上した。
論文 参考訳(メタデータ) (2024-08-13T08:32:06Z) - Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding [65.94521678103237]
投機的復号化(英: Speculative decoding)は、大規模言語モデルの生成プロセスを加速する広く使われている手法である。
我々は,草案作成プロセスの並列化のために,草案文を生成するOuroborosを紹介した。
ウロボロは投機的復号化で最大2.8倍、バニラ復号化で3.9倍のスピードアップを達成できる。
論文 参考訳(メタデータ) (2024-02-21T11:31:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。