論文の概要: DLoop: Looped Speculative Decoding
- arxiv url: http://arxiv.org/abs/2610.07659v1
- Date: Tue, 06 Oct 2026 02:55:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.776391
- Title: DLoop: Looped Speculative Decoding
- Title(参考訳): DLoop: ループ化された投機的デコード
- Abstract要約: 投機的復号化は、大規模言語モデルにおける自己回帰生成を加速させる。
検証は各ドラフト段階に従って行われ、不要なターゲットモデルフォワードがパスされる。
提案するDLoopは,検証前に複数の起草段階を適応的に実行するループ型投機復号法である。
- 参考スコア(独自算出の注目度): 57.84976863792784
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates autoregressive generation in large language models. In each drafting stage, a lightweight draft model proposes tokens that the target model subsequently verifies. With increasingly capable draft models, we find that the target model frequently accepts all tokens produced in a drafting stage. A verification nevertheless follows each drafting stage, resulting in unnecessary target-model forward passes even when drafting could have continued. Adaptive draft length methods decide during decoding how many draft tokens precede a verification, but they raise the speedup only for autoregressive draft models. For a parallel draft model, drafting further requires target-model hidden states for draft tokens that have not been verified. We propose DLoop, a looped form of speculative decoding that adaptively performs multiple drafting stages before verification. DLoop continues drafting while the draft model remains confident and verifies all accumulated draft tokens together. Loop-aware training keeps the draft model reliable in the additional drafting stages by exposing it to its own hidden states for unverified draft tokens. By spending additional draft-model forward passes, DLoop reduces the number of target-model forward passes required for verification. Across diverse speculative decoding methods including EAGLE-3, DFlash, Domino, DSpark, and multi-token prediction modules, DLoop improves the wall-clock speedup by 5 to 41 percent while preserving lossless decoding. Code will be available at https://github.com/naver-ai/DLoop.
- Abstract(参考訳): 投機的復号化は、大規模言語モデルにおける自己回帰生成を加速させる。
各ドラフト段階では、軽量なドラフトモデルがトークンを提案し、その後、ターゲットモデルが検証する。
ますます有能なドラフトモデルでは、ターゲットモデルは、ドラフト段階で生成されたすべてのトークンを頻繁に受け入れる。
それでも検証は各起草段階に従い、起草が続けられた場合でも、不要な目標モデル前方通過が生じる。
適応的ドラフト長法は、検証に先立って何個のドラフトトークンをデコードするかを決定するが、自動回帰的ドラフトモデルのみにスピードアップする。
パラレルドラフトモデルでは、未検証のドラフトトークンに対して、さらにターゲットモデル隠れ状態が必要となる。
提案するDLoopは,検証前に複数の起草段階を適応的に実行するループ型投機復号法である。
DLoopはドラフトを継続するが、ドラフトモデルは自信を持ち、まとめられたドラフトトークンを一緒に検証する。
ループアウェアトレーニングは、未検証のドラフトトークンを隠された状態に公開することにより、追加のドラフト段階でドラフトモデルを信頼性を維持する。
追加のドラフトモデルフォワードパスを使用することで、DLoopは検証に必要なターゲットモデルフォワードパスの数を減らすことができる。
EAGLE-3, DFlash, Domino, DSpark, およびマルチトークン予測モジュールを含む様々な投機的復号化手法において、DLoopは損失のない復号化を保ちながら、ウォールクロックの高速化を5~41%改善する。
コードはhttps://github.com/naver-ai/DLoop.comから入手できる。
関連論文リスト
- LongSpark: Efficient speculative decoding with a fixed-cost parallel drafter [21.532092822766504]
LongSparkは、複数のモデルスケールにわたる最先端のエンドツーエンド効率を達成する、ブロック拡散ドラフトラである。
長いコンテキストタスクに対して最小の時間単位のコンテキストを提供すると同時に、ドラフトアのコンテキスト状態を桁違いに削減します。
論文 参考訳(メタデータ) (2026-09-29T08:42:58Z) - Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length [21.738896310075678]
投機的復号法(SD)は,大規模言語モデル(LLM)の推論過程を高速化する強力な手法である
軽量でトレーニング可能な事前検証レイヤを用いて,ドラフト長を動的に制御する新しいアプローチであるPacerを提案する。
以上の結果から,Pacerは自己回帰復号化よりも最大2.66倍の高速化を実現し,一貫した投機復号化を実現していることがわかった。
論文 参考訳(メタデータ) (2026-02-01T15:12:38Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - CARD: A Cache-Assisted Parallel Speculative Decoding Framework via Query-and-Correct Paradigm for Accelerating LLM Inference [14.527697328189362]
本稿では,新しいクエリ・アンド・コレクト・パラダイムを用いたCARDという投機的復号化フレームワークを提案する。
提案手法は,提案手法を検証から切り離し,詳細な調整を伴わずに効果的にドラフトモデルの効率を向上する。
CARDは既存の最先端の手法よりも優れており、バニラ自己回帰復号よりも最大4.83倍の高速化を実現している。
論文 参考訳(メタデータ) (2025-08-06T14:02:10Z) - PEARL: Parallel Speculative Decoding with Adaptive Draft Length [12.166703341906242]
本稿では,適応dRaft Length(PEARL)を用いた投機的復号化(Parallel speculative decoding)を促進するための,概念的にシンプルでフレキシブルで汎用的なフレームワークを提案する。
PEARLは、ドラフトフェーズ中に事前に最初のドラフトトークンを検証し、検証フェーズ中により多くのドラフトトークンを生成するための後検証を提案する。
各種テキスト生成ベンチマークの実験では、PEARLの有効性が実証されており、自動回帰復号法とバニラ投機復号法と比較して、パフォーマンスが4.43$times$と1.50$times$に向上した。
論文 参考訳(メタデータ) (2024-08-13T08:32:06Z) - Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding [65.94521678103237]
投機的復号化(英: Speculative decoding)は、大規模言語モデルの生成プロセスを加速する広く使われている手法である。
我々は,草案作成プロセスの並列化のために,草案文を生成するOuroborosを紹介した。
ウロボロは投機的復号化で最大2.8倍、バニラ復号化で3.9倍のスピードアップを達成できる。
論文 参考訳(メタデータ) (2024-02-21T11:31:28Z) - Multi-Candidate Speculative Decoding [82.05519287513444]
大規模な言語モデルは、様々なNLPタスクで印象的な機能を示してきたが、その生成は自動回帰的に時間を要する。
これは高速なドラフトモデルから候補セグメントを生成し、ターゲットモデルによって並列に検証する。
本稿では,複数の候補をドラフトモデルから抽出し,検証のためにバッチにまとめる手法を提案する。
対象モデルの分布を維持しつつ,効率的な多候補検証のためのアルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-01-12T17:15:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。