論文の概要: DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting
- arxiv url: http://arxiv.org/abs/2607.07409v1
- Date: Wed, 08 Jul 2026 13:41:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.3972
- Title: DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting
- Title(参考訳): DeLS-Spec:並列投機描画のための非結合長短コンテキスト
- Authors: Hong-Kai Zheng, Piji Li,
- Abstract要約: 投機的復号化は、複数のトークンを起草し、それらを並列に検証することで推論を加速する。
DominoやDSparkといった最近の手法では、ブロック並列のドラフトに因果性を導入しようとしているが、ドラフトモデルをゼロからトレーニングする必要がある。
本稿では,デカップリング型長短コンテキスト投機復号法であるDeLS-Specを提案する。
- 参考スコア(独自算出の注目度): 22.7968403903992
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates LLM inference by drafting multiple tokens and verifying them in parallel. Block-parallel drafters such as DFlash further improve drafting efficiency by predicting an entire block in one pass, but their position-wise predictions lack explicit intra-block causal conditioning. Recent methods such as Domino and DSpark attempt to introduce such causality into block-parallel drafting, but they require training the draft model from scratch, which limits their flexibility and increases training cost. We propose DeLS-Spec, a decoupled long-short context speculative decoding method. DeLS-Spec treats the fixed DFlash model as a long-context expert and introduces a lightweight local head as a short-context expert. The local head can be trained independently with a standard next-token prediction objective, without joint training with the target model or the DFlash backbone, leading to extremely low training cost. At inference time, DeLS-Spec combines long-context and short-context logits, and the local head is not tied to a specific DFlash checkpoint, making the method more modular and flexible. Experiments on Qwen3 models show that DeLS-Spec consistently improves speedup and average acceptance length over DFlash across math, code, and dialogue benchmarks.
- Abstract(参考訳): 投機的復号化は、複数のトークンを起草し、それらを並列に検証することでLCM推論を加速する。
DFlashのようなブロック並列のドラフトラは、1回のパスでブロック全体を予測することでドラフトの効率をさらに向上するが、その位置ワイドな予測にはブロック内の因果条件が明示されていない。
DominoやDSparkといった最近の手法では、ブロック並列のドラフトにこのような因果性を導入しようとしているが、その柔軟性を制限し、トレーニングコストを増大させるために、ドラフトモデルをゼロからトレーニングする必要がある。
本稿では,デカップリング型長短コンテキスト投機復号法であるDeLS-Specを提案する。
DeLS-Specは固定DFlashモデルを長文の専門家として扱い、短文専門家として軽量なローカルヘッドを導入している。
ローカルヘッドは、ターゲットモデルやDFlashバックボーンと共同でトレーニングすることなく、標準の次世代予測目標と独立してトレーニングすることができるため、非常に低いトレーニングコストがかかる。
推論時に、DeLS-Specは長文と短文のロジットを結合し、ローカルヘッドは特定のDFlashチェックポイントに縛られず、メソッドをよりモジュール化し、柔軟にする。
Qwen3モデルの実験では、DLS-Specは数学、コード、ダイアログのベンチマークでDFlashよりもスピードアップと平均受け入れ期間を継続的に改善している。
関連論文リスト
- D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem [12.668341559890605]
KnapSpecは、knapsack問題としてドラフトモデル選択を再構成し、トークン毎のスループットを最大化する、トレーニング不要のフレームワークである。
本稿では,トークンの受入率の数学的代用として,隠れ状態間のコサイン類似性を証明した最初の厳密な理論的解析を行う。
Qwen3とLlama3の実験は、KnapSpecが最先端のベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-02-23T08:13:03Z) - DFlash: Block Diffusion for Flash Speculative Decoding [11.98141750480807]
自己回帰型大規模言語モデル(LLM)は高い性能を提供するが、本質的にシーケンシャルなデコーディングを必要とする。
本稿では,並列起草のための軽量ブロック拡散モデルを用いた投機的復号化フレームワークであるDFlashを紹介する。
論文 参考訳(メタデータ) (2026-02-05T18:59:30Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding [4.734824660843965]
PipeSpecは、投機的デコーディングを階層的なパイプラインに配置された$k$モデルに一般化するフレームワークである。
PipeSpecは2.54$times$の高速化を実現し、最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-05-02T20:29:31Z) - SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration [10.970637831760136]
投機的復号法(SD)は,LLM推論を品質を損なうことなく高速化するためのパラダイムとして広く用いられている。
本稿では,LLMの中間層を適応的に選択して推論時にスキップする,オンザフライの自己投機的復号アルゴリズムであるSWIFTを紹介する。
実験により,SWIFTは生成したテキストの元の分布を保ちながら,1.3x-1.6x以上の高速化を実現することができることを示した。
論文 参考訳(メタデータ) (2024-10-09T14:15:30Z) - ParallelSpec: Parallel Drafter for Efficient Speculative Decoding [62.68430939686566]
提案するParallelSpecは,最先端の投機的復号化手法における自己回帰的起草戦略の代替となる。
投機段階における自己回帰的起草とは対照的に,効率的な投機モデルとして機能する並列投機を訓練する。
論文 参考訳(メタデータ) (2024-10-08T01:05:08Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。