論文の概要: A Practical Investigation of Training-free Relaxed Speculative Decoding
- arxiv url: http://arxiv.org/abs/2607.08690v1
- Date: Thu, 09 Jul 2026 16:50:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.602929
- Title: A Practical Investigation of Training-free Relaxed Speculative Decoding
- Title(参考訳): トレーニング不要な緩和型投機的復号法の一検討
- Authors: Guoxuan Xia, Luka Ribar, Paul Balanca,
- Abstract要約: トレーニング不要な緩和された投機的復号法について検討する。
既存のアプローチを共有フレームワークに統合します。
緩和されたアプローチが、優れた言語モデルであるドラフトラに依存していることを示す。
- 参考スコア(独自算出の注目度): 6.241175101549978
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates sampling from an autoregressive LLM by using a faster auxiliary model to draft tokens which are then verified in parallel by the LLM. Standard speculative decoding is lossless: its rejection and resampling steps exactly preserve the LLM's sampling distribution. Recent work argues that relaxing this strict guarantee can yield further speed-ups, controlled capability-speed trade-offs, or even capability gains. We practically investigate training-free relaxed speculative decoding techniques, unify existing approaches within a shared framework, benchmark them on contemporary settings, and distil takeaways and empirical findings for practitioners. Important takeaways include: relaxation can require considerable capability evaluation unlike lossless speculative decoding, and many relaxed approaches rely on a drafter that is a good language model, making them unsuited for lightweight dedicated multi-token-prediction drafters.
- Abstract(参考訳): 投機的復号化は、高速補助モデルを用いて自己回帰LDMからのサンプリングを加速し、LLMによって並列に検証されるトークンをドラフトする。
標準的な投機的復号法は失われず、その拒絶と再サンプリングのステップはLLMのサンプリング分布を正確に保存する。
最近の研究は、この厳格な保証を緩めることで、さらなるスピードアップ、制御能力-速度トレードオフ、さらには能力向上につながると主張している。
トレーニング不要の緩和された投機的復号法を実際に検討し、共有フレームワーク内で既存のアプローチを統一し、現代の設定でそれらをベンチマークし、実践者にとっての試行錯誤や経験的発見を排除した。
緩和は、損失のない投機的デコーディングとは異なり、かなりの能力評価を必要とするし、多くの緩和されたアプローチは、優れた言語モデルであるドラフトラに依存しているため、軽量なマルチトークン予測ドラフトラには適さない。
関連論文リスト
- Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - Speeding up Speculative Decoding via Sequential Approximate Verification [7.754712828900729]
投機的復号法 (SD) はLarge Language Models (LLM) を用いた高速推論手法である。
本稿では,SPRINTERを提案する。SPRINTERは,LLMから生成されたトークンが目標のLLMに受け入れられるかどうかを予測するために訓練された,低複雑さの検証器である。
逐次近似検証を行うことで、SPRINTERは目標のLSMによる検証を必要とせず、トークンが受け入れられないと判断された場合にのみ呼び出される。
論文 参考訳(メタデータ) (2025-02-06T23:10:53Z) - Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation [8.046705062670096]
損失のない投機的復号化は、ターゲットとする大言語モデル推論を加速する。
FSPAD (Feature Sampling and partial Alignment Distillation for Lossless Speculative Decoding) を提案する。
我々の実験は、ヴィクナ級数とLLaMA3-インストラクト級数で最大かつ最小のモデルにおいて、欲求と非欲求デコーディングの両方を含む。
論文 参考訳(メタデータ) (2024-08-28T06:28:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。