論文の概要: A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding
- arxiv url: http://arxiv.org/abs/2607.27735v1
- Date: Thu, 30 Jul 2026 06:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.421653
- Title: A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding
- Title(参考訳): 列車不要の自己投機的復号法
- Authors: Yuesong Liu, Yuan Zeng, Min Lyu, Ruilin Liu, Yu Guo, Yinlong Xu,
- Abstract要約: 長文推論のためのトレーニング不要な自己投機的デコーディングフレームワークであるSparseSpec-Lを紹介する。
SparseSpec-Lは動的にスパース化され、リコール可能なKVキャッシュを使用して、ターゲットモデルから直接軽量なドラフトを生成する。
複数の長期コンテキストタスクとモデルスケールにわたる実験は、一貫したエンドツーエンドの加速を示す。
- 参考スコア(独自算出の注目度): 11.263048239748379
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding alleviates the memory-bandwidth bottleneck in large language model inference, but its acceleration is jointly constrained by drafting overhead, token acceptance, and speculation length. We present a unified efficiency analysis showing that extending the speculation horizon can reduce rather than improve speedup when the marginal acceptance probability falls below the relative drafting cost. Guided by this analysis, we introduce SparseSpec-L, a training-free self-speculative decoding framework for long-context inference. SparseSpec-L generates lightweight drafts directly from the target model using a dynamically sparsified and recallable KV cache. It recycles per-head attention statistics produced during full-context verification as a no-extra-forward importance signal, allowing critical historical tokens to be recalled without permanently discarding the dense KV cache. An online entropy-based controller further selects the speculation length according to expected step-wise efficiency. Experiments across multiple long-context tasks and model scales show consistent end-to-end acceleration, with up to speedup over autoregressive decoding while preserving the target model's output distribution.
- Abstract(参考訳): 投機的復号化は、大きな言語モデル推論におけるメモリバンド幅のボトルネックを軽減するが、その加速は、オーバーヘッドの起草、トークンの受け入れ、投機長によって共同で制限される。
本稿では,相対的な起草コスト以下で限界受容確率が低下した場合に,投機的地平線を延ばすことで,高速化よりも削減できることを示す。
この分析で導かれたSparseSpec-Lは、長文推論のためのトレーニング不要な自己投機的デコーディングフレームワークである。
SparseSpec-Lは動的にスパース化され、リコール可能なKVキャッシュを使用して、ターゲットモデルから直接軽量なドラフトを生成する。
フルコンテキスト検証時に発生したヘッドアテンション毎の統計データを、外部から重要でないシグナルとしてリサイクルし、重要な歴史的トークンを、密度の高いKVキャッシュを永久に破棄することなくリコールできるようにする。
オンラインエントロピーベースのコントローラは、予想されるステップワイド効率に応じて投機長を更に選択する。
複数の長期コンテキストタスクとモデルスケールにわたる実験は、目標モデルの出力分布を保ちながら、自動回帰デコーディングを最大で高速化する、一貫したエンドツーエンドの加速を示す。
関連論文リスト
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding [7.4564440570059]
Dustinは投機的復号化のために設計されたスパース検証フレームワークである。
ドラフトモデルからのルックアヘッド信号とターゲットモデルからの歴史的な注意を統合して、クリティカルトークンを識別する。
自己アテンションの27.85倍のスピードアップと、32kのシーケンス長で9.17倍のエンドツーエンドのデコードスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-23T08:51:20Z) - Quasar: Quantized Self-Speculative Acceleration for Rapid Inference via Memory-Efficient Verification [11.585310190276923]
textbfQuasar (textbfQuantized textbfSelf-speculative textbfAcceleration for textbfRapid Inference)は、この「メモリウォール」を克服するために設計されたトレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-03-02T03:02:25Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences [11.225649178057695]
SpecExtendは、追加のトレーニングなしで長いシーケンスでの投機的復号化を改善する。
長い入力のドラフト精度と速度をトレーニングせずに向上させるため,クロスモデル検索を提案する。
SpecExtendは16K-tokenの長い要約で最大2.84倍、長い推論で最大3.86倍の投機的復号化を加速する。
論文 参考訳(メタデータ) (2025-05-27T06:30:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。