論文の概要: DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- arxiv url: http://arxiv.org/abs/2607.05147v1
- Date: Mon, 06 Jul 2026 14:28:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.191739
- Title: DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- Title(参考訳): DSpark: 半自己回帰生成による信頼性スケジューリングされた投機的デコーディング
- Authors: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang,
- Abstract要約: 投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
- 参考スコア(独自算出の注目度): 69.8840101036735
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.
- Abstract(参考訳): 投機的復号化は、ターゲット検証からドラフト生成を分離することにより、Large Language Model (LLM)推論を加速する。
最近の並列プロジェクタは、1つの前方パスで長いトークンシーケンスを効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
さらに、これらの拡張ブロックを無差別に検証することは、高い拒否リスクを持つトークンに臨界バッチ容量を浪費し、高速サービスシステムにおいてスループットを著しく低下させる。
我々はDSparkという投機的復号化フレームワークを導入し,高スループット並列生成を適応的かつ負荷認識の検証と統合する。
ドラフト品質を維持するため、DSparkは半自己回帰アーキテクチャを使用して、並列バックボーンと軽量なシーケンシャルモジュールを結合し、ブロック内依存性モデリングを導入し、サフィックス崩壊を緩和する。
システムの効率を最適化するために、DSparkは信頼性スケジューリングの検証を採用し、推定プレフィックス生存確率とエンジン固有のスループットプロファイルに基づいて、各リクエストの検証期間を動的に調整する。
さまざまなドメインにわたるオフラインベンチマークでは、DSparkは最先端の自己回帰型および並列ドラフトラよりも許容される長さを大幅に改善する。
ライブユーザトラフィック下でDeepSeek-V4サービスシステムにデプロイされると、DSparkは検証の無駄を軽減できる。
確立されたプロダクションベースライン(MTP-1)と比較して、DSparkは、一致したスループットレベルで、ユーザ毎の生成速度を60~85%高速化する。
さらに,厳密な対話性制約の下でのスループット低下を防止することにより,従来達成不可能だったパフォーマンス層を実現し,サービスシステムのParetoフロンティアをシフトさせる。
関連論文リスト
- Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation [15.129362213838974]
2つのコンポーネントを持つトレース対応復号化フレームワークを提案する。
まず、時間空間並列復号(TSPD)は、トークンが収束し、安全に固定できるかどうかを決定するために、信頼、エントロピー、運動量を含む、トーケン軌道毎の特徴を消費する軽量な時間空間コントローラを使用する。
第二に、CE(Confidence Extrapolation)は、トレーニング不要な状態空間モジュールで、前向きな決定を支援するために、不確実性を伴う将来のロジットトレンドを予測する。
論文 参考訳(メタデータ) (2026-05-29T02:29:28Z) - Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes [10.877713536966601]
Longestahead Prefix(LSP)スケジューラは、モノリシックプレフィックスの吸収に基づく、トレーニング不要でモデルに依存しない推論パラダイムである。
LSPは1つのフォワードパスを介してトークンの安定性を評価し、安定な予測の連続した左整列ブロックを動的に識別する。
原子のコミットメントの前に、言語や構造的受容の境界を画定する。
論文 参考訳(メタデータ) (2026-03-05T18:25:26Z) - DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs [17.284485483927448]
拡散大言語モデル(dLLM)は、テキスト生成の有望な代替手段として登場した。
広く使われている固定ブロック (naive) スケジュールは意味的難易度に非依存であり、品質と効率の両面での準最適戦略である。
本研究では,動的ブロックの剛性を克服するため,動的サイズを有するスライディングブロックを用いて,トレーニング不要なブロックスケジューリング手法であるDynamic Sliding Block (DSB)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:41:38Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism [17.858104076062897]
大規模言語モデル (LLM) は、長いコンテンツ生成にますます使われている。
補助モデルや元のモデルパラメータの変更を必要とせずにデコーディングを高速化するAdaDecodeを提案する。
AdaDecodeは最大1.73倍のスピードアップで優れた復号処理を実現している。
論文 参考訳(メタデータ) (2025-06-04T08:32:30Z) - Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference [54.53508601749513]
本稿では,マルチモーダル理解のためのタスク指向特徴圧縮(TOFC)手法を提案する。
圧縮効率を向上させるために、視覚特徴の特性に基づいて複数のエントロピーモデルを適応的に選択する。
その結果,TOFCはデータ転送オーバーヘッドを最大52%削減し,システム遅延を最大63%削減できることがわかった。
論文 参考訳(メタデータ) (2025-03-17T08:37:22Z) - Fast and Robust Early-Exiting Framework for Autoregressive Language
Models with Synchronized Parallel Decoding [43.659680579686544]
本稿では,浅層深度モジュールと並列デコーディングを併用したFast and Robust Early-Exitingフレームワークを提案する。
我々のフレームワークは、既存のトークンの復号処理を、以前に積み重ねられた早期発行トークンと同期させることで、より高速な推論を可能にする。
並列デコーディングにより,浅層モデルと深部モデルの両方からの予測を観測できるので,新しい適応しきい値推定器を提案する。
論文 参考訳(メタデータ) (2023-10-09T05:53:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。