論文の概要: AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
- arxiv url: http://arxiv.org/abs/2607.25852v2
- Date: Wed, 29 Jul 2026 07:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.738595
- Title: AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
- Title(参考訳): AngelSpec: 投機的デコーディングによる実世界のハイパフォーマンス推論を目指す
- Authors: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu,
- Abstract要約: 投機的復号化は、ターゲット分布を変更することなく、大きな言語モデル推論を加速する。
本稿では,投機的復号化のための統一的なトレーニングフレームワークであるAngelSpecを紹介する。
アーキテクチャレベルでは,ブロック拡散フレームワークDFlyを提案する。
- 参考スコア(独自算出の注目度): 29.797292873854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates large language model inference without changing the target distribution, but no single drafting structure performs best across real-world workloads. Autoregressive multi-token prediction (MTP) is a lightweight, stable proposal mechanism, whereas block-parallel diffusion amortizes drafting latency over much longer candidate sequences; the better choice depends strongly on the output distribution. We present AngelSpec, a unified training framework for MTP and block-parallel speculative decoding that addresses this heterogeneity at three levels. At the training level, rather than fitting one universal drafter to a uniform data mixture, we co-specialize structure and data: the MTP drafter is trained on diverse conversational data for high-entropy open-ended chat, and the block-diffusion drafter on code and mathematics data for longer predictable continuations. At the architecture level, we propose DFly, a block-diffusion framework combining a hybrid target-conditioning backbone with a predecessor-conditioned autoregressive head, improving target-feature utilization and intra-block dependency modeling while keeping generation parallel. At the inference level, both acceptance length and verification cost vary with domain, request, online load, and hardware, so DFly treats verification as a shared batch-level resource: it reallocates compute toward high-confidence prefixes across requests and combines expected utility with a profiled cost model to adapt verification depth online. Across the Hy3 series, DFly raises the average accepted length on Hy3-A21B by roughly 30% and attains the highest average throughput at every tested concurrency from 4 to 64, a 1.98-2.40x speedup over autoregressive decoding and 10.5-11.8% higher throughput than DFlash. We release AngelSpec to support training and extending these methods.
- Abstract(参考訳): 投機的復号化は、ターゲットの分布を変更することなく、大きな言語モデル推論を加速させるが、実際のワークロード間では、単一のドラフト構造が最善を尽くすことはない。
MTP(Autoregressive Multi-token Prediction)は軽量で安定な提案機構であるが、ブロック並列拡散はずっと長い候補列の起草遅延を補正し、より良い選択は出力分布に強く依存する。
我々は、MPPとブロック並列投機復号のための統一的なトレーニングフレームワークであるAngelSpecを紹介し、この異種性に3つのレベルで対処する。
トレーニングレベルでは,1つの普遍的ドラフトラを均一なデータ混合に適合させるのではなく,構造とデータを共用する: MTPドラフトラは,高エントロピーなオープンエンドチャットのための多様な会話データに基づいて訓練され,ブロック拡散ドラフトラはより長い予測可能な継続のためにコードと数学データに対して訓練される。
アーキテクチャレベルでは,ハイブリッドなターゲット条件付きバックボーンと事前条件付き自己回帰ヘッドを組み合わせたブロック拡散フレームワークDFlyを提案する。
推論レベルでは、受け入れ期間と検証コストはドメイン、要求、オンライン負荷、ハードウェアによって異なるため、DFlyは検証を共有バッチレベルのリソースとして扱う。
Hy3シリーズ全体では、DFlyはHy3-A21Bの平均許容長を約30%引き上げ、テストされた並行処理の最大スループットを4から64まで、自動回帰復号よりも1.98-2.40倍、DFlashより10.5-11.8%高いスループットを達成した。
AngelSpecをリリースし、これらのメソッドのトレーニングと拡張をサポートします。
関連論文リスト
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction [8.146414118644069]
We present HyperDFlash, a block-parallel speculative decoding framework for DeepSeek-V4's Hyper-Connections (HC)。
DeepSeek-V4のネイティブなマルチトークン予測(MTP)モジュールが初期トークンドラフトで高いパフォーマンスを示したにもかかわらず、ドラフトの精度は後の位置で大幅に低下した。
元のDFlash法は効率的なワンパスブロックドラフトをサポートしているが、HCパラダイムにシームレスに適応することはできない。
論文 参考訳(メタデータ) (2026-06-25T08:31:53Z) - How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving [14.552785121277529]
本研究では,デバイス上でのカーネル計測と高忠実度ネットワークシミュレーションを融合したフレームワークを用いて,AFD(Attention-FFN Disaggregation)のメリットと限界について検討する。
厳格なTTFT/TPOT SLOの下では、AFDはチャット、コーディング、エージェントコーディングのワークロード間でDeepSeek-V3.2で約4kトークン/秒のシステムスループットを維持できる。
論文 参考訳(メタデータ) (2026-05-27T10:55:57Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z) - SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models [21.933379266533098]
大規模言語モデル(LLM)は、推論品質と計算コストの間に重要なトレードオフをもたらす。
既存のサービス戦略では、固定されたモデルスケールや静的な2段階の投機的デコードを用いることが多い。
本稿では,LLM推論を適応的ルーティング問題として再定義する新しいフレームワークであるsystemnameを紹介する。
論文 参考訳(メタデータ) (2025-05-12T15:46:28Z) - Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE [15.003006630308517]
投機的復号(SD)は、より小さなドラフトモデルを用いて複数のトークンを予測することで、大きな言語モデル推論を加速する。
本稿では,専門家の混在(Mixture of Experts, MoE)を利用したJakiroを提案する。
提案手法は予測精度を大幅に向上し,推論高速化を実現する。
論文 参考訳(メタデータ) (2025-02-10T09:24:06Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - Fed-CVLC: Compressing Federated Learning Communications with
Variable-Length Codes [54.18186259484828]
フェデレートラーニング(FL)パラダイムでは、パラメータサーバ(PS)がモデル収集、更新アグリゲーション、複数のラウンドでのモデル分散のために、分散参加クライアントと同時通信する。
FLの圧縮には可変長が有用であることを示す。
本稿では,Fed-CVLC(Federated Learning Compression with Variable-Length Codes)を提案する。
論文 参考訳(メタデータ) (2024-02-06T07:25:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。