論文の概要: DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair
- arxiv url: http://arxiv.org/abs/2610.01439v1
- Date: Thu, 01 Oct 2026 10:37:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.059455
- Title: DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair
- Title(参考訳): DRelay: プリフィックス対応並列投機的デコード修復のためのグローバルドラフトコンテキスト
- Abstract要約: 提案するDRelayは,ドラフトブロック全体からのグローバル情報を用いて,候補選択のプレフィックスアウェアによる選択的修復を行う。
DRelayは、DFlash、Domino、DSpark上での平均受け入れ長とエンドツーエンドのデコードパフォーマンスを継続的に改善する。
- 参考スコア(独自算出の注目度): 4.5881678566958985
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Parallel drafting reduces the drafting overhead of speculative decoding for large language models (LLMs), but its gains remain limited by the accepted prefix length. Even when the correct token is present in the candidate pool, a single early selection error prevents subsequent predictions from being used. We propose DRelay, which uses global information from the entire draft block to perform prefix-aware selective repair of candidate selections before target-model verification. DRelay bases its decisions on candidate correlations and the selected path: a global reader extracts predictive information across positions for each candidate. While a causal selector combines candidate-level information extracted by the global read with the tokens selected at preceding positions to determine whether the native choice at the current position is consistent with the global evidence and the selected prefix. It then decides whether to retain or replace the token, thereby repairing early errors and extending the accepted prefix. We further jointly train the draft backbone and the selector, combining candidate-support learning with a repair objective, while weighting the repair loss according to each block position's potential contribution to the consecutive accepted prefix. Across eight diverse benchmarks on an H800 GPU, DRelay consistently improves both average acceptance length and end-to-end decoding performance over DFlash, Domino, and DSpark. Under SGLang serving, DRelay improves average end-to-end speedup over DFlash, Domino, and DSpark by 14.7%-16.8%, 8.7%-9.3%, and 8.1%-9.3%, respectively.
- Abstract(参考訳): 並列起草は、大きな言語モデル(LLM)の投機的復号化のオーバーヘッドを軽減するが、その利得は受け入れられたプレフィックス長によって制限される。
候補プールに正しいトークンが存在する場合でも、単一の早期選択エラーにより、その後の予測が使用されない。
DRelayを提案する。DRelayは、ターゲットモデル検証の前に、ドラフトブロック全体からのグローバル情報を用いて、候補の選択をプレフィックスアウェアで選択的に修復する。
DRelayは、その決定を候補相関と選択された経路に基づいており、グローバルリーダーは各候補の位置をまたいだ予測情報を抽出する。
因果セレクタは、グローバル読み取りによって抽出された候補レベル情報と先行位置で選択されたトークンとを組み合わせて、現在の位置でのネイティブ選択がグローバルエビデンスと選択されたプレフィックスと一致しているかどうかを判定する。
その後、トークンを保持または置換するかを決め、早期エラーを修復し、受け入れられたプレフィックスを拡張する。
さらに、各ブロック位置が連続的に受容されるプレフィックスに対する潜在的貢献度に応じて、補修損失を重み付けながら、候補支援学習と補修目標を併用して、ドラフトバックボーンとセレクタを共同で訓練する。
H800 GPU上の8つの多様なベンチマークの中で、DRelayは、DFlash、Domino、DSparkに対する平均受け入れ長とエンドツーエンドのデコードパフォーマンスを一貫して改善している。
SGLangサービスの下では、DFlash、Domino、DSparkの平均エンドツーエンドのスピードアップを14.7%-16.8%、8.7%-9.3%、そして8.1%-9.3%改善している。
関連論文リスト
- Draft in Parallel, Condition Through Depth: Adjacent Causal Injection for Speculative Decoding [23.339433247434723]
DSpineは背骨全体に因果条件注入を施したドラフト機である。
各レイヤにおいて、ゲートされた隣接インジェクションは、各前任者の予測された機能をその後継に書き込む。
対象モデルの出力埋め込みから構築された統一的な転送空間は、事前条件付きデコードによる層ワイズインジェクションである。
論文 参考訳(メタデータ) (2026-09-28T19:44:02Z) - From Position Risks to Block Survival: Faster Generation for Diffusion Language Models [8.476731545781847]
拡散言語モデル(DLM)は複数のトークンを並列に予測することで生成を加速することができる。
これらのトークンの予測方法と、最終的に生成にどのように貢献するかの間には、ミスマッチがあります。
BRISK-DLM(BRISK-DLM)は、提案学習の最適化と、検証された進捗に対する選択によって、両者のミスマッチに対処するフレームワークである。
論文 参考訳(メタデータ) (2026-09-27T09:11:26Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees [40.61855455828842]
投機的復号化は、複数のドラフトトークンを並列に検証することで、自動回帰言語モデルを高速化する。
Dartreeはトレーニング不要の投機的復号法で、事前訓練されたAR補正ヘッドをチェーンからツリーに拡張する。
論文 参考訳(メタデータ) (2026-08-13T17:43:44Z) - Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models [29.849017661114342]
拡散言語モデルは、デノナイジングステップ毎に一時的な予測を公開する。
生成時早期出口は、スケジュールが切れる前に復号を停止する。
2つの軸を分離し、それぞれの決定をそれぞれのスコープの証拠と一致させる。
論文 参考訳(メタデータ) (2026-07-30T13:04:47Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models [27.44373450962651]
最近の拡散ベースのドラフトラはトークンのブロック全体を並列に生成するが、通常は検証毎に単一のドラフトシーケンスにコミットする。
D2SDは,候補を信頼誘導プレフィックスツリーに整理する,二重拡散ドラフト投機的復号化フレームワークである。
結果として得られた共有誘導候補は、カスケードの注意を通して共同で検証される。
論文 参考訳(メタデータ) (2026-06-03T04:48:00Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - FastCorrect 2: Fast Error Correction on Multiple Candidates for
Automatic Speech Recognition [92.12910821300034]
本稿では,複数のASR候補を入力として取り込んだ誤り訂正モデルFastCorrect 2を提案する。
FastCorrect 2は、カスケードされた再描画と修正パイプラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2021-09-29T13:48:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。