論文の概要: ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.29748v2
- Date: Sat, 05 Sep 2026 16:06:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.31279
- Title: ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding
- Title(参考訳): ReTrace: 投機的復号化のためのリジェクタ-トラジェクタ条件
- Abstract要約: 本稿では,前回のラウンドから削除された接尾辞に対して,各ドラフトブロックを条件付けするReTraceを紹介する。
ReTraceは、DFlashバックボーン上で、平均受信長とエンドツーエンドの復号速度を継続的に改善する。
- 参考スコア(独自算出の注目度): 46.17292752074153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates autoregressive language model inference by having a lightweight draft model propose multiple candidate tokens, which are then verified in parallel by a larger target model. However, after the first rejection, standard prefix-based verification discards the remaining draft suffix, so the computation spent generating and verifying those positions does not contribute to decoding progress. Focusing on DFlash, we show that rejected positions in a rejected suffix may still align with the target continuation, indicating that the draft model can retain useful semantic and structural information despite local token-level errors. Motivated by this observation and inspired by conditional diffusion, we introduce ReTrace, a rejected-trajectory conditioning method that conditions each draft block on the rejected suffix from the previous round rather than generating it from fresh mask placeholders alone. ReTrace retains the hidden representations of the rejected suffixes, aligns them with the next draft block, refines them using target-aware correction signals from the same verification pass, and admits them into the drafter's input embeddings through gated residual fusion. Because rejected tokens are never committed and target-side verification remains unchanged, ReTrace preserves the lossless property of speculative decoding without requiring an additional model forward pass. Experiments with Qwen3 models across mathematical reasoning, code generation, and open-ended dialogue demonstrate that ReTrace consistently improves average acceptance length and end-to-end decoding speed over its DFlash backbone. By introducing cross-round conditioning without modifying within-round proposal generation, ReTrace is largely orthogonal to existing drafting improvements and might be combined with them for further gains.
- Abstract(参考訳): 投機的復号化は、軽量なドラフトモデルで複数の候補トークンを提案し、より大きなターゲットモデルによって並列に検証することで、自己回帰型言語モデル推論を加速させる。
しかし、最初の拒絶後、標準プレフィックスベースの検証は残りのドラフト接尾辞を廃止するので、それらの位置の生成と検証に費やした計算は、復号化に寄与しない。
DFlashに焦点をあてると、拒否された接尾辞における拒否された位置は依然として目標の継続と一致している可能性を示し、局所的なトークンレベルの誤りにもかかわらず、ドラフトモデルが有用な意味情報や構造情報を保持できることを示す。
この観察に触発され,条件拡散に触発されたReTraceは,マスクプレースホルダーのみから生成するのではなく,前回のラウンドから各ドラフトブロックを条件付けする。
ReTraceは、拒否された接尾辞の隠された表現を保持し、次のドラフトブロックと整列し、同じ検証パスからターゲット認識補正信号を使用してそれらを洗練し、ゲートされた残留融合を通じてドラフトの入力埋め込みに承認する。
拒否されたトークンはコミットされず、ターゲット側の検証も変わらないため、ReTraceは追加のモデルフォワードパスを必要とせず、投機的デコーディングの損失のない特性を保っている。
数学的推論、コード生成、オープンエンドダイアログにわたるQwen3モデルによる実験では、ReTraceはDFlashバックボーンよりも平均受け入れ長とエンドツーエンドの復号速度を一貫して改善している。
内部のプロポーザル生成を変更することなく、クロスラウンド条件付けを導入することで、ReTraceは既存のドラフトの改善とほぼ直交し、さらなる利益を得るためにそれらと組み合わせることができる。
関連論文リスト
- DFlow: Enabling Verifier Information Flow in Block Diffusion Speculative Decoding [25.203742152821548]
筆者らは,ドラフトラウンドをまたいで検証情報を流すフレームワークであるDFlowを提案する。
DFlowは、削除された接尾辞のためにターゲット検証者によって生成された隠された状態を再利用し、その後の起草をガイドする。
さまざまなベンチマークを対象としたQwen3モデルの実験では、DFlowがDFlashよりもドラフト品質と受け入れ期間を一貫して改善していることが示されている。
論文 参考訳(メタデータ) (2026-09-06T09:25:56Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - Encoder-Decoder Manifold Alignment for Idempotent Generation [51.959208893243776]
この失敗の主な理由は、エンコーダとデコーダによって学習された多様体間の幾何学的ミスマッチである。
我々は、エンコーダとデコーダに同じ基礎となるデータ多様体の一貫性のある表現を学習させ、このギャップを明示的に埋める新しいトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-21T02:14:37Z) - Teaching Diffusion to Speculate Left-to-Right [3.205247598097648]
大規模言語モデル(LLM)は、幅広いタスクにわたって顕著なパフォーマンスを達成するが、その自己回帰的復号処理は、かなりの推論コストを発生させる。
投機的復号化はこのボトルネックに対処するため、軽量なドラフトモデルを使用して、後により大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案する。
最近の研究は、拡散言語モデルがこの設定に適しており、パラレルでドラフトトークンのブロック全体を生成できることを実証している。
論文 参考訳(メタデータ) (2026-06-10T01:21:56Z) - D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models [27.44373450962651]
最近の拡散ベースのドラフトラはトークンのブロック全体を並列に生成するが、通常は検証毎に単一のドラフトシーケンスにコミットする。
D2SDは,候補を信頼誘導プレフィックスツリーに整理する,二重拡散ドラフト投機的復号化フレームワークである。
結果として得られた共有誘導候補は、カスケードの注意を通して共同で検証される。
論文 参考訳(メタデータ) (2026-06-03T04:48:00Z) - Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - Make Every Draft Count: Hidden State based Speculative Decoding [7.373716645300893]
廃棄されたドラフトを再利用トークンに変換する新しいシステムを提案する。
私たちの重要な洞察は、隠れた状態レベルで自動回帰予測を実行することです。
我々は、標準的な投機的復号化に対して3.3倍のスピードアップを示す。
論文 参考訳(メタデータ) (2026-02-02T08:25:21Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Think Before You Accept: Semantic Reflective Verification for Faster Speculative Decoding [48.52389201779425]
投機的復号化は、軽量モデルを使用して複数のドラフトトークンを生成し、それらを並列に検証することで推論を加速する。
既存の検証手法は、意味的正確性を見越しながら、分布の整合性に大きく依存している。
我々は,学習自由でセマンティックなアプローチであるリフレクティブ検証を提案し,正確性と効率のトレードオフを改善する。
論文 参考訳(メタデータ) (2025-05-24T10:26:27Z) - Traversal Verification for Speculative Tree Decoding [15.720388162422978]
投機的復号化は、大きな言語モデルを加速するための有望なアプローチである。
本稿では,新しい投機的復号化アルゴリズムであるトラバーサル検証を紹介する。
提案手法は,既存手法よりも受け入れ長とスループットを継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-05-18T12:51:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。