論文の概要: CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.00531v1
- Date: Sat, 01 Aug 2026 08:43:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.746446
- Title: CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding
- Title(参考訳): CURE:Block-Parallel Speculative Decodingのローカル不確実性修復
- Abstract要約: CUREは、不確実な焦点でエラーを修復するために設計された予算対応の動的修復ツリーである。
CUREは並列ベースライン上で平均許容長を4.2-7.5%増加させる。
また、標準的な並列ドラフトフレームワークと互換性のあるプラグアンドプレイ修復モジュールも提供します。
- 参考スコア(独自算出の注目度): 6.268849049716121
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Speculative decoding mitigates the latency of sequential generation in autoregressive Large Language Models (LLMs) by interleaving draft generation with target verification. However, existing parallel drafting backends often suffer from rapid accuracy degradation over long horizons, leading to high rejection rates during verification and suboptimal wall-clock speedups. We observe that drafting errors are not uniformly distributed but typically stem from localized high-uncertainty tokens that destabilize downstream generation trajectories. Motivated by this token error pattern, we propose CURE, a budget-aware dynamic repair tree designed to repair errors at uncertainty focal points without incurring prohibitive tree-verification overheads. Specifically, our method uses predictive confidence margins to dynamically locate candidate error tokens within a block-parallel draft, expands bounded repair paths only at these fragile nodes, and employs a novel repair resynchronization mechanism to realign draft states post-verification. Evaluations on code-generation benchmarks (HumanEval, MBPP, and LiveCodeBench-lite) and mathematical reasoning benchmark (GSM8K) demonstrate that CURE increases the average accepted length by 4.2-7.5% over parallel baselines without repair, translating to an end-to-end speedup of $2.66-3.49\times$ over target-only decoding. Furthermore, we provide a plug-and-play repair module compatible with standard parallel drafting frameworks. We also characterize the trade-off between draft compute and verification efficiency.
- Abstract(参考訳): 投機的復号化は、自動回帰大言語モデル(LLM)における逐次生成の遅延を軽減する。
しかし、既存の並列起草バックエンドは、長い水平線上での高速な精度低下に悩まされることが多く、検証や壁面下時間短縮の際の高い拒絶率につながる。
起草誤差は一様分布ではなく, 下流生成軌道を不安定化する局所的な高不確かさトークンに由来すると考えられる。
このトークンエラーパターンにより,不確実な焦点でのエラーを不確実な木検証オーバーヘッドを生じさせないよう設計した,予算に配慮した動的修復木CUREを提案する。
具体的には、予測信頼率を用いてブロック並列ドラフト内の候補誤りトークンを動的に検出し、これらの脆弱なノードのみに境界付き修復経路を拡張し、新しい修復同期機構を用いて、検証後のドラフト状態の認識を行う。
コード生成ベンチマーク(HumanEval, MBPP, LiveCodeBench-lite)と数学的推論ベンチマーク(GSM8K)による評価では、CUREは修理なしで並列ベースライン上で平均許容長を4.2-7.5%増加し、目標のみの復号よりも2.66-3.49\times$に変換している。
さらに、標準的な並列ドラフトフレームワークと互換性のあるプラグアンドプレイ修復モジュールを提供する。
また、ドラフト計算と検証効率のトレードオフを特徴付ける。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding [14.590812900433328]
投機的復号化は、出力品質を損なうことなく、大言語モデル(LLM)推論を加速させる。
D-Cutは、バッチ間で共同でドラフトトークンを選択し、最も受け入れられそうなトークンに検証予算を集中する適応型プルーニング手法である。
論文 参考訳(メタデータ) (2026-07-16T07:18:05Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens [22.687236570529844]
本稿では,組込み空間内で動作するトレーニングフリーフレームワークASRDを提案する。
我々はASRDが最近のリメイキングベースラインを上回り、最大6.4%の精度向上を実現し、推論スループットを最大7.2倍に向上させることを示した。
論文 参考訳(メタデータ) (2026-06-15T15:23:47Z) - FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration [21.05266483397106]
FlexDraftは投機的デコードフレームワークで、3つの重要な設計を通じて様々なバッチサイズに対応します。
Attention Tuningは、マスクトークン上の最後の数層の注意プロジェクタのみをチューニングすることで、ブロック拡散のドラフトを可能にする。
Bonus-guidedは、解決されたボーナストークンに軽量な条件を付け、ドラフトロジットを校正する。
論文 参考訳(メタデータ) (2026-05-19T15:48:16Z) - $R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction [28.068667649331246]
推論とトレーニングの両方の観点から,デコード冗長性を低減するための統一的なフレームワークを提案する。
R2$-dLLMは、既存のデコード戦略と比較して、デコードステップの数を最大75%削減する。
論文 参考訳(メタデータ) (2026-04-21T02:26:08Z) - Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning [58.331709210563616]
サブトラクションによる思考は、信頼主導のコントラスト的デコーディングアプローチである。
低信頼トークンの小さなサブセットは、誤りの推論と不要な出力拡大に不当に寄与する。
信頼駆動型コントラストデコーディング(Confidence-Driven Contrastive Decoding)は,デコーディング中の低信頼トークンを検出し,それらの位置で介入する。
論文 参考訳(メタデータ) (2026-02-20T14:13:22Z) - Causality-Inspired Safe Residual Correction for Multivariate Time Series [12.183024727781449]
我々はCRC(Causality-inspired Safe Residual Correction)を提案する。
因果性にインスパイアされたエンコーダを用いて、自己および相互変数のダイナミクスを分離することで方向認識構造を公開する。
実験の結果、CRCは精度を継続的に改善する一方、深部アブレーションの研究は、そのコアセーフティメカニズムが例外的に高い非劣化速度(NDR)を保証していることを確認した。
論文 参考訳(メタデータ) (2025-12-27T01:34:14Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。