論文の概要: Approximate Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.03447v1
- Date: Tue, 04 Aug 2026 10:45:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.144218
- Title: Approximate Speculative Decoding
- Title(参考訳): 近似投機復号法
- Authors: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang,
- Abstract要約: 投機的復号化は、ターゲットモデルと並行してドラフトブロックを検証することで自己回帰生成を加速する。
我々は、二項第一ミスマッチトランケーションを予算化された最長選択に置き換えるトレーニング不要な検証器であるtextbf Speculative Decoding (ASD) を導入する。
ASDは新しいドラフトモデルも微調整も必要ありません。
- 参考スコア(独自算出の注目度): 2.7677713446315946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates autoregressive generation by verifying a draft block with a target model in parallel. Under standard greedy verification, decoding stops at the first draft token that differs from the target argmax, discarding the remaining target-scored suffix. Although accepting such a mismatch changes the decoding trajectory, it can make a contiguous suffix reusable when its tokens remain target-greedy under the realized prefix. In this paper, we introduce \textbf{Approximate Speculative Decoding (ASD)}, a training-free verifier that replaces binary first-mismatch truncation with budgeted longest-prefix selection. ASD accepts selected mismatches subject to a local target-logit regret gate, a per-block exception cap, and a persistent request-level regret budget, then reuses the contiguous target-greedy suffix without additional approximate decisions or target-model forward passes. ASD requires neither a new draft model nor fine-tuning, and exactly reduces to standard greedy verification when the budget is zero. Experiments show that ASD improves fixed-workload throughput by $3.05\%$--$15.26\%$ over matched strict verification and averages a $7.78\%$ gain across seven Qwen3-14B + DSpark-14B tasks. On DeepSeek-V4-Flash (284B) with DSpark it also raises verifier-side acceptance by roughly $10\%$--$16\%$ on GSM8K and MATH-500 in an FP4-to-FP8 compatibility setting. The source code is publicly available at: https://github.com/Kissmetothemoon/ASD
- Abstract(参考訳): 投機的復号化は、ターゲットモデルと並行してドラフトブロックを検証することで自己回帰生成を加速する。
標準的なグリーディ検証では、デコーディングはターゲットのargmaxと異なる最初のドラフトトークンで停止し、残りのターゲットマークされた接尾辞を破棄する。
このようなミスマッチを受け入れるとデコード軌跡が変化するが、トークンが現実の接頭辞の下でターゲットグレードのままである場合には、連続した接尾辞を再利用することができる。
本稿では,二項第一ミスマッチトランケーションを予算長のプリフィックス選択に置き換えるトレーニング不要な検証器である \textbf{Approximate Speculative Decoding (ASD) を紹介する。
ASDは、ローカルなターゲットログ後悔ゲート、ブロックごとの例外キャップ、永続的な要求レベルの後悔予算の対象となる選択されたミスマッチを受け入れ、さらに近似的な決定や目標モデルフォワードパスを伴わずに、連続したターゲットグラフの接尾辞を再利用する。
ASDは新しいドラフトモデルも微調整も必要ありません。
実験の結果、ASDは厳密な検証により3.05 %$--15.26 %$で、Qwen3-14B + DSpark-14Bの7つのタスクで平均7.78 %$利得を達成している。
DSparkを使ったDeepSeek-V4-Flash (284B)では、FP4-to-FP8互換設定で、GSM8KとMATH-500で約10\%$-16\%の検証側受け入れを約10\%引き上げている。
ソースコードは、https://github.com/Kissmetothemoon/ASDで公開されている。
関連論文リスト
- Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware [0.0]
大規模言語モデルのシングルストリーム自動回帰復号化は、メモリ帯域幅によって制限される。
小さなドラフトモデルは、自動回帰的に$K$トークンを提案し、ターゲットモデルは、これらすべてを1回のバッチパスでスコアする。
本稿では、CUDA/MPS/CPUの実装と、5つのドラフト/ターゲットバックエンド構成に関する実証的研究を紹介する。
論文 参考訳(メタデータ) (2026-07-19T15:01:35Z) - Self-Evolving Agents with Anytime-Valid Certificates [1.2691047660244335]
我々は,小型のステアリングアダプタとEmphfrozenベースモデルを中心としたバージョン付きハーネスに自己修正を限定するアーキテクチャである textbfSEA を提案する。
5つのループコントローラが発行された保証を構成しており、そのようなゲートは凍結されたベースが既に生成している動作の中でのみ選択できるため、5つの検証器・イン・ザ・ループ機構はゲートが必要とする高密度でグレーダフリーな信号を供給する。
結果は高価な評価で単回実行され、実行時から実行時までの分散を確認し、タスク毎のアルゴリズムの混合を適用することが今後の作業である。
論文 参考訳(メタデータ) (2026-07-01T12:34:52Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Minimal-Intervention KV Retention via Set-Conditioned Diversity [7.208745673318648]
小さな予算でのKVキャッシュ圧縮は、キャッシュ表現、ヘッドワイドルーティング、圧縮ケイデンス、デコード動作、予算内スコアリングにまたがる複雑な設計空間である。
本稿では,TriAttentioncitemao2026triattention Retention scorerの1機能的変更を提案する。
事前登録されたプロトコルは、凍結した開発スプリットで$をチューニングし、非結合のホールトアウトスプリットで$ = 0.5$、$$$は4つのうち2つでBonferroniをクリアする。
論文 参考訳(メタデータ) (2026-05-14T02:50:20Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding [80.12789199134511]
大規模言語モデル(LLM)における自己回帰デコーディングは、ステップ毎に1つのトークンを生成し、高い推論遅延を引き起こす。
我々は,検索した正確なパターンとロジット駆動の将来の手がかりを統合する軽量でトレーニング不要な $textbfRACER を提案する。
Spec-Bench、HumanEval、MGSM-ZHの実験では、RACERは推論を継続的に加速し、自動回帰デコーディングよりも2倍以上のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-04-16T11:23:55Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Estimating the Decoding Failure Rate of Binary Regular Codes Using Iterative Decoding [84.0257274213152]
並列ビットフリップデコーダのDFRを高精度に推定する手法を提案する。
本研究は,本症候群のモデル化およびシミュレーションによる重み比較,第1イテレーション終了時の誤りビット分布の誤検出,復号化復号化率(DFR)について検証した。
論文 参考訳(メタデータ) (2024-01-30T11:40:24Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。