論文の概要: Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting
- arxiv url: http://arxiv.org/abs/2607.12422v1
- Date: Tue, 14 Jul 2026 06:48:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.056567
- Title: Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting
- Title(参考訳): PEFTによるブロック拡散ドラフトの否定的な結果
- Authors: Abdurrahman Javat, Allan Kazakov,
- Abstract要約: 投機的復号化は、低価格のドラフトラを使って、複数の将来のトークンと、それらを検証するためのターゲットモデルを提案する。
我々は,この方向に対する負の結果を,同バックボーン投機復号法PEFT-BDを用いて検討した。
提案手法は投機的復号化を成功させるためには単純だが重要な条件を分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates autoregressive language model inference by using a cheap drafter to propose multiple future tokens and a target model to verify them. A common design goal is therefore to improve draft quality while reducing auxiliary parameters and systems overhead. We study a negative result for this direction through PEFT-BD, a same-backbone speculative decoding method in which a LoRA-like adapter acts as a block-diffusion drafter for an autoregressive verifier. PEFT-BD is motivated by several attractive properties: it avoids tokenizer mismatch, avoids loading a separate draft model, adds only a small number of trainable parameters, and uses a BD3LM-style denoising objective to propose a block of tokens in parallel. Despite these advantages, PEFT-BD does not yield a practical speedup in our Qwen3-0.6B experiments. Although the method obtains nontrivial accepted prefixes, profiling shows that each speculative step requires an adapter-enabled full-backbone draft pass followed by an adapter-disabled full-backbone verification pass. Thus, the drafter is parameter-efficient but not compute-efficient. Our results isolate a simple but important condition for successful speculative decoding: the drafter must be substantially cheaper to execute than the verifier. Longer accepted prefixes alone cannot compensate when draft computation remains verifier-scale.
- Abstract(参考訳): 投機的復号化は、安価なドラフトラを使って、複数の将来のトークンと、それらを検証するためのターゲットモデルを提案することで、自己回帰型言語モデル推論を加速させる。
したがって、一般的な設計目標は、補助パラメータとシステムのオーバーヘッドを減らしながら、ドラフト品質を改善することである。
PEFT-BDは,ロラ型アダプタが自己回帰検証器のブロック拡散ドラフトアとして機能する,同バックボーン投機復号法である。
PEFT-BDは、トークン化ミスマッチを回避し、別々のドラフトモデルのロードを回避し、少数のトレーニング可能なパラメータのみを追加し、BD3LMスタイルのデノゲーションオブジェクトを使用して、トークンのブロックを並列に提案する、いくつかの魅力的な特性によって動機付けられている。
これらの利点にもかかわらず、PEFT-BDは我々のQwen3-0.6B実験において実用的なスピードアップを得られない。
この方法は非自明な接頭辞を得るが、プロファイリングにより、各投機的なステップは、アダプタ対応のフルバックボーンドラフトパスと、アダプタ対応のフルバックボーン検証パスを必要とする。
従って、ドラフトはパラメータ効率が良いが、計算効率は良くない。
提案手法により,提案手法は提案手法の検証よりも大幅に安価に実行できなければならない。
長く受け入れられたプレフィックスだけでは、ドラフト計算が検証子スケールのままである場合に補償できない。
関連論文リスト
- Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - MineDraft: A Framework for Batch Parallel Speculative Decoding [87.76522944353825]
投機的復号(SD)は、より小さなドラフトモデルを用いて、より大きなターゲットモデルによって検証されたドラフトトークンを提案することで、大きな言語モデル推論を加速する。
提案するMineDraftは,バッチ並列投機的復号化フレームワークで,検証と重なり合うことで遅延を効果的に隠蔽する。
実験の結果,MineDraftのスループット(最大75%)とエンドツーエンドのレイテンシ(最大39%)を標準SDよりも大幅に改善した。
論文 参考訳(メタデータ) (2026-02-24T17:24:50Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - CARD: A Cache-Assisted Parallel Speculative Decoding Framework via Query-and-Correct Paradigm for Accelerating LLM Inference [14.527697328189362]
本稿では,新しいクエリ・アンド・コレクト・パラダイムを用いたCARDという投機的復号化フレームワークを提案する。
提案手法は,提案手法を検証から切り離し,詳細な調整を伴わずに効果的にドラフトモデルの効率を向上する。
CARDは既存の最先端の手法よりも優れており、バニラ自己回帰復号よりも最大4.83倍の高速化を実現している。
論文 参考訳(メタデータ) (2025-08-06T14:02:10Z) - Think Before You Accept: Semantic Reflective Verification for Faster Speculative Decoding [48.52389201779425]
投機的復号化は、軽量モデルを使用して複数のドラフトトークンを生成し、それらを並列に検証することで推論を加速する。
既存の検証手法は、意味的正確性を見越しながら、分布の整合性に大きく依存している。
我々は,学習自由でセマンティックなアプローチであるリフレクティブ検証を提案し,正確性と効率のトレードオフを改善する。
論文 参考訳(メタデータ) (2025-05-24T10:26:27Z) - PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation [4.031603850949324]
本稿では,自動回帰ドラフトモデルの並列ドラフトモデルへの低コストな適応を可能にする新しい投機的復号化手法を提案する。
提案した条件付きドロップトークン法は,ドラフトモデルのトレーニング効率を3倍に向上させることができる。
最適化された推論フレームワークでは、PARDはLLaMA3.1-8B推論を4.08倍高速化し、毎秒311.5トークンを達成する。
論文 参考訳(メタデータ) (2025-04-23T12:27:43Z) - PEARL: Parallel Speculative Decoding with Adaptive Draft Length [12.166703341906242]
本稿では,適応dRaft Length(PEARL)を用いた投機的復号化(Parallel speculative decoding)を促進するための,概念的にシンプルでフレキシブルで汎用的なフレームワークを提案する。
PEARLは、ドラフトフェーズ中に事前に最初のドラフトトークンを検証し、検証フェーズ中により多くのドラフトトークンを生成するための後検証を提案する。
各種テキスト生成ベンチマークの実験では、PEARLの有効性が実証されており、自動回帰復号法とバニラ投機復号法と比較して、パフォーマンスが4.43$times$と1.50$times$に向上した。
論文 参考訳(メタデータ) (2024-08-13T08:32:06Z) - LegoNet: A Fast and Exact Unlearning Architecture [59.49058450583149]
機械学習は、トレーニングされたモデルから削除された要求に対する特定のトレーニングサンプルの影響を削除することを目的としている。
固定エンコーダ+複数アダプタのフレームワークを採用した新しいネットワークである textitLegoNet を提案する。
我々は、LegoNetが許容できる性能を維持しつつ、高速かつ正確な未学習を実現し、未学習のベースラインを総合的に上回っていることを示す。
論文 参考訳(メタデータ) (2022-10-28T09:53:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。