論文の概要: When Is a Draft Accepted? A Theory of Acceptance in Speculative Decoding
- arxiv url: http://arxiv.org/abs/2606.30265v1
- Date: Mon, 29 Jun 2026 13:14:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.242616
- Title: When Is a Draft Accepted? A Theory of Acceptance in Speculative Decoding
- Title(参考訳): ドラフトはいつ受理されるか : 投機的復号における受理の理論
- Abstract要約: 我々は,ゆるやかな復号,ゆるやかな受理規則,木に基づく候補集合について検討する。
我々は、正確な証明書を提出する拒否に必要な正確なKLの発散を特徴付ける。
フレームワークをgreedyツリーのデコードに拡張し、正確かつマージンのみの証明書を導出します。
- 参考スコア(独自算出の注目度): 0.7252027234425333
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates language model inference by using a fast drafter to propose candidate tokens that are then verified by a larger target model. Existing theory largely studies the stochastic, distribution-preserving setting, where the goal is to exactly sample from the target distribution. In contrast, many practical systems use greedy decoding, relaxed acceptance rules, or tree-based candidate sets, where success is governed by local ranking and threshold events rather than exact distributional equality. We develop a theory for these regimes. We identify that many common acceptance criteria have rejection regions that can be characterized as lower level sets of the target distribution. For these, we characterize the exact KL divergence required for rejection yielding exact certificates and sharp margin-based bounds for strict greedy decoding, additive and multiplicative relaxed acceptance, top-(m) relaxed criteria, and entropy-thresholded acceptance. We then extend the framework to greedy tree decoding, deriving exact and margin-only certificates for when the target greedy token remains covered by the drafter's top-(m) candidates. Finally, we evaluate the resulting certificates on Qwen3 models, showing that relaxed and tree-based criteria substantially enlarge the region of certified acceptance, especially on decoding steps with low target model distribution margin. These results complement existing distribution-preserving analyses of speculative decoding by characterizing the deterministic local acceptance events common in practical inference systems.
- Abstract(参考訳): 投機的復号化は、高速なドラフトラを使って言語モデルの推論を加速し、より大きなターゲットモデルによって検証される候補トークンを提案する。
既存の理論は確率的、分布保存的な設定を主に研究しており、目標分布から正確にサンプリングすることが目的である。
対照的に、多くの実用的なシステムは、厳密な復号化、緩和された受理規則、あるいはツリーベースの候補集合を使用し、成功は正確な分布等式ではなく、局所的なランク付けとしきい値イベントによって制御される。
我々はこれらの体制の理論を発展させる。
我々は,多くの共通受理基準が,対象分布の低レベル集合として特徴付けられる拒絶領域を有することを確認した。
これらの結果から,厳密なグリーディ復号化,加法的および乗算的緩和受理,トップ(m)緩和基準,エントロピー保留受理に対する厳密な証明と鋭いマージンベース境界の拒絶に必要な正確なKL偏差を特徴づけた。
次に、フレームワークをgreedyツリーのデコーディングに拡張し、ターゲットのgreedyトークンがドラフト作成者のトップ(m)候補によってカバーされたままである場合に、正確かつマージンのみの証明書を導出する。
最後に,Qwen3モデル上で得られた証明を評価した結果,特に目標モデル分布率の低い復号過程において,木質基準と緩和基準が認定受理の領域を大幅に拡大することが確認された。
これらの結果は,実際の推論システムに共通する決定論的局所受容事象を特徴付けることにより,投機的復号化の既存の分布保存分析を補完する。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - A Mean-Field Framework for Inference-Time Distributional Control of Diffusion Models [3.2299643462065286]
平均場枠組みの下で傾いた測度を対象とする推定時間分布制御を定式化する。
原理的に対象とする重み付き相互作用粒子スキームを導出する。
提案手法は, トラクタブルな低次元設定において, 所定の分布を的確に目標とすることを実証する。
論文 参考訳(メタデータ) (2026-08-09T15:41:01Z) - Generalised Eigenvalue Geometry of Semantic Adversarial Attacks [0.0]
セマンティック・パラフレーズ摂動の連続的局所モデルを構築した。
対象表現の最悪の局所変位は、行列鉛筆の最大一般化固有値によって制御される。
アフィンの読み出しのクラスを均一に制御するために、二値攻撃可能性指標の分布自由VCを導出する。
論文 参考訳(メタデータ) (2026-06-17T15:47:57Z) - How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling [29.45621080100186]
投機的サンプリング(SpS)は,自動回帰型大言語モデルの復号スループット向上に成功している。
検証器分布から制御された発散を保証する手法であるCactus (Constrained acceptance Speculative sample)を提案する。
論文 参考訳(メタデータ) (2026-04-05T03:37:30Z) - Evidence-based Distributional Alignment for Large Language Models [58.65469623911573]
LLM分布推定の忠実度とロバスト性を改善する証拠に基づくアライメント手法であるEvi-DAを提案する。
対象国が与えられた場合、Evi-DAは関連するWorld Values Survey項目とその回答分布を検索し、オプション毎に粗いヴェルツェル値シグネチャを予測し、国条件の回答分布を構造化形式で推測する。
論文 参考訳(メタデータ) (2026-03-03T03:34:06Z) - Distribution-informed Efficient Conformal Prediction for Full Ranking [22.380815981596403]
不確実性の定量化は、現実世界のアプリケーションにおけるランキングモデルの安全な配置に不可欠である。
最近の研究は、完全ランク付けシナリオにおける共形予測を用いた厳密なソリューションを提供し、テスト項目の絶対ランクの予測セットを構築することを目的としている。
非整合性スコアの正確な分布を導出して効率的な予測セットを生成する分散インフォームド・コンフォーマルランキング(DCR)を提案する。
論文 参考訳(メタデータ) (2026-01-30T16:16:44Z) - Traversal Verification for Speculative Tree Decoding [15.720388162422978]
投機的復号化は、大きな言語モデルを加速するための有望なアプローチである。
本稿では,新しい投機的復号化アルゴリズムであるトラバーサル検証を紹介する。
提案手法は,既存手法よりも受け入れ長とスループットを継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-05-18T12:51:55Z) - Conformal Prediction Sets with Improved Conditional Coverage using Trust Scores [52.92618442300405]
有限サンプルにおいて、正確に分布のない条件付きカバレッジを達成することは不可能である。
本稿では,最も重要となる範囲を対象とするコンフォメーション予測アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-01-17T12:01:56Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。