論文の概要: UniVer: A Unified Perspective for Multi-step and Multi-draft Speculative Decoding
- arxiv url: http://arxiv.org/abs/2605.04543v1
- Date: Wed, 06 May 2026 06:42:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.677752
- Title: UniVer: A Unified Perspective for Multi-step and Multi-draft Speculative Decoding
- Title(参考訳): UniVer: マルチステップおよびマルチドラフト投機デコードのための統一的な視点
- Authors: Yepeng Weng, Qiao Hu, Takehisa Yairi,
- Abstract要約: 本稿では,条件付きOT問題として木に基づく検証を行う統一的な視点を提案する。
局所的最適輸送計画を構成することにより,木レベルで共同最適化を行う検証アルゴリズムUniVerを導入する。
- 参考スコア(独自算出の注目度): 2.486699239459455
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates Large Language Models via draft-then-verify, where verification can be framed as an Optimal Transport (OT) problem. Existing approaches typically handle multi-draft and multi-step aspects in isolation, applying either flat OT to single-step drafts or per-token rejection sampling to tree-structured candidates. This separation leaves the joint regime (where multi-step dependencies meet multi-draft branching) poorly optimized, as local verification rules fail to exploit the coupling between horizontal and vertical dimensions of candidate trees. In this paper, we propose a unified perspective that casts tree-based verification as a conditional OT problem. Our key insight is that vertical dependencies can be abstracted through prefix acceptance probabilities, which act as dynamic scaling factors to actively guide horizontal draft selection. Based on this principle, we introduce UniVer, a verification algorithm that jointly optimizes across tree levels by composing local optimal transport plans under prefix constraints. We prove that UniVer remains lossless and achieves the optimal acceptance rate under the proposed conditional framework. Extensive experiments across different tasks and models demonstrate that UniVer improves acceptance length by 4.2% to 8.5% over standard recursive rejection sampling without replacement, while maintaining exact distributional alignment with the target model.
- Abstract(参考訳): 投機的復号化は、ドラフト・then-verifyを通じて大規模言語モデルを加速し、検証は最適輸送(OT)問題としてフレーム化できる。
既存のアプローチは、通常、単一ステップのドラフトにフラットなOTを適用したり、ツリー構造化された候補に対してトーケン毎のリジェクションサンプリングをすることで、分離されたマルチドラフトとマルチステップのアスペクトを処理します。
この分離は、局所的な検証ルールが、候補木の水平次元と垂直次元の結合をうまく利用できないため、(多段階の依存関係がマルチドラフト分岐に適合する)結合状態は、最適化が不十分である。
本稿では,木に基づく検証を条件付きOT問題として活用する統一的な視点を提案する。
私たちのキーとなる洞察は、垂直の依存関係はプレフィックスの受け入れ確率によって抽象化され、動的スケーリング要因として機能し、水平のドラフト選択を積極的に導くことができるということです。
この原理に基づき、プレフィックス制約の下で局所的最適輸送計画を構成することにより、木レベルで共同最適化する検証アルゴリズムUniVerを導入する。
We prove that UniVer remains lostless and achieve the optimal acceptance rate under the proposed conditional framework。
異なるタスクやモデルにわたる大規模な実験により、UniVerはターゲットモデルとの正確な分布アライメントを維持しながら、標準的な再帰的リジェクションサンプリングよりも4.2%から8.5%の受け入れ長を改善することが示されている。
関連論文リスト
- Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models [102.20309135516186]
クロスエントロピー(CE)トレーニングは、言語モデルの密集したスケーラブルな監視を提供する。
言語モデル微調整のための特徴マッチング手法を提案する。
この目的を効率的に最適化するために,エネルギーベースファインチューニングを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:57:50Z) - Dynamic Delayed Tree Expansion For Improved Multi-Path Speculative Decoding [35.984745508100595]
本稿では,モデルファミリー,タスク,サンプリング体制間の検証戦略を体系的に評価する。
Traversal Verificationは、OTベースのメソッドがはるかに遅れているため、一貫して支配的だ。
我々は,部分的な単一経路を起草し,分岐点を遅らせる遅延木拡張を提案する。
論文 参考訳(メタデータ) (2026-02-19T01:41:58Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Traversal Verification for Speculative Tree Decoding [15.720388162422978]
投機的復号化は、大きな言語モデルを加速するための有望なアプローチである。
本稿では,新しい投機的復号化アルゴリズムであるトラバーサル検証を紹介する。
提案手法は,既存手法よりも受け入れ長とスループットを継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-05-18T12:51:55Z) - Towards Optimal Multi-draft Speculative Decoding [102.67837141152232]
MDSD(Multi-Draft Speculative Decoding)は、各トークンを生成する際に、小さなドラフトモデルで複数のドラフトを生成する手法である。
本稿では、最適輸送問題の双対性について論じ、最適受容率を効率的に計算する方法を提供する。
論文 参考訳(メタデータ) (2025-02-26T03:22:44Z) - 360 Layout Estimation via Orthogonal Planes Disentanglement and Multi-view Geometric Consistency Perception [56.84921040837699]
既存のパノラマ配置推定ソリューションは、垂直圧縮されたシーケンスから部屋の境界を復元し、不正確な結果をもたらす傾向にある。
そこで本稿では,直交平面不整合ネットワーク(DOPNet)を提案し,あいまいな意味論を識別する。
また,水平深度と比表現に適した教師なし適応手法を提案する。
本手法は,単分子配置推定と多視点レイアウト推定の両タスクにおいて,他のSoTAモデルよりも優れる。
論文 参考訳(メタデータ) (2023-12-26T12:16:03Z) - MLPruning: A Multilevel Structured Pruning Framework for
Transformer-based Models [78.45898846056303]
プルーニングは、大きな自然言語処理モデルに関連するメモリフットプリントと計算コストを削減する効果的な方法である。
我々は,頭部刈り込み,行刈り,ブロックワイズ刈りという3つの異なるレベルの構造化刈り込みを利用する,新しいマルチレベル構造化刈り込みフレームワークを開発した。
論文 参考訳(メタデータ) (2021-05-30T22:00:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。