論文の概要: From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.02123v1
- Date: Mon, 03 Aug 2026 12:15:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.523784
- Title: From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding
- Title(参考訳): 鎖から木へ:半自己回帰的投機的復号のための親和図面
- Abstract要約: 投機的復号化LLMは、提案された継続がターゲットモデル検証を継続した場合のみ、推論を加速する。
親条件分岐は、半自己回帰型ドラフトラにおいて既に存在する条件付きキャパシティをエンドツーエンドの推論ゲインに変換することができることを示す。
- 参考スコア(独自算出の注目度): 14.328430707715114
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates LLM inference only when drafted continuations survive target-model verification. Semi-autoregressive drafters such as DSpark predict an entire token block with one backbone forward and refine it with a lightweight Markov head. However, DSpark decodes this block as a single chain, so an early mismatch invalidates the remaining suffix and limits the benefit of large draft blocks. We show that the conditional structure already learned by DSpark can support multiple parent-consistent continuations without retraining or additional backbone passes. We introduce Parent-Conditioned Drafting Tree (PCTree), which uses the pretrained Markov head to score alternative children separately for each concrete parent and allocates a fixed verification budget to the most probable paths. This converts DSpark's linear draft into a tree while preserving its one-pass parallel backbone. Across Qwen3-{4B,8B,14B} and nine benchmarks, at $B{=}7$, measured speedup gains over autoregressive (AR) decoding, relative to matched DSpark, range from $3.1\%$ to $29.5\%$. On Qwen3-4B GSM8K at $B{=}16$, PCTree increases mean acceptance length from $9.41$ to $11.16$ and three-run mean AR speedup from $6.14{\times}$ to $6.60{\times}$. These show that parent-conditioned branching can turn conditional capacity already present in a semi-autoregressive drafter into end-to-end inference gains through an inference-only change.
- Abstract(参考訳): 投機的復号化は、提案された継続がターゲットモデル検証を継続した場合のみ、LSM推論を加速させる。
DSparkのような半自己回帰的なドラフトアは、1つのバックボーンが前方にあるトークンブロック全体を予測し、軽量なMarkovヘッドでそれを洗練します。
しかし、DSparkはこのブロックを1つのチェーンとしてデコードするため、初期ミスマッチによって残りの接尾辞が無効になり、大きなドラフトブロックの利点が制限される。
DSparkが既に学習している条件構造は、再トレーニングやバックボーンパスを追加することなく、複数の親一貫性継続をサポートできることが示される。
そこで我々は,PCTree(Parent-Conditioned Drafting Tree)を導入する。PCTree(PCTree)は,訓練済みのマルコフヘッドを用いて,各具体的親に対して別の子どもを個別に得点し,最も確率の高い経路に固定された検証予算を割り当てる。
これはDSparkの線形ドラフトを1パスの並列バックボーンを保持しながらツリーに変換する。
Qwen3-{4B,8B,14B} と9つのベンチマークで、B{=}7$で、一致したDSparkと比較してオートレグレッシブ(AR)デコーディングよりも速くなる速度は、$3.1\%から$29.5\%である。
Qwen3-4B GSM8K at $B{=}16$では、PCTreeは9.41ドルから11.16ドル、3ラン平均ARスピードアップを6.14{\times}$から6.60{\times}$に引き上げる。
これらのことは、親条件分岐が、半自己回帰的なドラフトアにすでに存在する条件付きキャパシティを、推論のみの変更を通じてエンドツーエンドの推論ゲインに変換することができることを示している。
関連論文リスト
- Fork Where the Model Changes Its Mind: Belief-Shift Branching for Tree-Structured Reinforcement Learning [62.24941741019998]
分岐配置をチェーンの値曲線のエンフスの位置として定式化し、期待される結果が変わる。
ステップレベルの監視を必要としない3つのインスタンス化は、ブラックボックスプローブ、ログレンズの深さプロファイル、学習されたアクティベーション方向というアクセスレベルにまたがる。
論文 参考訳(メタデータ) (2026-09-10T04:06:45Z) - Ceiling-Clipped Acceptance Histograms Indicate Stranded Speed-up in Block-Diffusion Speculative Decoding [0.008640713300591884]
投機的復号化は効率的なドラフトモデルによる生成を高速化する(後述)
DFlashやDFlareのような高速なブロック拡散ドラフトラは、ブロック全体を1つの並列パスで埋める。
我々は、新しく公開された位置を強調する短いカリキュラムで、より長いブロックでドラフト作成者の訓練を後押しする。
論文 参考訳(メタデータ) (2026-08-31T08:23:14Z) - DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees [40.61855455828842]
投機的復号化は、複数のドラフトトークンを並列に検証することで、自動回帰言語モデルを高速化する。
Dartreeはトレーニング不要の投機的復号法で、事前訓練されたAR補正ヘッドをチェーンからツリーに拡張する。
論文 参考訳(メタデータ) (2026-08-13T17:43:44Z) - Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting [46.66100714934569]
我々は、構造化された並列ドラフト戦略を用いて、モデルの並列ポテンシャルを利用する textbfProgressive Tree Drafting (PTD) を提案する。
実験によると、PTDはトレーニング不要でモデルに依存しないまま、様々なベンチマークで最大2倍のデコードスピードアップを達成する。
論文 参考訳(メタデータ) (2026-07-12T09:10:34Z) - TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding [32.75269650141292]
投機的復号化のためのワンショットブロックのドラフトは、1つのフォワードパスで完全なドラフトを生成する。
それぞれのドラフトトークンはプレフィックスコンテキストのみに条件付けされ、以前のドラフトトークンに依存しない。
この非自己回帰条件は、ドラフトの深さが大きくなるにつれて、検証者の真の自己回帰分布からドラフトの分布が分岐する。
そこで我々は,この問題に対処するために,プロダクタの隠蔽状態とそれ以前のトークンに条件付きレイヤを組み込んで,自己回帰分布を近似するTreeFlashを提案する。
論文 参考訳(メタデータ) (2026-06-02T16:00:18Z) - Cost-Aware Diffusion Draft Trees for Speculative Decoding [17.900184934329666]
textbfCaDDTree (Cost-aware Diffusion Draft Tree) は,木構造とノード予算を協調的に選択することで,トークンスループット(単位時間当たりの予測トークン)を直接最適化する手法である。
Qwen3-4BとQwen3-8Bの実験では、推論、コーディング、命令追従タスクにまたがる8つのベンチマークで、caDDTreeがDDTreeとほぼ全てのタスクでオラクルの予算選択と一致または上回っていることが示されている。
論文 参考訳(メタデータ) (2026-06-01T07:29:56Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - Accelerating Speculative Decoding with Block Diffusion Draft Trees [20.28933257827737]
投機的復号化は、軽量なドラフトラを使って複数の未来のトークンを提案することで、自己回帰言語モデルを加速する。
DFlashは、ブロック拡散ドラフトラが1つのフォワードパスでドラフトブロック全体を生成することができることを示している。
Vanilla DFlashは、ラウンド毎に1つのドラフトされた軌道のみを検証する。
DDTreeは,ブロック拡散型ドラフトラの配置分布から直接ドラフトツリーを構築する手法である。
論文 参考訳(メタデータ) (2026-04-14T17:23:14Z) - SMART: When is it Actually Worth Expanding a Speculative Tree? [26.986851887229054]
ツリーベースの投機的復号化は、分岐したツリードラフトトークンを単一のターゲットモデルフォワードパスで検証することにより、自己回帰生成を加速する。
既存の方法では、重要な効率パラドックスを無視しながら、受理トークン数のトークンレベル確率の最大化が優先されている」。
本稿では,実行木構築のためのシステム対応限界解析フレームワークSMARTを提案する。
論文 参考訳(メタデータ) (2026-04-09T13:17:56Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z) - Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass [72.07642648108849]
Superposed Decodingは、1つの自己回帰推論パスのコストで$k$のドラフトを生成する新しい復号アルゴリズムである。
Superposed Decodingは、他のデコード戦略と組み合わせることで、推論時間計算のスケーリング時に普遍的なカバレッジが向上する。
論文 参考訳(メタデータ) (2024-05-28T17:40:48Z) - Strongly Incremental Constituency Parsing with Graph Neural Networks [70.16880251349093]
文を構文木にパースすることは、NLPの下流アプリケーションに恩恵をもたらす。
トランジッションベースは、状態遷移システムでアクションを実行することでツリーを構築する。
既存のトランジションベースは主にシフト・リデュース・トランジション・システムに基づいている。
論文 参考訳(メタデータ) (2020-10-27T19:19:38Z) - Please Mind the Root: Decoding Arborescences for Dependency Parsing [67.71280539312536]
我々はUniversal Dependency Treebankから多くの言語における最先端の出力を分析する。
最悪の制約違反率は24%です。
論文 参考訳(メタデータ) (2020-10-06T08:31:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。