論文の概要: Tsubame: Tree Replay for Diffusion-Based Speculative Decoding
- arxiv url: http://arxiv.org/abs/2609.33652v1
- Date: Sun, 27 Sep 2026 15:18:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 15:00:31.09512
- Title: Tsubame: Tree Replay for Diffusion-Based Speculative Decoding
- Title(参考訳): ツバメ:拡散に基づく投機的デコードのためのツリーリプレイ
- Abstract要約: 拡散型ドラフト作成者のための2パス木投機的復号化フレームワークであるツバメを紹介する。
ツバメは、サンプルチェーンに対する不利益を逆転させる設定を含む、決定論的木よりも受け入れ長とスループットを向上させる。
- 参考スコア(独自算出の注目度): 2.486699239459455
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Context-aware dynamic trees allocate the speculative decoding budget according to draft path probabilities, adapting their depth and branching to the current context. Under stochastic decoding, however, we find that this structural advantage does not always compensate for the acceptance gains of random sampling paired with advanced verification, and such dynamic trees can fall behind sampled chains in some settings. These trees grow their topology from the candidates themselves, so the tokens submitted for verification are typically the deterministic high-score tokens selected during construction. This coupling is not inherent: once the topology is fixed, its nodes can be repopulated by sampling, allowing dynamic trees to retain their structural advantage while also benefiting from random sampling and advanced verification. Diffusion-based drafters make this practical, as their parallel outputs or lightweight conditional corrections allow candidates to be regenerated cheaply after the complete topology is known. We introduce Tsubame, a two-pass tree speculative decoding framework for diffusion-based drafters. The first pass plans and freezes a context-aware topology using draft path scores; the second replays the fixed topology, sampling the tokens that populate its nodes to form the candidate tree for verification. We prove that Tsubame is lossless under compatible sampling and verification strategies. Experiments across three diffusion-based drafters, six datasets, and multiple candidate budgets show that Tsubame improves acceptance length and throughput over deterministic trees, including settings where it reverses their disadvantage against sampled chains.
- Abstract(参考訳): コンテキスト対応の動的ツリーは、ドラフトパスの確率に応じて投機的デコード予算を割り当て、その深さに適応し、現在のコンテキストに分岐する。
しかし、確率的復号化の下では、この構造上の優位性は、先進的な検証と組み合わせたランダムサンプリングの受入利得を必ずしも補うとは限らない。
これらの木は候補者自身からトポロジーを成長させるため、検証のために提出されたトークンは通常、建設中に選択された決定論的ハイスコアトークンである。
トポロジーが固定されると、そのノードはサンプリングによって再人口化され、動的木はその構造上の優位性を維持しつつ、ランダムサンプリングと高度な検証の恩恵を受けることができる。
拡散に基づく草案作成者は、並列出力または軽量条件修正により、完全なトポロジーが判明した後、候補者を安価に再生することができるため、これを現実的に実現している。
拡散型ドラフト作成者のための2パス木投機的復号化フレームワークであるツバメを紹介する。
第1は計画を実行し、ドラフトパススコアを使用してコンテキスト認識トポロジを凍結する。第2は固定トポロジをリプレイし、ノードをポップアップして検証用の候補ツリーを形成するトークンをサンプリングする。
本研究は, ツバメはサンプリングと検証の両面において無害であることが証明された。
3つの拡散型ドラフトラ、6つのデータセット、および複数の候補予算に対する実験により、ツバメは、サンプル連鎖に対する不利益を逆転させる設定を含む決定論的木よりも受け入れ長とスループットを改善することが示された。
関連論文リスト
- RheoSampling: Resolving the One-Hot Dilemma in Stochastic Dynamic-Tree Speculative Decoding [4.611034553649923]
我々は,無損失性を維持しつつ,文脈認識型トップK構築とサンプリングを併用した新しい動的ツリー手法を提案する。
OTベースの検証戦略とスパースドラフト機構により、ゲインが実用的な効率に変換されることが保証される。
このフレームワークは、ツリー構造を分析するテンプレートを提供するかもしれない。
論文 参考訳(メタデータ) (2026-09-18T14:28:28Z) - TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding [3.210063008779709]
TreeSparkは、ドラフトアの既存のMarkovヘッドから、無視可能なコストで、親条件のディストリビューションを読み取る。
TreeSparkは1ラウンドあたり15~25%のドラフトトークンを受け入れ、単一要求のウォールクロックで8~14%高速にデコードする。
論文 参考訳(メタデータ) (2026-08-12T05:30:46Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - Learn from your own latents and not from tokens: A sample-complexity theory [53.5821824211418]
本研究では,関連するビューやマスキング領域の潜在表現を予測するために訓練されたネットワークについて検討する。
潜在予測は、対数的要因まで、多くのサンプルを$L$で表すことでこれを達成できることを示す。
これは、H-JEPAのような明示的な積み重ねがほとんど冗長であることを示している。
論文 参考訳(メタデータ) (2026-05-26T22:16:42Z) - Efficient Test-Time Inference via Deterministic Exploration of Truncated Decoding Trees [68.04613115686509]
自己整合性は、複数の推論トレースを並列にサンプリングし、投票することで、推論時間のパフォーマンスを向上させる。
そこで本研究では,切り落された標本を伐採木として扱う決定論的復号法であるDLE(Distinct Leafion)を提案する。
DLEは高品質な推論トレースを調査し、数学、コーディング、一般的な推論タスクのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-04-22T12:42:03Z) - Traversal Verification for Speculative Tree Decoding [15.720388162422978]
投機的復号化は、大きな言語モデルを加速するための有望なアプローチである。
本稿では,新しい投機的復号化アルゴリズムであるトラバーサル検証を紹介する。
提案手法は,既存手法よりも受け入れ長とスループットを継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-05-18T12:51:55Z) - C2T: A Classifier-Based Tree Construction Method in Speculative Decoding [9.663330370149428]
投機的復号法は、しばしばトークンツリーの構築や候補トークンの検証において非効率に直面する。
トークンツリーを動的に生成・生成するための軽量な分類器C2Tを提案する。
論文 参考訳(メタデータ) (2025-02-19T11:57:02Z) - Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls [83.89771461061903]
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
意味論的に等価なコンテンツを持つ冗長な状態による$textitover-Exploration$と、検証器のスコアリングにおける高いばらつきに起因する$textitunder-Exploration$である。
各種木探索アルゴリズムに適合するフレキシブルなプラグアンドプレイシステムであるFETCHを提案する。
論文 参考訳(メタデータ) (2025-02-16T16:12:01Z) - Complex Event Forecasting with Prediction Suffix Trees: Extended
Technical Report [70.7321040534471]
複合イベント認識(CER)システムは、イベントのリアルタイムストリーム上のパターンを"即時"検出する能力によって、過去20年間に人気が高まっている。
このような現象が実際にCERエンジンによって検出される前に、パターンがいつ発生するかを予測する方法が不足している。
複雑なイベント予測の問題に対処しようとする形式的なフレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-01T09:52:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。