論文の概要: AdaSpark: Adaptive DSpark with Online Learning for Tree Verification and N-gram Fill
- arxiv url: http://arxiv.org/abs/2610.05774v1
- Date: Mon, 05 Oct 2026 04:18:43 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:30:05.966739
- Title: AdaSpark: Adaptive DSpark with Online Learning for Tree Verification and N-gram Fill
- Title(参考訳): AdaSpark: 木検証とN-gramフィリングのためのオンライン学習を備えた適応型DSpark
- Abstract要約: AdaSparkは、プロファイル、キャリブレーション、あるいは前もってスイープなしで、サービス中に両方の量を学ぶ。
各候補者の受理結果に適合し、起草者の自信の頭が1つの入力となり、その木が頭によってではなく、その木によって順序と大きさが決定される。
幅のスイープがなければ、AdaSparkは、どの密集したターゲットやコンテキストバンド上でも最高のピン付きツリー幅よりも0.3%遅くならない。
- 参考スコア(独自算出の注目度): 8.802416156144181
- License:
- Abstract: Block drafters such as DSpark propose ranked candidates for several positions in one forward pass, and a tree verifier checks them in one pass of the target. The number of rows to verify trades the tokens a wider tree is expected to accept against the time a wider verify takes. Most schedulers that choose this number take the verify time from a table or model measured before serving, corrected online by at most one scale factor, and take acceptance from the drafter's confidence estimates or from a map fitted offline. AdaSpark learns both quantities while it serves, with no profile, calibration or sweep in advance. It learns which verify widths are worth offering and fits each one's verify time as a function of context. It fits each candidate's acceptance probability to the target's verify outcomes, with the drafter's confidence head as one input, and orders and sizes the tree by that fit instead of by the head. The same model prices n-gram continuations of the request's own text, so drafted and text-derived candidates compete for rows in one best-first order. The width is chosen by pricing time at the long-run decode rate. On single- and multi-turn conversations from six public datasets, on three dense targets and one mixture-of-experts target, AdaSpark decodes 1.5-3.1x faster than llama.cpp's DSpark with the same drafters. Our imparo engine with AdaSpark is 1.17-1.52x faster than imparo running with a three-token chain (the default llama.cpp setting); this gain comes from the scheduler alone. Without a width sweep, AdaSpark is never more than 0.3% slower than the best pinned tree width on any dense target or context band. On the mixture-of-experts target it ties the best pinned width, and the other pinned widths from 4 to 16 rows are 5-14% slower.
- Abstract(参考訳): DSparkのようなブロックドラフトラは、1つのフォワードパスで複数の位置にランク付けされた候補を提案し、ツリー検証器がターゲットの1つのパスでそれらをチェックします。
より広いツリーのトークンの取引を検証する行数は、より広い検証を行う時間に対して受け入れられると予想される。
この番号を選択するほとんどのスケジューラは、サービス前に測定されたテーブルやモデルから検証時間を取り、少なくとも1つのスケールファクタによってオンラインに修正し、ドラフトの信頼性見積やオフラインに適合したマップから受け入れる。
AdaSparkは、プロファイル、キャリブレーション、あるいは前もってスイープなしで、サービス中に両方の量を学ぶ。
どの検証幅が提供に値するかを学び、それぞれの検証時間をコンテキストの関数として適合させる。
各候補者の受理確率を目標の検証結果に適合させ、起草者の自信の頭を入力とし、その木を頭ではなくその順に並べる。
同じモデルでは、リクエスト自身のテキストのn-gram継続価格が設定されているため、ドラフトとテキスト由来の候補が1つの最優先順序で行を競う。
幅は、長期デコードレートでの価格設定時間によって選択される。
6つのパブリックデータセットからのシングルターンとマルチターンの会話では、3つの密集したターゲットと1つの専門家のターゲットで、AdaSparkは同じドラフトでllama.cppのDSparkよりも1.5-3.1倍高速にデコードされる。
AdaSparkのインパロエンジンは、3つのチェーン(デフォルトのllama.cpp設定)で実行しているインパロよりも1.17-1.52倍高速です。
幅のスイープがなければ、AdaSparkは高密度のターゲットやコンテキストバンドの最高のピン付き木幅よりも0.3%遅いことはない。
試験対象の混合では、最適ピン付き幅を結び、4列から16列までのピン付き幅は5-14%遅い。
関連論文リスト
- CAST: Cost-Aware Speculative Trees from One-Pass Block Drafters [7.59352120325978]
投機的復号化は、将来のトークンを安価にドラフトすることで、大きな言語モデル推論を加速させる。
CAST(Cost-Aware Speculative Trees)を導入し、これらの候補を木にまとめ、単一のターゲットパスで検証する。
予測幅では、CASTは8つの設定すべてで標準チェーンよりも43%高速である。
論文 参考訳(メタデータ) (2026-09-29T04:13:00Z) - DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees [40.61855455828842]
投機的復号化は、複数のドラフトトークンを並列に検証することで、自動回帰言語モデルを高速化する。
Dartreeはトレーニング不要の投機的復号法で、事前訓練されたAR補正ヘッドをチェーンからツリーに拡張する。
論文 参考訳(メタデータ) (2026-08-13T17:43:44Z) - Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding [3.210063008779709]
TreeSparkは、ドラフトアの既存のMarkovヘッドから、無視可能なコストで、親条件のディストリビューションを読み取る。
TreeSparkは1ラウンドあたり15~25%のドラフトトークンを受け入れ、単一要求のウォールクロックで8~14%高速にデコードする。
論文 参考訳(メタデータ) (2026-08-12T05:30:46Z) - Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes [12.0234471682647]
トレーニング不要な投機的デコードドラフトは、コンテキストの正確な接尾辞と以前のコンテキストのプールとを一致させることによって行われる。
提案する第2のセマンティックなドラフトソースは,検証者が各コミットトークンですでに計算済みの隠された状態にリキーされた同じプールと,既存の語彙的ドラフト作成者のツリーの中を乗れるマージである。
論文 参考訳(メタデータ) (2026-08-04T15:47:51Z) - From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding [14.328430707715114]
投機的復号化LLMは、提案された継続がターゲットモデル検証を継続した場合のみ、推論を加速する。
親条件分岐は、半自己回帰型ドラフトラにおいて既に存在する条件付きキャパシティをエンドツーエンドの推論ゲインに変換することができることを示す。
論文 参考訳(メタデータ) (2026-08-03T12:15:26Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。