論文の概要: OUTLETS: Output-Length Prediction from Speculative Decoding Backbones
- arxiv url: http://arxiv.org/abs/2609.01068v2
- Date: Thu, 10 Sep 2026 08:40:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:20:15.66763
- Title: OUTLETS: Output-Length Prediction from Speculative Decoding Backbones
- Title(参考訳): OUTLETS: 投機的復号化バックボーンからの出力長予測
- Authors: Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu,
- Abstract要約: 大規模言語モデル(LLM)における出力長のヘビーテール分布は,リソースのプロビジョニングやクラスタスケジューリングにおいて大きな課題となっている。
投機的復号法(SD)と長さ予測との間の構造的関係を同定する。
本稿では,推定バックボーンを軌跡認識長予測器として再利用するOUTLETSを提案する。
- 参考スコア(独自算出の注目度): 9.273938403693576
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The heavy-tailed distribution of output lengths in Large Language Model (LLM) serving poses major challenges for resource provisioning and cluster scheduling. Although output-length prediction can mitigate these issues, existing approaches have key drawbacks: external proxy models add substantial latency and often have limited fidelity, whereas internal state-based methods are efficient but rely on shallow probes of current model states. We identify a structural connection between speculative decoding (SD) and length prediction: latent representations produced by the draft decoder in advanced frameworks (e.g., EAGLE-3) encode signals that are predictive of generation length. Building on this insight, we introduce OUTLETS (Output-Length Prediction from Speculative Decoding Backbones), which repurposes the speculative backbone as a trajectory-aware length predictor. When its draft representations are already computed for speculative decoding, OUTLETS adds only a lightweight regression head and achieves lower MAE than the evaluated methods. Under saturated disaggregated serving, OUTLETS predictions enable standard scheduling policies to prioritize shorter requests and distribute requests more evenly across decoding instances, reducing short-request P99 latency by 34.8%.
- Abstract(参考訳): 大規模言語モデル(LLM)における出力長の重み付け分布は,資源のプロビジョニングやクラスタスケジューリングにおいて大きな課題となっている。
外部プロキシモデルは相当なレイテンシを増し、しばしば忠実度が制限されるのに対して、内部状態ベースのメソッドは効率的だが、現在のモデル状態の浅いプローブに依存している。
我々は、投機的復号法(SD)と長予測との間の構造的接続を同定する: 先進的なフレームワーク(例えば、ERGLE-3)において、ドラフトデコーダによって生成された潜時表現は、生成長の予測可能な信号を符号化する。
この知見に基づいて, OUTLETS (Output-Length Prediction from Speculative Decoding Backbones) を導入する。
ドラフト表現が投機的復号化のために既に計算されている場合、OUTLETSは軽量な回帰ヘッドのみを追加し、評価された方法よりも低いMAEを達成する。
飽和分散サービスの下では、OUTLETS予測により、標準的なスケジューリングポリシーにより、短い要求を優先順位付けし、デコードインスタンスをまたいでリクエストをより均等に分散し、短要求のP99レイテンシを34.8%削減できる。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs [7.630708097054872]
拡散に基づく大規模言語モデル(D-LLM)は、生成AIにおける有望なフロンティアである。
提案するPredict-then-Diffuseは,入力クエリ毎の計算予算推論を可能にするモデルに依存しないフレームワークである。
そこで,Predict-then-DiffuseはデフォルトのD-LLM推論機構と比較して計算コスト(FLOP)を大幅に削減することを示した。
論文 参考訳(メタデータ) (2026-05-05T18:55:24Z) - Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions [16.877407702260243]
既存のメソッドは通常、スケジューリングを容易にするためにリクエスト毎に単一の出力長を予測する。
SJFスケジューリングにおける出力長の代替として,Tail Inflated expectation (TIE)を提案する。
TIEは、オンライン推論のために、トーケン毎のレイテンシを2.31ドル削減し、オフラインデータ生成のために、スループットを1.42ドル改善する。
論文 参考訳(メタデータ) (2026-04-01T05:31:21Z) - Predicting LLM Output Length via Entropy-Guided Representations [13.351384070796747]
本稿では,本モデルの内部隠蔽状態を有効長予測のために再利用する軽量フレームワークを提案する。
1) オンザフライアクティベーションとトークンエントロピーを用いて高精度な静的予測を行うEGTP (Entropy-Guided Token Pooling) である。
論文 参考訳(メタデータ) (2026-02-12T10:49:04Z) - Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios [76.85739138203014]
本稿では,一方向および注目メカニズムを加速する新しいアーキテクチャであるSpecFormerを紹介する。
また,SpecFormerはトレーニング要求の低減と計算コストの削減を実現している。
論文 参考訳(メタデータ) (2025-11-25T14:20:08Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation [64.59292053188264]
主流SDベンチマークと推論重ベンチマークの実験結果から,SVIPの優れた性能が示された。
SVIPは、ドラフトエントロピーを参照して、ドラフトシーケンスの長さを適応的に決定する、投機的復号システムのためのトレーニング不要な動的長さポリシーである。
論文 参考訳(メタデータ) (2024-11-27T15:53:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。