論文の概要: Speculative Pre-Positioning: Decoding Stateful Sessions to the Next Decision Point Off the Critical Path
- arxiv url: http://arxiv.org/abs/2606.29565v1
- Date: Sun, 28 Jun 2026 19:10:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.960312
- Title: Speculative Pre-Positioning: Decoding Stateful Sessions to the Next Decision Point Off the Critical Path
- Title(参考訳): 投機的プレポジション:ステートフルセッションをクリティカルパスの次の決定点にデコードする
- Abstract要約: 投機的事前配置はセッションを次の決定点までデコードする。
有能なモデルは、ほぼ全力で87%の精度でゲートを発射する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A stateless inference server (vLLM, SGLang, TensorRT-LLM) idles between requests while the accelerator waits; a stateful session reclaims that idle time. Speculative pre-positioning decodes the session forward to its next decision point with the target model's own forward pass and no draft model, moving the cross-request prefill and entry-decode off the critical path: the next request resumes from a pre-paid entry on its delta, or, when a confidence gate fires, is answered from a cached distribution in one near-constant vocabulary scan with no decode, at a cost only of energy and a rare, bounded false accept. The payoff is conditional on capability: a capable model fires the gate at near-full coverage and about 87% precision (a smaller one never clears it), returning the first token in about 1.0 ms versus the 39 ms decode a prefix cache still pays.
- Abstract(参考訳): ステートレス推論サーバ(vLLM、SGLang、TensorRT-LLM)は、アクセルが待機している間にリクエスト間でアイドルする。
投機的事前配置は、セッションを次の決定点までデコードし、ターゲットモデル自身のフォワードパスとドラフトモデルなしで、クリティカルパスからクロスリクエストプリフィルとエントリーデコードを動かす:次のリクエストはデルタでのプリペイドエントリから再開されるか、信頼ゲートが発火すると、デコードなしのほぼ一定に近い語彙スキャンでキャッシュされた分布から応答される。
能力のあるモデルは、ほぼ完全なカバレッジでゲートを発射し、約87%の精度で(より小さいものはクリアしない)、最初のトークンを約1.0ミリ秒で返却し、39ミリ秒でデコードしたプレフィックスキャッシュがまだ支払っている。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection [0.0]
ステートスペースモデル(SSM)は、建設によるプレフィルコストを回避する。
文書コーパスをSSM隠蔽状態としてオフラインでプリエンコードする。
プリフィルレイテンシは、エッジハードウェアで$sim$27 sから$6 msに削減される。
論文 参考訳(メタデータ) (2026-08-03T17:43:36Z) - Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models [29.849017661114342]
拡散言語モデルは、デノナイジングステップ毎に一時的な予測を公開する。
生成時早期出口は、スケジュールが切れる前に復号を停止する。
2つの軸を分離し、それぞれの決定をそれぞれのスコープの証拠と一致させる。
論文 参考訳(メタデータ) (2026-07-30T13:04:47Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference [4.3361375690943795]
vLLMのようなサービスエンジンのプリフィックスキャッシュは、リクエストが同じトークンプレフィックスを共有する場合にのみ、このコストを削減する。
キャッシュ対応エビデンスオーダの軽量なプロンプト層手法であるCacheWeaverを提案する。
論文 参考訳(メタデータ) (2026-06-18T00:38:46Z) - Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding [8.297861366384156]
Hybrid Verified Decodingは、検証前にキャッシュドラフトが受け入れられた長さを予測する。
分析の結果,キャッシュの素早い生成方法,高利得キャッシュのドラフトがドラフトスペースのごく一部に集中する方法,およびペイオフ誘導選択がドラフト選択の逐次的削除を減らしたことを示す。
論文 参考訳(メタデータ) (2026-05-31T05:22:40Z) - Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers [0.0]
Flash Queriesは、データ到着間のアイドルサイクルを再利用し、登録された質問を事前に評価し、ユーザが尋ねる前にキャッシュされた回答を返す。
セル予算の受け入れとプレフィックスを意識したグループプレフィルを備えたマルチテナント連続バッチスケジューラは、数十のステートフルセッションを1つのGPU上で共存させることができる。
ストリーミング市場データベンチマークでは、参照実装は従来の推論エンジンよりも最大5.9倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-05-13T17:06:15Z) - EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models [8.323540970510809]
本稿では,新たに復号されたトークン分布の最大エントロピーを,いつ再計算するかを決定するための定コスト信号として利用する,トレーニング不要なKVキャッシュ手法であるEntropyCacheを提案する。
LLaDA-8B-InstructとDream-7B-Instructの実験によると、EntropyCacheは15.2times$-26.4times$標準ベンチマークのスピードアップ、22.4times$-24.1times$-24.1times$。
論文 参考訳(メタデータ) (2026-03-19T04:46:34Z) - Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability [61.28049899686214]
本稿では,生成を低コストの高速ステップと時折高密度の低速ステップに分解する,学習不要な復号化フレームワークを提案する。
評価されたコンテキスト長全体にわたって、SFIは約1.6times$--14.4times$高い復号スループットを提供する。
論文 参考訳(メタデータ) (2026-03-12T15:14:48Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。