論文の概要: Exact Memory-Time Optimization for Prefix-Cached Language Model Serving
- arxiv url: http://arxiv.org/abs/2610.02766v1
- Date: Fri, 02 Oct 2026 03:47:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.200421
- Title: Exact Memory-Time Optimization for Prefix-Cached Language Model Serving
- Title(参考訳): プリフィックスキャッシュ言語モデルのエクササイズメモリ時間最適化
- Abstract要約: Prefix-Certificate Retention (PCR)は、静的、グループ化、リセットオン・アクセスタイムアウトのための、正確な有限トレースの定式化である。
我々は、この制限のコストを証明した順序付きタイムアウトと境界に対する線形時間イングリッドサイズ動的プログラムを導出する。
固定グリッド上では、120のトレースグループ・プライスケースのうち118の非制限トレーニング最適値が得られる。
- 参考スコア(独自算出の注目度): 2.731113456484581
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retaining language-model prefix states trades recomputation against storage time. Optimizing each cached block independently can overcount savings: a resident block is usable only when the required preceding prefix is also available. We introduce Prefix-Certificate Retention (PCR), an exact finite-trace formulation for static, grouped, reset-on-access timeouts. Usable-prefix rewards become nodes whose prerequisites are timeout thresholds and preceding hit certificates. The resulting maximum-weight closure reduces to one minimum cut, with graph size linear in the number of block lookups and timeout choices. A breakpoint theorem extends the construction to all nonnegative timeouts without discretization error. We also derive a linear-time-in-grid-size dynamic program for ordered timeouts and bounds that certify the cost of this restriction. Exhaustive small-instance checks and chronological replay of 39,632 public Mooncake requests validate the formulation. On the fixed grid, ordered timeouts attain the unrestricted training optimum in 118 of 120 trace-grouping-price cases. Heterogeneous retention improves several held-out memory-time tradeoffs, but finer training optimization does not uniformly improve transfer. The contribution is a tractable optimization model and an auditable benchmark for retention policies; the experiments measure usable prefix blocks and storage time, not GPU latency.
- Abstract(参考訳): 言語モデルプレフィックスの保持は、記憶時間と再計算を交換する。
キャッシュされたブロックを個別に最適化することは、貯蓄をオーバーカウントすることができる: 常駐ブロックは、必要となるプレフィックスが利用可能である場合にのみ使用可能である。
Prefix-Certificate Retention (PCR)は、静的、グループ化、リセットオン・アクセスタイムアウトのための、正確な有限トレースの定式化である。
使用可能なプリフィックス報酬は、必要条件がタイムアウトしきい値と前回のヒット証明書であるノードになる。
その結果、最大重み付きクロージャは1つの最小カットに減少し、グラフサイズはブロックのルックアップ数とタイムアウトの選択数に線形である。
ブレークポイント定理は、離散化誤差のない全ての非負のタイムアウトに構成を拡張する。
また、この制限のコストを証明した順序付きタイムアウトと境界に対する線形時間イングリッドサイズ動的プログラムを導出する。
39,632人のムーンケーキの発掘調査と時系列のリプレイにより、この定式化が検証された。
固定グリッド上では、120のトレースグループ・プライスケースのうち118の非制限トレーニング最適値が得られる。
不均一な保持は、いくつかの保留メモリタイムトレードオフを改善するが、より微細なトレーニング最適化は、転送を均一に改善しない。
このコントリビューションは、トラクタブルな最適化モデルと、保持ポリシーの監査可能なベンチマークである。実験は、GPUレイテンシではなく、使用可能なプレフィックスブロックとストレージ時間を測定する。
関連論文リスト
- Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs [5.5444120195759785]
制約のないトークンレベルのプレフィックス再利用を可能にするプレフィックスキャッシュ機構であるTail-Replayを提案する。
我々は,LongBench と RULER ベンチマークを用いて,Gated DeltaNet をベースとした3つのハイブリッドモデル上でのTail-Replay の評価を行った。
論文 参考訳(メタデータ) (2026-08-31T06:27:07Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Evolving Cache Schedules for Fast Diffusion Policy Inference [6.879031540914794]
拡散ポリシは、アクションチャンクを反復的にデノナイズすることで、強力なビジュモータ制御を実現するが、繰り返しデノナイズすることで、リアルタイムなデプロイメントを計算的に要求する。
Evolving Cache Schedules (EVO)は,進化的検索によるキャッシュリフレッシュをグローバルにスケジュールする,トレーニング不要のアクセラレーションフレームワークである。
EVOは計算量を大幅に削減し、最大8.05倍の動作生成速度を実現し、FLOPを15.77Gから1.96Gに削減する。
論文 参考訳(メタデータ) (2026-07-22T15:40:11Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Sparse Prefix Caching for Hybrid and Recurrent LLM Serving [0.7284556903703034]
重なり合う深さの分布の下で,スパースプレフィックスキャッシングをチェックポイント配置として定式化する。
リクエストが非自明なプレフィックスを共有する場合、実世界のデータ上で標準非対称性によって追跡されるフロンティアを一貫して改善することを示す。
正確な出力を保持し、リカレント計算自体を変更したり、新しいリカレント更新カーネルを必要としたりしない。
論文 参考訳(メタデータ) (2026-04-17T09:24:58Z) - TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation [16.28432866472846]
我々は、状態レベルのメモリを通じて凍結したビジョン・ランゲージ・アクションポリシーをアップグレードする、トレーニング不要の時間的修正であるTempoFitを紹介する。
私たちの重要な洞察は、プレフィックスアテンションK/Vが、すでにモデルネイティブで、コンテンツ順応可能なランタイム状態を形成しています。
LIBERO-LONGでは、TempoFitは、ほぼリアルタイムのレイテンシを維持しながら、最大4.0%の成功率で、トレーニング済みの強いバックボーンを改善している。
論文 参考訳(メタデータ) (2026-03-08T14:17:25Z) - On-Device Fine-Tuning via Backprop-Free Zeroth-Order Optimization [27.237134457089194]
メモリ効率のゼロオーダー最適化(MeZO)はこのボトルネックを軽減する。
本稿ではまず,BPおよびMeZOトレーニングで適用可能な相対モデルサイズを理論的に推定する。
次に,メモリ上の制約下で,MeZOが精度上の優位性を示すことを示す。
論文 参考訳(メタデータ) (2025-11-14T14:46:29Z) - Rectified Sparse Attention [61.7702154360081]
効率的なロングシーケンス生成は、大規模言語モデルにとって重要な課題である。
本稿では,ブロックスパースアテンションと周期的な密度補正を組み合わせた簡易かつ効果的な方法であるRectified Sparse Attention (ReSA)を提案する。
数学推論、言語モデリング、検索タスクにわたる実験は、ReSAがほぼ無作為な生成品質を達成することを示す。
論文 参考訳(メタデータ) (2025-06-04T16:01:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。