論文の概要: Divergence Timing and Cumulative Disagreement under KV-Cache Eviction
- arxiv url: http://arxiv.org/abs/2609.16617v2
- Date: Fri, 18 Sep 2026 04:09:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.687563
- Title: Divergence Timing and Cumulative Disagreement under KV-Cache Eviction
- Title(参考訳): KVキャッシュ推定における発散タイミングと累積分解
- Abstract要約: KV-cache消去は自己回帰生成を管理する条件付きトークン分布を乱す。
本稿では,最初の発散タイミングとその後のトークンミスマッチが累積不一致をどのように決定するかを検討する。
- 参考スコア(独自算出の注目度): 5.094080300011339
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: KV-cache eviction perturbs the conditional token distributions governing autoregressive generation. We investigate how first-divergence timing and subsequent token mismatch determine cumulative disagreement. We derive an exact decomposition under a specified stepwise maximal coupling: the expected mismatch fraction equals a first-mismatch contribution plus post-divergence exposure multiplied by its mismatch rate. An explicit construction over unrestricted autoregressive kernel pairs realizes the sharp interval of risks compatible with a finite divergence-aligned observation window. Residual-branch conditional Monte Carlo provides unbiased joint estimates of occurrence, occupation, and window/tail contributions, with per-replicate variance dominance for total token loss. Complete trajectories from Meta-Llama-3.1-8B-Instruct and Qwen2.5-7B-Instruct show that SnapKV at 50% retention enters divergence later and less often than SnapKV-512 or recent-token retention with the same 50% prompt-cache budget, while post-divergence total variation (TV) remains high. In an exploratory analysis of 288 documents, post-divergence exposure accounts for 85-90% of four aggregate mismatch gaps. On 288 independent documents at 90% retention, prespecified comparisons show higher branch-aligned TV in the late than in the early window in both models.
- Abstract(参考訳): KV-cache消去は自己回帰生成を管理する条件付きトークン分布を乱す。
本稿では,最初の発散タイミングとその後のトークンミスマッチが累積不一致をどのように決定するかを検討する。
推定ミスマッチ分画はそのミスマッチ率に乗じて、第1ミスマッチ分画と第2ミスマッチ分画と第2ミスマッチ分画との正確な分解を導出する。
制限のない自己回帰的カーネル対に対する明示的な構成は、有限発散した観察窓と互換性のあるリスクの急激な間隔を実現する。
残留ブランチ条件のモンテカルロは、発生、占有、ウィンドウ/テールコントリビューションの非バイアス付きジョイント見積もりを提供し、トークン損失総数に対して、複製ごとの分散優位性を提供する。
Meta-Llama-3.1-8B-Instruct と Qwen2.5-7B-Instruct の完全な軌道は、スナップKVの50%の保持が後に分岐し、スナップKV-512 よりも遅く、最近では50%の即時保持予算で維持されるのに対し、スナップKV-512 の保持率が低いことを示している。
288の文書の探索分析では、4つの集合ミスマッチギャップの85-90%が拡散後の露光である。
288件の独立文書を90%の保持率で比較すると, 両モデルとも, 両モデルとも早期のウィンドウよりも, 後期のブランチアラインTVの方が高い傾向を示した。
関連論文リスト
- Observational Indistinguishability and Integrity Blind Regions in Hybrid Quantum-Classical Workflows [0.0]
本稿では,ハイブリッド量子古典的ワークフロー整合性のためのクレーム相対的エビデンス/参照フレームワークを提案する。
観測上の不明瞭さは、有限バッチ統計ミスとは異なる構造的な盲点をもたらす。
論文 参考訳(メタデータ) (2026-09-15T13:16:37Z) - From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts [61.695980784491475]
テストタイムスケーリングは、推論ロールアウトのコホートを生成するが、推論が展開するにつれて内部計算がどのように再編成されるかについて、標準的なラベルのない説明はない。
本稿では,MoEの専門家による類似性から構築したクロスロールアウトグラフのエントロピー有効次元性であるルーティング有効ランクデフを導入する。
論文 参考訳(メタデータ) (2026-09-06T05:43:22Z) - Iterate or Widen? When Test-Time Refinement Helps LiDAR Scene Completion: A Controlled Study of Evidence Geometry, Training Coverage, and Compute [4.730664917323328]
我々は,同じ凍結予測器から1ショットの予測器,パラメータマッチングされたより広い予測器,および重み付き乗算器を比較した。
このプロトコルは、コヒーレント領域の除去、独立した薄型化、範囲依存性の減衰、および添加性クラッタを分離する。
5つの訓練種子と815個のセマンティックKITTI-08フレームにまたがって、完全な反復システムはmIoUを0.911ポイントの範囲で改善する。
論文 参考訳(メタデータ) (2026-08-06T13:19:14Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models [1.4563514298965277]
チェーン・オブ・シント推論モデルはバイモーダル収束パターンを示す。
世代は、(収束しない)トークン予算内で終了するか、(収束しない)結論に達することなくそれを排気する
AIME 1983-2024では収束世代が90.3%、非収束世代は6.6%であり、全体の収束率は62.0%である。
論文 参考訳(メタデータ) (2026-07-23T15:37:04Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - Self-Compacting Language Model Agents [44.3231488987671]
SelfCompactは、モデル自体がいつ、どのようにコンパクトになるかを決定できる足場である。
微調整や外部の監督なしに、効果的な適応圧縮を付与する。
以上の結果から,SelfCompactはトークンコストのごく一部で,固定区間の要約と一致するか,あるいは超えていることがわかった。
論文 参考訳(メタデータ) (2026-06-22T16:08:34Z) - DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models [3.0273878903284266]
DASHは、両方のスコアブランチを監督する二重ブランチ蒸留フレームワークである。
TIRT Transferは、教師の時間単位の重要カリキュラムを凍結した前科として生徒にコピーする。
論文 参考訳(メタデータ) (2026-05-30T16:35:54Z) - Almost Asymptotically Optimal Active Clustering Through Pairwise Observations [59.20614082241528]
そこで本研究では, ノイズと能動的に収集された応答を用いて, M$アイテムを未知数の$K$個別グループにクラスタリングするための新しい分析フレームワークを提案する。
クラスタリングの精度に対する望ましい信頼性を達成するのに必要なクエリ数の基本的下位境界を確立する。
我々は、一般化された同値比統計の計算可能な変種を開発し、その下限に対する性能ギャップを正確に推定できることを実証的に示す。
論文 参考訳(メタデータ) (2026-02-05T14:16:47Z) - On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games [71.73971094342349]
ゲームにおける学習力学の非エルゴード収束は、理論と実践の両方において重要であるため、広く研究されている。
近年の研究では、最適乗算重み更新を含む学習力学の幅広いクラスが、任意に遅い最終項目収束を示すことが示されている。
OMWUは、同じクラスのゲームにおいて、その遅い最終点収束とは対照的に、$O(T-1/6)$est-iterate convergence rateを達成することを示す。
論文 参考訳(メタデータ) (2025-03-04T17:49:24Z) - Continuous K-Max Bandits [54.21533414838677]
我々は、連続的な結果分布と弱い値-インデックスフィードバックを持つ、$K$-Maxのマルチアームバンディット問題について検討する。
この設定は、レコメンデーションシステム、分散コンピューティング、サーバスケジューリングなどにおいて重要なアプリケーションをキャプチャします。
我々の重要な貢献は、適応的な離散化とバイアス補正された信頼境界を組み合わせた計算効率の良いアルゴリズムDCK-UCBである。
論文 参考訳(メタデータ) (2025-02-19T06:37:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。