論文の概要: Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving
- arxiv url: http://arxiv.org/abs/2609.04748v1
- Date: Fri, 04 Sep 2026 05:27:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.919904
- Title: Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving
- Title(参考訳): 同じ要求、異なる回答: 量子化は LLM サービングにおけるキャッシュ誘起の多様性を増幅する
- Abstract要約: サービスエンジンがリクエスト間で共有プロンプトプレフィックスのキーと値テンソルを再利用するプリフィックスキャッシュは、主要なオープンソーススタックでデフォルトで有効になっている。
キャッシュを有効にし、2つのエンジンと4つの重み付けフォーマットで無効にする。
繰り返し実行はすべての構成においてビット識別され、800回中0回であり、他の非決定性源を0.5%に制限している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prefix caching, in which a serving engine reuses the key and value tensors of a shared prompt prefix across requests, is enabled by default in the major open-source stacks and treated as a transparent optimization. We measure what it costs in reproducibility, and find that the cost rises sharply with weight quantization. Holding the model, decoding parameters, seed, and request order fixed, and issuing every request serially at batch size one, we ran an eighty-episode multi-turn agentic tool-use workload with caching enabled and disabled across two engines and four weight formats. Enabling the cache changed the agent's trajectory on 36.2 percent of episodes at 16-bit precision and on 75.0 percent at four-bit, a gradient that survives re-measurement under a controlled cache configuration. With caching disabled, repeated execution was bit-identical in every configuration, 0 of 800 episodes, which bounds other sources of nondeterminism at 0.5 percent. Repeated cache-enabled runs did diverge, and three experiments locate the cause: a single server-level prompt-cache setting moves run-to-run divergence by 37.5 percentage points, execution order acts only while that setting is active, and restoring cache state makes the cached and recompute paths each reproduce on 40 of 40 items while still differing from each other on 14. Cached serving is deterministic given cache state, and irreproducible in practice because that state is absent from the request and never reset by default. A single-turn bridge shows the divergence reaching task outcomes without shifting aggregate accuracy. We release the harness, logs, and analysis pipeline.
- Abstract(参考訳): サービスエンジンがリクエスト間で共有プロンプトプレフィックスのキーと値テンソルを再利用するプリフィックスキャッシュは、主要なオープンソーススタックでデフォルトで有効になり、透過的な最適化として扱われる。
再現性におけるコストを測定し、重量量子化によってコストが急上昇することを確認する。
モデル、デコードパラメータ、シード、リクエスト順序を固定し、バッチサイズ1で全てのリクエストをシリアライズに発行すると、キャッシュを有効にし、2つのエンジンと4つの重み付けフォーマットで無効にする8つのエピソードのマルチターンエージェントツールのワークロードを実行しました。
キャッシュの導入により、エージェントの軌道は16ビットの精度で36.2%、そして4ビットで75.0%に変化した。
キャッシュを無効にすると、繰り返し実行はすべての構成でビット識別され、800回中0回は、他の非決定性ソースを0.5パーセントに制限した。
1つのサーバレベルのプロンプトキャッシュ設定がラン・ツー・ランの分散を37.5ポイントずつ移動し、実行順序がアクティブである間にのみ動作し、キャッシュ状態の復元によって、キャッシュとリコンプリートパスがそれぞれ40項目中40項目で再現され、14では相変わらず異なる。
Cachedサービスは決定論的に与えられたキャッシュ状態であり、実際にはその状態が要求から外れ、デフォルトではリセットされないため、実行不可能である。
単一ターンブリッジは、集約精度をシフトすることなくタスク結果に分岐することを示す。
ハーネス、ログ、分析パイプラインをリリースしています。
関連論文リスト
- FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents [2.7688478017544274]
FinCacheServeは、生成された各回答を、企業意図によってインデックスされたサービスオブジェクトとして扱う。
vLLM実装は、Qwen2.5モデルでSEC由来の財務文書ワークロードを評価する。
論文 参考訳(メタデータ) (2026-07-14T02:58:16Z) - StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving [0.0]
StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割します。
StepCacheは、選択的パッチによって失敗したリージョンのみを再生する。
平均レイテンシは2.13秒から0.67秒、中央レイテンシは2.42秒から0.01秒、p95レイテンシは3.38秒から3.30秒に減少する。
論文 参考訳(メタデータ) (2026-03-24T17:19:26Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Accelerating Diffusion Transformer via Error-Optimized Cache [17.666577782052205]
Diffusion Transformer (DiT) はコンテンツ生成の重要な方法である。
既存のキャッシュ手法は、前回のステップからDiT機能を再利用し、次のステップで計算をスキップすることで、生成を加速する。
我々はこの問題を解決するために textbfError-textbfOptimized textbfCache (textbfEOC) を提案する。
論文 参考訳(メタデータ) (2025-01-31T15:58:15Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。