論文の概要: Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation
- arxiv url: http://arxiv.org/abs/2607.28495v1
- Date: Thu, 30 Jul 2026 16:41:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.666934
- Title: Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation
- Title(参考訳): ステージ再生によるKVキャッシュの追跡:固定前精度制御と双方向キャッシュ移植
- Authors: Alexander Boesgaard Lorup,
- Abstract要約: Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
- 参考スコア(独自算出の注目度): 51.56484100374058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Stage-replay diagnostics reconstruct intermediate token prefixes and treat fresh-prefill continuation as continuation from the decoder state that originally reached the prefix. We audit that assumption at a whole reasoning-stage boundary in a Qwen2.5-derived system. A matched 200-item experiment compares retained live cache with one-shot prefill of identical integer tokens and places an exact replica on both sides. In BF16, replicas remain exact while the constructions differ on 166 suffixes and 20 correctness labels; the accuracy difference is only one point (paired 95% CI [-3.5, +5.5]). A fixed-prefix 2x2 holds all 200 token states constant while crossing construction and precision. The BF16 disagreements recur, whereas FP32 produces no decoded disagreement (95% Wilson upper bound 1.88%). A prospective bridge makes token-by-token incremental and retained live caches bit-exact on 12/12 rows; an all-200 saved-ledger audit reproduces every retained trajectory and comparison fingerprint. Bidirectional transplantation of all 48 key/value layers makes every tested divergent continuation follow its cache donor, both on a selected set at the primary checkpoint (24/24) and an outcome-blind replication at a later checkpoint (43/43). Exact-token replay can therefore be repeatable without preserving live-state fidelity. On the tested states, boundary K/V cache is a causally sufficient carrier of the divergent trajectory, while numerical precision moderates its behavioral expression.
- Abstract(参考訳): ステージ再生診断は中間トークンプレフィックスを再構築し、最初にプレフィックスに到達したデコーダ状態からの継続として、新しいプリフィル継続を治療する。
我々は、Qwen2.5由来のシステムにおいて、その仮定を完全な推論段階境界で評価する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
BF16では、複製は正確なままであり、166個の接尾辞と20個の正当性ラベルが異なるが、精度の違いは1点のみである(95% CI [-3.5, +5.5])。
固定前固定2x2は、建設と精度を越えながら200のトークン状態を一定に保持する。
BF16は再帰するが、FP32は復号化しない(95% Wilson上界1.88%)。
将来的なブリッジはトークン・バイ・トークンのインクリメンタルおよび保持されたライブキャッシュを12行/12行でビット交換し、全200の保存されたレガー監査は保持されたすべての軌跡と比較指紋を再現する。
全48のキー/値層を双方向に移植することで、テストされた各分岐継続はそのキャッシュドナーに従い、プライマリチェックポイント(24/24)で選択されたセットと、後のチェックポイント(43/43)で結果ブラインドレプリケーションを行う。
したがって、実状態の忠実さを保たずに、厳密なリプレイを繰り返すことができる。
テストされた状態において、境界K/Vキャッシュは発散軌道の因果的に十分なキャリアであり、数値的精度は行動表現を弱めている。
関連論文リスト
- From Expert Reduction to Behavioral Divergence: Tracing Numerical State through Sparse MoE Inference [0.0]
専門家還元命令は、観測可能な異なるスパース-MoE実行を生成することができる。
ローカルMoE状態の凍結とアグリゲーションのセマンティクスの変化により、ネイティブのDeepSeek-V4-Flashでこの効果を分離する。
論文 参考訳(メタデータ) (2026-07-30T12:07:56Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters [10.230437172157474]
思考の連鎖はLSM推論を改善するが、ソースは競合する。
それぞれのモデルを同じ質問に繰り返しサンプリングし、同じ推論計画に従って、より長い自然世代とペアリングする。
余分なトークンは、独立に訓練されたすべての理性者に対して、本質的には変化しない。
同じ意味的内容を表す2つのトレースが、より冗長な場合に異なる結果をもたらすかどうかを問う。
論文 参考訳(メタデータ) (2026-06-29T11:06:46Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation [0.0]
言語モデルのロールアウトにおいて、どのトークンが最終回答が正しいか間違っているかを尋ねる。
我々は、この仮定がストック推論エンジンのコストを3パスの設計で測定する。
6つの構成と3つのモデルにまたがって、リフィーディングはレプリカフロアよりも14-28ポイント高いレートでクレジットの見積もりを変更する。
論文 参考訳(メタデータ) (2026-06-14T06:09:16Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - Capture-Quiet Decomposition: A Verification Theorem for Chess Endgame Tablebases [51.56484100374058]
チェス・エンドゲーム・テーブルベースにおけるWin-Draw-Lossラベルの検証のためのCapture-Quiet Decomposition(CQD)を提案する。
この定理は、すべての法的位置を、終端、捕捉、静かの3つのカテゴリのうちの1つに分解する。
CQDは35の3ピースと4ピースのエンドゲーム(2200万ポジション)、110の5ピースのエンドゲーム、72の6ピースのエンドゲーム(合計517のエンドゲーム)で徹底的に検証します。
論文 参考訳(メタデータ) (2026-04-09T07:22:24Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。