論文の概要: KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models
- arxiv url: http://arxiv.org/abs/2608.09412v1
- Date: Mon, 10 Aug 2026 10:38:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.21062
- Title: KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models
- Title(参考訳): KVDiagnosis:長期言語モデルにおけるKVキャッシュ圧縮の診断ベンチマーク
- Abstract要約: KV-cache圧縮は、長いコンテキストメモリを減らすが、アグリゲートタスクスコアは、どの正しい実行が失敗するか、なぜ失敗するかを明らかにしない。
我々は3つのコントリビューションを持つ診断データセットとベンチマークであるKVDiagnosisを提示する。
- 参考スコア(独自算出の注目度): 5.349156411852564
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: KV-cache compression reduces long-context memory, but aggregate task scores reveal neither which correct executions fail nor why. We present KVDiagnosis, a diagnostic dataset and benchmark with three contributions. First, a 25-method taxonomy groups methods into five mechanism families and links them to eight verified implementations and their valid diagnostic measurements. Second, for every supported method setting, we evaluate all sources in each fixed split against a per-source FullCache control before selecting FullCache-correct/compressed-wrong (C-to-W) rows separately for each method-setting, so no compressor defines another's test set. Third, a common record format links paired outputs and run metadata to cache, likelihood, attention, and decoding measurements with explicit applicability states. On Qwen3-8B, four evidence-aware workloads yield 59 800 supported compressed runs over 2600 sources and 12 520 C-to-W rows. Under fixed diagnostic rules, 63.2% have low or partial measured/projected coverage. Only 19 rows (0.2%) combine high measured/projected coverage with strong likelihood drift; another 2,126 (17.0%) preserve structural position addressability, for which representation fidelity remains unknown, while showing the same drift. Against C-to-C success controls, all ten diagnostics separate failed from successful compression (stratified AUROC 0.684-0.871). Among 96 reproducible low-EAR failures, a controlled 4x evidence-attention boost repairs 29.2%, versus 6.3% under a count-matched sham intervention and 3.3% degradation on matched C-to-C controls. Code and data are available at https://github.com/ChosenQC/KVDiagnosis.
- Abstract(参考訳): KV-cache圧縮は、長いコンテキストメモリを減らすが、アグリゲートタスクスコアは、どの正しい実行が失敗するか、なぜ失敗するかを明らかにしない。
我々は3つのコントリビューションを持つ診断データセットとベンチマークであるKVDiagnosisを提示する。
第一に、25mの分類群は5つのメカニズムファミリーに分類し、8つの検証済みの実装とそれらの有効な診断測定をリンクする。
次に、各メソッド設定毎にFullCache-correct/compressed-wrong(C-to-W)行を別々に選択する前に、各固定分割のソースをソース毎のFullCacheコントロールに対して評価するので、コンプレッサーが他のテストセットを定義することはない。
第三に、共通のレコードフォーマットは、ペア化された出力をリンクし、メタデータをキャッシュ、可能性、注意、および明示的な適用性状態による復号化計測に実行します。
Qwen3-8Bでは、4つのエビデンス対応ワークロードが2600のソースと12の520のC-to-W行で59 800の圧縮実行をサポートする。
一定の診断規則の下では、63.2%は低または部分的な測定/予測のカバレッジを持つ。
19行 (0.2%) だけが高い測定/投影された範囲と強い可能性ドリフトを組み合わせており、さらに2,126 (17.0%) は、同じドリフトを示しながら、表現の忠実さが不明な構造的位置アドレス性を保っている。
C-to-Cの成功制御に対して、すべての10の診断は成功した圧縮から分離できなかった(AUROC 0.684-0.871)。
96の再現可能な低周波故障のうち、制御された4倍のエビデンス・アテンション・ブースターは29.2%、カウントマッチングシャムの介入では6.3%、マッチしたC-to-Cの制御では3.3%である。
コードとデータはhttps://github.com/ChosenQC/KVDiagnosisで公開されている。
関連論文リスト
- Data Diversity, Not Frequency Invariance: A Controlled and Self-Audited Study of Compression-Robust Deepfake Detection [0.26856688022781555]
周波数特徴と圧縮不変表現学習は、ビデオ圧縮に耐えるディープフェイク検出の鍵であると広く考えられている。
本稿では, CAFRL - block-DCT および FFT-phase ストリーム, 圧縮レベル条件付き帯域アテンション, 逆(逆)圧縮でこれを検証する。
キャパシティと拡張整合制御を備えた事前登録されたプロトコルの下では、マルチ品質データに対するプレーンなEfficientNet-B0が、各圧縮レベルで指定されたCAFRLを上回った。
論文 参考訳(メタデータ) (2026-08-26T12:05:10Z) - D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory [10.177699115336425]
D$2$ACCIプロトコルは、ペア化されたエビデンス、保護されたスライス監視、トレースレベルのローカライズ可能性に基づいて、メモリ介入を促進、機能フラグ、拒否する。
我々はMemStackでプロトコルをインスタンス化し、3つの公開ベンチマークで評価し、LoCoMoで93.59%、LongMemEvalで90.93%、PersonaMem-V2で57.20%を達成した。
論文 参考訳(メタデータ) (2026-08-18T13:18:38Z) - Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression [42.94199567901975]
KVキャッシュ圧縮は、一般に最終回答精度によって評価され、答えを保存することもそれをサポートする推論を保存することを暗黙的に仮定する。
我々は、この仮定を大きな推論モデルで検証し、失敗する可能性があることを示す。
数理的推論,科学的QA,臨床計算,長文検索の3つのモデルに対して,10個のトークン消去KV圧縮法と1つの量子化法を評価した。
論文 参考訳(メタデータ) (2026-08-03T03:03:53Z) - Control Under Compression: Reliability Frontiers for Tool-Using Agents [0.0]
ACC圧縮のための環境検証ベンチマークであるCompressAgentを紹介する。
75%の保持状況では、汎用的な書き換えとセクションベースの圧縮が92.7%、92.4%の成功を収めている。
25%から10%の継続コンテキスト予算では、実行可能なプロトコルは脆弱になる。
論文 参考訳(メタデータ) (2026-08-02T07:43:44Z) - EduPluginBench: Executable Assurance for AI-Generated Educational Plugins [0.0]
我々は,ソフトウェアエコシステムにおいて生成したプラグインに対して,負の証明,実行可能なベンチマーク,ステージド・インセプション手法を導入する。
現在の2つの符号化モデルから600世代を凍結した転写研究では300/600が解析されたが、P0を通過させたり、P0-P4適合性を達成したりはしなかった。
初期の540世代の診断では、ホック後のバウンド修理で112回のP0パスが得られたが、全ては不整合であり、リコールは13.4%から100%に増加した。
論文 参考訳(メタデータ) (2026-08-01T16:22:35Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit [5.366718741784969]
KV-cache圧縮法は、圧縮前にコンテキストに付加されたクエリで主に評価される。
本稿では,3つの自明なベースラインに対する6つの圧縮手法の一致した予算監査について述べる。
論文 参考訳(メタデータ) (2026-07-11T09:30:35Z) - From CVE to CWE: Syscall-Based HIDS Generalisation [41.99844472131922]
運用環境では、ディフェンダーは既知の脆弱性の新たなエクスプロイトを認識する必要がある。
我々は,CWE(Common Weaknession)クラスを共有するCVEの正常な動作に基づいて訓練された一級異常検知器が,同一クラス内の別の未知のCVEに一般化するか否かを実証的に検証した。
論文 参考訳(メタデータ) (2026-06-21T16:34:39Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression [12.959497604836956]
長文LLM推論は、デコード中に大きなKVキャッシュを読み取る際のメモリと帯域幅のコストによってボトルネックとなる。
KV圧縮は、キャッシュの一部だけを保持することで、このコストを削減するが、タスク精度だけでは、セレクタが成功したり失敗したりする理由を特定できない。
セレクタは3つのステップで失敗する可能性がある: 将来の復号化の必要性の証拠を見逃し、出力に影響を与えないトークンに高いスコアを与えるか、スコアを小さなキャッシュに組み込む際に関連する証拠を壊す。
我々は,セレクタのセットアップを固定し,一度に1つの決定スロットを変更する固定契約診断を導入する。
論文 参考訳(メタデータ) (2026-05-07T00:36:59Z) - ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection [8.362927764080203]
キーセントロイドにユークリッド距離でトークンをランク付けする学習自由スコアラを提案する。
ManifoldKVは4K-16Kコンテキストで95.7%の精度を実現し、圧縮率は20%である。
WindowedManifoldKV は 25% 圧縮で 84.3% まで精度を回復し、グローバル L2 では 49 点、キーディフでは +3.2 点を回復する。
論文 参考訳(メタデータ) (2026-02-09T07:28:55Z) - One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache [38.49582847975703]
低ランクKVキャッシュ圧縮のための新しいポストトレーニングフレームワークDynaKVを提案する。
我々の手法は既存の最先端圧縮技術より一貫して優れています。
SnapKVと統合した場合、DynaKVはKVキャッシュの6%しか保持せず、LongBenchベンチマークのベースラインパフォーマンスの94%を維持している。
論文 参考訳(メタデータ) (2026-02-03T13:20:36Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests [17.90798133817018]
本研究は, 事故報告から得られたスタックトレースを, スペクトルベース断層定位における故障トリガー試験のプロキシとして用いる可能性について検討した。
本稿では,スタックトレース情報とテストカバレッジデータを統合する新たな手法であるSBESTを提案する。
論文 参考訳(メタデータ) (2024-05-01T15:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。