論文の概要: Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization
- arxiv url: http://arxiv.org/abs/2607.17019v1
- Date: Sun, 19 Jul 2026 01:13:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.338507
- Title: Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization
- Title(参考訳): 正規化やローカライズ: 量子化の下でのトレーニング時間KVキャッシュの幾何学
- Abstract要約: シグレグは3対の種子に対して、隠れ状態のペアワイズ対異方性(英語版)を38%値下げる。
しかし、継続トレーニング中にSigregを直接KとVに適用すると、平均キャッシュ異方性は4つのチェックポイントで94%削減される。
- 参考スコア(独自算出の注目度): 7.954260884574662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study whether \sigreg -- LeJEPA's anti-collapse objective -- can reshape representations during standard autoregressive language-model pretraining, and when the resulting geometry helps \kv-cache quantization. We train 110M-parameter models on 10B FineWeb tokens and report three findings. \textbf{(1)} At $λ{=}0.01$, \sigreg reduces hidden-state pairwise-cosine anisotropy by $38\%$ across three paired seeds. Perplexity increases by less than $0.35\%$ in every pair, with no consistent zero-shot loss. \textbf{(2)} This change does not propagate from hidden states to the \kv cache. Applying \sigreg directly to K and V during continued training, however, reduces mean cache anisotropy by $94\%$ across four checkpoints. A matched continuation without the \kv term leaves cache geometry nearly unchanged, and the frozen-trunk retrofits we tested do not reproduce the effect. \textbf{(3)} Under untransformed symmetric group-free quantization, direct \kv regularization is the only training condition that prefers per-channel scaling in all three seeds, and under that same 3-bit per-channel scheme the baseline incurs $4.3$--$7.9\times$ the directly regularized model's \dnll. Under the full simulated KIVI-style configuration (mixed arrangement, zero-points, grouped scales), however, all models reach near-parity, including when storage overhead is approximately matched. In this 110M regime, the training intervention helps when quantizer scales are coarse; the advantage vanishes under the tested combination of token-local grouping, mixed \kv scaling, and zero-points. To our knowledge this is the first training-time \emph{distributional} regularization of standard \kv-cache geometry evaluated against post-hoc cache quantization.
- Abstract(参考訳): 我々は,LeJEPA の反崩壊目標である \sigreg が,標準自己回帰言語モデル事前学習中に表現を再構成できるかどうか,その結果の幾何が \kv-cache の量子化に役立つかを検討する。
110Mパラメータモデルを10B FineWebトークンでトレーニングし,3つの知見を報告する。
textbf{(1)} at $λ{=}0.01$, \sigreg is reduces hidden-state pairwise-cosine anisotropy across three paired seed。
パープレキシティはすべてのペアにおいて0.35\%以下で増加し、一貫したゼロショット損失は生じない。
textbf{(2)} この変更は、隠された状態から \kv キャッシュに伝播しない。
しかし、継続トレーニング中にShasigregを直接KとVに適用すると、平均キャッシュ異方性は4つのチェックポイントで9,4\%削減される。
kv項のない一致した継続はキャッシュ幾何学をほとんど変わらないままにし、我々が試した凍結トランクの逆修正は効果を再現しない。
\textbf{(3)} 非変換対称群自由量子化の下では、直接 \kv正則化は3つのシードの全てにおいてチャネルごとのスケーリングを好む唯一の訓練条件であり、同じ3ビット毎のスキームの下では、ベースラインは4.3$--$7.9\times$ である。
しかし、KIVIスタイルのフルシミュレートされた構成(混合配置、ゼロポイント、グループ化スケール)では、ストレージオーバーヘッドがほぼ一致する場合を含む全てのモデルがほぼパリティに達する。
この110M体制では、トレーニングの介入は、量子化器のスケールが粗いときに役立ち、トークン局所的なグループ化、混合 \kv スケール、ゼロポイントの試験の組み合わせで利点が消える。
我々の知る限り、これはポストホックキャッシュ量子化に対して評価された標準 \kv-cache のトレーニング時間 \emph{distributional} 正規化である。
関連論文リスト
- Fast Weight Attention for Continual Learning [75.34672054079408]
リカレント高速記憶と選択状態空間モデルは、拡張コンテキストを固定サイズのリカレント状態に圧縮する。
正則化された二乗誤差回帰と負の内積目標の1次更新を導出する。
我々は、数値的に安定な正のデカイ再正規化とともに、繰り返し、マスクパラレル、チャンクパラレル形式を提供する。
論文 参考訳(メタデータ) (2026-08-27T22:55:11Z) - High-Dimensional Nonparametric Change-Point Detection via Low-Rank Degree-Three Density Projection [2.1991623402625606]
分布の変化は手段に見えず、共変は歪み、非対称な相互作用、または他の3階構造に現れる。
我々は, 直接密度推定を回避しつつ, 密度の最大3次係数を全て保持する非パラメトリックな変化点法を開発した。
論文 参考訳(メタデータ) (2026-08-16T01:21:55Z) - A Design Space Study of Density Matrix Parameterizations for Diffusion-Based Quantum State Tomography [0.0]
拡散QSTのための密度行列パラメータ化の最初の設計空間について述べる。
2-および3-qubitスケールでの7つのパラメータ化の校正は、エンドツーエンドのトレーニングによって検証され、エンフォメトリ条件だけではエンドツーエンドのパフォーマンスを予測できないことが判明した。
論文 参考訳(メタデータ) (2026-08-10T14:05:36Z) - A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs [0.0]
キー値(KV)キャッシュは、トランスフォーマー推論の主要なメモリコストとなっている。
低ランク法はキャッシュの2次元スライス、またはヘッド当たり行列またはクロス層特徴ブロックを分解し、量子化法は各エントリのビット幅を下げる。
提案手法は,トークンと特徴軸のみを圧縮し,頭部と層軸をそのまま残す部分的タッカー分解法である。
ランダム化されたSVDの派生型であるFlashJoLTは、1024のコンテキストで5-13倍の圧縮時間のスピードアップと品質の一致を提供する。
論文 参考訳(メタデータ) (2026-07-14T09:23:20Z) - Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization [58.14514930760722]
参加者が協力して大規模なニューラルネットワークを訓練し、提供する分散セットアップを検討する。
このセットアップでは、フルウェイトセットがどの参加者にも利用できないような、非機械的なウェイトの可能性を探る。
我々は、シャードモデルセットアップを利用するトレーニングおよび推論フレームワーク、Unextractable Protocol Models (UPMs)を紹介する。
論文 参考訳(メタデータ) (2026-05-22T10:24:57Z) - Towards Joint Quantization and Token Pruning of Vision-Language Models [53.978753457744055]
トークンプルーニングと低ビット量子化は、推論コストの削減を補完する。
我々は、低ビット推論と決定論的視覚トーケンプルーニングを統一する協調量子化&プルーニングフレームワークを提案する。
標準VLMベンチマークの実験では、同じ低ビット状態下でのステージワイドベースラインよりもロバスト性が改善された。
論文 参考訳(メタデータ) (2026-04-19T08:18:29Z) - EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models [8.323540970510809]
本稿では,新たに復号されたトークン分布の最大エントロピーを,いつ再計算するかを決定するための定コスト信号として利用する,トレーニング不要なKVキャッシュ手法であるEntropyCacheを提案する。
LLaDA-8B-InstructとDream-7B-Instructの実験によると、EntropyCacheは15.2times$-26.4times$標準ベンチマークのスピードアップ、22.4times$-24.1times$-24.1times$。
論文 参考訳(メタデータ) (2026-03-19T04:46:34Z) - Learning to Forget Attention: Memory Consolidation for Adaptive Compute Reduction [6.908972852063454]
状態空間モデルと注意を結合したハイブリッドアーキテクチャは、高い効率品質のトレードオフを実現している。
テキストbf88%の注意操作は、モデルの隠れた状態から既に予測可能な情報を取得する。
textbfours (textbfConsolidation-based textbfRouting for textbfAdaptive textbfMemory) は生物学的にインスパイアされたメモリ統合機構で、エピソード検索をパラメトリックセマンティックメモリに徐々に蒸留する。
論文 参考訳(メタデータ) (2026-02-12T17:40:15Z) - Phase-space entropy at acquisition reflects downstream learnability [54.4100065023873]
楽器分解位相空間に基づく取得レベルスカラー$S_mathcal B$を提案する。
本稿では, (S_mathcal B) が周期サンプリングの位相空間コヒーレンスを正確に同定できることを理論的に示す。
$|S_mathcal B|$は一貫してサンプリングジオメトリをランク付けし、トレーニングなしで下流での再構築/認識の困難を予測します。
論文 参考訳(メタデータ) (2025-12-22T10:03:51Z) - Chebyshev Moment Regularization (CMR): Condition-Number Control with Moment Shaping [0.0]
textbfChebyshev Moment Regularization (CMR)を導入する。
CMRは、ログ条件プロキシ形状と内部をチェビシェフモーメントを介して、スペクトルエッジを共同で制御する。
これらの結果は、テキスト最適化によるスペクトル事前条件付け(英語版)をサポートし、安定的で正確な学習のために、よく条件付けられた状態に向けて直接ステアリングする。
論文 参考訳(メタデータ) (2025-10-17T06:54:41Z) - Self-Ensembling Gaussian Splatting for Few-Shot Novel View Synthesis [55.561961365113554]
3D Gaussian Splatting (3DGS) は新規ビュー合成(NVS)において顕著な効果を示した
本稿では,Self-Ensembling Gaussian Splatting(SE-GS)を紹介する。
我々は,トレーニング中に不確実性を認識した摂動戦略を導入することで,自己理解を実現する。
LLFF, Mip-NeRF360, DTU, MVImgNetデータセットによる実験結果から, 本手法がNVSの品質を向上させることを示す。
論文 参考訳(メタデータ) (2024-10-31T18:43:48Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。