論文の概要: Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement
- arxiv url: http://arxiv.org/abs/2609.25916v1
- Date: Tue, 22 Sep 2026 09:22:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.308537
- Title: Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement
- Title(参考訳): スカラー感度を超える:クロス層リファインメントを用いたアクティベーション・アウェア混合精密LDM量子化
- Abstract要約: 混合精度重み量子化は一般にMultiple-Choice Knapsack Problem (MCKP)として定式化される
既存の解法は、各重み行列のヘッセンを1つの数に分解し、全ての加群を独立に扱うスカラー感度プロキシに依存している。
最適なスカラープロキシでさえ、最大$sqrt(mathbfA)(mathbfB)$までの乗法歪みを、活性化を意識した二次性に対して生じさせることを証明した。
- 参考スコア(独自算出の注目度): 7.305019142196582
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixed-precision weight quantization is commonly formulated as a Multiple-Choice Knapsack Problem (MCKP), yet existing solvers rely on scalar sensitivity proxies that collapse each weight matrix's Hessian into a single number and treat every module independently. We prove that even the optimal scalar proxy incurs multiplicative distortion up to $\sqrt{κ(\mathbf{A})κ(\mathbf{B})}$ relative to the full activation-aware quadratic, where $κ(\mathbf{A})$ and $κ(\mathbf{B})$ denote the condition numbers of the input- and output-side Hessian factors. This bound varies from $10^1$ to $10^{13}$ for typical LLM modules, making inter-module sensitivity ranking unreliable. To address these limitations, we propose Cross-layer Activation-aware Sensitivity Allocation (CASA), a two-phase method. In Stage 1, the scalar proxy is replaced by an activation-aware metric derived from the Kronecker-factored Hessian, reducing the MCKP to a form whose continuous relaxation admits a closed-form solution. In Stage 2, a cross-layer-aware local search evaluates bit-width updates using the end-to-end model loss. Experiments on multiple LLMs across different bit budgets show that CASA achieves lower perplexity than the latest scalar-proxy baselines, especially at ultra-low bit-widths ($<3$ bits per weight). Moreover, the performance gain in zero-shot accuracy tracks the per-model average condition-number over modules, confirming the distortion bound as a practical indicator of scalar-proxy failure.
- Abstract(参考訳): 混合精度の重み量子化は、一般にMultiple-Choice Knapsack Problem (MCKP)として定式化されるが、既存の解法は、各重み行列のヘシアンを1つの数に分解し、全てのモジュールを独立に扱うスカラー感度プロキシに依存している。
最適スカラープロキシでさえ、$κ(\mathbf{A})$と$κ(\mathbf{B})$が入力側および出力側のヘッセン因子の条件数を表すとき、フルアクティベーション対応二次体に対して$\sqrt{κ(\mathbf{A})κ(\mathbf{B})}$に乗法的歪みが生じることを証明している。
この境界は、典型的なLCMモジュールに対して10^1$から10^{13}$まで様々であり、モジュール間の感度ランキングが信頼できない。
これらの制約に対処するため,二相法であるクロス層活性化型感度割当(CASA)を提案する。
ステージ1では、スカラープロキシはKronecker-factored Hessianに由来するアクティベーション対応の計量に置換され、MCKPは閉形式解を許容する形式に還元される。
ステージ2では、クロスレイヤ対応のローカルサーチが、エンド・ツー・エンドのモデル損失を用いてビット幅の更新を評価する。
異なるビット予算にわたる複数のLSMの実験により、CASAは最新のスカラープロキシベースラインよりも低いパープレキシティ、特に超低ビット幅(1ウェイトあたり3$ビット)を実現していることが示された。
さらに、ゼロショット精度における性能向上は、モデル平均条件数オーバーモジュールをトラックし、スカラー・プロキシ故障の実用的な指標として歪み境界を確認した。
関連論文リスト
- Scaling-Score Conformal Prediction for Multi-Target Regression [0.42970700836450476]
マルチターゲット回帰は、複数の関連する出力を同時に予測するモデルを必要とする。
モデルに依存しないスケーリングスコアコンフォメーション法(コンポーネント単位の絶対残差のみを要求する)を提案する。
論文 参考訳(メタデータ) (2026-09-15T12:23:57Z) - Scalable Lindblad Noise Learning via Stochastic Tensor-Network Simulation [48.887627688666974]
大規模オープン量子システムにおける学習散逸率は、短期量子技術の大きな障害である。
本稿では,シミュレーション手法であるJump Method(TJM)を組み合わせたLindblad散逸率のスケーラブルなノイズ学習フレームワークを提案する。
我々は,Isingモデルにおける2つのノイズモデルに対するアプローチを実証し,各サイトについて,N_mathrmsite=16$まで独立散逸率を学習した。
スケーラブルな数値と厳密な理論的保証の組み合わせは、TJMベースのノイズ学習を大きな量子デバイスにおける散逸を特徴づける実用的な基礎として位置づけている。
論文 参考訳(メタデータ) (2026-08-25T15:07:11Z) - Adaptive operator-generated subspaces for effective many-body Hamiltonians [0.0]
適応型Clifford-Algebra Subspacesolver (A-CASE) について述べる。
オーバーラップ、ハミルトン、観測可能、および応答行列は、共通のパウリ観測バンクから再構成される。
グループ化された反復は、しきい値、ルートマッチング、スペクトル重み、感受性、拡張を通じて有限ショットの変動を伝播する。
論文 参考訳(メタデータ) (2026-08-01T09:51:25Z) - Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Exact Schur-Sylvester Dimensionality Reductions for Non-Smooth Stochastic Complexity and Manifold Sampling [0.0]
本稿では、シュア補数ブロックとシルヴェスターの同一性を利用してボトルネックを回避した、正確に数学的に等価な定式化を提案する。
高次元データセットのベンチマークでは,2倍精度の数値等価性を保ちながら,14,100Times$を超える一定のスピードアップを確認した。
論文 参考訳(メタデータ) (2026-06-22T19:09:25Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - High-Rate Quantized Matrix Multiplication II [29.75700570685703]
我々は, 実用的なLCM量子化アルゴリズム(GPTQ)を改良するために, 給水をどのように利用できるかを示す。
スカラーINT量子化器のみを使用する最近のスキーム(WaterSIC')を解析し、そのハイレート性能をベースフリー(つまり、$_X$の行列式を特徴とする)として示す。
論文 参考訳(メタデータ) (2026-05-13T16:47:25Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - Breaking the Sample Complexity Barrier to Regret-Optimal Model-Free
Reinforcement Learning [52.76230802067506]
漸進的強化学習における後悔を最小限に抑えるために,新しいモデルフリーアルゴリズムを提案する。
提案アルゴリズムは、2つのQ-ラーニングシーケンスの助けを借りて、初期設定された参照更新ルールを用いる。
初期の分散還元法の設計原理は、他のRL設定とは独立した関心を持つかもしれない。
論文 参考訳(メタデータ) (2021-10-09T21:13:48Z) - Breaking the Sample Size Barrier in Model-Based Reinforcement Learning
with a Generative Model [50.38446482252857]
本稿では、生成モデル(シミュレータ)へのアクセスを想定して、強化学習のサンプル効率について検討する。
最初に$gamma$-discounted infinite-horizon Markov decision process (MDPs) with state space $mathcalS$ and action space $mathcalA$を考える。
対象の精度を考慮すれば,モデルに基づく計画アルゴリズムが最小限のサンプルの複雑さを実現するのに十分であることを示す。
論文 参考訳(メタデータ) (2020-05-26T17:53:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。