論文の概要: Quantization Error Is Spectrally Flat: A Single Random Probe Is a Calibrated, Data-Free Sensitivity Estimator, with Application to Budget-Targeted Mixed-Precision Quantization
- arxiv url: http://arxiv.org/abs/2609.33923v2
- Date: Tue, 29 Sep 2026 04:20:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.700431
- Title: Quantization Error Is Spectrally Flat: A Single Random Probe Is a Calibrated, Data-Free Sensitivity Estimator, with Application to Budget-Targeted Mixed-Precision Quantization
- Title(参考訳): 量子化誤差はスペクトル平らである: 単一ランダムプローブはキャリブレーションされたデータ自由感性推定器であり、予算目標混合精度量子化への応用
- Abstract要約: 単一のランダムガウスプローブは、層の量子化誤差の偏りのない推定を与える。
35B MoEと9B高密度モデルからの1,683個のテンソルを横切ると、有効次元は、同じ形状の雑音値の0.93から0.96倍になる。
1つのプローブはテンソルあたりの感度を4から7%の範囲で測定し、20個のプローブは1.3から1.4%に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: A single random Gaussian probe gives an unbiased estimate of the squared Frobenius norm of a layer's quantization error. The estimator is well-behaved because round-to-nearest error is spectrally flat. Across 1,683 tensors from a 35B MoE and a 9B dense model, effective dimensionality is 0.93 to 0.96 times the i.i.d. noise value of the same shape, and on the MoE the median is unchanged from 2-bit to 8-bit. The probe coefficient of variation is predictable from tensor shape. One probe measures per-tensor sensitivity to within 4 to 7%; twenty probes reach 1.3 to 1.4%.RAM applies the propagated form of this estimator to budget-targeted mixed-precision quantization with no calibration data. Gaussian probes carrying the network's own input statistics score every tensor at six bit-widths. A knapsack solver allocates bits under an exact byte budget, with guardrails against catastrophic 2-bit assignments. One probe pass serves any budget. Isolated and propagated scores rank tensors independently on Qwen3.5-35B-A3B (Spearman -0.01), yet the propagated probe rank-correlates 0.81 to 0.83 with the GPTQ layer objective from real activations, while the isolated estimator is uncorrelated with it. That objective is the wrong allocation target: at matched bytes on Qwen3.8-27B, a block-output probe beats a vendor IQ3_M mix and an oracle that allocates from the real-activation objective. On Qwen3-8B the propagated probe ties HAWQ-V2 at matched bytes. Across seven architectures from 8B to 122B, with probe timing up to a 400B model in nine minutes on one workstation, RAM reaches 3.5 to 13.6% lower median WikiText-2 perplexity than size-comparable uniform 4-bit builds on the tested MoE models. (Black Sheep Ai baa.ai)
- Abstract(参考訳): 単一のランダムガウスプローブは、層の量子化誤差の2乗フロベニウスノルムの偏りのない推定を与える。
ラウンド・トゥ・アネレスト誤差がスペクトル平らであるため、推定器は良好である。
35B MoEと9B高密度モデルからの1,683個のテンソルに対して、実効寸法は同一形状の雑音値の0.93から0.96倍であり、MoEでは中央値は2ビットから8ビットに変化しない。
変分プローブ係数は、テンソル形状から予測可能である。
1つのプローブはテンソルあたりの感度を4から7%の範囲で測定し、20個のプローブは1.3から1.4%に達する。
RAMは、キャリブレーションデータのない予算目標の混合精度量子化に、この推定器の伝播形式を適用している。
ネットワーク独自の入力統計を持つガウスプローブは、テンソル毎に6ビット幅でスコアする。
knapsackソルバは、破滅的な2ビット割り当てに対するガードレールを備えた、正確なバイト予算の下でビットを割り当てる。
1つのプローブパスは、いかなる予算にも役立ちます。
Qwen3.5-35B-A3B (Spearman -0.01) で独立にランクテンソルをスコアするが、プロパゲートプローブのランク相関は0.81から0.83であり、GPTQ層は実際の活性化を目標としており、孤立推定器はそれとは無関係である。
Qwen3.8-27B上の一致したバイトでは、ブロック出力プローブがベンダーIQ3_Mミックスと実際の実行目標から割り当てる託宣を破る。
Qwen3-8Bでは、伝播プローブはHAWQ-V2をマッチしたバイトで結合する。
8Bから122Bまでの7つのアーキテクチャで、1つのワークステーションで9分で400Bモデルまでプローブのタイミングが向上し、テスト対象のMoEモデルでは、サイズ比較可能な均一な4ビットビルドよりも3.5から13.6%低いWikiText-2パープレキシティに達した。
(ブラックシープアイ・バアアイ)
関連論文リスト
- Perplexity Cost Understates What Activation Quantisation Breaks [0.0]
回転ベースでの量子化は、1ブロックの介入でトークン平均3ビットで 0.001 から 0.0.980 の誘導を復元する。
Retrievalは、同じ設定で完全に回復する(0.694)。
論文 参考訳(メタデータ) (2026-09-19T16:51:05Z) - Diffusion models for eye-gaze trajectory generation using position and velocity representations [39.577682622066256]
アイトラッキングデータは収集に費用がかかり、特別なハードウェアと制御された実験室条件が必要であり、プライバシー上の制約のために共有が困難である。
本研究では2つの相補的拡散確率モデル(DDPM)を用いて、視覚探索データから視線力学を無条件に生成する。
論文 参考訳(メタデータ) (2026-09-01T07:53:11Z) - Deterministic LLM Inference Across GPU Kernels: Power-of-Two INT8 Quantization Scales and the Limits of Tolerance-Based Conformance [0.10152838128195468]
量子化されたGEMMカーネルのコンフォーマンススイートは、2つの実装が許容範囲内で一致するかどうかを問う。
5つのエピローグ断層(スケール精度、ダブルラウンド、乗算順序、出力トランケーション、融合順序)のうちの1つが、少なくとも1つのbfloat16間隔で出力を移動していることがわかった。
5つの断層のうち4つはスイートのチェック無しで検出され、5番目は2つのスケールでのみ検出される。
論文 参考訳(メタデータ) (2026-08-25T03:05:54Z) - Detecting and Discriminating Operator Misspecification in Hybrid PDE-Parameter Learning: a Reference-Free Instrument, with Discrimination Bounded In Sample [0.0]
私たちは1つのフィットから読み取る楽器を作り、オラクルは持っていません。
回復時に神経推定器がTikhonov-regularized inversionに負ける、事前登録された負の機器である、装置の盲点を報告する。
論文 参考訳(メタデータ) (2026-08-04T21:20:44Z) - Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations [5.218766876318545]
LLMのアクティベーションをトレーニングした線形プローブは、騙し検出指標としてますます提案されているが、AUROCは分布シフトの下で崩壊しながらクリーンなベンチマークで0.96を超えることを報告している。
本稿では, Gemma 3 モデルファミリ(1B-27B パラメータ)における圧力-プローブ-ベースの測定値について, 系統的に検討する。
1) 単線方向, (2) 多次元部分空間, (3) 凸円錐殻, (4) エントロピープロキシの4つの仮説を検証した。
論文 参考訳(メタデータ) (2026-05-27T04:51:55Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Statistically-Lossless Quantization of Large Language Models [41.38595517076645]
本稿では、量子化LDMにおけるロスレスの3つの相補的な概念を通して、統計的にロスレス圧縮の中間点について検討する。
第一に、タスクロスレス圧縮は、自然サンプリングのばらつきの中でゼロショットベンチマークの精度を保ち、攻撃的なビット幅で達成可能である。
第二に、分散ロスレス圧縮というより厳密な概念を定式化し、量子化モデルの次トーケン分布を、原点と事実上区別できないものにすることを要求する。
第三に、対称量子化が非対称量子化に対するガンマ二乗によるノイズ分散を膨らませることを示すガンマ二乗分散法則を証明する。
論文 参考訳(メタデータ) (2026-05-04T09:46:47Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - The case for 4-bit precision: k-bit Inference Scaling Laws [75.4335600212427]
量子化法は、モデル内の各パラメータを表すために必要なビット数を減少させる。
最終的なモデルサイズは、元のモデルのパラメータの数と圧縮率の両方に依存する。
我々は16ビットの入力とkビットのパラメータを持つ35,000以上のゼロショット実験を行い、どの量子化手法が3ビットから8ビットの精度でスケーリングを改善するかを検証した。
論文 参考訳(メタデータ) (2022-12-19T18:48:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。