論文の概要: Depth Laws for the Precision Floor of Trained Neural Networks: Amplification, Residual Scaling, and a Quantization-Aware Training Paradox
- arxiv url: http://arxiv.org/abs/2609.32060v1
- Date: Fri, 25 Sep 2026 22:48:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 03:26:05.586028
- Title: Depth Laws for the Precision Floor of Trained Neural Networks: Amplification, Residual Scaling, and a Quantization-Aware Training Paradox
- Title(参考訳): 学習ニューラルネットワークの精度床の深さ法則:増幅、残留スケーリング、量子化対応学習パラドックス
- Abstract要約: 精度フロア, レベル, ビット幅について検討し, その精度は偶然の半ばに低下する。
学習後量子化(PTQ)および雑音認識訓練(QAT)の下で、CNN、視覚変換器および9つの事前訓練言語モデルについて研究する。
QATパラドックス: ノイズ認識トレーニングは浅いネットワークのノイズをおよそ2倍にしますが、利得は深さとともに減衰するため、深さ法則は急上昇します。
- 参考スコア(独自算出の注目度): 0.7469588051458093
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How many bits does a network need before its accuracy collapses, and how does this grow with depth? We study the precision floor, the perturbation level or bit-width at which accuracy falls halfway to chance, in MLPs, CNNs, Vision Transformers and nine pretrained language models, under post-training quantization (PTQ) and quantization- or noise-aware training (QAT). (i) A first-order theory sets the floor through one full-precision quantity, the predictive amplification $G$: $η_c=Λ/G$, and $G^2$ grows linearly in depth at a rate proportional to the squared residual branch scale. (ii) The predicted equality $α_{PTQ}=ρ$ of depth exponents holds within 95% intervals in twelve of thirteen trained architectures and in GPT-2 from 12 to 48 layers, with $Λ=1.45\pm14\%$ across trained architectures. (iii) Residual branches scaled by $1/\sqrt{D}$ and pre-normalisation remove the depth penalty, and each quantizer turns noise into bits at a rate fixed by its step rule, giving $b_c=(α/γ)\log_2 D+C$. (iv) A QAT paradox: noise-aware training roughly doubles the tolerable noise of shallow networks, but the gain decays with depth, so the depth law steepens ($α_{QAT}/α_{PTQ}=1.45$-$1.47$ on two datasets, ten seeds each). Decision margins, cross-layer error cancellation and heavy tails do not set the floor.
- Abstract(参考訳): ネットワークは、その精度が崩壊する前に何ビットが必要か。
MLP、CNN、ビジョントランスフォーマー、および9つの事前訓練言語モデルにおいて、精度の高いフロア、摂動レベル、ビット幅について、後学習量子化(PTQ)および量子化・雑音認識訓練(QAT)の下で検討する。
(i)一階述語理論はフロアを1つの完全精度量で設定し、予測増幅$G$:$η_c=\/G$,$G^2$は正方分枝スケールに比例して線形に成長する。
(ii)深さ指数の予測等式$α_{PTQ}=ρ$は、訓練された13のアーキテクチャのうち、95%の間隔で、12から48のレイヤからGPT-2において、訓練されたアーキテクチャ間で$=1.45\pm14\%である。
3) 残留枝を1/\sqrt{D}$でスケールし、プレ正規化することにより深さのペナルティを除去し、各量子化器はそのステップルールによって固定されたレートでノイズをビット化し、$b_c=(α/γ)\log_2 D+C$を与える。
(4)QATパラドックス:雑音認識トレーニングは、浅層ネットワークの耐久騒音をほぼ2倍にするが、利得は深さとともに減衰するため、深さ法は2つのデータセットで11.45$-1.47$となる(α_{QAT}/α_{PTQ}=1.45$)。
決定マージン、層間エラーキャンセル、重テールは床を固定しない。
関連論文リスト
- Modeling quantum neural network gradient with reinforcement learning [0.0]
短期ハードウェア上での量子ニューラルネットワーク(QNN)のトレーニングは、2つの複合的な困難によって妨げられている。
RLQ-Gradは、古典的ポリシーがパラメータを直接更新することを学習する強化学習に基づく手法である。
最大12キュービットの回路上の勾配ベースのベースラインよりも、最大10ドル以上でトップ1の精度を向上する。
論文 参考訳(メタデータ) (2026-09-25T10:03:48Z) - Quantum amplitude estimation beyond power-of-two schedules [0.0]
非適応量子振幅推定(QAE)はGroverの深さを予め修正しているため、全ての回路が並列に動作可能である。
このギャップのほとんどは、サブスペースベースのポストプロセッシングとパワー・オブ・ツー・ディープ・ラグの2つの従来の選択に由来する。
第1の行列乗算は、推定のバッチごとに1つの行列乗算、第2の行列乗算は、比$r=1.45$の幾何学的はしごによって置き換える。
論文 参考訳(メタデータ) (2026-09-02T15:20:50Z) - DeepLoop: Depth Scaling for Looped Transformers [91.7922038545625]
ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
論文 参考訳(メタデータ) (2026-07-15T06:37:05Z) - Quantum Tunneling-Aware Machine Learning: Physics-Derived Noise Models for Robust Deployment [5.373588450790602]
量子トンネル対応機械学習(QTAML)を紹介する。
We derived the deployment-time weight-error distribution from first principles using the Wentzel-Kramers-Brillouin (WKB) approximation。
我々は,これらの構造特性を単一配置時アルゴリズムであるTunning-Aware Compensation (TAC) にパッケージ化し,閉形式平均補正と最適層予算配分を組み合わせた。
論文 参考訳(メタデータ) (2026-05-30T14:21:16Z) - Geometric Layer-wise Approximation Rates for Deep Networks [13.496991650323038]
我々は,精密なスケール依存解釈を実現する枠組みを開発する。
我々のネットワーク設計は、深度が進歩的な改善メカニズムとして機能するマルチグレードのディープラーニングにインスパイアされている。
論文 参考訳(メタデータ) (2026-04-22T06:09:20Z) - Arithmetic-Mean $μ$P for Modern Architectures: A Unified Learning-Rate Scale for CNNs and ResNets [9.94514344279733]
Arithmetic-Mean $mu$P は個々の層ではなく、ネットワーク全体の平均1ステップのプレアクティベーション第2モーメントを一定スケールに制限する。
1次元および2次元の畳み込みネットワークの場合、最大更新学習率は$etastar(L)propto L-3/2$; を満足する。
論文 参考訳(メタデータ) (2025-10-05T19:22:50Z) - Emergence and scaling laws in SGD learning of shallow neural networks [64.48316762675141]
等方性ガウスデータに基づいてP$ニューロンを持つ2層ニューラルネットワークを学習するためのオンライン勾配降下(SGD)の複雑さについて検討した。
平均二乗誤差(MSE)を最小化するために,学生2層ネットワークのトレーニングのためのSGDダイナミックスを高精度に解析する。
論文 参考訳(メタデータ) (2025-04-28T16:58:55Z) - Bayesian Inference with Deep Weakly Nonlinear Networks [57.95116787699412]
我々は,完全連結ニューラルネットワークによるベイズ推定が解けることを示す物理レベルの厳密さを示す。
我々はモデルエビデンスを計算し、任意の温度で1/N$で任意の順序に後続する手法を提供する。
論文 参考訳(メタデータ) (2024-05-26T17:08:04Z) - Bayesian Interpolation with Deep Linear Networks [92.1721532941863]
ニューラルネットワークの深さ、幅、データセットサイズがモデル品質にどう影響するかを特徴付けることは、ディープラーニング理論における中心的な問題である。
線形ネットワークが無限深度で証明可能な最適予測を行うことを示す。
また、データに依存しない先行法により、広い線形ネットワークにおけるベイズ模型の証拠は無限の深さで最大化されることを示す。
論文 参考訳(メタデータ) (2022-12-29T20:57:46Z) - Understanding Deep Neural Function Approximation in Reinforcement
Learning via $\epsilon$-Greedy Exploration [53.90873926758026]
本稿では、強化学習(RL)における深部神経機能近似の理論的研究について述べる。
我々は、Besov(およびBarron)関数空間によって与えられるディープ(および2層)ニューラルネットワークによる$epsilon$-greedy探索により、バリューベースのアルゴリズムに焦点を当てる。
我々の解析は、ある平均測度$mu$の上の$L2(mathrmdmu)$-integrable空間における時間差誤差を再構成し、非イド設定の下で一般化問題に変換する。
論文 参考訳(メタデータ) (2022-09-15T15:42:47Z) - Faster Depth-Adaptive Transformers [71.20237659479703]
深さ適応型ニューラルネットワークは入力単語の硬さに応じて動的に深さを調整することができる。
従来の作業は一般的に、計算が各レイヤで続行するか停止するかを決定するために停止ユニットを構築する。
本稿では,停止ユニットを除去し,必要な深さを事前に推定し,より高速な深度適応モデルを生成する。
論文 参考訳(メタデータ) (2020-04-27T15:08:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。