論文の概要: How Bregman Divergences Shape Shampoo
- arxiv url: http://arxiv.org/abs/2610.08534v1
- Date: Tue, 06 Oct 2026 15:25:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.081087
- Title: How Bregman Divergences Shape Shampoo
- Title(参考訳): ブレグマンがシャンプーの形状を分かち合う方法
- Abstract要約: 我々は、一般的なすべての分岐を接続する統合されたブレグマン分岐フレームワークを開発し、それらを共同で研究することができる。
いくつかの発散は、経験的第二モーメントの有限サンプル過小評価をよりよく補うことができ、対応するシャンプー不変量の異なる振る舞いを説明するのに役立つ。
- 参考スコア(独自算出の注目度): 22.067344056950443
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding the principles behind Shampoo has recently guided the development of more effective neural network optimizers. These methods learn a preconditioner by optimizing the Frobenius or Kullback-Leibler (KL) divergence against the gradient second moment. In this work, we investigate how the choice of divergence shapes preconditioning, which remains unclear and blocks further improvements. To do so, we develop a unified Bregman divergence framework that connects all popular divergences, allowing us to study them jointly. Through empirical spectral analysis of gradient second moments, we examine how divergence choice shapes Kronecker approximation and interacts with finite-sample error in preconditioning. We find that some divergences can better compensate for finite-sample underestimation of the empirical second moment, helping explain the differing behavior of their corresponding Shampoo variants. We further validate this explanation through GPT-2 pretraining experiments. By connecting divergence choice to practical training behavior, we believe our framework provides principled guidance for understanding the foundations of, and further improving, Shampoo.
- Abstract(参考訳): Shampooの背後にある原則を理解することは、最近より効果的なニューラルネットワークオプティマイザの開発をガイドした。
これらの方法は、勾配第二モーメントに対してフロベニウスあるいはクルバック・リーブラー(KL)の発散を最適化することでプレコンディショナーを学習する。
本研究では, 分岐形状の選択が未定であり, さらなる改善を阻害する要因として, 分岐形状の選択について検討する。
そのために、一般的なすべての分岐を接続する統合されたブレグマン分岐フレームワークを開発し、それらを共同で研究する。
勾配第二モーメントの実験的スペクトル分析を通じて, 偏差選択がクロネッカー近似をどのように形成し, プリコンディショニングにおける有限サンプル誤差と相互作用するかを検討する。
いくつかの発散は、経験的第二モーメントの有限サンプル過小評価をよりよく補うことができ、対応するシャンプー不変量の異なる振る舞いを説明するのに役立つ。
我々はこの説明を GPT-2 プレトレーニング実験を通じて検証する。
分散選択を実践的なトレーニング行動に結びつけることで、私たちのフレームワークは、シャンプーの基礎を理解し、さらに改善するための原則化されたガイダンスを提供すると信じています。
関連論文リスト
- Exact closed-form Gaussian moments of residual layers [0.0]
本研究では,モンテカルロの基底的真理からKLの偏差を,最先端の決定論的推論法により100倍に改善することを示す。
また、最近注目されているフィードフォワードニューロンの事前誤差境界と予備解析も与えている。
論文 参考訳(メタデータ) (2026-01-29T20:47:55Z) - Training-Free Stein Diffusion Guidance: Posterior Correction for Sampling Beyond High-Density Regions [46.59494117137471]
自由拡散誘導の訓練は、追加の訓練なしに既成の分類器を活用する柔軟な方法を提供する。
本稿では,SOC を対象とする新たなトレーニングフリーフレームワークである Stein Diffusion Guidance (SDG) を紹介する。
分子低密度サンプリングタスクの実験は、SDGが標準のトレーニングフリーガイダンス手法を一貫して上回っていることを示唆している。
論文 参考訳(メタデータ) (2025-07-07T21:14:27Z) - How Transformers Learn In-Context Recall Tasks? Optimality, Training Dynamics and Generalization [23.759737527800585]
コンテクスト内リコールタスクで訓練された変換器の近似能力,収束速度,収束挙動について検討した。
トレーニングされたトランスフォーマーは,分布外分布の一般化,すなわち人口分布外のサンプルへの一般化を示す。
論文 参考訳(メタデータ) (2025-05-21T01:26:44Z) - A New Formulation of Lipschitz Constrained With Functional Gradient Learning for GANs [52.55025869932486]
本稿では,大規模データセット上でGAN(Generative Adversarial Networks)のトレーニングを行うための有望な代替手法を提案する。
本稿では,GANの学習を安定させるために,Lipschitz-Constrained Functional Gradient GANs Learning (Li-CFG)法を提案する。
判別器勾配のノルムを増大させることにより、潜在ベクトルの近傍サイズを小さくすることができることを示す。
論文 参考訳(メタデータ) (2025-01-20T02:48:07Z) - Variational Inference of overparameterized Bayesian Neural Networks: a
theoretical and empirical study [27.86555142135798]
本稿では,ベイズニューラルネットワーク(BNN)のトレーニングに用いる変分推論(VI)について検討する。
平均フィールドVIトレーニングにおける重要な課題を指摘する。
この問題は、エビデンス(ELBO)の下位境界を2項に分解することから生じる。
論文 参考訳(メタデータ) (2022-07-08T12:31:08Z) - Variational Refinement for Importance Sampling Using the Forward
Kullback-Leibler Divergence [77.06203118175335]
変分推論(VI)はベイズ推論における正確なサンプリングの代替として人気がある。
重要度サンプリング(IS)は、ベイズ近似推論手順の推定を微調整し、偏りを逸脱するためにしばしば用いられる。
近似ベイズ推論のための最適化手法とサンプリング手法の新たな組み合わせを提案する。
論文 参考訳(メタデータ) (2021-06-30T11:00:24Z) - Loss function based second-order Jensen inequality and its application
to particle variational inference [112.58907653042317]
粒子変分推論(PVI)は、後部分布の実験的近似としてモデルのアンサンブルを用いる。
PVIは、最適化されたモデルの多様性を保証するために、各モデルを反発力で反復的に更新する。
我々は,新たな一般化誤差を導出し,モデルの多様性を高めて低減できることを示す。
論文 参考訳(メタデータ) (2021-06-09T12:13:51Z) - Critical Parameters for Scalable Distributed Learning with Large Batches
and Asynchronous Updates [67.19481956584465]
飽和を伴う分散トレーニング(SGD)の効率は、バッチサイズと、実装における停滞に決定的に依存することが実験的に観察されている。
結果がタイトであることを示し、数値実験で重要な結果を示しています。
論文 参考訳(メタデータ) (2021-03-03T12:08:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。