論文の概要: Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks
- arxiv url: http://arxiv.org/abs/2606.29176v1
- Date: Sun, 28 Jun 2026 03:44:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.823201
- Title: Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks
- Title(参考訳): デッドダイレクトコンディショナー:ディープネットワークのためのゲージ等価プリコンディショニング
- Authors: Tejas Pradeep Shirodkar,
- Abstract要約: ディープネットワークの損失はそのパラメータの連続対称性に不変である。
我々は、$G$-不変距離の軌道分解を条件付けるデッド・ディビジョン・コンディショナーであるDDCを構築する。
適合点を越えて訓練された言語モデルでは、DDCAdamはAdamWの過度のトレーニング崩壊に抵抗し、5.88に対して0.67のトレーニング損失ギャップを保持し、65層中32層でデッドダイレクト率を読み取る。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A deep network's loss is invariant to continuous symmetries of its parameters: the logit shift, the ReLU rescaling, the LayerNorm scale, the per-head attention rotation. Adam's per-coordinate preconditioner drifts along each symmetry orbit, which pulls the trajectory off the symmetry quotient where the optimization lives and blurs the singular-learning rate the quotient makes readable. We build DDC, a Dead-Direction Conditioner that lifts a base optimizer into a $G$-equivariant one: it conditions the optimizer's state in the orbit decomposition of a $G$-invariant metric, so the trajectory stays a preconditioned gradient flow on the quotient $\barΘ= Θ/G$. The construction carries four architectural gauges (cross-entropy shift, ReLU and SwiGLU rescaling, LayerNorm and RMSNorm scale, and a per-head $O(d_{\rm head})$ attention rotation matched to RoPE), proves exactly equivariant on an Adam base, and composes with a Muon base through a gauge-equivariant orthogonaliser. Respecting the symmetry changes both the minimum the optimizer reaches and what it leaves measurable there. On a language model trained past the point of fit, DDCAdam resists the over-training collapse AdamW falls into, holding a validation-train loss gap of 0.67 against 5.88, and reads the dead-direction rate in 32 of 65 layer-by-observable cells where AdamW reads it in 7. A vision transformer trained from scratch reaches lower validation loss (1.71 against 2.12) while compressing spare feed-forward capacity a matched AdamW leaves intact. On a Muon base, where the rotation gauge composes exactly, DDCMuon groks ten of eleven seeds at depth 24 that a plain Muon never reaches. Built into the optimizer, a network's gauge symmetry sharpens the minimum it finds and turns that minimum's geometry into something the trajectory can measure.
- Abstract(参考訳): ディープ・ネットワークの損失は、ロジットシフト、ReLU再スケーリング、LayerNormスケール、ヘッド・アテンション・ローテーションといったパラメータの連続した対称性に不変である。
アダムの調整されたプレコンディショナーは各対称性の軌道に沿ってドリフトし、最適化が居住する対称性の商から軌道を引き出し、商が読み取る特異学習率を曖昧にする。
DDCは、ベースオプティマイザを$G$-等変量に引き上げるデッド・ディレクション・コンディショナーで、$G$-不変計量の軌道分解におけるオプティマイザの状態を条件にしているので、トラジェクトリは、商 $\bar'= s/G$ 上で事前条件付き勾配の流れを保っている。
この構成には4つのアーキテクチャゲージ(クロスエントロピーシフト、ReLUとSwiGLUの再スケーリング、LayerNormとRMSNormスケール、および1ヘッド当たりの$O(d_{\rm head})$アテンションローテーションがRoPEと一致する)があり、Adamベース上で正確に同変であることを証明し、ゲージ同変直交器を通じてミューオンベースを構成する。
対称性を尊重すると、オプティマイザが到達する最小値と、そこで測定可能なものの両方が変化する。
適合点を越えて訓練された言語モデル上で、DDCAdamはAdamWの過度なトレーニング崩壊に抵抗し、AdamWは0.67と5.88のバリデーション-トレイン損失ギャップを保持し、65層中32層でデッドダイレクトレートを読み、AdamWは7で読み取る。
スクラッチから訓練された視覚変換器は、AdamWの葉にマッチした予備給電容量を圧縮しながら、低い検証損失(1.71対2.12)に達する。
回転ゲージが正確に構成されるムーンベースでは、DDCMuonは、平らなムーンが到達しない深さ24で11個の種のうち10個を収穫する。
オープティマイザに組み込まれたネットワークのゲージ対称性は、探す最小限を鋭くし、最小限の幾何学を軌跡が測定できるものに変える。
関連論文リスト
- Dead-Direction Signatures: A Cheap Spectral Reading of Singular Complexity [5.67642958049511]
特異学習理論は、損失特異点の幾何学を通して深いネットワークの複雑さを特徴づける。
単体構造をもつ安価でクローズドなスペクトル読影器であるDeadDirection Signatures (DDS)を紹介する。
それぞれが選択された層でネットワークの活性化行列またはサンプル単位のフィッシャーグラムを読み、後鎖スペクトル線型代数を置き換える。
論文 参考訳(メタデータ) (2026-06-19T06:49:09Z) - Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale [5.67642958049511]
層ノルムアフィンの逆スケールの$-1/|-1|$は、終末ノルム中心の活性化共分散の正確な核である。
LNスケールパラメータのみから読み出され、前方または後方のパスがなく、固有解がない。
論文 参考訳(メタデータ) (2026-06-17T18:28:37Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Directional Consistency as a Complementary Optimization Signal: The GONO Framework [0.0]
我々は、深層学習最適化における未探索現象を定式化し、指向性アライメントと損失収束を分離することができる。
本稿では,方向整合性の下でモーメントを増幅し,振動中にそれを抑圧する cc_t に基づいて,Adam の運動量ベータを適応させる GONO を紹介する。
我々は、GONOがAdamの収束率と一致することを証明し、信号が非形式的であるとき、正確にAdamに還元する。
論文 参考訳(メタデータ) (2026-05-07T17:05:05Z) - Spectral Edge Dynamics of Training Trajectories: Signal--Noise Geometry Across Scales [0.0]
コンヒーレントな方向のみにおいてトランスフォーマー訓練軌道が発展することを示す。
共同作業では、同じスペクトル幾何学がグラッキングの早期警戒信号を提供する。
論文 参考訳(メタデータ) (2026-03-14T04:46:05Z) - MuonBP: Faster Muon via Block-Periodic Orthogonalization [24.232069944820513]
ベースラインからMuonBPへの学習率の調整方法を示し、このアルゴリズムの保証を与える。
8方向テンソルテンソルとZeROによる8Bモデルのトレーニングでは、ムオンBPは8%のムオンを達成でき、性能は劣化しない。
論文 参考訳(メタデータ) (2025-10-19T19:56:05Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion [55.95767828747407]
分子やタンパク質の生成のようなドメインでは、物理系はモデルにとって重要な固有の対称性を示す。
学習のばらつきを低減し、確率的に低い分散勾配推定器を提供するフレームワークを提案する。
また,軌道拡散法(Orbit Diffusion)と呼ばれる手法を用いて,損失とサンプリングの手順を取り入れた推定器の実用的実装を提案する。
論文 参考訳(メタデータ) (2025-02-14T03:26:57Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。