論文の概要: Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws
- arxiv url: http://arxiv.org/abs/2605.21803v1
- Date: Wed, 20 May 2026 23:00:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.020061
- Title: Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws
- Title(参考訳): 同じアーキテクチャ、異なるキャパシティ:オプティマイザによるスペクトルスケーリング法則
- Authors: Nandan Kumar Jha, Brandon Reagen,
- Abstract要約: スケーリング法則は、モデルのサイズ、データ、計算から言語モデルのパフォーマンスを予測可能にするが、それらは通常、一定のトレーニング詳細として扱う。
この仮定は、FFN幅を有効活用するスペクトル容量への変換がいかに効果的かという、表現のスケーリングの基本的な軸を欠いていることを示す。
フィードフォワードネットワーク表現の固有スペクトルを用いて、ソフトおよびハードスペクトルランクを用いて測定すると、同じトランスフォーマーアーキテクチャは、異なる指数でトレーニングした場合、顕著に異なるスペクトルスケーリング法則を実現する。
- 参考スコア(独自算出の注目度): 2.8232103900765693
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling laws have made language-model performance predictable from model size, data, and compute, but they typically treat the optimizer as a fixed training detail. We show that this assumption misses a fundamental axis of representation scaling: how effectively the optimizer converts added FFN width into utilized spectral capacity. Using eigenspectra of feed-forward network representations, measured through soft and hard spectral-ranks, we find that \emph{the same Transformer architecture realizes markedly different spectral scaling laws when trained with different optimizers}. Holding architecture and width schedule fixed, AdamW exhibits weak hard-rank scaling ($β$=0.44) on rare-token (TAIL) representations where learning is known to be hardest, whereas Muon achieves linear scaling ($β$=1.02) in the same regimes, a $2.3\times$ increase in the scaling exponent. This difference is not reducible to validation loss: AdamW configurations can match low-rank Dion variants in perplexity, under extended training, while exhibiting sharply different spectral geometry, demonstrating that matched loss does not imply matched representation structure. Hard--soft rank asymmetry further reveals that optimizers differ not only in how much capacity is realized, but also in how that capacity is structured across eigenmodes. To disentangle optimizer effects from architectural ones, we compare against architectural interventions (e.g., attention rank and positional encoding), and find that optimizer-induced spectral shifts often exceed the architectural effects. These results suggest optimization as a first-class axis of representation scaling, motivating optimizer--architecture co-design.
- Abstract(参考訳): スケーリング法則は、モデルのサイズ、データ、計算から言語モデルのパフォーマンスを予測可能にするが、通常はオプティマイザを一定のトレーニング詳細として扱う。
この仮定は、最適化器が追加のFFN幅を有効にスペクトル容量に変換する方法という、表現スケーリングの基本的な軸を欠いていることを示す。
フィードフォワードネットワーク表現の固有スペクトルを用いて、ソフトおよびハードスペクトルランクを用いて測定し、異なるオプティマイザでトレーニングすると、同じトランスフォーマーアーキテクチャが著しく異なるスペクトルスケーリング法則を実現する。
アーキテクチャと幅のスケジュールを固定したAdamWは、学習が最も難しいと知られているレアトケン(TAIL)表現に対して弱いハードランクのスケーリング(β$=0.44)を示す。
アダムW構成は、拡張トレーニングの下で、低ランクのDion変種とパープレキシティで一致し、スペクトル幾何学が鋭く異なることを示し、一致した損失が表現構造に一致しないことを示す。
ハードソフトな階数非対称性は、オプティマイザがどれだけのキャパシティを実現するかだけでなく、そのキャパシティが固有モデム全体にわたってどのように構成されるかという点で、さらに異なることを明らかにしている。
アーキテクチャ的効果からオプティマイザ効果を遠ざけるために、アーキテクチャ的介入(注意ランクや位置エンコーディングなど)と比較し、オプティマイザによるスペクトルシフトがアーキテクチャ的効果を上回ることが多いことを見出す。
これらの結果から,表現スケーリングの第一級軸として最適化が提案される。
関連論文リスト
- Towards Robust Scaling Laws for Optimizers [89.21160945066737]
経験的スケーリング法則は、モデルのサイズやトレーニングデータの増加に伴って損失を予測するために広く使用されている。
本研究では, 損失分解を既約, 近似, 最適化誤差に分解した結果, チンチラ方式のスケーリング法則が自然に現れることを示す。
論文 参考訳(メタデータ) (2026-02-07T21:40:33Z) - Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales [55.91454326946738]
学習速度と減量率の最適化は,幅広い言語に対して,モデルの幅と深さでどのようにスケールするかを検討する。
我々は、$Pによる学習率のスケーリングは転送を改善するが、それでもかなりの有限幅偏差に悩まされる可能性があることを見出した。
計算-最適スケーリングでは、独立したウェイト崩壊が1/mathrmwidth$で言語間でほぼ最適であることが分かる。
論文 参考訳(メタデータ) (2025-12-05T11:03:41Z) - Symmetry-Aware Fully-Amortized Optimization with Scale Equivariant Graph Metanetworks [39.69046654861533]
ここでは,Scale Equivariant Graph Metanetworks (ScaleGMNs) が既存モデルの単一ショット微調整を可能にすることを示す。
畳み込み型ニューラルネットワークでは,マルチ層パーセプトロンよりもゲージ自由度が厳密に小さいことを示す。
我々の研究は、対称性を意識したメタネットワークが、効率的で一般化可能なニューラルネットワーク最適化のための強力なアプローチであることを示す。
論文 参考訳(メタデータ) (2025-10-09T14:51:15Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - Recursive Inference Scaling: A Winning Path to Scalable Inference in Language and Multimodal Systems [21.01887711305712]
本稿では,言語およびマルチモーダルシステムにおける推論時間をスケールするための補完的なプラグインレシピとして,Recursive Inference Scaling (RINS)を紹介した。
RINS はモバイル LLM の最近の "repeat-all-over" (RAO) 戦略など、他の55種類よりも大幅に優れている。
軽量アダプタでは、RINSは非レグレット戦略を提供するため、RINS対応プレトレーニングにより言語モデリングのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2025-02-11T12:11:40Z) - Geometric Algebra Planes: Convex Implicit Neural Volumes [70.12234371845445]
GA-Planes はスパース低ランク係数と低分解能行列と等価であることを示す。
また,GA-Planeは既存の表現にも適用可能であることを示す。
論文 参考訳(メタデータ) (2024-11-20T18:21:58Z) - Break a Lag: Triple Exponential Moving Average for Enhanced Optimization [2.0199251985015434]
本稿では,三重指数移動平均のパワーを利用する新しい最適化手法であるFAMEを紹介する。
FAMEはデータダイナミクスに対する応答性を高め、トレンド識別ラグを緩和し、学習効率を最適化する。
包括的評価は、画像分類、オブジェクト検出、セマンティックセグメンテーションを含む様々なコンピュータビジョンタスクを含み、FAMEを30の異なるアーキテクチャに統合する。
論文 参考訳(メタデータ) (2023-06-02T10:29:33Z) - Effective Invertible Arbitrary Image Rescaling [77.46732646918936]
Invertible Neural Networks (INN)は、ダウンスケーリングとアップスケーリングのサイクルを共同で最適化することにより、アップスケーリングの精度を大幅に向上させることができる。
本研究の1つのモデルのみをトレーニングすることにより、任意の画像再スケーリングを実現するために、単純で効果的な非可逆的再スケーリングネットワーク(IARN)を提案する。
LR出力の知覚品質を損なうことなく、双方向任意再スケーリングにおいて最先端(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2022-09-26T22:22:30Z) - Data Scaling Laws in NMT: The Effect of Noise and Architecture [59.767899982937756]
ニューラルネットワーク翻訳(NMT)のデータスケーリング特性に及ぼすアーキテクチャとトレーニングデータ品質の影響について検討する。
データスケーリング指数は最小限の影響を受けており、より多くのデータを追加することで、極端に悪いアーキテクチャやトレーニングデータの補償が可能になることを示唆しています。
論文 参考訳(メタデータ) (2022-02-04T06:53:49Z) - Audio Transformers [3.1972247646168523]
畳み込み層のないトランスフォーマーアーキテクチャを生音声信号に適用することを提案する。
我々のモデルは、畳み込みモデルより優れて、アート結果の状態を生成します。
畳み込みネットワークにインスパイアされたプーリングなどの手法を用いてトランスフォーマーアーキテクチャの性能をさらに向上する。
論文 参考訳(メタデータ) (2021-05-01T19:38:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。