論文の概要: Unified Neural Scaling Laws
- arxiv url: http://arxiv.org/abs/2605.26248v1
- Date: Mon, 25 May 2026 18:15:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.31067
- Title: Unified Neural Scaling Laws
- Title(参考訳): 統一型ニューラルスケーリング法則
- Abstract要約: 本稿では,ディープニューラルネットワークのスケーリング動作を正確にモデル化し,外挿する機能形式を提案する。
このセットには、大規模ビジョン、言語、数学、強化学習が含まれる。
- 参考スコア(独自算出の注目度): 25.998188481650534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a functional form (that we refer to as a Unified Neural Scaling Law (UNSL)) that accurately models and extrapolates the scaling behaviors of deep neural networks as multiple dimensions all vary simultaneously (i.e. how the evaluation metric of interest varies as one simultaneously varies the number of model parameters, training dataset size, number of training steps, number of inference steps, amount of compute, and various hyperparameters) for various architectures and for each of various tasks within a varied set of upstream and downstream tasks. This set includes large-scale vision, language, math, and reinforcement learning. When compared to other functional forms for neural scaling, this functional form yields extrapolations of scaling behavior that are considerably more accurate on this set.
- Abstract(参考訳): 本稿では, 深層ニューラルネットワークのスケーリング挙動を複数の次元で正確にモデル化し外挿する機能形式(UNSL)を提案する。例えば, モデルパラメータ数, トレーニングデータセットサイズ, トレーニングステップ数, 推論ステップ数, 計算量, 各種ハイパーパラメータ)を, 上流タスクと下流タスクの様々なセット内において, それぞれ同時に変化する。
このセットには、大規模ビジョン、言語、数学、強化学習が含まれる。
ニューラルスケーリングの他の機能形式と比較すると、この関数形式は、この集合においてかなり正確なスケーリングの振る舞いの補間をもたらす。
関連論文リスト
- Neural Approximation and Its Applications [73.11802084858294]
トレーニングされていないニューラルネットワークをベース関数として活用することにより、ニューラルネットワークの基盤関数を導入する。
多変量関数近似のための神経近似(NeuApprox)パラダイムを提案する。
多様な多次元画像、光フィールドデータ、ビデオ、トラフィックデータ、ポイントクラウドデータの実験は、NeuApproxの有望な性能を示している。
論文 参考訳(メタデータ) (2026-03-04T06:05:43Z) - Transferable Post-training via Inverse Value Learning [83.75002867411263]
別個のニューラルネットワーク(すなわち値ネットワーク)を用いた後学習におけるロジットレベルのモデリング変更を提案する。
このネットワークをデモを使って小さなベースモデルでトレーニングした後、推論中に他のトレーニング済みモデルとシームレスに統合することができる。
得られた値ネットワークは、パラメータサイズの異なる事前学習されたモデル間で広い転送性を有することを示す。
論文 参考訳(メタデータ) (2024-10-28T13:48:43Z) - Deep Neural Networks are Adaptive to Function Regularity and Data Distribution in Approximation and Estimation [8.284464143581546]
深層ニューラルネットワークが、異なる位置とスケールにわたる関数の異なる規則性にどのように適応するかを研究する。
この結果から,深部ニューラルネットワークは関数の正則性や不均一なデータ分布に適応していることが示唆された。
論文 参考訳(メタデータ) (2024-06-08T02:01:50Z) - An exactly solvable model for emergence and scaling laws in the multitask sparse parity problem [2.598133279943607]
本稿では,新たな能力(スキル)を基礎関数として表現するフレームワークを提案する。
新たなスキルの出現と、トレーニング時間、データサイズ、モデルサイズ、最適計算による損失の法則のスケーリングに関する分析式を見つける。
私たちの単純なモデルでは、単一の適合パラメータを使用して、トレーニング時間、データサイズ、モデルサイズが増大するにつれて、複数の新しいスキルのシグモダルな出現を捉えます。
論文 参考訳(メタデータ) (2024-04-26T17:45:32Z) - A Dynamical Model of Neural Scaling Laws [79.59705237659547]
ネットワークトレーニングと一般化の解決可能なモデルとして,勾配降下で訓練されたランダムな特徴モデルを分析する。
我々の理論は、データの繰り返し再利用により、トレーニングとテスト損失のギャップが徐々に増大することを示している。
論文 参考訳(メタデータ) (2024-02-02T01:41:38Z) - Latent State Models of Training Dynamics [51.88132043461152]
異なるランダムなシードでモデルをトレーニングし、トレーニングを通じてさまざまなメトリクスを計算します。
次に、結果のメトリクス列に隠れマルコフモデル(HMM)を適合させる。
我々はHMM表現を用いて相転移を研究し、収束を遅くする潜伏状態(detour state)を特定する。
論文 参考訳(メタデータ) (2023-08-18T13:20:08Z) - A Solvable Model of Neural Scaling Laws [72.8349503901712]
大量のパラメータを持つ大規模な言語モデルは、インターネットに近い数のトークンで訓練されると、ニューラルネットワークのスケーリング法則に従うことが実証的に示されている。
我々は,このニューラルスケーリング現象を捉える統計モデル(共同生成データモデルとランダム特徴モデル)を提案する。
主な発見は、自然データセットの統計に現れる電力法則が非線形ランダムな特徴写像によって拡張される方法である。
論文 参考訳(メタデータ) (2022-10-30T15:13:18Z) - Broken Neural Scaling Laws [9.020652910657931]
ブロークニューラルスケーリング法(BNSL)は、ディープニューラルネットワークのスケーリング挙動を正確にモデル化し、外挿する。
このセットには、大規模ビジョン、言語、オーディオ、ビデオ、拡散、生成モデリング、マルチモーダル学習、コントラスト学習、AIアライメント、ロボット工学、アウト・オブ・ディストリビューション(OOD)一般化が含まれる。
論文 参考訳(メタデータ) (2022-10-26T17:45:01Z) - Explaining Neural Scaling Laws [17.115592382420626]
訓練されたディープニューラルネットワークの人口減少は、しばしば正確なパワー-ロースケーリング関係に従う。
本稿では、これらのスケーリング法則の起源を説明し、接続する理論を提案する。
データセットとモデルサイズの両方に対する分散制限と分解能制限のスケーリング挙動を同定する。
論文 参考訳(メタデータ) (2021-02-12T18:57:46Z) - A Functional Perspective on Learning Symmetric Functions with Neural
Networks [48.80300074254758]
本研究では,測定値に基づいて定義されたニューラルネットワークの学習と表現について検討する。
正規化の異なる選択の下で近似と一般化境界を確立する。
得られたモデルは効率よく学習でき、入力サイズにまたがる一般化保証を享受できる。
論文 参考訳(メタデータ) (2020-08-16T16:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。