論文の概要: Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons
- arxiv url: http://arxiv.org/abs/2605.12049v1
- Date: Tue, 12 May 2026 12:29:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.856097
- Title: Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons
- Title(参考訳): 表現ニューロンのリカレントネットワークにおけるスケーリング法則とトレードオフ
- Authors: Aaron Spieler, Georg Martius, Anna Levina,
- Abstract要約: 皮質ニューロンは複雑で、マルチタイムスケールのプロセッサで、リカレント回路に接続されている。
機械学習は主に、初期のニューラルネットワーク理論から継承された、非常に単純なユニットのモデルを構築する。
本稿では,Expressive Memory (ELM) ニューロンからリカレント層を構築するEMMネットワークを紹介する。
- 参考スコア(独自算出の注目度): 27.855778669417592
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cortical neurons are complex, multi-timescale processors wired into recurrent circuits, shaped by long evolutionary pressure under stringent biological constraints. Mainstream machine learning, by contrast, predominantly builds models from extremely simple units, a default inherited from early neural-network theory. We treat this as a normative architectural question. How should one split a fixed parameter budget $P$ between the number of units $N$, per-unit effective complexity $k_e$, and per-unit connectivity $k_c$? What controls the optimal allocation? This calls for a model in which per-unit complexity can be tuned independently of width and connectivity. Accordingly, we introduce the ELM Network, whose recurrent layer is built from Expressive Leaky Memory (ELM) neurons, chosen to mirror functional components of cortical neurons. The architecture allows for individually adjusting $N$, $k_e$, and $k_c$ and trains stably across orders of magnitude in scale. We evaluate the model on two qualitatively different sequence benchmarks: the neuromorphic SHD-Adding task and Enwik8 character-level language modeling. Performance improves monotonically along each of the three axes individually. Under a fixed budget, a clear non-trivial optimum emerges in their tradeoff, and larger budgets favor both more and more complex neurons. A closed-form information-theoretic model captures these tradeoffs and attributes the diminishing returns at two ends to: per-neuron signal-to-noise saturation and across-neuron redundancy. A hyperparameter sweep spanning three orders of magnitude in trainable parameters traces a near-Pareto-frontier scaling law consistent with the framework. This suggests that the simple-unit default in ML is not obviously optimal once this tradeoff surface is probed, and offers a normative lens on cortex's reliance on complex spatio-temporal integrators.
- Abstract(参考訳): 皮質ニューロンは複雑でマルチタイムスケールのプロセッサで、長い進化的な圧力で形づくられる。
対照的に、主流の機械学習は、非常に単純なユニットからモデルを構築する。
私たちはこれを規範的なアーキテクチャ上の問題として扱います。
固定パラメータ予算$P$をユニット単位数$N$、ユニット単位の有効複雑性$k_e$、ユニット単位の接続コスト$k_c$に分割するにはどうすればよいか?
最適な割り当てを制御するものは何か?
これは、ユニット単位の複雑さを幅と接続性から独立して調整できるモデルを要求する。
そこで我々は,脳皮質ニューロンの機能成分を反映するために選択されたExpressive Leaky Memory (ELM) ニューロンから再帰層を構築するEMMネットワークを紹介した。
このアーキテクチャでは、個別に$N$、$k_e$、$k_c$を調整でき、スケールで安定して列車を走らせることができる。
我々は、ニューロモルフィックSHD-AddingタスクとEnwik8文字レベル言語モデリングという、2つの定性的に異なるシーケンスベンチマークでモデルを評価する。
性能は3つの軸ごとに単調に向上する。
一定の予算の下では、明確な非自明な最適条件がトレードオフに現れ、より大きな予算はより複雑なニューロンを好んでいる。
閉形式情報理論モデルでは、これらのトレードオフを捕捉し、2つの端で減少するリターンを、2つの端に属性付けている。
トレーニング可能なパラメータの3桁にまたがるハイパーパラメータスイープは、フレームワークと一致したほぼパレトフロンティアスケーリング法則を辿る。
これは、MLにおける単純な単位のデフォルトは、このトレードオフ面が探索されると明らかに最適ではないことを示唆し、複雑な時空間積分器に依存する皮質に規範的なレンズを提供する。
関連論文リスト
- Randomized based restricted kernel machine for hyperspectral image classification [0.0]
ランダムベクトル汎関数リンク(RVFL)ネットワークは、ハイパースペクトル画像(HSI)分類において大きな人気を得ている。
RVFLモデルは、特に非線形関係や複雑なデータ構造を扱う際に、いくつかの制限に直面している。
本稿では,RVFLと制限されたカーネルマシンを併用した,ランダム化された制限されたカーネルマシン(R2KM$)モデルを提案する。
論文 参考訳(メタデータ) (2025-03-06T17:18:39Z) - A Theory of Synaptic Neural Balance: From Local to Global Order [6.136957611263998]
我々は、シナプス的神経バランスの理論を開発し、それをニューラルネットワークでどのように生み出すか、強制するかを考察する。
与えられた正規化器の場合、入力重みの総コストが出力重みの総コストと等しい場合、ニューロンは平衡にあると言われる。
論文 参考訳(メタデータ) (2024-05-15T20:27:56Z) - Kronecker-Factored Approximate Curvature for Modern Neural Network
Architectures [85.76673783330334]
線形重み付け層の2つの異なる設定がクロネッカー型近似曲率(K-FAC)の2つの風味を動機付けている
重み付けをそれぞれ設定したディープ・リニア・ネットワークに対して正確であることを示す。
グラフニューラルネットワークと視覚変換器の両方をトレーニングするために、これらの2つのK-FACの違いをほとんど観測しない。
論文 参考訳(メタデータ) (2023-11-01T16:37:00Z) - The Expressive Leaky Memory Neuron: an Efficient and Expressive Phenomenological Neuron Model Can Solve Long-Horizon Tasks [64.08042492426992]
本稿では,脳皮質ニューロンの生物学的モデルであるExpressive Memory(ELM)ニューロンモデルを紹介する。
ELMニューロンは、上記の入力-出力関係を1万以下のトレーニング可能なパラメータと正確に一致させることができる。
本稿では,Long Range Arena(LRA)データセットなど,時間構造を必要とするタスクで評価する。
論文 参考訳(メタデータ) (2023-06-14T13:34:13Z) - Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language
Understanding [82.46024259137823]
幅広いタスクに対するクロスモデル比較損失を提案する。
3つの異なるNLUタスクから14のデータセットに対する広範な実験により比較損失の普遍的有効性を示す。
論文 参考訳(メタデータ) (2023-01-10T03:04:27Z) - Neural Stochastic Partial Differential Equations [1.2183405753834562]
物理に着想を得たニューラルアーキテクチャの2つの重要なクラスの拡張を提供するニューラルSPDEモデルを導入する。
一方、一般的な神経-通常、制御され、粗い-微分方程式モデルをすべて拡張し、入ってくる情報を処理することができる。
一方、関数空間間のマッピングをモデル化するニューラルネットワークの最近の一般化であるNeural Operatorsを拡張して、複雑なSPDEソリューション演算子を学習することができる。
論文 参考訳(メタデータ) (2021-10-19T20:35:37Z) - The Separation Capacity of Random Neural Networks [78.25060223808936]
標準ガウス重みと一様分布バイアスを持つ十分に大きな2層ReLUネットワークは、この問題を高い確率で解くことができることを示す。
我々は、相互複雑性という新しい概念の観点から、データの関連構造を定量化する。
論文 参考訳(メタデータ) (2021-07-31T10:25:26Z) - Fundamental tradeoffs between memorization and robustness in random
features and neural tangent regimes [15.76663241036412]
モデルがトレーニングのごく一部を記憶している場合、そのソボレフ・セミノルムは低い有界であることを示す。
実験によって初めて、(iv)ミンノルム補間器の堅牢性における多重発色現象が明らかになった。
論文 参考訳(メタデータ) (2021-06-04T17:52:50Z) - Measuring Model Complexity of Neural Networks with Curve Activation
Functions [100.98319505253797]
本稿では,線形近似ニューラルネットワーク(LANN)を提案する。
ニューラルネットワークのトレーニングプロセスを実験的に検討し、オーバーフィッティングを検出する。
我々は、$L1$と$L2$正規化がモデルの複雑さの増加を抑制することを発見した。
論文 参考訳(メタデータ) (2020-06-16T07:38:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。