論文の概要: λ-GELU: Learning Gating Hardness for Controlled ReLU-ization in Deep Networks
- arxiv url: http://arxiv.org/abs/2603.21991v1
- Date: Mon, 23 Mar 2026 13:58:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.698782
- Title: λ-GELU: Learning Gating Hardness for Controlled ReLU-ization in Deep Networks
- Title(参考訳): λ-GELU:ディープネットワークにおける制御されたReLU化のためのゲーティングハードネスの学習
- Authors: Cristian Pérez-Corral, Alberto Fernández-Hernández, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí,
- Abstract要約: Gaussian Error Linear Unit (GELU) はRectifier Linear Unit (ReLU) のスムーズな代替品として広く使われている。
-GELUは、ゲーティングの硬さをプロファイルし制御するための最小限の解釈可能なノブを提供する。
全体として、 -GELUは、ゲーティングの硬さをプロファイルし制御するための最小限の、解釈可能なノブを提供し、ReLU中心の下流パイプラインによるスムーズなトレーニングをブリッジする。
- 参考スコア(独自算出の注目度): 1.1145952934885128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Gaussian Error Linear Unit (GELU) is a widely used smooth alternative to Rectifier Linear Unit (ReLU), yet many deployment, compression, and analysis toolchains are most naturally expressed for piecewise-linear (ReLU-type) networks. We study a hardness-parameterized formulation of GELU, f(x;λ)=xΦ(λ x), where Φ is the Gaussian CDF and λ \in [1, infty) controls gate sharpness, with the goal of turning smooth gated training into a controlled path toward ReLU-compatible models. Learning λ is non-trivial: naive updates yield unstable dynamics and effective gradient attenuation, so we introduce a constrained reparameterization and an optimizer-aware update scheme. Empirically, across a diverse set of model--dataset pairs spanning MLPs, CNNs, and Transformers, we observe structured layerwise hardness profiles and assess their robustness under different initializations. We further study a deterministic ReLU-ization strategy in which the learned gates are progressively hardened toward a principled target, enabling a post-training substitution of λ-GELU by ReLU with reduced disruption. Overall, λ-GELU provides a minimal and interpretable knob to profile and control gating hardness, bridging smooth training with ReLU-centric downstream pipelines.
- Abstract(参考訳): Gaussian Error Linear Unit (GELU) はRectifier Linear Unit (ReLU) のスムーズな代替品として広く使われているが、多くの配置、圧縮、分析ツールチェーンは、ReLUタイプのネットワークに対して最も自然に表現されている。
GELU, f(x;λ)=x'(λ x) の硬度パラメタライズド定式化について検討し、ここでは λ はガウス CDF であり、λ \in [1, infty) は門のシャープネスを制御し、滑らかなゲートトレーニングを ReLU 互換モデルへの制御経路に変換する。
λ の学習は簡単ではない: ナイーブ更新は不安定なダイナミクスと効果的な勾配減衰をもたらすので、制約付き再パラメータ化とオプティマイザ対応更新スキームを導入する。
実験では,MLP,CNN,トランスフォーマーにまたがる多種多様なモデルデータセットのペアに対して,構造的層状硬さプロファイルを観察し,その頑健さを異なる初期化の下で評価する。
さらに、学習ゲートを原則的目標に向けて徐々に硬化させ、ReLUによるλ-GELUの学習後置換を可能にする決定論的ReLU化戦略について検討する。
全体として、λ-GELUは最小限かつ解釈可能なノブを提供し、ゲーティングの硬さをプロファイリングし制御し、ReLU中心の下流パイプラインでスムーズなトレーニングを行う。
関連論文リスト
- IGLU: The Integrated Gaussian Linear Unit Activation Function [13.305282275999778]
半正規混合分布の下でGELUゲートのスケール混合として導出されるパラメトリック活性化関数IGLUを導入する。
IGLUは、ReLUとGELUのベースラインに対して、視覚と言語データセットの両方において、競争力または優れた性能を達成することを示す。
論文 参考訳(メタデータ) (2026-03-06T20:28:08Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - A Simplified Analysis of SGD for Linear Regression with Weight Averaging [64.2393952273612]
最近の研究は、定常学習率を用いた線形回帰におけるSGD最適化のためのシャープレートを提供する。
簡単な線形代数ツールを用いて,2021ベニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグニグニグニグニグニグネグニグニグニグニグネグニグニグネグニ
我々の研究は線形回帰の勾配勾配を非常に容易に解析し、ミニバッチと学習率のスケジューリングのさらなる分析に役立てることができると信じている。
論文 参考訳(メタデータ) (2025-06-18T15:10:38Z) - ReLU's Revival: On the Entropic Overload in Normalization-Free Large Language Models [3.7802450241986945]
LayerNormは、トレーニングの安定化とスムーズな最適化を保証するため、現代の大規模言語モデル(LLM)において重要なコンポーネントである。
本研究は、正規化自由デコーダのみのLLMにおける望ましいアクティベーション関数について検討する。
ReLUは、LayerNormフリーモデルでGELUを著しく上回り、bf 8.2%のパープレキシティ改善をもたらした。
論文 参考訳(メタデータ) (2024-10-12T20:26:01Z) - Fixing the NTK: From Neural Network Linearizations to Exact Convex
Programs [63.768739279562105]
学習目標に依存しない特定のマスクウェイトを選択する場合、このカーネルはトレーニングデータ上のゲートReLUネットワークのNTKと等価であることを示す。
この目標への依存の欠如の結果として、NTKはトレーニングセット上の最適MKLカーネルよりもパフォーマンスが良くない。
論文 参考訳(メタデータ) (2023-09-26T17:42:52Z) - Optimal Sets and Solution Paths of ReLU Networks [56.40911684005949]
最適なReLUネットワークの集合を特徴付ける分析フレームワークを開発した。
我々は、ReLUネットワークのニューラル化を継続する条件を確立し、ReLUネットワークに対する感度結果を開発する。
論文 参考訳(メタデータ) (2023-05-31T18:48:16Z) - Fast Convex Optimization for Two-Layer ReLU Networks: Equivalent Model Classes and Cone Decompositions [47.276004075767176]
ReLUアクティベーション機能を持つ2層ニューラルネットワークの凸最適化のためのソフトウェアを開発した。
本稿では,凸ゲート型ReLUモデルにおいて,ReLUトレーニング問題に対するデータ依存アルゴリズムが得られたことを示す。
論文 参考訳(メタデータ) (2022-02-02T23:50:53Z) - Adaptive Control and Regret Minimization in Linear Quadratic Gaussian
(LQG) Setting [91.43582419264763]
我々は不確実性に直面した楽観主義の原理に基づく新しい強化学習アルゴリズムLqgOptを提案する。
LqgOptはシステムのダイナミクスを効率的に探索し、モデルのパラメータを信頼区間まで推定し、最も楽観的なモデルのコントローラをデプロイする。
論文 参考訳(メタデータ) (2020-03-12T19:56:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。