論文の概要: Rethinking Neural Nonlinearity as Gating
- arxiv url: http://arxiv.org/abs/2607.03148v1
- Date: Fri, 03 Jul 2026 09:38:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.533524
- Title: Rethinking Neural Nonlinearity as Gating
- Title(参考訳): 神経の非線形性をゲーティングとして再考
- Abstract要約: 標準アクティベーションは、実際には単一のThreshold Gatingプリミティブのインスタンスであることを示す。
ソフトマックスに対して、同値な要素ごとのシグモイド形式による正確なTG変換が認められることを示す。
また,我々のプリミティブで必要となる枝の最小個数を一般深部ニューラルネットワークのトレーニング可能性に関連付ける「最小枝定理」も提案する。
- 参考スコア(独自算出の注目度): 0.7073210405344709
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Activation functions are considered an essential primitive for neural nonlinearity, i.e., they enable neural networks to serve as universal approximators. In this paper, we show that this nonlinearity can also be achieved by input-conditioned threshold gating through branches as a universal primitive. We demonstrate that standard activations -- whether piecewise-linear (ReLU, PReLU, Hardtanh) or smooth (SiLU, Sigmoid, Tanh, GELU) -- are in fact instances of a single Threshold Gating (TG) primitive. For softmax, we show that it admits an exact TG conversion via its equivalent per-element Sigmoid form. We then validate these equivalences by converting pretrained networks across CNNs, transformer-based models, and recurrent architectures, preserving model performance without requiring retraining. Threshold Gating also enables training from scratch that goes beyond replacing existing activations, enabling gains in model compression, performance, and shorter training. We also propose a 'Minimal Branch Theorem' which relates the minimum number of required branches in our primitive to the trainability of general deep neural networks. In terms of hardware implementation, TG maps to a unified implementation in the case of analog in-memory systems, addressing the bottleneck of analog-to-digital and digital-to-analog converters (ADC/DAC) that is known to significantly impact power consumption and on-chip area.
- Abstract(参考訳): 活性化関数は、神経の非線形性、すなわちニューラルネットワークが普遍的な近似器として機能するために必要な原始的であると考えられている。
本稿では、この非線形性は、入力条件付きしきい値ゲーティングによって、分岐を普遍的なプリミティブとして達成できることを示す。
我々は、片方向線形 (ReLU, PRELU, Hardtanh) や滑らか (SiLU, Sigmoid, Tanh, GELU) の標準活性化が、実際には単一のThreshold Gating (TG) プリミティブの例であることを示した。
ソフトマックスに対して、同値な要素ごとのシグモイド形式による正確なTG変換が認められることを示す。
次に、CNN、トランスフォーマーベースモデル、および繰り返しアーキテクチャに事前トレーニングされたネットワークを変換し、再トレーニングを必要とせずにモデル性能を保ち、これらの等価性を検証した。
Threshold Gatingはまた、既存のアクティベーションを置き換える以上のスクラッチからトレーニングを可能にし、モデル圧縮、パフォーマンス、トレーニングの短縮を可能にしている。
また,我々のプリミティブで必要となる枝の最小個数を一般深部ニューラルネットワークのトレーニング可能性に関連付ける「最小枝定理」も提案する。
ハードウェア実装に関して、TGはアナログインメモリシステムにおいて統一された実装にマッピングし、ADC/DAC(アナログ・デジタル・デジタル・アナログ・コンバータ)のボトルネックに対処する。
関連論文リスト
- Hardware-Software Co-Design of Scalable, Energy-Efficient Analog Recurrent Computations [1.1023117530294009]
環境センサーからバイオメディカルインプラントまで、常にAIアプリケーションは、超低消費電力を必要とする。
アナログ回路はサブマイクロワット推論の経路を提供するが、既存のアナログ実装はフィードフォワードアーキテクチャに限られている。
この障壁は、ハードウェアとソフトウェアの共同設計によって克服可能であることを実証する。
論文 参考訳(メタデータ) (2026-05-12T09:44:32Z) - Elastic Spiking Transformers for Efficient Gesture Understanding [6.52225846892392]
Spiking Neural Networks(SNN)は、医療アプリケーションのためのイベントベースのセンサデータのエネルギー効率の高い処理を提供する。
我々は、スパイキングパラダイムに弾力性をもたらすランタイム適応アーキテクチャであるElastic Spiking Transformerを紹介します。
CIFAR10/100, CIFAR10-DVS, EHWGesture 臨床ジェスチャー理解データセットについて検討した。
論文 参考訳(メタデータ) (2026-05-04T12:35:52Z) - Hardware-Aware Model Design and Training of Silicon-based Analog Neural Networks [33.83993649730681]
物理インフォームドハードウェア・アウェアモデルを用いてニューラルネットワークを再トレーニングすることにより、理想的なネットワークモデルの推論精度を完全に回復できることを示す。
これは、アナログニューラルネットワークの忠実性を改善するデフォルトオプションよりも、スケーラビリティと統合密度に有望である。
論文 参考訳(メタデータ) (2025-12-08T10:11:13Z) - Elastic ViTs from Pretrained Models without Retraining [74.5386166956142]
ビジョンファウンデーションモデルは優れたパフォーマンスを達成するが、事前決定されたサイズの限られたセットでしか利用できない。
本稿では, プルーニングされた視覚変換器のためのシングルショットネットワーク近似であるSnapViTを紹介する。
提案手法は,進化的アルゴリズムを用いて近似した勾配情報とクロスネットワーク構造相関を効率的に結合する。
論文 参考訳(メタデータ) (2025-10-20T16:15:03Z) - Neural Network Verification with Branch-and-Bound for General Nonlinearities [63.39918329535165]
ブランチ・アンド・バウンド(BaB)は、ニューラルネットワーク(NN)検証において最も効果的な手法の一つである。
我々は、一般的な非線形性にBaBを実行し、一般的なアーキテクチャでNNを検証する汎用フレームワークGenBaBを開発した。
我々のフレームワークは、一般的な非線形グラフの検証を可能にし、単純なNNを超えた検証アプリケーションを可能にする。
論文 参考訳(メタデータ) (2024-05-31T17:51:07Z) - Globally Optimal Training of Neural Networks with Threshold Activation
Functions [63.03759813952481]
しきい値アクティベートを伴うディープニューラルネットワークの重み劣化正規化学習問題について検討した。
ネットワークの特定の層でデータセットを破砕できる場合に、簡易な凸最適化の定式化を導出する。
論文 参考訳(メタデータ) (2023-03-06T18:59:13Z) - On Feature Learning in Neural Networks with Global Convergence
Guarantees [49.870593940818715]
勾配流(GF)を用いた広帯域ニューラルネットワーク(NN)の最適化について検討する。
入力次元がトレーニングセットのサイズ以下である場合、トレーニング損失はGFの下での線形速度で0に収束することを示す。
また、ニューラル・タンジェント・カーネル(NTK)システムとは異なり、我々の多層モデルは特徴学習を示し、NTKモデルよりも優れた一般化性能が得られることを実証的に示す。
論文 参考訳(メタデータ) (2022-04-22T15:56:43Z) - Pretraining Graph Neural Networks for few-shot Analog Circuit Modeling
and Design [68.1682448368636]
本稿では、新しい未知のトポロジや未知の予測タスクに適応可能な回路表現を学習するための教師付き事前学習手法を提案する。
異なる回路の変動位相構造に対処するため、各回路をグラフとして記述し、グラフニューラルネットワーク(GNN)を用いてノード埋め込みを学習する。
出力ノード電圧の予測における事前学習GNNは、新しい未知のトポロジや新しい回路レベル特性の予測に適応可能な学習表現を促進することができることを示す。
論文 参考訳(メタデータ) (2022-03-29T21:18:47Z) - NN-LUT: Neural Approximation of Non-Linear Operations for Efficient
Transformer Inference [9.329021390526124]
GELU、Layer normalization、Softmaxといった非線形演算は、トランスフォーマーモデルのブロックの構築には不可欠だがコストがかかる。
本稿では,効率的なトランスフォーマー推論のためのハードウェアフレンドリな近似フレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-03T23:06:57Z) - Rate Distortion Characteristic Modeling for Neural Image Compression [59.25700168404325]
エンドツーエンドの最適化機能は、ニューラルイメージ圧縮(NIC)の優れた損失圧縮性能を提供する。
異なるモデルは、R-D空間の異なる点に到達するために訓練される必要がある。
深層ネットワークと統計モデルを用いてNICのR-D挙動を記述するために,本質的な数学的関数の定式化に努めている。
論文 参考訳(メタデータ) (2021-06-24T12:23:05Z) - Training End-to-End Analog Neural Networks with Equilibrium Propagation [64.0476282000118]
本稿では,勾配降下による終端から終端までのアナログニューラルネットワークの学習法を提案する。
数学的には、アナログニューラルネットワークのクラス(非線形抵抗性ネットワークと呼ばれる)がエネルギーベースモデルであることが示される。
我々の研究は、オンチップ学習をサポートする、超高速でコンパクトで低消費電力のニューラルネットワークの新世代の開発を導くことができる。
論文 参考訳(メタデータ) (2020-06-02T23:38:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。