論文の概要: Large Language Model-Guided Evolutionary Discovery of Native Neural Architectures for Spiking Sequence Modeling
- arxiv url: http://arxiv.org/abs/2609.40258v1
- Date: Wed, 30 Sep 2026 17:41:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.204804
- Title: Large Language Model-Guided Evolutionary Discovery of Native Neural Architectures for Spiking Sequence Modeling
- Title(参考訳): スパイクシーケンスモデリングのための大規模言語モデルに基づくネイティブニューラルネットワークの進化的発見
- Abstract要約: スパイキングニューラルネットワーク(SNN)は、スパース、イベント駆動計算による低エネルギーシーケンスモデリングを提供する。
既存のSNNシーケンスモデルは、しばしば実数値アクティベーションのために設計された人工知能ニューラルネットワーク(ANN)アーキテクチャを適用する。
本稿では,大規模言語モデル(LLM)を用いたオープンプログラム空間における実行可能アーキテクチャコードをスパイク・プロジェクション制約下で進化させるOpenArchEvoを紹介する。
- 参考スコア(独自算出の注目度): 24.029406641787926
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spiking neural networks (SNNs) offer low-energy sequence modeling through sparse, event-driven computation. However, interactions among spike encoding, neuronal dynamics, and information propagation complicate architecture design. Existing SNN sequence models often adapt artificial neural network (ANN) architectures designed for real-valued activations, potentially underusing spike-based communication and temporal state updates, motivating automated discovery of native SNN architectures. Most evolutionary neural architecture search (ENAS) methods operate within predefined configuration spaces, limiting discovery to mechanisms expressible within those spaces. We introduce OpenArchEvo, which uses large language models (LLMs) to evolve executable architecture code in an open program space under spiking-projection constraints. In this space, code differences need not reflect architectural novelty, while direct performance evaluation requires costly training. We construct a three-view representation spanning code, design rationale, and a behavioral fingerprint to support novelty estimation and performance prediction. The search treats predicted performance and estimated novelty as two objectives, using surrogate predictions to select candidates for expensive training evaluations. With an estimated candidate-training cost of 132 V100 GPU-days, the search uncovers multiple native SNN architectures, exemplified by three designs featuring mechanisms such as spike-activity-dependent control of state updates and residual pathways. The discovered NeuroGate surpasses the ANN DeltaNet on WikiText-103, and the discovered architectures reduce estimated architecture-level arithmetic energy by up to 50.6x (LoopMem) relative to a common dense Transformer (ANN) baseline. All code and all discovered architectures will be made publicly available soon.
- Abstract(参考訳): スパイキングニューラルネットワーク(SNN)は、スパース、イベント駆動計算による低エネルギーシーケンスモデリングを提供する。
しかし、スパイクエンコーディング、神経力学、情報伝達の相互作用はアーキテクチャ設計を複雑にする。
既存のSNNシーケンスモデルは、しばしば、リアルタイムに評価されたアクティベーションのために設計された人工知能ニューラルネットワーク(ANN)アーキテクチャを適用し、スパイクベースの通信と時間状態の更新を弱め、ネイティブなSNNアーキテクチャの自動発見を動機付けている。
ほとんどの進化的ニューラルネットワークサーチ(ENAS)法は、事前に定義された構成空間内で動作し、発見をそれらの空間内で表現可能なメカニズムに制限する。
本稿では,大規模言語モデル(LLM)を用いたオープンプログラム空間における実行可能アーキテクチャコードをスパイク・プロジェクション制約下で進化させるOpenArchEvoを紹介する。
この領域では、コードの違いはアーキテクチャ上の斬新さを反映する必要はない。
本稿では,コードにまたがる3次元表現,設計論理,行動指紋を構築し,新規性推定と性能予測を支援する。
このサーチは、予測性能と予測新規性を2つの目的として扱い、高価なトレーニング評価のための候補を選択するために代理予測を使用する。
候補トレーニングコストは132V100GPU日と見積もられ、複数のネイティブSNNアーキテクチャを明らかにし、スパイクアクティビティに依存した状態更新と残留経路の制御などのメカニズムを特徴とする3つの設計で実証されている。
発見されたNeuroGateは、WikiText-103上のANN DeltaNetを上回り、発見されたアーキテクチャは、一般的な高密度トランスフォーマー(ANN)ベースラインと比較して、推定アーキテクチャレベルの演算エネルギーを最大50.6倍(LoopMem)削減する。
すべてのコードと発見されたアーキテクチャは、まもなく公開される予定だ。
関連論文リスト
- ONNX-Net: Towards Universal Representations and Instant Performance Prediction for Neural Architectures [60.14199724905456]
ONNX-Benchは、ONNXファイルに基づいた統一形式のニューラルネットワークの集合からなるベンチマークである。
ONNX-Netは、パフォーマンス予測器への入力として機能する自然言語記述を使用して、任意のニューラルネットワークを表す。
実験では,少数の事前学習サンプルのみを用いて,異なる探索空間をまたいだゼロショット性能を示す。
論文 参考訳(メタデータ) (2025-10-06T15:43:36Z) - ASNN: Learning to Suggest Neural Architectures from Performance Distributions [0.0]
ニューラルネットワーク(NN)のアーキテクチャは、その性能を決定する上で重要な役割を果たす。
ネットワーク構造と精度をマッピングする一般閉形式関数は存在しない。
NNアーキテクチャとテスト精度の関係を学習するためのモデルであるアーキテクチャ提案ネットワーク(ASNN)を提案する。
論文 参考訳(メタデータ) (2025-07-27T07:39:33Z) - Contextualizing MLP-Mixers Spatiotemporally for Urban Data Forecast at Scale [54.15522908057831]
本稿では,STTD予測を大規模に行うためのコンピュータ・ミクサーの適応版を提案する。
我々の結果は、この単純な効率の良いソリューションが、いくつかのトラフィックベンチマークでテストした場合、SOTAベースラインに匹敵する可能性があることを驚くほど示している。
本研究は, 実世界のSTTD予測において, 簡便な有効モデルの探索に寄与する。
論文 参考訳(メタデータ) (2023-07-04T05:19:19Z) - Set-based Neural Network Encoding Without Weight Tying [91.37161634310819]
本稿では,ネットワーク特性予測のためのニューラルネットワーク重み符号化手法を提案する。
我々のアプローチは、混合アーキテクチャのモデル動物園でニューラルネットワークを符号化することができる。
ニューラルネットワークのプロパティ予測には,クロスデータセットとクロスアーキテクチャという,2つの新しいタスクを導入する。
論文 参考訳(メタデータ) (2023-05-26T04:34:28Z) - GENNAPE: Towards Generalized Neural Architecture Performance Estimators [25.877126553261434]
GENNAPEは、与えられたニューラルネットワークを、原子操作の計算グラフ(CG)として表現する。
最初に、トポロジ的特徴によるネットワーク分離を促進するために、Contrastive Learningを介してグラフエンコーダを学習する。
実験により、NAS-Bench-101で事前訓練されたGENNAPEは、5つの異なる公開ニューラルネットワークベンチマークに優れた転送性が得られることが示された。
論文 参考訳(メタデータ) (2022-11-30T18:27:41Z) - NAR-Former: Neural Architecture Representation Learning towards Holistic
Attributes Prediction [37.357949900603295]
本稿では,属性の全体的推定に使用できるニューラルネットワーク表現モデルを提案する。
実験の結果,提案するフレームワークは,セルアーキテクチャとディープニューラルネットワーク全体の遅延特性と精度特性を予測できることがわかった。
論文 参考訳(メタデータ) (2022-11-15T10:15:21Z) - ANNETTE: Accurate Neural Network Execution Time Estimation with Stacked
Models [56.21470608621633]
本稿では,アーキテクチャ検索を対象ハードウェアから切り離すための時間推定フレームワークを提案する。
提案手法は,マイクロカーネルと多層ベンチマークからモデルの集合を抽出し,マッピングとネットワーク実行時間推定のためのスタックモデルを生成する。
生成した混合モデルの推定精度と忠実度, 統計モデルとルーフラインモデル, 評価のための洗練されたルーフラインモデルを比較した。
論文 参考訳(メタデータ) (2021-05-07T11:39:05Z) - Differentiable Neural Architecture Learning for Efficient Neural Network
Design [31.23038136038325]
スケールド・シグモイド関数に基づく新しいemphアーキテクチャのパラメータ化を提案する。
そこで本論文では,候補ニューラルネットワークを評価することなく,ニューラルネットワークを最適化するための汎用的エファイブルニューラルネットワーク学習(DNAL)手法を提案する。
論文 参考訳(メタデータ) (2021-03-03T02:03:08Z) - Neural Architecture Search For LF-MMI Trained Time Delay Neural Networks [61.76338096980383]
TDNN(State-of-the-the-art Factored Time delay Neural Network)の2種類のハイパーパラメータを自動的に学習するために、さまざまなニューラルネットワークサーチ(NAS)技術が使用されている。
DARTSメソッドはアーキテクチャ選択とLF-MMI(格子のないMMI)TDNNトレーニングを統合する。
300時間のSwitchboardコーパスで行われた実験では、自動構成システムはベースラインLF-MMI TDNNシステムより一貫して優れていることが示唆された。
論文 参考訳(メタデータ) (2020-07-17T08:32:11Z) - A Semi-Supervised Assessor of Neural Architectures [157.76189339451565]
我々は、ニューラルネットワークの有意義な表現を見つけるためにオートエンコーダを用いる。
アーキテクチャの性能を予測するために、グラフ畳み込みニューラルネットワークを導入する。
論文 参考訳(メタデータ) (2020-05-14T09:02:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。