論文の概要: The Sparsity Ceiling: Where Spiking Networks Can and Cannot Trade Activity for Energy
- arxiv url: http://arxiv.org/abs/2607.26648v1
- Date: Wed, 29 Jul 2026 09:09:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.60695
- Title: The Sparsity Ceiling: Where Spiking Networks Can and Cannot Trade Activity for Energy
- Title(参考訳): スパイクネットワークがエネルギーの取引を可能かつ不可能に
- Authors: Zeyu Wang,
- Abstract要約: スパイキングニューラルネットワーク(SNN)はエネルギー効率のよい基質として推進される。
我々は、スパーシティのエネルギー配当はSNNの特性ではなく、その課題であると主張している。
- 参考スコア(独自算出の注目度): 6.152579481336182
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spiking neural networks (SNNs) are promoted as an energy-efficient substrate because sparse, event-driven activity replaces dense multiply-accumulates with cheap accumulates. We argue the energy dividend of sparsity is not a property of SNNs but of the task. Holding architecture fixed and swapping only the hidden unit (continuous vs. leaky-integrate-and-fire), plus a two-sided target-firing-rate probe, we measure how far activity can be pushed down before quality breaks. Low-load feed-forward perception sparsifies to 5% firing at no accuracy cost; a recurrent language model cannot go below ~50% -- the recurrent state must stay active to carry information. A spiking Transformer, by contrast, sparsifies freely to 2% (3 seeds) -- so the ceiling is a property of recurrent compression, not sequence modeling. Attention escapes the floor only by storing the full key-value cache, trading a firing floor for a memory wall: on neuromorphic hardware, recurrence and attention pay on different axes, neither escapes. We formalize the ceiling with an information-theoretic bound rho >= H_b^{-1}(log2 M / H) and confirm its predictions: the floor rises with memory load, falls with state width, and (refuting a naive memory-only reading) rises with task difficulty. A layer-wise input floor further caps op reduction under dense input, isolating event-driven perception as where neuromorphic hardware wins.
- Abstract(参考訳): スパイキングニューラルネットワーク(SNN)は、希薄でイベント駆動のアクティビティが高密度のマルチプライ累積を安価な蓄積に置き換えるため、エネルギー効率のよい基質として推進される。
我々は、スパーシティのエネルギー配当はSNNの特性ではなく、その課題であると主張している。
アーキテクチャを固定し、隠されたユニットのみを交換する(連続的 vs. リーク・インテグレート・アンド・ファイア)とともに、両面の目標フィリングレートプローブにより、品質が損なわれる前にどれだけのアクティビティが押し下げられるかを測定する。
低負荷フィードフォワードの認識は、正確さなしで5%まで拡散する。リカレント言語モデルは ~50% 以下にはならない。リカレント状態は、情報を運ぶためにアクティブでなければならない。対照的に、スパイキングトランスフォーマーは、自由に2% (3 シード)まで拡散する。したがって、天井は、シーケンスモデリングではなく、リカレント圧縮の特性である。
注意は、完全なキーバリューキャッシュを格納し、メモリウォールのために発射フロアを交換することでフロアから逃れる:ニューロモルフィックハードウェアでは、異なる軸に対して繰り返し、注意を払う。
我々は,情報理論的境界rho >= H_b^{-1}(log2 M / H) で天井を形式化し,その予測を確認する。
層ワイド入力フロアは、高密度入力下でのオプ還元をさらにカプセル化し、ニューロモルフィックハードウェアが勝利する場所としてのイベント駆動認識を分離する。
関連論文リスト
- Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention [0.48342038441006796]
本稿では,入力が新規である場合にのみスロットを割り当てるスパースキャッシュについて検討する。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
論文 参考訳(メタデータ) (2026-07-10T18:28:21Z) - The Orthogonalized Read Is a Removable Training Scaffold for Recurrent Memory [0.0]
効果は再現されるが、メモリ改善ではない。
この任務の訓練は、急激な脱出に続き、長い確率の台地である。
公開された利益の多くは、アーキテクチャをまったく必要としない。
論文 参考訳(メタデータ) (2026-07-02T18:54:23Z) - Learning to Forget: Sleep-Inspired Memory Consolidation for Resolving Proactive Interference in Large Language Models [0.11080037957254413]
大規模言語モデル (LLM) はプロアクティブ干渉 (PI) に悩まされ、コンテキストウィンドウの古い情報が現在の値の検索を妨害する。
キー値(KV)キャッシュ上で学習した睡眠サイクルでトランスフォーマーベースのLCMを増強するフレームワークであるSleepGateを提案する。
SleepGateは深さ5で99.5%、深さ10で97.0%、全ベースライン(フルKVキャッシュ、スライディングウインドウ、H2O、StreamingLLM、崩壊専用アブレーション)は18%以下である。
論文 参考訳(メタデータ) (2026-03-15T17:54:43Z) - One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers [80.19461768457622]
Elastic Latent Interface Transformer (ELIT) は、入力画像サイズを計算から切り離すための、ドロップインでDiT互換のメカニズムである。
読み取りと書き込み クロスアテンション・レイヤは空間トークンとラテントの間で情報を移動し、重要な入力領域を優先する。
ImageNet-1K 512pxでは、ELITの平均利得は35.3%、FIDおよびFDDスコアは39.6%である。
論文 参考訳(メタデータ) (2026-03-12T17:57:04Z) - Mind the Gap: Why Neural Memory Fails Under Semantic Density [0.0]
現在のAIシステムは、この分離を欠き、ニューラルウェイトだけで両方の機能を試みている。
オンラインニューラルメモリの'安定性ギャップ'を識別する。
崩壊はN=5の事実を高密度で示している。
また、本運用システムでは、スキーマドリフトとバージョンあいまいさを主要な障害モードとみなしています。
論文 参考訳(メタデータ) (2026-01-14T18:55:23Z) - Mixture of Hidden-Dimensions Transformer [50.40325486463241]
隠れ次元の空間性について検討し、訓練されたトランスフォーマーがわずかなトークン次元しか利用していないことを観察する。
スパース条件付アクティベーションアーキテクチャであるMoHD(Mixture of Hidden Dimensions)を提案する。
50%のアクティベーションパラメータが減少し、3.7%のハイパフォーマンスを実現し、3倍のパラメータを一定のアクティベーションコストで拡張する。
論文 参考訳(メタデータ) (2024-12-07T13:15:22Z) - Hamiltonian Mechanics of Feature Learning: Bottleneck Structure in Leaky ResNets [58.460298576330835]
ResNets と Fully-Connected Nets を相互接続する Leaky ResNets について「有効深度」に依存して検討する。
この直感を利用して、以前の研究で見られるように、ボトルネック構造の出現を説明する。
論文 参考訳(メタデータ) (2024-05-27T18:15:05Z) - Simple linear attention language models balance the recall-throughput tradeoff [60.06020449520365]
線形およびすべり窓の注意を結合したシンプルなアーキテクチャであるBASEDを提案する。
我々は、最大1.3bパラメータの言語モデルをトレーニングし、BASEDがパープレキシティにおいて最強のサブクワッドラティックモデルと一致し、実世界のリコール集約タスクにおいて6.22の精度ポイントでそれらのモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-28T19:28:27Z) - Learning Bayesian Sparse Networks with Full Experience Replay for
Continual Learning [54.7584721943286]
継続学習(CL)手法は、機械学習モデルが、以前にマスターされたタスクを壊滅的に忘れることなく、新しいタスクを学習できるようにすることを目的としている。
既存のCLアプローチは、しばしば、事前に確認されたサンプルのバッファを保持し、知識蒸留を行い、あるいはこの目標に向けて正規化技術を使用する。
我々は,現在および過去のタスクを任意の段階で学習するために,スパースニューロンのみを活性化し,選択することを提案する。
論文 参考訳(メタデータ) (2022-02-21T13:25:03Z) - The fine line between dead neurons and sparsity in binarized spiking
neural networks [1.370633147306388]
スパイキングニューラルネットワークは、情報を符号化したり、離散化された量を処理することによって、量子化エラーを補償することができる。
本稿では,しきい値のウォームアップ手法としてしきい値アニーリング(しきい値アニーリング)を提案する。
ニューロンの発火が止まる複数の層にスパイクを伝播させることで、4つの多様なデータセットに対して高い競争力を持つ結果が得られることを示す。
論文 参考訳(メタデータ) (2022-01-28T03:33:12Z) - ActNN: Reducing Training Memory Footprint via 2-Bit Activation
Compressed Training [68.63354877166756]
ActNNは、バック伝搬のためのランダムに量子化されたアクティベーションを格納するメモリ効率のトレーニングフレームワークである。
ActNNはアクティベーションのメモリフットプリントを12倍に削減し、6.6倍から14倍のバッチサイズでトレーニングを可能にする。
論文 参考訳(メタデータ) (2021-04-29T05:50:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。