論文の概要: SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks
- arxiv url: http://arxiv.org/abs/2608.01622v1
- Date: Mon, 03 Aug 2026 02:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.30485
- Title: SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks
- Title(参考訳): SMM変換器:マルチモーダルタスクのためのスパイキングニューラルネットワークの活用
- Abstract要約: スパイキングニューラルネットワーク(SNN)は、スパースアクティベーションによるイベント駆動型計算を可能にする。
SNN上のマルチモーダルトランスフォーマーの構築は、深層スパイクスタックにおける不安定なトレーニングと、高密度ソフトマックスアテンションとスパイクベース通信のミスマッチによって妨げられる。
本稿では,SNNをベースとしたマルチモーダルトランスフォーマフレームワークであるSMM Transformerを提案する。
- 参考スコア(独自算出の注目度): 18.182498348045723
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spiking Neural Networks (SNNs) enable event-driven computation with sparse activations, but building multimodal Transformers on SNNs is hindered by unstable training in deep spiking stacks and the mismatch between dense softmax attention and spike-based communication. We propose SMM Transformer, an SNN-based multimodal Transformer framework that combines (i)PLMP, a Parallel LIF with Multistage Learnable Parameters neuron and a tailored P-STBP algorithm for stable deep SNN training, (ii) SMSA, an attention-inspired spike-driven token-mixing module that replaces dense pairwise softmax attention with channel-wise spike co-activation and self-compensation, and (iii)SMoE, a spiking mixture-of-experts module for modality-aware fusion. Across visual and multimodal benchmarks, SMM Transformer achieves competitive accuracy compared to ANN baselines. Under a standard MAC/AC arithmetic model, SMSA reduces the estimated operator-level compute energy of the attention module by up to 97%, while whole-model profiling shows more moderate but consistent efficiency gains.
- Abstract(参考訳): スパイキングニューラルネットワーク(SNN)は、スパースアクティベーションによるイベント駆動計算を可能にするが、SNN上のマルチモーダルトランスフォーマーの構築は、深層スパイキングスタックの不安定なトレーニングと、密度の高いソフトマックスアテンションとスパイクベースの通信のミスマッチによって妨げられる。
SNNベースのマルチモーダルトランスフレームワークであるSMM Transformerを提案する。
(i)PLMP、多段階学習可能なパラメーターニューロンを持つ並列LIF、および安定した深部SNNトレーニングのためのP-STBPアルゴリズム
(ii)SMSAは、高密度のソフトマックスアテンションをチャネルワイドスパイクコアクティベーションと自己補償に置き換える、注目に刺激されたスパイク駆動型トークンミキシングモジュールである。
(iii)SMoEは、モダリティを意識した核融合のためのスパイキング・オブ・エキスパート・ミックスモジュールである。
視覚的およびマルチモーダルなベンチマークで、SMM TransformerはANNのベースラインと比較して、競争精度が向上する。
標準的なMAC/AC演算モデルの下では、SMSAはアテンションモジュールの演算子レベルの計算エネルギーを最大97%削減する。
関連論文リスト
- Reducing ANN-SNN Conversion Error via Residual Membrane Potential Alignment [52.910770415431244]
スパイキングニューラルネットワーク(SNN)は、ニューロモルフィックコンピューティングのコアアーキテクチャとして機能する。
ANN-SNN変換は、低レイテンシでエネルギー効率のよい推論のために、よく訓練されたANN重みを再利用することで問題を回避している。
既存の変換方式は、小さなタイミングで精度の低下、大きな推論遅延、累積量子化誤差に悩まされている。
論文 参考訳(メタデータ) (2026-08-14T04:46:03Z) - Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer [84.8831358775386]
スパイキングニューラルネットワーク(SNN)は、ニューラルネットワーク(ANN)よりも優れたエネルギー効率を提供する
ANN-SNN ConversionやSpatial-Temporal Backpropagation (STBP)といった既存のパラダイムは、固有の制限に悩まされている。
Ge$text2$mS-Tを提案する。これは時間的・空間的・ネットワーク的構造次元にまたがるグループ計算を実装した新しいアーキテクチャである。
論文 参考訳(メタデータ) (2026-04-10T02:58:46Z) - CollaPipe: Adaptive Segment-Optimized Pipeline Parallelism for Collaborative LLM Training in Heterogeneous Edge Networks [57.95170323315603]
CollaPipeは、コラボレーティブパイプライン並列性とフェデレーションアグリゲーションを統合し、自己進化型ネットワークをサポートする分散学習フレームワークである。
CollaPipeでは、エンコーダ部分は可変サイズのセグメントに適応的に分割され、パイプライン並列トレーニングのためにモバイルデバイスにデプロイされ、デコーダは生成タスクを処理するためにエッジサーバにデプロイされる。
トレーニング効率を向上させるために,モデルセグメント,マイクロバッチ,帯域幅,送信電力を適応的に割り当てる共同最適化問題を定式化する。
論文 参考訳(メタデータ) (2025-09-24T07:54:01Z) - DNN-Based Precoding in RIS-Aided mmWave MIMO Systems With Practical Phase Shift [43.56429251312585]
本稿では、直接通信路を妨害したミリ波マルチインプット多重出力(MIMO)システムのスループットを最大化する。
リコンフィギュアブルインテリジェントサーフェス(RIS)は、視線(LoS)とマルチパス効果に関連するmmWave特性を考慮して伝送性を高めるために使用される。
ディープニューラルネットワーク(DNN)は、より高速なコードワード選択を容易にするために開発された。
論文 参考訳(メタデータ) (2025-07-03T17:35:06Z) - A Lightweight RL-Driven Deep Unfolding Network for Robust WMMSE Precoding in Massive MU-MIMO-OFDM Systems [8.526578240549794]
本稿では,各SWMMSEイテレーションをネットワーク層にマッピングする,軽量強化学習(RL)駆動の深層展開(RLDDU-Net)ネットワークを提案する。
具体的には、そのDUモジュールは、ビーム領域の間隔と周波数領域のサブキャリア相関を統合し、収束を著しく加速し、計算オーバーヘッドを低減する。
不完全なCSI下でのシミュレーションの結果、RLDDU-Netは計算効率と収束効率を向上しつつ、既存のEWSR性能のベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2025-06-19T06:54:42Z) - Multiscale Tensor Summation Factorization as a New Neural Network Layer (MTS Layer) for Multidimensional Data Processing [18.557169937152967]
Multiscale Summation (MTS) Factorizationは、テンソル和を複数スケールで実装した新しいニューラルネットワーク演算子である。
MTSは、重量最適化の効率を高めながら必要となるパラメータ数を減少させるだけでなく、畳み込み層よりも明確な利点を示す。
対応するニューラルネットワークであるMTSNetは、さまざまなコンピュータビジョンアプリケーションにおける最先端のトランスフォーマーと比較して、より好ましい複雑性とパフォーマンスのトレードオフを示す。
論文 参考訳(メタデータ) (2025-04-17T22:19:59Z) - Deep-Unrolling Multidimensional Harmonic Retrieval Algorithms on Neuromorphic Hardware [78.17783007774295]
本稿では,高精度かつエネルギー効率の高い単発多次元高調波検索のための変換に基づくニューロモルフィックアルゴリズムの可能性について検討する。
複雑な値の畳み込み層と活性化をスパイクニューラルネットワーク(SNN)に変換する新しい手法を開発した。
変換されたSNNは、元のCNNに比べて性能が低下し、ほぼ5倍の電力効率を実現している。
論文 参考訳(メタデータ) (2024-12-05T09:41:33Z) - Neuromorphic Wireless Split Computing with Multi-Level Spikes [69.73249913506042]
ニューロモルフィックコンピューティングは、スパイキングニューラルネットワーク(SNN)を使用して推論タスクを実行する。
スパイクニューロン間で交換される各スパイクに小さなペイロードを埋め込むことで、エネルギー消費を増大させることなく推論精度を高めることができる。
分割コンピューティング — SNNを2つのデバイスに分割する — は、有望なソリューションだ。
本稿では,マルチレベルSNNを用いたニューロモルフィック無線分割コンピューティングアーキテクチャの総合的研究について述べる。
論文 参考訳(メタデータ) (2024-11-07T14:08:35Z) - Structured and Balanced Multi-Component and Multi-Layer Neural Networks [9.699640804685629]
バランスの取れた多成分多層ニューラルネットワーク(MMNN)構造を提案する。
MMNNは、完全連結ニューラルネットワーク(FCNN)または多層パーセプトロン(MLP)の単純な修正と見なすことができる。
論文 参考訳(メタデータ) (2024-06-30T17:00:42Z) - Learning Long Sequences in Spiking Neural Networks [0.0]
スパイキングニューラルネットワーク(SNN)は、エネルギー効率の高い計算を可能にするために、脳からインスピレーションを得ている。
トランスフォーマーの効率的な代替品に対する近年の関心は、状態空間モデル(SSM)と呼ばれる最先端の繰り返しアーキテクチャの台頭をもたらした。
論文 参考訳(メタデータ) (2023-12-14T13:30:27Z) - A Multi-Head Ensemble Multi-Task Learning Approach for Dynamical
Computation Offloading [62.34538208323411]
共有バックボーンと複数の予測ヘッド(PH)を組み合わせたマルチヘッドマルチタスク学習(MEMTL)手法を提案する。
MEMTLは、追加のトレーニングデータを必要とせず、推測精度と平均平方誤差の両方でベンチマーク手法より優れている。
論文 参考訳(メタデータ) (2023-09-02T11:01:16Z) - Towards Energy-Efficient, Low-Latency and Accurate Spiking LSTMs [1.7969777786551424]
Spiking Neural Networks(SNN)は、複雑なタスクのための魅力的なテンポラルコンピューティングパラダイムビジョンとして登場した。
そこで本研究では,新規な長期記憶ネットワーク(LSTM)の学習フレームワークを提案する。
rev-to-SNN変換フレームワーク、続いてSNNトレーニング。
我々は、時間的M、Google Speech Commands(GSC)データセット、異なるLSTMアーキテクチャ上のUCIスマートフォンなど、逐次学習タスクに関するフレームワークを評価した。
論文 参考訳(メタデータ) (2022-10-23T04:10:27Z) - Joint Deep Reinforcement Learning and Unfolding: Beam Selection and
Precoding for mmWave Multiuser MIMO with Lens Arrays [54.43962058166702]
離散レンズアレイを用いたミリ波マルチユーザマルチインプット多重出力(MU-MIMO)システムに注目が集まっている。
本研究では、DLA を用いた mmWave MU-MIMO システムのビームプリコーディング行列の共同設計について検討する。
論文 参考訳(メタデータ) (2021-01-05T03:55:04Z) - Rewiring the Transformer with Depth-Wise LSTMs [55.50278212605607]
カスケードトランスとサブ層を接続する奥行きLSTMを用いたトランスフォーマーを提案する。
6層トランスを用いた実験では、WMT 14英語/ドイツ語/フランス語タスクとOPUS-100多言語NMTタスクの両方でBLEUが大幅に改善された。
論文 参考訳(メタデータ) (2020-07-13T09:19:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。