論文の概要: Current Injection Spiking Neural Network for Infrared and Visible Image Fusion
- arxiv url: http://arxiv.org/abs/2607.19879v1
- Date: Wed, 22 Jul 2026 08:10:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.025338
- Title: Current Injection Spiking Neural Network for Infrared and Visible Image Fusion
- Title(参考訳): 赤外・可視画像融合のための電流インジェクションスパイクニューラルネットワーク
- Abstract要約: 赤外線および可視画像融合(IVIF)は、2つのモードの相補的な情報をよりリッチなシーン内容の単一の画像に統合する。
膜電位レベルで直接クロスモーダル核融合を行うスパイクネットワークであるCIS-Fuseを提案する。
4つのIVIFベンチマークと下流検出とセグメンテーションの実験により、CIS-Fuseは最先端のANN法と同等の核融合品質が得られることが示された。
- 参考スコア(独自算出の注目度): 55.20584003351512
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Infrared and visible image fusion (IVIF) integrates the complementary information of two modalities into a single image with richer scene content. While existing methods are largely built on artificial neural networks (ANNs), which densely compute over all activations, spiking neural networks (SNNs) communicate through sparse binary spikes and compute only where and when a spike occurs, offering a route to more energy-efficient fusion. However, directly applying SNNs to IVIF creates a fundamental tension: cross-modal fusion relies on fine-grained responses from both modalities, whereas binary spikes can discard complementary cues that remain below the firing threshold. The membrane potential retains these subthreshold responses before firing, letting both modalities jointly shape the output when integrated at this stage. Building on this, we propose CIS-Fuse, a spiking network that performs cross-modal fusion directly at the membrane-potential level. At its core is the current injection spiking (CIS) operator, which injects one modality as a gated auxiliary current into the driving neuron of the other, so the two integrate before spike firing, with a per-channel learnable injection strength that adaptively regulates the modulation magnitude. Building on CIS, we construct a bidirectional cross-modal fusion (BCMF) module and deploy it on a dual-branch architecture with asymmetric stacking depths, where the two branches develop a clear functional specialization. Extensive experiments on four IVIF benchmarks and on downstream detection and segmentation show that CIS-Fuse achieves fusion quality on par with state-of-the-art ANN-based methods while inheriting the energy efficiency of spike-based computation, with roughly an order of magnitude lower inference energy than the similarly-sized ANN-based DCEvo. Code will be released upon publication.
- Abstract(参考訳): 赤外線および可視画像融合(IVIF)は、2つのモードの相補的な情報をよりリッチなシーン内容の単一の画像に統合する。
既存の手法は、すべてのアクティベーションを厳密に計算する人工知能ニューラルネットワーク(ANN)に基づいて構築されているが、スパイクが発生する場所と場所のみを計算し、よりエネルギー効率のよい核融合へのルートを提供する。
しかし、SNNをIVIFに直接適用すると、基本的な緊張が生じる: クロスモーダル融合は両方のモーダルからのきめ細かい応答に依存しているのに対し、バイナリスパイクは発射しきい値より下にある相補的なキューを破棄することができる。
膜電位はこれらのサブスレッショルド反応を発射前に保持し、この段階では両方のモードが出力を共同で形成する。
そこで本研究では, 膜電位レベルで直接クロスモーダル融合を行うスパイクネットワークCIS-Fuseを提案する。
その中核は電流噴射スパイク(CIS)演算子であり、これは一方のモードが他方の駆動ニューロンにゲート補助電流として注入されるので、2つのモードはスパイク発火の前に統合され、チャネルごとの学習可能な注入強度が調節の大きさを適応的に調節する。
CIS上に構築した双方向クロスモーダル融合(BCMF)モジュールは,非対称な積層深さを持つデュアルブランチアーキテクチャ上に展開する。
4つのIVIFベンチマークと下流検出およびセグメンテーションによる大規模な実験により、CIS-Fuseは、同等の大きさのANNベースのDCEvoに比べて、スパイクベースの計算のエネルギー効率を継承しながら、最先端のANNベースの方法と同等に融合品質を達成することが示された。
コードは出版時に公開される。
関連論文リスト
- LI-DSN: A Layer-wise Interactive Dual-Stream Network for EEG Decoding [7.8846145693499246]
脳波のための現在のデュアルストリームニューラルネットワークは、しばしば平行分岐を通して時間的特徴と空間的特徴を独立に処理する。
本稿では,各層におけるプログレッシブ・クロスストリーム通信を容易にするレイヤワイド・インタラクティブなデュアルストリームネットワークであるLI-DSNを提案する。
LI-DSNは13の最先端(SOTA)ベースラインモデルを大幅に上回り、その優れた堅牢性とデコード性能を示している。
論文 参考訳(メタデータ) (2026-04-02T10:52:04Z) - Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval [79.04396446873932]
スパイキングニューラルネットワーク(SNN)は、最近、視覚的タスクとテキストタスクに強い可能性を示している。
画像テキスト検索(ITR)のようなマルチモーダルアプリケーションのための直接訓練され、低エネルギーで高性能なSNNを構築することは、依然として非常に困難である。
我々は脳にインスパイアされたクロスモーダルスパイク・フュージョン・ネットワーク(CMSF)を提案し、初めてITRに適用した。
論文 参考訳(メタデータ) (2026-03-25T08:41:07Z) - SCRNet: Spatial-Channel Regulation Network for Medical Ultrasound Image Segmentation [1.4930126157970809]
CNNベースのメソッドは長距離依存を無視する傾向があり、Transformerベースのメソッドはローカルなコンテキスト情報を見落としてしまう。
本稿では,前層から2つの入力特徴を処理するために設計された新しい特徴集約モジュール(FAM)を提案する。
この戦略により、モジュールは長距離依存とローカルコンテキスト情報の両方に同時に集中することができます。
論文 参考訳(メタデータ) (2025-08-19T15:02:27Z) - CodeBrain: Towards Decoupled Interpretability and Multi-Scale Architecture for EEG Foundation Model [52.466542039411515]
EEGファウンデーションモデル(EFM)は、タスク固有のモデルのスケーラビリティ問題に対処するために登場した。
このギャップを埋めるために設計された2段階のEMFであるCodeBrainを紹介します。
第1段階では、異種時間・周波数の脳波信号を離散トークンに分解するTFDual-Tokenizerを導入する。
第2段階では、構造化されたグローバル畳み込みとスライディングウインドウの注意を結合したマルチスケールEEGSSMアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-06-10T17:20:39Z) - Channel Fingerprint Construction for Massive MIMO: A Deep Conditional Generative Approach [65.47969413708344]
CF双生児の概念を導入し、条件付き生成拡散モデル(CGDM)を設計する。
本研究では, 粗粒CFに条件付き観測された細粒CFの対数分布に対するエビデンスローバウンド(ELBO)を導出するために, 変分推論手法を用いる。
提案手法は, ベースラインと比較して, 復元性能が著しく向上していることを示す。
論文 参考訳(メタデータ) (2025-05-12T01:36:06Z) - Double-Shot 3D Shape Measurement with a Dual-Branch Network for Structured Light Projection Profilometry [14.749887303860717]
我々は、異なる構造光(SL)変調を処理するために、デュアルブランチ畳み込みニューラルネットワーク(CNN)-トランスフォーマーネットワーク(PDCNet)を提案する。
PDCNet内では、Transformerブランチを使用してフリンジイメージのグローバルな認識をキャプチャし、CNNブランチはスペックルイメージのローカル詳細を収集するように設計されている。
提案手法は, 自己生成データセット上で高精度な結果が得られる一方で, フランジオーダーの曖昧さを低減できる。
論文 参考訳(メタデータ) (2024-07-19T10:49:26Z) - GAN-driven Electromagnetic Imaging of 2-D Dielectric Scatterers [4.510838705378781]
逆散乱問題は、それらが不適切で非線形であるという事実を考えると、本質的に困難である。
本稿では、生成的対向ネットワークに依存する強力なディープラーニングに基づくアプローチを提案する。
適切に設計された高密度層からなる凝集性逆ニューラルネットワーク(INN)フレームワークが設定される。
トレーニングされたINNは、平均2進クロスエントロピー(BCE)損失が0.13ドル、構造類似度指数(SSI)が0.90ドルであることを示す。
論文 参考訳(メタデータ) (2024-02-16T17:03:08Z) - CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for
Multi-Modality Image Fusion [138.40422469153145]
本稿では,CDDFuse(Relationed-Driven Feature Decomposition Fusion)ネットワークを提案する。
近赤外可視画像融合や医用画像融合など,複数の融合タスクにおいてCDDFuseが有望な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2022-11-26T02:40:28Z) - Bandwidth-efficient distributed neural network architectures with
application to body sensor networks [73.02174868813475]
本稿では,分散ニューラルネットワークアーキテクチャを設計するための概念設計手法について述べる。
提案手法により,損失を最小限に抑えつつ,最大20倍の帯域幅削減が可能となることを示す。
本稿では,ウェアラブル脳-コンピュータインタフェースに焦点をあてるが,他のセンサネットワークアプリケーションにも適用できる。
論文 参考訳(メタデータ) (2022-10-14T12:35:32Z) - ACMP: Allen-Cahn Message Passing with Attractive and Repulsive Forces for Graph Neural Networks [29.755769118770733]
グラフニューラルネットワークにおけるAllen-Cahnメッセージパッシングをモデル化する。
系の力学は、粒子を吹き飛ばすことなく分離できる反応拡散過程である。
理論上はディリクレエネルギーの厳密に正の低い境界を持つ100層までネットワークの深さを拡大する。
論文 参考訳(メタデータ) (2022-06-11T06:26:12Z) - X-volution: On the unification of convolution and self-attention [52.80459687846842]
本稿では,畳み込み操作と自己注意操作の両方からなるマルチブランチ基本モジュールを提案する。
提案したX-進化は、非常に競争力のある視覚的理解の改善を実現する。
論文 参考訳(メタデータ) (2021-06-04T04:32:02Z) - Diffusion Mechanism in Residual Neural Network: Theory and Applications [12.573746641284849]
限られたトレーニングサンプルを持つ多くの学習タスクでは、拡散はラベル付きおよびラベルなしのデータポイントを接続する。
本稿では,ニューラルネットワークのアーキテクチャへの拡散を内部的に導入する新しい拡散残差ネットワーク(Diff-ResNet)を提案する。
構造的データ仮定により,提案した拡散ブロックは,クラス間点の分離性を向上させる距離-距離比を増大させることができることが証明された。
論文 参考訳(メタデータ) (2021-05-07T10:42:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。