論文の概要: GPU Parallelization Strategies for Forward and Backward Propagation in Shallow Neural Networks: A CUDA-Based Comparative Study
- arxiv url: http://arxiv.org/abs/2606.30497v1
- Date: Mon, 29 Jun 2026 16:02:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.324383
- Title: GPU Parallelization Strategies for Forward and Backward Propagation in Shallow Neural Networks: A CUDA-Based Comparative Study
- Title(参考訳): 浅層ニューラルネットワークにおける前方・後方伝播のためのGPU並列化戦略:CUDAによる比較研究
- Authors: Rania Zitouni, Nadine Bousdjira, Sarah Hasnaoui, Amel Sadoun, Fatma Salhi,
- Abstract要約: 本稿では,浅層ニューラルネットワークにおける前方・後方伝播に対する最適化手法の比較検討を行う。
NVIDIA Tesla T4(CUDA 13.0)の実験では、完全に最適化された実装はベースラインバージョンよりも1.41倍のスピードアップを達成した。
結果は、シーケンシャルベースラインとOpenMP並列実装と比較される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a comparative study of CUDA optimization strategies applied to forward and backward propagation in a shallow neural network. Three stacked optimizations are evaluated: (1) tiled shared memory with bank-conflict elimination via +1-column padding, (2) pre-transposed weight matrices for coalesced global memory access, and (3) a fused MatMul+ReLU kernel that eliminates intermediate global-memory round-trips. Experiments on an NVIDIA Tesla T4 (CUDA 13.0) across three dataset sizes show that the fully optimized implementation achieves a 1.41x speedup over the baseline CUDA version on the large dataset (25,600 samples), reducing execution time from 21.0s to 14.8s. Results are compared against a sequential CPU baseline and an OpenMP parallel implementation, demonstrating the effectiveness of memory-access optimization in GPU-accelerated deep learning primitives.
- Abstract(参考訳): 本稿では,浅部ニューラルネットワークにおける前方及び後方伝播に応用したCUDA最適化手法の比較検討を行う。
3つの重ね重ねられた最適化が評価され,(1) +1カラムパディングによるバンク・コンフリクト除去による共有メモリのタイル化,(2) 合体したグローバルメモリアクセスのための既設重量行列,(3) 中間のグローバルメモリラウンドトリップを排除したMtMul+ReLUカーネルが評価された。
3つのデータセットサイズにわたるNVIDIA Tesla T4(CUDA 13.0)の実験によると、完全に最適化された実装は、大規模なデータセット(25,600サンプル)上のベースラインCUDAバージョンよりも1.41倍のスピードアップを実現し、実行時間を21.0sから14.8sに短縮している。
結果は、逐次CPUベースラインとOpenMP並列実装を比較し、GPUアクセラレーションされたディープラーニングプリミティブにおけるメモリアクセス最適化の有効性を実証する。
関連論文リスト
- GSPN-2: Efficient Parallel Sequence Modeling [101.33780567131716]
一般化空間伝搬ネットワーク(GSPN)は2次自己アテンションを直線走査型伝搬方式に置き換えることでこの問題に対処する。
GSPN-2は、視覚アプリケーションにおけるグローバル空間コンテキストをモデル化するための新しい効率フロンティアを確立する。
論文 参考訳(メタデータ) (2025-11-28T07:26:45Z) - Unified Kernel-Segregated Transpose Convolution Operation [3.4558311080267954]
本稿では,メモリと計算資源の使用を制限する統一カーネル分離手法を提案する。
EB-GANモデルにおける畳み込み層を変換する方法は,最大35MBのメモリ節約効果を示す。
論文 参考訳(メタデータ) (2025-02-27T19:56:25Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - Fast Inference with Kronecker-Sparse Matrices [4.387337528923525]
KS行列乗算のための既存のGPUカーネルは、高いデータ移動コストに悩まされている。
本稿では、これらのオーバーヘッドを解消する、融合した出力定常GPUカーネルを提案する。
FP32では,VT-S/16では最大22%,GPT-2媒体では16%のレイテンシ低下を示した。
論文 参考訳(メタデータ) (2024-05-23T19:36:10Z) - INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order
Gradient Computations in Implicit Neural Representation Processing [66.00729477511219]
計算グラフとして表される関数を考えると、従来のアーキテクチャはn階勾配を効率的に計算する上で困難に直面している。
InR-Archは,n階勾配の計算グラフをハードウェア最適化データフローアーキテクチャに変換するフレームワークである。
1.8-4.8x と 1.5-3.6x の高速化を CPU と GPU のベースラインと比較した結果を示す。
論文 参考訳(メタデータ) (2023-08-11T04:24:39Z) - Im2win: An Efficient Convolution Paradigm on GPU [1.9162301033784574]
本稿では、メモリフットプリントの削減だけでなく、連続的なメモリアクセスを提供するim2winと呼ばれる畳み込みベースの畳み込みに関するパラダイムを提案する。
直接畳み込みと、PyTorchのGEMMベースの畳み込みと、DNNベースの畳み込み実装の6ドルを、12の最先端ベンチマークで比較する。
論文 参考訳(メタデータ) (2023-06-25T19:09:56Z) - Efficient Dataset Distillation Using Random Feature Approximation [109.07737733329019]
本稿では,ニューラルネットワークガウス過程(NNGP)カーネルのランダム特徴近似(RFA)を用いた新しいアルゴリズムを提案する。
我々のアルゴリズムは、KIP上で少なくとも100倍のスピードアップを提供し、1つのGPUで実行できる。
RFA蒸留 (RFAD) と呼ばれる本手法は, 大規模データセットの精度において, KIP や他のデータセット凝縮アルゴリズムと競合して動作する。
論文 参考訳(メタデータ) (2022-10-21T15:56:13Z) - Distributed Out-of-Memory NMF on CPU/GPU Architectures [1.0051474951635875]
本稿では,HPCシステムに対する非負行列分解(NMF)アルゴリズムのメモリ外実装を提案する。
ベンチマークの結果、CPUベースのNMFkよりもGPUを使用した新しい実装により、32Xから76倍のスピードアップが大幅に改善された。
論文 参考訳(メタデータ) (2022-02-19T03:49:21Z) - Efficient and Generic 1D Dilated Convolution Layer for Deep Learning [52.899995651639436]
幅広いパラメータをカバーする汎用的な1D畳み込み層の効率的な実装を紹介します。
特にIntel AVX-512とAVX-512 BFloat16命令を含むアーキテクチャ向けに最適化されている。
本稿では,最適化された1次元畳み込み層の性能を,実際のゲノミクスデータセットを用いたエンドツーエンドニューラルネットワークトレーニングで実証する。
論文 参考訳(メタデータ) (2021-04-16T09:54:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。