論文の概要: Energy Variation in Training Modern Computer Vision Architectures
- arxiv url: http://arxiv.org/abs/2610.03772v1
- Date: Tue, 29 Sep 2026 09:15:37 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:22:29.777056
- Title: Energy Variation in Training Modern Computer Vision Architectures
- Title(参考訳): 現代のコンピュータビジョンアーキテクチャの訓練におけるエネルギー変動
- Abstract要約: ディープラーニングは、モデルトレーニングに関連するエネルギー消費を大幅に増加させた。
本研究では,現代のコンピュータビジョンアーキテクチャ7つのトレーニングのエネルギー変動を実験的に測定する。
- 参考スコア(独自算出の注目度): 1.1278903078792915
- License:
- Abstract: The rapid growth of deep learning has substantially increased the energy consumption associated with model training, making energy efficiency an increasingly relevant design criterion. This study empirically measures the energy variation of training seven modern computer vision architectures, MobileNetV3-Small, MobileNetV3-Large, EfficientNet-B0, EfficientNet-B1, ViT-B/32, ConvNeXt-Tiny, and ViT-B/16 for the ImageNet-1k classification task, using a homogeneous 10,000-image subset (ImageNet-10k) and a uniform 40-epoch baseline configuration executed on two NVIDIA Tesla P100 GPUs at the Bioinformatics and Computational Biology Center of Colombia (BIOS). Energy was recorded directly via NVML and contrasted with the computational complexity of each model. The results show a Pearson correlation of 0.85 between floating-point operations (GFLOPs) and energy consumption in kWh, indicating that computational complexity is a strong but imperfect predictor of energy expenditure: architectures with comparable GFLOPs exhibited consumption differing by up to 3.1x due to differences in the hardware efficiency of their dominant operations. The EfficientNet variants offered the best balance between classification performance (Val Top-5 up to 97.15%) and energy efficiency (0.457-0.611 kWh), while Vision Transformers exhibited the highest relative energy consumption and lower classification performance under the evaluated configuration. These findings guide architecture selection in energy-constrained computing environments.
- Abstract(参考訳): ディープラーニングの急速な成長は、モデルトレーニングに伴うエネルギー消費を大幅に増加させ、エネルギー効率を設計基準に関連付けている。
本研究は, バイオインフォマティクス・計算生物学センター(BIOS)の2つのNVIDIA Tesla P100 GPU上で, 均質な1万画像サブセット(ImageNet-10k)と均一な40時間ベースライン構成を用いて, 現代のコンピュータビジョンアーキテクチャ7つのトレーニング, MobileNetV3-Small, MobileNetV3-Large, EfficientNet-B0, EfficientNet-B1, ViT-B/32, ConvNeXt-Tiny, ViT-B/16のエネルギー変動を実証的に測定した。
エネルギーはNVMLを介して直接記録され、各モデルの計算複雑性と対比された。
その結果、Pearsonは浮動小数点演算(GFLOP)とkWhのエネルギー消費の0.85の相関を示し、計算複雑性はエネルギー消費の強いが不完全な予測因子であることを示した。
効率的なNetの派生型は、分類性能(Val Top-5から97.15%まで)とエネルギー効率(0.457-0.611 kWh)の最良のバランスを提供し、Vision Transformersは評価された構成の下で最も高い相対エネルギー消費と低い分類性能を示した。
これらの知見は、エネルギー制約のある計算環境におけるアーキテクチャの選択を導く。
関連論文リスト
- Application of Algorithms in Energy-Efficient Design Platforms for Green Building [1.8231950836324822]
本稿では,ビルディング情報モデリング,センサ操作データ,ロバストアルゴリズムを用いた高度なシミュレーションを組み合わせたプラットフォームを提案する。
ケーススタディとして中層オフィスビルが選定された。
論文 参考訳(メタデータ) (2026-05-31T13:26:17Z) - Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer [84.8831358775386]
スパイキングニューラルネットワーク(SNN)は、ニューラルネットワーク(ANN)よりも優れたエネルギー効率を提供する
ANN-SNN ConversionやSpatial-Temporal Backpropagation (STBP)といった既存のパラダイムは、固有の制限に悩まされている。
Ge$text2$mS-Tを提案する。これは時間的・空間的・ネットワーク的構造次元にまたがるグループ計算を実装した新しいアーキテクチャである。
論文 参考訳(メタデータ) (2026-04-10T02:58:46Z) - Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation [50.21021246855702]
本稿では,計算複雑性(FLOP)に基づく拡散モデルに対するGPUエネルギー消費予測のためのKaplanスケーリング法の適用法を提案する。
提案手法は, テキストエンコーディング, 反復的復号化, 復号化コンポーネントへの拡散モデル推論を分解し, 複数の推論ステップをまたいだ繰り返し実行により, 演算の復号化がエネルギー消費を支配しているという仮説を導いた。
この結果は拡散予測の計算バウンドの性質を検証し、持続可能なAIデプロイメント計画と炭素フットプリント推定の基礎を提供する。
論文 参考訳(メタデータ) (2025-11-21T08:12:47Z) - CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer [1.9336815376402718]
視覚変換器(ViT)は様々なコンピュータビジョンタスクにおいて顕著な性能を示した。
本稿では,軽量かつ計算効率の良い視覚変換器アーキテクチャであるemph Cascaded-ViT(CViT)を提案する。
CCFFNは精度を犠牲にすることなくパラメータとFLOP効率を改善する。
論文 参考訳(メタデータ) (2025-11-18T03:51:15Z) - LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons [1.213604453116022]
ビジョントランスフォーマーはコンピュータビジョンタスクで非常に成功しています。
大規模計算、メモリ、エネルギー要求はFPGAにおけるエッジ推論の課題である。
本稿では,新しいエッジ最適化型視覚変換器であるLL-ViTを提案する。
論文 参考訳(メタデータ) (2025-11-02T05:51:48Z) - SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer [49.1761733723771]
本稿では,テキスト・画像生成における効率的なスケーリングを実現する線形拡散変換器であるSANA-1.5を提案する。
効率的なトレーニングスケーリング、モデルの深さ決定、推論時間スケーリングの3つの重要なイノベーションを紹介します。
これらの戦略により、SANA-1.5 は GenEval 上のテキスト計算画像アライメントスコア 0.81 を達成し、VILA-Judge による推論スケーリングにより、さらに 0.96 に改善できる。
論文 参考訳(メタデータ) (2025-01-30T15:31:48Z) - Measuring the Energy Consumption and Efficiency of Deep Neural Networks:
An Empirical Analysis and Design Recommendations [0.49478969093606673]
BUTTER-Eデータセットは、BUTTER Empirical Deep Learningデータセットの拡張である。
このデータセットは、データセットのサイズ、ネットワーク構造、エネルギー使用の複雑な関係を明らかにする。
本稿では,ネットワークサイズ,コンピューティング,メモリ階層を考慮した,単純かつ効率的なエネルギーモデルを提案する。
論文 参考訳(メタデータ) (2024-03-13T00:27:19Z) - TurboViT: Generating Fast Vision Transformers via Generative
Architecture Search [74.24393546346974]
近年、視覚変換器は様々な視覚認知タスクに対処する上で、前例のないレベルの性能を示している。
近年,効率的な視覚変換器の設計に関する研究が盛んに行われている。
本研究では,生成型アーキテクチャサーチによる高速ビジョントランスフォーマーアーキテクチャの設計について検討する。
論文 参考訳(メタデータ) (2023-08-22T13:08:29Z) - GOHSP: A Unified Framework of Graph and Optimization-based Heterogeneous
Structured Pruning for Vision Transformer [76.2625311630021]
視覚変換器(ViT)は、様々なコンピュータビジョンタスクにおいて非常に印象的な経験的性能を示している。
この問題を緩和するために、構造化プルーニングはモデルサイズを圧縮し、実用的な効率を実現するための有望な解決策である。
グラフと最適化に基づく構造的プルーニング(Structured Pruning)を統合化したフレームワークであるGOHSPを提案する。
論文 参考訳(メタデータ) (2023-01-13T00:40:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。