論文の概要: Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation
- arxiv url: http://arxiv.org/abs/2608.10805v2
- Date: Thu, 13 Aug 2026 03:25:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.704914
- Title: Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation
- Title(参考訳): I/O認識による高速かつメモリ効率の良いウェーブレット畳み込み
- Authors: Amit Aflalo, Shahaf E. Finder, Roy Amoyal, Eran Treister, Oren Freifeld,
- Abstract要約: Wavelet Convolution(WTConv)は、標準のコンボリューションの代替として人気が高まっている。
我々の改定により、モデル化されたトラフィックを約2.55倍に減らし、参照のトレーニング速度を最大4.35倍に向上する。
我々の改定はWTConvの利点を保ちつつ、実行時間とメモリフットプリントを大幅に削減します。
- 参考スコア(独自算出の注目度): 20.810698047691794
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Wavelet convolution (WTConv) has emerged as an increasingly popular drop-in replacement for standard convolutions, expanding a network's receptive field exponentially with the number of decomposition levels while keeping the parameter count linear. However, its reference implementation is severely memory-bound due to excessive data movement through high-bandwidth memory (HBM). We develop an I/O model of WTConv to characterize this bottleneck and use it to guide three algebraic reformulations: (1) recomputing the inexpensive Haar analysis butterfly on chip, (2) collapsing the multi-level synthesis cascade into a single closed-form pass indexed by output-coordinate bits, and (3) folding learned per-channel scales into the convolution weights. Together, these reformulations enable an I/O-aware fused implementation that substantially reduces HBM traffic. We evaluate the WTConvNeXt configuration across decomposition levels and a broad range of tensor shapes. Despite performing comparable arithmetic, the reference WTConv is substantially slower than the depthwise convolution it replaces. Our reformulation reduces modeled HBM traffic by approximately $2.55\times$, yielding up to a $4.35\times$ training speedup over the reference while roughly halving peak memory usage. Thus, our reformulation preserves the benefits of WTConv while substantially reducing its execution time and memory footprint, removing the systems overhead that previously limited its practical efficiency.
- Abstract(参考訳): ウェーブレット畳み込み(WTConv)は、標準畳み込みの代替として人気が高まりつつあり、パラメータ数を線形に保ちながら、分解レベルの数と指数関数的にネットワークの受容場を拡大している。
しかし、その参照実装は、高帯域メモリ(HBM)による過剰なデータ移動のため、メモリバウンドが非常に大きい。
このボトルネックを特徴づけるWTConvのI/Oモデルを開発し,(1)安価なハール解析バタフライをチップ上に再計算し,(2)出力座標ビットでインデックスされた1つの閉形式パスに多段合成カスケードを折り畳み,(3)チャネル毎に学習したスケールを畳み込み重みに分解する3つの代数的再構成を導出する。
これらの変更により、HBMトラフィックを大幅に削減するI/O対応実装が実現される。
WTConvNeXtの構成を,分解レベルと幅広いテンソル形状で評価した。
WTConvは、同等の計算量を実行するにもかかわらず、それが置き換える奥行きの畳み込みよりもかなり遅い。
我々の改定により、モデル化されたHBMトラフィックは約2.55\times$に減少し、ピークメモリ使用量の半減とともに、基準よりも4.35\times$のトレーニングスピードアップとなる。
これにより、WTConvの利点を保ちつつ、実行時間とメモリフットプリントを大幅に削減し、それまでの実用効率を制限していたシステムのオーバーヘッドを取り除くことができる。
関連論文リスト
- GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation [6.515041755039866]
GRINQHは、量子化とスパーシフィケーションを統合することでデコーディングを加速する、重量のみのポストトレーニング量子化フレームワークである。
Llama3とQwen3モデルで評価すると、GRINQHは3ビットと4ビットの設定で最先端の固定精度と混合精度のベースラインを上回っている。
我々は、階層型ネストメモリレイアウトをカスタムGPUカーネルのマルチ精度ストレージに活用することにより、理論的スピードアップを実験的に検証する。
論文 参考訳(メタデータ) (2026-06-22T14:42:34Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Taming the Tail: NoI Topology Synthesis for Mixed DL Workloads on Chiplet-Based Accelerators [8.493759841403682]
CPU/GPUと新興技術(HBM/DRAM)の異種チップレットベースシステムによるスケール向上
しかし、このパッケージ上のデアグリゲーションはNetwork-on-Interposer(NoI)に遅延をもたらす
論文 参考訳(メタデータ) (2025-10-28T06:36:44Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - DistZO2: High-Throughput and Memory-Efficient Zeroth-Order Fine-tuning LLMs with Distributed Parallel Computing [4.589472292598182]
細調整された大規模言語モデル(LLM)は、その厳密なスケールのため、リソース集約型のままである。
LLMの分散ゼロオーダー微調整のためのメモリ効率のよいフレームワークであるDistZO2を提案する。
論文 参考訳(メタデータ) (2025-07-03T22:53:34Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。