論文の概要: Group-Shared Low-Rank Approximation for Mobile-Efficient Pointwise Convolutions in Large-Kernel CNNs
- arxiv url: http://arxiv.org/abs/2608.26069v2
- Date: Thu, 27 Aug 2026 08:17:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.905272
- Title: Group-Shared Low-Rank Approximation for Mobile-Efficient Pointwise Convolutions in Large-Kernel CNNs
- Title(参考訳): 大規模カーネルCNNにおける移動効率の良いポイントワイド畳み込みに対する群共有低ランク近似
- Authors: Hao Luo, Yiting Yang, Wenyi Zhao, Man Jiang, Zhijun Lin, Ghulam Mohiuddin, Ting Jiang, Kunming Luo, Zihao Zhang, Qingsen Yan, Guoqing Wang, Wei Dong, Peng Wang,
- Abstract要約: 本稿では,新しいSingular Value Decomposition(SVD)に基づくパラメータ共有戦略であるChannel Group-Shared(CGS)低ランク近似を提案する。
CGSは、エッジデバイスに事前トレーニングされたCNNモデルのデプロイを可能にするため、高性能なビジョンモデルと実用的なエッジデプロイメントのギャップを埋めることができる。
- 参考スコア(独自算出の注目度): 44.54167094821349
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-kernel Convolutional Neural Networks (CNNs) deliver remarkable performance in vision tasks by significantly expanding receptive fields, yet their quadratic parameter growth critically impedes storage-efficient edge deployment. While existing efficient architectures adopt parameter-efficient depthwise separable convolution backbones that leverage techniques like low-rank approximation and weight sharing to compress depthwise convolutions, we identify a critical oversight: pointwise convolutions dominate parameter volume (>87% in models like RepLKNet-31B) and constitute the primary deployment bottleneck on resource-constrained edge devices. This results in prohibitive storage costs and severe memory-loading constraints on resource-limited devices (e.g., smartphones with 4-12 GB Random Access Memory (RAM)). To overcome this, we propose Channel Group-Shared (CGS) low-rank approximation, a novel Singular Value Decomposition (SVD)-based parameter-sharing strategy. CGS constructs a structured low-rank paradigm isomorphic to SVD decomposition, comprising shared (high-parameter-cost) down/up-projection matrices across channel groups within a layer and channel-group-specific (low-parameter-cost) scalable diagonal matrices. This group-sharing design achieves significant parameter reduction. Extensive experiments demonstrate that large-kernel CNNs (RepLKNet, ConvNeXt, SLaK) enhanced with CGS strike an empirically favorable balance between competitive performance and substantially reduced storage costs. Crucially, by alleviating storage constraints, reducing memory bandwidth pressure during loading, and minimizing model loading latency, CGS enables the feasible deployment of pre-trained large-kernel CNN models on edge devices, thereby bridging the gap between high-performance vision models and practical edge deployment.
- Abstract(参考訳): 大規模カーネル畳み込みニューラルネットワーク(CNN)は、受容場を著しく拡張することで視覚タスクにおいて顕著なパフォーマンスを提供するが、その二次パラメータの成長は、ストレージ効率のよいエッジデプロイメントを著しく阻害する。
既存の効率的なアーキテクチャでは,低ランク近似や重み共有といった手法を生かしたパラメータ効率の深い分離可能な畳み込みバックボーンが採用されているが,パラメータボリューム(RepLKNet-31Bのようなモデルでは>87%)のポイントワイド畳み込みが重要視されている。
これにより、リソース制限のあるデバイス(例:4-12GBのRandom Access Memory (RAM)を持つスマートフォン)では、ストレージコストの禁止とメモリ負荷の厳しい制約が発生します。
そこで我々は,新しいSingular Value Decomposition (SVD) に基づくパラメータ共有戦略であるChannel Group-Shared (CGS) Low-rank approximationを提案する。
CGSはSVD分解に同型な構造化された低ランクのパラダイムを構築し、層内のチャネル群にまたがる共有(高パラメータコスト)ダウン/アップ・プロジェクション行列と、チャネル群固有の(低パラメータコスト)スケーラブルな対角行列からなる。
このグループ共有設計は重要なパラメータ還元を実現する。
大規模なカーネルCNN(RepLKNet、ConvNeXt、SLaK)がCGSによって強化され、競争性能とストレージコストの大幅な削減が実証的に有利なバランスを取ることを示した。
重要なのは、ストレージの制約を緩和し、ロード中のメモリ帯域幅のプレッシャーを低減し、モデルのロードレイテンシを最小化することで、CGSはエッジデバイス上でトレーニング済みの大規模カーネルCNNモデルのデプロイを可能にすることで、高性能なビジョンモデルと実用的なエッジデプロイメントのギャップを埋めることができる。
関連論文リスト
- ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields [29.09208632865348]
本稿では、局所的な時間的要求に基づいて表現能力を割り当てるアダプティブ・キャパシティ・アンカーベースのフレームワークを提案する。
提案手法は,最先端のアンカー方式よりも最大1.5倍高い圧縮を実現し,同等の品質を保っている。
論文 参考訳(メタデータ) (2026-08-05T08:47:48Z) - Robust Auto-associative Memory via Convolutional Restricted Hopfield Networks [0.22940141855172036]
連想記憶モデルはパターン検索において基本的な役割を果たす。
Modern Hopfield Networks (MHNs) や Predictive Coding Networks (PCNs) といった既存のアプローチでは、ストレージ容量、計算効率、堅牢性のバランスが制限されている。
本稿では、畳み込み特徴抽出とアトラクタベースのメモリ検索を統合した構造化潜在空間における畳み込み制限ホップフィールドネットワーク(CRHN)を提案する。
論文 参考訳(メタデータ) (2026-06-11T21:25:54Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression [14.759497852655047]
本稿では,新しいストリーミング動的ガウススプラッティング圧縮フレームワークであるHPCを提案する。
これは、非占有空間におけるパラメータ冗長性を避けるために、ガウス単位の階層的な点ベースの潜在表現を用いる。
高い復元率を維持しながら、ベースラインに対して67%のストレージ削減を実現している。
論文 参考訳(メタデータ) (2026-01-31T11:35:02Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z) - Learning k-Level Structured Sparse Neural Networks Using Group Envelope Regularization [4.0554893636822]
制約のあるリソースに大規模ディープニューラルネットワークをデプロイするための新しいアプローチを導入する。
この手法は推論時間を短縮し、メモリ需要と消費電力を減らすことを目的とする。
論文 参考訳(メタデータ) (2022-12-25T15:40:05Z) - Efficient Micro-Structured Weight Unification and Pruning for Neural
Network Compression [56.83861738731913]
ディープニューラルネットワーク(DNN)モデルは、特にリソース制限されたデバイスにおいて、実用的なアプリケーションに不可欠である。
既往の非構造的あるいは構造化された重量刈り法は、推論を真に加速することはほとんど不可能である。
ハードウェア互換のマイクロ構造レベルでの一般化された重み統一フレームワークを提案し,高い圧縮と加速度を実現する。
論文 参考訳(メタデータ) (2021-06-15T17:22:59Z) - Adaptive Subcarrier, Parameter, and Power Allocation for Partitioned
Edge Learning Over Broadband Channels [69.18343801164741]
パーティショニングエッジ学習(PARTEL)は、無線ネットワークにおいてよく知られた分散学習手法であるパラメータサーバトレーニングを実装している。
本稿では、いくつかの補助変数を導入してParticleELを用いてトレーニングできるディープニューラルネットワーク(DNN)モデルについて考察する。
論文 参考訳(メタデータ) (2020-10-08T15:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。