論文の概要: Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective
- arxiv url: http://arxiv.org/abs/2607.03784v1
- Date: Sat, 04 Jul 2026 09:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.714441
- Title: Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective
- Title(参考訳): 視覚変換器の深度プルーニング再考:不均一性を考慮した視点
- Authors: Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang,
- Abstract要約: HetDPTは次元ミスマッチを回避するヘテロジニティ対応深さ刈り法である。
HetDPT は精度を維持しながら DeiT-B の 1.58$times$ Speedup を達成し、DeiT-S の 1.39$times$ speedup をほぼ精度の劣化のないものにした。
幅のプルーニングと組み合わせると、HetDPT+は極端なViTプルーニングで新しい最先端のレコードを設定する。
- 参考スコア(独自算出の注目度): 12.461911138669848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While prior studies have successfully compressed vision Transformers (ViTs) through various pruning techniques, most have concentrated on width pruning to achieve significant reductions in model size. Depth pruning, which removes entire layers from a ViT, is notoriously difficult for accuracy recovery despite its potential to deliver higher speedups, limiting the acceleration achieved by existing joint width-and-depth pruning methods. In this work, we reveal that the failure of existing depth pruning methods lies in their neglect of heterogeneity between different layers, and we introduce HetDPT, a heterogeneity-aware depth pruning method that avoids dimension mismatch. Comprehensive experiments on ImageNet-1K, CIFAR-100, COCO, and ADE20K validate our method: HetDPT achieves a 1.58$\times$ speedup for DeiT-B while maintaining accuracy and a 1.39$\times$ speedup for DeiT-S with nearly no accuracy degradation. Furthermore, when combined with width pruning, HetDPT+ sets a new state-of-the-art record in extreme ViT pruning, enhancing the acceleration ratio from 4.24$\times$ to 5.19$\times$ for the Isomorphic-Pruning-2.6G configuration while maintaining near-lossless accuracy; our code is available at https://github.com/Efficient-AI-for-All/HetDPT.
- Abstract(参考訳): 以前の研究では、様々なプルーニング技術を通じて視覚変換器(ViT)を圧縮することに成功しているが、そのほとんどは、モデルサイズを大幅に削減するために幅のプルーニングに集中している。
ViTから全層を除去する深さプルーニングは、より高いスピードアップを実現する可能性があり、既存のジョイント幅と深さプルーニング法によって達成される加速度を制限することで知られている。
本研究では,各層間の不均一性を無視する上で,既存の深度刈り込み手法の故障が原因であることを明らかにし,次元ミスマッチを回避する不均一性を考慮した深度刈り出し手法HetDPTを導入する。
HetDPTは精度を保ちながらDeiT-Bの1.58$\times$スピードアップを達成し、DeiT-Sの1.39$\times$スピードアップは精度をほとんど損なわない。
さらにHetDPT+は、幅のプルーニングと組み合わせることで、最先端のViTプルーニングに新たな最先端記録を設定し、アクセラレーション比を4.24$\times$から5.19$\times$まで高めながら、ほぼロスレスな精度を維持しながら、アイソモルフィック・プルーニング-2.6Gの構成を維持した上で、我々のコードはhttps://github.com/Efficient-AI-for-All/HetDPTで利用可能である。
関連論文リスト
- $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - FlattenGPT: Depth Compression for Transformer with Layer Flattening [89.7587433008809]
textbfFlattenGPTは、深さ方向の冗長性を検出し、減少させる新しい方法である。
実験によると、FlattenGPTはモデル効率を十分なトレードオフで向上させる。
論文 参考訳(メタデータ) (2026-02-09T16:22:58Z) - Accelerating Vision Transformers with Adaptive Patch Sizes [58.48800204993534]
Vision Transformerは、入力画像をコンテンツに関係なく一様サイズのパッチに分割する。
適応パッチ変換器(APT)は,複数の異なるパッチサイズを同一画像内で使用することで,この問題に対処する。
APTはViT推論とトレーニングの大幅な高速化を実現し、ViT-Lでは40%、ViT-Hでは50%のスループット向上を実現している。
論文 参考訳(メタデータ) (2025-10-20T20:37:11Z) - CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs [89.79139531731637]
ビジョントランスフォーマー (ViT) は様々なビジョンタスクの最先端モデルとして登場した。
本稿では,高次アンダーライン精度,高速アンダーライン推論速度,下流タスクに対する好適なアンダーライン変換性を両立させたViTの合同アンダーライン圧縮法を提案する。
論文 参考訳(メタデータ) (2023-09-27T16:12:07Z) - CAP: Correlation-Aware Pruning for Highly-Accurate Sparse Vision Models [22.055655390093722]
correlation Aware Pruner (CAP) は最先端アーキテクチャの圧縮限界を大幅に押し下げる。
新たな理論的に調整されたプルーナーは、プルーニングプロセス自体の複雑な重量相関を正確かつ効率的に処理する。
自己監督技術を用いて訓練された超高精度な大規模視覚モデルも、適度な空間にプルーニングでき、精度の低下も無視できることを示す。
論文 参考訳(メタデータ) (2022-10-14T12:19:09Z) - Q-ViT: Accurate and Fully Quantized Low-bit Vision Transformer [56.87383229709899]
我々は、完全量子化視覚変換器(Q-ViT)のための情報修正モジュール(IRM)と分配誘導蒸留法を開発した。
我々の手法は、先行技術よりもはるかに優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-10-13T04:00:29Z) - CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity
Prediction [16.578899848650675]
ViT(Vision Transformer)は、様々なコンピュータビジョンアプリケーションにおいて、競合する精度を達成したが、その計算コストは、リソース制限されたモバイルデバイスへのデプロイを妨げる。
本稿では, CP-ViTモデルにおいて, 精度損失を最小化しつつ, 計算冗長性を抑えるために, 動的かつ段階的に間隔を予測し, CP-ViTと呼ばれるカスケード刈り込みフレームワークを提案する。
論文 参考訳(メタデータ) (2022-03-09T08:15:14Z) - Global Vision Transformer Pruning with Hessian-Aware Saliency [93.33895899995224]
この研究はヴィジュアルトランスフォーマー(ViT)モデルの共通設計哲学に挑戦する。
遅延を意識した規則化による直接遅延低減を実現し,すべての層や構造に匹敵する新しいヘッセン型構造解析基準を導出する。
DeiT-Baseモデルで反復的なプルーニングを実行すると、NViT(Novel ViT)と呼ばれる新しいアーキテクチャファミリが生まれ、パラメータをより効率的に利用する新しいパラメータが現れる。
論文 参考訳(メタデータ) (2021-10-10T18:04:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。