論文の概要: JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
- arxiv url: http://arxiv.org/abs/2605.26636v1
- Date: Tue, 26 May 2026 07:17:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.721601
- Title: JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
- Title(参考訳): JetViT: トレーニング後アテンション検索による高分解能高分解能ビジョントランス
- Authors: Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai,
- Abstract要約: JetViTは、ハイブリッドアーキテクチャビジョントランスフォーマー(ViT)モデルの新しいファミリーである。
NVIDIA H100 GPUでは、JetViTは最大1.79倍のスループットと44.81%のレイテンシを実現し、精度を犠牲にしている。
- 参考スコア(独自算出の注目度): 49.62748530356587
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce JetViT, a novel family of hybrid-architecture Vision Transformer (ViT) models that match the accuracy of state-of-the-art full-attention vision foundation models while achieving substantially higher inference efficiency on high-resolution images. At the core of our approach is Post-Training Attention Search, a post-training acceleration framework that converts pre-trained full-attention ViTs into efficient hybrid-attention variants by identifying and replacing redundant full-attention blocks with linear or window-attention blocks. By inheriting the MLP and attention weights from the base model, Post-Training Attention Search efficiently explores the architectural design space through three key steps: (1) optimizing the linear-attention block design; (2) finding the best combination of linear-attention and window-attention blocks; and (3) identifying and preserving critical full-attention blocks. We evaluate JetViT on two representative high-resolution vision foundation models, DINOv3 and DepthAnythingV2. On the NVIDIA H100 GPU, JetViT achieves up to 1.79x higher throughput and up to 44.81% lower latency without sacrificing accuracy. We will release our code and accelerated ViT models soon.
- Abstract(参考訳): 我々は,ハイブリットアーキテクチャ・ビジョン・トランスフォーマー(ViT)モデルの新たなファミリーであるJetViTを紹介した。
私たちのアプローチの核心は、トレーニング後のアクセレーションフレームワークであるPost-Training Attention Searchです。これは、トレーニング済みのフルアテンション ViT を、冗長なフルアテンションブロックを線形またはウィンドウアテンションブロックで識別し置き換えることで、効率的なハイブリッドアテンション変種に変換するものです。
MLPと注意重みをベースモデルから継承することにより,(1)線形アテンションブロック設計の最適化,(2)線形アテンションブロックとウィンドウアテンションブロックの最良の組み合わせの発見,(3)重要なフルアテンションブロックの特定と保存,という3つの重要なステップを通じて,アーキテクチャ設計空間を効率的に探索する。
我々は、DINOv3とDepthAnythingV2という2つの代表的な高解像度ビジョン基盤モデル上でJetViTを評価する。
NVIDIA H100 GPUでは、JetViTは最大1.79倍のスループットと44.81%のレイテンシを実現し、精度を犠牲にしている。
もうすぐコードをリリースし、ViTモデルを加速します。
関連論文リスト
- MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers [6.427162946484909]
Vision Transformer (ViT) は、視覚タスク全体にわたって顕著な精度を達成するが、エッジデプロイメントには計算コストがかかる。
本稿では,実デバイス効率に最適化された軽量ビジョントランスであるMicroViTv2を提案する。
論文 参考訳(メタデータ) (2026-05-11T07:54:27Z) - FastVGGT: Training-Free Acceleration of Visual Geometry Transformer [83.67766078575782]
VGGTは最先端のフィードフォワード視覚幾何学モデルである。
本稿では,VGGTの高速化のためのトレーニングフリーメカニズムを用いて,3次元領域におけるトークンのマージを利用したFastVGGTを提案する。
1000の入力画像により、FastVGGTはVGGTの4倍の高速化を実現し、長いシーケンスシナリオにおけるエラーの蓄積を緩和する。
論文 参考訳(メタデータ) (2025-09-02T17:54:21Z) - VMoBA: Mixture-of-Block Attention for Video Diffusion Models [29.183614108287276]
本稿では,ビデオ拡散モデル(VDM)に特化して適応する新しい注意機構,VMoBAについて紹介する。
VMoBAは、事前訓練されたビデオトランスフォーマー内の注意パターンの詳細な分析によって、オリジナルのMoBAフレームワークを3つの重要な修正で強化する。
VMoBAは、長いシーケンスでのVDMのトレーニングを著しく加速し、2.92倍のFLOPと1.48倍のレイテンシ高速化を実現している。
論文 参考訳(メタデータ) (2025-06-30T13:52:31Z) - ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models [39.520825264698374]
視覚変換器(ViT)は、グローバルな自己注意を通じて顕著な進歩を遂げてきたが、その二次的な複雑さは高解像度入力では禁止される可能性がある。
本稿では、リッチなViT表現を線形時間再帰型モデルに変換するクロスアーキテクチャ蒸留フレームワークであるViT-Linearizerについて述べる。
この結果から,RNNに基づく大規模視覚タスクの優れた実現可能性を示し,理論的効率性と実世界の実践とのギャップを埋めることができた。
論文 参考訳(メタデータ) (2025-03-30T15:35:24Z) - Exploring Lightweight Hierarchical Vision Transformers for Efficient
Visual Tracking [69.89887818921825]
HiTは、さまざまなデバイス上で高速に動作可能な、効率的なトラッキングモデルの新たなファミリーだ。
HiTはLaSOTベンチマークで64.6%のAUCを達成した。
論文 参考訳(メタデータ) (2023-08-14T02:51:34Z) - GOHSP: A Unified Framework of Graph and Optimization-based Heterogeneous
Structured Pruning for Vision Transformer [76.2625311630021]
視覚変換器(ViT)は、様々なコンピュータビジョンタスクにおいて非常に印象的な経験的性能を示している。
この問題を緩和するために、構造化プルーニングはモデルサイズを圧縮し、実用的な効率を実現するための有望な解決策である。
グラフと最適化に基づく構造的プルーニング(Structured Pruning)を統合化したフレームワークであるGOHSPを提案する。
論文 参考訳(メタデータ) (2023-01-13T00:40:24Z) - ViTALiTy: Unifying Low-rank and Sparse Approximation for Vision
Transformer Acceleration with a Linear Taylor Attention [23.874485033096917]
Vision Transformer (ViT)は、様々なコンピュータビジョンアプリケーションのための畳み込みニューラルネットワークの競合代替として登場した。
そこで本研究では,VitaliTy という,VT の推論効率向上のためのハードウェア設計フレームワークを提案する。
ViTALiTyは、ViTにおける注目の低ランクとスパースの両方のコンポーネントを統合する。
論文 参考訳(メタデータ) (2022-11-09T18:58:21Z) - EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense
Prediction [67.11722682878722]
この研究は、新しいマルチスケール線形注意を持つ高解像度ビジョンモデルのファミリーであるEfficientViTを提示する。
マルチスケール線形注意は,グローバルな受容場とマルチスケール学習を実現する。
EfficientViTは従来の最先端モデルよりも優れたパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2022-05-29T20:07:23Z) - Twins: Revisiting Spatial Attention Design in Vision Transformers [81.02454258677714]
本稿では,注意深い空間的注意機構が最先端のスキームに対して好適に機能することを実証する。
Twins-PCPVTとTwins-SVTの2つのビジョントランスアーキテクチャを提案します。
提案するアーキテクチャは,現代のディープラーニングフレームワークに高度に最適化された行列乗算のみを含む,高効率かつ実装が容易である。
論文 参考訳(メタデータ) (2021-04-28T15:42:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。