論文の概要: RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT
- arxiv url: http://arxiv.org/abs/2606.08156v1
- Date: Sat, 06 Jun 2026 13:13:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.8815
- Title: RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT
- Title(参考訳): RAPID: レイヤワイズ冗長性対応プルーニングと高効率ViTのための重要駆動型トケマージ
- Authors: Kyumin Choi, Ikbeom Jang,
- Abstract要約: 視覚変換器(ViT)は高い性能を実現するが、二次的な自己注意の複雑さにより高い計算コストを被る。
本稿では,トークン表現の層的特性に還元戦略を適用した深度対応型トークン還元フレームワークを提案する。
我々のフレームワークは、階層的特徴進化と縮小戦略を整合させることにより、視覚モデルを最適化するためのトレーニング不要のテンプレートを提供する。
- 参考スコア(独自算出の注目度): 0.014257559724536567
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Transformers (ViTs) achieve strong performance but suffer from high computational costs due to quadratic self-attention complexity. Although token reduction techniques such as pruning and merging mitigate this, they typically overlook how representations evolve across network depth. We propose RAPID, a depth-aware token reduction framework that adapts reduction strategies to the layer-wise characteristics of token representations. The primary methodological contribution is a bifurcated strategy: in shallow-to-middle layers, RAPID employs a redundancy-similarity aware pruning metric to eliminate over-represented local patterns. As features transition to global semantic concepts in deeper layers, the framework shifts to an importance-similarity aware merging mechanism. This stage leverages classification (CLS) token attention weights to protect semantically critical tokens while fusing less important but similar neighbors. Empirical validation on ImageNet-1K using ViT and DeiT architectures demonstrates that RAPID establishes a superior accuracy-compression Pareto frontier compared to plug-and-play baselines such as ToMe and ToFu. RAPID is particularly robust in aggressive compression regimes, achieving up to 4.29% higher accuracy than ToMe at extreme reduction rates. Our framework provides a training-free template for optimizing vision models by aligning reduction strategies with hierarchical feature evolution.
- Abstract(参考訳): 視覚変換器(ViT)は高い性能を実現するが、二次的な自己注意の複雑さにより高い計算コストを被る。
プルーニングやマージングのようなトークン削減技術は、これを緩和するが、一般的にはネットワークの深さを越えて表現がどのように進化するかを見落としている。
トークン表現の層的特性に還元戦略を適用した深度対応型トークン還元フレームワークRAPIDを提案する。
RAPIDは、浅層から中層までの層において、過剰に表現された局所パターンを排除するために冗長性に類似したプルーニング指標を用いる。
機能がより深いレイヤにおけるグローバルなセマンティックな概念に移行するにつれて、フレームワークは重要で類似性に敏感なマージメカニズムへと移行する。
この段階は、分類(CLS)トークンの注意重みを利用して意味論的に重要なトークンを保護すると同時に、あまり重要でないが類似した近隣のトークンを融合させる。
ViT と DeiT アーキテクチャを用いた ImageNet-1K の実証検証では、RAPID がToMe やToFu のようなプラグアンドプレイベースラインに比べて精度の高いパレートフロンティアを確立することが示されている。
RAPIDは攻撃的な圧縮方式では特に堅牢であり、ToMeよりも最大4.29%の精度で極端に低下する。
我々のフレームワークは、階層的特徴進化と縮小戦略を整合させることにより、視覚モデルを最適化するためのトレーニング不要のテンプレートを提供する。
関連論文リスト
- TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders [51.71228803075235]
我々は、深部圧縮オートエンコーダのためのViTベースのアーキテクチャであるTC-AEを提案する。
トークン・ツー・ラテント圧縮を2段階に分解し,構造的情報損失を低減する。
画像トークンのセマンティック構造を,共同指導による訓練によって強化し,より生成しやすい潜伏者へと導いた。
論文 参考訳(メタデータ) (2026-04-08T17:53:52Z) - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models [98.72926158261937]
本稿では,Visual AutoRegressive モデルのためのトレーニングフリートークン解析フレームワークを提案する。
我々は局所的なテクスチャの詳細を捉えるために軽量なハイパスフィルタを使用し、グローバルな構造情報を保存するために主成分分析(PCA)を活用している。
スパーストークンの下で有効な次世代の予測を維持するために,近接した特徴伝達戦略を導入する。
論文 参考訳(メタデータ) (2026-03-02T11:35:05Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Rethinking Autoregressive Models for Lossless Image Compression via Hierarchical Parallelism and Progressive Adaptation [75.58269386927076]
自己回帰(AR)モデルは、しばしば計算コストの禁止のために非現実的に除外される。
この研究は、階層的並列性とプログレッシブ適応に基づくフレームワークを導入して、このパラダイムを再考する。
各種データセット(自然,衛星,医療)の実験により,本手法が新たな最先端圧縮を実現することを確認した。
論文 参考訳(メタデータ) (2025-11-14T06:27:58Z) - Efficient Token Compression for Vision Transformer with Spatial Information Preserved [59.79302182800274]
トーケン圧縮は、トランスモデルの計算およびメモリ要求の低減に不可欠である。
本稿では,Prune と Merge という,効率的なハードウェア互換のトークン圧縮手法を提案する。
論文 参考訳(メタデータ) (2025-03-30T14:23:18Z) - Fraesormer: Learning Adaptive Sparse Transformer for Efficient Food Recognition [9.83509397800422]
2つのコア設計を持つ適応的で効率的なスパーストランスフォーマーアーキテクチャ (Fraesormer) を提案する。
ATK-SPAは学習可能なGated Dynamic Top-K Operator (GDTKO)を使用して重要な注意点を保持する。
HSSFGNはマルチスケールの特徴表現を実現するためにゲーティング機構を採用している。
論文 参考訳(メタデータ) (2025-03-15T05:13:26Z) - Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation [36.46163240168576]
Open-vocabulary semantic segmentation (OVSS)は、任意のテキスト記述によって定義された特定のクラスに画像内の各ピクセルを割り当てることを目的としたオープンワールドタスクである。
大規模視覚言語モデルの最近の進歩は、そのオープン語彙理解能力を示している。
本研究では, 冗長性を効果的に低減し, 精度と効率のバランスをとる新しいフレームワークであるERR-Segを紹介する。
論文 参考訳(メタデータ) (2025-01-29T13:24:53Z) - Semantic Hierarchical Prompt Tuning for Parameter-Efficient Fine-Tuning [13.384550074613717]
Visual Prompt Tuningは、フル微調整に比べて優れたパフォーマンスで知られている。
船は性能を大幅に改善し、VTAB-1kタスクのVT-B/16バックボーンでVPTよりも精度が4.9%向上した。
論文 参考訳(メタデータ) (2024-12-22T10:28:52Z) - PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference [44.77064952091458]
PRANCEはVision Transformer圧縮フレームワークで、アクティベートされたチャネルを共同で最適化し、入力の特性に基づいてトークンを削減する。
本稿では,ViTの推論過程を逐次決定プロセスとしてモデル化する,新しい「結果と結果」学習機構を提案する。
我々のフレームワークは、プルーニング、マージング、プルーニングマージングといった様々なトークン最適化手法と互換性があることが示されている。
論文 参考訳(メタデータ) (2024-07-06T09:04:27Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。