論文の概要: Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers
- arxiv url: http://arxiv.org/abs/2608.00264v1
- Date: Fri, 31 Jul 2026 20:14:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.564723
- Title: Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers
- Title(参考訳): 視覚変換器におけるアテンションヘッドの可読性誘導型ソフトプルーニング
- Abstract要約: そこで本研究では,ラプラシアン固有ベクトルに基づく各注目ヘッドのスペクトル解析と新しい可視化手法を提案する。
視覚変換器のブロック構造に関する最近の観測に基づいて,注目頭部のセマンティッククラスタリングを行い,機能的冗長性を特定する。
本稿では、LapSum Soft Top-Kアプローチに基づくエンドツーエンドの差別化可能なプルーニングフレームワークであるSAPERを紹介する。
- 参考スコア(独自算出の注目度): 8.49520972146025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision foundation models, such as DINOv2, learn highly expressive representations but rely on massive, opaque architectures that demand substantial computational power and memory. To provide an interpretable-guided and efficient solution to this issue, we first propose a spectral analysis and new visualization technique for individual attention heads based on the Laplacian eigenvectors of their attention maps. Building upon recent observations regarding the block structure of Vision Transformers, we perform semantic clustering of attention heads and identify functional redundancies. Leveraging these insights, we introduce SAPER (Soft Attention PrunER), an end-to-end differentiable pruning framework based on the LapSum Soft Top-K approach. Extensive experiments on ImageNet-1K demonstrate that SAPER achieves a highly favorable accuracy-efficiency trade-off, outperforming the competitive RAPTOR baseline in FLOPs reduction while preserving strong classification performance.
- Abstract(参考訳): DINOv2のようなビジョンファウンデーションモデルは、高度に表現力のある表現を学習するが、かなりの計算能力とメモリを必要とする巨大な不透明なアーキテクチャに依存している。
この問題に対する解釈可能かつ効率的な解法として,まず,その注意マップのラプラシアン固有ベクトルに基づいて,個々の注目者に対するスペクトル分析と新しい可視化手法を提案する。
視覚変換器のブロック構造に関する最近の観測に基づいて,注目頭部のセマンティッククラスタリングを行い,機能的冗長性を特定する。
これらの知見を生かしたSAPER(Soft Attention PrunER)は,LapSum Soft Top-Kアプローチに基づくエンドツーエンドの差別化可能なプルーニングフレームワークである。
ImageNet-1Kの大規模な実験により、SAPERは高い精度と効率のトレードオフを達成し、強力な分類性能を維持しつつ、FLOPの削減において競合するRAPTORベースラインを上回った。
関連論文リスト
- VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding [50.904820090651974]
VEN-VLは、効果的かつ効率的な知覚のための視覚アンサンブルMoEフレームワークである。
まず、異なる視点の視覚的表現を統一することで、情報容量を増強する。
そして、情報密度を高めるために、特殊視覚の専門家による適応ルータで段階的に圧縮する。
論文 参考訳(メタデータ) (2026-05-25T15:28:48Z) - Accelerating Vision Foundation Models with Drop-in Depthwise Convolution [51.50107862675191]
我々は、注目ヘッドのドロップイン代替として機能する、効率的な奥行き畳み込みベースの層を導入する。
画像分類とセグメンテーションの両方のタスクにおいて,提案手法は性能劣化を最小限に抑えながら17~20%の推論高速化を実現している。
論文 参考訳(メタデータ) (2026-05-21T08:07:23Z) - Large Vision-Language Models Get Lost in Attention [51.851592109135716]
本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
論文 参考訳(メタデータ) (2026-05-07T04:45:52Z) - Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing [2.099922236065961]
Face Anti-Spoofing (FAS) は、目に見えない環境にまたがる堅牢なドメインの一般化を必要とするため、依然として困難である。
本稿では、FASの高効率で堅牢なベースラインを確立するために、視覚のみの基礎モデルの可能性を再考する。
包括的分析により、自己監督型視覚モデル、特にDINOv2 with Registersは、注意要素を著しく抑制し、重要できめ細かなスプーフィングキューを捉えていることが明らかとなった。
論文 参考訳(メタデータ) (2026-04-21T08:05:21Z) - CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models [14.30682201364961]
本研究では,注目度をベクトルサイズで重み付けした注意貢献が,視覚的トークン選択のためのより正確な基準を提供することを示す。
本稿では、重要な機能遷移における注意貢献を用いて視覚トークンを創出する二重戦略フレームワークであるCAPA(Contribution-Aware Pruning and FFN Approximation)を紹介する。
論文 参考訳(メタデータ) (2026-01-30T19:09:03Z) - Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning [70.57180215148125]
ビジュアルインストラクションチューニングは、大きな言語モデルで視覚世界を理解できるようにすることを目的としている。
既存の手法は、精度と効率の間の難解なトレードオフに悩まされることが多い。
LLaVA-Meteorは,コア情報を妥協することなく,視覚トークンを戦略的に圧縮する手法である。
論文 参考訳(メタデータ) (2025-05-17T10:22:29Z) - GMAR: Gradient-Driven Multi-Head Attention Rollout for Vision Transformer Interpretability [0.20482269513546453]
Vision Transformer (ViT) はコンピュータビジョンに大きく進歩し、様々なタスクで最先端のパフォーマンスを達成するために自己認識機構を利用している。
ViTの複雑なマルチヘッドアテンション機構は、基礎となる予測プロセスが不透明であるため、解釈可能性に重大な課題をもたらす。
グラディエント駆動型マルチヘッド・アテンション・ロールアウト (GMAR) を導入し, グラディエントベーススコアを用いて各アテンションヘッドの重要性を定量化する手法を提案する。
論文 参考訳(メタデータ) (2025-04-28T01:58:39Z) - "Principal Components" Enable A New Language of Images [79.45806370905775]
証明可能なPCAのような構造を潜在トークン空間に組み込む新しい視覚トークン化フレームワークを導入する。
提案手法は、最先端の再構築性能を実現し、人間の視覚システムとの整合性を向上する。
論文 参考訳(メタデータ) (2025-03-11T17:59:41Z) - Differential Contrastive Training for Gaze Estimation [24.53837441433775]
CLIPの助けを借りて視線推定性能を向上させる新しい微分コントラスト訓練戦略を提案する。
視覚的外観認識ブランチとセマンティック微分認識ブランチからなる微分コントラストゲイズ推定ネットワーク(DCGaze)を導入する。
論文 参考訳(メタデータ) (2025-02-27T14:23:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。