論文の概要: Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)
- arxiv url: http://arxiv.org/abs/2603.26743v1
- Date: Mon, 23 Mar 2026 07:08:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.56183
- Title: Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)
- Title(参考訳): 視覚変換器の動的ヘッドプルーニング制御のためのステアリングスパースオートエンコーダラミタント(学生要約)
- Abstract要約: 視覚変換器(ViT)における動的ヘッドプルーニングは、冗長なアテンションヘッドを除去することで効率を向上する。
既存のプルーニングポリシーは解釈と制御が難しいことが多い。
本研究では,スパースオートエンコーダと動的プルーニングを統合した新しいフレームワークを提案する。
- 参考スコア(独自算出の注目度): 5.736588561666141
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dynamic head pruning in Vision Transformers (ViTs) improves efficiency by removing redundant attention heads, but existing pruning policies are often difficult to interpret and control. In this work, we propose a novel framework by integrating Sparse Autoencoders (SAEs) with dynamic pruning, leveraging their ability to disentangle dense embeddings into interpretable and controllable sparse latents. Specifically, we train an SAE on the final-layer residual embedding of the ViT and amplify the sparse latents with different strategies to alter pruning decisions. Among them, per-class steering reveals compact, class-specific head subsets that preserve accuracy. For example, bowl improves accuracy (76% to 82%) while reducing head usage (0.72 to 0.33) via heads h2 and h5. These results show that sparse latent features enable class-specific control of dynamic pruning, effectively bridging pruning efficiency and mechanistic interpretability in ViTs.
- Abstract(参考訳): 視覚変換器(ViT)の動的プルーニングは、冗長なアテンションヘッドを除去することで効率を向上するが、既存のプルーニングポリシーは解釈と制御が難しいことが多い。
本研究では,Sparse Autoencoders (SAE) を動的プルーニングと統合し,高密度埋め込みを解釈可能かつ制御可能なスパース潜水器に切り離す能力を活用する新しいフレームワークを提案する。
具体的には,ViTの最終層への残留埋め込みにSAEを訓練し,異なる戦略でスパース潜伏剤を増幅し,プルーニング決定を変更する。
それらの中で、クラスごとのステアリングは、正確性を保ったコンパクトなクラス固有のヘッドサブセットを明らかにする。
例えば、ボウルの精度は76%から82%に向上し、ヘッドh2とh5を介してヘッド使用率(0.72から0.33)を下げる。
これらの結果から, 緩やかな潜伏特性は動的刈り込みのクラス特異的制御を可能にし, 効果的に刈り込み効率とViTの機械的解釈可能性を向上させることが示唆された。
関連論文リスト
- Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control [3.3394856680250284]
本研究では,世界行動モデル(WAM)の活性化空間における頑健性関連摂動の表現について検討する。
成功したロールアウトと失敗したロールアウトのアクティベーションを比較すると、いくつかのWAMアーキテクチャはロバストネスクリティカルな特徴に対して低次元線形分離性を示す。
これにより、トレーニングフリーのWAMステアリングにおける対照的なアクティベーション方向の使用がモチベーションとなる。
また, WAMアクティベーションダイナミクスの局所線形性はモデルベース最適制御による効率的なフィードバックステアリングを可能にすることを示す。
論文 参考訳(メタデータ) (2026-07-16T12:52:49Z) - Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers [33.36466188187489]
Foveated Dynamic Transformer (FDT)は、フォベーション誘導型動的トークン選択アーキテクチャを視覚トランスフレームワークに統合する。
FDTは、このような課題に対して明示的に訓練されていないにもかかわらず、様々な種類のノイズや敵攻撃に対して強い弾力性を示す。
これらの属性は、適応計算とレジリエンスの改善を組み合わせた、HVSにインスパイアされた人工知能へのステップとして位置付けられている。
論文 参考訳(メタデータ) (2026-07-10T14:53:16Z) - Accelerating Vision Foundation Models with Drop-in Depthwise Convolution [51.50107862675191]
我々は、注目ヘッドのドロップイン代替として機能する、効率的な奥行き畳み込みベースの層を導入する。
画像分類とセグメンテーションの両方のタスクにおいて,提案手法は性能劣化を最小限に抑えながら17~20%の推論高速化を実現している。
論文 参考訳(メタデータ) (2026-05-21T08:07:23Z) - Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models [75.27089289058613]
textbfTIES(textbfTau-guided textbfInter-layer textbfEfficient textbfSelection)は、層間トークンランキングの整合性によって導かれる動的フレームワークである。
CogACT + SIMPLERベンチマークでは、TIESは平均成功率を6%改善し、トークン使用率を78%削減した。
論文 参考訳(メタデータ) (2026-03-26T02:13:03Z) - Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection [8.819278296219071]
大規模言語モデル(LLM)は複雑なユーザ命令に従わないことが多い。
アクティベーションステアリング技術はモデル内部を操作することを目的としているが、オーバーステアリングの危険性がある。
余分なデータセットを使わずにKVキャッシュをスケーリングすることで、操舵強度を動的に調節する新しい操舵法であるDIRECTERを導入する。
論文 参考訳(メタデータ) (2026-03-06T09:49:32Z) - ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT [14.21482208417138]
ビジョントランスフォーマー(ViT)は様々なビジョンタスクで顕著な成功を収めているが、その展開は計算コストの制限によって妨げられていることが多い。
異なるViTコンポーネントに特別な戦略を適用する分離されたフレームワークであるToaStを提案する。
論文 参考訳(メタデータ) (2026-02-17T16:52:13Z) - Internalizing LLM Reasoning via Discovery and Replay of Latent Actions [4.830503861275364]
連鎖プロセスの隠れ状態への内部化は、テスト時間計算をスケールするための非常に効率的なパラダイムとして現れている。
動的潜在軌道制御問題として推論強化を再構築するSTIR(Self-Distilled Tools for Internal Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:44:57Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - Forest Before Trees: Latent Superposition for Efficient Visual Reasoning [61.29300723302152]
レーザーは動的ウィンドウアライメント学習(DWAL)を通して視覚的推論を再構成する新しいパラダイムである
レーザーは遅延推論法で最先端のパフォーマンスを達成し、強いベースラインのモネを平均5.03%上回る。
論文 参考訳(メタデータ) (2026-01-11T08:30:49Z) - Structured Contrastive Learning for Interpretable Latent Representations [2.8870482999983094]
本研究では,潜在空間表現を3つの意味群に分割するフレームワークであるStructured Contrastive Learning (SCL)を提案する。
ECG相の分散とIMU回転の実験は優れた性能を示した。
この研究は、リアクティブデータ拡張からプロアクティブな構造学習へのパラダイムシフトを表し、ニューラルネットワークにおける解釈可能な潜在表現を可能にする。
論文 参考訳(メタデータ) (2025-11-18T21:18:20Z) - Mixture of Hidden-Dimensions Transformer [50.40325486463241]
隠れ次元の空間性について検討し、訓練されたトランスフォーマーがわずかなトークン次元しか利用していないことを観察する。
スパース条件付アクティベーションアーキテクチャであるMoHD(Mixture of Hidden Dimensions)を提案する。
50%のアクティベーションパラメータが減少し、3.7%のハイパフォーマンスを実現し、3倍のパラメータを一定のアクティベーションコストで拡張する。
論文 参考訳(メタデータ) (2024-12-07T13:15:22Z) - Self-slimmed Vision Transformer [52.67243496139175]
視覚変換器(ViT)は、様々な視覚タスクにおいて一般的な構造となり、CNN(Creative Convolutional Neural Network)よりも優れています。
本稿では,バニラVT,すなわちSiTに対する汎用的な自己スリム学習手法を提案する。
具体的には、まず、ViTの推論効率を向上させる新しいToken Slimming Module (TSM) を設計する。
論文 参考訳(メタデータ) (2021-11-24T16:48:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。