論文の概要: Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)
- arxiv url: http://arxiv.org/abs/2603.26743v1
- Date: Mon, 23 Mar 2026 07:08:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.56183
- Title: Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)
- Title(参考訳): 視覚変換器の動的ヘッドプルーニング制御のためのステアリングスパースオートエンコーダラミタント(学生要約)
- Authors: Yousung Lee, Dongsoo Har,
- Abstract要約: 視覚変換器(ViT)における動的ヘッドプルーニングは、冗長なアテンションヘッドを除去することで効率を向上する。
既存のプルーニングポリシーは解釈と制御が難しいことが多い。
本研究では,スパースオートエンコーダと動的プルーニングを統合した新しいフレームワークを提案する。
- 参考スコア(独自算出の注目度): 5.736588561666141
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dynamic head pruning in Vision Transformers (ViTs) improves efficiency by removing redundant attention heads, but existing pruning policies are often difficult to interpret and control. In this work, we propose a novel framework by integrating Sparse Autoencoders (SAEs) with dynamic pruning, leveraging their ability to disentangle dense embeddings into interpretable and controllable sparse latents. Specifically, we train an SAE on the final-layer residual embedding of the ViT and amplify the sparse latents with different strategies to alter pruning decisions. Among them, per-class steering reveals compact, class-specific head subsets that preserve accuracy. For example, bowl improves accuracy (76% to 82%) while reducing head usage (0.72 to 0.33) via heads h2 and h5. These results show that sparse latent features enable class-specific control of dynamic pruning, effectively bridging pruning efficiency and mechanistic interpretability in ViTs.
- Abstract(参考訳): 視覚変換器(ViT)の動的プルーニングは、冗長なアテンションヘッドを除去することで効率を向上するが、既存のプルーニングポリシーは解釈と制御が難しいことが多い。
本研究では,Sparse Autoencoders (SAE) を動的プルーニングと統合し,高密度埋め込みを解釈可能かつ制御可能なスパース潜水器に切り離す能力を活用する新しいフレームワークを提案する。
具体的には,ViTの最終層への残留埋め込みにSAEを訓練し,異なる戦略でスパース潜伏剤を増幅し,プルーニング決定を変更する。
それらの中で、クラスごとのステアリングは、正確性を保ったコンパクトなクラス固有のヘッドサブセットを明らかにする。
例えば、ボウルの精度は76%から82%に向上し、ヘッドh2とh5を介してヘッド使用率(0.72から0.33)を下げる。
これらの結果から, 緩やかな潜伏特性は動的刈り込みのクラス特異的制御を可能にし, 効果的に刈り込み効率とViTの機械的解釈可能性を向上させることが示唆された。
関連論文リスト
- Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection [8.819278296219071]
大規模言語モデル(LLM)は複雑なユーザ命令に従わないことが多い。
アクティベーションステアリング技術はモデル内部を操作することを目的としているが、オーバーステアリングの危険性がある。
余分なデータセットを使わずにKVキャッシュをスケーリングすることで、操舵強度を動的に調節する新しい操舵法であるDIRECTERを導入する。
論文 参考訳(メタデータ) (2026-03-06T09:49:32Z) - ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT [14.21482208417138]
ビジョントランスフォーマー(ViT)は様々なビジョンタスクで顕著な成功を収めているが、その展開は計算コストの制限によって妨げられていることが多い。
異なるViTコンポーネントに特別な戦略を適用する分離されたフレームワークであるToaStを提案する。
論文 参考訳(メタデータ) (2026-02-17T16:52:13Z) - Internalizing LLM Reasoning via Discovery and Replay of Latent Actions [4.830503861275364]
連鎖プロセスの隠れ状態への内部化は、テスト時間計算をスケールするための非常に効率的なパラダイムとして現れている。
動的潜在軌道制御問題として推論強化を再構築するSTIR(Self-Distilled Tools for Internal Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:44:57Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - Forest Before Trees: Latent Superposition for Efficient Visual Reasoning [61.29300723302152]
レーザーは動的ウィンドウアライメント学習(DWAL)を通して視覚的推論を再構成する新しいパラダイムである
レーザーは遅延推論法で最先端のパフォーマンスを達成し、強いベースラインのモネを平均5.03%上回る。
論文 参考訳(メタデータ) (2026-01-11T08:30:49Z) - Structured Contrastive Learning for Interpretable Latent Representations [2.8870482999983094]
本研究では,潜在空間表現を3つの意味群に分割するフレームワークであるStructured Contrastive Learning (SCL)を提案する。
ECG相の分散とIMU回転の実験は優れた性能を示した。
この研究は、リアクティブデータ拡張からプロアクティブな構造学習へのパラダイムシフトを表し、ニューラルネットワークにおける解釈可能な潜在表現を可能にする。
論文 参考訳(メタデータ) (2025-11-18T21:18:20Z) - Mixture of Hidden-Dimensions Transformer [50.40325486463241]
隠れ次元の空間性について検討し、訓練されたトランスフォーマーがわずかなトークン次元しか利用していないことを観察する。
スパース条件付アクティベーションアーキテクチャであるMoHD(Mixture of Hidden Dimensions)を提案する。
50%のアクティベーションパラメータが減少し、3.7%のハイパフォーマンスを実現し、3倍のパラメータを一定のアクティベーションコストで拡張する。
論文 参考訳(メタデータ) (2024-12-07T13:15:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。