論文の概要: When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs
- arxiv url: http://arxiv.org/abs/2608.25941v1
- Date: Wed, 26 Aug 2026 15:57:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.894731
- Title: When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs
- Title(参考訳): LLMにおけるスパースオートエンコーダのロバスト性保存
- Abstract要約: スパースオートエンコーダ(SAE)は、大きな言語モデルの内部表現を解釈するために広く使われている。
固定されたSAEの場合、その影響は摂動エネルギーによって支配されることを示す。
そこで我々は,同じ平均プルーニング間隔で低いパープレキシティを実現するレイヤワイド・スパシティ・アロケーション・ストラテジーを提案する。
- 参考スコア(独自算出の注目度): 15.418870425179875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoders (SAEs) are widely used to interpret the internal representations of large language models (LLMs), yet their reliability under post-hoc model compression remains poorly understood. We present a systematic study of how pruning affects SAE behavior and theoretically show that, for a fixed SAE, its impact is governed by perturbation energy, a covariance-weighted norm. This perspective exposes a key limitation of magnitude pruning: by ignoring activation geometry, it distorts the learned representation space and degrades SAE functionality. Activation-aware methods such as Wanda and SparseGPT, in contrast, implicitly control perturbation energy and are therefore substantially more robust at preserving SAE behavior. We further reveal a consistent structural vulnerability across all pruning methods: middle layers are significantly more sensitive to pruning than early or late layers. Guided by this insight, we propose a layer-wise sparsity allocation strategy, achieving lower perplexity under the same average pruning sparsity. Experiments across four model architectures validate our theoretical findings. Code is publicly available at https://github.com/osu-srml/sae-robustness-under-pruning/tree/main.
- Abstract(参考訳): スパースオートエンコーダ (SAE) は大規模言語モデル (LLM) の内部表現の解釈に広く用いられているが、ポストホックモデル圧縮下での信頼性は未だによく理解されていない。
本研究では, 刈り取りがSAE行動に与える影響について系統的研究を行い, 固定されたSAEの場合, その影響は共分散重み付きノルムである摂動エネルギーによって支配されることを示した。
アクティベーション幾何学を無視して、学習した表現空間を歪め、SAE機能を劣化させる。
一方、Wanda や SparseGPT のような活性化を意識した手法は摂動エネルギーを暗黙的に制御し、したがってSAE の振舞いを保ちやすくする。
中間層は、初期層や後期層よりもプルーニングにかなり敏感である。
この知見に導かれて、我々は、同じ平均プルーニング間隔で低いパープレキシティを実現する、レイヤワイズ・スパシティ・アロケーション・ストラテジーを提案する。
4つのモデルアーキテクチャの実験は、我々の理論的な結果を検証する。
コードはhttps://github.com/osu-srml/sae-robustness-under-pruning/tree/mainで公開されている。
関連論文リスト
- From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability [53.681678236115836]
我々は,SAEに基づく説明を,基盤となる凍結LMの忠実な見方として扱うことができるかを検討した。
この枠組みは, 4つの測定可能な量を用いて, 基本モデルの予測リスクの上限を導出する。
我々は, GPT-2 Small, Gemma-2B, Llama-3-8B のサンプルサイズにおいて, 境界が非空洞となることを示す。
論文 参考訳(メタデータ) (2026-06-16T18:28:23Z) - Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression [68.1291440835878]
分解は有望な方向として現れ、トランスフォーマーの重み構造に適したコンパクトなパラメータ化を提供する。
既存の研究では、これらの手法を狭い環境で評価しており、大規模展開においてテンソル化が有効かどうかは不明である。
我々は高密度およびMoEのテンソル圧縮を体系的に評価し、経験的解析と理論的解析の両方に基礎を置いた性能トレードオフを確立する。
論文 参考訳(メタデータ) (2026-06-02T10:45:21Z) - Towards Understanding the Robustness of Sparse Autoencoders [13.16745936025085]
本稿では,事前学習したSAEを推論時に変圧器残流に組み込むことについて検討する。
SAE強化モデルは、未定義のベースラインに対するジェイルブレイク成功率を最大5倍に向上させる。
論文 参考訳(メタデータ) (2026-04-20T19:00:09Z) - Improving Robustness In Sparse Autoencoders via Masked Regularization [21.265992727881514]
トレーニング中にトークンをランダムに置き換え、共起パターンを乱すマスクベースの正規化を提案する。
これにより、SAEアーキテクチャ間の堅牢性と、吸収を低減し、探索性能を高め、OODギャップを狭める。
論文 参考訳(メタデータ) (2026-04-07T21:56:23Z) - When Does Sparsity Mitigate the Curse of Depth in LLMs [53.137717161619484]
本研究では,分散伝播の規制として空間空間が機能し,深度利用が向上することを示す。
以上の結果から,大規模な言語モデルにおいて,より効率的な深度スケーリングを実現するための重要なメカニズムとして,スパーシリティが明らかとなった。
論文 参考訳(メタデータ) (2026-03-16T15:04:16Z) - Sparse Semantic Dimension as a Generalization Certificate for LLMs [53.681678236115836]
Sparse Semantic Dimension (SSD)は,モデル層上で訓練されたSparse Autoencoder (SAE)のアクティブな特徴語彙から導かれる複雑性尺度である。
我々はGPT-2 Small と Gemma-2B でこの枠組みを検証し、実際のサンプルサイズで非空き証明書を提供することを実証した。
論文 参考訳(メタデータ) (2026-02-11T21:45:18Z) - Analysis of Variational Sparse Autoencoders [1.675385127117872]
SAEアーキテクチャに変分手法を組み込むことで,特徴構造や解釈可能性が改善されるかどうかを検討する。
本稿では,変分スパースオートエンコーダ(vSAE)を導入し,決定論的ReLUゲーティングを学習したガウス後部からのサンプリングに置き換える。
以上の結果から,SAEに対する変分法の適用は,機能的構造や解釈可能性の向上には至らないことが示唆された。
論文 参考訳(メタデータ) (2025-09-26T23:09:56Z) - Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models [57.20761595019967]
注意空間にL1をベースとした正規化・精細化を施した,効率的かつトレーニング不要な機構である正規化注意誘導(NAG)を提案する。
NAGは、CFGが忠実性を維持しながら崩壊する効果的な負のガイダンスを復元する。
NAGはアーキテクチャ(UNet、DiT)、サンプリングレシスタンス(複数ステップ、複数ステップ)、モダリティ(イメージ、ビデオ)をまたいで一般化する
論文 参考訳(メタデータ) (2025-05-27T13:30:46Z) - Effective Layer Pruning Through Similarity Metric Perspective [0.0]
ディープニューラルネットワークは、認知タスクを解決する機械学習において、主要なパラダイムとなっている。
これらのモデルから構造を抽出することは、ネットワークの複雑さを減らすための簡単なアプローチである。
層プルーニングは、しばしば高い圧縮速度でネットワーク予測能力(すなわち精度)を損なう。
この研究は、プルーニング手法によって追求されるすべての基礎特性を満たす効果的なレイヤ・プルーニング戦略を導入する。
論文 参考訳(メタデータ) (2024-05-27T11:54:51Z) - Towards Practical Control of Singular Values of Convolutional Layers [65.25070864775793]
畳み込みニューラルネットワーク(CNN)の訓練は容易であるが、一般化誤差や対向ロバスト性といった基本的な特性は制御が難しい。
最近の研究では、畳み込み層の特異値がそのような解像特性に顕著に影響を及ぼすことが示された。
我々は,レイヤ表現力の著しく低下を犠牲にして,先行技術の制約を緩和するための原則的アプローチを提供する。
論文 参考訳(メタデータ) (2022-11-24T19:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。