論文の概要: Feature Starvation as Geometric Instability in Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2605.05341v1
- Date: Wed, 06 May 2026 18:11:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.365136
- Title: Feature Starvation as Geometric Instability in Sparse Autoencoders
- Title(参考訳): スパースオートエンコーダの幾何学的不安定性としての特徴飢餓
- Authors: Faris Chaudhry, Keisuke Yano, Anthea Monod,
- Abstract要約: 適応弾性ネットSAEは,古典的スパース回帰に基づく完全微分可能なアーキテクチャである。
AEN-SAEは、強い凸性およびリプシッツ安定性を適応的な$ell$再重み付けで強制する$ell$構造項を組み合わせる。
我々は,AEN-SAEsがLipschitzcontinuous sparse code mapを生成し,軽度の仮定でグローバル機能サポートを回復することを示す。
- 参考スコア(独自算出の注目度): 0.764671395172401
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse autoencoders (SAEs) are used to disentangle the dense, polysemantic internal representations of large language models (LLMs) into interpretable, monosemantic concepts. However, standard $\ell_1$-regularized SAEs suffer from feature starvation (dead neurons) and shrinkage bias, often requiring computationally expensive heuristic resampling and nondifferentiable hard-masking methods to bypass these challenges. We argue that feature starvation is not merely an empirical artifact of poor data diversity, but a fundamental optimization-geometric pathology of overcomplete dictionaries: the $\ell_1$-induced sparse coding map is unstable and fundamentally misaligned with shallow, amortized encoders. To address this structural instability, we introduce adaptive elastic net SAEs (AEN-SAEs), a fully differentiable architecture grounded in classical sparse regression. AEN-SAEs combine an $\ell_2$ structural term that enforces strong convexity and Lipschitz stability with adaptive $\ell_1$ reweighting that eliminates shrinkage bias and suppresses spurious features, thereby jointly controlling the curvature and interaction structure of the induced polyhedral geometry. Theoretically, we show that AEN-SAEs yield a Lipschitz-continuous sparse coding map and recover the global feature support under mild assumptions. Empirically, across synthetic settings and LLMs (Pythia 70M, Llama 3.1 8B), AEN-SAEs mitigate feature starvation without auxiliary heuristics while maintaining competitive reconstruction abilities.
- Abstract(参考訳): スパースオートエンコーダ (SAE) は、大言語モデル (LLM) の高密度で多意味な内部表現を解釈可能で単意味的な概念に分解するために用いられる。
しかし、標準的な$\ell_1$-regularized SAEは機能停止(死のニューロン)と収縮バイアスに悩まされ、計算コストのかかるヒューリスティックな再サンプリングや、これらの課題を回避できないハードマスキングが必要となる。
我々は、機能飢餓は単なるデータ多様性の実証的な成果ではなく、オーバーコンプリート辞書の基本的な最適化と幾何学的パスロジーであると主張している。
この構造不安定性に対処するために,古典的スパース回帰を基盤とした完全微分可能なアーキテクチャである適応弾性ネットSAE(AEN-SAEs)を導入する。
AEN-SAEは、強い凸性とリプシッツ安定性を強制する$\ell_2$構造項を適応的な$\ell_1$再重み付けと組み合わせ、縮退バイアスを排除し、スプリアス特性を抑圧し、誘導された多面体幾何学の曲率と相互作用構造を共同制御する。
理論的には、AEN-SAEはリプシッツ連続スパース符号化マップを生成し、軽度の仮定の下でグローバルな特徴支援を復元する。
実証的に、合成設定とLLM(Pythia 70M, Llama 3.1 8B)を通して、AEN-SAEは補助的なヒューリスティックを伴わずに、競争力のある復元能力を維持しながら、特徴的飢餓を緩和する。
関連論文リスト
- The Trojan in the Vocabulary: Stealthy Sabotage of LLM Composition [31.827344197678126]
トケナイザー移植はサプライチェーンの脆弱性を導入する。
係数再利用の幾何学を利用して、我々の攻撃は非対称的な実現可能性ギャップを生み出す。
実験的に、攻撃は訓練なしで、スペクトルの模倣を達成し、異常検出を回避する。
論文 参考訳(メタデータ) (2025-12-31T19:00:03Z) - Analysis of Variational Sparse Autoencoders [1.675385127117872]
SAEアーキテクチャに変分手法を組み込むことで,特徴構造や解釈可能性が改善されるかどうかを検討する。
本稿では,変分スパースオートエンコーダ(vSAE)を導入し,決定論的ReLUゲーティングを学習したガウス後部からのサンプリングに置き換える。
以上の結果から,SAEに対する変分法の適用は,機能的構造や解釈可能性の向上には至らないことが示唆された。
論文 参考訳(メタデータ) (2025-09-26T23:09:56Z) - Taming Polysemanticity in LLMs: Provable Feature Recovery via Sparse Autoencoders [50.52694757593443]
既存のSAEトレーニングアルゴリズムは厳密な数学的保証を欠いていることが多く、実用的な制限に悩まされている。
まず,特徴の特定可能性という新たな概念を含む特徴回復問題の統計的枠組みを提案する。
本稿では、ニューラルネットワークのバイアスパラメータを適応的に調整し、適切なアクティベーション間隔を確保する手法である「バイアス適応」に基づく新たなSAEトレーニングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-16T20:58:05Z) - Sparse Autoencoders, Again? [15.48801130346124]
我々は、正準SAEと変分オートエンコーダの両方を用いて、未承認の弱点を定式化する。
提案したモデルの大域的ミニマは、多様体の和合にまたがるある種の構造化されたデータを復元する。
一般に、等価容量SAEとVAEの性能を超えることができる。
論文 参考訳(メタデータ) (2025-06-05T10:26:06Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Interpreting CLIP with Hierarchical Sparse Autoencoders [8.692675181549117]
サエマトリオシュカ(MSAE)は複数の粒度の階層的表現を同時に学習する。
MSAEは、CLIPの再構築品質とスパーシリティの間に新しい最先端のフロンティアを確立する。
論文 参考訳(メタデータ) (2025-02-27T22:39:13Z) - The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective [55.15192437680943]
連続状態と行動空間を持つ非線形力学系の一般設定におけるオンライン強化学習のサンプル複雑性について検討した。
我々のアルゴリズムは、$mathcalO(N epsilon2 + Mathrmln(m(epsilon)/epsilon2)$のポリシーを後悔する。
力学がコンパクトで実数値のパラメータ集合によってパラメータ化される特別な場合、$mathcalO(sqrt)のポリシー後悔を証明する。
論文 参考訳(メタデータ) (2025-01-27T10:01:28Z) - Posterior Collapse and Latent Variable Non-identifiability [54.842098835445]
柔軟性を犠牲にすることなく識別性を強制する深層生成モデルである,潜時同定可能な変分オートエンコーダのクラスを提案する。
合成および実データ全体にわたって、潜在識別可能な変分オートエンコーダは、後方崩壊を緩和し、データの有意義な表現を提供する既存の方法より優れている。
論文 参考訳(メタデータ) (2023-01-02T06:16:56Z) - Robust Implicit Networks via Non-Euclidean Contractions [63.91638306025768]
暗黙のニューラルネットワークは、精度の向上とメモリ消費の大幅な削減を示す。
彼らは不利な姿勢と収束の不安定さに悩まされる。
本論文は,ニューラルネットワークを高機能かつ頑健に設計するための新しい枠組みを提供する。
論文 参考訳(メタデータ) (2021-06-06T18:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。