論文の概要: Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
- arxiv url: http://arxiv.org/abs/2607.24645v1
- Date: Mon, 27 Jul 2026 16:45:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.514515
- Title: Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
- Title(参考訳): スパースオートエンコーダは概念と関数の両方を符号化する:特徴効果の下流幾何学
- Authors: Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty, Iryna Gurevych, Subhabrata Dutta,
- Abstract要約: Feature-Effect Geometry Analysis (FEGA)は、コンテキスト間で同じアクティブなSAE機能を削除した教師なしのフレームワークである。
ステアリングの安定な方向を提供することなく,特徴を解釈し,因果的に関連付けることができることを示す。
- 参考スコア(独自算出の注目度): 58.98080129016082
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The wide-scale use of sparse autoencoders (SAEs) as interpretability tools is limited by inconsistent links between SAE features and model behavior. Features with clear activation descriptions may have weak or unexpected causal effects; steering can vary across prompts or oppose the intended direction; and activation-based feature selection can miss features that produce the desired output change. Prior work has studied feature geometry inside the model, where features are computed. We instead study the geometry of changes in model logits caused by feature interventions. We introduce Feature-Effect Geometry Analysis (FEGA), an unsupervised framework that removes the same active SAE feature across contexts and analyzes the resulting cloud of logit changes. Across SAE variants, consistent one-dimensional effects are rare: few features behave like reusable directions. To interpret this variation, we distinguish value-like features, tied to static information such as factual attributes, from pointer-like features, associated with context-dependent operations. Value-like features more often exhibit structured, low-dimensional effects, although these effects typically span several directions. Pointer-like features, by contrast, predominantly exhibit diffuse effects. Our results show that a feature can be interpretable and causally relevant without providing a stable direction for steering.
- Abstract(参考訳): 解釈可能性ツールとしてのスパースオートエンコーダ(SAE)の大規模使用は、SAE特徴とモデル動作の一貫性のないリンクによって制限される。
明確なアクティベーション記述を持つ特徴は、弱いか予期せぬ因果効果を持ち、ステアリングはプロンプトによって異なり、意図した方向に反対し、アクティベーションベースの特徴選択は、望ましい出力変化を生み出す特徴を見逃す可能性がある。
以前の研究では、モデル内の特徴幾何を研究しており、そこでは特徴が計算されている。
代わりに、機能介入によるモデルロジットの変化の幾何学について研究する。
これは教師なしのフレームワークで、コンテキスト間で同じアクティブなSAE機能を取り除き、結果として生じるロジットの雲を分析する。
SAEの変種全体において一貫した一次元効果は稀であり、再利用可能な方向のように振る舞う特徴はほとんどない。
この変動を解釈するために、実物属性などの静的情報に関連付けられた値のような特徴と、文脈依存的な操作に関連するポインタのような特徴とを区別する。
値のような特徴は、しばしば構造的かつ低次元的な効果を示すが、これらの効果は典型的にはいくつかの方向にまたがる。
対照的にポインタのような特徴は、主に拡散効果を示す。
この結果から, ステアリングの安定な方向を与えることなく, 特徴を解釈し, 因果的に関連付けることが可能であることが示唆された。
関連論文リスト
- Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features [1.5874067490843806]
Control Reinforcement Learningは、各トークンでステアリングするためのSAE機能を選択するポリシーをトレーニングし、解釈可能な介入ログを生成する。
Adaptive Feature Maskingは、単一機能解釈性を維持しながら、多様な機能発見を促進する。
MMLU、BBQ、GSM8K、HarmBench、XSTestにわたるGemma 2Bでは、CRLは、トークン単位の介入ログを提供しながら改善されている。
論文 参考訳(メタデータ) (2026-02-11T02:28:49Z) - TangledFeatures: Robust Feature Selection in Highly Correlated Spaces [0.0]
我々はTangledFeaturesを紹介した。TangledFeaturesは、相関した特徴空間における特徴選択のためのフレームワークである。
絡み合った予測器のグループから代表的特徴を識別し、説明力を維持しながら冗長性を低下させる。
選択された特徴は、背骨のねじれ角の変化を説明する構造的に意味のある原子内距離に対応している。
論文 参考訳(メタデータ) (2025-10-16T05:54:04Z) - SAEs Are Good for Steering -- If You Select the Right Features [45.47261543304217]
現在の方法では、それらを活性化する入力トークンを分析して、SAEの機能をステアに識別する。
本研究では,主にモデル入力のパターンをキャプチャする入力特徴と,モデル出力に対する人間の理解可能な影響を持つ出力特徴の2つの特徴を区別する。
論文 参考訳(メタデータ) (2025-05-26T14:47:59Z) - Going Beyond Neural Network Feature Similarity: The Network Feature
Complexity and Its Interpretation Using Category Theory [64.06519549649495]
機能的に等価な機能と呼ぶものの定義を提供します。
これらの特徴は特定の変換の下で等価な出力を生成する。
反復的特徴マージ(Iterative Feature Merging)というアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-10T16:27:12Z) - EEGminer: Discovering Interpretable Features of Brain Activity with
Learnable Filters [72.19032452642728]
本稿では,学習可能なフィルタと事前決定された特徴抽出モジュールからなる新しい識別可能なEEGデコーディングパイプラインを提案する。
我々は,SEEDデータセットおよび前例のない大きさの新たな脳波データセット上で,脳波信号からの感情認識に向けたモデルの有用性を実証する。
発見された特徴は、以前の神経科学の研究と一致し、音楽聴取中の左右の時間領域間の機能的接続プロファイルの顕著な相違など、新たな洞察を提供する。
論文 参考訳(メタデータ) (2021-10-19T14:22:04Z) - Can contrastive learning avoid shortcut solutions? [88.249082564465]
暗黙的特徴修正(IFM)は、より広い種類の予測的特徴を捉えるために、対照的なモデルを導くために、正と負のサンプルを変更する方法である。
IFMは特徴抑制を低減し、その結果、視覚および医用画像タスクのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2021-06-21T16:22:43Z) - Unsupervised Feature Learning for Manipulation with Contrastive Domain
Randomization [19.474628552656764]
教師なし学習に対するドメインランダム化のナイーブな応用は不変性を促進しないことを示す。
本研究では,視覚特性のシミュレーションによるランダム化を制御できることを生かして,コントラスト損失の簡単な修正を提案する。
論文 参考訳(メタデータ) (2021-03-20T09:54:45Z) - Removing Spurious Features can Hurt Accuracy and Affect Groups
Disproportionately [83.68135652247496]
自然な修正は、モデルからスプリアスな特徴を取り除くことである。
誘導バイアスによる突発的特徴の除去は精度を低下させる可能性が示唆された。
また,ロバストな自己学習によって,全体的な正確性に影響を与えずにスプリアスな特徴を除去できることを示した。
論文 参考訳(メタデータ) (2020-12-07T23:08:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。