論文の概要: Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects
- arxiv url: http://arxiv.org/abs/2607.20596v1
- Date: Wed, 22 Jul 2026 17:33:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.179924
- Title: Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects
- Title(参考訳): シングルトークンスパースオートエンコーダの特徴は因果的必要か? 層深とSAE-Family効果
- Abstract要約: 1つの語彙項目でアクティベートするシングルトークン機能は、基底真理が直接比較を許可する診断ケースを提供する。
我々は6つのモデルと3つのSAEファミリーにまたがる3.9Mの特徴を全層深度でのゼロアブレーションを用いて分析した。
- 参考スコア(独自算出の注目度): 1.630081999385542
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoder (SAE) features are used to interpret and steer large language models, yet whether a feature's causal role is stable across SAE families remains untested. Single-token features that activate on one vocabulary item provide the diagnostic case where ground truth permits direct comparison. We analyze 3.9M features across six models and three SAE families using zero-ablation at full layer depth. Single-token features cluster 4.7x tighter in decoder space and concentrate in early layers (Layer 0 in GPT2-Small; L0-L4 in Gemma). Ablating them yields Benjamini-Hochberg-significant logit reductions in 178 of 208 full-layer conditions, with depth controlling whether damage cascades downstream or shapes the output directly. Cross-family causal differences exceed within-family scale effects: on the same base model, GemmaScope and BatchTopK features remain causally anchored, while LlamaScope features are locally redundant. The target token's rank recovers to within 2x baseline 96-98% of the time after the same ablation, and a controlled activation-function comparison reverses sign within the same model, leaving training recipe as the residual candidate. Cross-family interpretability claims are therefore sensitive to training methodology, not just activation function or scale.
- Abstract(参考訳): スパースオートエンコーダ(SAE)機能は、大きな言語モデルの解釈とステアリングに使用されるが、機能の役割がSAEファミリー全体で安定しているかどうかはまだ検証されていない。
1つの語彙項目でアクティベートするシングルトークン機能は、基底真理が直接比較を許可する診断ケースを提供する。
我々は6つのモデルと3つのSAEファミリーにまたがる3.9Mの特徴を全層深度でのゼロアブレーションを用いて分析した。
シングルトークンはデコーダ空間においてクラスタ4.7倍の密接さを持ち、初期層に集中している(GPT2-SmallのLayer 0、GemmaのL0-L4)。
これらを非難すると、Benjamini-Hochberg-significant logit reductions in 178 of 208 full-layer conditions, with depth control whether damage cascades downstream or shapes the output。
同じベースモデルでは、GemmaScopeとBatchTopKの機能は因果的に固定され、LlamaScopeの機能は局所的に冗長である。
目標トークンのランクは、同じアブレーション後の2倍のベースライン96〜98%に回復し、制御されたアクティベーション・ファンクション比較は、同じモデル内の符号を反転させ、トレーニングレシピを残留候補として残す。
したがって、家族間の解釈可能性の主張は、アクティベーション関数やスケールだけでなく、トレーニング方法論に敏感である。
関連論文リスト
- From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability [53.681678236115836]
我々は,SAEに基づく説明を,基盤となる凍結LMの忠実な見方として扱うことができるかを検討した。
この枠組みは, 4つの測定可能な量を用いて, 基本モデルの予測リスクの上限を導出する。
我々は, GPT-2 Small, Gemma-2B, Llama-3-8B のサンプルサイズにおいて, 境界が非空洞となることを示す。
論文 参考訳(メタデータ) (2026-06-16T18:28:23Z) - Perplexity Can Miss SAE Feature Damage Under Quantization [0.16921396880325779]
量子化モデルは、パープレキシティや下流の精度が完全精度のオリジナルに近い場合、許容できると判断される。
凍結スパースオートエンコーダ(SAE)を固定的な測定基準として用いることでこれを検証する。
論文 参考訳(メタデータ) (2026-06-02T01:17:05Z) - Reading Task Failure Off the Activations: A Sparse-Feature Audit of GPT-2 Small on Indirect Object Identification [0.0]
我々は, GPT-2小火器のスパースオートコーダ(SAE)機能について, 失敗した試験と成功した試験との違いを報告した。
300プロンプトでは、GPT-2小径の精度は79.7%に達し、Bloom (2024)の層8残流SAEリリースの24,576個の特徴のうち146個はホルム補正値の閾値をクリアしている。
17,491, d=+2.93, Neuronpedia label 'cryptographic key' は、プロンプトの転送されたオブジェクトが「キー」である場合を除いて、本質的に静かである。
論文 参考訳(メタデータ) (2026-05-21T16:55:27Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders [10.172598963520961]
大規模言語モデルは、その出力レベルの不確かさと実際の正しさが、同じ内部メカニズムによって駆動されるか、または異なる特徴集団によって駆動されるかという疑問を提起する。
モデル予測を正当性と信頼軸に沿って分割する2x2フレームワークを導入し,スパースオートエンコーダを用いて各次元に関連する特徴を独立に同定する。
論文 参考訳(メタデータ) (2026-04-21T20:34:14Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models [0.0]
本稿では,非構造化プルーニングが言語モデルの特徴幾何にどう影響するかについて,最初の体系的研究を行う。
種子の安定性,特徴生存性,SAE伝達性,特徴脆弱性,因果関係に関する5つの研究課題について検討した。
我々の最も顕著な発見は、希少なSAE機能 ― 発射率の低い ― が、頻繁なプルーニングよりもはるかに優れていることです。
論文 参考訳(メタデータ) (2026-03-26T11:12:42Z) - Sparse Semantic Dimension as a Generalization Certificate for LLMs [53.681678236115836]
Sparse Semantic Dimension (SSD)は,モデル層上で訓練されたSparse Autoencoder (SAE)のアクティブな特徴語彙から導かれる複雑性尺度である。
我々はGPT-2 Small と Gemma-2B でこの枠組みを検証し、実際のサンプルサイズで非空き証明書を提供することを実証した。
論文 参考訳(メタデータ) (2026-02-11T21:45:18Z) - Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders [63.544453925182005]
3つの言語モデルで90のSAEをトレーニングし、解釈可能性と操舵性を評価します。
解析の結果,比較的弱い正の相関(tau b approx 0.298)しか示さず,解釈性は操舵性能の指標として不十分であることが示唆された。
本稿では,特徴量の増幅が次のトークン分布に与える影響を計測するデルタトークン信頼性(Delta Token Confidence)という新しい選択基準を提案する。
論文 参考訳(メタデータ) (2025-10-04T04:14:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。