論文の概要: From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness
- arxiv url: http://arxiv.org/abs/2607.12166v1
- Date: Mon, 13 Jul 2026 21:18:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.968846
- Title: From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness
- Title(参考訳): 幾何学的復元から因果検証へ:重畳幾何から因果不確かさまで、スパースオートエンコーダの特徴の再現可能な監査
- Abstract要約: スパースオートエンコーダ(SAE)は、重畳された神経表現を解釈可能な特徴に分解する標準である。
これはデコーダ・ジオメトリーアライメントとエンコーダ・アクティベーションの2つの異なるクレームを示す。
本手法は,決定論的パイプラインを持つモデル非依存の楽器であるsae-causal-auditとしてパッケージ化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoders (SAEs) are the standard for decomposing superposed neural representations into interpretable features, and evaluation relies predominantly on correlational recovery metrics -- cosine similarity between ground-truth directions and decoder atoms. We show this conflates two distinct claims: decoder-geometry alignment and encoder-activation behavior. We reproduce the superposition phase diagram of Elhage et al. (2022), identifying a convergence artifact at high sparsity and an under-described diffuse sharing regime at extreme overcompleteness. We reproduce the TopK-versus-L1 comparison of Gao et al. (2024), with direct evidence of L1 shrinkage. Our central result is causal: subjecting every recovered feature to ablation and steering, we find up to 77% of features passing a recovery bar (cosine >= 0.90) in a degraded SAE -- and 9% in a well-trained one -- are causally inert: the matched atom never fires when the feature is present, including matches at cosine ~1.000. We package the method as sae-causal-audit, a model-agnostic instrument with a deterministic pipeline. Re-auditing refines the finding: inertness decomposes by cause into structural inertness (antipodal-pair geometry, present in good SAEs) and competitive inertness (a TopK pathology of degraded SAEs), and by direction into read- and write-inertness, which five antipodal pairs dissociate completely -- unmonitorable yet steerable through the same atom, with steering specificities of 143-310 attached to zero ablation effects. We document why byte-exact reproducibility is unavailable by construction, and propose reporting it as a stack of claims with explicit scopes. Applying the instrument to a production SAE reproduces the pattern at small scale (14% inert) and surfaces an atom-collision signal: a handful of atoms recur as the nearest match for dozens of unrelated concepts, replicated across three batches.
- Abstract(参考訳): スパースオートエンコーダ(SAEs)は、重畳された神経表現を解釈可能な特徴に分解する標準であり、評価は主に相関回復の指標に依存している。
これはデコーダ・ジオメトリーアライメントとエンコーダ・アクティベーションの2つの異なるクレームを示す。
我々はElhage et al (2022) の重ね合わせ位相図を再現し, 収束アーティファクトを高い間隔で同定し, 過度な過完全性で拡散共有状態を示す。
我々は,Gao et al(2024)のTopK-versus-L1比較を再現し,L1収縮の直接的証拠を得た。
回復した全ての特徴をアブレーションとステアリングに照らし合わせると、劣化したSAEで回復バー(cosine >= 0.90)を通過する特徴の77%、よく訓練された特徴の9%が因果的に不活性であることがわかった。
本手法は,決定論的パイプラインを持つモデル非依存の楽器であるsae-causal-auditとしてパッケージ化する。
慣性(inertness)は構造的慣性(antipodal-pair geometry, present in good SAEs)と競争的慣性(topK pathology of degraded SAEs)に分解され、5つの反足動物対が完全に解離する、読み取りと書き込みの慣性(read- and write-inertness)へと誘導される。
提案手法では, 建設作業で再現不可能な理由を記述し, 明示的なスコープを持つクレームのスタックとして報告することを提案する。
装置を製造SAEに適用すると、小さなスケール(14%の不活性)でパターンを再現し、原子衝突シグナルを表面化する。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Principled Detection of Coordinated Manipulation from Aggregate Distortion and Account Reuse [10.023638697449062]
調整可能なアカウントは、評価、ランキング、エンゲージメントを共同で歪めることができる。
我々は,文脈レベルの結果分布の歪みを主証拠として扱うアグリゲートファーストエビデンス層を導入する。
制御された回転実験とペアの対実的介入によるメカニズムを過去のAmazonレビューストリームで評価した。
論文 参考訳(メタデータ) (2026-09-11T18:16:42Z) - A Dominant Diffuse Phase in the Sparse Autoencoder Phase Diagram [0.0]
スパースオートエンコーダ(SAE)は、ニューラルネットワークのアクティベーションから解釈可能な特徴を回復するために、ますます使われるようになっている。
MAIS-O43開放問題では、真の合成辞書の回復が特徴付けの方法を与えるときに特徴付ける制御実験が提案されている。
論文 参考訳(メタデータ) (2026-09-09T15:13:42Z) - Differentiable Interval Bottlenecks for Interpretable Anomaly Detection in Numerical Data [0.5213778368155993]
DIFFINTは、遅延ボトルネックがソフトな軸方向のインターバルメンバシップのセットとして構成されるオートエンコーダである。
統計的にタイトされた7つの方法のリードクラスターの中で唯一の解釈可能な検出器である。
論文 参考訳(メタデータ) (2026-09-03T14:05:27Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - The Representational Limit of Scalar Interactions: An Interventional Decomposition [9.850981754860754]
署名されたペア相互作用スコアが、一意性(U)、冗長性(R)、シナジー(S)を根本的に説明することを証明する。
介入マスクによる推定により,機能当たりのU/R/Sプロファイルを推定する,ポストホックかつリトレーニング不要な予測可能性分解であるHi-Fiを導入する。
論文 参考訳(メタデータ) (2026-06-17T15:21:28Z) - From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability [53.681678236115836]
我々は,SAEに基づく説明を,基盤となる凍結LMの忠実な見方として扱うことができるかを検討した。
この枠組みは, 4つの測定可能な量を用いて, 基本モデルの予測リスクの上限を導出する。
我々は, GPT-2 Small, Gemma-2B, Llama-3-8B のサンプルサイズにおいて, 境界が非空洞となることを示す。
論文 参考訳(メタデータ) (2026-06-16T18:28:23Z) - Symbolic Regression via Latent Iterative Refinement [8.016092717336457]
単発予測と真の後部とのギャップを埋めるフレームワークであるLatent Equation Embedding (LEE)を提案する。
LEEは、3つのコンポーネントを備えた共有潜在空間Zを学習する。
LEEは、最強の精度指向のベースラインよりも2~10倍単純である。
論文 参考訳(メタデータ) (2026-05-26T16:25:05Z) - High-Dimensional Latents Should Be Diagnosed Through Phase Structure [56.362776482614976]
スピングラス理論のレンズによるオートエンコーダと変分オートエンコーダの潜在空間について検討した。
固定復号器用の潜時空間スピングラス辞書を定式化する。
トポロジカルな自明化機構のエッジ・オブ・ステイティに向けて潜伏系を駆動することは、下流に具体的な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2026-05-23T06:17:23Z) - scHelix: Asymmetric Dual-Stream Integration via Explicit Gene-Level Disentanglement [84.88065404629079]
scHelixは、機能がどのように処理されるかを根本的に変更するデータセット適応フレームワークである。
scHelixは、停止段階のグラフキャッシュを備えたデュアルストリームスパース拡散エンコーダを使用する。
scHelixは最先端のメソッドより優れています。
論文 参考訳(メタデータ) (2026-05-18T15:55:13Z) - Pairwise matrices for sparse autoencoders: single-feature inspection mislabels causal axes [2.741152471987327]
標準スパースオートエンコーダプロトコルは、各機能をトップアクティベーションコンテキストからラベル付けし、単一機能ステアリングによって検証する。
本稿では,Qwen3-1.7B-Instruct上での標準ワンコーナプロトコルミスをGemma-2-2B-itで再現した,ペアワイズ行列プロトコルと共変ステアリング係数を提案する。
これら3つの所見はGemmaでモデル特異的な損傷シグネチャを再現し,一致した形状制御はCIを10倍に分離する。
論文 参考訳(メタデータ) (2026-05-04T21:11:21Z) - Function-Space Decoupled Diffusion for Forward and Inverse Modeling in Carbon Capture and Storage [65.51149575007149]
本稿では,Fun-DDPSについて述べる。Fun-DDPSは,関数空間拡散モデルと微分可能なニューラル演算子サロゲートを結合した生成フレームワークである。
Fun-DDPSは、ジョイントステートベースラインで観察される高周波アーティファクトから、物理的に一貫した実現をもたらす。
論文 参考訳(メタデータ) (2026-02-12T18:58:12Z) - Halt the Hallucination: Decoupling Signal and Semantic OOD Detection Based on Cascaded Early Rejection [7.227431306238601]
粗い論理による異常検出のための階層的フィルタリングを実現するカスケード早期退避(CER)フレームワークを提案する。
実験の結果、CERは計算オーバーヘッドを32%削減するだけでなく、CIFAR-100ベンチマークの大幅な性能向上も達成している。
論文 参考訳(メタデータ) (2026-02-06T02:55:35Z) - Detecting AI Hallucinations in Finance: An Information-Theoretic Method Cuts Hallucination Rate by 92% [4.693270291878929]
大規模言語モデル(LLMs)は、流動的だがサポートされていない答え、幻覚を生み出す。
ECLIPSEは,モデルの意味エントロピーと利用可能な証拠の容量とのミスマッチとして幻覚を扱うフレームワークである。
論文 参考訳(メタデータ) (2025-12-02T05:25:48Z) - Noise & pattern: identity-anchored Tikhonov regularization for robust structural anomaly detection [58.535473924035365]
異常検出は自動産業検査において重要な役割を担い、他の均一な視覚パターンの微妙な欠陥や稀な欠陥を識別することを目的としている。
自己教師型オートエンコーダを用いて, 破損した入力の修復を学習する構造的異常検出に取り組む。
構造欠陥を模倣した画像に人工的破壊を注入する汚職モデルを導入する。
論文 参考訳(メタデータ) (2025-11-10T15:48:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。