論文の概要: PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding
- arxiv url: http://arxiv.org/abs/2602.01322v1
- Date: Sun, 01 Feb 2026 16:34:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:33.715238
- Title: PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding
- Title(参考訳): PolySAE:ポリノミアルデコーディングによるスパースオートエンコーダの機能相互作用のモデル化
- Abstract要約: 我々は,SAEデコーダを高次項で拡張して特徴的相互作用をモデル化するPolySAEを紹介する。
4つの言語モデルと3つのSAE変種に対して、PolySAEはF1の探索において平均8%の改善を達成した。
- 参考スコア(独自算出の注目度): 16.10987386200554
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse autoencoders (SAEs) have emerged as a promising method for interpreting neural network representations by decomposing activations into sparse combinations of dictionary atoms. However, SAEs assume that features combine additively through linear reconstruction, an assumption that cannot capture compositional structure: linear models cannot distinguish whether "Starbucks" arises from the composition of "star" and "coffee" features or merely their co-occurrence. This forces SAEs to allocate monolithic features for compound concepts rather than decomposing them into interpretable constituents. We introduce PolySAE, which extends the SAE decoder with higher-order terms to model feature interactions while preserving the linear encoder essential for interpretability. Through low-rank tensor factorization on a shared projection subspace, PolySAE captures pairwise and triple feature interactions with small parameter overhead (3% on GPT2). Across four language models and three SAE variants, PolySAE achieves an average improvement of approximately 8% in probing F1 while maintaining comparable reconstruction error, and produces 2-10$\times$ larger Wasserstein distances between class-conditional feature distributions. Critically, learned interaction weights exhibit negligible correlation with co-occurrence frequency ($r = 0.06$ vs. $r = 0.82$ for SAE feature covariance), suggesting that polynomial terms capture compositional structure, such as morphological binding and phrasal composition, largely independent of surface statistics.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は、活性化を辞書原子のスパース結合に分解することで、ニューラルネットワーク表現を解釈するための有望な方法として登場した。
線形モデルは「スターバックス」が「スターバックス」と「コーヒー」の特徴の合成から生じるのか、単にその共起から生じるのかを区別できない。
これにより、SAEはそれらを解釈可能な構成要素に分解するのではなく、複合概念にモノリシックな特徴を割り当てる。
本稿では,SAEデコーダを高次項で拡張し,解析性に不可欠な線形エンコーダを保ちながら特徴的相互作用をモデル化するPolySAEを紹介する。
共有射影部分空間上の低ランクテンソル因子化により、PolySAEは小さなパラメータのオーバーヘッド(GPT2)で3%)を持つペアとトリプルの特徴相互作用をキャプチャする。
4つの言語モデルと3つのSAE変種の間で、PolySAEはF1の探索において平均8%の改善を達成し、クラス条件の特徴分布間の2-10$\times$大きなワッサースタイン距離を生成する。
批判的に、学習された相互作用重みは共起周波数(r = 0.06$ vs. $r = 0.82$ for SAE feature covariance)と無視できる相関を示し、多項式項は、形態的結合やフレーズ合成のような構成構造を、表面統計とは独立に捉えることを示唆している。
関連論文リスト
- Hyper-Fold: Exploring the Expressive Limit of Sequence-Geometry Learning for Proteins via Hypergraph Modeling [55.36837305276515]
コンテント幾何学的外積に対する完全双線型作用素、すなわち2階の相互作用の十分統計は、表現的天井であることを示す。
次に、メッセージパッシングコストで天井に近づく、ランク-K分離可能な畳み込みバックボーンであるHyper-Foldを紹介します。
論文 参考訳(メタデータ) (2026-08-29T11:43:25Z) - Understanding Synergistic Interactions among Pathology Foundation Models via Adaptive Fusion [49.550545038402184]
病理基盤モデル(PFM)は、大規模病理画像の自己教師付き事前トレーニングを通じて、強力なタイルレベルの表現を提供する。
AdaFusionは軽量な適応型核融合フレームワークで、複数の凍結されたPFMから補完的な信号を統合する。
AdaFusionは、解釈可能な組織可視化を提供しながら、個々のPFMやその他の融合ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-02T16:44:45Z) - All you need is SAMPAT [4.978871870250063]
解釈可能性(interpretability)は、実験データを分析しながら洞察を引き出す上で重要である。
連続的かつ至るところで微分可能な関数を確実に学習できる3層ニューラルネットワーク、SAMPATを提案する。
合成およびベンチマークデータセットの実験は、SAMPATがより単純な表現で競合性能を得ることを示している。
論文 参考訳(メタデータ) (2026-07-10T09:31:01Z) - PairSAE: Mechanistic Interpretability from Pair Representations in Protein Co-Folding [2.360330081206126]
我々はNモードSVDによるペアワイズテンソルをトークンワイズインタラクションロールに要約するPairSAEを紹介する。
次に、スパースオートエンコーダを使用して、シーケンスとペア表現の両方にデコードするトークンレベルの機能の共有セットを学習する。
これらの結果は、PairSAEが構造生物学の基礎モデルの潜在空間と解釈可能な構造概念を結びつけていることを示している。
論文 参考訳(メタデータ) (2026-06-25T18:01:44Z) - The Representational Limit of Scalar Interactions: An Interventional Decomposition [9.850981754860754]
署名されたペア相互作用スコアが、一意性(U)、冗長性(R)、シナジー(S)を根本的に説明することを証明する。
介入マスクによる推定により,機能当たりのU/R/Sプロファイルを推定する,ポストホックかつリトレーニング不要な予測可能性分解であるHi-Fiを導入する。
論文 参考訳(メタデータ) (2026-06-17T15:21:28Z) - Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models [51.56484100374058]
モデルがサポートできるほぼ直交方向数を推定するためのフレームワークを開発する。
このメトリックを数十のオープンソースモデルに適用すると、高い$varepsilon$を持つモデルと、それを維持する$varepsilon$の低いモデルという2つのクラスが明らかになる。
論文 参考訳(メタデータ) (2026-06-01T18:28:56Z) - Feature Starvation as Geometric Instability in Sparse Autoencoders [0.764671395172401]
適応弾性ネットSAEは,古典的スパース回帰に基づく完全微分可能なアーキテクチャである。
AEN-SAEは、強い凸性およびリプシッツ安定性を適応的な$ell$再重み付けで強制する$ell$構造項を組み合わせる。
我々は,AEN-SAEsがLipschitzcontinuous sparse code mapを生成し,軽度の仮定でグローバル機能サポートを回復することを示す。
論文 参考訳(メタデータ) (2026-05-06T18:11:14Z) - RiboSphere: Learning Unified and Efficient Representations of RNA Structures [57.40815107640066]
RNAのバックボーンは非常に柔軟で、非カノニカル相互作用が一般的であり、実験的に決定された3D構造は比較的少ない。
本稿では,ベクトル量子化とフローマッチングを組み合わせることで,RNAの固有な幾何学的表現を学習するフレームワークであるemphRiboSphereを紹介する。
論文 参考訳(メタデータ) (2026-03-20T04:36:35Z) - RaCo: Ranking and Covariance for Practical Learned Keypoints [51.38393049306958]
RaCoは、様々な3Dコンピュータビジョンタスクに適した堅牢で汎用的なキーポイントを学ぶように設計されている。
RaCoは可視画像ペアを必要とせずに動作する。
論文 参考訳(メタデータ) (2026-02-17T17:39:52Z) - Scalable and Interpretable Scientific Discovery via Sparse Variational Gaussian Process Kolmogorov-Arnold Networks (SVGP KAN) [0.0]
Kolmogorov-Arnold Networks (KAN)はMulti-Layer Perceptron (MLP)に代わる有望な代替手段を提供する
カンは確率的な出力を欠き、不確実な定量化を必要とするアプリケーションにおける実用性を制限している。
本稿では,Sparse Variational GP-KANについて紹介する。
論文 参考訳(メタデータ) (2025-11-29T00:48:55Z) - Pearl: A Foundation Model for Placing Every Atom in the Right Location [52.35027831422145]
タンパク質-リガンド共フォールディングの基礎モデルであるPearlを紹介した。
パールはタンパク質-リガンド結合における新しい最先端性能を確立している。
Pearlは、パブリックなRuns N' PosesとPoseBustersベンチマークでAlphaFold 3や他のオープンソースベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:36:51Z) - Randomized based restricted kernel machine for hyperspectral image classification [0.0]
ランダムベクトル汎関数リンク(RVFL)ネットワークは、ハイパースペクトル画像(HSI)分類において大きな人気を得ている。
RVFLモデルは、特に非線形関係や複雑なデータ構造を扱う際に、いくつかの制限に直面している。
本稿では,RVFLと制限されたカーネルマシンを併用した,ランダム化された制限されたカーネルマシン(R2KM$)モデルを提案する。
論文 参考訳(メタデータ) (2025-03-06T17:18:39Z) - SAFR: Neuron Redistribution for Interpretability [7.756342860929851]
重ね合わせ(英: superposition)とは、単一ニューロン内の複数の特徴の表現を符号化することである。
期待された性能にもかかわらず、モデルの解釈可能性は低下している。
本稿では,特徴重畳を正規化することによってモデル解釈可能性を高める新しい手法を提案する。
論文 参考訳(メタデータ) (2025-01-23T06:20:33Z) - Incorporating Arbitrary Matrix Group Equivariance into KANs [69.30866522377694]
Kolmogorov-Arnold Networks (KAN) は科学分野で大きな成功を収めている。
本研究では,Equivariant Kolmogorov-Arnold Networks (EKAN)を提案する。
論文 参考訳(メタデータ) (2024-10-01T06:34:58Z) - Squeezeformer: An Efficient Transformer for Automatic Speech Recognition [99.349598600887]
Conformerは、そのハイブリッドアテンション・コンボリューションアーキテクチャに基づいて、様々な下流音声タスクの事実上のバックボーンモデルである。
Squeezeformerモデルを提案する。これは、同じトレーニングスキームの下で、最先端のASRモデルよりも一貫して優れている。
論文 参考訳(メタデータ) (2022-06-02T06:06:29Z) - SHRIMP: Sparser Random Feature Models via Iterative Magnitude Pruning [3.775565013663731]
IMP (ShRIMP) を用いたスペーサーランダム特徴モデル(スペーサーランダム特徴モデル)を提案する。
提案手法は,2層密集ネットワークにおける疎く宝くじを作成・発見するための複合的なプロセスとみなすことができる。
論文 参考訳(メタデータ) (2021-12-07T21:32:28Z) - Bilinear Classes: A Structural Framework for Provable Generalization in
RL [119.42509700822484]
Bilinear Classesは強化学習の一般化を可能にする新しい構造フレームワークである。
このフレームワークは、サンプルの複雑さが達成可能な、ほとんどすべての既存のモデルを取り込んでいる。
我々の主な成果は、双線形クラスのためのサンプル複雑性を持つRLアルゴリズムである。
論文 参考訳(メタデータ) (2021-03-19T16:34:20Z) - ACDC: Weight Sharing in Atom-Coefficient Decomposed Convolution [57.635467829558664]
我々は,CNNにおいて,畳み込みカーネル間の構造正則化を導入する。
我々はCNNがパラメータや計算量を劇的に減らして性能を維持していることを示す。
論文 参考訳(メタデータ) (2020-09-04T20:41:47Z) - Reduced Dilation-Erosion Perceptron for Binary Classification [1.3706331473063877]
ディレーション・エロージョン・パーセプトロン(Dilation-erosion Perceptron, DEP)は、ディレーションとエロージョンの凸結合によって得られるニューラルネットワークである。
本稿では,r-DEP(reduce Dilation-erosion)分類器を提案する。
論文 参考訳(メタデータ) (2020-03-04T19:50:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。