論文の概要: ClasSAE: Class-Aligned Sparse Autoencoders via Differentiable Feature-Class Affinity
- arxiv url: http://arxiv.org/abs/2610.04020v1
- Date: Fri, 02 Oct 2026 20:28:03 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:15:45.484396
- Title: ClasSAE: Class-Aligned Sparse Autoencoders via Differentiable Feature-Class Affinity
- Title(参考訳): ClasSAE: 特徴クラス親和性によるクラスアラインなスパースオートエンコーダ
- Abstract要約: ClasSAEは、機能に自動的にクラスを割り当て、トレーニング中のクラス分離可能な表現に向けてエンコーダをガイドする新しいメソッドである。
得られた親和性行列は、ホールドアウトデータに基づいて計算された、独立に見積もられた特徴クラス行列と密接に一致していることを示す。
- 参考スコア(独自算出の注目度): 11.728621223411475
- License:
- Abstract: Sparse Autoencoders (SAEs) began as an unsupervised tool for decomposing neural representations into sparse, interpretable features, and are increasingly used not only for passive analysis but also for active interventions such as unlearning, bias mitigation, and concept editing. A central challenge for these editing and steering methods is reliably matching features to target concepts; most current approaches address this by computing post-hoc scores over an already-trained, frozen dictionary. We instead introduce ClasSAE, a novel method that both automatically assigns classes to features and guides the encoder toward class-separable representations during training. Specifically, we apply a differentiable top-$k$ operator to a trainable feature--class affinity matrix with per-feature budgets, coupling the features selected for each sample to the classes they are trained to represent. Because gradients flow through the selection of active features rather than only through their magnitudes, the encoder and the affinity matrix co-adapt rather than being fit in separate stages. The result is a dictionary that is both class-separable and class-annotated, with no need for post-hoc probing. We propose three variants for enforcing sparsity within this framework, which achieve comparable overall performance with slightly different trade-offs. Using CLIP ViT-L/14 embeddings on ImageNet, we show that the learned affinity matrix agrees closely with an independently estimated post-hoc feature-class matrix computed on held-out data. The model also supports direct class prediction from the encoder and affinity matrix alone, without a separately fitted classifier, and its more class-aligned encoder yields improved separation in Targeted Probe Perturbation evaluations. https://github.com/St0pien/ClasSAE.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は、神経表現をスパースで解釈可能な特徴に分解するための教師なしのツールとして始まり、受動的解析だけでなく、未学習、バイアス軽減、概念編集といった積極的な介入にも使われるようになった。
これらの編集とステアリング手法における中心的な課題は、目標とする概念に確実に適合する機能である。
代わりに、クラスを機能に自動的に割り当てる新しい方法であるCrasSAEを導入し、トレーニング中にクラス分離可能な表現に向けてエンコーダを誘導する。
具体的には、トレーニング可能な機能-クラス親和性行列に対して、各サンプルから選択した特徴を、それらが表現するように訓練されたクラスに結合して、k$演算子を適用します。
勾配はその大きさだけでなく活性な特徴の選択を通して流れるので、エンコーダと親和性行列は別々の段階に収まるのではなく、共適応である。
その結果、クラス分離可能とクラスアノテーションの両方を持つ辞書となり、ポストホックな探索は不要である。
我々は,このフレームワーク内でのスパーシティを強制する3つの変種を提案し,若干のトレードオフを伴って,全体的な性能を同等に向上する。
画像Net上のCLIP ViT-L/14埋め込みを用いて、学習親和性行列は、ホールドアウトデータに基づいて計算された、独立に推定された特徴クラス行列と密接に一致していることを示す。
モデルはまた、分離された分類器を使わずに、エンコーダと親和性行列のみからの直接クラス予測をサポートし、よりクラス整列型エンコーダは、ターゲットされたプローブ摂動評価の分離を改善する。
https://github.com/St0pien/ClasSAE.com
関連論文リスト
- SmoothOperator: Enhancing Representations for Fine-grained Open-set Recognition via Modulated Label Smoothing [5.315316451049643]
Open Set Recognition (OSR) は、未知のクラスからのサンプルを拒絶しながら、モデルが既知のクラスを正確に分類できるようにすることを目的としている。
組込み空間信号であるtextbfprominence から各サンプルの平滑化係数を設定するプラグイン SmoothOP を提案する。
本手法は,訓練のオーバーヘッドを最小限に抑えつつ,既存の4つの球面表現学習手法に統合する。
論文 参考訳(メタデータ) (2026-10-01T00:08:35Z) - AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning [17.715024506546957]
CIL(Class-Incremental Learning)は,現実世界の学習システム構築において重要である。
CLIにおける属性抽出とアグリゲーションのためのAREAを提案する。
実験の結果、AREAはSOTA法よりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-05-27T17:58:16Z) - Towards Realistic Zero-Shot Classification via Self Structural Semantic
Alignment [53.2701026843921]
大規模事前訓練型視覚言語モデル(VLM)はゼロショット分類に有効であることが証明されている。
本稿では,アノテーションではなく,より広い語彙を前提とした,より難易度の高いゼロショット分類(Realistic Zero-Shot Classification)を提案する。
本稿では,ラベルのないデータから構造意味情報を抽出し,同時に自己学習を行う自己構造意味アライメント(S3A)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-24T17:56:46Z) - Fine-Grained Visual Classification using Self Assessment Classifier [12.596520707449027]
識別的特徴の抽出は、きめ細かい視覚的分類タスクにおいて重要な役割を担っている。
本稿では,画像とトップkの予測クラスを同時に活用する自己評価手法を提案する。
本手法は,CUB200-2011,Stanford Dog,FGVC Aircraft のデータセットに対して,最新の結果が得られることを示す。
論文 参考訳(メタデータ) (2022-05-21T07:41:27Z) - Exploring Category-correlated Feature for Few-shot Image Classification [27.13708881431794]
本稿では,従来の知識として,新しいクラスとベースクラスのカテゴリ相関を探索し,シンプルで効果的な特徴補正手法を提案する。
提案手法は, 広く使用されている3つのベンチマークにおいて, 一定の性能向上が得られる。
論文 参考訳(メタデータ) (2021-12-14T08:25:24Z) - APANet: Adaptive Prototypes Alignment Network for Few-Shot Semantic
Segmentation [56.387647750094466]
Few-shotのセマンティックセマンティックセマンティクスは、指定されたクエリイメージに、ラベル付きサポートイメージのみで、新規クラスのオブジェクトをセグメントすることを目的としている。
ほとんどの高度なソリューションは、各クエリ機能を学習したクラス固有のプロトタイプにマッチさせることでセグメンテーションを実行するメトリクス学習フレームワークを利用している。
本稿では,クラス固有およびクラス非依存のプロトタイプを導入することで,適応型プロトタイプ表現を提案する。
論文 参考訳(メタデータ) (2021-11-24T04:38:37Z) - Simpler is Better: Few-shot Semantic Segmentation with Classifier Weight
Transformer [112.95747173442754]
数ショットのセマンティックセグメンテーションモデルは典型的にはCNNエンコーダ、CNNデコーダ、単純な分類器から構成される。
既存のほとんどのメソッドは、新しいクラスに迅速に適応するために、3つのモデルコンポーネント全てをメタ学習する。
本稿では,最も単純なコンポーネントである分類器にのみ焦点をあてて,メタ学習タスクの簡略化を提案する。
論文 参考訳(メタデータ) (2021-08-06T10:20:08Z) - Sinkhorn Label Allocation: Semi-Supervised Classification via Annealed
Self-Training [38.81973113564937]
セルフトレーニングは、学習者がラベルのないデータに関する予測をトレーニング中の監督として使用する半教師付き学習の標準的なアプローチです。
本稿では,このラベル割当問題を事例とクラス間の最適輸送問題として再解釈する。
我々は,CIFAR-10,CIFAR-100,SVHNデータセットに対するアルゴリズムの有効性を,最先端の自己学習アルゴリズムであるFixMatchと比較した。
論文 参考訳(メタデータ) (2021-02-17T08:23:15Z) - Learning Class Regularized Features for Action Recognition [68.90994813947405]
本稿では,階層活性化のクラスベース正規化を行うクラス正規化手法を提案する。
動作認識に最先端CNNアーキテクチャのクラス正規化ブロックを用いることで,Kineetics,UCF-101,HMDB-51データセットにおいて,それぞれ1.8%,1.2%,1.4%の体系的改善が得られた。
論文 参考訳(メタデータ) (2020-02-07T07:27:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。