論文の概要: C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2606.30609v1
- Date: Mon, 29 Jun 2026 17:45:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.368114
- Title: C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders
- Title(参考訳): C$^{2}$R: スパースオートエンコーダの特徴分割と吸収を軽減するクロスサンプル一貫性規則化
- Authors: Haoran Jin, Xiting Wang, Shijie Ren, Hong Xie, Defu Lian,
- Abstract要約: スパースオートエンコーダ(SAE)は、アクティベーションをスパースで人間の理解可能な機能に分解することで、大きな言語モデルを解釈するために広く使われている。
これらの問題は、サンプル間の一貫性のない潜在的な割り当てに起因している。
我々はC$2$Rを導入し、これは方向的に類似した潜伏剤の共活性化を罰する。
- 参考スコア(独自算出の注目度): 56.67585330425431
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse Autoencoders (SAEs) are widely used to interpret large language models by decomposing activations into sparse, human-understandable features, but scaling to large dictionaries exposes fundamental challenges. Systematic studies reveal pervasive feature splitting that fragments coherent concepts into non-atomic latents and widespread feature absorption that creates arbitrary exceptions in general features, severely compromising latent reliability. These issues stem from inconsistent latent assignment across samples: without cross-sample constraints, per-sample optimization often allows a single underlying concept to be inconsistently distributed across multiple redundant or interfering latents. To address this, we introduce C$^2$R (\underline{\textbf{C}}ross-sample \underline{\textbf{C}}onsistency \underline{\textbf{R}}egularization). C$^2$R explicitly encourages that each semantic feature is consistently represented by a unified latent across the batch by penalizing the co-activation of directionally similar latents. Comprehensive evaluation demonstrates that C$^2$R effectively mitigates both splitting and absorption while, crucially, preserving reconstruction fidelity, providing a principled solution that enhances latent interpretability without degrading model performance. Source code is available at https://github.com/hr-jin/Cross-sample-Consistency-Regularization.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は、アクティベーションをスパースで人間に理解可能な機能に分解することで、大きな言語モデルを解釈するために広く使われているが、大きな辞書へのスケーリングは根本的な課題を露呈している。
体系的な研究は、コヒーレントな概念を非原子的潜在概念に分解し、一般的な特徴において任意の例外を生じさせる広範囲な特徴吸収によって潜在信頼性を著しく損なうような広汎な特徴分割を明らかにしている。
クロスサンプル制約がなければ、サンプルごとの最適化によって、単一の基盤となる概念を複数の冗長なあるいは干渉的な潜在概念に一貫性なく分散させることができる。
これを解決するために、C$^2$R (\underline{\textbf{C}}ross-sample \underline{\textbf{C}}onsistency \underline{\textbf{R}}egularization)を導入します。
C$^2$R は、各セマンティックな特徴が一貫したラテントによってバッチ全体にわたって一貫して表現されることを明示的に推奨し、方向的に類似したラテントのコアクティベーションを罰する。
包括的評価により,C$^2$Rは分割と吸収の両面を効果的に緩和する一方で,再現性の維持を重要視し,モデル性能を劣化させることなく潜時的解釈性を向上する原理的解法を提供する。
ソースコードはhttps://github.com/hr-jin/Cross-sample-Consistency-Regularizationで公開されている。
関連論文リスト
- Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability [11.543771846135021]
スパースオートエンコーダ(SAE)は、大規模言語モデルにおける機械的解釈可能性に広く用いられている。
この仮定はモデル特徴の多次元構造と一致しないことを示す。
本稿では,単一ベクトルデコーダを学習したデコーダサブスペースに置き換えるSubspace-Aware Sparse Autoencoders (SASA)を紹介する。
論文 参考訳(メタデータ) (2026-06-04T16:08:25Z) - Feature Starvation as Geometric Instability in Sparse Autoencoders [0.764671395172401]
適応弾性ネットSAEは,古典的スパース回帰に基づく完全微分可能なアーキテクチャである。
AEN-SAEは、強い凸性およびリプシッツ安定性を適応的な$ell$再重み付けで強制する$ell$構造項を組み合わせる。
我々は,AEN-SAEsがLipschitzcontinuous sparse code mapを生成し,軽度の仮定でグローバル機能サポートを回復することを示す。
論文 参考訳(メタデータ) (2026-05-06T18:11:14Z) - Bi-Lipschitz Autoencoder With Injectivity Guarantee [14.99578789813769]
Bi-Lipschitz Autoencoder (BLAE) は、病的局所性ミニマを除去するための分離基準に基づくインジェクティブ正規化スキームである。
BLAEは、空間と分布のシフトをサンプリングするために弾力性を維持しながら、多様体構造を保存する既存の方法よりも一貫して優れている。
論文 参考訳(メタデータ) (2026-04-08T05:40:00Z) - SIM-CoT: Supervised Implicit Chain-of-Thought [108.30049193668083]
Implicit Chain-of-Thought(CoT)メソッドは、大規模言語モデルにおける明示的なCoT推論に代わるトークン効率の代替手段を提供する。
暗黙的なCoTの計算予算をスケールする際の中核的な不安定性問題を特定する。
そこで我々はSIM-CoTを提案する。SIM-CoTは,遅延推論空間を安定化・拡張するためのステップレベルの監視を実現するモジュールである。
論文 参考訳(メタデータ) (2025-09-24T17:01:32Z) - UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation [104.59740403500132]
マルチモーダルイメージセグメンテーションは、不完全/破損したモダリティの劣化による実際のデプロイメント課題に直面している。
階層型自己教師型補償(HSSC)による統一Modality-relaxセグメンテーションネットワーク(UniMRSeg)を提案する。
我々のアプローチは、入力レベル、特徴レベル、出力レベルをまたいだ完全なモダリティと不完全なモダリティの間の表現ギャップを階層的に橋渡しします。
論文 参考訳(メタデータ) (2025-09-19T17:29:25Z) - PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning [17.302186298424836]
クロスモーダル検索は、意味的類似性によって異なるモダリティを整列することを目的としている。
既存の手法では、画像とテキストのペアが完全に整列していると仮定し、実データでノイズ対応を見渡すことが多い。
論文 参考訳(メタデータ) (2025-09-19T05:41:17Z) - Tackling Ambiguity from Perspective of Uncertainty Inference and Affinity Diversification for Weakly Supervised Semantic Segmentation [12.308473939796945]
画像レベルのラベルを持つ弱教師付きセマンティックセマンティックセグメンテーション(WSSS)は、退屈なアノテーションを使わずに高密度なタスクを実現することを目的としている。
WSSSの性能、特にクラス活性化マップ(CAM)の生成と擬似マスクの精製の段階では、あいまいさに悩まされている。
統一された単一ステージWSSSフレームワークであるUniAを提案し、不確実性推論と親和性多様化の観点からこの問題に対処する。
論文 参考訳(メタデータ) (2024-04-12T01:54:59Z) - Improve Variational Autoencoder for Text Generationwith Discrete Latent
Bottleneck [52.08901549360262]
変分オートエンコーダ(VAE)は、エンドツーエンドの表現学習において必須のツールである。
VAEは強い自己回帰デコーダで潜伏変数を無視する傾向がある。
よりコンパクトな潜在空間において暗黙的な潜在特徴マッチングを強制する原理的アプローチを提案する。
論文 参考訳(メタデータ) (2020-04-22T14:41:37Z) - Distributional Robustness and Regularization in Reinforcement Learning [62.23012916708608]
経験値関数の新しい正規化器を導入し、ワッサーシュタイン分布のロバストな値関数を下限とすることを示す。
強化学習における$textitexternalな不確実性に対処するための実用的なツールとして正規化を使用することを提案する。
論文 参考訳(メタデータ) (2020-03-05T19:56:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。