論文の概要: Cross-seed explainability using Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2607.08499v1
- Date: Thu, 09 Jul 2026 13:59:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.555548
- Title: Cross-seed explainability using Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoders
- Title(参考訳): Procrustes- Conditioned Joint-to-end Top-K Sparse Autoencoders を用いたクロスシード説明可能性
- Abstract要約: 本稿では,個別に訓練されたBERT文献から,クロスコンディショニングされたSAEを抽出するためのTopK Sparse Autoencoder(SAE)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present a Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoder (SAE) for extracting cross-seed universal features from independently trained BERT models. Cross-seed feature universality is a fundamental challenge in mechanistic interpretability: because dictionary learning is non-convex, independently trained networks learn misaligned feature spaces, so apparently identical features may differ by random initialization. We address this by computing an orthogonal Procrustes rotation between seeds' activation spaces before joint SAE training, combining Top-K sparsity, end-to-end downstream optimization, and an auxiliary dead-feature revival loss based on previous SAE literature. Evaluating on five independent seed pairs (ten BERT models) across three benchmark datasets (SST-2, Stanford Politeness, TweetEval Emotion), our full pipeline produces more universal features (Pearson r $\geq$ 0.70 across seeds) than post-hoc alignment baselines on all three datasets. A minimal qualitative analysis confirms that high-universality features encode interpretable sociolinguistic patterns.
- Abstract(参考訳): 独立に訓練されたBERTモデルからクロスシードユニバーサル特徴を抽出するために,プロクリストコンディション付きTop-K Sparse Autoencoder(SAE)を提案する。
辞書学習は非凸であるため、独立に訓練されたネットワークは不整合な特徴空間を学習するので、明らかに同一の機能はランダム初期化によって異なる可能性がある。
本研究では,SAEトレーニング前の種子の活性化空間間の直交的プロクレスト回転を計算し,Top-K間隔,エンド・ツー・エンド・エンド・ダウンストリーム最適化,および以前のSAE文献に基づく補助的致命的回復損失を組み合わせた。
3つのベンチマークデータセット(SST-2、Stanford Politeness、TweetEval Emotion)にまたがる5つの独立したシードペア(BERTモデル10)を評価することで、私たちの完全なパイプラインは、すべての3つのデータセットに対するポストホックアライメントベースラインよりも、より普遍的な機能(Pearson r $\geq$ 0.70)を生成します。
最小限の質的分析により、高ユニバーシティーな特徴が解釈可能な社会言語学的パターンをコード化することを確認した。
関連論文リスト
- Learning Auditable Classifier Models: Source-Disjoint Tree Ensembles [0.0]
臨床および規制された設定における予測モデルは正確で、完全に監査可能である必要がある。
本稿では,3段階学習手法であるResidual Pattern Tree Ensemble(RPTE)を紹介する。
RPTEは、有界特徴予算(bounded feature budget)、ソースの不整合(source disjointness)、別個の係数推定という3つの重要な原則に基づいている。
論文 参考訳(メタデータ) (2026-08-16T12:56:49Z) - C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders [56.67585330425431]
スパースオートエンコーダ(SAE)は、アクティベーションをスパースで人間の理解可能な機能に分解することで、大きな言語モデルを解釈するために広く使われている。
これらの問題は、サンプル間の一貫性のない潜在的な割り当てに起因している。
我々はC$2$Rを導入し、これは方向的に類似した潜伏剤の共活性化を罰する。
論文 参考訳(メタデータ) (2026-06-29T17:45:31Z) - Rational Sparse Autoencoder [14.27315714880774]
本稿では、固定エンコーダアクティベーションをトレーニング可能な有理関数に置き換えるRational Sparse Autoencoder(RSAE)を紹介する。
RSAEは、リコンストラクションサイドメトリクスと下流ビヘイビアメトリクスの両方において、微調整後の厳格な改善を行っている。
これらのゲインはホスト言語モデル、ベースラインアクティベーションファミリ、そしてテストしたベースラインの完全範囲にわたって一貫しています。
論文 参考訳(メタデータ) (2026-06-12T22:22:40Z) - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models [102.20309135516186]
クロスエントロピー(CE)トレーニングは、言語モデルの密集したスケーラブルな監視を提供する。
言語モデル微調整のための特徴マッチング手法を提案する。
この目的を効率的に最適化するために,エネルギーベースファインチューニングを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:57:50Z) - BTZSC: A Benchmark for Zero-Shot Text Classification Across Cross-Encoders, Embedding Models, Rerankers and LLMs [0.0]
ゼロショットテキスト分類(ZSC)は、コストのかかるタスク固有のアノテーションを排除することを約束する。
テキスト埋め込みモデル、リランカ、命令調整型大規模言語モデル(LLM)の最近の進歩は、NLIベースのアーキテクチャの優位性に挑戦している。
我々は、感情、トピック、意図、感情の分類にまたがる22の公開データセットの総合ベンチマークであるBTZSCを紹介する。
論文 参考訳(メタデータ) (2026-03-12T14:43:20Z) - Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models [9.059725329168435]
トップW(Top-W)は、トークン埋め込み幾何学上のワッサーシュタイン距離定義を用いた幾何対応トランケーション規則である。
我々は、Top-Wが、最先端のデコードアプローチにおいて、最大33.7%の改善を継続的に達成していることを示す。
論文 参考訳(メタデータ) (2026-02-10T22:36:48Z) - CoT-Saliency: Unified Chain-of-Thought Reasoning for Heterogeneous Saliency Tasks [96.64597365827046]
本稿では,3つの運用上不均一なサリエンシタスクを共同で処理する,最初の統合フレームワークを提案する。
タスクの不均一性を橋渡しする視覚言語モデル(VLM)において、チェーン・オブ・ソート(CoT)推論プロセスを導入する。
我々は,全タスクにまたがる特別なSOTA手法と強力なクローズドソースVLMの整合性を示す。
論文 参考訳(メタデータ) (2025-11-01T04:37:01Z) - Soft decision trees for survival analysis [2.1506382989223782]
本稿では,各分岐ノードにソフトスプリッティングルールを付加した新しい生存木モデル(SST)を提案する。
SSTとトレーニング定式化は、柔軟性と解釈可能性を組み合わせたものである。
SSTは4つの広く使用されている差別と校正の指標で3つのベンチマークサバイバルツリーを上回っている。
論文 参考訳(メタデータ) (2025-06-20T08:51:33Z) - Compressed Feature Quality Assessment: Dataset and Baselines [89.62929964441962]
圧縮された特徴のセマンティック忠実度を評価するための最初のベンチマークデータセットを提案する。
MSE、コサイン類似性、CKA(Centered Kernel Alignment)という3つの広く使われているメトリクスを、意味的劣化を捉える能力の観点から体系的に評価する。
この研究は、基礎的なベンチマークを確立し、コミュニティがCFQAを探索するための重要なリソースを提供することによって、この分野を前進させます。
論文 参考訳(メタデータ) (2025-06-09T04:16:39Z) - TD3: Tucker Decomposition Based Dataset Distillation Method for Sequential Recommendation [50.23504065567638]
本稿では,メタラーニングフレームワークにおける textbfDataset textbfDistillation 手法である textbfTD3 を紹介する。
TD3は、オリジナルのデータから完全に表現力のある合成配列の要約を蒸留する。
拡張技術により、学習者は合成要約を忠実に適合させ、アンプループでの正確な更新を確実にすることができる。
論文 参考訳(メタデータ) (2025-02-05T03:13:25Z) - Mutual Exclusivity Training and Primitive Augmentation to Induce
Compositionality [84.94877848357896]
最近のデータセットは、標準的なシーケンス・ツー・シーケンスモデルにおける体系的な一般化能力の欠如を露呈している。
本稿では,セq2seqモデルの振る舞いを分析し,相互排他バイアスの欠如と全例を記憶する傾向の2つの要因を同定する。
広範に使用されている2つの構成性データセット上で、標準的なシーケンス・ツー・シーケンスモデルを用いて、経験的改善を示す。
論文 参考訳(メタデータ) (2022-11-28T17:36:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。