論文の概要: Sparse Weight Decomposition for Efficient Circuit Extraction
- arxiv url: http://arxiv.org/abs/2608.03913v1
- Date: Tue, 04 Aug 2026 16:40:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.283447
- Title: Sparse Weight Decomposition for Efficient Circuit Extraction
- Title(参考訳): 効率的な回路抽出のためのスパースウェイト分解
- Authors: Chuanhao Yan, Xuhan Huang, Yawen Duan, Zhenfei Yin, Hang Zhao, Bryan Dai, Jie Fu,
- Abstract要約: 複雑な事前訓練された変換器は、回路抽出のための解釈可能なユニットを自然に公開しない。
本稿では,各重み行列を2つのスパース因子に分解することで,事前学習した射影を分解するスパース重み分解法を提案する。
SWDは,非ゼロ因子値の微調整後,すべての注意および重み行列のフルモデル置換に有効であることを示す。
- 参考スコア(独自算出の注目度): 36.87892448834478
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dense pretrained transformers do not naturally expose interpretable units for circuit extraction. Existing approaches obtain such units by learning auxiliary sparse representations or training sparse models, incurring substantial additional computation while potentially introducing a fidelity gap between the representation being analyzed and the original pretrained model. We propose Sparse Weight Decomposition (SWD), which reparameterizes pretrained linear projections by factorizing each weight matrix into two sparse factors whose shared intermediate coordinates serve as individually addressable circuit units. Without training a separate replacement network, this parametric representation supports the same scoring, selection, and ablation circuit extraction workflow used for methods that learn sparse features. Across single-matrix replacements, SWD matches the held-out fidelity achieved by Transcoder and other strong baselines while using less than 1% of the data that those baselines use to train their replacements. For matched replacement fidelity, SWD reaches the same circuit sufficiency and necessity targets with fewer active read/write edges and selected units across tasks on GPT-2, Qwen2.5, and Qwen3.5-27B. We further show that SWD remains effective for full-model replacement of all attention and MLP weight matrices after fine-tuning the nonzero factor values. Finally, SWD also features a zero-data variant, allowing broader use of mechanistic interpretability analysis (e.g., per-step analysis).
- Abstract(参考訳): 複雑な事前訓練された変換器は、回路抽出のための解釈可能なユニットを自然に公開しない。
既存の手法では、補助スパース表現や訓練スパースモデルを学習し、かなりの余分な計算を行いながら、分析対象の表現と元の事前訓練されたモデルの忠実さのギャップを生じさせる可能性がある。
本稿では,各重み行列を個別に対応可能な回路ユニットとして機能する2つのスパース因子に分解することで,事前学習された線形射影を再パラメータ化するスパース重み分解(SWD)を提案する。
別個の置換ネットワークをトレーニングせずに、このパラメトリック表現はスパース特徴を学習するメソッドで使用される同じスコアリング、選択、アブレーション回路抽出ワークフローをサポートする。
シングルマトリクスの代替品全体にわたって、SWDはTranscoderや他の強力なベースラインによって達成された保持された忠実度と一致し、それらのベースラインが置換を訓練するために使用するデータの1%未満を使用する。
整合した置換フィデリティでは、SWDは、GPT-2、Qwen2.5、Qwen3.5-27B上のタスクにまたがる、アクティブな読み取り/書き込みエッジが少なく、同じ回路飽和度と必要目標に達する。
さらに、SWDは非ゼロ因子値の微調整後、すべての注意とMLPの重量行列のフルモデル置換に有効であることを示す。
最後に、SWDはゼロデータ変種も備えており、機械的解釈可能性解析(例えば、ステップごとの分析)を広く利用することができる。
関連論文リスト
- One-Sided Quantile Coupling for Flow Matching [8.295726579539016]
Flow Matching Train Continuous-time Generative Model by regressing the velocity field of a probability path between a simple source distribution and a target data distribution。
本稿では,データバッチのみをサンプリングし,各ペアソースを直接構築する軽量な一方結合であるQuantile Coupling Flow Matching (QC-FM)を提案する。
QC-FMはトレーニング予算に合わせてベースラインを改良し、FIDを最大12.9%削減し、4つのデータセットでOT-CFMを上回っている。
論文 参考訳(メタデータ) (2026-08-02T04:03:59Z) - Action-Inspired Generative Models [0.0]
アクションインスパイアされた生成モデル(AGM)
既往の橋梁整合法が輸送景観の遷移に均一な回帰重みを割り当てるという観察に動機づけられた双対ネットワーク生成フレームワークを導入する。
学習可能なポテンシャルを通して不定形輸送経路を選択的に解析すると、フィデリティとカバレッジのメトリクス間で生成品質が一貫した改善が得られることを実証する。
論文 参考訳(メタデータ) (2026-05-14T09:43:32Z) - In-Context Symbolic Regression for Robustness-Improved Kolmogorov-Arnold Networks [3.7163623763519733]
シンボリック回帰は、ブラックボックス予測器を機械学習で検査および検証可能な分析式に置き換えることを目的としている。
Kolmogorov-Arnold Pursuit Networks (KANs) はこの目的に適している。
しかし、実際には記号抽出はボトルネックであり、標準のkan-to-symbolアプローチは各学習エッジ関数に微妙な分離で適合する。
論文 参考訳(メタデータ) (2026-03-16T13:21:26Z) - WUSH: Near-Optimal Adaptive Transforms for LLM Quantization [52.77441224845925]
低ビット幅への量子化は、大きな言語モデルをデプロイするための標準的なアプローチである。
いくつかの極端な重みと活性化は、ダイナミックレンジを拡張し、量子化器の有効分解能を減少させる。
結合重みアクティベーション量子化のための閉形式最適線形ブロックワイズ変換を初めて導出する。
論文 参考訳(メタデータ) (2025-11-30T16:17:34Z) - MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts [0.0]
大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
論文 参考訳(メタデータ) (2025-11-26T06:14:26Z) - Incorporating Arbitrary Matrix Group Equivariance into KANs [69.30866522377694]
Kolmogorov-Arnold Networks (KAN) は科学分野で大きな成功を収めている。
本研究では,Equivariant Kolmogorov-Arnold Networks (EKAN)を提案する。
論文 参考訳(メタデータ) (2024-10-01T06:34:58Z) - Improving the Sample-Complexity of Deep Classification Networks with
Invariant Integration [77.99182201815763]
変換によるクラス内分散に関する事前知識を活用することは、ディープニューラルネットワークのサンプル複雑性を改善するための強力な方法である。
そこで本研究では,アプリケーションの複雑な問題に対処するために,プルーニング法に基づく新しい単項選択アルゴリズムを提案する。
本稿では,Rotated-MNIST,SVHN,CIFAR-10データセットにおけるサンプルの複雑さの改善について述べる。
論文 参考訳(メタデータ) (2022-02-08T16:16:11Z) - Unfolding Projection-free SDP Relaxation of Binary Graph Classifier via
GDPA Linearization [59.87663954467815]
アルゴリズムの展開は、モデルベースのアルゴリズムの各イテレーションをニューラルネットワーク層として実装することにより、解釈可能で類似のニューラルネットワークアーキテクチャを生成する。
本稿では、Gershgorin disc perfect alignment (GDPA)と呼ばれる最近の線形代数定理を利用して、二進グラフの半定値プログラミング緩和(SDR)のためのプロジェクションフリーアルゴリズムをアンロールする。
実験結果から,我々の未学習ネットワークは純粋モデルベースグラフ分類器よりも優れ,純粋データ駆動ネットワークに匹敵する性能を示したが,パラメータははるかに少なかった。
論文 参考訳(メタデータ) (2021-09-10T07:01:15Z) - Exact Backpropagation in Binary Weighted Networks with Group Weight
Transformations [0.0]
量子化に基づくモデル圧縮は、推論のためのハイパフォーマンスで高速なアプローチとして機能する。
重みをバイナリ値に制限するモデルは、ユビキタスドット製品の効率的な実装を可能にします。
論文 参考訳(メタデータ) (2021-07-03T10:29:34Z) - Bayesian Transformer Language Models for Speech Recognition [59.235405107295655]
トランスフォーマーで表現される最先端のニューラルネットワークモデル(LM)は非常に複雑である。
本稿では,トランスフォーマーLM推定のためのベイズ学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-02-09T10:55:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。