論文の概要: Weights Read and Write Features: Scalable Parameter Decomposition Grounded in Activation Space
- arxiv url: http://arxiv.org/abs/2609.37731v2
- Date: Thu, 01 Oct 2026 19:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.952087
- Title: Weights Read and Write Features: Scalable Parameter Decomposition Grounded in Activation Space
- Title(参考訳): 軽量で読み書き可能な機能: アクティベーションスペースで構築されたスケーラブルなパラメータ分解
- Abstract要約: 我々は、アクティベーションとパラメータ空間を分解し、読み書きするアクティベーション機能において、各学習したウェイト成分をグラウンド化する。
これらの特性は、事前訓練された大きな言語モデルにおいて、スケーラブルで解釈可能で、因果的に編集可能なパラメータ分解を可能にする。
ASPDを用いて、従来のIOI回路の基盤となるメカニズムを復元し、モデル重みによる意味変換をトレースする。
- 参考スコア(独自算出の注目度): 11.580981382543817
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation space and parameter space provide complementary views of model computation. Activations represent information, while weights read, transform, and write that information. Yet existing interpretability methods largely study the two spaces separately, leaving the connection between represented information and parameter-level computation underexplored. We introduce Activation-Supported Parameter Decomposition (ASPD), which jointly decomposes activation and parameter spaces and grounds each learned weight component in the activation features it reads or writes. This grounding constrains otherwise non-unique parameter decompositions using the model's internal activations, while an internal reconstruction objective provides a local learning signal at the weight matrix being analyzed. Together, these properties enable scalable, interpretable, and causally editable parameter decomposition in pretrained large language models, demonstrated on Qwen-3-8B. The learned read--write components can also be composed into parameter-level mechanism circuits. We use ASPD to recover mechanisms underlying the classic IOI circuit and trace semantic transformations through model weights.
- Abstract(参考訳): 活性化空間とパラメータ空間はモデル計算の相補的なビューを提供する。
アクティベーションは情報を表し、ウェイトはその情報を読み、変換し、書き込む。
しかし、既存の解釈可能性法は主に2つの空間を別々に研究し、表現された情報とパラメータレベルの計算とのつながりを過小評価している。
本稿では、アクティベーションとパラメータ空間を共同で分解し、読み書きするアクティベーション機能において、各学習重量成分を接地する、アクティベーション対応パラメータ分解(ASPD)を紹介する。
この基底は、モデルの内部アクティベーションを用いた非特異パラメータ分解を制約し、内部再構成の目的は、分析対象の重み行列における局所的な学習信号を提供する。
これらの特性は、Qwen-3-8Bで実証された事前訓練された大規模言語モデルにおいて、スケーラブルで解釈可能で、因果的に編集可能なパラメータ分解を可能にする。
学習した読み書きコンポーネントはパラメータレベルの機構回路に構成することもできる。
ASPDを用いて、従来のIOI回路の基盤となるメカニズムを復元し、モデル重みによる意味変換をトレースする。
関連論文リスト
- Diffusion learning reveals viable parameter manifolds and compensation geometry in biological dynamical systems [0.8373151777137791]
本研究では,パラメータ・トゥ・フェース・マップの下でのシステムの対象行動の逆画像として,互換パラメータ集合を表現可能なパラメータ多様体として定式化する。
シミュレーションパラメーター対の条件付きスコアベース拡散モデルを訓練し、それらを事前重み付け可能な集合のアモータライズ標本として利用する。
この観点では、ロバスト性、補償、および隠れパラメータ依存は逆幾何学として組織され、拡散モデルは、その幾何学をサンプリング、視覚化、尋問するための実用的なツールを提供する。
論文 参考訳(メタデータ) (2026-07-04T02:51:11Z) - Weight Patching: Toward Source-Level Mechanistic Localization in LLMs [12.558998651017374]
重み付き同一アーキテクチャモデルにおけるソース指向解析のためのパラメータ空間介入手法であるWeight Patchingを提案する。
本稿では,タスク関連制御状態が形成されたかどうかの共通内部規準を提供する,ベクトル・アンカー・ビヘイビア・インタフェースを中心にしたフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T10:21:38Z) - Circuit Insights: Towards Interpretability Beyond Activations [20.178085579725472]
WeightLensとCircuitLensの2つの相補的手法を提案する。
WeightLensは学習したウェイトから直接機能を解釈し、説明モデルやデータセットの必要性を取り除く。
CircuitLensは、コンポーネント間のインタラクションから機能アクティベーションがどのように発生し、回路レベルのダイナミクスを明らかにするのかをキャプチャする。
論文 参考訳(メタデータ) (2025-10-16T17:49:41Z) - Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models [55.46269953415811]
ToM感受性パラメータを同定し、これらのパラメータの0.001%の摂動がToM性能を著しく低下させることを示す。
我々の結果は、モデルアライメントの強化、バイアス軽減、ヒューマンインタラクション用に設計されたAIシステムの改善に影響を及ぼす。
論文 参考訳(メタデータ) (2025-04-05T17:45:42Z) - Solution space and storage capacity of fully connected two-layer neural networks with generic activation functions [0.552480439325792]
二項分類モデルの記憶容量は、モデルが学習できるパラメータ毎のランダムな入出力ペアの最大数である。
一般活性化機能を持つ完全連結二層ニューラルネットワークの解空間の構造と記憶容量を解析する。
論文 参考訳(メタデータ) (2024-04-20T15:12:47Z) - Data-free Weight Compress and Denoise for Large Language Models [96.68582094536032]
パラメータ行列を圧縮する手法として,データフリーなジョイントランクk近似を提案する。
キャリブレーションデータなしで、元の性能の93.43%を維持しながら80%のパラメータのモデルプルーニングを実現する。
論文 参考訳(メタデータ) (2024-02-26T05:51:47Z) - Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model [81.55141188169621]
PEFTにクロスブロックオーケストレーション機構を組み、SAM(Segment Anything Model)の様々な下流シナリオへの適応を可能にする。
本稿では,超複素層から重みが生じる線形射影ヘッドを導入するブロック内拡張モジュールを提案する。
提案手法は,約1Kのパラメータのみを付加した新規シナリオにおいて,セグメンテーション性能を大幅に向上させる。
論文 参考訳(メタデータ) (2023-11-28T11:23:34Z) - Analyzing Transformers in Embedding Space [59.434807802802105]
学習したトランスフォーマーの全てのパラメータを埋め込み空間に投影することで解釈する理論解析を提案する。
予め訓練されたモデルと微調整されたモデルの両方のパラメータを埋め込み空間で解釈できることを示す。
我々の発見は、少なくとも部分的には、モデル仕様から抽象化し、埋め込み空間でのみ動作する解釈手法への扉を開く。
論文 参考訳(メタデータ) (2022-09-06T14:36:57Z) - Transforming Feature Space to Interpret Machine Learning Models [91.62936410696409]
この貢献は、特徴空間変換のレンズを通して機械学習モデルを解釈する新しいアプローチを提案する。
非条件的および条件付きポストホック診断ツールの拡張に使用できる。
提案手法の可能性を実証するために,46特徴のリモートセンシング土地被覆分類の事例研究を行った。
論文 参考訳(メタデータ) (2021-04-09T10:48:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。