論文の概要: SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
- arxiv url: http://arxiv.org/abs/2608.13538v2
- Date: Tue, 18 Aug 2026 07:35:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.841147
- Title: SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
- Title(参考訳): SAEVerbalizer:Representation Verbalizationによるスパースオートエンコーダ機能の説明生成
- Authors: Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li,
- Abstract要約: SAEVerbalizerは,SAAEデコーダの方向を大言語モデルの表現に注入するフレームワークである。
その結果得られた動詞化子は、SAEの機能をデコーダの方向から直接説明し、両方の制限に対処する。
実験により、学習された動詞化能力は、見つからない特徴に一般化し、個別に訓練されたSAE辞書をまたいで転送し、軽量なアダプタで異なるLSMからSAE機能に拡張することを示した。
- 参考スコア(独自算出の注目度): 45.84399159937069
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoders (SAEs) are proposed to extract numerous features from large language model (LLM) representations, yet explaining these features still relies primarily on external observation. This reliance leads to superficial explanations inferred from observed model behavior and computational inefficiency from collecting such behavioral evidence at scale. We introduce SAEVerbalizer, a framework that injects SAE decoder directions into an LLM's representations and fine-tunes the LLM's downstream layers to generate natural-language explanations of the injected features. Once trained, the resulting verbalizer explains SAE features directly from decoder directions, addressing both limitations. Our experiments show that the learned verbalization capability generalizes to unseen features, transfers across separately trained SAE dictionaries, and, with a lightweight adapter, extends to SAE features from different LLMs. Intervention experiments show that injecting multiple directions yields an explanation combining their meanings, while reversing individual directions produces corresponding meaning shifts.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は,大規模言語モデル(LLM)表現から多数の特徴を抽出するために提案されている。
この依存は、観察されたモデル行動から推測される表面的な説明と、そのような行動的証拠を大規模に収集することによる計算的非効率性に繋がる。
本稿では,SAEVerbalizerについて紹介する。SAEVerbalizerは,SAAEデコーダの方向をLLMの表現に注入し,LLMの下流層を微調整し,注入した特徴の自然言語による説明を生成するフレームワークである。
訓練が終わると、結果の動詞化子はSAEの機能をデコーダの方向から直接説明し、両方の制限に対処する。
実験の結果,学習した動詞化能力は,未知の特徴に一般化され,個別に訓練されたSAE辞書間での移動が実現され,軽量なアダプタにより,異なるLSMからSAE機能に拡張されることがわかった。
干渉実験により、複数の方向を注入すると、それぞれの方向を逆転させると対応する意味の変化が生じる。
関連論文リスト
- SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models [37.102387880457535]
大規模言語モデル(LLM)は目覚ましい進歩を遂げているが、その内部メカニズムはほとんど不透明である。
スパースオートエンコーダ(SAE)は、LLM表現をより解釈可能な機能に分解するための有望なツールとして登場した。
本稿では,SAGE(SAE AGentic Explainer)というエージェントベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-25T20:14:29Z) - ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders [30.219733023958188]
Sparse Autoencoder (SAE) は、大規模言語モデルの機械的解釈可能性のための強力なツールとして登場した。
ProtSAEと呼ばれる意味誘導型SAEを提案する。
ProtSAEは,従来の方法と比較して,生物学的に関連性があり,隠れた特徴を解釈できることがわかった。
論文 参考訳(メタデータ) (2025-08-26T11:20:31Z) - Ensembling Sparse Autoencoders [10.81463830315253]
スパースオートエンコーダ(SAE)は、ニューラルネットワークの活性化を人間の解釈可能な特徴に分解するために用いられる。
我々は,複数のSAEを包括的袋詰めとブースティングによりアンサンブルすることを提案する。
実験の結果,SAEのアンサンブルにより,言語モデルの活性化,特徴の多様性,SAEの安定性が向上することが示された。
論文 参考訳(メタデータ) (2025-05-21T23:31:21Z) - Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models [50.587868616659826]
視覚表現におけるニューロンレベルでの単意味性を評価するための包括的枠組みを提案する。
実験の結果,視覚言語モデルで訓練したSAEは個々のニューロンの単意味性を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-04-03T17:58:35Z) - Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders [29.356200147371275]
大きな言語モデル(LLM)は人間のクエリを扱うのに優れていますが、時に欠陥や予期せぬ応答を生成することができます。
特徴解釈と相互情報に基づく目的設計のための固定語彙集合を提案する。
そこで本研究では,学習した機能アクティベーションを,対応する説明に基づいて調整する2つの実行時ステアリング戦略を提案する。
論文 参考訳(メタデータ) (2025-02-21T16:36:42Z) - LatentQA: Teaching LLMs to Decode Activations Into Natural Language [72.87064562349742]
自然言語におけるモデルアクティベーションに関するオープンな疑問に答えるタスクであるLatentQAを紹介する。
本稿では,アクティベーションと関連する質問応答ペアのデータセット上で,デコーダLLMを微調整するLatent Interpretation Tuning (LIT)を提案する。
我々のデコーダはまた、ステレオタイプ付き文のモデルのデバイアス化や世代ごとの感情制御など、モデルを制御するために使用する差別化可能な損失も規定している。
論文 参考訳(メタデータ) (2024-12-11T18:59:33Z) - Automatically Interpreting Millions of Features in Large Language Models [1.8035046415192353]
スパースオートエンコーダ(SAE)は、活性化を高次元の潜在空間に変換するために用いられる。
SAEの機能に関する自然言語の説明を生成・評価するためのオープンソースのパイプラインを構築します。
我々の大規模分析は、SAE潜伏剤がニューロンよりもはるかに解釈可能であることを確認しています。
論文 参考訳(メタデータ) (2024-10-17T17:56:01Z) - FaithLM: Towards Faithful Explanations for Large Language Models [60.45183469474916]
大規模言語モデルの忠実度を評価し改善するモデルに依存しないフレームワークであるFaithLMを紹介した。
FaithLMは一貫して忠実度を高め、強い自己説明ベースラインよりも人間の合理性に整合した説明を生成する。
論文 参考訳(メタデータ) (2024-02-07T09:09:14Z) - Towards ASR Robust Spoken Language Understanding Through In-Context
Learning With Word Confusion Networks [68.79880423713597]
本稿では,トップ仮説のみに頼るのではなく,ASRシステムの格子出力を利用する手法を提案する。
音声質問応答と意図分類を網羅した文脈内学習実験により,LLMの音声書き起こしに対する弾力性について明らかにした。
論文 参考訳(メタデータ) (2024-01-05T17:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。