論文の概要: Gradients for Interventions and Activations for Detection: Targeted Feature Learning in Language Models
- arxiv url: http://arxiv.org/abs/2609.32355v1
- Date: Sat, 26 Sep 2026 08:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 17:30:25.027612
- Title: Gradients for Interventions and Activations for Detection: Targeted Feature Learning in Language Models
- Title(参考訳): インターベンションとアクティベーションのためのグラディエント:言語モデルにおける特徴学習
- Abstract要約: 多くの解釈可能性質問は仮説駆動であり、事前に定義された概念を懸念する。
我々は,この設定を目標となる特徴学習として研究し,そのような事前定義された概念のために一つの特徴が構築される。
これらの手法を、15のタスクと3つの言語モデルにまたがる事前訓練されたSAEと比較し、検出と因果介入の両方を評価した。
- 参考スコア(独自算出の注目度): 3.602377086789099
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model-internal features can be studied through both their ability to identify a specified concept and their causal effect when manipulated, e.g., through steering or weight editing. A prominent approach to feature learning is Sparse Autoencoders (SAEs), which learn broad feature dictionaries whose relation to particular concepts is typically identified post hoc. However, many interpretability questions are instead hypothesis-driven and concern a concept specified in advance. We study this setting as targeted feature learning, where a single feature is constructed for such a predefined concept. We present a controlled comparison across three model signals (activation values, activation gradients, and parameter gradients) and two estimators (contrastive mean and a learned one-dimensional encoder-decoder), yielding six targeted methods, with CAA and GRADIEND as existing instances and four new methods covering the remaining combinations. We compare these methods against pretrained SAEs across 15 tasks and three language models, evaluating both detection and causal intervention. Across models, the strongest detection performance is achieved by contrastive activation value methods, whereas the strongest intervention performance is achieved by gradient-based methods. Overall, our results show that targeted feature quality depends jointly on the model signal and estimator, with detection and intervention capturing complementary properties.
- Abstract(参考訳): モデル内部の特徴は、特定の概念を識別する能力と、ステアリングやウェイト編集による操作時の因果効果の両方を通して研究することができる。
特徴学習における顕著なアプローチはスパースオートエンコーダ(SAE)であり、特定の概念との関係が一般的にポストホックと同一視される広い特徴辞書を学習する。
しかし、多くの解釈可能性質問は仮説駆動であり、事前に定義された概念を懸念する。
我々は,この設定を目標となる特徴学習として研究し,そのような事前定義された概念のために一つの特徴が構築される。
本稿では,3つのモデル信号(アクティベーション値,アクティベーション勾配,パラメータ勾配)と2つの推定器(コントラスト平均と学習1次元エンコーダデコーダ)を比較し,CAAとGRADIENDを既存インスタンスとし,残りの組み合わせをカバーした4つの新しい手法を提案する。
これらの手法を、15のタスクと3つの言語モデルにまたがる事前訓練されたSAEと比較し、検出と因果介入の両方を評価した。
モデル全体では、最強検出性能は対照的なアクティベーション値法によって達成され、一方、最強介入性能は勾配法によって達成される。
以上の結果から,対象の特徴品質はモデル信号と推定器に比例し,検出と介入が相補的特性を捉えることが示唆された。
関連論文リスト
- Stochastic Encodings for Active Feature Acquisition [100.47043816019888]
Active Feature Acquisitionは、インスタンスワイドでシーケンシャルな意思決定問題である。
目的は、テストインスタンスごとに独立して、現在の観測に基づいて計測する機能を動的に選択することである。
一般的なアプローチは強化学習(Reinforcement Learning)であり、トレーニングの困難を経験する。
我々は、教師付きで訓練された潜在変数モデルを導入し、潜在空間における観測不能な実現の可能性の多くにまたがる特徴を推論することで獲得する。
論文 参考訳(メタデータ) (2025-08-03T23:48:46Z) - HeAL3D: Heuristical-enhanced Active Learning for 3D Object Detection [1.623951368574041]
HeAL(Heuristical-enhanced Active Learning for 3D Object Detection)を導入し、モデルのトレーニングに最も貢献するサンプルを提供する。
従来の研究とは対照的に,本手法では,不確実性を推定するために,対象距離や点量などの達成的特徴を統合している。
KITTI を用いた評価では,HeAL は 最先端の mAP と完全教師付きベースラインと同じ mAP を,サンプルの 24% しか持たない。
論文 参考訳(メタデータ) (2025-05-01T13:24:55Z) - KOPPA: Improving Prompt-based Continual Learning with Key-Query Orthogonal Projection and Prototype-based One-Versus-All [24.50129285997307]
本稿では,新しいキークエリ学習戦略を導入し,マッチング効率を向上し,機能変更の課題に対処する。
提案手法は,現在の最先端手法を最大20%の差で超えた結果を達成するためのモデルである。
論文 参考訳(メタデータ) (2023-11-26T20:35:19Z) - MCDAL: Maximum Classifier Discrepancy for Active Learning [74.73133545019877]
近年の最先端のアクティブラーニング手法は, 主にGAN(Generative Adversarial Networks)をサンプル取得に活用している。
本稿では,MCDAL(Maximum Discrepancy for Active Learning)と呼ぶ新しいアクティブラーニングフレームワークを提案する。
特に,両者の差分を最大化することにより,より厳密な決定境界を学習する2つの補助的分類層を利用する。
論文 参考訳(メタデータ) (2021-07-23T06:57:08Z) - Aligning Pretraining for Detection via Object-Level Contrastive Learning [57.845286545603415]
画像レベルのコントラスト表現学習は、伝達学習の汎用モデルとして非常に有効であることが証明されている。
我々は、これは準最適である可能性があり、従って、自己教師付きプレテキストタスクと下流タスクのアライメントを促進する設計原則を提唱する。
Selective Object Contrastive Learning (SoCo) と呼ばれる本手法は,COCO検出における伝達性能の最先端化を実現する。
論文 参考訳(メタデータ) (2021-06-04T17:59:52Z) - Learning What Makes a Difference from Counterfactual Examples and
Gradient Supervision [57.14468881854616]
ニューラルネットワークの一般化能力を改善するための補助的学習目標を提案する。
我々は、異なるラベルを持つ最小差の例のペア、すなわち反ファクトまたはコントラストの例を使用し、タスクの根底にある因果構造を示す信号を与える。
このテクニックで訓練されたモデルは、配布外テストセットのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2020-04-20T02:47:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。