論文の概要: Signatures of Steerability in Activation Space of Language Models
- arxiv url: http://arxiv.org/abs/2609.14151v1
- Date: Sat, 12 Sep 2026 21:06:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.713603
- Title: Signatures of Steerability in Activation Space of Language Models
- Title(参考訳): 言語モデルの活性化空間におけるステアビリティのシグナチャ
- Abstract要約: 単純な分離メトリクスは、様々な設定で言語モデルの下流のステアビリティと強く相関していることを示す。
以上の結果から, 単純な分離性統計は, ステアリングベクトルが動作しそうな場合の診断に有効であることが示唆された。
- 参考スコア(独自算出の注目度): 3.7155332656584186
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Steering language models using a set of contrastive representations has been a canonical and computationally efficient method for controlling model behavior. Despite this success in controlling certain model behaviors, the effectiveness of activation steering varies markedly across concepts; the generalization properties of steering vectors are often considered a function of the dataset used to construct them. We make this dataset-dependence claim more rigorous and show that simple separation metrics strongly correlate with the downstream steerability of language models across diverse settings, even after controlling for layers and dataset effects. Beyond prediction, we provide evidence from a synthetic superposition experiment that separation metrics are strongly correlated with alignment between the empirical and true feature direction. Our results suggest that simple separability statistics can serve as practical diagnostics for when steering vectors are likely to work.
- Abstract(参考訳): コントラスト表現の集合を用いたステアリング言語モデルは、モデル挙動を制御するための標準的かつ計算学的に効率的な方法である。
このようなモデル行動の制御の成功にもかかわらず、アクティベーションステアリングの有効性は概念によって大きく異なっており、ステアリングベクトルの一般化特性は、それらを構築するために使われるデータセットの関数と見なされることが多い。
このデータセット依存性の主張をより厳密なものにし、単純な分離メトリクスが、レイヤやデータセット効果を制御した後でも、さまざまな設定で言語モデルの下流のステアビリティと強く相関していることを示します。
さらに, 合成重ね合わせ実験から, 分離指標が経験的特徴方向と真の特徴方向のアライメントと強く相関していることが示唆された。
以上の結果から, 単純な分離性統計は, ステアリングベクトルが動作しそうな場合の診断に有効であることが示唆された。
関連論文リスト
- Detecting and Controlling Sycophancy with Cascading Linear Features [7.13923185919936]
動作に責任のあるカスケード線形特徴を分離する反復データ生成パイプラインを提案する。
私たちは、ユーザのバリデーションを優先する言語モデルの傾向である、梅毒の検知とステアリングに重点を置いています。
論文 参考訳(メタデータ) (2026-06-23T20:10:53Z) - Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations [0.0]
ステアリング信頼性が行動によって異なる理由と,ベクタートレーニングデータによる影響について検討する。
トレーニングアクティベーションの違いのコサイン類似度が高いと、より信頼性の高いステアリングが予測される。
操舵方向に沿って正負のアクティベーションがより分離された行動データセットは、より確実に操舵可能であることを観察する。
論文 参考訳(メタデータ) (2026-02-19T22:37:05Z) - Concept Influence: Leveraging Interpretability to Improve Performance and Efficiency in Training Data Attribution [11.387100835483672]
トレーニングデータ属性(TDA)メソッドは、トレーニングデータが特定の行動、特に意図しない行動を実行する方法を特定する。
影響関数のような既存のアプローチは、計算的に高価であり、単一のテスト例に基づく属性である。
帰属中にモデル内の解釈可能な構造を利用する。
従来のTDAパイプラインに解釈可能な構造を組み込むことで,データによるモデル動作のよりスケーラブルで説明可能な,より優れた制御が可能になることを示す。
論文 参考訳(メタデータ) (2026-02-16T16:02:09Z) - On the Identifiability of Steering Vectors in Large Language Models [0.0]
アクティベーションステアリング法は大規模言語モデルの振る舞いを制御するために広く用いられている。
この解釈は、操舵方向が入力出力動作から識別可能で一意に回復可能であることを暗黙的に仮定する。
操舵ベクトルは、行動的に区別不能な介入の大きな同値類のため、基本的には識別不可能であることを示す。
論文 参考訳(メタデータ) (2026-02-06T15:53:50Z) - Steering Language Models Before They Speak: Logit-Level Interventions [9.055997973281919]
制御可能な生成のためのトレーニング不要な推論時間ロジット介入を提案する。
以上の結果から,ロジットステアリングは大きな,一貫した,マルチタスク制御のゲインを達成できることが示唆された。
論文 参考訳(メタデータ) (2026-01-16T03:00:33Z) - Nonparametric Data Attribution for Diffusion Models [57.820618036556084]
生成モデルのデータ属性は、個々のトレーニング例がモデル出力に与える影響を定量化する。
生成画像とトレーニング画像のパッチレベルの類似性によって影響を測定する非パラメトリック属性法を提案する。
論文 参考訳(メタデータ) (2025-10-16T03:37:16Z) - KV Cache Steering for Controlling Frozen LLMs [80.50365534625438]
キャッシュステアリングは、言語モデルの暗黙的なステアリングのための軽量な方法である。
キャッシュステアリングを応用して、小さな言語モデルにおける連鎖推論を誘導する。
論文 参考訳(メタデータ) (2025-07-11T17:59:36Z) - One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs [21.2431937128876]
本稿では,1つのトレーニング例に基づいて,勾配降下によるステアリングベクトルの最適化を提案する。
その結果,複数モデルにおける安全関連挙動を効果的に処理できることが判明した。
の作業を拡張し、脆弱なコードを書くためにモデルに最適化されたSVがモデルに有害な応答をもたらすことを示す。
論文 参考訳(メタデータ) (2025-02-26T06:13:01Z) - Activation Scaling for Steering and Interpreting Language Models [55.59689963561315]
モデルにうまく介入することは、内部の動作を解釈するための前提条件である、と我々は主張する。
成功した介入は、間違ったトークンで正しいことを正し、その逆を正すべきである。
勾配に基づく最適化を用いることで、特定の種類の効率的かつ解釈可能な介入を学習(そして後で評価)することができる。
論文 参考訳(メタデータ) (2024-10-07T12:01:32Z) - Revisiting Demonstration Selection Strategies in In-Context Learning [66.11652803887284]
大規模言語モデル(LLM)は、インコンテキスト学習(ICL)を用いて広範囲のタスクを実行するという印象的な能力を示している。
本研究ではまず,データとモデルの両方の側面から,この分散に寄与する要因を再検討し,実演の選択がデータとモデルに依存していることを確かめる。
本研究では,データとモデルに依存した実演選択手法である textbfTopK + ConE を提案する。
論文 参考訳(メタデータ) (2024-01-22T16:25:27Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z) - Prototypical Representation Learning for Relation Extraction [56.501332067073065]
本論文では, 遠隔ラベルデータから予測可能, 解釈可能, 堅牢な関係表現を学習することを目的とする。
文脈情報から各関係のプロトタイプを学習し,関係の本質的意味を最善に探求する。
いくつかの関係学習タスクの結果,本モデルが従来の関係モデルを大きく上回っていることがわかった。
論文 参考訳(メタデータ) (2021-03-22T08:11:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。