論文の概要: Steering Interference Reflects the Model's Defaults, Not the Behavior Directions
- arxiv url: http://arxiv.org/abs/2609.06951v1
- Date: Mon, 07 Sep 2026 02:45:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.341006
- Title: Steering Interference Reflects the Model's Defaults, Not the Behavior Directions
- Title(参考訳): ステアリング干渉は行動方向ではなく、モデルのデフォルトを反映する
- Abstract要約: アクティベーションステアリングは、言語モデルの振る舞いのモジュラー制御を約束する。
私たちは、他のどの行動が動くのか、どのくらいで決定するかを尋ねます。
操られている行動ではなく、モデルであることに気付きました。
- 参考スコア(独自算出の注目度): 14.170453340251981
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Activation steering promises modular control of language model behavior: a behavior such as politeness corresponds to a direction in a model's activations, and adding that direction while it generates should switch the behavior on and leave everything else alone. It does not. We ask what decides which other behaviors move, and by how much, and find that it is the model rather than the behavior being steered. A steer relaxes the model toward a small set of behaviors it already favors, chiefly refusal, sycophancy, and poeticism, and that set is much the same whatever is steered. Three results across 24 behaviors and ten instruction-tuned models support this, every effect read off the generated text by a language-model judge rather than off a probe. That readout matters: all 24 behaviors are linearly decodable, but only 20 change what the model writes. First, a direction carrying no behavioral content, matched to a real steer only in the size of the vector it adds, moves the same behaviors in the same order as real steers do, while producing none of the behaviors that need a specific direction. Second, most interference runs one way, so it cannot be an overlap between two directions: steering profanity makes the model toxic, while steering toxicity leaves profanity untouched. Third, with a behavior held out entirely, geometry measured on the others explains almost none of the interference it takes part in. The account holds on all ten models, the pull toward defaults strongest below 10B parameters and weakening in each family's largest. Reading a steer as a perturbation whose endpoint the model fixes implies that disentangling behavior directions cannot by itself make steering modular.
- Abstract(参考訳): アクティベーションステアリング(Activation steering)は、言語モデルの振る舞いのモジュラー制御を約束する: 丁寧さのような振る舞いは、モデルのアクティベーションの方向に対応する。
そうではない。
我々は、他のどの行動が動くのか、どのくらいで決定するかを問う。
ステアは、既に好まれている少数の行動、主に拒絶、梅毒、詩主義に対してモデルを緩め、そのセットは、全く同じものである。
24の行動にまたがる3つの結果と10の命令調整されたモデルがこれをサポートし、すべての効果は、プローブを外すのではなく、言語モデルによる判断によって生成されたテキストを読み取る。
24の振る舞いはすべて線形にデオード可能であるが、モデルが書くものを変更するのは20だけである。
第一に、行動内容を持たない方向は、それが付加するベクトルの大きさでのみ実際のステアに一致し、実際のステアと同じ順序で動きながら、特定の方向を必要とする行動は発生しない。
第二に、ほとんどの干渉は片方向を走るので、2つの方向の重なりはあり得ない: ステアリング・プロファンティ(steering profanity)はモデルに有毒を与え、一方、ステアリング・毒性(steering toxicity)はプロファンティ(profanity)を無害にする。
第三に、振舞いが完全に抑えられ、他で計測された幾何学は、それらが関与する干渉のほとんどを説明できない。
このアカウントは10モデルすべてに当てはまり、デフォルトへのプルは10Bパラメータを下回り、各ファミリーの最大値を弱めている。
終端をモデルが固定する摂動としてステアを読み取ると、不連続な振舞いの方向自体がモジュラー化できないことを意味する。
関連論文リスト
- Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models [56.88565331713778]
推論指向のトレーニングは、モデル正しさに最も結びついている振る舞いを増幅することなく、トレースをより熟考的に見せることができる。
このミスマッチを、モデル推論トレースにおける振る舞いの有無に対して、振舞いがどの程度の正確性を変えるかを測定するメトリクスである振舞いリフトと定量化します。
我々は、思考モデルが自己認識、仮説テスト、不確実性認知を強く増幅する増幅自由ギャップの証拠を見つける。
論文 参考訳(メタデータ) (2026-08-13T20:37:59Z) - Divergent Response Modes in Frontier Language Models Under Steering Pressure [0.0]
本研究では,6つのフロンティアモデルに対して,300対のベースとステアリングアイテムを3つのカテゴリに分けて評価した。
モデルの違いは、操舵がどれだけ振る舞うかではなく、どのような反応を与えるか、そしていくつかの応答モードが1つか2つしか現れないことにあります。
論文 参考訳(メタデータ) (2026-08-06T20:48:14Z) - They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It [0.0]
我々は、送信者の意図をデコードする言語モデルの失敗は、ロバストな表現の上にある読み出しの1つであることを示す。
線形プローブは、6つのモデルと4つのファミリー、およびベースチェックポイントで、送信者の意図を認識または評価したいかどうかを復号する。
ストーリーの行動的半分は、デフォルトの出力が意図に作用するかどうかが異なるという認識/評価のコントラストに基づいている。
論文 参考訳(メタデータ) (2026-07-03T20:49:37Z) - Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models [1.9247157750972368]
私たちは、最も行動を検出する方向と、それを引き起こす方向の角度をテストします。
検出が制御を意味する場合、コサインは1付近であり、そうでなければ検出ギャップを定量化する。
コサインは、知識とステアリングの解離の重み付け可能な記号であり、その予測子ではない。
論文 参考訳(メタデータ) (2026-06-23T08:07:51Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal [53.189667624047416]
異なるステアリング手法が同一層に印加した場合に機能的に交換可能な回路を利用することを示す。
その結果,操舵ベクトルは最大90~99%のスペーサー化が可能であり,ほとんどの性能は維持できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T17:57:14Z) - Reliable Control-Point Selection for Steering Reasoning in Large Language Models [28.288321095634128]
ステアリングベクトルは、大規模言語モデルにおける推論動作を制御するためのトレーニング不要のメカニズムを提供する。
しかし、有効なベクトルを構成するには、モデルが隠した状態にある真の行動信号を特定する必要がある。
提案手法は,全ての検出された境界が真の行動信号を符号化していることを暗黙的に仮定して,チェーンオブソートトレースのキーワードマッチングによってこれらの挙動を検出する。
本研究では,コンテキスト依存的なトリガ確率を持つ事象として固有の推論動作を形式化する確率モデルを構築し,不安定な境界が操舵信号を弱めることを示す。
論文 参考訳(メタデータ) (2026-04-02T14:48:56Z) - Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations [0.0]
ステアリング信頼性が行動によって異なる理由と,ベクタートレーニングデータによる影響について検討する。
トレーニングアクティベーションの違いのコサイン類似度が高いと、より信頼性の高いステアリングが予測される。
操舵方向に沿って正負のアクティベーションがより分離された行動データセットは、より確実に操舵可能であることを観察する。
論文 参考訳(メタデータ) (2026-02-19T22:37:05Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - Model Editing with Canonical Examples [75.33218320106585]
標準例を用いたモデル編集について紹介する。
例えば、モーリシャスの首都はポートルイである。
本稿では,各標準例に対して数個の感覚ベクトルを選択し,微調整するセンスファインタニングを提案する。
論文 参考訳(メタデータ) (2024-02-09T03:08:12Z) - Scaling Laws vs Model Architectures: How does Inductive Bias Influence
Scaling? [91.78878523252897]
本稿では,10種類のモデルアーキテクチャのスケーリング挙動の系統的研究を行う。
アーキテクチャはスケーリングを行う上で重要な考慮事項であり、最高のパフォーマンスモデルが異なるスケールで変動可能であることを示す。
論文 参考訳(メタデータ) (2022-07-21T15:50:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。