論文の概要: On the Steering Dimensionality of Refusal in Language Models
- arxiv url: http://arxiv.org/abs/2610.04245v1
- Date: Sat, 03 Oct 2026 03:08:30 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:53:08.254359
- Title: On the Steering Dimensionality of Refusal in Language Models
- Title(参考訳): 言語モデルにおける拒絶のステアリング次元について
- Abstract要約: 本研究では,2種類の拒絶動作を確実に制御できる方向数について検討する。
安全アライメントによって引き起こされる拒絶は1次元ステアリング可能であるのに対し、複数の異なるステアリング方向は同等に制御できることがわかった。
以上の結果から,リファリングに基づく活性化幾何学は文脈依存的であり,単一の線形ステアリング方向よりもかなり複雑であることが明らかとなった。
- 参考スコア(独自算出の注目度): 27.06314265608798
- License:
- Abstract: Existing activation steering methods often assume that a high-level concept can be mediated by a single steering direction. To support this, two complementary interventions should be achieved: additive steering should induce the target behavior, while directional ablation should suppress it. Yet behaviors may occupy richer activation geometries beyond a single direction, and semantically similar behaviors may be represented by distinct directions. In this work, we study how many directions can reliably control two different types of refusal behaviors: refusal triggered by the safety alignment and refusal in general contexts. Given the limited expressive capability of a single steering vector, we study the general setting of steering subspaces and introduce the notion of steering dimensionality as the minimum subspace dimensionality required to reliably control a behavior. We characterize sufficient steering subspaces that cover the full extent of the target behavior through both the (monotonic) improvement before the sufficient dimensionality, and the saturation beyond it. Empirically, we find that refusal triggered by safety alignment is 1-dim steerable, while multiple distinct steering directions can achieve comparable control. In contrast, refusal in general contexts exhibits substantially richer activation geometry where even 5-dim steering subspaces fail to reliably capture its full steerable variation. Our results reveal that the activation geometry underlying refusal is highly context-dependent and can be substantially more complex than a single linear steering direction.
- Abstract(参考訳): 既存のアクティベーションステアリング法は、高レベルの概念を単一のステアリング方向によって仲介できると仮定することが多い。
補助的ステアリングは目標動作を誘導し、指向性アブレーションはそれを抑制すべきである。
しかし、行動は単一の方向を超えてよりリッチな活性化測地を占有し、意味的に類似した行動は異なる方向で表されるかもしれない。
本研究では、安全アライメントによって引き起こされる拒絶と、一般的な文脈における拒絶の2つの異なる種類の拒絶行動を確実に制御できる方向数について検討する。
単一のステアリングベクトルの限られた表現能力を考えると、ステアリング部分空間の一般的な設定を考察し、その振る舞いを確実に制御するために必要な最小部分空間次元としてステアリング次元の概念を導入する。
十分な次元の前の(単調な)改善とそれを超える飽和によって、対象の行動の全範囲をカバーする十分なステアリング部分空間を特徴づける。
実験により、安全アライメントによって引き起こされる拒絶は1次元の操舵が可能であり、複数の異なる操舵方向が同等に制御できることがわかった。
対照的に、一般的な文脈での拒絶はよりリッチな活性化幾何学を示し、5次元のステアリング部分空間でさえそのフルステアブル変動を確実に捉えることができない。
以上の結果から,リファリングに基づく活性化幾何学は文脈依存的であり,単一の線形操舵方向よりもかなり複雑であることが明らかとなった。
関連論文リスト
- First-Order Steering: Translating Weight Adaptation into Activation Steering [39.23375433079565]
アクティベーションステアリングは残ストリームの解釈可能な方向を利用して、モデル動作の推論時間操作を可能にする。
操舵強度ベクトルによりパラメータ化された重み更新行列の1次近似として,アクティベーションステアリングの定式化である1次ステアリングを導入する。
そこで我々は, 1次近似誤差項を最小限に抑え, 1次ステアリング精度を高める新しいモデルマージ手法HeRD-Mergingを開発した。
論文 参考訳(メタデータ) (2026-10-03T04:22:36Z) - Disentangling Steering Vectors [13.671243729016568]
合成方向から個人的・意味論的に一貫した特徴を明示的に分離する枠組みを提案する。
具体的には、正と負のアクティベーションをペアにして、それらの差を利用してインスタンスレベルのステアリングベクトルの集合を生成する。
提案手法は, ステアリング効果が相互に区別可能な, 意味論的に一貫した基底ベクトルの集合を導出することを示す。
論文 参考訳(メタデータ) (2026-09-07T04:45:32Z) - Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation [74.17379276939599]
近年のQwen-3.5シリーズにおいても,アクティベーションステアリングが広範囲のアライメントを引き起こすことが示されている。
ステアリングサイズ, ステアリングサブスペースの低ランク構造, ステアリングベクター構築時のエポック数など, キーステアリング固有の因子を解析することにより, AS誘起EMの特性を特徴づける。
論文 参考訳(メタデータ) (2026-06-07T15:34:59Z) - A Geometric Account of Activation Steering through Angle-Norm Decomposition [1.4323566945483497]
線形アクティベーションステアリングは、言語モデルの振る舞いをシンプルかつ経験的に制御する方法として人気を集めている。
ステアリング法は,トークンの角方向のアライメントを概念方向に変更し,隠れ状態のノルムを変更するという2つの幾何学的効果の相違を示す。
以上の結果から,アクティベーションステアリングは角状成分と放射状成分によってパラメータ化されるべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-04T21:42:48Z) - The Cylindrical Representation Hypothesis for Language Model Steering [57.97381760521523]
中心軸は、概念の欠如と存在との主な違いを捉え、概念生成を駆動することを示す。
我々はこれを円筒表現仮説(CRH)として定式化する。
本実験は円筒構造の存在を検証し,CRHが実環境でのモデルステアリング動作の解釈に有効かつ実用的な方法であることを示した。
論文 参考訳(メタデータ) (2026-05-03T12:26:13Z) - What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal [53.189667624047416]
異なるステアリング手法が同一層に印加した場合に機能的に交換可能な回路を利用することを示す。
その結果,操舵ベクトルは最大90~99%のスペーサー化が可能であり,ほとんどの性能は維持できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T17:57:14Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment [49.68063561145927]
活性化ステアリングのための統一常微分方程式(ODE)に基づく理論的枠組みを提案する。
本稿では,バリア関数によって誘導されるODEベースのステアリングの一種であるODESteerを紹介する。
最先端のアクティベーションステアリング手法と比較すると、ODESteerは一貫した経験的改善を実現している。
論文 参考訳(メタデータ) (2026-02-19T17:13:44Z) - Angular Steering: Behavior Control via Rotation in Activation Space [1.3400719989424488]
Angular Steeringは、振る舞い変調の新しいフレキシブルな方法である。
固定された2次元部分空間内で回転活性化によって作用する。
拒否やコンプライアンスといった行動に対して,継続的かつきめ細かいコントロールを提供する。
論文 参考訳(メタデータ) (2025-10-30T08:23:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。