論文の概要: Kernelized Activation Steering
- arxiv url: http://arxiv.org/abs/2610.01062v2
- Date: Sat, 03 Oct 2026 07:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.511965
- Title: Kernelized Activation Steering
- Title(参考訳): カーネル化活性化ステアリング
- Abstract要約: 我々は,カーネル化活性化ステアリング(KAS)を提案し,再生カーネルヒルベルト空間に活性化ステアリングを持ち上げる。
KASはカーネル評価によって純粋に表現された最適化問題としてステアリングを定式化している。
KASは局所適応ステアリングを誘導し、表現空間上の非線形ステアリング場を生成する。
- 参考スコア(独自算出の注目度): 7.446273281962142
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation steering provides a simple, training-free mechanism for controlling attributes of generative models such as sentiment, style, and helpfulness. However, standard approaches such as Difference-in-Means apply a single input-independent steering vector across all activations, limiting expressivity and ignoring the local geometry of the activation space. We propose Kernelized Activation Steering (KAS), a unifying framework that lifts activation steering into a reproducing kernel Hilbert space. KAS formulates steering as an optimization problem expressed purely via kernel evaluations, yielding an implicit, activation-dependent steering score without constructing explicit feature maps. Unlike DiM, KAS induces locally adaptive steering: each activation is modified according to its relative position with respect to source and target reference sets, producing a nonlinear steering field over the representation space. Importantly, DiM is recovered as a special case under a linear kernel, while richer kernels enable geometry-aware interventions. Across standard activation steering tasks, including jailbreaking LLMs and image style control, KAS outperforms or is on par with the existing methods.
- Abstract(参考訳): アクティベーションステアリング(Activation steering)は、感情、スタイル、有用性などの生成モデルの属性を制御するための、シンプルでトレーニング不要なメカニズムを提供する。
しかし、差分-in-Meansのような標準的なアプローチは、すべてのアクティベーションに対して単一の入力非依存のステアリングベクトルを適用し、表現性を制限し、アクティベーション空間の局所幾何学を無視する。
本稿では,活性化ステアリングを再生カーネルHilbert空間に引き上げる統一フレームワークであるKernelized Activation Steering (KAS)を提案する。
KASは、カーネル評価によって純粋に表現された最適化問題としてステアリングを定式化し、明示的な特徴写像を構築することなく、暗黙的にアクティベーションに依存したステアリングスコアを得る。
それぞれのアクティベーションは、ソースおよびターゲット参照セットに対する相対的な位置に応じて変更され、表現空間上の非線形ステアリング場を生成する。
重要なことは、DiMは線形カーネルの下で特別なケースとして回収され、よりリッチなカーネルは幾何学的な介入を可能にする。
ジェイルブレイクLDMやイメージスタイルコントロールなど、標準的なアクティベーションステアリングタスク全体において、KASは、既存のメソッドよりも優れているか、あるいは同等である。
関連論文リスト
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond [65.02517762858879]
生成過程の各ステップにおけるステアリング方向を適応的に再推定するステアリングベクトルの一般化であるステアリング場を導入する。
ステアフィールド場は流れモデルのノイズの多い状態で動作し、ステアリング強度とコンテンツ保存との間の連続的なトレードオフを露呈し、構成的である。
明示的な空間マスクや物体の先行値を使用しないにもかかわらず、軌道適応推定は局所構造を自然に保存する。
論文 参考訳(メタデータ) (2026-09-30T12:06:48Z) - LocUS: Head Selection and Subspace Projection for Targeted Activation Steering [29.028428921189555]
LocUS (Localized Unembedding Steering) は、モデル自身の出力語彙部分空間にアクティベーションステアリングを基盤とする手法である。
LocUSは,6%未満のパラメータと保存能力の向上を図りながら,最先端のベースラインに適合あるいは優れることを示す。
論文 参考訳(メタデータ) (2026-09-25T11:13:24Z) - GEOSTEER: Geodesic Optimization for Activation Steering in Large Language Models [9.438320824151157]
標準保存型アクティベーションステアリングの最適化手法であるGeoSteerを提案する。
また,GeoSteerは,最先端のアクティベーションステアリングベースラインよりも一貫して改善されていることを示す。
これらの結果は、事前定義されたワンステップ編集を適応的・幾何学的最適化に置き換えることで、ノルム保存ステアリングをより効果的にすることができることを示唆している。
論文 参考訳(メタデータ) (2026-09-09T16:55:52Z) - Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation [74.17379276939599]
近年のQwen-3.5シリーズにおいても,アクティベーションステアリングが広範囲のアライメントを引き起こすことが示されている。
ステアリングサイズ, ステアリングサブスペースの低ランク構造, ステアリングベクター構築時のエポック数など, キーステアリング固有の因子を解析することにより, AS誘起EMの特性を特徴づける。
論文 参考訳(メタデータ) (2026-06-07T15:34:59Z) - Beyond Linear Activation Steering: Invertible Latent Transformations for Controlling LLM Behavior [13.073472989807675]
INNSteerは非可逆潜在変換に基づく非線形活性化ステアリングフレームワークである。
線形、輸送ベース、非線形ステアリングベースラインに対するモデル制御を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-07T05:01:25Z) - Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control [2.752817022620644]
推論時間LLMアライメント法は、生成中のアクティベーションを直接修正することで、微調整の代替となる。
複数のLLMアーキテクチャとスケールの層ワイドダイナミクスが局所線形モデルによってよく近似されていることを示す。
我々は, ステアリング性能の正式な保証を可能にするために, セットポイント追従誤差の理論的境界を導出する。
論文 参考訳(メタデータ) (2026-04-21T03:09:46Z) - What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal [53.189667624047416]
異なるステアリング手法が同一層に印加した場合に機能的に交換可能な回路を利用することを示す。
その結果,操舵ベクトルは最大90~99%のスペーサー化が可能であり,ほとんどの性能は維持できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T17:57:14Z) - Weight Updates as Activation Shifts: A Principled Framework for Steering [54.70188910511715]
アクティベーションステアリングは極めてパラメータ効率のよい適応形態となるが、その有効性は重要な設計選択に依存する。
我々は,活性化空間介入と重量空間更新の1次等価性を確立し,活性化ステアリングが微調整動作を再現できる条件を導出する。
この等価性は、設計をステアリングするための原則的な枠組みをもたらし、ポストブロック出力を理論的に支持され、非常に表現力のある介入サイトとして特定する。
論文 参考訳(メタデータ) (2026-02-28T02:50:04Z) - ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment [49.68063561145927]
活性化ステアリングのための統一常微分方程式(ODE)に基づく理論的枠組みを提案する。
本稿では,バリア関数によって誘導されるODEベースのステアリングの一種であるODESteerを紹介する。
最先端のアクティベーションステアリング手法と比較すると、ODESteerは一貫した経験的改善を実現している。
論文 参考訳(メタデータ) (2026-02-19T17:13:44Z) - Angular Steering: Behavior Control via Rotation in Activation Space [1.3400719989424488]
Angular Steeringは、振る舞い変調の新しいフレキシブルな方法である。
固定された2次元部分空間内で回転活性化によって作用する。
拒否やコンプライアンスといった行動に対して,継続的かつきめ細かいコントロールを提供する。
論文 参考訳(メタデータ) (2025-10-30T08:23:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。