論文の概要: On the Limits of Steering Vectors for Preference-Aligned Generation
- arxiv url: http://arxiv.org/abs/2607.01802v1
- Date: Thu, 02 Jul 2026 07:18:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.718103
- Title: On the Limits of Steering Vectors for Preference-Aligned Generation
- Title(参考訳): 主観的生成のためのステアリングベクトルの極限について
- Authors: Melanie Subbiah, Zara Hall, Kathleen McKeown,
- Abstract要約: 本研究では, 特性表現性, タスク伝達, マルチトレート構成の3次元に沿ったステアリングベクトル一般化の限界について検討する。
この結果から, ステアリングベクトルは, 嗜好アライメントのための汎用ツールとして有意な限界に直面していることが示唆された。
- 参考スコア(独自算出の注目度): 12.350800078736128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Steering vectors have emerged as a promising approach to controlled text generation, offering interpretable, training-free mechanisms for shaping model outputs. However, their practical generality remains poorly understood. We study the limits of steering vector generalization along three dimensions: trait expressibility, task transfer, and multi-trait composition. Using the PLUME writing personalization benchmark, we extract steering vectors for a range of preferences and evaluate them on summarization and email-writing tasks across two open-source models (Qwen2.5-7B-Instruct and Llama3.1-8B-Instruct). We find that steering effectiveness varies substantially across traits. We further show that steering effectiveness can degrade when vectors extracted from positive and negative style examples are transferred to downstream writing personalization tasks. Finally, we compare common methods for composing multiple steering vectors and find that all methods suffer significant drops in trait expression as more vectors are added, with a tradeoff between coherence and expressibility that requires per-setting hyperparameter tuning. Taken together, our results suggest that steering vectors face meaningful limits as a general-purpose tool for preference alignment.
- Abstract(参考訳): ステアリングベクトルは、モデル出力を形作るための解釈可能な、トレーニングなしのメカニズムを提供する、制御されたテキスト生成のための有望なアプローチとして登場した。
しかし、その実践的一般性はあまり理解されていない。
本研究では, 特性表現性, タスク伝達, マルチトレート構成の3次元に沿ったステアリングベクトル一般化の限界について検討する。
PLUME書き込みパーソナライズベンチマークを用いて、さまざまな好みのステアリングベクトルを抽出し、2つのオープンソースモデル(Qwen2.5-7B-InstructとLlama3.1-8B-Instruct)の要約およびメール書き込みタスクで評価する。
ステアリングの有効性は特性によって大きく異なります。
さらに,正および負のスタイルの例から抽出したベクトルを下流書き込みパーソナライズタスクに転送すると,ステアリングの有効性が劣化することを示した。
最後に、複数のステアリングベクトルを構成する一般的な手法を比較し、さらに多くのベクトルを追加すると、全ての手法が特性表現の顕著な低下に悩まされ、コヒーレンスと表現性のトレードオフは、設定ごとのハイパーパラメータチューニングを必要とする。
その結果, 操舵ベクトルは, 嗜好調整のための汎用ツールとして有意な限界に直面していることが示唆された。
関連論文リスト
- What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal [53.189667624047416]
異なるステアリング手法が同一層に印加した場合に機能的に交換可能な回路を利用することを示す。
その結果,操舵ベクトルは最大90~99%のスペーサー化が可能であり,ほとんどの性能は維持できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T17:57:14Z) - Multi-Task Model Merging via Adaptive Weight Disentanglement [69.7292615212444]
モデルマージのための適応重み分散法を提案する。
余剰ベクトルの抽出に成功し, 減算後, タスクベクトルは頑健な性能を維持した。
論文 参考訳(メタデータ) (2024-11-27T20:08:55Z) - Improving Instruction-Following in Language Models through Activation Steering [58.876600545898675]
命令固有ベクトル表現を言語モデルから導出し,それに従ってモデルをステアリングする。
提案手法は,出力形式や長さ,単語の包摂といった制約に対するモデル適合性をいかに向上させるかを示す。
本研究は,アクティベーションステアリングが言語生成におけるきめ細かい制御に実用的でスケーラブルなアプローチを提供することを示す。
論文 参考訳(メタデータ) (2024-10-15T08:38:20Z) - Activation Scaling for Steering and Interpreting Language Models [55.59689963561315]
モデルにうまく介入することは、内部の動作を解釈するための前提条件である、と我々は主張する。
成功した介入は、間違ったトークンで正しいことを正し、その逆を正すべきである。
勾配に基づく最適化を用いることで、特定の種類の効率的かつ解釈可能な介入を学習(そして後で評価)することができる。
論文 参考訳(メタデータ) (2024-10-07T12:01:32Z) - Analyzing the Generalization and Reliability of Steering Vectors [8.253773195379166]
ステアリングベクトルは分布内および分布外の両方にかなりの制限があることを示す。
分散において、ステアビリティは異なる入力間で高度に変動する。
アウト・オブ・ディストリビューション(out-of-distribution)、ステアリングベクトル(steering vector)はよく一般化されるが、いくつかの概念はプロンプトの合理的な変化に対して脆弱である。
論文 参考訳(メタデータ) (2024-07-17T08:32:03Z) - Knowledge Composition using Task Vectors with Learned Anisotropic Scaling [51.4661186662329]
本稿では,パラメータブロックと異なる学習係数を線形に組み合わせ,タスクベクトルレベルでの異方性スケーリングを実現するアルゴリズムであるaTLASを紹介する。
このような線形結合は事前学習されたモデルの低内在性を明示的に利用しており、学習可能なパラメータは数係数のみであることを示す。
本稿では,タスク算術,少数ショット認識,テスト時間適応において,教師なしあるいは教師なしの目的を用いた手法の有効性を実証する。
論文 参考訳(メタデータ) (2024-07-03T07:54:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。