論文の概要: Steer Like the LLM: Activation Steering that Mimics Prompting
- arxiv url: http://arxiv.org/abs/2605.03907v1
- Date: Tue, 05 May 2026 15:59:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 19:35:44.019934
- Title: Steer Like the LLM: Activation Steering that Mimics Prompting
- Title(参考訳): LLMのようなステアリング: マイクが飛び出すアクティベーションステアリング
- Authors: Geert Heyman, Frederik Vandeputte,
- Abstract要約: 大規模な言語モデルは、プロンプトやアクティベーションの介入を通じて、推論時に操縦することができる。
アクティベーションステアリング法は、しばしばプロンプトベースのアプローチに比べて性能が劣る。
本稿では,アクティベーションステアリングの一形態として,迅速なステアリングを定式化するフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can be steered at inference time through prompting or activation interventions, but activation steering methods often underperform compared to prompt-based approaches. We propose a framework that formulates prompt steering as a form of activation steering and investigates whether distilling successful prompt steering behavior into simpler, interpretable models can close this gap. Our analysis reveals that popular activation steering methods are not faithful to the mechanics of prompt steering, which applies strong interventions on some tokens while barely affecting others. Based on these insights, we introduce Prompt Steering Replacement (PSR) models that estimate token-specific steering coefficients from the activations themselves and are trained to imitate prompt-based interventions. Experiments on three steering benchmarks across multiple language models show that PSR models outperform existing activation steering methods, especially when controlling for high-coherence completions, and also compare favorably to prompting on AxBench and persona steering.
- Abstract(参考訳): 大規模言語モデルは、プロンプトやアクティベーションの介入を通じて推論時に操ることができるが、アクティベーションステアリング手法は、プロンプトベースのアプローチに比べて性能が劣ることが多い。
本稿では,アクティベーションステアリングの一形態としてプロンプトステアリングを定式化したフレームワークを提案する。
分析の結果,アクティベーションステアリングの手法は,トークンに強い介入を施すと同時に,他のトークンにほとんど影響を与えない,プロンプトステアリングのメカニズムに忠実ではないことが明らかとなった。
これらの知見に基づき,アクティベーション自体からトークン固有のステアリング係数を推定し,アクティベーションに基づく介入を模倣するように訓練されたPmpt Steering Replacement(PSR)モデルを導入する。
複数の言語モデルにまたがる3つのステアリングベンチマークの実験では、PSRモデルは既存のアクティベーションステアリング法よりも優れており、特に高コヒーレンス完了の制御においては、AxBenchやペルソナステアリングのプロンプトと好意的に比較できる。
関連論文リスト
- AMPS: Adaptive Modality Preference Steering via Functional Entropy [66.69992693275061]
本稿では,各モータリティの情報提供量を定量化し,ステアリングに対するサンプル固有の感受性を明らかにするインスタンス認識診断指標を提案する。
実験結果から, インスタンス認識のステアリングは, 従来のステアリングよりもモダリティの嗜好の調整に優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-02-13T02:29:06Z) - Mechanistic Indicators of Steering Effectiveness in Large Language Models [3.635648354808971]
アクティベーションベースのステアリングにより、大規模言語モデルでは、トレーニングをせずに中間的アクティベーションに介入することで、ターゲットとなる振る舞いを表現できる。
広く使われているにもかかわらず、操舵が成功または失敗する際の機械的要因はいまだに理解されていない。
ステアリングの信頼性を内部モデル信号を用いて診断できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-02T06:56:22Z) - Steering Language Models Before They Speak: Logit-Level Interventions [9.055997973281919]
制御可能な生成のためのトレーニング不要な推論時間ロジット介入を提案する。
以上の結果から,ロジットステアリングは大きな,一貫した,マルチタスク制御のゲインを達成できることが示唆された。
論文 参考訳(メタデータ) (2026-01-16T03:00:33Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - Prototype-Based Dynamic Steering for Large Language Models [3.90727941420584]
Prototype-Based Dynamic Steering (PDS) は、命令の追加や変更なしに大きな言語モデル(LLM)推論を増幅するテスト時メソッドである。
本稿では,CoT (Chain-of-Thought) と中性プロンプトのクラスタリングアクティベーション差による「推論プロトタイプ」を提案する。
PDSは微調整やプロンプトエンジニアリングなしで精度を継続的に改善する。
論文 参考訳(メタデータ) (2025-10-07T01:34:28Z) - KV Cache Steering for Controlling Frozen LLMs [80.50365534625438]
キャッシュステアリングは、言語モデルの暗黙的なステアリングのための軽量な方法である。
キャッシュステアリングを応用して、小さな言語モデルにおける連鎖推論を誘導する。
論文 参考訳(メタデータ) (2025-07-11T17:59:36Z) - Instruction Following by Boosting Attention of Large Language Models [11.739148611340964]
潜水ステアリングは 内部の活性化を 誘導する 軽量な技術だ
InstABoostは、世代間のモデルの注意を変えることで、インストラクションの強度を高める。
InstABoostは従来のプロンプトと潜伏したステアリングよりも優れたコントロール成功を示している。
論文 参考訳(メタデータ) (2025-06-16T17:42:35Z) - Improving Instruction-Following in Language Models through Activation Steering [58.876600545898675]
命令固有ベクトル表現を言語モデルから導出し,それに従ってモデルをステアリングする。
提案手法は,出力形式や長さ,単語の包摂といった制約に対するモデル適合性をいかに向上させるかを示す。
本研究は,アクティベーションステアリングが言語生成におけるきめ細かい制御に実用的でスケーラブルなアプローチを提供することを示す。
論文 参考訳(メタデータ) (2024-10-15T08:38:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。