論文の概要: OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
- arxiv url: http://arxiv.org/abs/2607.19806v2
- Date: Thu, 23 Jul 2026 05:44:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.748362
- Title: OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
- Title(参考訳): OPium:デュアルオブジェクト潜在最適化によるステアリング外部性と過剰拒絶の軽減
- Abstract要約: アクティベーションステアリングは、推論時に大きな言語モデルを制御するための軽量なメカニズムを提供する。
本稿では,表現マッチングによるステアリングベクトルの衛生化のためのトレーニング不要な方法であるOPiumを紹介する。
- 参考スコア(独自算出の注目度): 5.915252597405961
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vectors may weaken safety behavior, while refusal vectors may induce over-refusal on benign prompts. We introduce OPIUM (Optimizing Protected Injections via Utility Manifolds), a training-free method for sanitizing steering vectors through representation matching. Given reference behaviors on two prompt sets, OPIUM optimizes a new steering vector that preserves the downstream representations induced by the desired intervention while matching a safer reference behavior on prompts where the original vector fails. Across steering-externality and over-refusal settings, OPIUM improves the safety--utility tradeoff relative to vanilla steering and directional ablation, suggesting that harmful side effects of activation steering can often be mitigated directly in activation space.
- Abstract(参考訳): アクティベーションステアリングは、推論時に大きな言語モデルを制御するための軽量なメカニズムを提供するが、ステアリングベクターは意図しない外部性を持つことができる。
本稿では,表現マッチングによるステアリングベクトルの衛生化のためのトレーニング不要なOPium(Optimizing Protected Injections via Utility Manifolds)を紹介する。
2つのプロンプト集合上の参照挙動が与えられた場合、OPiumは、元のベクトルが失敗するプロンプト上のより安全な参照挙動をマッチングしながら、所望の介入によって誘導される下流表現を保存する新しいステアリングベクトルを最適化する。
ステアリングの外部性および過剰な設定全体にわたって、OPiumはバニラステアリングと指向性アブレーションに対する安全・実用トレードオフを改善し、アクティベーションステアリングの有害な副作用をアクティベーション空間で直接緩和することができることを示唆している。
関連論文リスト
- Safety Cost of Steering Vectors Is Separable and Reducible [15.133262969401004]
ステアリングベクターは、意図せずにモデルの安全メカニズムを妥協し、有害な要求に対するコンプライアンスを高めることができる。
この安全劣化は, モデルの安全機構を乱すベクトルの分離可能な成分から生じるが, 操舵目標にはほとんど寄与しないことを示す。
本手法は, 操舵時の安全劣化を著しく低減し, 元の操舵効果を抑えながら, 誤操作を最小限に抑える。
論文 参考訳(メタデータ) (2026-08-09T00:29:54Z) - Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation [74.17379276939599]
近年のQwen-3.5シリーズにおいても,アクティベーションステアリングが広範囲のアライメントを引き起こすことが示されている。
ステアリングサイズ, ステアリングサブスペースの低ランク構造, ステアリングベクター構築時のエポック数など, キーステアリング固有の因子を解析することにより, AS誘起EMの特性を特徴づける。
論文 参考訳(メタデータ) (2026-06-07T15:34:59Z) - What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal [53.189667624047416]
異なるステアリング手法が同一層に印加した場合に機能的に交換可能な回路を利用することを示す。
その結果,操舵ベクトルは最大90~99%のスペーサー化が可能であり,ほとんどの性能は維持できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T17:57:14Z) - Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models [71.11171576590134]
視覚言語モデルは視覚的ジェイルブレイク攻撃によって容易に誘導され、有害なコンテンツを生成する。
本稿では,NullSteerを提案する。
我々はNullSteerが様々なジェイルブレイク攻撃において有害な出力を著しく減少させることを示す。
論文 参考訳(メタデータ) (2026-03-23T15:23:23Z) - Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models [62.16655896700062]
活性化ステアリングは大規模言語モデル(LLM)の有用性を高める技術である
重要かつ過度に調査された安全リスクを無意識に導入することを示します。
実験によると、これらの介入は強制乗算器として機能し、ジェイルブレイクに新たな脆弱性を発生させ、標準ベンチマークで攻撃成功率を80%以上向上させる。
論文 参考訳(メタデータ) (2026-02-03T12:32:35Z) - Self-Guard: Defending Large Reasoning Models via enhanced self-reflection [54.775612141528164]
Self-Guardは、大規模推論モデルのための軽量な安全防御フレームワークである。
これは認識とコンプライアンスのギャップを埋め、モデルユーティリティを損なうことなく堅牢な安全性能を達成する。
セルフガードは、さまざまな未知のリスクとさまざまなモデルスケールにまたがる強力な一般化を示す。
論文 参考訳(メタデータ) (2026-01-31T13:06:11Z) - The Rogue Scalpel: Activation Steering Compromises LLM Safety [11.402179030703188]
アクティベーションステアリング(Activation steering)は、推論中にモデルの隠れ状態に直接意味論的意味のあるベクトルを追加することによって、LCMの動作を制御する技術である。
ステアリングはモデルアライメントの保護を系統的に破り、有害な要求に従わせる。
論文 参考訳(メタデータ) (2025-09-26T08:49:47Z) - AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint [49.641959856967276]
提案手法はAlphaSteerと呼ばれる,理論的に基礎的かつ実験的に有効なアクティベーションステアリング法である。
ユーティリティ保存のために、Null-space制約を使って、良性データのステアリングのためのほぼゼロベクトルを構築することを学ぶ。
複数のjailbreak攻撃とユーティリティベンチマークの実験は、AlphaSteerの有効性を示している。
論文 参考訳(メタデータ) (2025-06-08T07:03:28Z) - Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations [4.029252551781513]
ステアリングベクトルを明らかにするための原理的アプローチを提案する。
我々は,大規模言語モデルから潜在リスクの選好を抽出することに注力する。
得られた操舵ベクトルが目標動作に合わせてLLM出力を正常かつ確実に変調することを示す。
論文 参考訳(メタデータ) (2025-05-16T18:23:10Z) - One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs [21.2431937128876]
本稿では,1つのトレーニング例に基づいて,勾配降下によるステアリングベクトルの最適化を提案する。
その結果,複数モデルにおける安全関連挙動を効果的に処理できることが判明した。
の作業を拡張し、脆弱なコードを書くためにモデルに最適化されたSVがモデルに有害な応答をもたらすことを示す。
論文 参考訳(メタデータ) (2025-02-26T06:13:01Z) - Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization [34.05163996072159]
人選好データのアクティベーションから「ステアリングベクトル」を抽出する。
この研究は、双方向の選好最適化によってより効果的なステアリングベクトルを生み出すことができる革新的なアプローチを提案する。
提案手法は, ステアリングベクトルが人間の嗜好データペアの生成確率に直接影響を与えるように設計されている。
論文 参考訳(メタデータ) (2024-05-28T05:10:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。