論文の概要: ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives
- arxiv url: http://arxiv.org/abs/2608.30197v1
- Date: Mon, 31 Aug 2026 03:25:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.209914
- Title: ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives
- Title(参考訳): ALTSTEER: コンストラクティブな代替品にハードリファインを超越した安全なステアリング
- Authors: Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim,
- Abstract要約: ALTSTEERは、単一の推論パス内で構成的リダイレクトによる選択的介入を結合する推論時フレームワークである。
Llama-3.1 と Qwen2.5 の評価は、ALTSTEER が建設的セーフコンプリート挙動を改善しつつ良性を維持していることを示している。
- 参考スコア(独自算出の注目度): 15.352264811086359
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment is essential for deploying large language models, requiring systems to prevent harmful compliance while preserving helpfulness on benign requests. Activation steering offers a training-free inference-time approach to safety control, but effective safety steering requires addressing two coupled questions: when to intervene and how generation should be shaped after intervention. However, existing safety steering methods remain limited along both dimensions, as their triggering mechanisms can be unstable across domains and refusal-oriented steering often yields rigid refusals rather than constructive safe guidance. To address these limitations, we propose ALTSTEER, an inference-time framework that couples selective intervention with refusal-anchored constructive redirection within a single inference pass. ALTSTEER uses an internal refusal-relevant signal to decide when to steer, and applies staged steering to shift generation from refusal-oriented control toward constructive alternatives. Evaluations on Llama-3.1 and Qwen2.5 show that ALTSTEER preserves benign utility while improving constructive safe-completion behavior, especially on models that otherwise tend to produce short refusals for harmful requests.
- Abstract(参考訳): 大規模な言語モデルをデプロイするには安全性の調整が不可欠であり、システムは有害なコンプライアンスを防ぎつつ、良心的な要求に役立っている。
アクティベーションステアリング(Activation steering)は、安全管理に対するトレーニングなしの推論タイムアプローチを提供するが、効果的な安全ステアリングでは、いつ介入すべきか、介入後の生成をどのように形成すべきかという2つの複合的な疑問に対処する必要がある。
しかし、既存の安全ステアリング法は、ドメイン間でトリガー機構が不安定であり、リファリング指向のステアリングは、建設的安全誘導よりも厳格な拒絶をもたらすことが多いため、両方の次元に沿って制限されている。
これらの制約に対処するため,1つの推論パス内で,リフレルアンコールされた建設的リダイレクトに選択的に介入する推論時フレームワークであるALTSTEERを提案する。
ALTSTEERは内部の拒絶関連信号を使用して、いつ操縦するかを判断し、段階的なステアリングを適用して、リファリング指向の制御から建設的な代替へと生成をシフトさせる。
Llama-3.1 と Qwen2.5 の評価によれば、ALTSTEER は建設上の安全補完性を改善しながら良質な実用性を保ち、特に有害な要求に対する短い拒絶を生じる傾向にある。
関連論文リスト
- Hamilton-Jacobi Reachability-Based Safe Reinforcement Learning for Emergency Collision Avoidance [13.82721066487409]
本稿では,ハミルトン・ヤコビ到達可能性に基づく運動安全セットによってガイドされる安全な強化学習フレームワークを提案する。
提案手法は,目標達成率の向上,回避操作の円滑化,基準法よりも大きな統一安全マージンの維持を実現している。
論文 参考訳(メタデータ) (2026-06-13T13:57:30Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - Safety-Guided Flow (SGF): A Unified Framework for Negative Guidance in Safe Generation [2.5489046505746704]
本稿では,画像生成タスクに対する最大平均離散性(MMD)ポテンシャルを用いた統一確率的フレームワークを提案する。
我々は制御バリア関数解析を利用して、負のガイダンスが強くなければならない臨界時間窓の存在を正当化する。
我々は,いくつかの現実的な安全な生成シナリオにおいて,統合されたフレームワークを評価し,否定的なガイダンスがデノナイジングプロセスの初期段階で適用されるべきであることを確認した。
論文 参考訳(メタデータ) (2026-03-02T07:31:29Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models [62.16655896700062]
活性化ステアリングは大規模言語モデル(LLM)の有用性を高める技術である
重要かつ過度に調査された安全リスクを無意識に導入することを示します。
実験によると、これらの介入は強制乗算器として機能し、ジェイルブレイクに新たな脆弱性を発生させ、標準ベンチマークで攻撃成功率を80%以上向上させる。
論文 参考訳(メタデータ) (2026-02-03T12:32:35Z) - Self-Guard: Defending Large Reasoning Models via enhanced self-reflection [54.775612141528164]
Self-Guardは、大規模推論モデルのための軽量な安全防御フレームワークである。
これは認識とコンプライアンスのギャップを埋め、モデルユーティリティを損なうことなく堅牢な安全性能を達成する。
セルフガードは、さまざまな未知のリスクとさまざまなモデルスケールにまたがる強力な一般化を示す。
論文 参考訳(メタデータ) (2026-01-31T13:06:11Z) - Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines [31.031589383127677]
本稿では,Synthesized Guideline-based Adaptive Safety Alignment (SGASA)フレームワークを紹介する。
モデル生成安全ガイドラインを内包し、敵のプロンプトに対する堅牢性を強化するモデルの能力を強化する。
複数のデータセットにわたる実験により、SGASAはモデルの安全性を大幅に改善し、適応性とスケーラブルな効率性を検証する。
論文 参考訳(メタデータ) (2025-11-26T09:44:32Z) - SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering [56.92068213969036]
悪意のある命令から脅威を守るために、LLM(Large Language Models)には安全アライメントが不可欠である。
近年の研究では、過大な安全性の問題により、安全性に配慮したLCMは、良質な問い合わせを拒否する傾向にあることが明らかになっている。
過大な安全性の懸念を和らげるために,SCANS法を提案する。
論文 参考訳(メタデータ) (2024-08-21T10:01:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。