論文の概要: Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs
- arxiv url: http://arxiv.org/abs/2607.09697v1
- Date: Sat, 20 Jun 2026 12:09:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.376148
- Title: Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs
- Title(参考訳): 安全対応問題:MLLMにおける出力対応安全ガードレールの過度な拒絶を緩和する
- Abstract要約: 大規模言語モデル(MLLM)の既存の安全性メカニズムは、安全性とユーティリティの基本的なトレードオフに直面している。
出力対応安全ガードレールへのパラダイムシフトを提案する。
我々の手法はモデル内の隠れ状態空間内で動作し、次の世代が安全でないかどうかを予測する。
- 参考スコア(独自算出の注目度): 13.624659633750861
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing safety mechanisms for multimodal large language models (MLLMs) face a fundamental trade-off between safety and utility. Model fine-tuning achieves robust safety but compromises general utility. Input-side safety guardrails offer a lightweight alternative, yet they suffer from severe over-refusal, indiscriminately blocking benign queries or those the model could have safely answered through refusal or advisory responses. We identify that the root cause of over-refusal lies in the input-aware paradigm: safety guardrails make safety decisions without considering whether the model itself is capable of generating safe responses. Usually, MLLMs already possess intrinsic safety mechanisms that can transform harmful inputs into harmless outputs, but input-side safety guardrails override this capability, degrading user experience. Motivated by this insight, we propose a paradigm shift toward output-aware safety guardrails. Our method operates within the model's hidden state space to predict whether the forthcoming generation will be unsafe before it is fully produced. By training a lightweight classifier via multi-instance contrastive learning on hidden state representations, our approach distinguishes between inputs that will lead to unsafe outputs and those that will not, even when the inputs themselves contain risky elements. This enables precise intervention only when the model's actual response would be harmful. Extensive experiments demonstrate that our output-aware safety guardrail matches the safety performance of existing methods while drastically reducing over-refusal, preserving the model's utility and built-in safety capabilities. Code is available at: https://github.com/kunzhan/OutGuard
- Abstract(参考訳): MLLM(Multimodal large language model)の既存の安全性メカニズムは、安全性とユーティリティの基本的なトレードオフに直面している。
モデルファインチューニングは堅牢な安全性を実現するが、汎用性を損なう。
入力側の安全ガードレールは軽量な代替手段を提供するが、過度に拒否され、良心的なクエリを無差別にブロックする。
安全ガードレールは、モデル自体が安全な応答を生成できるかどうかを考慮せずに、安全判断を行う。
MLLMには、有害な入力を無害な出力に変換する固有の安全メカニズムがすでに備わっているが、入力側の安全ガードレールはこの機能をオーバーライドし、ユーザエクスペリエンスを劣化させる。
この知見に感化されて、出力対応安全ガードレールへのパラダイムシフトを提案する。
提案手法はモデル内の隠れ状態空間内で動作し,生成前に次の世代が安全でないかどうかを予測する。
隠れ状態表現に対するマルチスタンス・コントラスト学習による軽量分類器の訓練により,入力自体が危険な要素を含む場合でも,安全でない出力につながる入力とそうでない入力を区別する。
これにより、モデルの実際の応答が有害な場合にのみ、正確な介入が可能になる。
大規模な実験により,我々の出力対応安全ガードレールは既存手法の安全性能に匹敵するが,過度な拒絶を著しく低減し,モデルの実用性と組込み安全性を維持できることを示した。
コードは、https://github.com/kunzhan/OutGuardで入手できる。
関連論文リスト
- SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models [46.33456413143737]
本稿では,本質的なVLM安全性を実現するために,ストリーミング認識とゲート付きLoRAフレームワークを提案する。
LoRAモジュールは、安全でないプレフィックス、トランジションステートメント、安全な継続からトレーニングされ、アクティベーション後の安全な応答に安全でない世代をリダイレクトする。
論文 参考訳(メタデータ) (2026-09-03T08:43:07Z) - Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models [20.42976162135529]
大規模言語モデル(LLM)は、仮想アシスタント、自動コード生成、科学研究など、さまざまな領域で広く使われている。
我々は,与えられた安全対応LLMの安全トリガトークンを識別し,明示的に復号する,シンプルで効果的な防衛アルゴリズムであるtextttD-STT を提案する。
論文 参考訳(メタデータ) (2025-05-12T01:26:50Z) - Safe Vision-Language Models via Unsafe Weights Manipulation [75.04426753720551]
我々は、異なるレベルの粒度で安全性を評価する新しい指標セットであるSafe-Groundを導入し、安全性の評価を見直した。
我々は異なる方向を採り、トレーニングなしでモデルをより安全にできるかどうかを探り、Unsafe Weights Manipulation (UWM)を導入します。
UWMは、セーフとアンセーフのインスタンスのキャリブレーションセットを使用して、セーフとアンセーフのコンテンツのアクティベーションを比較し、後者を処理する上で最も重要なパラメータを特定する。
論文 参考訳(メタデータ) (2025-03-14T17:00:22Z) - SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals [51.49737867797442]
大規模言語モデル(LLM)は、様々なタスクにまたがる例外的な能力を示すが、有害なコンテンツを生成することでリスクを引き起こす。
LLMは、内部状態の安全性に関する内部評価を同様に行うことができることを示す。
本稿では,プロバーをベースとした内部状態モニタを用いて,安全でない出力を規制するSafeSwitchを提案する。
論文 参考訳(メタデータ) (2025-02-03T04:23:33Z) - Locking Down the Finetuned LLMs Safety [33.56657036839617]
特定の下流タスクのために最適化するためには、追加のデータセット上での微調整大型言語モデル(LLM)が必要であることが多い。
既存の安全アライメント対策は、推論中の有害な行動を制限するものであり、微調整時の安全性リスクを軽減するには不十分である。
そこで,本研究では,手直し後の堅牢な安全性を維持する新しいアライメント介入手法であるSafetyLockを紹介する。
論文 参考訳(メタデータ) (2024-10-14T09:58:29Z) - What Makes and Breaks Safety Fine-tuning? A Mechanistic Study [64.9691741899956]
安全性の微調整は、大規模な言語モデル(LLM)を、安全なデプロイメントのための人間の好みに合わせるのに役立つ。
安全でない入力の健全な側面をキャプチャする合成データ生成フレームワークを設計する。
これを用いて,3つのよく知られた安全微調整手法について検討する。
論文 参考訳(メタデータ) (2024-07-14T16:12:57Z) - On Prompt-Driven Safeguarding for Large Language Models [172.13943777203377]
表現空間では、入力クエリは通常、安全プロンプトによって「より高い拒絶」方向に移動される。
これらの知見に触発されて,安全性向上,すなわちDROの最適化手法を提案する。
安全性プロンプトを継続的かつトレーニング可能な埋め込みとして扱うことで、DROは、その有害性に応じて、クエリの表現を拒否方向に沿ってあるいは反対に移動させることを学ぶ。
論文 参考訳(メタデータ) (2024-01-31T17:28:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。