論文の概要: SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models
- arxiv url: http://arxiv.org/abs/2609.03544v1
- Date: Thu, 03 Sep 2026 08:43:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.986839
- Title: SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models
- Title(参考訳): SafeRI:大規模視覚言語モデルにおけるトークンレベル安全対策の認識と介入
- Abstract要約: 本稿では,本質的なVLM安全性を実現するために,ストリーミング認識とゲート付きLoRAフレームワークを提案する。
LoRAモジュールは、安全でないプレフィックス、トランジションステートメント、安全な継続からトレーニングされ、アクティベーション後の安全な応答に安全でない世代をリダイレクトする。
- 参考スコア(独自算出の注目度): 46.33456413143737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing safety alignment methods for vision-language models usually modify the model behavior globally: once the safety parameters are trained or loaded, they participate in both unsafe and already-safe generations. This always-on intervention can unnecessarily perturb the model's original reasoning path and degrade general multimodal capabilities. We argue that safety alignment should be an on-demand intervention rather than a permanent modification to every decoding trajectory. To this end, we propose a streaming recognition and gated LoRA framework for intrinsic VLM safety. During autoregressive generation, a lightweight recognizer estimates whether the current pre-token generation state is safe or unsafe. Its output updates the LoRA gate for the following decoding step; otherwise, generation follows the frozen-backbone policy. The LoRA module is trained from unsafe prefixes, transition statements, and safe continuations, so that it learns to redirect unsafe generations back to safe responses after activation. Experiments across multiple safety and general-purpose benchmarks demonstrate the effectiveness of our method in post-alignment settings.
- Abstract(参考訳): 視覚言語モデルの既存の安全アライメント手法は、通常、世界規模でモデル動作を変化させる: 安全パラメータがトレーニングされたりロードされたりすると、それらは安全でない世代とすでに安全である世代の両方に関係する。
この常時オンの介入は、モデルの元々の推論パスを不必要に乱し、一般的なマルチモーダル能力を低下させる可能性がある。
安全アライメントは、すべてのデコード軌道に恒久的な変更を加えるのではなく、オンデマンドの介入であるべきだ、と我々は主張する。
そこで本研究では,本質的なVLM安全性を実現するための,ストリーミング認識とゲート付きLoRAフレームワークを提案する。
自己回帰生成中、軽量認識器は、現在のプリトークン生成状態が安全か否かを推定する。
出力は次のデコードステップのためにLoRAゲートを更新する。
LoRAモジュールは、安全でないプレフィックス、トランジションステートメント、安全な継続からトレーニングされ、アクティベーション後の安全なレスポンスに安全でない世代をリダイレクトする。
複数の安全性および汎用ベンチマークを用いた実験により, 調整後設定における本手法の有効性が示された。
関連論文リスト
- Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs [13.624659633750861]
大規模言語モデル(MLLM)の既存の安全性メカニズムは、安全性とユーティリティの基本的なトレードオフに直面している。
出力対応安全ガードレールへのパラダイムシフトを提案する。
我々の手法はモデル内の隠れ状態空間内で動作し、次の世代が安全でないかどうかを予測する。
論文 参考訳(メタデータ) (2026-06-20T12:09:13Z) - Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Safe Vision-Language Models via Unsafe Weights Manipulation [75.04426753720551]
我々は、異なるレベルの粒度で安全性を評価する新しい指標セットであるSafe-Groundを導入し、安全性の評価を見直した。
我々は異なる方向を採り、トレーニングなしでモデルをより安全にできるかどうかを探り、Unsafe Weights Manipulation (UWM)を導入します。
UWMは、セーフとアンセーフのインスタンスのキャリブレーションセットを使用して、セーフとアンセーフのコンテンツのアクティベーションを比較し、後者を処理する上で最も重要なパラメータを特定する。
論文 参考訳(メタデータ) (2025-03-14T17:00:22Z) - Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models [30.93821289892195]
IRR (Identify, Remove, and Recalibrate for Safety Realignment) を提案する。
IRRの中核は、保持されたパラメータを再調整しながら、微調整されたモデルから安全でないデルタパラメータを特定し、除去することである。
この結果から,IRRは有害なクエリやジェイルブレイク攻撃などの安全性ベンチマークにおいて,微調整モデルの安全性を著しく向上することが示された。
論文 参考訳(メタデータ) (2024-12-15T03:58:38Z) - A safety realignment framework via subspace-oriented model fusion for large language models [22.588716190505963]
サブスペース指向モデル融合(SOMF)による安全性向上フレームワークを提案する。
我々のアプローチは、各微調整されたモデルの重みから全てのタスクベクトルを遠ざけることから始まる。
次に,これらのベクトル内の安全関連領域をサブスペースマスキング手法により同定する。
論文 参考訳(メタデータ) (2024-05-15T03:04:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。