論文の概要: Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.02082v2
- Date: Thu, 03 Sep 2026 07:46:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.287214
- Title: Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルにおけるクロスモーダル・セーフティ・ドリフトに対するトランスファー・セーフティ・アウェアネス
- Abstract要約: 我々は、このクロスモーダルな安全ドリフトと表現し、パイロットスタディにより、そのような要求に対する安全応答率は、明示的に安全でないテキストを含む要求よりも大幅に低いことが示されている。
冷凍MLLMバックボーンによるクロスモーダルな安全ドリフトを緩和する軽量な方向補正法である安全認識表現転送(SRT)を提案する。
- 参考スコア(独自算出の注目度): 11.458228829093152
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual modality enhances the capabilities of multimodal large language models (MLLMs) but also introduces a safety concern: a benign textual query may convey harmful intent when grounded in a visual image. We term this cross-modal safety drift and our pilot studies show that the safety response rate for such requests is substantially lower than that for requests containing explicitly unsafe text. This paper aims to systematically study this issue. First, we conduct an empirical analysis to identify representative unsafe response patterns. Building on these, we interpret model representations and attentions, revealing that visually risky cues receive limited attention and weakly trigger refusal. Motivated by the observation that safety signals from unsafe text processing can be transferred, we propose safety-awareness representation transfer (SRT), a lightweight direction-refinement method that mitigates cross-modal safety drift with a frozen MLLM backbone. Experiments across multiple benchmarks and models show that SRT effectively improves safety in diverse cross-modal settings while preserving utility. Code is available at https://github.com/cucu220123/safety-awareness.
- Abstract(参考訳): 視覚的モダリティは、マルチモーダルな大言語モデル(MLLM)の機能を強化するが、安全上の懸念ももたらしている。
我々は、このクロスモーダルな安全ドリフトと表現し、パイロットスタディにより、そのような要求に対する安全応答率は、明示的に安全でないテキストを含む要求よりも大幅に低いことが示されている。
本稿では,この問題を体系的に研究することを目的とする。
まず、代表的な安全でない応答パターンを特定するための経験的分析を行う。
これらに基づいて、モデル表現と注意を解釈し、視覚的に危険な手がかりが限られた注意を惹きつけ、拒否を弱く引き起こすことを明らかにする。
安全でないテキスト処理からの安全信号の転送が可能であることに感心し、凍結MLLMバックボーンによるクロスモーダルな安全ドリフトを緩和する軽量な方向補正法である安全認識表現転送(SRT)を提案する。
複数のベンチマークやモデルに対する実験により、SRTはユーティリティを保ちながら様々なモード間設定の安全性を効果的に向上することが示された。
コードはhttps://github.com/cucu220123/safety-awarenessで入手できる。
関連論文リスト
- Harnessing Textual Refusal Directions for Multimodal Safety [70.16764304975675]
マルチモーダルセーフティデータを必要とせずにマルチモーダルセーフティを注入する軽量なトレーニングフリーアプローチであるModality-Agnostic Refusal Steering (MARS)を導入する。
MARSは、アクティベーションリセンタによるモダリティの不整合を補正し、幾何的に定義された信頼領域内でステアリング強度を適応的にスケーリングし、最適な介入層を選択する。
論文 参考訳(メタデータ) (2026-06-30T15:57:50Z) - Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction [43.59114552026716]
MLLM(Multimodal large language model)は、テキストモダリティで学習した安全性機能を意味的に等価な非テキスト入力に転送するのに失敗することが多い。
本研究は,テキストアライメントされた拒絶方向とモダリティによるドリフト方向を解析することにより,このギャップについて検討する。
本稿では,自己修正によるモダリティドリフトを適応的に補正するトレーニングフリー推論時間法であるReGapを提案する。
論文 参考訳(メタデータ) (2026-05-18T09:16:55Z) - SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues [50.928203120795786]
本研究では,視覚言語モデルにおけるマルチモーダル安全性の挙動を,単純な意味的手がかりによって評価できるかどうかを考察する。
シーン内容を変更することなく、テキスト、視覚、認知の介入を制御できるセマンティック・ステアリング・フレームワークを導入する。
論文 参考訳(メタデータ) (2026-03-19T16:18:00Z) - Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility [26.564913442069866]
視覚言語モデル(VLM)は、大きな言語モデル(LLM)の推論能力を、モード間設定に拡張する。
既存の防衛は、安全性の微調整や攻撃的なトークン操作に頼っており、相当な訓練コストや性能の大幅な低下を招いている。
安全校正のための軽量かつトレーニング不要なフレームワークであるリスク意識注入(RAI)を提案する。
論文 参考訳(メタデータ) (2026-02-03T11:26:05Z) - CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs [10.42126976065225]
MLLM(Multimodal large language model)は、テキストと画像の相互作用を可能にする。
本稿では,クロスモーダル信頼性を評価するベンチマークであるCSR-Benchを紹介する。
我々は16の最先端MLLMを評価し,系統的な相互アライメントギャップを観察した。
論文 参考訳(メタデータ) (2026-02-03T08:49:44Z) - Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models [46.51961683413124]
本稿では,LVLMの脆弱性であるImplicit Reasoning Safetyの概念を紹介する。
私たちのデモでは、SSUIを使った単純なインコンテキスト学習でさえ、これらの暗黙のマルチモーダルな脅威を著しく軽減します。
論文 参考訳(メタデータ) (2025-08-12T13:26:06Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model [29.63418384788804]
5つのベンチマークでMLRM(Multimodal Large Reasoning Model)11の安全性評価を行う。
分析の結果、異なるベンチマークで異なる安全性パターンが明らかになった。
これは、モデル固有の推論能力を活用して安全でない意図を検出することで、MLRMの安全性問題に対処する潜在的アプローチである。
論文 参考訳(メタデータ) (2025-05-10T06:59:36Z) - Multimodal Situational Safety [73.63981779844916]
マルチモーダル・シチュエーション・セーフティ(Multimodal situational Safety)と呼ばれる新しい安全課題の評価と分析を行う。
MLLMが言語やアクションを通じても安全に応答するためには、言語クエリが対応する視覚的コンテキスト内での安全性への影響を評価する必要があることが多い。
我々は,現在のMLLMの状況安全性能を評価するためのマルチモーダル状況安全ベンチマーク(MSSBench)を開発した。
論文 参考訳(メタデータ) (2024-10-08T16:16:07Z) - SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering [56.92068213969036]
悪意のある命令から脅威を守るために、LLM(Large Language Models)には安全アライメントが不可欠である。
近年の研究では、過大な安全性の問題により、安全性に配慮したLCMは、良質な問い合わせを拒否する傾向にあることが明らかになっている。
過大な安全性の懸念を和らげるために,SCANS法を提案する。
論文 参考訳(メタデータ) (2024-08-21T10:01:34Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z) - On Prompt-Driven Safeguarding for Large Language Models [172.13943777203377]
表現空間では、入力クエリは通常、安全プロンプトによって「より高い拒絶」方向に移動される。
これらの知見に触発されて,安全性向上,すなわちDROの最適化手法を提案する。
安全性プロンプトを継続的かつトレーニング可能な埋め込みとして扱うことで、DROは、その有害性に応じて、クエリの表現を拒否方向に沿ってあるいは反対に移動させることを学ぶ。
論文 参考訳(メタデータ) (2024-01-31T17:28:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。