論文の概要: SafeMol: Dual-Modality Safety Alignment for Molecular Multimodal Models
- arxiv url: http://arxiv.org/abs/2609.33640v1
- Date: Sun, 27 Sep 2026 15:03:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 15:09:24.713288
- Title: SafeMol: Dual-Modality Safety Alignment for Molecular Multimodal Models
- Title(参考訳): SafeMol:分子マルチモーダルモデルのための二重モード安全性アライメント
- Abstract要約: テキストのみの設定とグラフ条件の設定の両方で、ジェイルブレイクの重大な脆弱性が示されます。
本分析は,安全性,過度な拒絶,実用性のバランスを保ちつつ,入力モダリティの安全性を保たなければならないことを示す。
テキストのみの入力とグラフ条件の入力にまたがる軽量モジュールを協調的に最適化するパラメータ効率の高い安全アライメントフレームワークであるSafeMolを提案する。
- 参考スコア(独自算出の注目度): 15.662897734186323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Molecular multimodal models support diverse understanding and generation tasks but may introduce safety vulnerabilities when handling hazardous molecules. In this work, We reveal substantial jailbreak vulnerabilities under both text-only and graph-conditioned settings. Our analysis further shows that safety robustness must hold across input modalities while balancing safety, over-refusal, and utility. To address these challenges, we construct SafeMolBench, a molecular multimodal safety-alignment benchmark with 3702 samples covering 618 unique hazardous molecules and safe molecular tasks, organized into hazardous-harmful, hazardous-allowed, and utility-replay subsets to support unified training and evaluation of safety, over-refusal, and utility. Based on SafeMolBench, we propose SafeMol, a parameter-efficient safety alignment framework that jointly optimizes lightweight modules across text-only and graph-conditioned inputs, uses MMD for distribution-level representation alignment to reduce modality-induced discrepancies, and explicitly models molecular hazardousness and harmful operational intent. Experiments on SafeMolBench show that SafeMol reduces attack success by several tens of percentage points while largely maintaining low over-refusal and preserving molecular-task utility.
- Abstract(参考訳): 分子マルチモーダルモデルは、多様な理解と生成タスクをサポートするが、有害分子を扱う際の安全性上の脆弱性をもたらす可能性がある。
この作業では、テキストオンリーとグラフコンディショニングの両方で、ジェイルブレイクの重大な脆弱性を明らかにします。
さらに, 安全性, 過度な拒絶, 実用性のバランスを保ちながら, 入力モダリティをまたいで安全性の堅牢性が保たなければならないことを示す。
これらの課題に対処するため, SafeMolBenchという分子マルチモーダル・セーフアライメント・ベンチマークを構築し, 618個のユニークな危険分子と安全な分子タスクをカバーし, 安全性, 過剰拒絶, ユーティリティの統一的なトレーニングと評価を支援するために, 有害害, 有害許容およびユーティリティ・リプレイサブセットに編成した。
SafeMolBenchをベースとしたSafeMolは,テキストのみおよびグラフ条件の入力にまたがる軽量モジュールを協調的に最適化するパラメータ効率の高い安全アライメントフレームワークである。
SafeMolBenchの実験では、SafeMolは低遅延と分子タスクの有効性を維持しながら、攻撃成功を数十パーセント削減している。
関連論文リスト
- MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration [34.42959451448432]
MLLM(Multimodal large language model)は、安全でないテキストプロンプトを拒否するが、意味的に等価なマルチモーダル入力に対する有害な応答を生成する。
MLLM表現を幾何学的に解析し、この安全性の相違の原因を特定する。
既存の拒絶領域に安全でないマルチモーダル表現を校正する保護手法であるMMAlignerを提案する。
論文 参考訳(メタデータ) (2026-08-06T11:39:08Z) - MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules [60.55214893687032]
MolSafeEvalは、分子生成の安全性リスクを評価し分析するためのベンチマークである。
有害なデータベースからハザードルールまで、異質な安全知識を構造化された分子安全知識グラフに統合する。
MolSafeEvalは、現在の生成アプローチの安全性の脆弱性を体系的に明らかにすることによって、分子モデルのベンチマークのための新しいレンズを提供する。
論文 参考訳(メタデータ) (2026-07-01T05:33:51Z) - Robust Multimodal Safety via Conditional Decoding [52.92816441364308]
マルチモーダル大規模言語モデル(MLLM)は、有害なクエリが相互モーダル相互作用を悪用した場合、しばしば安全性の低下を経験する。
本稿では,MLLMの内部表現を利用して応答生成前の二項安全トークンを予測する,シンプルな条件付きデコード戦略であるCASAを提案する。
論文 参考訳(メタデータ) (2026-03-31T23:19:50Z) - Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models [83.80177564873094]
マルチモーダル・ユニバーサル・ジェイルブレイク・アタック・フレームワークを提案する。
LLaVA,Yi-VL,MiniGPT4,MiniGPT-v2,InstructBLIPなどのMLLMの望ましくないコンテキスト生成を評価する。
本研究は,MLLMにおける堅牢な安全対策の必要性を浮き彫りにするものである。
論文 参考訳(メタデータ) (2025-06-02T04:33:56Z) - Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs [56.440345471966666]
MLLM(Multimodal Large Language Models)は、テキストと画像の両方を通して対話を可能にすることで、従来の言語モデルの能力を拡大した。
MMSafeAwareは,安全シナリオ29のMLLMを評価するために設計された,初の総合的マルチモーダル安全意識ベンチマークである。
MMSafeAwareには安全でないサブセットと安全でないサブセットの両方が含まれており、安全でないコンテンツを正しく識別するモデルの評価と、有用性を阻害する過敏性を回避することができる。
論文 参考訳(メタデータ) (2025-02-16T16:12:40Z) - Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching [74.62818936088065]
textscSafePatchingは包括的なPSAのための新しいフレームワークである。
textscSafePatchingはベースラインメソッドよりも包括的なPSAを実現する。
textscSafePatchingは、連続的なPSAシナリオにおいて、その優位性を示している。
論文 参考訳(メタデータ) (2024-05-22T16:51:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。