論文の概要: MME-Safety: A Fine-grained Benchmark for Safety Evaluation of MLLMs
- arxiv url: http://arxiv.org/abs/2609.20850v2
- Date: Tue, 22 Sep 2026 12:08:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.686625
- Title: MME-Safety: A Fine-grained Benchmark for Safety Evaluation of MLLMs
- Title(参考訳): MME-Safety: MLLMの安全性評価のためのきめ細かいベンチマーク
- Abstract要約: MLLM(Multimodal Large Language Models)のクロスモーダルな機能には、アンモダルフィルタを簡単に回避できる複雑な脆弱性が導入されている。
既存のベンチマークには詳細なインテント関連のアノテーションがなく、一次元のメトリクスに依存しており、包括的な堅牢性評価を妨げる。
MME-Safetyは,リスクシナリオ,有害度,モダリティ固有のステルスレベルを分類する,ユニークな4次元アノテーションスキーマを備えた,厳格に検証されたベンチマークである。
- 参考スコア(独自算出の注目度): 28.86403703474286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Multimodal Large Language Models (MLLMs) show remarkable advancements, their cross-modal capabilities introduce complex vulnerabilities that easily bypass unimodal filters. Existing benchmarks lack fine-grained intent-related annotations and rely on unidimensional metrics, hindering comprehensive robustness evaluation. To address this, we propose MME-Safety, a rigorously verified benchmark featuring a unique four-dimensional annotation schema that categorizes risk scenarios, harm severity, and modality-specific stealth levels. Furthermore, we introduce a hierarchical evaluation framework to assess fundamental response reliability, actual risk exposure, and the structural integrity of defensive behaviors. Extensive zero-shot evaluations across 17 state-of-the-art MLLMs provide a comprehensive safety profile of current multimodal systems. Our analysis systematically investigates cross-modal input configurations and uncovers safety implications associated with Chain-of-Thought (CoT) reasoning. These multifaceted findings underscore the urgent need for robust, reasoning-aware safety alignment in the multimodal landscape.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は目覚ましい進歩を示すが、そのクロスモーダル機能は複雑な脆弱性を導入し、アンモダルフィルタをバイパスする。
既存のベンチマークには詳細なインテント関連のアノテーションがなく、一次元のメトリクスに依存しており、包括的な堅牢性評価を妨げる。
そこで本研究では,リスクシナリオ,有害度,モダリティ固有のステルスレベルを分類した,ユニークな4次元アノテーションスキーマを特徴とする,厳格に検証されたベンチマークであるMME-Safetyを提案する。
さらに, 基本応答信頼性, 実際のリスク暴露, 防御行動の構造的整合性を評価するための階層的評価フレームワークを導入する。
17の最先端MLLMにわたる広範囲なゼロショット評価は、現在のマルチモーダルシステムの包括的な安全プロファイルを提供する。
本分析では, クロスモーダルな入力構成を体系的に検討し, チェーン・オブ・ソート(CoT)推論に関連する安全性について考察した。
これらの多面的発見は、マルチモーダルランドスケープにおける堅牢で合理的な安全アライメントの必要性を浮き彫りにした。
関連論文リスト
- MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models [47.43519512313406]
既存のマルチモーダル安全ベンチマークは視覚入力のみに焦点を当てており、視覚、音声、テキストを処理するOmni Large Language Models (LLM)を評価することはできない。
MCBenchは4つの安全カテゴリにまたがる1196のシナリオを持つベンチマークで、正確な安全性評価のために複数のモダリティを統合する必要がある。
論文 参考訳(メタデータ) (2026-04-17T12:31:17Z) - Robust Multimodal Safety via Conditional Decoding [52.92816441364308]
マルチモーダル大規模言語モデル(MLLM)は、有害なクエリが相互モーダル相互作用を悪用した場合、しばしば安全性の低下を経験する。
本稿では,MLLMの内部表現を利用して応答生成前の二項安全トークンを予測する,シンプルな条件付きデコード戦略であるCASAを提案する。
論文 参考訳(メタデータ) (2026-03-31T23:19:50Z) - SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models [60.8821834954637]
LRMの安全性をエンドツーエンドに評価する最初のベンチマークであるSafeRBenchを紹介する。
私たちは、リスクカテゴリとレベルを入力設計に組み込んだ先駆者です。
我々は,長い推論トレースを意味的に一貫性のある単位にセグメント化するためのマイクロシンクのチャンキング機構を導入する。
論文 参考訳(メタデータ) (2025-11-19T06:46:33Z) - When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models [50.66979825532277]
我々は、クロスモーダルチャレンジに適した解釈可能な推論パスを備えた最初のデータセットであるSSUI(Safe-Semantics-but-Unsafe-Interpretation)を紹介した。
新たなトレーニングフレームワークであるSRPO(Safety-Aware Reasoning Path Optimization)も、SSUIデータセットに基づいて設計されている。
実験の結果, SRPO学習モデルでは, キーセーフティベンチマークで最先端の結果が得られた。
論文 参考訳(メタデータ) (2025-09-15T15:40:58Z) - SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models [75.67623347512368]
MLLMの安全性評価を行うための総合的なフレームワークであるツールンを提案する。
我々のフレームワークは、包括的な有害なクエリデータセットと自動評価プロトコルで構成されています。
本研究では,広く利用されている15のオープンソースMLLMと6つの商用MLLMの大規模実験を行った。
論文 参考訳(メタデータ) (2024-10-24T17:14:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。