論文の概要: Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine
- arxiv url: http://arxiv.org/abs/2607.00576v1
- Date: Wed, 01 Jul 2026 07:59:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.794616
- Title: Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine
- Title(参考訳): 画像が混ざり合っているとき、有害な毒性を防げる安全策
- Abstract要約: マルチイメージ暗黙的毒性(MIIT)は、各画像が独立して良さそうに見える新しい安全問題であるが、画像が共同で解釈されたときに有害な意味論が現れる。
本稿は,三井の識別方法を検討することを目的とする。
まず、MIITの正式な定義を提供し、その検出における3つの重要な課題を分析する。
自動生成パイプラインを通じて、7つの代表的なリスクカテゴリをカバーする画像のみのマルチイメージ安全データセットであるMIITデータセットを構築した。
最終的に、我々はMiShieldを徐々に蒸留した推論監督で訓練し、危険をもたらす関連物質を明示的に分析し、安全判断を作成できるようにした。
- 参考スコア(独自算出の注目度): 43.604242902855155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-image content has become an increasingly prevalent form of visual communication in social media, giving rise to a new safety issue, multi-image implicit toxicity (MIIT), where each image appears benign in isolation, but harmful semantics emerge when the images are interpreted jointly. MIIT is particularly challenging for existing commercial moderation APIs and models due to the lack of explicit risky cues in each image. This paper aims to study how to identify MIIT. We first provide a formal definition of MIIT and analyze three key challenges for its detection. To alleviate the scarcity of data in this area, we construct MIIT-dataset, an image-only multi-image safety dataset covering seven representative risk categories through an automatic generation pipeline. Finally, we train MiShield with progressively distilled reasoning supervision, enabling it to produce safety judgments accompanied by explicit analyses of the correlated entities that result in the hazards. Experiments show that MiShield-8B models outperform representative moderation services and even larger-scale models, revealing its effectiveness and practical value for this widely used visual format. Warning: This paper contains potentially sensitive content.
- Abstract(参考訳): ソーシャルメディアでは、マルチイメージコンテンツが視覚コミュニケーションの一般的な形態になりつつあるため、新たな安全性問題であるMIIT(Multi-image pseudo toxicity)が発生する。
MIITは、既存の商用モデレーションAPIやモデルでは、各イメージに明確なリスク回避手段がないため、特に困難である。
本稿は,三井の識別方法を検討することを目的とする。
まず、MIITの正式な定義を提供し、その検出における3つの重要な課題を分析する。
この領域におけるデータの不足を軽減するため、自動生成パイプラインを通じて、7つの代表的なリスクカテゴリをカバーする画像のみのマルチイメージ安全データセットであるMIITデータセットを構築した。
最後に,MiShieldを段階的に蒸留した推理指導で訓練し,危険をもたらす関連物質を明示的に分析し,安全性を判断することを可能にする。
実験により、MiShield-8Bモデルは代表モデレーションサービスや大規模モデルよりも優れており、この広く使われているビジュアルフォーマットの有効性と実用性を明らかにしている。
警告: この論文には、潜在的にセンシティブなコンテンツが含まれている。
関連論文リスト
- Unified Face Attack Detection via Fine-Grained Semantic Guidance [14.035934093163057]
我々は800万以上の攻撃画像を含む大規模MS-UFADデータセットを構築した。
本稿では,これらのテキスト情報を活用するために,DAF-Net(Dual Alignment Forgery Network)を提案する。
論文 参考訳(メタデータ) (2026-07-09T06:50:31Z) - The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning [46.156246746700894]
MIR-SafetyBenchは,マルチイメージ推論の安全性を重視した最初のベンチマークである。
より高度なマルチイメージ推論を持つモデルは、MIR-SafetyBenchに対してより脆弱であることが判明した。
安全でない世代は 平均して安全な世代よりも 注意のエントロピーが低い
論文 参考訳(メタデータ) (2026-01-20T16:24:18Z) - SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation [5.313750874857107]
安全ポリシーに関連する機能にのみ異なる、対物的な画像を生成するためのフレームワークであるSafetyPairsを紹介する。
SafetyPairsを使って、評価データの強力なソースとなる新しい安全ベンチマークを構築します。
我々は,9つの安全カテゴリーの分類学にまたがる3,020以上のSafetyPair画像を含むベンチマークを公表した。
論文 参考訳(メタデータ) (2025-10-24T03:19:48Z) - SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models [74.11062256255387]
テキスト・ツー・イメージのモデルは、安全対策を回避し、有害なコンテンツを生成できる敵のプロンプトに対して非常に脆弱である。
SafeGuiderは, 生成品質を損なうことなく, 堅牢な安全制御を実現するための2段階のフレームワークである。
SafeGuiderは攻撃成功率の最小化において例外的な効果を示し、様々な攻撃シナリオで最大速度は5.48%である。
論文 参考訳(メタデータ) (2025-10-05T10:24:48Z) - TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models [53.937498564603054]
近年のテキスト・画像拡散モデルの進歩により、フォトリアリスティックな画像生成が可能になったが、NSFW画像のような悪意のあるコンテンツを生成するリスクもある。
リスクを軽減するため,概念消去手法が研究され,モデルが特定の概念を学習しやすくする。
本稿では,2段階のコンセプト消去戦略を用いて,信頼性の高い消去と知識保存の効果的なトレードオフを実現するTRCEを提案する。
論文 参考訳(メタデータ) (2025-03-10T14:37:53Z) - Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models [25.606641582511106]
モデル性能を向上させるために,マルチイメージ入力と安全チェーン・オブ・ソート(CoT)ラベルを微粒な推論ロジックとして統合する新しいデータセットを提案する。
実験の結果,MISを用いた微調整InternVL2.5-8Bは,マルチイメージタスクに挑戦する上で,強力なオープンソースモデルとAPIベースモデルの両方を著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2025-01-30T17:59:45Z) - MLLM-as-a-Judge for Image Safety without Human Labeling [81.24707039432292]
AIGCの時代には、多くの画像生成モデルは有害なコンテンツを生成できる。
確立された安全ルールに基づいて、このような安全でない画像を特定することが不可欠である。
既存のアプローチでは、人間のラベル付きデータセットを使った微調整MLLMが一般的である。
論文 参考訳(メタデータ) (2024-12-31T00:06:04Z) - Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction [88.18235230849554]
大規模で未処理のデータセットでマルチモーダル生成モデルをトレーニングすることで、ユーザは有害で安全でない、議論の余地のない、文化的に不適切なアウトプットにさらされる可能性がある。
我々は、安全な埋め込みと、より安全な画像を生成するために、潜伏空間の重み付け可能な総和による修正拡散プロセスを活用する。
安全と検閲のトレードオフを特定し、倫理的AIモデルの開発に必要な視点を提示します。
論文 参考訳(メタデータ) (2024-11-21T09:47:13Z) - Cross-Modality Perturbation Synergy Attack for Person Re-identification [66.48494594909123]
クロスモダリティの人物再識別(ReID)システムはRGB画像に基づいている。
相互モダリティReIDの主な課題は、異なるモダリティ間の視覚的差異を効果的に扱うことである。
既存の攻撃方法は、目に見える画像のモダリティの特徴に主に焦点を当てている。
本研究では,クロスモーダルReIDに特化して設計されたユニバーサル摂動攻撃を提案する。
論文 参考訳(メタデータ) (2024-01-18T15:56:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。