論文の概要: MIRAGE: Protecting against Malicious Image Editing via False Moderation
- arxiv url: http://arxiv.org/abs/2606.26199v1
- Date: Wed, 24 Jun 2026 16:23:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.028241
- Title: MIRAGE: Protecting against Malicious Image Editing via False Moderation
- Title(参考訳): MIRAGE:偽モデレーションによる悪意ある画像編集の防止
- Abstract要約: 画像免疫に関する以前の研究は、許可されていない操作から保護するために、イメージに知覚できない摂動を追加する。
我々は,この問題をシステムレベルで把握し,すべての主要な商用画像編集システムに共通する未探索の攻撃面を特定する。
生成モデル自体を乱すのではなく、これらのモデレーションをポリシー違反としてイメージにフラグを付けることによって、イメージを免疫することを提案する。
- 参考スコア(独自算出の注目度): 73.0838743416626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The proliferation of AI-powered image editing systems raises serious concerns because it allows personal images to be arbitrarily manipulated at scale, with minimal effort, and a lower barrier to entry. Prior work on image immunization adds imperceptible perturbations to an image to protect against unauthorized manipulations. However, these methods usually require access to the model weights and the image manipulating prompt. This significantly limits their use, especially against powerful commercial image-editors such as GPT-Image, Gemini Flash Image (Nano Banana), and Grok Imagine. To address this, we take a system-level view of the problem and identify a previously unexplored attack surface common to all major commercial image editing systems: pre-generation safety moderation.Rather than disrupting the generative model itself, we propose to immunize images by causing these moderation classifiers to flag images as policy-violating, triggering an automatic refusal regardless of the editing prompt. We operationalize this by adding adversarial perturbations to align our image to policy-violating concepts in the representation space of an ensemble of open-source embedding and moderation models. We call our method MIRAGE, which stands for Moderation Induced Resistance Against Generative Editing. We evaluate MIRAGE against multiple closed-source image editing APIs and demonstrate success rates of more than 88%. Our approach is simple, prompt-agnostic, and effective, offering a practical path towards protecting personal images from unauthorized AI-powered editing.
- Abstract(参考訳): AIを利用した画像編集システムの普及は、個人イメージを最小限の労力で任意に操作し、参入障壁を低くするため、深刻な懸念を提起する。
画像免疫に関する以前の研究は、許可されていない操作から保護するために、イメージに知覚できない摂動を追加する。
しかしながら、これらの手法は通常、モデルウェイトと画像操作プロンプトへのアクセスを必要とする。
これにより、特にGPT-Image、Gemini Flash Image (Nano Banana)、Grok Imagineといった強力な商用画像エディターに対する使用が大幅に制限される。
そこで,本稿では,既存の画像編集システムに共通する未発見の攻撃面,すなわち前世代安全モデレーション(pre-generation safety moderation)をシステムレベルで同定し,生成モデル自体を乱すのではなく,これらのモデレーション分類器に画像にポリシー違反を警告させ,編集プロンプトによらず自動拒絶を誘発させることにより,画像の免疫化を提案する。
我々は、オープンソース埋め込みとモデレーションモデルのアンサンブルの表現空間において、私たちのイメージをポリシー違反の概念に合わせるために、敵対的摂動を加えることでこれを運用する。
MIRAGE(Modration induced resistance against Generative Editing)と呼ぶ。
我々はMIRAGEを複数のクローズドソース画像編集APIに対して評価し、88%以上の成功率を示した。
われわれのアプローチは単純で、迅速で、かつ効果的であり、無許可のAIによる編集から個人画像を保護するための実践的な道筋を提供する。
関連論文リスト
- Towards Transferable Defense Against Malicious Image Edits [70.17363183107604]
Transferable Defense Against Malicious Image Edits (TDAE)は、悪意のある編集に対するイメージ免疫を強化する新しいバイモーダルフレームワークである。
本稿では,FlatGrad Defense Mechanism (FDM) を紹介した。
テキストエンハンスメント保護のための動的プロンプトディフェンス (DPD) を提案し, テキスト埋め込みを周期的に洗練し, 免疫画像の編集結果を元の画像と整合させる。
論文 参考訳(メタデータ) (2025-12-16T12:10:16Z) - Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation [74.5813283875938]
ゼロショット画像・画像生成は知的財産権侵害に重大なリスクをもたらす。
この研究は、個人イメージを誤用から守ることを目的とした、最初の普遍的および認証統合ソリューションであるAdapter Shieldを提示する。
提案手法は, ゼロショット画像合成の不正化において, 最先端の防御を克服する。
論文 参考訳(メタデータ) (2025-11-25T04:49:16Z) - Is Perturbation-Based Image Protection Disruptive to Image Editing? [4.234664611250363]
現在の画像保護法は、拡散ベースの編集を妨げるために、イメージに知覚できない摂動を追加することに依存している。
画像に対する完全な保護は、編集の試みの出力が望ましくないノイズの多い画像であることを意味する。
我々は、摂動に基づく手法は、拡散に基づく編集に対する堅牢な画像保護に十分な解決策を提供していないと論じる。
論文 参考訳(メタデータ) (2025-06-04T19:20:37Z) - DCT-Shield: A Robust Frequency Domain Defense against Malicious Image Editing [1.7624347338410742]
最近のディフェンスは、拡散ベースの編集モデルの機能を損なうために、ピクセル空間に限られたノイズを加えることで画像を保護する。
本稿では,周波数領域に直接対向摂動を導入する新しい最適化手法を提案する。
JPEGパイプラインを利用して,悪意のある画像編集を効果的に防止する逆画像を生成する。
論文 参考訳(メタデータ) (2025-04-24T19:14:50Z) - GuardDoor: Safeguarding Against Malicious Diffusion Editing via Protective Backdoors [8.261182037130407]
GuardDoorは、イメージオーナとモデルプロバイダ間のコラボレーションを促進する、新しくて堅牢な保護メカニズムである。
本手法は,画像前処理操作に対するロバスト性を向上し,大規模展開にスケーラブルであることを示す。
論文 参考訳(メタデータ) (2025-03-05T22:21:44Z) - ACE: Anti-Editing Concept Erasure in Text-to-Image Models [73.00930293474009]
既存の概念消去手法は、削除された概念がプロンプトから生成されるのを防ぐために優れた結果が得られる。
本稿では、生成時にターゲット概念を消去するだけでなく、編集時に除去する反編集概念消去(ACE)手法を提案する。
論文 参考訳(メタデータ) (2025-01-03T04:57:27Z) - IMPRESS: Evaluating the Resilience of Imperceptible Perturbations
Against Unauthorized Data Usage in Diffusion-Based Generative AI [52.90082445349903]
拡散ベースの画像生成モデルは、アーティストのスタイルを模倣するアートイメージを作成したり、偽のコンテンツのためにオリジナルの画像を悪意を持って編集することができる。
知覚不能な摂動を追加することによって、元のイメージをそのような不正なデータ使用から保護する試みがいくつかなされている。
本研究では, IMPRESS という浄化摂動プラットフォームを導入し, 非受容性摂動の有効性を保護策として評価する。
論文 参考訳(メタデータ) (2023-10-30T03:33:41Z) - JPEG Compressed Images Can Bypass Protections Against AI Editing [48.340067730457584]
悪意ある編集から画像を保護する手段として、知覚不能な摂動が提案されている。
上記の摂動はJPEG圧縮に対して堅牢ではないことがわかった。
論文 参考訳(メタデータ) (2023-04-05T05:30:09Z) - TAFIM: Targeted Adversarial Attacks against Facial Image Manipulations [0.0]
顔画像操作手法は、個人のプライバシーに影響を与えるか、偽情報を広めることによって、懸念を引き起こす可能性がある。
本研究は,顔の操作がそもそも起こらないよう,前向きな防御法を提案する。
原画像に埋め込まれた画像固有の摂動を生成する新しいデータ駆動手法を提案する。
論文 参考訳(メタデータ) (2021-12-16T19:00:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。