論文の概要: Obliviate: Erasing Concepts from Autoregressive Image Generation Models
- arxiv url: http://arxiv.org/abs/2606.28643v1
- Date: Fri, 26 Jun 2026 22:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.629552
- Title: Obliviate: Erasing Concepts from Autoregressive Image Generation Models
- Title(参考訳): Obliviate: 自己回帰画像生成モデルから概念を消去する
- Abstract要約: 我々は,自己回帰画像生成のためのガイダンスに基づく概念消去手法であるObliviateを紹介する。
我々はObliviateを3つの最新自己回帰的テキスト・イメージモデル、Liquid, Emu3-Gen, Janus-Proで評価した。
Obliviateは現在の選択肢を一貫して上回り、防御的なRABベンチマークのヌードを91.58から3.15に減らし、全体のモデルユーティリティを保った。
- 参考スコア(独自算出の注目度): 6.871083333377967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The widespread adoption of generative AI models has intensified concerns about misuse, including the creation of unsafe or disturbing imagery. To mitigate such issues, several concept erasure approaches have been proposed to remove harmful content from multimodal generative models. Yet concept erasure for autoregressive image generation remains largely unexplored, despite the growing relevance of these models in recent trends toward unified multimodal architectures. In this work, we fill this gap by introducing Obliviate, a guidance-based concept erasure method for autoregressive image generation. Our method builds on three key design choices: KL-based supervision over visual token distributions, trajectory-level updates over full autoregressive rollouts, and aligned visual prefixes for stable target construction. We evaluate Obliviate on three state-of-the-art autoregressive text-to-image models, Liquid, Emu3-Gen, and Janus-Pro, covering the erasure of explicit content, graphic violence, and branded imagery. Obliviate consistently outperforms current alternatives, reducing nudity on the defensive RAB benchmark from 91.58 to 3.15 while preserving overall model utility.
- Abstract(参考訳): 生成AIモデルの普及により、安全でない画像や乱雑な画像の作成など、誤用に対する懸念が高まっている。
このような問題を緩和するため、マルチモーダル生成モデルから有害なコンテンツを取り除くために、いくつかの概念消去アプローチが提案されている。
しかし、これらのモデルが近年、統合マルチモーダルアーキテクチャへの関心が高まっているにもかかわらず、自己回帰画像生成の概念の消去は未解明のままである。
本研究では,自己回帰画像生成のためのガイダンスに基づく概念消去手法であるObliviateを導入することにより,このギャップを埋める。
提案手法は,視覚的トークン分布に対するKLに基づく監視,全自動回帰ロールアウトに対するトラジェクトリレベルの更新,安定なターゲット構築のための視覚的プレフィックスの整列という,3つの重要な設計選択に基づいて構築する。
我々は,現在最先端の自己回帰的テキスト・イメージモデルであるLiquid,Emu3-Gen,Janus-ProでObliviateを評価する。
Obliviateは現在の選択肢を一貫して上回り、防御的なRABベンチマークのヌードを91.58から3.15に減らし、全体のモデルユーティリティを保った。
関連論文リスト
- Concept Removal for Frontier Image Generative Models [24.385258118583767]
本稿ではフロンティア拡散とイメージ自己回帰モデルのための新しい概念除去手法を提案する。
私たちの介入は、内部のボトルネック層を元のレイヤを複製するように訓練されたトランスコーダに置き換えます。
この手法は、現代の拡散モデルと自己回帰モデルにまたがる最先端の概念除去性能を実証的に達成する。
論文 参考訳(メタデータ) (2026-06-24T08:25:30Z) - CGCE: Classifier-Guided Concept Erasure in Generative Models [53.7410000675294]
概念消去は、事前訓練されたモデルから望ましくない概念を取り除くために開発された。
既存の方法は、削除されたコンテンツを再生できる敵攻撃に弱いままである。
多様な生成モデルに対して堅牢な概念消去を提供する効率的なプラグアンドプレイフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-08T05:38:18Z) - VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation [57.36681904639463]
自己回帰的テキスト・画像モデルを保護する方法はまだ未検討のままである。
コンテンツセマンティクスから安全でない概念を正確に分離する新しいフレームワークであるVisual Contrast Exploitation (VCE)を提案する。
提案手法は,安全でない概念を消去し,無関係な概念の整合性を保ちながら,最先端の成果を効果的に確保できることを実証する。
論文 参考訳(メタデータ) (2025-09-21T09:00:27Z) - Robust Concept Erasure in Diffusion Models: A Theoretical Perspective on Security and Robustness [4.23067546195708]
textbfSCORE (Secure and Concept-Oriented Robust Erasure)は拡散モデルにおけるロバストな概念除去のための新しいフレームワークである。
SCOREは拡散モデルにおける安全で堅牢な概念消去のための新しい標準を定めている。
論文 参考訳(メタデータ) (2025-09-15T15:05:50Z) - Minimalist Concept Erasure in Generative Models [29.548315937553756]
我々は,最終生成出力の分布距離に基づいて,新しい最小限の概念消去目標を開発する。
消去の堅牢性を改善するため,我々はモデル微調整の代替としてニューロンマスキングを取り入れた。
現状のフローマッチングモデルに対する実証的な評価は,本手法がモデル全体の性能を劣化させることなく,概念を確実に消去することを示した。
論文 参考訳(メタデータ) (2025-07-16T00:32:14Z) - Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step [86.69947123512836]
CoT(Chain-of-Thought)推論は、複雑な理解タスクに取り組むために大規模なモデルで広く研究されている。
自己回帰画像生成を促進するために,CoT推論の可能性について,初めて包括的調査を行った。
本稿では,自動回帰画像生成に特化したPARMとPARM++を提案する。
論文 参考訳(メタデータ) (2025-01-23T18:59:43Z) - Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction [88.18235230849554]
大規模で未処理のデータセットでマルチモーダル生成モデルをトレーニングすることで、ユーザは有害で安全でない、議論の余地のない、文化的に不適切なアウトプットにさらされる可能性がある。
我々は、安全な埋め込みと、より安全な画像を生成するために、潜伏空間の重み付け可能な総和による修正拡散プロセスを活用する。
安全と検閲のトレードオフを特定し、倫理的AIモデルの開発に必要な視点を提示します。
論文 参考訳(メタデータ) (2024-11-21T09:47:13Z) - Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models [76.39651111467832]
本稿では,Reliable and Efficient Concept Erasure (RECE)を提案する。
派生した埋め込みによって表現される不適切なコンテンツを緩和するために、RECEはそれらをクロスアテンション層における無害な概念と整合させる。
新たな表現埋め込みの導出と消去を反復的に行い、不適切な概念の徹底的な消去を実現する。
論文 参考訳(メタデータ) (2024-07-17T08:04:28Z) - Towards Safe Self-Distillation of Internet-Scale Text-to-Image Diffusion
Models [63.20512617502273]
テキストから画像への拡散モデルにおいて,問題のあるコンテンツ生成を防止するため,SDDと呼ばれる手法を提案する。
本手法は,画像の全体的な品質を劣化させることなく,生成した画像から有害なコンテンツをはるかに多く除去する。
論文 参考訳(メタデータ) (2023-07-12T07:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。