論文の概要: PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2603.21547v1
- Date: Mon, 23 Mar 2026 04:01:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.476315
- Title: PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models
- Title(参考訳): PROBE: 消去されたテキスト・ビデオ拡散モデルにおける残留概念容量の診断
- Abstract要約: テキスト・ツー・ビデオ(T2V)拡散モデルの概念技術は、センシティブなコンテンツの相当な抑制を報告している。
本稿では,T2Vモデルにおけるテクストの潜在的な消去概念を定量化する診断プロトコル PROBE を紹介する。
- 参考スコア(独自算出の注目度): 9.957850061310054
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Concept erasure techniques for text-to-video (T2V) diffusion models report substantial suppression of sensitive content, yet current evaluation is limited to checking whether the target concept is absent from generated frames, treating output-level suppression as evidence of representational removal. We introduce PROBE, a diagnostic protocol that quantifies the \textit{reactivation potential} of erased concepts in T2V models. With all model parameters frozen, PROBE optimizes a lightweight pseudo-token embedding through a denoising reconstruction objective combined with a novel latent alignment constraint that anchors recovery to the spatiotemporal structure of the original concept. We make three contributions: (1) a multi-level evaluation framework spanning classifier-based detection, semantic similarity, temporal reactivation analysis, and human validation; (2) systematic experiments across three T2V architectures, three concept categories, and three erasure strategies revealing that all tested methods leave measurable residual capacity whose robustness correlates with intervention depth; and (3) the identification of temporal re-emergence, a video-specific failure mode where suppressed concepts progressively resurface across frames, invisible to frame-level metrics. These findings suggest that current erasure methods achieve output-level suppression rather than representational removal. We release our protocol to support reproducible safety auditing. Our code is available at https://github.com/YiweiXie/PRObingBasedEvaluation.
- Abstract(参考訳): テキスト・ツー・ビデオ(T2V)拡散モデルにおける概念消去技術は, センシティブなコンテンツの相当な抑制を報告しているが, 現在の評価は, 対象概念が生成されたフレームから欠落しているかどうかを確認し, 出力レベルの抑制を表現的除去の証拠として扱うことに限定されている。
本稿では,T2V モデルにおける消去概念の \textit{reactivation potential} を定量化する診断プロトコル PROBE を紹介する。
全てのモデルパラメータを凍結させることで、PRBEはデノナイズドリコンストラクションの目的を通した軽量な擬似トーケン埋め込みと、オリジナルの概念の時空間構造に回復を固定する新しい遅延アライメント制約を組み合わせて最適化する。
1)分類器に基づく検出,意味的類似性,時間的再活性化分析,人的検証を対象とする多段階評価フレームワーク,(2)3つのT2Vアーキテクチャ,3つの概念カテゴリ,および3つの消去戦略の体系的実験により,試験方法のすべてが,介入深度に相関するロバスト性を有する測定可能な残留能力を残していること,(3)フレームレベルメトリクスに不可避な概念を段階的に再浮上するビデオ固有の障害モードである時間的再帰の識別,の3つの貢献を行う。
これらの結果は,現在の消去手法が表現的除去よりも出力レベルの抑制を実現することを示唆している。
再現可能な安全監査をサポートするためのプロトコルをリリースする。
私たちのコードはhttps://github.com/YiweiXie/PRObingBasedEvaluation.comで公開されています。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders [103.46709005379591]
概念消去は、事前訓練されたモデルから不要なセマンティクスを取り除くことによって、原則化された救済を提供する。
既存のアプローチは一般に粗い品質で動作し、概念表現の微細で分散した性質と不一致である。
外科的概念の消去を実現するためにスパースオートエンコーダを利用する新しいフレームワークであるEraseSAEを提案する。
論文 参考訳(メタデータ) (2026-09-03T10:23:37Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks [1.9800951131982487]
我々はSpecRef(Speculative Refinement)を用いて、ARドラフトからマスク付き拡散言語モデルをウォームスタートする。
We evaluate SpecRef across six benchmarks (HumanEval, MBPP, GSM8K, BBH, ARC-Challenge, HellaSwag) with three distinct evaluation protocol。
これらの観察は、多段階または非自己回帰生成パイプラインに適用され、より診断評価の実践に向けて向けられる。
論文 参考訳(メタデータ) (2026-06-25T18:52:24Z) - Beyond Reconstruction: Reconstruction-to-Vector Diffusion for Hyperspectral Anomaly Detection [9.078979356836193]
ハイパースペクトル異常検出(HAD)は、複雑なシーンにおけるスパースターゲットの同定に優れる。
既存のモデルは、スカラー・アズ・ア・エンドポイント(reconstruction-as-endpoint)パラダイムに閉じ込められているままである。
本稿では, 精製源として再構成を再定義するリコンストラクション・トゥ・ディフュージョン(R2VD)を提案する。
R2VDは新たな最先端技術を確立し、例外的な目標検出のバックグラウンドを提供する。
論文 参考訳(メタデータ) (2026-04-13T12:31:50Z) - Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders [3.3192479135000426]
本稿では,ビデオ表現におけるSparseencoencoders(SAE)の最初の体系的研究について述べる。
標準SAEは解釈可能な単意味の特徴に分解されるが、時間的コヒーレンスを破壊する。
TopKの選択はフレーム間の不安定な特徴割り当てを生成し、自動相関を36%削減する。
論文 参考訳(メタデータ) (2026-04-05T01:08:19Z) - M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models [13.885985776728559]
M-ErasureBenchは、3つの入力モードで概念消去メソッドをベンチマークする新しいフレームワークである。
IRECEはプラグイン・アンド・プレイのモジュールで、クロスアテンションを通じてターゲットのコンセプトをローカライズし、ノイズ発生時に関連する潜伏者を摂動させる。
論文 参考訳(メタデータ) (2025-12-28T10:58:36Z) - Enhancing Dual Network Based Semi-Supervised Medical Image Segmentation with Uncertainty-Guided Pseudo-Labeling [5.1962665598872135]
本稿では,デュアルネットワークアーキテクチャに基づく新しい半教師付き3次元医用画像分割フレームワークを提案する。
具体的には,クロス・擬似とエントロピーフィルタの両方を用いたクロス・コンシステンシー・エンハンスメント・モジュールについて検討し,ノイズの多い擬似ラベルを減らす。
さらに、教師付きコントラスト学習機構を用いて、不確実なボクセル特徴を信頼性の高いクラスプロトタイプと整合させる。
論文 参考訳(メタデータ) (2025-09-16T13:40:20Z) - Erased or Dormant? Rethinking Concept Erasure Through Reversibility [6.895055915600732]
我々は、統一概念編集と消去安定拡散という2つの代表的な概念消去手法を評価する。
消去された概念は、最小限の適応の後、しばしばかなりの視覚的忠実度で再帰することを示す。
本研究は,既存の概念消去アプローチにおける限界を明らかにするものである。
論文 参考訳(メタデータ) (2025-05-22T03:26:46Z) - T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models [88.63040835652902]
テキストからビデオモデルへの攻撃はジェイルブレイク攻撃に弱いため、特別な方法で安全メカニズムをバイパスし、有害または安全でないコンテンツの生成につながる。
我々は、ジェイルブレイクの脅威からテキストからビデオモデルを守るために設計された包括的でモデルに依存しない防衛フレームワークであるT2VShieldを提案する。
本手法は,既存の防御の限界を特定するために,入力,モデル,出力の段階を体系的に解析する。
論文 参考訳(メタデータ) (2025-04-22T01:18:42Z) - Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models [76.39651111467832]
本稿では,Reliable and Efficient Concept Erasure (RECE)を提案する。
派生した埋め込みによって表現される不適切なコンテンツを緩和するために、RECEはそれらをクロスアテンション層における無害な概念と整合させる。
新たな表現埋め込みの導出と消去を反復的に行い、不適切な概念の徹底的な消去を実現する。
論文 参考訳(メタデータ) (2024-07-17T08:04:28Z) - Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models [58.74606272936636]
テキスト・ツー・イメージ(T2I)拡散モデルは、テキスト・プロンプトと密接に対応した画像を生成する際、例外的な機能を示す。
モデルは、暴力やヌードの画像を生成したり、不適切な文脈で公共の人物の無許可の肖像画を作成するなど、悪意ある目的のために利用することができる。
悪質な概念や望ましくない概念の発生を防ぐために拡散モデルを変更する概念除去法が提案されている。
論文 参考訳(メタデータ) (2024-06-21T03:58:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。