論文の概要: MDN-Control: Mask-Depth-Noise Guided Region Control for Multi-Subject Video Editing
- arxiv url: http://arxiv.org/abs/2609.16475v1
- Date: Tue, 15 Sep 2026 00:58:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.287721
- Title: MDN-Control: Mask-Depth-Noise Guided Region Control for Multi-Subject Video Editing
- Title(参考訳): MDN-Control:マルチオブジェクトビデオ編集のためのマスク奥行き誘導領域制御
- Abstract要約: マルチサブジェクトビデオ編集は、非ターゲットコンテンツを保持しながら指定対象を変更する。
既存のアプローチはマスクに依存しており、重複する対象を区別したり、一貫した生成を保証するのに苦労している。
MDN-Controlは,目標位置,オクルージョン形状,外観を協調的に制御するフリートレーニングフレームワークである。
MSVBenchの実験では、MDN-Controlは、競争力のあるテキストアライメントと時間的一貫性を維持しながら、最低のCM-Errと最高Q-Editを達成した。
- 参考スコア(独自算出の注目度): 19.25272895567409
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi subject video editing modifies designated subjects while preserving non target content, but faces cross subject attribute leakage, and occlusion ambiguity. Existing approaches rely on masks and struggle to distinguish overlapping subjects or ensure consistent generation. To address these limitations, we propose MDN-Control, a training free framework jointly controlling target localization, occlusion geometry, and appearance initialization. Specifically, mask-guided localization provides consistent target localization, while depth-aware occlusion control resolves ambiguous boundaries between overlapping subjects. We further introduce noise latent prompting, which retrieves Gaussian initializations from a noise library for prompt relevant priors. Experiments on MSVBench show that MDN-Control achieves the lowest CM-Err and the highest Q-Edit, while maintaining competitive text alignment and temporal consistency, demonstrating the effectiveness of combining spatial, geometric, and latent priors for multi subject video editing.
- Abstract(参考訳): マルチサブジェクトビデオ編集は、対象でないコンテンツを保持しながら指定対象を変更するが、クロスサブジェクト属性の漏洩とオクルージョンの曖昧さに直面する。
既存のアプローチはマスクに依存しており、重複する対象を区別したり、一貫した生成を保証するのに苦労している。
これらの制約に対処するため,MDN-Controlは,目標位置,閉塞形状,外観初期化を協調的に制御するフリーフレームワークである。
具体的には、マスク誘導の局所化は、一貫した目標位置付けを提供するが、奥行き認識の閉塞制御は、重なり合う対象間のあいまいな境界を解消する。
さらにノイズ潜時プロンプトを導入し,ノイズライブラリからガウス初期化を抽出し,関連する事前処理を行う。
MSVBenchの実験では、MDN-Controlは、競争力のあるテキストアライメントと時間的一貫性を維持しつつ、最小のCM-Errと最高Q-Editを実現し、空間的、幾何学的、潜時的な事前編集の有効性を実証している。
関連論文リスト
- Drag within Prior Distribution: Text-Conditioned Point-Based Image Editing within Distribution Constraints [7.503616785263929]
拡散に基づく点編集は、雑音潜時摂動の多様体に局所的な摂動を適用することで、画像の意味や細部を操作できる。
伝統的な点ベースの編集は、運動軌跡を定義するためにハンドルとターゲットポイントのペアに依存している。
中間編集ステップの評価とガイドを行うCLIPベースのモデルを導入し、生成した結果がセマンティックに一致し続けることを保証する。
論文 参考訳(メタデータ) (2026-05-13T11:05:31Z) - CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing [17.372230178356357]
本稿では,モデル計算を特定の編集能力と整合させる条件認識専門家(CARE-Edit)を提案する。
中心となるのは、4人の専門専門家に符号化された拡散トークンを割り当てる軽量の潜伏型ルータである。
実験は、文脈編集タスクにおけるCARE-Editの強いパフォーマンスを検証する。
論文 参考訳(メタデータ) (2026-03-09T16:40:47Z) - AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization [55.06425570300248]
我々はレイアウト誘導型マルチオブジェクトカスタマイズのためのトレーニングフリーフレームワークであるAnyMSを紹介する。
AnyMSはテキストプロンプト、主題画像、レイアウト制約という3つの入力条件を利用する。
AnyMSは最先端のパフォーマンスを達成し、複雑な構成をサポートし、より多くの課題にスケールする。
論文 参考訳(メタデータ) (2025-12-29T15:26:25Z) - LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization [49.945233586949286]
LoVoRAは、マスクのないビデオオブジェクトの削除と追加のための新しいフレームワークである。
提案手法は,画像間翻訳,光フローベースのマスク伝搬,ビデオペインティングを統合し,時間的に一貫した編集を可能にする。
LoVoRAは、推論中に外部制御信号を必要とせずに、エンドツーエンドのビデオ編集を実現する。
論文 参考訳(メタデータ) (2025-12-02T17:01:07Z) - ReMix: Towards a Unified View of Consistent Character Generation and Editing [22.04681457337335]
ReMixは、文字一貫性の生成と編集のための統一されたフレームワークである。
ReMixモジュールとIP-ControlNetという2つのコアコンポーネントで構成されている。
ReMixはパーソナライズされた生成、画像編集、スタイル転送、マルチ条件合成など、幅広いタスクをサポートしている。
論文 参考訳(メタデータ) (2025-10-11T10:31:56Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models [10.798205956644317]
我々は,MDE-Edit と呼ばれる複雑な多目的シーンにおいて,高精度な局所化画像操作を可能にする,トレーニング不要な推論ステージ最適化手法を提案する。
大規模な実験により、MDE-Editは、編集精度と視覚的品質において最先端の手法よりも優れており、複雑な多目的画像操作タスクに対する堅牢なソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-08T10:01:14Z) - MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation [55.101611012677616]
拡散ベースのテキスト・トゥ・イメージ(T2I)モデルは,グローバルビデオ編集タスクにおいて顕著な結果を示した。
我々は、オープンドメインビデオ編集のための事前訓練されたT2Iモデル上に構築された、チューニング不要なMAEフレームワークであるMAKIMAを紹介する。
論文 参考訳(メタデータ) (2024-12-28T02:36:51Z) - Re-Attentional Controllable Video Diffusion Editing [48.052781838711994]
本稿では,Re-Attentional Controllable Video Diffusion Editing (ReAtCo)法を提案する。
対象物体の空間配置と編集されたテキストプロンプトを無訓練で整合させるために,再注意拡散(RAD)を提案する。
RADは、編集されたテキストプロンプトとデノナイジング段階のターゲットビデオとの間の相互注意活性化反応を再焦点化し、空間的に位置整列し、意味的に高忠実に操作されたビデオを生成する。
論文 参考訳(メタデータ) (2024-12-16T12:32:21Z) - Addressing Text Embedding Leakage in Diffusion-based Image Editing [33.1686050396517]
本稿では属性リークに対処するフレームワークであるAttribute-Leakage-free Editing (ALE)を紹介する。
ALEは、オブジェクト制限埋め込み(ORE)とテキスト埋め込みのアンタングル、空間的に正確に注意を向けるRGB-CAM(Regional-Guided Blending for Cross-Attention Masking)、非編集コンテンツを保存するためにバックグラウンドブレンディング(Backside Blending)を組み合わせる。
論文 参考訳(メタデータ) (2024-12-06T02:10:07Z) - When ControlNet Meets Inexplicit Masks: A Case Study of ControlNet on its Contour-following Ability [93.15085958220024]
ControlNetは、ユーザーが提供するマスクの正確な輪郭と密に一致したコンテンツを作成するのに長けている。
これらのマスクがノイズを含む場合、非専門家で頻繁に発生するため、出力には不要なアーティファクトが含まれる。
筆者らはまず, 深部分析により, 種々の劣化レベルを有する非説明マスクの影響を抑える上で重要な役割について述べる。
劣化推定器と形状優先変調ブロックからなる高度な形状認識制御ネットを考案した。
論文 参考訳(メタデータ) (2024-03-01T11:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。