論文の概要: Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
- arxiv url: http://arxiv.org/abs/2607.25802v1
- Date: Tue, 28 Jul 2026 14:48:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.873938
- Title: Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
- Title(参考訳): ビデオオブジェクト挿入と層分解のための明示的層モデリング
- Abstract要約: フォアグラウンドレイヤには、オブジェクトの外観と関連する視覚効果の両方が含まれている。
この明示的な監督により、モデルは暗黙的に推論するのではなく、レイヤー化されたビデオ表現を直接学習することができる。
DBL-Diffusionは、RGBコンポジットとRGBA前景層を共同でモデル化する二重分岐拡散フレームワークである。
- 参考スコア(独自算出の注目度): 18.022394461124
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Most video editing systems still lack explicit layered video representations, limiting their ability to perform realistic compositing, object reuse, and consistent manipulation. This limitation is especially pronounced in video object insertion and video layer decomposition, where existing methods rely on implicit inference or per-scene optimization due to the absence of explicit foreground-layer supervision. We introduce TriLayer, a large-scale triplet video dataset containing aligned composite, background, and foreground videos, where the foreground layers include both object appearance and associated visual effects. This explicit supervision enables models to learn layered video representations directly rather than inferring them implicitly. Building on this dataset, we propose DBL-Diffusion, a dual-branch diffusion framework that jointly models RGB composites and RGBA foreground layers through shared denoising and cross-branch interaction. We instantiate the framework in two tasks: DBL-Insert for layered object insertion, which generates explicit RGBA layers for realistic compositing and flexible post-editing, and DBL-Decompose for video layer decomposition, which recovers foreground and background layers using triplet supervision. Experiments demonstrate that explicit layer modeling substantially improves both insertion fidelity and decomposition quality.
- Abstract(参考訳): ほとんどのビデオ編集システムでは、明らかに階層化されたビデオ表現が欠けており、現実的な合成、オブジェクトの再利用、一貫性のある操作を行う能力が制限されている。
この制限は、特にビデオオブジェクトの挿入やビデオ層分解において顕著であり、既存の手法は暗黙の推論や、露骨なフォアグラウンド・レイヤの監督がないため、シーンごとの最適化に依存している。
我々はTriLayerを紹介した。TriLayerは、オブジェクトの外観と関連する視覚効果の両方を含む合成、背景、および前景のビデオを含む大規模な3重ビデオデータセットである。
この明示的な監督により、モデルは暗黙的に推論するのではなく、レイヤー化されたビデオ表現を直接学習することができる。
このデータセットに基づいてDBL-Diffusionを提案する。DBL-DiffusionはRGBコンポジットとRGBAフォアグラウンド層を共用する二重分岐拡散フレームワークである。
DBL-Insert for layered object insert, which generated explicit RGBA layer for real compositing and flexible post-editing, and DBL-Decompose for video layer decomposition, which recovers preeground and background layer using triplet supervision。
実験により、明示的な層モデリングは挿入忠実度と分解品質の両方を著しく改善することが示された。
関連論文リスト
- Referring Layer Decomposition [25.128453386102887]
単一のRGB画像から完全なRGBA層を予測するRLD(Referring Layer Decomposition)タスクを導入する。
コアとなるRefLadeは、スケーラブルなデータエンジンによって生成される1.11Mイメージ層プロンプトトリプレットからなる大規模なデータセットです。
本稿では,プロンプト条件付き層分解のためのシンプルなベースラインRefLayerを提案し,高い視覚的忠実度とセマンティックアライメントを実現する。
論文 参考訳(メタデータ) (2026-02-22T22:05:17Z) - Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition [73.43121650616804]
単一のRGB画像を複数の意味的不整合RGBA層に分解するエンドツーエンド拡散モデルである textbfQwen-Image-Layered を提案する。
本手法は,分解品質の既存手法を大幅に上回り,一貫した画像編集のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-12-17T17:12:42Z) - From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition [16.7393689710179]
レイヤ化された表現により、要素の独立した編集が可能になり、コンテンツ作成の柔軟性が向上する。
我々は, 層分解と in/outpainting タスクの強い関係を観察し, 軽量微細化による層分解に対する拡散型インペインティングモデルの適用を提案する。
潜伏空間の細部をより詳細に保存するために,線形注意複雑性を持つ新しいマルチモーダルコンテキスト融合モジュールを導入する。
論文 参考訳(メタデータ) (2025-11-26T02:50:07Z) - BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing [39.18857645517109]
我々は、オブジェクト、カメラ、背景を再コンパイルすることで、新しいシーンを合成する生成的視覚合成フレームワークであるBlenderFusionを紹介する。
i)視覚入力を編集可能な3Dエンティティ(レイヤ)に分割・変換し、(ii)3Dグラウンド制御(編集)でブレンダーで編集し、(iii)生成合成装置(合成)を用いてコヒーレントなシーンに融合する。
論文 参考訳(メタデータ) (2025-06-20T19:38:34Z) - DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers [85.1185656296496]
本稿では,DiffDecomposeについて述べる。DiffDecomposeは拡散トランスフォーマーをベースとしたフレームワークで,入力画像に条件付き可能な層分解を後部から学習する。
コードとデータセットは、論文の受理時に提供される。
論文 参考訳(メタデータ) (2025-05-24T16:08:04Z) - BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations [82.94002870060045]
既存のビデオ生成モデルは、複雑なテキストプロンプトに従い、複数のオブジェクトを合成するのに苦労する。
我々は,BlobGEN-Vidというブロブグラウンドビデオ拡散モデルを開発し,ユーザがオブジェクトの動きを制御し,細かいオブジェクトの外観を制御できるようにする。
U-NetとDiTをベースとした動画拡散モデルに基づいてBlobGEN-Vidを構築する。
論文 参考訳(メタデータ) (2025-01-13T19:17:06Z) - Video Decomposition Prior: A Methodology to Decompose Videos into Layers [74.36790196133505]
本稿では,プロのビデオ編集の実践からインスピレーションを得た,VDP以前の新しいビデオ分解手法を提案する。
VDPフレームワークは、ビデオシーケンスを複数のRGBレイヤと関連する不透明度レベルに分解する。
ビデオオブジェクトのセグメンテーション、デハジング、リライティングといったタスクに対処する。
論文 参考訳(メタデータ) (2024-12-06T10:35:45Z) - InVi: Object Insertion In Videos Using Off-the-Shelf Diffusion Models [46.587906540660455]
InViは、ビデオ内のオブジェクトを挿入または置換するためのアプローチで、オフザシェルフ、テキスト・ツー・イメージの潜伏拡散モデルを用いて導入する。
InViは、フレーム間の一貫したブレンディングとコヒーレンスで現実的なオブジェクト挿入を実現し、既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-07-15T17:55:09Z) - WALDO: Future Video Synthesis using Object Layer Decomposition and
Parametric Flow Prediction [82.79642869586587]
WALDOは、過去のビデオフレームを予測するための新しいアプローチである。
個々の画像は、オブジェクトマスクと小さなコントロールポイントのセットを組み合わせた複数の層に分解される。
レイヤ構造は、各ビデオ内のすべてのフレーム間で共有され、フレーム間の密接な接続を構築する。
論文 参考訳(メタデータ) (2022-11-25T18:59:46Z) - Unsupervised Video Interpolation by Learning Multilayered 2.5D Motion
Fields [75.81417944207806]
本稿では,ビデオフレーム学習において,単一のビデオのみを必要とする自己教師型アプローチを提案する。
時間変化運動場上に定義された通常の微分可能方程式(ODE)を解くことにより,映像の動きをパラメータ化する。
この暗黙的な神経表現は、ビデオを時空間連続体として学習し、任意の時間分解能でフレーム時間連続体を可能にする。
論文 参考訳(メタデータ) (2022-04-21T06:17:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。