論文の概要: Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting
- arxiv url: http://arxiv.org/abs/2604.14648v1
- Date: Thu, 16 Apr 2026 05:55:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.747312
- Title: Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting
- Title(参考訳): シーエント・トゥ・シーン:シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント・ザ・シーエント
- Authors: Inseok Jeon, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Suhwan Cho, Sangyoun Lee,
- Abstract要約: ビデオのアウトパインティングは、オリジナルのフレームの境界を超えて、ビデオの可視コンテンツを拡張することを目的としている。
本稿では,映像のアウトパインティングのための伝搬型および生成型パラダイムを統一する新しいフレームワークであるSeen-to-Sceneを提案する。
- 参考スコア(独自算出の注目度): 29.60843145809862
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video outpainting aims to expand the visible content of a video beyond the original frame boundaries while preserving spatial fidelity and temporal coherence across frames. Existing methods primarily rely on large-scale generative models, such as diffusion models. However, generationbased approaches suffer from implicit temporal modeling and limited spatial context. These limitations lead to intraframe and inter-frame inconsistencies, which become particularly pronounced in dynamic scenes and large outpainting scenarios. To overcome these challenges, we propose Seen-to-Scene, a novel framework that unifies propagationbased and generation-based paradigms for video outpainting. Specifically, Seen-to-Scene leverages flow-based propagation with a flow completion network pre-trained for video inpainting, which is fine-tuned in an end-to-end manner to bridge the domain gap and reconstruct coherent motion fields. To further improve the efficiency and reliability of propagation, we introduce a reference-guided latent propagation that effectively propagates source content across frames. Extensive experiments demonstrate that our method achieves superior temporal coherence and visual realism with efficient inference, surpassing even prior state-of-the-art methods that require input-specific adaptation.
- Abstract(参考訳): 映像の露光は、フレーム間の空間的忠実さと時間的コヒーレンスを保ちながら、元のフレーム境界を越えてビデオの可視的内容を拡張することを目的としている。
既存の手法は主に拡散モデルのような大規模な生成モデルに依存している。
しかし、生成に基づくアプローチは暗黙の時間的モデリングと限られた空間的文脈に悩まされる。
これらの制限はフレーム内およびフレーム間の不整合を招き、動的なシーンや大きなアウトパインティングシナリオで特に顕著になる。
これらの課題を克服するために,ビデオのアウトペイントのための伝搬ベースおよび生成ベースパラダイムを統一する新しいフレームワークであるSeen-to-Sceneを提案する。
特に,Seen-to-Sceneでは,ビデオインペイント用に事前訓練されたフロー完了ネットワークを用いて,フローベースの伝搬を利用して,ドメインギャップをブリッジし,コヒーレントな運動場を再構築する。
伝播の効率と信頼性をさらに向上するために,フレーム間のソースコンテンツを効果的に伝播する参照誘導潜時伝搬を導入する。
広汎な実験により,提案手法は,入力固有の適応を必要とする従来の最先端手法よりも優れた時間的コヒーレンスと視覚的リアリズムを効率的に推論できることを示した。
関連論文リスト
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence [81.82643953694485]
フレーム内対応とフレーム間対応を統合し,より堅牢な時空間制約を定式化するFRESCOを提案する。
提案手法は注意誘導を超越して特徴を明示的に最適化し,入力ビデオとの空間的整合性を実現する。
動画翻訳とテキスト誘導ビデオ編集の2つのゼロショットタスクに対してFRESCO適応を検証する。
論文 参考訳(メタデータ) (2025-12-03T15:51:11Z) - VidSplice: Towards Coherent Video Inpainting via Explicit Spaced Frame Guidance [57.57195766748601]
VidSpliceは、テンポラリな手口でペンキを塗るプロセスをガイドする新しいフレームワークである。
VidSpliceは様々な映像のインパインティングシナリオで競争力を発揮することを示す。
論文 参考訳(メタデータ) (2025-10-24T13:44:09Z) - DiffuEraser: A Diffusion Model for Video Inpainting [13.292164408616257]
安定拡散に基づく映像インペイントモデルであるDiffuEraserを導入し,より詳細な情報とコヒーレントな構造でマスクされた領域を埋める。
また,従来のモデルとDiffuEraserの両方の時間的受容領域を拡張し,ビデオ拡散モデルの時間的平滑化特性を活用して一貫性を高める。
論文 参考訳(メタデータ) (2025-01-17T08:03:02Z) - RepVideo: Rethinking Cross-Layer Representation for Video Generation [53.701548524818534]
テキスト・ビデオ拡散モデルのための拡張表現フレームワークであるRepVideoを提案する。
近隣層からの機能を蓄積してリッチな表現を形成することで、このアプローチはより安定したセマンティック情報をキャプチャする。
我々の実験は、RepVideoが正確な空間的外観を生成する能力を著しく向上するだけでなく、ビデオ生成における時間的一貫性も向上することを示した。
論文 参考訳(メタデータ) (2025-01-15T18:20:37Z) - Optical-Flow Guided Prompt Optimization for Coherent Video Generation [51.430833518070145]
我々は,光フローによる映像生成プロセスをガイドするMotionPromptというフレームワークを提案する。
ランダムフレーム対に適用した訓練された識別器の勾配を用いて,逆サンプリングステップにおける学習可能なトークン埋め込みを最適化する。
提案手法により,生成したコンテンツの忠実さを損なうことなく,自然な動きのダイナミクスを忠実に反映した視覚的コヒーレントな映像シーケンスを生成することができる。
論文 参考訳(メタデータ) (2024-11-23T12:26:52Z) - Semantically Consistent Video Inpainting with Conditional Diffusion Models [16.42354856518832]
本稿では,条件付きビデオ拡散モデルを用いた問題解決フレームワークを提案する。
我々は,コンテキストにおける重要な長距離依存関係をキャプチャする塗装特化サンプリングスキームを導入する。
不完全フレーム中の既知の画素を条件付けするための新しい手法を考案する。
論文 参考訳(メタデータ) (2024-04-30T23:49:26Z) - FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation [85.29772293776395]
フレーム間対応とフレーム間対応のFRESCOを導入し,より堅牢な時空間制約を確立する。
この拡張により、フレーム間で意味的に類似したコンテンツのより一貫性のある変換が可能になる。
提案手法では,入力ビデオと高空間時間整合性を実現するために,特徴の明示的な更新を行う。
論文 参考訳(メタデータ) (2024-03-19T17:59:18Z) - Internal Video Inpainting by Implicit Long-range Propagation [39.89676105875726]
本稿では,内部学習戦略を取り入れた映像インパインティングのための新しいフレームワークを提案する。
畳み込みニューラルネットワークを既知の領域に適合させることにより、暗黙的に実現可能であることを示す。
提案手法を別の課題に拡張する: 4Kビデオの1フレームに1つの物体マスクを与えるビデオから物体を除去する学習。
論文 参考訳(メタデータ) (2021-08-04T08:56:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。