論文の概要: CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
- arxiv url: http://arxiv.org/abs/2607.26529v1
- Date: Wed, 29 Jul 2026 06:48:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.562886
- Title: CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
- Title(参考訳): CineWeaver:シネマティックストーリーテリングのためのトレーニング不要のレファレンス調整可能なマルチショットビデオ生成
- Authors: Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li,
- Abstract要約: 我々は、参照制御可能なマルチショット長ビデオ生成を実現するために、CineWeaverという統合フレームワークを提案する。
実験により、CineWeaverは、連続したアイデンティティ、安定したグローバルな外観、鮮明なショット遷移を持つ長時間の高品質なシネマティックビデオを生成することを示した。
- 参考スコア(独自算出の注目度): 111.28808966759613
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cinematic video generation is challenging for text-to-video diffusion models due to concurrent requirements on multi-shot generation, fine-grained controllability over characters and scenes, and long-form generation across extended temporal horizons. Existing methods rely on customization and retraining to separately address specific requirements, and cannot simultaneously fulfill all the requirements with a unified framework. In this paper, we shed light on the training-free paradigm with the key insight that the difficulty of multi-shot generation arises from a structural bias toward temporal continuity in pretrained video diffusion models, and consequently, propose a unified framework named CineWeaver to achieve reference-controllable multi-shot long-video generation without retraining. We manipulate positional encoding and attention patterns to break temporal continuity during inference to enable clear shot transitions using pretrained video diffusion models. Furthermore, we extend the proposed framework with a shot-routed reference conditioning mechanism for per-shot fine-grained controllability, and develop an anchor memory mechanism to allow long-form generation with consistent global appearance cues. To our best knowledge, CineWeaver is the first unified framework to simultaneously enable \textbf{long-form}, \textbf{reference-controllable}, and \textbf{multi-shot} video generation in a training-free fashion. Experimental results demonstrate that CineWeaver produces high-quality cinematic videos of long durations with consistent identities, stable global appearance, and clear shot transitions. The project page is available at: https://cineweaver.github.io.
- Abstract(参考訳): マルチショット生成の同時要求、キャラクタやシーンのきめ細かい制御性、時間的地平線を越えてのロングフォーム生成などにより、テキスト間拡散モデルでは、シネマティックビデオ生成は困難である。
既存のメソッドは、特定の要求に個別に対処するためにカスタマイズと再訓練に依存しており、統一されたフレームワークですべての要求を同時に満たすことはできない。
本稿では,事前学習したビデオ拡散モデルにおける時間的連続性に対する構造バイアスから,マルチショット生成の難しさが生じるという重要な洞察を得て,トレーニング不要なパラダイムに光を当て,CineWeaverという統合フレームワークを提案して,参照制御可能なマルチショット長ビデオ生成を実現する。
我々は、予め訓練されたビデオ拡散モデルを用いて、位置符号化と注意パターンを操作して、推論中の時間的連続性を破り、鮮明なショット遷移を可能にする。
さらに,一貫したグローバルな外観条件で長文生成が可能なアンカーメモリ機構を開発した。
我々の知る限り、CineWeaverは、トレーニング不要な方法で、 \textbf{long-form}、 \textbf{reference-controllable}、 \textbf{multi-shot}ビデオ生成を同時に有効化する最初の統一フレームワークです。
実験により、CineWeaverは、連続したアイデンティティ、安定したグローバルな外観、鮮明なショット遷移を持つ長時間の高品質なシネマティックビデオを生成することを示した。
プロジェクトページは、https://cineweaver.github.io.comで公開されている。
関連論文リスト
- Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration [61.98029663481308]
Soap2SoapはDualBridgeメカニズムを通じて長期の視覚的一貫性を強制するマルチエージェントフレームワークである。
クローズドループ検証エージェントは、識別、安定性、アライメントを監査し、選択的再生を誘導する。
論文 参考訳(メタデータ) (2026-05-17T12:38:21Z) - Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation [40.694968116482315]
Inference-time, plug-and-play法であるPrompt Relayを提案する。
Prompt Relayは、各時間セグメントが割り当てられたプロンプトにのみ参加するように、クロスアテンションメカニズムにペナルティを導入する。
論文 参考訳(メタデータ) (2026-04-11T04:59:06Z) - FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion [46.67733869872552]
textbfFilmWeaverは任意の長さで一貫したマルチショットビデオを生成するように設計されたフレームワークである。
私たちの重要な洞察は、問題をショット間の一貫性とショット内のコヒーレンスに分離することです。
本手法は, 整合性と美的品質の両面において, 既存の手法を超越した手法である。
論文 参考訳(メタデータ) (2025-12-12T04:34:53Z) - MultiShotMaster: A Controllable Multi-Shot Video Generation Framework [67.38203939500157]
現在の生成技術はシングルショットクリップで優れているが、物語的なマルチショットビデオを作成するのに苦労している。
高度に制御可能なマルチショットビデオ生成のためのフレームワークであるMultiShotMasterを提案する。
論文 参考訳(メタデータ) (2025-12-02T18:59:48Z) - EchoShot: Multi-Shot Portrait Video Generation [37.77879735014084]
EchoShotは、基礎的なビデオ拡散モデルに基づいて構築されたポートレートカスタマイズのためのネイティブなマルチショットフレームワークである。
マルチショットシナリオにおけるモデルトレーニングを容易にするため,大規模かつ高忠実な人間中心のビデオデータセットであるPortraitGalaを構築した。
適用性をさらに向上するため、EchoShotを拡張して、参照画像に基づくパーソナライズされたマルチショット生成と、無限ショットカウントによる長いビデオ合成を行う。
論文 参考訳(メタデータ) (2025-06-16T11:00:16Z) - Long Context Tuning for Video Generation [63.060794860098795]
Long Context Tuning (LCT) は、訓練済みのシングルショットビデオ拡散モデルのコンテキストウィンドウを拡張する訓練パラダイムである。
本手法は、シーン内のすべてのショットを包含するために、個々のショットからフルアテンションメカニズムを拡張する。
実験では、コヒーレントなマルチショットシーンを実証し、合成生成やインタラクティブショット拡張など、新たな能力を示す。
論文 参考訳(メタデータ) (2025-03-13T17:40:07Z) - Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion [116.40704026922671]
事前訓練されたテキスト・ツー・ビデオモデルに基づいて構築されたファースト・イン・ファースト・アウト(FIFO)ビデオ拡散は,近年,チューニング不要な長ビデオ生成に有効なアプローチとして浮上している。
We propose Ouroboros-Diffusion, a novel video denoising framework designed to enhance structure and content (ject) consistency。
論文 参考訳(メタデータ) (2025-01-15T18:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。