論文の概要: ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
- arxiv url: http://arxiv.org/abs/2608.04956v1
- Date: Wed, 05 Aug 2026 15:27:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.977571
- Title: ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
- Title(参考訳): ContextMaster: 固定予算スパースコンテキストルーティングによるインタラクティブなマルチショットビデオ作成
- Authors: Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo, Min Wei, Yiran Zhu, Qiulin Wang, Yulong Xu, Xintao Wang, Pengfei Wan, Qi Fan, Xiangwang Hou,
- Abstract要約: ビデオモデルは、単一のモデル内で生成、参照条件付け、編集をサポートするようになった。
我々はこの設定をインタラクティブなマルチショットビデオ作成(IMVC)として定式化する。
これらの操作にロールを意識したコンテキスト表現を備えた統合モデルであるContextMasterを紹介します。
- 参考スコア(独自算出の注目度): 42.25675968821303
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent video models increasingly support generation, reference conditioning, and editing within a single model, yet typically expose them as separate operations over fixed inputs. Practical creation unfolds across multiple shots, requiring one model to generate from text, follow a reference, or edit source footage while maintaining shared history. We formalize this setting as interactive multi-shot video creation (IMVC) and introduce ContextMaster, a unified model with a role-aware context representation for these operations. An interactive model must retain access to an expanding history without allowing the context read cost at each denoising step to grow. ContextMaster combines reusable clean context states with fixed budget sparse context routing and uses ConstraintSink to keep task constraints visible. To address the dual challenges of sparse context access and inference with few denoising steps, we propose a two-stage privileged context distillation framework, which transfers full context behavior from a dense teacher through consistency distillation and then refines deployment rollouts with distribution matching. Experiments on the three primitive tasks demonstrate improved task fulfillment and consistency across shots over specialized baselines. User studies further validate flexibly composed workflows, while the model reaches 16 FPS on a single GPU.
- Abstract(参考訳): 最近のビデオモデルは、単一のモデル内で生成、参照条件付け、編集をサポートするようになったが、通常は固定された入力に対して別々の操作として公開する。
実際の作成は、複数のショットにまたがって展開され、1つのモデルがテキストから生成し、参照をフォローし、ソースの映像を編集し、共有履歴を維持する必要がある。
我々は、この設定をインタラクティブなマルチショットビデオ生成(IMVC)として形式化し、これらの操作にロールを意識したコンテキスト表現を備えた統合モデルであるContextMasterを導入する。
インタラクティブなモデルは、拡大する履歴へのアクセスを維持しなければならない。
ContextMasterは再利用可能なクリーンなコンテキスト状態と固定された予算のスパースなコンテキストルーティングを組み合わせて、ConstraintSinkを使用してタスクの制約を可視化する。
そこで本研究では,2段階の特権的文脈蒸留フレームワークを提案する。このフレームワークは,高密度教師から整合性蒸留を通じてコンテキストの完全な振る舞いを伝達し,分散マッチングによる展開ロールアウトを洗練させる。
3つのプリミティブなタスクの実験では、特定のベースライン上でのショット間のタスク充足と一貫性の改善が示されている。
ユーザスタディはさらに、フレキシブルに構成されたワークフローを検証する一方で、モデルは1つのGPU上で16FPSに達する。
関連論文リスト
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory [47.073128448877775]
我々は,一貫した,スケーラブルな物語生成のためのグローバルかつコンパクトなクロスショットコンテキストモデリングを実現するOneStoryを提案する。
OneStoryは、MSVを次のショット生成タスクとして再構成し、トレーニング済みのイメージ・ツー・ビデオ(I2V)モデルを活用しながら、自己回帰的なショット合成を可能にする。
OneStoryは、テキストと画像条件の両方の設定において、多種多様な複雑なシーンにまたがる最先端の物語コヒーレンスを実現する。
論文 参考訳(メタデータ) (2025-12-08T18:32:24Z) - BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration [56.98981194478512]
本稿では,幅広いテーマ・ツー・ビデオシナリオを扱う統一フレームワークを提案する。
MLLM-DiTフレームワークは,事前訓練されたマルチモーダルな大規模言語モデルで,基底エンティティに対して深い相互モーダル推論を行う。
OpenS2Vベンチマークの実験により、本手法は、生成ビデオにおける主観的整合性、自然性、テキスト関連性において優れた性能を実現することを示した。
論文 参考訳(メタデータ) (2025-10-01T02:41:11Z) - Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling [81.69474860607542]
画像とテキストの両方にインスタンスレベルのアノテーションを追加する大規模データセットであるOpenstory++を提示する。
また、長いマルチモーダルコンテキストが提供される際に、画像生成タスクを評価するための先駆的なベンチマークフレームワークであるCohere-Benchについても紹介する。
論文 参考訳(メタデータ) (2024-08-07T11:20:37Z) - Contextualized Diffusion Models for Text-Guided Image and Video Generation [67.69171154637172]
条件拡散モデルは高忠実度テキスト誘導視覚生成および編集において優れた性能を示した。
本研究では,テキスト条件と視覚的サンプル間の相互作用とアライメントを包含するクロスモーダルコンテキストを組み込むことにより,コンテキスト拡散モデル(ContextDiff)を提案する。
理論的導出を伴うDDPMとDDIMの両方にモデルを一般化し、テキスト・ツー・イメージ生成とテキスト・ツー・ビデオ編集という2つの課題を伴う評価において、モデルの有効性を実証する。
論文 参考訳(メタデータ) (2024-02-26T15:01:16Z) - DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot
Text-to-Video Generation [37.25815760042241]
本稿では,テキスト・ツー・ビデオ(T2V)ビデオを生成するための新しいフレームワークであるDirecT2Vを紹介する。
拡散モデルに新しい値マッピング法とデュアルソフトマックスフィルタリングを適用し、追加のトレーニングを必要としない。
実験により,視覚的コヒーレントかつストーリーフルなビデオ制作におけるフレームワークの有効性が検証された。
論文 参考訳(メタデータ) (2023-05-23T17:57:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。