論文の概要: MAVIN: Multi-Shot Audio-Visual Generation with Narrative Control
- arxiv url: http://arxiv.org/abs/2606.29473v1
- Date: Sun, 28 Jun 2026 16:01:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.935689
- Title: MAVIN: Multi-Shot Audio-Visual Generation with Narrative Control
- Title(参考訳): MAVIN:ナラティブ制御によるマルチショットオーディオ映像生成
- Abstract要約: 既存の手法は、時間的ミスアライメント、制限された制御性、不完全なスクリプティングに悩まされている。
我々は、カスタマイズされた物語制御によるマルチショット映像生成のための最初のフレームワークであるMAVINを提案する。
MAVINは最先端のパフォーマンスを実現し、生成モデルをプロの映画製作に組み込む新たな道を開く。
- 参考スコア(独自算出の注目度): 66.04301887685004
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent generative models produce high-fidelity videos, they struggle with the complex narrative control required for coherent multi-shot audio-visual generation. Existing methods suffer from temporal misalignment, limited controllability, and incomplete scripting. In this paper, we propose MAVIN, the first framework for multi-shot audio-visual generation with customized narrative control. To resolve temporal misalignment, we propose boundary-aware attention, which leverages hierarchical captions and boundary-aware token routing to render audio-visual elements within their respective temporal boundaries. To improve the controllability for multi-subject scenarios, we propose ID-aware propagation, utilizing identity embeddings and an identity-aware mask to bind specific identities to consistent visual appearances and vocal timbres. To provide comprehensive audio-visual narratives, we present a multi-agent scripting pipeline to transform free-form user inputs into hierarchical captions. Furthermore, we construct MAVINSet, a multi-shot audio-visual dataset for robust training and evaluation. Extensive experiments demonstrate that MAVIN achieves state-of-the-art performance, opening up a new avenue for integrating generative models into professional filmmaking workflows.
- Abstract(参考訳): 最近の生成モデルは高忠実度ビデオを生成するが、コヒーレントなマルチショット映像生成に必要な複雑な物語制御に苦慮している。
既存の手法は、時間的ミスアライメント、制限された制御性、不完全なスクリプティングに悩まされている。
本稿では,カスタマイズされた物語制御によるマルチショット映像生成のための最初のフレームワークであるMAVINを提案する。
時間的ミスアライメントを解決するために,階層的なキャプションと境界対応トークンルーティングを利用して,それぞれの時間的境界内に音声視覚要素を描画する境界対応アテンションを提案する。
マルチオブジェクトシナリオの制御性を向上させるために,ID埋め込みとID認識マスクを用いて,一貫した視覚的外観と声の音色に特定のアイデンティティを結合するID認識伝搬法を提案する。
音声・視覚の包括的物語を提供するため,自由形式のユーザ入力を階層的なキャプションに変換するマルチエージェントスクリプティングパイプラインを提案する。
さらに,ロバストなトレーニングと評価のためのマルチショット音声視覚データセットMAVINSetを構築した。
大規模な実験により、MAVINは最先端のパフォーマンスを実現し、生成モデルをプロの映画製作ワークフローに統合するための新たな道を開いた。
関連論文リスト
- Vorch-Omni: Multi-Task Orchestration of Sight and Sound [51.39284238118125]
Vorch-Omniは任意の条件から任意言語への定式化に基づく音声・視覚合成のための統一されたフレームワークである。
ビデオや音声の信号を入力や生成ターゲットの条件付けとして柔軟に扱う。
テキスト・トゥ・ビデオ、テキスト・トゥ・オーディオ・ビデオ、イメージ・アンド・レファレンス・コンディショナード・ジェネレーション、時間拡張、音声駆動生成、ビデオ変換、オーディオ・ビジュアル編集を含む10以上のタスクをサポートする。
論文 参考訳(メタデータ) (2026-08-06T09:38:30Z) - Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment [20.811984469709508]
Auraは、高忠実でアイデンティティに一貫性のあるビデオ生成のための統一されたフレームワークである。
本稿では,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを紹介する。
専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
論文 参考訳(メタデータ) (2026-07-05T13:54:33Z) - Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation [93.44732526074876]
複数のアイデンティティの正確なバインディングとシームレスな融合を目的としたエンドツーエンドフレームワークを提案する。
本アーキテクチャでは,セマンティックアンコール型マルチモーダルロ (SA-MRo) を用いて,視覚的および音声的参照トークンとTS埋め込みを対応する意味記述に固定する。
実験により、Omni-Contextはデュアルモーダルなカスタマイズ生成において最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-05-17T14:56:52Z) - OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video [59.391671069156274]
本稿では,階層的なシーン・バイ・シーンのスクリプトを生成することを目的とした,新しいV2Sタスクを提案する。
長文の物語理解に適した8Bパラメータ omni-modal (audio-visual) 言語モデルであるOmniScriptを提案する。
論文 参考訳(メタデータ) (2026-04-13T07:19:27Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - PresentAgent: Multimodal Agent for Presentation Video Generation [30.274831875701217]
長文文書をナレーション付きプレゼンテーションビデオに変換するマルチモーダルエージェントであるPresentAgentを提案する。
この統合を実現するために、PresentAgentでは、インプットドキュメントのセグメント化、計画、スライドスタイルのビジュアルフレームのレンダリングを行うモジュールパイプラインを採用している。
このようなマルチモーダルなアウトプットの評価の複雑さを考慮し,ビジョンランゲージモデルを用いた統合評価フレームワークであるPresentEvalを紹介する。
論文 参考訳(メタデータ) (2025-07-05T13:24:15Z) - Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router [72.29811385678168]
MM-DiTベースのモデルであるBind-Your-Avatarを紹介した。
具体的には,音とキャラクタの対応制御に対処するために,誰が誰と何を話し合うのかを結合する,きめ細かい埋め込みルータを組み込んだ新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-24T17:50:16Z) - SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers [25.36460340267922]
SkyReels-Audioは高忠実で時間的コヒーレントなポートレート映像を合成するための統一的なフレームワークである。
我々のフレームワークは、無限長の生成と編集をサポートし、マルチモーダル入力による多様かつ制御可能な条件付けを可能にする。
論文 参考訳(メタデータ) (2025-06-01T04:27:13Z) - OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking [22.337906095079198]
我々はOmniTalkerについて述べる。OmniTalkerは、入力テキストから同期音声ビデオコンテンツを共同で生成する統合フレームワークである。
本フレームワークは,2分岐拡散変換器(DiT)アーキテクチャを採用し,一方は音声生成に,もう一方はビデオ合成に用いている。
論文 参考訳(メタデータ) (2025-04-03T09:48:13Z) - Dynamic Graph Representation Learning for Video Dialog via Multi-Modal
Shuffled Transformers [89.00926092864368]
音声・視覚シーン認識ダイアログタスクのためのセマンティクス制御型マルチモーダルシャッフルトランスフォーマー推論フレームワークを提案する。
また,フレーム内推論層を用いた動的シーングラフ表現学習パイプラインを提案する。
その結果,全ての評価指標について最先端の性能を示すことができた。
論文 参考訳(メタデータ) (2020-07-08T02:00:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。