論文の概要: Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment
- arxiv url: http://arxiv.org/abs/2607.04311v2
- Date: Tue, 07 Jul 2026 14:30:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.218284
- Title: Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment
- Title(参考訳): オーラ:VLM周囲のセマンティックアライメントによる連続多目的映像生成
- Abstract要約: Auraは、高忠実でアイデンティティに一貫性のあるビデオ生成のための統一されたフレームワークである。
本稿では,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを紹介する。
専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
- 参考スコア(独自算出の注目度): 20.811984469709508
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subject-driven and multi-element video generation are central to controllable video synthesis, but existing methods still struggle to preserve identity consistency and model complex relationships among multiple subjects. In this paper, we propose Aura, a unified framework for high-fidelity and identity-consistent video generation. To better capture scene dynamics and subject interactions, we introduce AI director-level captions that provide dense and structured descriptions of video content. We further leverage a vision-language model (VLM) with learnable queries to extract multimodal semantic features from textual and visual references, covering both global semantics and fine-grained visual cues. To bridge the representational gap between the VLM and the Diffusion Transformer (DiT), we design a two-stage alignment strategy that progressively maps VLM features into the DiT feature space. For visual conditioning, we adopt token concatenation to inject reference information directly into the generation process. To distinguish heterogeneous subject types and reduce common copy-paste artifacts, we develop a subject-aware RoPE-Shift mechanism. To further differentiate reference images of different categories, we introduce subject-aware learnable tokens. In addition, we introduce Memory Tokens to balance the training signal across examples with different numbers of reference subjects. During inference, Progressive-APG (Adaptive Prompt Guidance) further alleviates oversaturation and improves semantic alignment with user prompts. Finally, we build a high-quality video-subject image dataset through a dedicated data construction pipeline. Extensive experiments show that our method achieves state-of-the-art performance on both single-subject generation and more challenging multi-element scenarios.
- Abstract(参考訳): 被写体駆動および多要素ビデオ生成は、制御可能なビデオ合成の中心であるが、既存の方法は、複数の被写体間のアイデンティティの整合性と複雑な関係のモデル化に苦慮している。
本稿では,高精細・高精細・高精細な映像生成のための統合フレームワークであるAuraを提案する。
シーンのダイナミクスや主題のインタラクションをよりよく捉えるために,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを導入する。
さらに、学習可能なクエリで視覚言語モデル(VLM)を利用して、テキストやビジュアル参照から多モーダルなセマンティックな特徴を抽出し、グローバルなセマンティクスときめ細かな視覚的手がかりの両方を網羅する。
本稿では,VLM と Diffusion Transformer (DiT) の表現ギャップを埋めるために,VLM の機能を段階的に DiT 特徴空間にマッピングする2段階アライメント戦略を設計する。
視覚条件付けにはトークン結合を用いて参照情報を生成プロセスに直接注入する。
異質な被写体を識別し, 一般的なコピー・ペースト・アーティファクトを減らすため, 対象を意識した RoPE-Shift 機構を開発した。
異なるカテゴリの参照画像をさらに区別するために、主観的学習可能なトークンを導入する。
さらに,サンプル間のトレーニング信号と参照対象数とのバランスをとるために,メモリトークンを導入する。
推論中、Progressive-APG(Adaptive Prompt Guidance)はさらに過飽和を緩和し、ユーザプロンプトとのセマンティックアライメントを改善する。
最後に、専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
大規模な実験により,本手法は単一オブジェクト生成とより困難な多要素シナリオの両方において,最先端の性能を実現することが示された。
関連論文リスト
- HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement [49.760248537839715]
人間中心型ビデオパーソナライゼーション(HOCVP)は、主観駆動型ビデオ生成における中核的な課題である。
我々は,オブジェクト間の入力設定とオブジェクト内入力設定の両方を統一的に扱うHOCVPフレームワークHOMIEを提案する。
本稿では,MLLMに基づく意味的特徴とVAEトークンとの整合性を向上するために,自己注意の中でグローバルなマルチモーダルガイダンスを導入する。
論文 参考訳(メタデータ) (2026-07-20T17:51:35Z) - Multimodal Large Language Models for Multi-Subject In-Context Image Generation [56.20395856287325]
音楽は、textbfMUlti-textbfSubject textbfIn-textbfContextイメージ生成用に特別に設計された最初のMLLMである。
我々は,視覚連鎖機構による多目的意味関係の理解を深める。
訓練中に複雑な被写体画像を取り込むことで,連鎖推論におけるモデルの能力を向上させる。
論文 参考訳(メタデータ) (2026-04-08T15:37:42Z) - ID-Composer: Multi-Subject Video Synthesis with Hierarchical Identity Preservation [48.59900036213667]
大規模なデータセットで事前訓練されたビデオ生成モデルは高品質なビデオを生成することができるが、テキストや単一の画像に条件付けされることも多い。
本稿では,テキストプロンプトと参照画像から多目的映像を生成する新しいフレームワークであるID-Composerを紹介する。
論文 参考訳(メタデータ) (2025-11-01T11:29:14Z) - BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration [56.98981194478512]
本稿では,幅広いテーマ・ツー・ビデオシナリオを扱う統一フレームワークを提案する。
MLLM-DiTフレームワークは,事前訓練されたマルチモーダルな大規模言語モデルで,基底エンティティに対して深い相互モーダル推論を行う。
OpenS2Vベンチマークの実験により、本手法は、生成ビデオにおける主観的整合性、自然性、テキスト関連性において優れた性能を実現することを示した。
論文 参考訳(メタデータ) (2025-10-01T02:41:11Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement [26.89021788485701]
PolyVividは、フレキシブルでアイデンティティ一貫性のある生成を可能にする、多目的ビデオカスタマイズフレームワークである。
実験では、PolyVividはアイデンティティの忠実さ、ビデオリアリズム、被写体アライメントにおいて優れたパフォーマンスを達成し、既存のオープンソースおよび商用ベースラインを上回っている。
論文 参考訳(メタデータ) (2025-06-09T15:11:09Z) - MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement [47.064467920954776]
我々は、任意の参照ビデオ生成のための統一的で効果的なフレームワークであるMAGREFを紹介する。
提案手法は,マスキング誘導と主観的ゆがみ機構を取り入れたものである。
包括的なベンチマークの実験は、MAGREFが既存の最先端のアプローチを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-29T17:58:15Z) - CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance [34.345125922868]
MLLM(Multimodal Large Language Model)を利用したコヒーレントなマルチオブジェクトビデオ生成フレームワークCINEMAを提案する。
提案手法では,対象画像とテキストエンティティとの明示的な対応の必要性を排除し,曖昧さを軽減し,アノテーションの労力を削減する。
当社のフレームワークはさまざまな主題に適応でき、パーソナライズされたコンテンツ作成の柔軟性が向上する。
論文 参考訳(メタデータ) (2025-03-13T14:07:58Z) - MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing [90.06041718086317]
我々は、高忠実度ビデオ生成と編集の両方のタスクに対して、MagDiffと呼ばれる統合多重配位拡散を提案する。
提案したMagDiffは、主観駆動アライメント、適応プロンプトアライメント、高忠実アライメントを含む3種類のアライメントを導入している。
論文 参考訳(メタデータ) (2023-11-29T03:36:07Z) - RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation [53.4319652364256]
本稿では,ビデオオブジェクトのセグメンテーションを参照するためのSAMの可能性を探るRefSAMモデルを提案する。
提案手法は,Cross-RValModalを用いることで,モダリティ学習を向上させるためにオリジナルのSAMモデルに適応する。
我々は、言語と視覚の特徴を効果的に調整し、融合させるために、パラメータ効率のチューニング戦略を採用している。
論文 参考訳(メタデータ) (2023-07-03T13:21:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。