論文の概要: Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization
- arxiv url: http://arxiv.org/abs/2606.26668v1
- Date: Thu, 25 Jun 2026 07:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.189003
- Title: Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization
- Title(参考訳): Disco-LoRA:マルチコンセプトビデオカスタマイズのためのコンテンツ、スタイル、動作のアンタングル構成
- Authors: Xuancheng Xu, Gengyun Jia, Bing-Kun Bao,
- Abstract要約: テキスト・トゥ・ビデオ(T2V)モデルに基づくビデオのカスタマイズは、参照データから特定の特徴を学習し、制御可能なビデオを生成することを目的としている。
我々は、コンテンツ、スタイル、動きの協調制御を必要とするマルチコンセプトビデオカスタマイズのタスクを体系的に定義する。
本稿では,異なる概念を2段階に分割し,柔軟に再結合することで,この問題に対処する統合フレームワークであるDisco-LoRAを提案する。
- 参考スコア(独自算出の注目度): 24.028888270203215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video customization based on Text-to-Video (T2V) models aims to learn specific features from reference data to generate controllable videos. While significant strides have been made in image stylization and video motion customization, simultaneously controlling multiple concepts, such as content, style, and motion, remains a major challenge. In this work, we systematically define the task of multi-concept video customization, which requires the joint control of content, style, and motion. To facilitate research in this area, we construct a comprehensive benchmark and propose Disco-LoRA, a unified framework designed to tackle this problem by disentangling and flexibly recombining different concepts in two stages: (1) We decompose the objective into two sub-tasks: Content-Style and Content-Motion. Each sub-task is addressed using our Iterative Dual-LoRA Disentanglement Framework, which effectively disentangles distinct concepts within the data. (2) We identify layer-wise weight trends as crucial for LoRA identity, while weight magnitudes dictate composability. To harmonize these scales, we propose a Z-score-based statistical regularization that aligns weight distributions, preserving layer-wise trends while minimizing interference between different LoRAs. Extensive experiments show that Disco-LoRA excels in multi-concept video customization, effectively preserving appearance, style, and motion for controllable text-to-video generation.
- Abstract(参考訳): テキスト・トゥ・ビデオ(T2V)モデルに基づくビデオのカスタマイズは、参照データから特定の特徴を学習し、制御可能なビデオを生成することを目的としている。
画像のスタイリングや動画の動きのカスタマイズにおいて大きな進歩を遂げてきたが、コンテンツ、スタイル、動きといった複数の概念を同時に制御することは大きな課題である。
本研究では,コンテンツ,スタイル,動作の協調制御を必要とするマルチコンセプト映像カスタマイズのタスクを体系的に定義する。
この領域の研究を容易にするために,我々は,(1)コンテンツスタイルとコンテンツモードの2つのサブタスクに目的を分解する,という2段階の異なる概念を分離し,柔軟に組み換えることにより,この問題に対処する統合フレームワークであるDisco-LoRAを提案する。
各サブタスクは、我々のIterative Dual-LoRA Disentanglement Frameworkを使って対処されます。
2) 層単位の重み傾向はLoRAの識別に不可欠であり, 重量の程度は構成可能性を決定する。
これらのスケールを調和させるために、Zスコアに基づく統計正則化を提案し、異なるLoRA間の干渉を最小限に抑えながら、重み分布を整列し、階層的な傾向を保存する。
広汎な実験により、Disco-LoRAはマルチコンセプトビデオのカスタマイズに優れており、制御可能なテキスト・ツー・ビデオ生成のための外観、スタイル、動きを効果的に保存している。
関連論文リスト
- DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning [82.28800081483224]
我々は,Omniモーション制御による多目的カスタマイズを実現する統合フレームワークであるDreamVideo-Omniを提案する。
複数対象のあいまいさを解決するために,グループとロールの埋め込みを導入し,特定のアイデンティティに移動信号を明示的に固定する。
これは、人間の嗜好に沿ったアイデンティティ保存を優先して、潜在空間における動き認識ID報酬を提供する。
論文 参考訳(メタデータ) (2026-03-12T17:59:12Z) - Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA [17.6011255931793]
意味制御ビデオ生成のためのスケーラブルで汎用的なフレームワークであるVideo2LoRAを提案する。
Video2LoRAは、各セマンティック入力に対してパーソナライズされたLoRA重みを予測するために、軽量なハイパーネットワークを使用する。
モデルは、キースタイルとコンテンツのバリエーションを保持しながら、参照セマンティクスと整合したビデオを生成する。
論文 参考訳(メタデータ) (2026-03-09T10:40:03Z) - FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning [65.42201665046505]
現在のビデオ理解モデルは、各質問の特定の推論条件にかかわらず、固定されたフレームサンプリング戦略に依存し、所定の視覚入力を処理する。
この静的アプローチは、視覚的エビデンスを適応的に収集する能力を制限し、広範囲の時間的カバレッジやきめ細かい空間的詳細を必要とするタスクにおいて、最適以下のパフォーマンスをもたらす。
Frame-Interleaved Chain-of-Thought (FiCOT)を通して、モデルが推論中に視覚情報を動的に要求することを可能にする強化学習で訓練されたエンドツーエンドフレームワークであるFrameMindを紹介する。
従来のアプローチとは異なり、FrameMindは複数のターンで動作し、モデルがテキスト推論とアクティブな視覚知覚を交互に切り替え、ツールを使って抽出する。
論文 参考訳(メタデータ) (2025-09-28T17:59:43Z) - Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA [84.89284738178932]
テキスト・ビデオ・モデルにおける動的概念のパーソナライズのためのゼロショットフレームワークを提案する。
提案手法は,空間的に入力と出力のペアを整理する構造化2x2ビデオグリッドを利用する。
専用のグリッドフィルモジュールが部分的に観測されたレイアウトを完了し、時間的に一貫性とアイデンティティを保った出力を生成する。
論文 参考訳(メタデータ) (2025-07-23T22:09:38Z) - JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation [13.168628936598367]
JointTunerは、外観とモーションコンポーネントのジョイント最適化を可能にするフレームワークである。
AiT Lossは外見に関連するコンポーネントの流れを乱し、モデルがモーション学習のみに集中するように誘導する。
JointTunerは、UNetベースのモデルとDiffusion Transformerベースのモデルの両方と互換性がある。
論文 参考訳(メタデータ) (2025-03-31T11:04:07Z) - Dynamic Concepts Personalization from Single Videos [92.62863918003575]
動的概念で生成ビデオモデルをパーソナライズするための新しいフレームワークであるSet-and-Sequenceを紹介する。
提案手法は,空間的特徴と時間的特徴を明確に区別しないアーキテクチャにおいて,時間的重み空間を課す。
我々のフレームワークは動的概念をビデオモデルの出力領域に埋め込んでおり、前例のない編集性と構成性を実現している。
論文 参考訳(メタデータ) (2025-02-20T18:53:39Z) - DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control [42.506988751934685]
本研究では、特定の主題と動きの軌跡でビデオを生成することができるゼロショットビデオカスタマイズフレームワークDreamVideo-2を提案する。
具体的には,対象学習におけるモデル固有の能力を活用する参照アテンションを導入する。
我々は,ボックスマスクの頑健な動作信号を完全に活用して,高精度な動作制御を実現するためのマスク誘導型モーションモジュールを考案した。
論文 参考訳(メタデータ) (2024-10-17T17:52:57Z) - Implicit Style-Content Separation using B-LoRA [61.664293840163865]
一つの画像のスタイルとコンテンツコンポーネントを暗黙的に分離する手法であるB-LoRAを紹介する。
SDXLのアーキテクチャをLoRAと組み合わせて解析することにより、2つのブロックのLoRA重みを共同で学習することで、スタイル・コンテント分離を実現する。
論文 参考訳(メタデータ) (2024-03-21T17:20:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。