論文の概要: Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
- arxiv url: http://arxiv.org/abs/2607.09581v2
- Date: Mon, 13 Jul 2026 10:32:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.280656
- Title: Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
- Title(参考訳): Wan-Dancer: 微小スケールのコヒーレントな音楽対ダンス生成のための階層的フレームワーク
- Authors: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang,
- Abstract要約: ミニスケールのコヒーレントな音楽間距離生成のための新しい階層的枠組みを提案する。
提案手法は,その過程をグローバルな計画と時間的改善に分解し,長距離コヒーレンスを確保するためにフルトラック音楽コンテキストを活用する。
我々のフレームワークは従来の持続時間障壁を超え、時間安定性に優れた720p/30fpsのビデオを生成する。
- 参考スコア(独自算出の注目度): 18.47235332288348
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generating long-duration, high-definition, and rhythmically synchronized dance videos directly from music remains a significant challenge, primarily due to the temporal constraints of current diffusion models, which typically fail beyond 20 seconds. Existing approaches, whether they rely on intermediate 3D skeletons or on end-to-end video synthesis, suffer from temporal drift, identity inconsistency, and repetitive motion patterns when extended to longer horizons. To address these limitations, we propose a novel hierarchical framework for minute-scale coherent music-to-dance generation. Our method decouples the process into global keyframe planning and local temporal refinement, leveraging full-track musical context to ensure long-range coherence. Key innovations include dynamic frame rate adaptation via time-mapped RoPE embeddings for precise alignment, an optical-flow-based loss function to enhance motion continuity, and motion-speed control to preserve high-fidelity details during rapid movements. Extensive experiments demonstrate that our framework surpasses the conventional duration barrier, generating stable, 720p/30fps videos exceeding one minute with superior temporal stability. Furthermore, the model exhibits robust versatility across five distinct dance genres, conditioned on both audio and textual prompts, establishing a new state-of-the-art in coherent, long-form dance video synthesis.
- Abstract(参考訳): 音楽から直接長調、高精細、リズム的に同期されたダンスビデオを生成することは、主に20秒以上で失敗する現在の拡散モデルの時間的制約のために、大きな課題である。
既存のアプローチでは、中間的な3Dスケルトンや、時間的ドリフト、アイデンティティの不整合、より長い地平線への拡張時の反復的な動きパターンに悩まされている。
これらの制約に対処するため、我々は、ミニスケールのコヒーレントな音楽間距離生成のための新しい階層的枠組みを提案する。
提案手法は,その過程をグローバルなキーフレーム計画と局所的時間的改善に分解し,長距離コヒーレンスを確保するためにフルトラック音楽コンテキストを活用する。
主な革新としては、正確なアライメントのためのタイムマップされたRoPE埋め込みによる動的フレームレート適応、運動継続性を高めるための光フローベースの損失関数、高速動作中に高忠実度の詳細を保持する動き速度制御などがある。
大規模な実験により、我々のフレームワークは従来の持続時間障壁を超え、時間安定性に優れた720p/30fpsの動画を1分以上生成することを示した。
さらに、このモデルは、5つの異なるダンスジャンルにまたがる堅牢な汎用性を示し、音声とテキストの両方のプロンプトを条件に、コヒーレントでロングフォームなダンスビデオ合成における新しい最先端技術を確立している。
関連論文リスト
- DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion [21.262410801452948]
ダイナミックシーンにおける包括的認識を実現するためには、赤外線および可視ビデオ融合が不可欠である。
時間的一貫性を維持することは、依然として恐ろしい課題だ。
本研究では,歴史条件付きモーション生成としてタスクを再構成するドリフト耐性ビデオ融合法を提案する。
論文 参考訳(メタデータ) (2026-05-25T12:23:55Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation [62.82943523102]
音楽から3Dのダンス生成は、リアルでリズミカルに同期された人間のダンスを音楽から合成することを目的としている。
本研究では,階層的なテンポ認識型Mixture-of-ExpertsモジュールであるTempoMoEを提案する。
本研究では,TempoMoEがダンスの質とリズムアライメントを実現することを示す。
論文 参考訳(メタデータ) (2025-12-21T16:57:08Z) - AnchorSync: Global Consistency Optimization for Long Video Editing [8.65329684912554]
AnchorSyncは、高品質で長期的なビデオ編集を可能にする新しい拡散ベースのフレームワークである。
提案手法は,進行的復調過程を通じて構造的整合性を強制し,マルチモーダル誘導による時間的ダイナミクスを保存する。
論文 参考訳(メタデータ) (2025-08-20T10:51:24Z) - InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing [66.48064661467781]
我々は、アイデンティティ、象徴的なジェスチャー、カメラ軌跡を維持するために参照を戦略的に保存する新しいパラダイムであるスパースフレームビデオダビングを導入する。
無限長長列ダビング用に設計されたストリーミングオーディオ駆動型ジェネレータであるInfiniteTalkを提案する。
HDTF、CelebV-HQ、EMTDデータセットの総合評価は、最先端の性能を示している。
論文 参考訳(メタデータ) (2025-08-19T17:55:23Z) - MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation [10.203209816178552]
MotionRAG-Diffは、Retrieval-Augmented Generationと拡散に基づく改善を統合するハイブリッドフレームワークである。
我々の手法は3つの中核的な革新をもたらす。
動作品質、多様性、音楽-モーション同期の精度で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-03T09:12:48Z) - ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation [21.732021702335345]
我々は,新しい階層型潜在空間で動作する拡散フレームワークであるtextbfReactDanceを紹介する。
ReactDanceは、動作品質、長期コヒーレンス、サンプリング効率において、最先端の手法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2025-05-08T18:42:38Z) - Extending Visual Dynamics for Video-to-Music Generation [51.274561293909926]
DyViMは、ビデオから音楽への生成のための動的モデリングを強化する新しいフレームワークである。
高レベルのセマンティクスは、クロスアテンションメカニズムを通じて伝達される。
実験では、DyViMが最先端(SOTA)法よりも優れていることを示した。
論文 参考訳(メタデータ) (2025-04-10T09:47:26Z) - Lagrangian Motion Fields for Long-term Motion Generation [51.02126882968116]
本稿では,ラグランジアン運動場の概念について紹介する。
各関節を短い間隔で一様速度でラグランジアン粒子として扱うことにより、我々のアプローチは運動表現を一連の「超運動」に凝縮する。
私たちのソリューションは万能で軽量で、ニューラルネットワークの前処理の必要性を排除しています。
論文 参考訳(メタデータ) (2024-09-03T01:38:06Z) - LongDanceDiff: Long-term Dance Generation with Conditional Diffusion
Model [3.036230795326545]
LongDanceDiffは、シーケンス・ツー・シーケンスの長期ダンス生成のための条件付き拡散モデルである。
時間的一貫性と空間的制約の課題に対処する。
また,フットスライディングやアンスムース動作など,ダンス生成における視覚的品質の問題にも対処する。
論文 参考訳(メタデータ) (2023-08-23T06:37:41Z) - DiffDance: Cascaded Human Motion Diffusion Model for Dance Generation [89.50310360658791]
本稿では,高分解能長周期ダンス生成のための新しい動き拡散モデルDiffDanceを提案する。
本モデルは、音楽間拡散モデルとシーケンス超解像拡散モデルとから構成される。
DiffDanceは、入力された音楽と効果的に一致したリアルなダンスシーケンスを生成することができることを実証する。
論文 参考訳(メタデータ) (2023-08-05T16:18:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。