論文の概要: Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- arxiv url: http://arxiv.org/abs/2512.13507v2
- Date: Tue, 16 Dec 2025 16:58:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-17 14:48:05.989821
- Title: Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- Title(参考訳): Seedance 1.5 Pro: ネイティブオーディオとビジュアルの共同生成モデル
- Abstract要約: Seedance 1.5 Proは、ネイティブのジョイントオーディオビデオ生成用に特別に設計された基礎モデルである。
Seedance 1.5 Proは、正確な多言語と方言のリップシンク、ダイナミックシネマカメラコントロール、物語のコヒーレンスの向上を通じて、自分自身を区別する。
- 参考スコア(独自算出の注目度): 163.7218693050595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent strides in video generation have paved the way for unified audio-visual generation. In this work, we present Seedance 1.5 pro, a foundational model engineered specifically for native, joint audio-video generation. Leveraging a dual-branch Diffusion Transformer architecture, the model integrates a cross-modal joint module with a specialized multi-stage data pipeline, achieving exceptional audio-visual synchronization and superior generation quality. To ensure practical utility, we implement meticulous post-training optimizations, including Supervised Fine-Tuning (SFT) on high-quality datasets and Reinforcement Learning from Human Feedback (RLHF) with multi-dimensional reward models. Furthermore, we introduce an acceleration framework that boosts inference speed by over 10X. Seedance 1.5 pro distinguishes itself through precise multilingual and dialect lip-syncing, dynamic cinematic camera control, and enhanced narrative coherence, positioning it as a robust engine for professional-grade content creation. Seedance 1.5 pro is now accessible on Volcano Engine at https://console.volcengine.com/ark/region:ark+cn-beijing/experience/vision?type=GenVideo.
- Abstract(参考訳): ビデオ生成の最近の進歩は、オーディオ・ビジュアル・ジェネレーションの統一への道を開いた。
本稿では,ネイティブな共同音声映像生成のための基礎モデルであるSeedance 1.5 Proについて述べる。
デュアルブランチ拡散トランスフォーマーアーキテクチャを利用することで、クロスモーダルジョイントモジュールと特殊なマルチステージデータパイプラインを統合し、例外的なオーディオ-視覚同期と優れた生成品質を実現する。
実用性を確保するため,高品質なデータセット上での監視ファインチューニング(SFT)や,多次元報酬モデルを用いたRLHF(Reinforcement Learning from Human Feedback)などの厳密なポストトレーニング最適化を実装した。
さらに、推論速度を10倍に向上する加速フレームワークを導入する。
Seedance 1.5 Proは、正確に多言語と方言のリップシンク、ダイナミックシネマカメラコントロール、物語のコヒーレンスを強化し、プロ級のコンテンツ作成のための堅牢なエンジンとして位置づける。
Seedance 1.5 ProがVolcano Engineからhttps://console.volcengine.com/ark/rea:ark+cn-beijing/experience/visionでアクセスできるようになった。
type=GenVideo。
関連論文リスト
- Seedance 2.0: Advancing Video Generation for World Complexity [156.43863352024826]
Seedance 2.0は、2026年2月初旬に中国で正式にリリースされた、新しいマルチモーダルオーディオビデオ生成モデルである。
マルチモーダル・オーディオ・ビデオ・ジョイント・ジェネレーションに統一的で高効率で大規模アーキテクチャを採用する。
Seedance 2.0は、4秒から15秒、ネイティブ出力解像度が480pと720pのオーディオビデオコンテンツの直接生成をサポートする。
論文 参考訳(メタデータ) (2026-04-15T17:59:40Z) - ALIVE: Animate Your World with Lifelike Audio-Video Generation [50.693986608051716]
ALIVEは、Soraスタイルのオーディオビデオ生成とアニメーションに事前訓練されたテキスト・トゥ・ビデオ(T2V)モデルを適用する世代モデルである。
音声-視覚同期と参照アニメーションをサポートするため,共用音声-ビデオブランチによるMMDiTアーキテクチャの強化を行った。
ALIVEは優れたパフォーマンスを示し、一貫してオープンソースモデルを上回り、最先端の商用ソリューションにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-02-09T14:06:03Z) - HunyuanVideo 1.5 Technical Report [96.9793191588414]
HunyuanVideo 1.5は軽量だが強力なオープンソースビデオ生成モデルである。
最先端のビジュアル品質とモーションコヒーレンスを、わずか830億のパラメータで達成している。
すべてのオープンソース資産はhttps://github.com/Tencent-Hunyuan/HunyuanVideo-1.5で公開されている。
論文 参考訳(メタデータ) (2025-11-24T08:22:07Z) - UniVerse-1: Unified Audio-Video Generation via Stitching of Experts [59.38012380516272]
協調音声とビデオの同時生成が可能な統合型Veo-3型モデルUniVerse-1を提案する。
トレーニング効率を向上させるために、スクラッチからトレーニングをバイパスし、代わりに専門家の縫合技術(SoE)を用いる。
論文 参考訳(メタデータ) (2025-09-07T17:55:03Z) - Seedance 1.0: Exploring the Boundaries of Video Generation Models [71.26796999246068]
Seedance 1.0は高性能で推論効率の良いビデオ基盤生成モデルである。
精度と意味のあるビデオキャプションを付加したマルチソースキュレーションデータを統合する。
Seedance 1.0は1080p解像度で5秒のビデオを生成することができる。
論文 参考訳(メタデータ) (2025-06-10T17:56:11Z) - Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion
Latent Aligners [69.70590867769408]
ビデオとオーディオのコンテンツ制作は、映画産業とプロのユーザーにとって重要な技術である。
既存の拡散に基づく手法は、ビデオと音声を別々に生成する。
本研究では,このギャップを埋めることを目的として,クロス・ビジュアル・オーディオとジョイント・ヴィジュアル・オーディオ生成のためのフレームワークを慎重に設計した。
論文 参考訳(メタデータ) (2024-02-27T17:57:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。