論文の概要: HunyuanVideo 1.5 Technical Report
- arxiv url: http://arxiv.org/abs/2511.18870v2
- Date: Tue, 25 Nov 2025 02:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-26 15:01:35.454453
- Title: HunyuanVideo 1.5 Technical Report
- Title(参考訳): HunyuanVideo 1.5 Technical Report
- Abstract要約: HunyuanVideo 1.5は軽量だが強力なオープンソースビデオ生成モデルである。
最先端のビジュアル品質とモーションコヒーレンスを、わずか830億のパラメータで達成している。
すべてのオープンソース資産はhttps://github.com/Tencent-Hunyuan/HunyuanVideo-1.5で公開されている。
- 参考スコア(独自算出の注目度): 96.9793191588414
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present HunyuanVideo 1.5, a lightweight yet powerful open-source video generation model that achieves state-of-the-art visual quality and motion coherence with only 8.3 billion parameters, enabling efficient inference on consumer-grade GPUs. This achievement is built upon several key components, including meticulous data curation, an advanced DiT architecture featuring selective and sliding tile attention (SSTA), enhanced bilingual understanding through glyph-aware text encoding, progressive pre-training and post-training, and an efficient video super-resolution network. Leveraging these designs, we developed a unified framework capable of high-quality text-to-video and image-to-video generation across multiple durations and resolutions. Extensive experiments demonstrate that this compact and proficient model establishes a new state-of-the-art among open-source video generation models. By releasing the code and model weights, we provide the community with a high-performance foundation that lowers the barrier to video creation and research, making advanced video generation accessible to a broader audience. All open-source assets are publicly available at https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5.
- Abstract(参考訳): HunyuanVideo 1.5は、最先端のビジュアル品質とモーションコヒーレンスをわずか830億のパラメータで実現し、コンシューマグレードのGPU上で効率的な推論を可能にする軽量かつパワフルなオープンソースビデオ生成モデルである。
この成果は、巧妙なデータキュレーション、選択的およびスライディングタイルアテンション(SSTA)を備えた高度なDiTアーキテクチャ、グリフ対応テキストエンコーディングによるバイリンガル理解の強化、プログレッシブ事前学習とポストトレーニング、効率的なビデオ超解像ネットワークなど、いくつかの重要なコンポーネントの上に構築されている。
これらの設計を活用することで,高画質のテキスト・ツー・ビデオと画像・ツー・ビデオ生成が可能な統一的なフレームワークを複数期間にわたって開発した。
大規模な実験は、このコンパクトで熟練したモデルが、オープンソースビデオ生成モデルの中で新しい最先端のモデルを確立することを実証している。
コードとモデルの重みを公開することによって、コミュニティに高性能な基盤を提供し、ビデオ作成と研究の障壁を低くし、高度なビデオ生成をより広い聴衆に利用できるようにする。
すべてのオープンソース資産はhttps://github.com/Tencent-Hunyuan/HunyuanVideo-1.5で公開されている。
関連論文リスト
- Seedance 1.0: Exploring the Boundaries of Video Generation Models [71.26796999246068]
Seedance 1.0は高性能で推論効率の良いビデオ基盤生成モデルである。
精度と意味のあるビデオキャプションを付加したマルチソースキュレーションデータを統合する。
Seedance 1.0は1080p解像度で5秒のビデオを生成することができる。
論文 参考訳(メタデータ) (2025-06-10T17:56:11Z) - Wan: Open and Advanced Large-Scale Video Generative Models [83.03603932233275]
Wanは、ビデオ生成の境界を推し進めるために設計された、ビデオファンデーションモデルのスイートである。
我々は、ソースコードやすべてのモデルを含む一連のWanをオープンソース化し、ビデオ生成コミュニティの成長を促進することを目的としています。
論文 参考訳(メタデータ) (2025-03-26T08:25:43Z) - SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device [61.42406720183769]
本稿では,大規模ビデオ拡散モデルのパワーをエッジユーザーにもたらすための包括的加速フレームワークを提案する。
我々のモデルは0.6Bのパラメータしか持たないため、iPhone 16 PMで5秒以内に5秒のビデオを生成することができる。
論文 参考訳(メタデータ) (2024-12-13T18:59:56Z) - HunyuanVideo: A Systematic Framework For Large Video Generative Models [82.4392082688739]
HunyuanVideoは、革新的なオープンソースのビデオファンデーションモデルだ。
データキュレーション、高度なアーキテクチャ設計、プログレッシブモデルスケーリング、トレーニングが組み込まれている。
その結果,13億以上のパラメータを持つビデオ生成モデルの訓練に成功した。
論文 参考訳(メタデータ) (2024-12-03T23:52:37Z) - VideoCrafter1: Open Diffusion Models for High-Quality Video Generation [97.5767036934979]
高品質ビデオ生成のための2つの拡散モデル、すなわち、テキスト・ツー・ビデオ(T2V)と画像・ツー・ビデオ(I2V)モデルを導入する。
T2Vモデルは与えられたテキスト入力に基づいてビデオを合成し、I2Vモデルは追加のイメージ入力を含む。
提案したT2Vモデルは,解像度が1024×576$のリアルで映像品質の高いビデオを生成することができる。
論文 参考訳(メタデータ) (2023-10-30T13:12:40Z) - LAMP: Learn A Motion Pattern for Few-Shot-Based Video Generation [44.220329202024494]
我々は,1つのGPU上で816本の動画でテキストから画像への拡散モデルを学習する,数ショットベースのチューニングフレームワーク LAMP を提案する。
具体的には,コンテンツ生成のための既製のテキスト・ツー・イメージモデルを用いて,第1フレーム条件のパイプラインを設計する。
時間次元の特徴を捉えるため、T2Iモデルの事前訓練された2次元畳み込み層を、新しい時間空間運動学習層に拡張する。
論文 参考訳(メタデータ) (2023-10-16T19:03:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。