論文の概要: MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation
- arxiv url: http://arxiv.org/abs/2606.09056v1
- Date: Mon, 08 Jun 2026 05:46:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.718831
- Title: MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation
- Title(参考訳): MilliVid:ビデオ生成における長距離一貫性のための階層的遅延
- Authors: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann,
- Abstract要約: マルチスケールトークン空間内で粗大なロールアウトを用いてビデオを生成する方法を示す。
長いMinecraftビデオのカスタムデータセットを使用して、このアプローチを検証する。
- 参考スコア(独自算出の注目度): 48.042521266219524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generative models have become increasingly powerful, but long-range consistency remains challenging to achieve because even a few dozen frames require impractically long transformer sequence lengths. We show that this issue can be mitigated by generating video using coarse-to-fine rollout within a multi-scale token space. Our approach is simple: first, we pre-train an autoencoder that compresses each frame into a hierarchy of tokens, with levels ranging from the typical latent resolution to only a handful of tokens per frame. The coarsest levels capture the most consequential information, such as scene layout and semantics, while finer levels add high-frequency appearance and texture. Then, we train a video diffusion model to generate these tokens using coarse-to-fine rollout. By carefully controlling the level of detail at which frames are generated and used as context during each rollout step, we are able to preserve long-range consistency in geometry and object permanence while spending less compute on the long-range consistency of less perceptually relevant details. We validate this approach using a custom dataset of long Minecraft videos, where it produces substantially more consistent rollouts compared to existing baselines.
- Abstract(参考訳): ビデオ生成モデルはますます強力になっているが、数十フレームでさえ急激な長めのトランスフォーマーシーケンス長を必要とするため、長距離の整合性は達成し難いままである。
マルチスケールトークン空間内の粗大なロールアウトを用いてビデオを生成することで,この問題を緩和できることを示す。
まず、各フレームをトークン階層に圧縮するオートエンコーダを事前訓練します。
粗いレベルは、シーンレイアウトやセマンティクスなど、最も連続した情報をキャプチャする一方、より細かいレベルは、高周波の外観とテクスチャを付加する。
そして、粗いロールアウトを用いてこれらのトークンを生成するために、ビデオ拡散モデルを訓練する。
各ロールアウトステップでフレームが生成され、コンテキストとして使用される詳細レベルを慎重に制御することにより、幾何学とオブジェクトの永続性における長距離一貫性を保ちつつ、知覚に関係のない詳細の長距離一貫性に少ない計算を費やすことができる。
このアプローチは、既存のベースラインに比べてはるかに一貫性のあるロールアウトを生成する、長いMinecraftビデオのカスタムデータセットを使用して検証する。
関連論文リスト
- DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation [10.575655795360937]
DCARLは、分割・変換方式の構造安定性と高忠実度VDMの生成を結合した、新規な分割・変換型自己回帰フレームワークである。
提案手法は,最先端の自己回帰的・分割型ベースラインと比較して,視覚的品質とカメラの密着性の両方において優れた性能を実現する。
論文 参考訳(メタデータ) (2026-03-25T22:07:09Z) - KlingAvatar 2.0 Technical Report [43.949604396366425]
本モデルは,マルチモーダル・アライメントの長めの高解像度ビデオ生成における課題を効果的に解決する。
視覚的明瞭度の向上、正確な唇同期によるリアルな唇歯のレンダリング、強力なアイデンティティ保存、そしてコヒーレントなマルチモーダル・インストラクションを提供する。
論文 参考訳(メタデータ) (2025-12-15T13:30:51Z) - LoViC: Efficient Long Video Generation with Context Compression [68.22069741704158]
百万単位のオープンドメインビデオに基づいてトレーニングされたDiTベースのフレームワークであるLoViCを紹介する。
当社のアプローチの核心はFlexFormerです。ビデオとテキストを統合された潜在表現に共同で圧縮する表現型オートエンコーダです。
論文 参考訳(メタデータ) (2025-07-17T09:46:43Z) - Towards Smooth Video Composition [59.134911550142455]
ビデオ生成には、時間とともに動的コンテンツを伴う一貫した永続的なフレームが必要である。
本研究は, 生成的対向ネットワーク(GAN)を用いて, 任意の長さの映像を構成するための時間的関係を, 数フレームから無限までモデル化するものである。
単体画像生成のためのエイリアスフリー操作は、適切に学習された知識とともに、フレーム単位の品質を損なうことなく、スムーズなフレーム遷移をもたらすことを示す。
論文 参考訳(メタデータ) (2022-12-14T18:54:13Z) - Temporally Consistent Transformers for Video Generation [80.45230642225913]
正確なビデオを生成するには、アルゴリズムは世界の空間的および時間的依存関係を理解する必要がある。
時間依存性のあるビデオ生成を厳格に評価するために、複雑なデータに関する確立されたベンチマークは存在しない。
本稿では,長期間の一貫性を著しく向上し,サンプリング時間を短縮するTemporally Consistent Transformer(TECO)を提案する。
論文 参考訳(メタデータ) (2022-10-05T17:15:10Z) - Generating Long Videos of Dynamic Scenes [66.56925105992472]
本稿では、物体の動きを再現する映像生成モデル、カメラ視点の変化、時間とともに現れる新しいコンテンツについて述べる。
よくある障害ケースは、コンテンツが時間的一貫性を提供する誘導バイアスに過度に依存するため、決して変化しないことです。
論文 参考訳(メタデータ) (2022-06-07T16:29:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。