論文の概要: DreamX-World 1.0: A General-Purpose Interactive World Model
- arxiv url: http://arxiv.org/abs/2606.16993v1
- Date: Mon, 15 Jun 2026 17:30:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:05.105618
- Title: DreamX-World 1.0: A General-Purpose Interactive World Model
- Title(参考訳): DreamX-World 1.0: 汎用インタラクティブワールドモデル
- Authors: DreamX Team, Yancheng Bai, Rui Chen, Xiangxiang Chu, Rujing Dang, Hao Dou, Bingjie Gao, Qiwen Gu, Siyu Hong, Jiachen Lei, Geng Li, Jifan Li, Ruimin Lin, Qingfeng Shi, Bingze Song, Lei Sun, Jing Tang, Ruitian Tian, Jun Wang, Jiahong Wu, Pengfei Zhang, Shen Zhang, Jiashu Zhu,
- Abstract要約: DreamX-World 1.0は、制御可能なロングホライゾン生成のためのインタラクティブなテキスト/画像・ビデオの世界モデルである。
カメラナビゲーション、以前に観測された地域への再訪、フォトリアリスティック、ゲームスタイル、スタイル化されたドメイン間での即時イベントをサポートする。
- 参考スコア(独自算出の注目度): 27.431807314882935
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: DreamX-World 1.0 is a general-purpose interactive text/image-to-video world model for controllable long-horizon generation. It supports camera navigation, revisits to previously observed regions, and promptable events across photorealistic, game-style, and stylized domains. Our data engine combines camera-accurate Unreal Engine rendering, action-rich gameplay recordings, and real-world videos with recovered camera geometry. For camera control, we introduce E-PRoPE, a lightweight variant of projective positional encoding that retains PRoPE's projective camera geometry while applying camera-aware attention to spatially reduced tokens. We convert a bidirectional video generator into a few-step autoregressive world model using causal forcing, DMD-style distillation, and long-rollout training. Training on self-generated long-horizon contexts exposes the model to its own generated history and reduces the style and color drift that accumulates across autoregressive chunks. Memory-Conditioned Scene Persistence retrieves earlier views through camera-geometry-based retrieval, while residual recycling makes the conditioning path less sensitive to imperfect memory latents. Event Instruction Tuning adds composable event control, and reinforcement learning alignment recovers camera control and visual quality after distillation. With mixed-precision DiT execution, residual reuse, 75\%-pruned VAE decoding, and asynchronous pipeline parallelism, DreamX-World 1.0 reaches up to 16\,FPS on eight RTX\,5090 GPUs. On our 5-second basic evaluation, DreamX-World 1.0 achieves a camera-control score of 73.75 and an overall score of 84.76, outperforming HY-WorldPlay 1.5 and LingBot-World in overall score, which achieve 80.79 and 80.45, respectively.
- Abstract(参考訳): DreamX-World 1.0は、制御可能なロングホライゾン生成のための汎用インタラクティブテキスト/画像・ビデオワールドモデルである。
カメラナビゲーション、以前に観測された地域への再訪、フォトリアリスティック、ゲームスタイル、スタイル化されたドメイン間での即時イベントをサポートする。
我々のデータエンジンは、カメラ精度の高いUnreal Engineレンダリング、アクションリッチなゲームプレイ記録、および現実世界のビデオと、回復したカメラ幾何学を組み合わせたものです。
カメラ制御のためのE-PRoPEは、PRoPEの射影カメラ形状を保ちながら、空間的に減少するトークンにカメラに注意を向ける軽量な射影位置符号化である。
我々は、双方向ビデオ生成装置を、因果強制、DMDスタイルの蒸留、長期学習を用いて、数ステップの自己回帰世界モデルに変換する。
自己生成したロングホライゾンコンテキストのトレーニングは、モデルを自身の生成した履歴に公開し、自己回帰的なチャンクに蓄積するスタイルとカラードリフトを減らす。
メモリ・コンディションド・シーン・パーシステンス(Memory-Conditioned Scene Persistence)は、カメラ・ジオメトリに基づく検索を通じて以前のビューを検索する。
Event Instruction Tuningは構成可能なイベント制御を追加し、強化学習アライメントは蒸留後のカメラ制御と視覚的品質を回復する。
混合精度のDiT実行、再再使用、75\%のVAEデコード、非同期パイプライン並列性により、DreamX-World 1.0は8つのRTX\,5090 GPU上で最大16\,FPSに達する。
5秒の基本的な評価では、DreamX-World 1.0はカメラコントロールスコア73.75、総合スコア84.76、HY-WorldPlay 1.5、LingBot-Worldの合計スコア80.79、80.45をそれぞれ上回ります。
関連論文リスト
- WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models [32.26032900976109]
カメラナビゲーションからオブジェクトレベルのトラジェクトリアクションまで,インタラクティブなビデオワールドモデルを拡張するフレームワークであるWorldCraftを紹介する。
ユーザクリックとスケッチされたパスが与えられたら、WorldCraftは、選択したオブジェクトが所定の軌跡に従う将来のフレームを生成する。
実験により、WorldCraftは正確なオブジェクト制御を可能にし、カメラのみの評価の下でビデオベースのワールドモデルのカメラ忠実性を保ち、長期の自己回帰ロールアウトでオブジェクト状態を維持することが示されている。
論文 参考訳(メタデータ) (2026-05-24T13:40:42Z) - Geo-Align: Video Generation Alignment via Metric Geometry Reward [53.65904111864641]
Geo-Alignは、カメラ制御ビデオ再レンダリング用に特別に設計された最初の強化学習フレームワークである。
事前訓練されたモデルに基づいて、スケールアウェアの知覚報酬機構を用いてモデルを最適化する。
実験により、Geo-Alignは、カメラの正確な制御性と視覚的忠実性の両方において、既存の教師付き学習ベースラインを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-22T17:59:43Z) - WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories [36.79437857022868]
WorldStereoは、カメラ誘導のビデオ生成と3D再構成を橋渡しする新しいフレームワークだ。
我々はWorldStereoが強力な世界モデルとして機能し,多種多様なシーン生成タスクと高忠実度3D結果に対処していることを示す。
論文 参考訳(メタデータ) (2026-03-02T16:36:56Z) - Plenoptic Video Generation [80.3116444692858]
PlenopticDreamerは、同期時間記憶を維持するために生成幻覚を同期するフレームワークである。
中心となる考え方は、マルチインアウトのビデオ条件付きモデルを自己回帰的にトレーニングすることだ。
トレーニングでは,コンバージェンス向上のためのコンテキストスケーリング,エラー蓄積による幻覚への自己条件付け,拡張ビデオ生成をサポートする長時間ビデオコンディショニング機構が組み込まれている。
論文 参考訳(メタデータ) (2026-01-08T18:58:32Z) - Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation [49.12018869332346]
InfCamは、高ポーズ忠実度でカメラ制御されたビデオ・ビデオ生成フレームワークである。
1)ビデオ拡散モデルの2次元潜在空間内で直接3次元カメラ回転を符号化する。
論文 参考訳(メタデータ) (2025-12-18T20:03:05Z) - Captain Safari: A World Engine [38.0569196690842]
ポーズ条件付きワールドエンジンであるCaptain Safariを紹介し、永続的なワールドメモリからビデオを取得する。
カメラパスが与えられた場合、ダイナミックなローカルメモリを保持し、レトリバーを使用してポーズ整列ワールドトークンをフェッチし、軌道に沿ってビデオ生成を条件付ける。
ビデオの質、3Dの一貫性、そして後続の軌道で、Captain Safariは最先端のカメラ制御ジェネレータを大幅に上回っている。
論文 参考訳(メタデータ) (2025-11-28T00:27:46Z) - Yume: An Interactive World Generation Model [38.818537395166835]
Yumeは、画像やテキスト、ビデオを使って対話的でリアルでダイナミックな世界を作る。
入力画像から動的世界を生成し、キーボードアクションを使って世界を探索することができる。
論文 参考訳(メタデータ) (2025-07-23T17:57:09Z) - Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation [66.95956271144982]
本稿では,単一画像から一貫した3Dポイントクラウドシーケンスを生成する新しいビデオ拡散フレームワークであるVoyagerを紹介する。
既存のアプローチとは異なり、Voyagerはフレーム間で固有の一貫性を持って、エンドツーエンドのシーン生成と再構築を実現している。
論文 参考訳(メタデータ) (2025-06-04T17:59:04Z) - Stag-1: Towards Realistic 4D Driving Simulation with Video Generation Model [83.31688383891871]
本稿では,現実世界のシーンを再現するために,DrivinG(Stag-1)モデルのための空間-テンポラル・シミュレートを提案する。
Stag-1は、自動運転車のサラウンドビューデータを使用して、連続した4Dポイントのクラウドシーンを構築する。
空間的時間的関係を分離し、コヒーレントな運転ビデオを生成する。
論文 参考訳(メタデータ) (2024-12-06T18:59:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。