論文の概要: Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
- arxiv url: http://arxiv.org/abs/2604.08995v1
- Date: Fri, 10 Apr 2026 06:00:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.710332
- Title: Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
- Title(参考訳): Matrix-Game 3.0: リアルタイムとストリーミングの対話型ワールドモデル
- Abstract要約: Matrix-Game 3.0は、720pのリアルタイムビデオ生成用に設計されたメモリ拡張型インタラクティブワールドモデルである。
データ、モデル、推論にまたがる体系的な改善を導入する。
実験結果から, Matrix-Game 3.0は最大40FPSのリアルタイム生成を実現し, 5Bモデルで720pの解像度を実現した。
- 参考スコア(独自算出の注目度): 46.26930440421103
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the advancement of interactive video generation, diffusion models have increasingly demonstrated their potential as world models. However, existing approaches still struggle to simultaneously achieve memory-enabled long-term temporal consistency and high-resolution real-time generation, limiting their applicability in real-world scenarios. To address this, we present Matrix-Game 3.0, a memory-augmented interactive world model designed for 720p real-time longform video generation. Building upon Matrix-Game 2.0, we introduce systematic improvements across data, model, and inference. First, we develop an upgraded industrial-scale infinite data engine that integrates Unreal Engine-based synthetic data, large-scale automated collection from AAA games, and real-world video augmentation to produce high-quality Video-Pose-Action-Prompt quadruplet data at scale. Second, we propose a training framework for long-horizon consistency: by modeling prediction residuals and re-injecting imperfect generated frames during training, the base model learns self-correction; meanwhile, camera-aware memory retrieval and injection enable the base model to achieve long horizon spatiotemporal consistency. Third, we design a multi-segment autoregressive distillation strategy based on Distribution Matching Distillation (DMD), combined with model quantization and VAE decoder pruning, to achieve efficient real-time inference. Experimental results show that Matrix-Game 3.0 achieves up to 40 FPS real-time generation at 720p resolution with a 5B model, while maintaining stable memory consistency over minute-long sequences. Scaling up to a 2x14B model further improves generation quality, dynamics, and generalization. Our approach provides a practical pathway toward industrial-scale deployable world models.
- Abstract(参考訳): インタラクティブなビデオ生成の進歩により、拡散モデルは世界モデルとしての可能性をますます示してきた。
しかし、既存のアプローチは、メモリ対応の長期的一貫性と高解像度のリアルタイム生成を同時に実現し、現実のシナリオにおける適用性を制限している。
そこで本稿では,リアルタイムビデオ生成のためのメモリ拡張型インタラクティブワールドモデルMatrix-Game 3.0を提案する。
Matrix-Game 2.0に基づいて、データ、モデル、推論の体系的な改善を紹介します。
まず、Unreal Engineベースの合成データ、AAAゲームからの大規模自動収集、および高品質なビデオ-Pose-Action-Prompt四重項データを大規模に生成する実世界のビデオ拡張を統合した、産業規模の無限大データエンジンを開発する。
第2に、予測残差をモデル化し、トレーニング中に生成した不完全なフレームを再注入することにより、ベースモデルは自己補正を学習し、一方、カメラ対応メモリ検索とインジェクションにより、ベースモデルは長い水平時空間一貫性を達成することができる。
第3に, モデル量子化とVAEデコーダプルーニングを組み合わせた分散マッチング蒸留(DMD)に基づく多段自動回帰蒸留方式を設計し, 効率的なリアルタイム推論を実現する。
実験結果から, Matrix-Game 3.0は最大40FPSのリアルタイム生成を実現し, 5Bモデルで720pの解像度を実現した。
2x14Bモデルにスケールアップすることで、生成品質、ダイナミクス、一般化がさらに向上する。
我々のアプローチは、産業規模で展開可能な世界モデルへの実践的な経路を提供する。
関連論文リスト
- Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory [28.887112448832525]
本稿では,3つの重要な改良点を通じて,リアルタイム対話型ワールドジェネレーションを推し進めるMatrix-Game 3.5を紹介する。
まず、パッチメモリとタイル付きPRoPEコンポーネントが追加で学習可能なパラメータを導入しない統合幾何対応メモリフレームワークを提案する。
第2に、静的なシーン幾何学と動的主題を別々にモデル化した静的な非交叉世界表現を導入する。
第3に、双方向拡散モデルから数ステップの因果生成器に変換する2段階進行リアルタイム蒸留フレームワークを開発する。
論文 参考訳(メタデータ) (2026-08-30T17:11:00Z) - Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising [22.899605451385824]
我々は,リアルタイムなロボットアクションの実行と高忠実度4D世界合成(ビデオ+3D再構成)を単一のフレームワークで統合する,統一された4D世界モデルであるX-WAMを提案する。
X-WAMは、事前訓練されたビデオ拡散モデルの強い視覚的優位性を活用するために、マルチビューRGB-Dビデオを予測することによって未来を想像する。
非同期ノイズサンプリング(ANS)は、生成品質と動作復号効率を共同で最適化する。
論文 参考訳(メタデータ) (2026-04-29T14:01:54Z) - InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model [17.421965971185134]
InSpatio-WorldFMは空間知能のためのオープンソースのリアルタイムフレームモデルである。
InSpatio-WorldFMはフレームベースのパラダイムを採用し、各フレームを独立に生成し、低レイテンシのリアルタイム空間推論を可能にする。
論文 参考訳(メタデータ) (2026-03-12T13:28:50Z) - RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space [51.441415833480505]
RAYNOVAは、二重因果自己回帰フレームワークを使用するシナリオを駆動するための多視点世界モデルである。
相対的なシャーカー線位置符号化に基づいて、ビュー、フレーム、スケールにまたがる等方的時間的表現を構築する。
論文 参考訳(メタデータ) (2026-02-24T08:41:40Z) - Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory [101.2076718776139]
複雑な実環境において,1000フレーム以上のコヒーレントな視覚記憶を維持することのできる,堅牢な対話型世界モデルを提案する。
我々は,歴史的潜水剤を固定予算の幾何学的表現に蒸留するpose-free Memory (HPMC)を導入する。
また,連続動作を三状態論理に識別する不確実性認識型アクションラベルモジュールを提案する。
論文 参考訳(メタデータ) (2026-02-02T17:52:56Z) - TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model [53.555353366322464]
我々は,映像生成,動的シーン再構成,長期記憶をクローズドループシステム内で統合するリアルタイム多モード4DワールドモデリングフレームワークTeleWorldを提案する。
提案手法は,動的オブジェクトモデリングと静的シーン表現のシームレスな統合を実現し,現実的でインタラクティブで計算可能な合成システムに向けて世界モデルを推し進める。
論文 参考訳(メタデータ) (2025-12-31T18:31:46Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving [26.379817613036597]
CVD-STORMは時空間再構成変分オートエンコーダ(VAE)を利用したクロスビュービデオ拡散モデルである
提案手法は,まず補助的な4次元再構成タスクでVAEを微調整し,その3次元構造と時間的ダイナミクスをエンコードする能力を向上する。
実験結果から,FIDとFVDの両指標の精度向上が得られた。
論文 参考訳(メタデータ) (2025-10-09T08:41:58Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z) - RAVEN: Rethinking Adversarial Video Generation with Efficient Tri-plane Networks [93.18404922542702]
本稿では,長期的空間的および時間的依存関係に対処する新しいビデオ生成モデルを提案する。
提案手法は,3次元認識型生成フレームワークにインスパイアされた,明示的で単純化された3次元平面のハイブリッド表現を取り入れたものである。
我々のモデルは高精細度ビデオクリップを解像度256時間256$ピクセルで合成し、フレームレート30fpsで5ドル以上まで持続する。
論文 参考訳(メタデータ) (2024-01-11T16:48:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。