論文の概要: AlayaWorld: Long-Horizon and Playable Video World Generation
- arxiv url: http://arxiv.org/abs/2607.06291v1
- Date: Tue, 07 Jul 2026 13:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.543689
- Title: AlayaWorld: Long-Horizon and Playable Video World Generation
- Title(参考訳): AlayaWorld:長い水平と再生可能なビデオワールドジェネレーション
- Authors: AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao,
- Abstract要約: インタラクティブな生成世界を構築するためのフルスタックのオープンソースフレームワークである textbfAlayaWorld を提示する。
AlayaWorldはオープンなリアルタイムインタラクションを可能にし、ユーザーは自由に戦闘、スペルキャスティング、モンスター呼び出しなどの多様なアクションを操作できる。
- 参考スコア(独自算出の注目度): 36.52656377442462
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Game worlds have traditionally been built through labor-intensive production pipelines, making them costly to develop, difficult to customization, and expensive to modify after deployment. Recent advances in video world models offer a fundamentally different paradigm. Rather than explicitly authoring every component of a virtual environment, these models autoregressively synthesize future observations conditioned on the current world state and user interactions, enabling playable worlds to be generated online. Trained on both gameplay recordings and real-world videos, they can capture diverse visual appearances and physical dynamics, opening new opportunities for interactive applications beyond gaming, including embodied intelligence. In this paper, we present \textbf{AlayaWorld}, a full-stack open-source framework for building interactive generative worlds. AlayaWorld enables open-ended real-time interaction, allowing users to freely navigate and perform diverse actions such as combat, spell casting, and monster summoning. The framework unifies the complete development-from data preparation model architecture, model training, inference acceleration, and deployment-within a modular and extensible architecture. Alongside the framework, we release reproducible pipelines, reference implementations, evaluation tools, and comprehensive documentation, establishing a practical foundation for future research and real-time applications of generative world models.
- Abstract(参考訳): ゲームの世界は伝統的に労働集約的な生産パイプラインを通じて構築され、開発にコストがかかり、カスタマイズが難しく、展開後に修正する費用がかかる。
ビデオワールドモデルの最近の進歩は、根本的に異なるパラダイムを提供する。
仮想環境のすべてのコンポーネントを明示的に作成するのではなく、これらのモデルは現在の世界状態とユーザインタラクションに条件付けられた将来の観測を自動回帰的に合成し、再生可能な世界をオンラインで生成する。
ゲームプレイと現実世界のビデオの両方で訓練され、様々な視覚的な外観や身体的ダイナミクスを捉え、エンボディインテリジェンスを含むゲーム以外のインタラクティブなアプリケーションに新たな機会を与えることができる。
本稿では,インタラクティブな生成世界を構築するためのフルスタックのオープンソースフレームワークである \textbf{AlayaWorld} を紹介する。
AlayaWorldはオープンなリアルタイムインタラクションを可能にし、ユーザーは自由に戦闘、スペルキャスティング、モンスター呼び出しなどの多様なアクションを操作できる。
このフレームワークは、データ準備モデルアーキテクチャ、モデルトレーニング、推論アクセラレーション、そしてモジュラーで拡張可能なアーキテクチャで完全な開発を統一する。
このフレームワークとともに、再現可能なパイプライン、参照実装、評価ツール、包括的なドキュメントをリリースし、将来的な研究のための実践的な基盤を確立し、生成的世界モデルのリアルタイムな応用を可能にします。
関連論文リスト
- OpenWorldLib: A Unified Codebase and Definition of Advanced World Models [69.28080690708092]
先進世界モデルのための包括的で標準化された推論フレームワークであるOpenWorldLibを紹介します。
我々は,世界モデルとは,複雑な世界を理解し,予測するための,相互作用と長期記憶機能を備えた知覚を中心としたモデルあるいはフレームワークである,という明確な定義を提案する。
この定義に基づいて、OpenWorldLibは、統一されたフレームワーク内でさまざまなタスクにわたるモデルを統合し、効率的な再利用と協調的な推論を可能にします。
論文 参考訳(メタデータ) (2026-04-06T14:19:48Z) - MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines [55.641812280108574]
ユーザアクションによって継続的に更新され,世代別ロールアウトを通じてクエリされるシステムに,明示的な外部メモリを導入する。
この設計により、ユーザーは編集可能なメモリ表現を通じて環境構造を直接、編集可能な制御を行うことができる。
コヒーレントな視点と一貫したクロスプレイヤーインタラクションを備えた、リアルタイムマルチプレイヤーロールアウトに自然に拡張する。
論文 参考訳(メタデータ) (2026-03-03T18:58:17Z) - Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model [19.937724706042804]
Hunyuan-GameCraft-2は生成ゲームワールドモデリングのための命令駆動インタラクションの新しいパラダイムである。
我々のモデルでは,自然言語のプロンプトやキーボード,マウスの信号を通じてゲーム映像のコンテンツを制御することができる。
本モデルでは,時間的コヒーレントかつ因果的な対話型ゲームビデオを生成する。
論文 参考訳(メタデータ) (2025-11-28T18:26:39Z) - WorldGen: From Text to Traversable and Interactive 3D Worlds [87.95088818329403]
本稿では,テキストプロンプトから直接,大規模でインタラクティブな3Dワールドを自動生成するシステムWorldGenを紹介する。
我々のアプローチは、自然言語記述を標準のゲームエンジン内で即座に探索または編集できる完全にテクスチャ化された環境に変換する。
この研究は、ゲーム、シミュレーション、没入型社会環境における応用のための3D生成AIのフロンティアを前進させる、アクセス可能で、大規模に生成可能な世界構築への一歩である。
論文 参考訳(メタデータ) (2025-11-20T22:13:18Z) - Simulating the Visual World with Artificial Intelligence: A Roadmap [48.64639618440864]
ビデオ生成は、視覚的に魅力的なクリップを生成するものから、インタラクションをサポートし、物理的な可視性を維持する仮想環境を構築するものへとシフトしている。
この調査は、この進化の体系的な概要を提供し、現代のビデオ基盤モデルを2つのコアコンポーネントの組み合わせとして概念化した。
4世代にわたる映像生成の進展を追究し,本質的な物理的妥当性を具現化した映像生成モデルを構築した。
論文 参考訳(メタデータ) (2025-11-11T18:59:50Z) - LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation [35.4193352348583]
本稿では,3D環境の産業生産パイプラインを効率化する,シンプルで効果的な3Dワールドジェネレーションフレームワークを提案する。
LatticeWorldは、競合するマルチエージェントインタラクションを特徴とする、動的エージェントを備えた大規模な3Dインタラクティブワールドを生成する。
LatticeWorldは90倍以上の工業生産効率の向上を実現している。
論文 参考訳(メタデータ) (2025-09-05T17:22:33Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z) - WorldDreamer: Towards General World Models for Video Generation via
Predicting Masked Tokens [75.02160668328425]
本稿では,世界物理学と運動の包括的理解を促進する先駆的な世界モデルであるWorldDreamerを紹介する。
WorldDreamerは、教師なしのビジュアルシーケンスモデリングチャレンジとして世界モデリングをフレーム化している。
我々の実験によると、WorldDreamerは自然のシーンや運転環境など、さまざまなシナリオでビデオを生成するのに優れています。
論文 参考訳(メタデータ) (2024-01-18T14:01:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。