論文の概要: Multiplayer Interactive World Models with Representation Autoencoders
- arxiv url: http://arxiv.org/abs/2607.05352v1
- Date: Mon, 06 Jul 2026 17:31:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.2651
- Title: Multiplayer Interactive World Models with Representation Autoencoders
- Title(参考訳): 表現オートエンコーダを用いた多人数対話型世界モデル
- Abstract要約: 複雑な物理的相互作用によって制御される高度に動的な環境に対する最初のマルチプレイヤー世界モデルを導入する。
我々は,この問題をRocket Leagueのゲームで研究し,高速で密結合したダイナミックスの下でプレイヤーが競争し,協力する。
- 参考スコア(独自算出の注目度): 28.451678067070777
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce the first multiplayer world model for highly dynamic environments governed by complex physical interactions. Whereas single-player world models treat the other agents as part of the environment, ours conditions on the action streams of multiple agents, learning to attribute changes in the scene to the correct player and to stay coherent under arbitrary combinations of their actions. We study this problem in the game of Rocket League, where players compete and cooperate under fast, tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, our 5-billion-parameter latent diffusion model generates four-player matches in real time, producing 20 frames per second on a single Nvidia B200 GPU. Although trained only on short clips, its rollouts stay stable far beyond the training horizon: distributional quality holds steady out to five minutes, the longest horizon we measure, and in practice we observe rollouts continuing for hours with no sign of collapse. We systematically investigate the central design choices: the video codec, the generative objective, and the multiplayer conditioning scheme. In addition, we characterize how behavior changes with model and data scale, including the capabilities that emerge and the failure modes that persist. We further develop targeted evaluations that probe the model's physical understanding rather than visual appearance alone. To support continued research on multiplayer world models, we release our dataset, our full training and inference codebase, and a live demo.
- Abstract(参考訳): 複雑な物理的相互作用によって制御される高度に動的な環境に対する最初のマルチプレイヤー世界モデルを導入する。
シングルプレイヤーの世界モデルは、他のエージェントを環境の一部として扱うのに対し、複数のエージェントのアクションストリームの条件は、シーンの変化を正しいプレイヤーに属性付けし、アクションの任意の組み合わせの下で一貫性を保つことを学習する。
我々は,この問題をRocket Leagueのゲームで研究し,高速で密結合したダイナミックスの下でプレイヤーが競争し,協力する。
公開ボットで収集された1万時間分のゲームプレイに基づいて、我々の5億パラメータの潜伏拡散モデルがリアルタイムで4つのプレイヤーマッチを生成し、1台のNvidia B200 GPUで毎秒20フレームを生成する。
短いクリップでしか訓練されていないが、そのロールアウトはトレーニングの地平線をはるかに越えて安定している。
本稿では,ビデオコーデック,生成目的,マルチプレイヤー条件付け方式などの中心的設計選択を体系的に検討する。
さらに、モデルとデータスケールによる振る舞いの変化の特徴として、出現する機能や持続する障害モードなどを挙げる。
さらに、視覚的外観のみではなく、モデルの物理的理解を探索するターゲット評価を開発する。
マルチプレイヤーの世界モデルに関する継続的な研究をサポートするため、データセット、完全なトレーニングと推論コードベース、ライブデモをリリースしています。
関連論文リスト
- PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives [86.3073067035531]
ビデオワールドモデルは、現在の観察とユーザーアクションに基づいて、将来の状態をシミュレートする。
近年のシステムでは、長いシーケンス上での映像の一貫性とアクション制御性が顕著に示されている。
しかし、これらのインタラクティブモデルを比較することは依然として困難だ。
我々はマルチモーダル・エージェント・プレイヤーを用いて、特定の長距離目標に向けて世界モデルと対話する。
論文 参考訳(メタデータ) (2026-08-13T17:59:30Z) - Infinite Worlds with Versatile Interactions [72.56254206708059]
LingBot-World 2.0(LingBot-World-Infinity)は、LingBot-Worldの先進的なイテレーションである。
今回のアップデートでは、より広い範囲のアクションを含む、非常に多様なインタラクティブな要素が導入されている。
共有体験を容易にするために,複数のプレイヤーが同時にこの鮮やかな世界シミュレータに没入できるインタフェースを開発した。
論文 参考訳(メタデータ) (2026-07-08T15:33:25Z) - EgoCS-400K: An Egocentric Gameplay Dataset for World Models [53.9389499966106]
EgoCS-400Kは,世界モデルのための大規模リプレイ・グラウンド型Egocentric Counter-Strikeデータセットである。
パブリックプロのCSとCS2のマッチデモから作られ、人間のゲームプレイの軌跡を保存している。
EgoCS-400Kには、1000以上の試合と4万回以上のラウンドから40万人以上の個人ビデオと1万時間のゲームプレイが含まれている。
論文 参考訳(メタデータ) (2026-06-16T17:13:58Z) - ActionParty: Multi-Subject Action Binding in Generative Video Games [117.52562594944679]
ActionPartyは、ゲーム生成のための制御可能な多目的世界モデルである。
46の多様な環境において最大7人のプレイヤーを同時に制御できる最初のビデオワールドモデルを実証する。
論文 参考訳(メタデータ) (2026-04-02T17:59:58Z) - Solaris: Building a Multiplayer Video World Model in Minecraft [25.935990718354176]
既存のアクション条件付きビデオ生成モデル(ビデオワールドモデル)は、単一エージェントの視点に限られる。
我々は,一貫したマルチビュー観測をシミュレートするマルチプレイヤービデオワールドモデルSolarisを紹介する。
我々は1264万のマルチプレイヤーフレームを収集し、マルチプレイヤー運動、メモリ、グラウンド、ビルディング、ビュー整合性の評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-25T18:59:01Z) - DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos [110.98100817695307]
私たちはDreamDojoを紹介します。DreamDojoは、多種多様なインタラクションと、エゴセントリックな人間ビデオの44万時間から厳密なコントロールを学ぶ基礎的な世界モデルです。
本研究は, 遠隔操作, 政策評価, モデルベース計画など, 生成的世界モデルに基づくいくつかの重要な応用を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:49:43Z) - NitroGen: An Open Foundation Model for Generalist Gaming Agents [101.41866522979548]
NitroGenは、ジェネラリストゲームエージェントのためのビジョンアクション基盤モデルである。
1000以上のゲームで4万時間のゲームプレイビデオでトレーニングされている。
論文 参考訳(メタデータ) (2026-01-04T16:24:50Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z) - MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft [21.530000271719803]
我々はMinecraft上でリアルタイムインタラクティブな世界モデルであるMineWorldを提案する。
MineWorldはビジュアルアクション自動回帰トランスフォーマーによって駆動され、ペア化されたゲームシーンと対応するアクションを入力として取り込む。
本研究では,各フレームの空間的冗長トークンを同時に予測する並列デコーディングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-04-11T09:41:04Z) - From Motor Control to Team Play in Simulated Humanoid Football [56.86144022071756]
我々は、現実的な仮想環境でサッカーをするために、物理的にシミュレートされたヒューマノイドアバターのチームを訓練する。
一連の段階において、プレイヤーはまず、現実的な人間のような動きを実行するために、完全に関節化された身体を制御することを学習する。
その後、ドリブルやシューティングといった中級のサッカーのスキルを身につける。
最後に、彼らは他の人を意識し、チームとしてプレーし、ミリ秒のタイムスケールで低レベルのモーターコントロールのギャップを埋める。
論文 参考訳(メタデータ) (2021-05-25T20:17:10Z) - Mastering Atari with Discrete World Models [61.7688353335468]
本稿では,強力な世界モデルのコンパクトな潜伏空間における予測から純粋に振る舞いを学習する強化学習エージェントであるDreamerV2を紹介する。
DreamerV2は、Atariベンチマークにおいて、個別に訓練された世界モデル内での振る舞いを学習することで、55タスクの人間レベルのパフォーマンスを達成する最初のエージェントである。
論文 参考訳(メタデータ) (2020-10-05T17:52:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。