論文の概要: GameWAM: A World Action Model for Video Games
- arxiv url: http://arxiv.org/abs/2608.26200v1
- Date: Tue, 25 Aug 2026 17:21:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.120093
- Title: GameWAM: A World Action Model for Video Games
- Title(参考訳): GameWAM:ビデオゲームの世界アクションモデル
- Abstract要約: 我々は,ネイティブなクローズドループゲームプレイとGUI制御のための WAM について,我々の知る限り,GameWAM を紹介した。
協調した世界行動学習を支援するために,ゲームプレイとGUIトラジェクトリを構築した。
実験では、比較されたエージェントよりも実行されたネイティブアクションが少なく、競争力のあるタスク成功を示す。
- 参考スコア(独自算出の注目度): 36.43342575951464
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern video games combine first-person perception, rapid visual changes, persistent world state, and heterogeneous native controls. Existing game agents map visual and task context directly to actions but lack explicit world dynamics modeling, whereas interactive game world models predict visual futures from supplied actions but do not serve as task policies. World-Action Models (WAMs) unify these objectives, but remain largely unexplored under the dynamics and open-ended interaction of video games. We introduce GameWAM, to our knowledge the first WAM for native closed-loop gameplay and GUI control. GameWAM jointly generates future visual observations and executable keyboard-mouse trajectories through parallel visual and action generative processes with block-causal conditioning and flow matching. To support joint world-action learning, we construct synchronized gameplay and GUI trajectories. To handle heterogeneous native control, GameWAM predicts a gameplay/GUI mode at each action step and generates actions with mode-specific prediction distributions and continuous-action normalization. For long-horizon interaction, block-cycle control predicts beyond the committed horizon, executes only a short action prefix, and replans from new observations, while fine-grained within-cycle context and hierarchical cross-cycle history preserve temporal continuity. Experiments demonstrate competitive task success with fewer executed native actions than the compared agents. We further uncover Low-Frequency Action Source Imprinting (LASI), in which low-frequency components of the sampled action source systematically steer coarse generated camera motion under fixed conditioning, revealing a source-sensitivity failure mode in generative control. Project page is available at https://yunncheng.github.io/GameWAM/.
- Abstract(参考訳): 現代のビデオゲームは、一対一の知覚、迅速な視覚的変化、永続的な世界状態、異質なネイティブコントロールを組み合わせている。
既存のゲームエージェントは、視覚的およびタスクコンテキストを直接アクションにマッピングするが、明示的な世界ダイナミクスモデリングを欠いている。
World-Action Models (WAMs) はこれらの目的を統一するが、ビデオゲームのダイナミックスとオープンエンドインタラクションの下では、ほとんど探索されていない。
我々は,ネイティブなクローズドループゲームプレイとGUI制御のための WAM について,我々の知る限り,GameWAM を紹介した。
GameWAMはブロック因果条件付けとフローマッチングによる並列な視覚・行動生成プロセスを通じて、将来の視覚観察とキーボードマウスの軌道を共同で生成する。
協調した世界行動学習を支援するために,ゲームプレイとGUIトラジェクトリを構築した。
不均一なネイティブ制御を扱うため、GameWAMは各アクションステップでゲームプレイ/GUIモードを予測し、モード固有の予測分布と連続アクション正規化を備えたアクションを生成する。
長い水平相互作用のために、ブロックサイクル制御はコミットされた地平線を越えて予測し、短いアクションプレフィックスのみを実行し、新しい観測から再計画し、きめ細かい内部サイクルコンテキストと階層的クロスサイクル履歴は時間的連続性を保存する。
実験では、比較されたエージェントよりも実行されたネイティブアクションが少なく、競争力のあるタスク成功を示す。
さらに、サンプル動作源の低周波成分が固定条件下でシステマティックに粗いカメラモーションを発生させる低周波動作源インプリンティング(LASI)を明らかにし、生成制御におけるソース感度障害モードを明らかにする。
プロジェクトページはhttps://yunncheng.github.io/GameWAM/で公開されている。
関連論文リスト
- Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration [10.110436795631793]
World Action Models (WAM)は、予測的世界モデリングとアクション生成を結合し、将来の状態がエージェントの振る舞いをガイドできるようにする。
我々は、事前訓練された行動条件付き世界モデルを3Dゲームマップの探索と構築のためのWAMに変換するフレームワークであるtextscValerantを提案する。
このフレームワークは、WAMベースのインタラクションを2Dビジュアルシミュレーションを超えて拡張し、3Dゲームマップ作成における手作業の削減に新たなアプローチを提供する。
論文 参考訳(メタデータ) (2026-09-08T20:17:48Z) - From Pixels to States: Rethinking Interactive World Models as Game Engines [32.66997200688335]
本稿では,プレイヤアクションコントロール,ゲーム状態のダイナミクス,状態の持続性,リアルタイムのインタラクティブ生成という4つの側面によるインタラクティブなゲームワールドモデリングについて検討する。
我々はBlack Myth: Wukong用のスケーラブルなデータエンジンを提案し、90時間以上のゲームプレイを、フレーム整列プレーヤーアクション、グラウンドトゥルースゲームステート、視覚的観察で収集する。
論文 参考訳(メタデータ) (2026-07-15T17:48:48Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - ActionParty: Multi-Subject Action Binding in Generative Video Games [117.52562594944679]
ActionPartyは、ゲーム生成のための制御可能な多目的世界モデルである。
46の多様な環境において最大7人のプレイヤーを同時に制御できる最初のビデオワールドモデルを実証する。
論文 参考訳(メタデータ) (2026-04-02T17:59:58Z) - Olaf-World: Orienting Latent Actions for Video World Modeling [100.96069208914957]
アクションコントロール可能な世界モデルのスケーリングは、アクションラベルの不足によって制限される。
大規模受動的ビデオから行動条件付きビデオワールドモデルを事前訓練するパイプラインであるOraf-Worldを紹介する。
論文 参考訳(メタデータ) (2026-02-10T18:58:41Z) - Astra: General Interactive World Model with Autoregressive Denoising [73.6594791733982]
Astraはインタラクティブな汎用世界モデルであり、多様なシナリオのために現実世界の未来を生成する。
本稿では,自己回帰型認知型アーキテクチャを提案し,時間的因果的注意を用いて過去の観測を集約する。
Astraはインタラクティブで一貫性があり、一般的な長期的なビデオ予測を実現し、様々な形式のインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-12-09T18:59:57Z) - Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model [19.937724706042804]
Hunyuan-GameCraft-2は生成ゲームワールドモデリングのための命令駆動インタラクションの新しいパラダイムである。
我々のモデルでは,自然言語のプロンプトやキーボード,マウスの信号を通じてゲーム映像のコンテンツを制御することができる。
本モデルでは,時間的コヒーレントかつ因果的な対話型ゲームビデオを生成する。
論文 参考訳(メタデータ) (2025-11-28T18:26:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。