論文の概要: Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
- arxiv url: http://arxiv.org/abs/2608.24680v1
- Date: Tue, 25 Aug 2026 15:13:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.058676
- Title: Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
- Title(参考訳): Game2World Engine:ワールドモデルトレーニングのためのWildゲームプレイビデオのロック解除
- Abstract要約: ゲームプレイUIのグラウンドと削除を形式化したフルスタックフレームワークであるGameUI-TaxonomyとG2WEngineを紹介する。
G2WEngineは、実際のゲームプレイビデオから再利用可能なUIアセットを自動的に抽出し、クリーンな映像に時間的に一貫性のあるUIオーバーレイを合成する。
Game2Worldをベースとして,マルチモーダルなセマンティック理解とビデオ編集機能を組み合わせたマスクレスゲームプレイUI除去モデルであるGameCleanerを提案する。
- 参考スコア(独自算出の注目度): 10.094308570527923
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video games provide a scalable source of training data for video world models, offering diverse environments, complex interactions, and abundant in-the-wild gameplay videos. However, raw gameplay footage entangles the game world with screen-space interfaces, introducing game-specific biases and irrelevant dynamics that hinder world-model training. To address this problem, we introduce GameUI-Taxonomy and G2WEngine, a full-stack framework that formalizes gameplay UI grounding and removal. G2WEngine automatically extracts reusable UI assets from real gameplay videos and synthesizes temporally coherent UI overlays on clean footage. Using this engine, we construct Game2World, comprising 96K synthetic paired videos with precise reconstruction targets and 1,079 in-the-wild clips from 303 games for realistic evaluation. Its asset library contains 5,132 verified UI elements across 21 taxonomy categories, collected from 1,010 representative gameplay frames. Based on Game2World, we propose GameCleaner, a mask-free gameplay UI removal model that combines multimodal semantic understanding with video editing capabilities. Unlike mask-based methods, GameCleaner directly identifies and removes diverse HUD elements while preserving the underlying scene content and temporal dynamics. In a controlled pilot, world models trained on UI-free gameplay improve overall VideoReward by 6.83% over those trained on UI-overlaid data. On UI-removal evaluation, GameCleaner achieves an average AAR of 95.36 on synthetic videos, outperforming the strongest temporal mask baseline by 57.3%, and obtains the best in-the-wild AAR of 80.05 with 99.8 background preservation. These results demonstrate the scalable potential of transforming Internet gameplay videos into high-quality world-model training data. Code, dataset, and model will be available at https://github.com/Dongping-Chen/Game2World.
- Abstract(参考訳): ビデオゲームは、多様な環境、複雑な相互作用、豊富なゲームプレイビデオを提供する、ビデオワールドモデルのためのトレーニングデータのスケーラブルなソースを提供する。
しかし、生のゲームプレイ映像は、ゲームの世界をスクリーン空間のインターフェースで絡み合わせることで、ゲーム固有のバイアスや、ワールドモデルトレーニングを妨げる無関係なダイナミクスを導入している。
この問題に対処するために,ゲームプレイUIの接地と削除を形式化するフルスタックフレームワークであるGameUI-TaxonomyとG2WEngineを紹介する。
G2WEngineは、実際のゲームプレイビデオから再利用可能なUIアセットを自動的に抽出し、クリーンな映像に時間的に一貫性のあるUIオーバーレイを合成する。
このエンジンを用いて、正確な再構成対象となる96Kの合成ペアビデオと303のゲームから1079の内蔵クリップをリアルに評価するGame2Worldを構築した。
資産ライブラリには、21の分類カテゴリーにまたがる5,132のUI要素が含まれており、1,010の代表的なゲームプレイフレームから収集されている。
Game2Worldをベースとして,マルチモーダルなセマンティック理解とビデオ編集機能を組み合わせたマスクレスゲームプレイUI除去モデルであるGameCleanerを提案する。
GameCleanerはマスクベースの方法とは異なり、背景となるシーンの内容と時間的ダイナミクスを保存しながら、さまざまなHUD要素を直接識別し、削除する。
コントロールされたパイロットでは、UIなしのゲームプレイでトレーニングされた世界モデルは、UIオーバーレイデータでトレーニングされたモデルよりもビデオリワード全体の6.83%改善した。
UI除去評価では、GameCleanerは合成ビデオ上で平均95.36のAARを達成し、最も高い時間マスクベースラインを57.3%上回り、最高の80.05のAARと99.8のバックグラウンド保存が得られる。
これらの結果は,インターネットゲームプレイ映像を高品質なワールドモデルトレーニングデータに変換する,スケーラブルな可能性を示している。
コード、データセット、モデルはhttps://github.com/Dongping-Chen/Game2Worldで入手できる。
関連論文リスト
- EgoCS-400K: An Egocentric Gameplay Dataset for World Models [53.9389499966106]
EgoCS-400Kは,世界モデルのための大規模リプレイ・グラウンド型Egocentric Counter-Strikeデータセットである。
パブリックプロのCSとCS2のマッチデモから作られ、人間のゲームプレイの軌跡を保存している。
EgoCS-400Kには、1000以上の試合と4万回以上のラウンドから40万人以上の個人ビデオと1万時間のゲームプレイが含まれている。
論文 参考訳(メタデータ) (2026-06-16T17:13:58Z) - GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine? [65.42976417627254]
ゲーム生成はゲームエンジン内で行われ、スクリプト、シーン、アセット、レンダリング、実行時インタラクションは共同でコヒーレントなゲームプレイを生成する必要がある。
我々は、完全なゲームアーティファクトを生成する問題として、エンド・ツー・エンドのゲーム生成を形式化する。
我々は、このフレームワークを15のゲームファミリーで140のGodotタスクからなるベンチマークであるGameCraft-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-06-16T12:34:39Z) - Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos [82.4003989236851]
本稿では,物理世界理解のためのリッチでスケーラブルな監視源として,予め定義された物理法則に違反した視覚異常を参照しながら,ゲームプレイビデオのグリッチを利用する新しいパラダイムを提案する。
我々はPhysGameを紹介した。これは5つの物理ドメインと16のきめ細かいカテゴリからなる140,057のグリッチ中心の質問応答ペアを含むデータセットである。
実験の結果、PhysGameはGame2Realの転送性を大幅に向上させ、Qwen2.5VLの物理推論性能を2.5%向上させ、MVBenchベンチマークで1.9%向上した。
論文 参考訳(メタデータ) (2026-01-23T06:02:07Z) - NitroGen: An Open Foundation Model for Generalist Gaming Agents [101.41866522979548]
NitroGenは、ジェネラリストゲームエージェントのためのビジョンアクション基盤モデルである。
1000以上のゲームで4万時間のゲームプレイビデオでトレーニングされている。
論文 参考訳(メタデータ) (2026-01-04T16:24:50Z) - Automated Bug Frame Retrieval from Gameplay Videos Using Vision-Language Models [47.63488459021783]
報告されたバグ記述に最もよくマッチする単一のフレームに、各動画を縮小するパイプラインを導入する。
このアプローチは手作業を大幅に削減し、トリアージと回帰チェックを高速化します。
ゲーム業界全体で品質保証チームや開発者に実践的なメリットを提供する。
論文 参考訳(メタデータ) (2025-08-06T21:52:15Z) - VideoGameBench: Can Vision-Language Models complete popular video games? [8.5302862604852]
ビデオゲームは、人間が自然に帰納的バイアスを生かして学習し、習得するために直感的に作られている。
1990年代にVLMが直接リアルタイムに対話する人気ゲーム10種からなるベンチマークであるVideoGameBenchを紹介する。
その結果,フロンティア・ビジョン言語モデルは,ゲーム開始以降の進行に苦慮していることがわかった。
論文 参考訳(メタデータ) (2025-05-23T17:43:27Z) - Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion
Models [68.85478477006178]
ニューラルビデオゲームシミュレータのためのPGM(Promptable Game Model)を提案する。
ユーザーは高レベルのアクションシーケンスと低レベルのアクションシーケンスでゲームを実行することができる。
私たちのPGMは、エージェントの目標をプロンプトの形で指定することで、ディレクターのモードをアンロックします。
提案手法は,既存のニューラルビデオゲームシミュレータのレンダリング品質を著しく上回り,現在の最先端の能力を超えたアプリケーションをアンロックする。
論文 参考訳(メタデータ) (2023-03-23T17:43:17Z) - CLIP meets GamePhysics: Towards bug identification in gameplay videos
using zero-shot transfer learning [4.168157981135698]
本稿では,関連するゲームプレイ映像を検索するために,英語のテキストクエリを入力として受け入れる検索手法を提案する。
われわれのアプローチは外部情報(ビデオメタデータなど)に頼らない。
我々のアプローチの例としては、ビデオゲームのバグを再現するためのゲームプレイ用ビデオ検索エンジンがある。
論文 参考訳(メタデータ) (2022-03-21T16:23:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。