論文の概要: GameBoyWorlds: A Testbed for Self-Improvement in Embodied Video Games
- arxiv url: http://arxiv.org/abs/2609.32093v1
- Date: Fri, 25 Sep 2026 23:55:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 03:18:56.839763
- Title: GameBoyWorlds: A Testbed for Self-Improvement in Embodied Video Games
- Title(参考訳): GameBoyWorlds:エボダイドビデオゲームの自己改善テストベッド
- Abstract要約: ビデオゲームにおけるエージェントによる自己改善のためのテストベッドであるGameBoyWorldsを紹介する。
GameBoyWorlds-Executionは、5つの異なるゲームシリーズのコレクション上でタスク実行を評価する。
エージェントは専用のトレーニングゲームにアクセスできるが、デモ、ドキュメンテーション、報酬は提供されない。
- 参考スコア(独自算出の注目度): 26.012956392855628
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Powered by expert guidance, agents can operate in interactive environments; however, it is unclear whether they can learn autonomously from their own experience. To evaluate such self-improvement methods, we introduce GameBoyWorlds, a testbed for agentic self-improvement in video games. GameBoyWorlds-Execution evaluates task execution on a collection of 5 distinct game series. Agents are allowed access to dedicated training games but are provided no demonstrations, documentation, or rewards. Agents must ground themselves in the environment through self-directed exploration and by inferring actionable knowledge from their own experience. At test time, agents must complete short-horizon tasks that evaluate their ability to navigate, interact, and engage with game-specific mechanics in unseen games. Out-of-the-box frontier models complete fewer than 50% of the 500 tasks due to failures in multimodal grounding, establishing that self-improvement methods have room to push performance. We demonstrate that contemporary approaches to self-improvement are lacking, with world modelling and autonomous skill discovery failing, and a novel strategy that uses curiosity-based exploration to write guides achieving only partial success. GameBoyWorlds-Playthrough tests end-to-end game completion in two fan-made Pokémon games. We show that while frontier models have been pre-exposed to official releases such as Pokémon Red, they lack essential information on the games in our testbed. Instead of relying on their parametric knowledge to succeed, agents must learn from their own experience and autonomously improve over the course of the playthrough. We show that a sophisticated agentic pipeline with multimodal memory and hierarchical subgoals fails to reach even the first major milestone in both games, establishing GameBoyWorlds as an ambitious target for self-improving agents.
- Abstract(参考訳): 専門家の指導によって、エージェントは対話的な環境で操作できるが、彼ら自身の経験から自律的に学習できるかどうかは不明だ。
このような自己改善手法を評価するために,ビデオゲームにおけるエージェントによる自己改善のためのテストベッドであるGameBoyWorldsを紹介する。
GameBoyWorlds-Executionは、5つの異なるゲームシリーズのコレクション上でタスク実行を評価する。
エージェントは専用のトレーニングゲームにアクセスできるが、デモ、ドキュメンテーション、報酬は提供されない。
エージェントは、自己指向的な探索と、自身の経験から実行可能な知識を推測することによって、環境に身を置く必要がある。
テスト時にエージェントは、見知らぬゲームでゲーム固有のメカニクスをナビゲートし、対話し、関与する能力を評価する、短期水平タスクを完了しなければならない。
アウト・オブ・ザ・ボックスのフロンティアモデルは、マルチモーダルグラウンドの失敗により500タスクの50%未満を完了し、自己改善手法がパフォーマンスを向上する余地があることを証明した。
自己改善の現代的アプローチには,世界モデリングと自律的スキル発見の失敗,そして好奇心に基づく探索を用いて,部分的な成功を達成したガイドを書く新たな戦略が欠落していることを実証する。
GameBoyWorlds-Playthroughは、2つのファンメイドポケモンゲームでエンド・ツー・エンドのゲーム完了をテストする。
ポケモンレッドのようなオフィシャルリリースにフロンティアモデルが事前公開されたが、テストベッド内のゲームに関する重要な情報が欠如していることが示されています。
成功するためにパラメトリック知識に頼る代わりに、エージェントは自身の経験から学び、プレイスルーを通じて自律的に改善する必要がある。
マルチモーダルメモリと階層的なサブゴールを備えた高度なエージェントパイプラインは、両方のゲームにおいて最初の大きなマイルストーンに達することができず、GameBoyWorldsは自己改善エージェントの野心的なターゲットとして確立されている。
関連論文リスト
- GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay [96.56671308197234]
我々は,多種多様なモデルファミリーに対して,異なる地平線におけるゲームプレイ能力を測定する統一データと評価スイートであるGameHorizonを紹介する。
GameHorizon-Dataは、時間的に整列されたビデオ、プレイヤアクション、マルチホライゾン命令を備えた最初の大規模AAAゲームプレイデータセットである。
再現可能なオフラインおよびステップワイズオンラインテストを備えたGameHorizon-Benchを構築します。
論文 参考訳(メタデータ) (2026-09-21T17:59:33Z) - GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine? [65.42976417627254]
ゲーム生成はゲームエンジン内で行われ、スクリプト、シーン、アセット、レンダリング、実行時インタラクションは共同でコヒーレントなゲームプレイを生成する必要がある。
我々は、完全なゲームアーティファクトを生成する問題として、エンド・ツー・エンドのゲーム生成を形式化する。
我々は、このフレームワークを15のゲームファミリーで140のGodotタスクからなるベンチマークであるGameCraft-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-06-16T12:34:39Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - NitroGen: An Open Foundation Model for Generalist Gaming Agents [101.41866522979548]
NitroGenは、ジェネラリストゲームエージェントのためのビジョンアクション基盤モデルである。
1000以上のゲームで4万時間のゲームプレイビデオでトレーニングされている。
論文 参考訳(メタデータ) (2026-01-04T16:24:50Z) - FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games [56.81554611870848]
我々はFlashAdventureを紹介した。これは、フルストーリーのアーク補完をテストするために設計された、34のFlashベースのアドベンチャーゲームのベンチマークである。
また,ゲームプレイの自動評価装置であるCUA-as-a-Judgeと,長期記憶を利用したエージェントフレームワークであるCOASTを提案する。
実験では、現在のGUIエージェントがフルストーリーのアークに苦しむのに対して、COASTは観察と振る舞いのギャップを埋めることでマイルストーンの完了を改善する。
論文 参考訳(メタデータ) (2025-09-01T01:33:16Z) - VideoGameBench: Can Vision-Language Models complete popular video games? [8.5302862604852]
ビデオゲームは、人間が自然に帰納的バイアスを生かして学習し、習得するために直感的に作られている。
1990年代にVLMが直接リアルタイムに対話する人気ゲーム10種からなるベンチマークであるVideoGameBenchを紹介する。
その結果,フロンティア・ビジョン言語モデルは,ゲーム開始以降の進行に苦慮していることがわかった。
論文 参考訳(メタデータ) (2025-05-23T17:43:27Z) - Automated Play-Testing Through RL Based Human-Like Play-Styles
Generation [0.0]
強化学習は、ビデオゲームのテストを自動化する必要性に対する有望な答えである。
CARMI: aを提示します。
入力として相対測度を持つエージェント。
以前は目に見えないレベルであっても、プレイヤーのプレースタイルをエミュレートできるエージェント。
論文 参考訳(メタデータ) (2022-11-29T14:17:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。