論文の概要: RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement
- arxiv url: http://arxiv.org/abs/2609.39045v1
- Date: Wed, 30 Sep 2026 05:54:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.246888
- Title: RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement
- Title(参考訳): RSIGame: 再帰的自己改善による自律エージェントゲーム開発
- Abstract要約: RSIGameは自律型エージェントゲーム開発フレームワークである。
開発を補完的なローカルループとグローバルループに編成する。
開発予算の整合でゲーム品質を継続的に改善する。
- 参考スコア(独自算出の注目度): 47.08383845381285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models have made automatic game generation increasingly feasible, yet reliably improving generated games beyond a playable version remains challenging. Naive iterative refinement can easily overfit a small set of test cases, producing fragile games with unresolved bugs, missing behaviors, and poor generalization to broader player interactions. We introduce RSIGame, an autonomous agentic game development framework with recursive self-improvement. RSIGame organizes development into complementary local and global loops. Concretely, a local explore-diagnose-improve loop broadly explores the executable game, diagnoses and prioritizes discovered issues, and performs evidence-grounded revision, where an evolving checklist continually accumulates new testing and improvement guidance. A global loop tracks overall quality, preserves the best checkpoint, and detects saturation or regression over long-horizon development. Beyond test-time improvement, RSIGame further internalizes successful development experience into the generator through training. Across 140 GameCraft-Bench tasks, two game engines, and five generators, RSIGame consistently improves game quality under matched development budgets. Notably, experience internalization enables Qwen3.8-27B to reach 61.38 on Godot and 58.53 on Phaser, exceeding GPT-5.5 one-shot scores while reducing Qwen's generation tokens by 11 times.
- Abstract(参考訳): 大規模言語モデルの最近の進歩により、自動ゲーム生成はますます実現可能になったが、プレイ可能なバージョンを超えて、確実に生成されたゲームを改善することは困難である。
反復的な改善は、少数のテストケースに容易に適合し、未解決のバグ、動作の欠如、より広範なプレイヤーの相互作用への一般化が不十分な脆弱なゲームを生成する。
本稿では,再帰的な自己改善を伴う自律型エージェントゲーム開発フレームワークであるRSIGameを紹介する。
RSIGameは開発を補完的なローカルループとグローバルループに編成する。
具体的には、ローカルな探索・診断・改善ループが実行可能ゲームを幅広く探索し、発見された問題を診断・優先順位付けし、エビデンスに基づく修正を行い、進化するチェックリストが新しいテスト・改善ガイダンスを継続的に蓄積する。
グローバルループは、全体的な品質を追跡し、最高のチェックポイントを保持し、長期開発における飽和や回帰を検出する。
テスト時間の改善以外にも、RSIGameは、トレーニングを通じて開発エクスペリエンスをジェネレータに内包する。
140のGameCraft-Benchタスク、2つのゲームエンジン、5つのジェネレータで、RSIGameは一致した開発予算の下でゲーム品質を継続的に改善する。
特に、経験的な内部化により、Qwen3.8-27B は Godot の 61.38 と Phaser の 58.53 に到達し、GPT-5.5 のワンショットスコアを超え、Qwen の生成トークンを 11 倍削減できる。
関連論文リスト
- GameXpert-Bench: How Far Are Coding Agents from Expert Game Development? [6.806647989372878]
最近の大規模言語モデル(LLM)は、自然言語要求から完全なゲームを構築するコーディングエージェントとして動作する。
ゲーム開発は、プログラムロジック、ビジュアルおよびオーディオコンテンツ、インタフェース、インタラクション、プレイ容易性が一つの実行可能アーティファクトで一緒に機能する必要があるため、特に要求がある。
完全な人間エージェント開発軌跡の分析では,コーディングエージェントを用いてゲーム開発のライフサイクルにまたがる3つの段階を同定する。
論文 参考訳(メタデータ) (2026-08-22T08:05:16Z) - An Exploratory Case Study of LLM-Assisted Refactoring and Gameplay Feature Generation in an Endless Runner Game [0.0]
本稿では,Python/Pygame endless runner における GPT-4o の探索的ケーススタディを提案する。
本稿では,既存のゲームソフトウェアシステムにおけるLLM支援・ゲームプレイ機能生成の可能性と限界について,透明なケースベースで考察する。
論文 参考訳(メタデータ) (2026-06-19T07:19:08Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers [1.6086198362375759]
我々は,大規模言語モデルがソフトウェアバグを自律的に検出できるかどうかを評価するために,ゲーム品質保証ベンチマーク(GBQA)を導入する。
このベンチマークは、ゲームを開発し、スケーラブルな方法でバグを注入するマルチエージェントシステムを使用して構築されている。
実験では、最良のパフォーマンスモデルであるClaude-4.6-Opusが、検証されたバグの48.39%しか特定していない。
論文 参考訳(メタデータ) (2026-04-03T02:23:50Z) - GameDevBench: Evaluating Agentic Capabilities Through Game Development [49.19956546746812]
ゲーム開発は、エージェントが本質的にマルチモーダル資産を操作しながら大きな密集物をナビゲートしなければならないようなテストベッドを提供する。
本稿では,ゲーム開発タスクにおけるエージェント評価のための最初のベンチマークであるGameDevBenchを紹介する。
エージェントは依然としてゲーム開発に苦戦しており、最高のエージェントは54.5%のタスクしか解決していない。
論文 参考訳(メタデータ) (2026-02-11T18:15:11Z) - FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games [56.81554611870848]
我々はFlashAdventureを紹介した。これは、フルストーリーのアーク補完をテストするために設計された、34のFlashベースのアドベンチャーゲームのベンチマークである。
また,ゲームプレイの自動評価装置であるCUA-as-a-Judgeと,長期記憶を利用したエージェントフレームワークであるCOASTを提案する。
実験では、現在のGUIエージェントがフルストーリーのアークに苦しむのに対して、COASTは観察と振る舞いのギャップを埋めることでマイルストーンの完了を改善する。
論文 参考訳(メタデータ) (2025-09-01T01:33:16Z) - BDD-Based Framework with RL Integration: An approach for videogames
automated testing [0.0]
ビデオゲームのテストは、従来のソフトウェア開発のプラクティスとは異なる。
振る舞い駆動開発(BDD)と強化学習(RL)の統合を提案する。
論文 参考訳(メタデータ) (2023-10-08T20:05:29Z) - Deep Policy Networks for NPC Behaviors that Adapt to Changing Design
Parameters in Roguelike Games [137.86426963572214]
例えばRoguelikesのようなターンベースの戦略ゲームは、Deep Reinforcement Learning(DRL)にユニークな課題を提示する。
複雑なカテゴリ状態空間をより適切に処理し、設計決定によって強制的に再訓練する必要性を緩和する2つのネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2020-12-07T08:47:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。