論文の概要: SpeedrunBench: Challenging LLM Agents with Video Game Speedrunning
- arxiv url: http://arxiv.org/abs/2610.08076v1
- Date: Tue, 06 Oct 2026 10:06:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.927849
- Title: SpeedrunBench: Challenging LLM Agents with Video Game Speedrunning
- Title(参考訳): SpeedrunBench: ビデオゲームのスピードランニングでLLMエージェントを満足させる
- Abstract要約: LLMエージェントは、人間が測定可能なソリューションを持つ、ますます複雑なタスクを解決できることが示されている。
このことは、LLMのエージェントが人類がすでに解決した問題を超えることができるかどうかという、関連する疑問を提起する。
本稿では,ゲームスピードランニングのコミュニティ実践を通じて,エージェントのこのような戦略形成能力について検討する。
- 参考スコア(独自算出の注目度): 5.824899281958661
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frontier LLM agents have been shown to be capable of solving increasingly complex tasks for which humans have measurable solutions. This begs the pertinent question of whether LLM agents can go beyond what humans have already solved. The ability to develop sophisticated strategies to tackle consequential problems becomes paramount as well-trodden, human-developed solutions become insufficient for problems for which we lack context or enough training data. We study agents' capability of such strategy formation through the communal practice of video game speedrunning. In speedrunning, practitioners compete to find the fastest way to complete a video game under certain conditions, and in so doing uncovering interesting unorthodox play styles that require a thorough understanding and mastery of the underlying game mechanics. We introduce SPEEDRUNBENCH, a benchmark that evaluates frontier LLM agents across 9 different games. To perform well in this benchmark, agents must repeatedly improve their strategy, reflect on their performance, exploit their gained knowledge, and reason across a long-horizon of actions to improve on an increasingly difficult problem: being faster than themselves and everyone else. Our experiments show that while frontier agents approach human world records in simple platformer games, they remain behind human performance on longer, more complex games under practical budgets. These results suggest that SPEEDRUNBENCH is a useful testbed for studying agents' strategy formation capabilities as well as being a saturation-resistant evaluation measure, as there is almost always a faster completion time waiting to be discovered.
- Abstract(参考訳): 最前線のLSMエージェントは、人間が測定可能なソリューションを持つ、ますます複雑なタスクを解決できることが示されている。
このことは、LLMのエージェントが人類がすでに解決した問題を超えることができるかどうかという、関連する疑問を提起する。
逐次的問題に取り組むための高度な戦略を開発する能力が最重要となり、文脈や十分な訓練データがない問題に対して、人間が開発するソリューションが不十分になる。
本稿では,ゲームスピードランニングのコミュニティ実践を通じて,エージェントのこのような戦略形成能力について検討する。
スピードランニングにおいて、実践者は特定の条件下でビデオゲームを完成させる最速の方法を見つけるために競争し、また、基礎となるゲームの仕組みの理解と熟達を必要とする興味深い非オルソドックスなプレイスタイルを明らかにするために競う。
本研究では,9つのゲームにまたがるフロンティアLSMエージェントを評価するベンチマークSPEEDRUNBENCHを紹介する。
このベンチマークでうまく機能するためには、エージェントは戦略を何度も改善し、そのパフォーマンスを反映し、得られた知識を活用し、より困難な問題、すなわち自分自身や他の誰よりも速いことを改善するために、長期にわたる行動の理由付けをしなければならない。
我々の実験によると、フロンティアエージェントは単純なプラットフォームゲームでは人間の世界記録に近づいたが、実用予算下ではより長く複雑なゲームでは人間のパフォーマンスに遅れがないことが示されている。
これらの結果から,SPEEDRUNBENCHはエージェントの戦略形成能力や飽和抵抗性評価指標として有用なテストベッドであることが示唆された。
関連論文リスト
- GameBoyWorlds: A Testbed for Self-Improvement in Embodied Video Games [26.012956392855628]
ビデオゲームにおけるエージェントによる自己改善のためのテストベッドであるGameBoyWorldsを紹介する。
GameBoyWorlds-Executionは、5つの異なるゲームシリーズのコレクション上でタスク実行を評価する。
エージェントは専用のトレーニングゲームにアクセスできるが、デモ、ドキュメンテーション、報酬は提供されない。
論文 参考訳(メタデータ) (2026-09-25T23:55:38Z) - Play Like Champions: Counterfactual Feedback Generation in Latent Space [10.090846922590462]
本稿では,反ファクトパス生成のためのフレームワークであるLatent Maps of Performanceを紹介する。
我々は23,305のプロトーナメントリプレイでガイド付き変分オートエンコーダモデルを訓練した。
我々は、私たちが採用しているパスフィニング手法にはトレードオフがあり、将来の研究が人間の改善のためのモデルソリューションの開発に集中することを望んでいると結論づける。
論文 参考訳(メタデータ) (2026-06-30T21:15:34Z) - PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game? [14.698359286590408]
PTCG-Bench は Pok'emon Trading Card Game (PTCG) 上に構築されたベンチマークである。
実験の結果, LLMエージェントは非自明なゲームプレイ性能を達成できるが, 持続的かつ安定した自己進化は依然として困難であることがわかった。
我々はPTCG-Benchが現実的な対話環境におけるハーネス認識および自己進化エージェントの今後の研究を促進することを願っている。
論文 参考訳(メタデータ) (2026-05-28T09:16:22Z) - Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks [83.4942519570046]
大型言語モデル(LLM)はゲームプレイエージェントとして有望な代替手段を提供するが、一貫した長期的意思決定に苦戦することが多い。
我々は、LLM決定エージェントが学習可能なスキルバンクからスキルを回収し、アクションテイクをガイドするコ進化フレームワークであるCOSPLAYを提案する。
当社のフレームワークは,スキル検索とアクション生成を学習するための意思決定エージェントを改良し,スキルバンクエージェントは,契約とともに継続的にスキルを抽出し,洗練し,更新する。
論文 参考訳(メタデータ) (2026-04-22T18:17:17Z) - LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents [10.632179121247466]
LLMエージェントを用いた一般的なゲームテストフレームワークを提案し、広くプレイされている戦略ゲームであるWordleとSlay the Spireでテストする。
LLMは平均的な人間プレイヤーほど動作しないかもしれないが、単純で汎用的なプロンプト技術によって誘導される場合、人間のプレイヤーが示す困難さと統計的に有意で強い相関関係を示す。
このことから, LLM は開発過程におけるゲーム難易度測定に有効である可能性が示唆された。
論文 参考訳(メタデータ) (2024-10-01T18:40:43Z) - ALYMPICS: LLM Agents Meet Game Theory -- Exploring Strategic
Decision-Making with AI Agents [77.34720446306419]
Alympicsは、ゲーム理論の研究にLarge Language Model (LLM)エージェントを利用する、体系的なシミュレーションフレームワークである。
Alympicsは、複雑なゲーム理論の問題を研究するための汎用的なプラットフォームを作成する。
論文 参考訳(メタデータ) (2023-11-06T16:03:46Z) - Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation [52.930183136111864]
我々は,大言語モデル(LLM)を評価するためにスコーラブルネゴシエーション(scorable negotiations)を提案する。
合意に達するには、エージェントは強力な算術、推論、探索、計画能力を持つ必要がある。
我々は、新しいゲームを作成し、進化するベンチマークを持つことの難しさを増大させる手順を提供する。
論文 参考訳(メタデータ) (2023-09-29T13:33:06Z) - SPRING: Studying the Paper and Reasoning to Play Games [102.5587155284795]
我々は,ゲーム本来の学術論文を読み取るための新しいアプローチ,SPRINGを提案し,大言語モデル(LLM)を通してゲームの説明とプレイの知識を利用する。
実験では,クラフトオープンワールド環境の設定下で,異なる形態のプロンプトによって引き起こされる文脈内「推論」の品質について検討した。
我々の実験は、LLMが一貫したチェーン・オブ・シークレットによって誘導されると、洗練された高レベル軌道の完成に大きな可能性があることを示唆している。
論文 参考訳(メタデータ) (2023-05-24T18:14:35Z) - Solving Royal Game of Ur Using Reinforcement Learning [0.0]
我々はモンテカルロ、クラーニング、サーサといった異なる手法を用いてエージェントを訓練し、戦略的なUrゲームを行うための最適なポリシーを学ぶ。
アルゴリズムによる限られたリソースで訓練された場合、全体的なパフォーマンスは向上するが、期待されるSarsaは、学習の高速化に関して有望な結果を示す。
論文 参考訳(メタデータ) (2022-08-23T01:26:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。