論文の概要: PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence
- arxiv url: http://arxiv.org/abs/2610.07127v1
- Date: Mon, 05 Oct 2026 17:52:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.569464
- Title: PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence
- Title(参考訳): PlaySuite:インタラクティブなビジュアルインテリジェンスのための大規模ベンチマーク
- Abstract要約: 5K以上のオープンソースのビデオゲームでインタラクティブなビジュアルインテリジェンスを評価するための大規模なベンチマークであるPlaySuiteを紹介した。
異種タイトル間のスケーラブルな評価を実現するため,HPCクラスタ向けに最適化された統合クローズドループインタラクションフレームワークを開発した。
- 参考スコア(独自算出の注目度): 46.0545232516101
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in multimodal foundation models yield strong performance on static perception and reasoning benchmarks, yet such evaluations largely overlook a central aspect of intelligence: acting competently in dynamic environments over extended time horizons. We introduce PlaySuite, a large-scale benchmark for evaluating interactive visual intelligence across more than 5K open-source video games curated from PyWeek and itch.io. Spanning diverse genres and engines, including Pygame, HTML5, Godot, and Unity, these independent games are largely out-of-distribution for current models, reducing the likelihood that success can be achieved by retrieving memorized walkthroughs or web-scale training artifacts. To enable scalable evaluation across heterogeneous titles, we develop a unified closed-loop interaction framework optimized for HPC clusters alongside a Video-LLM-as-a-judge protocol that maps observable gameplay milestones to standardized progress levels. We evaluate fourteen recent open models spanning vision-language models, computer-use agents, and vision-language-action models. Our results yield strong evidence of a perception-action gap: despite strong reasoning capabilities, current models struggle to make sustained progress and exhibit recurring failures in spatial grounding, action execution, and self-correction. PlaySuite provides a reproducible and extensible testbed for measuring progress from visual perception to goal-directed interaction, and a foundation for developing models that can act, adapt, and generalize in dynamic visual environments.
- Abstract(参考訳): 近年のマルチモーダル基礎モデルの進歩は、静的知覚と推論のベンチマークにおいて強いパフォーマンスをもたらすが、そのような評価は、時間的地平線を超えて動的環境において有能に作用する、知性の中心的な側面をほとんど見落としている。
PyWeekとitch.ioからキュレートされた5K以上のオープンソースのビデオゲームでインタラクティブなビジュアルインテリジェンスを評価するための大規模なベンチマークであるPlaySuiteを紹介した。
Pygame、HTML5、Godot、Unityなど、さまざまなジャンルやエンジンにまたがって、これらの独立したゲームは、現在のモデルにはほとんど分布していないため、記憶されたウォークスルーやWebスケールのトレーニングアーティファクトを取得することで、成功が達成できる可能性を減らすことができる。
異種タイトル間のスケーラブルな評価を実現するため,HPCクラスタ向けに最適化された統合クローズドループインタラクションフレームワークと,観測可能なゲームプレイマイルストーンを標準化された進捗レベルにマッピングするVideo-LLM-as-a-judgeプロトコルを開発した。
我々は、視覚言語モデル、コンピュータ利用エージェント、視覚言語アクションモデルにまたがる14の最近のオープンモデルを評価する。
強い推論能力にもかかわらず、現在のモデルは持続的な進行に苦慮し、空間的接地、行動実行、自己補正の繰り返し失敗を示す。
PlaySuiteは、視覚知覚から目標指向インタラクションへの進歩を測定するための再現可能で拡張可能なテストベッドと、動的視覚環境において行動し、適応し、一般化できるモデルを開発するための基盤を提供する。
関連論文リスト
- PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives [86.3073067035531]
ビデオワールドモデルは、現在の観察とユーザーアクションに基づいて、将来の状態をシミュレートする。
近年のシステムでは、長いシーケンス上での映像の一貫性とアクション制御性が顕著に示されている。
しかし、これらのインタラクティブモデルを比較することは依然として困難だ。
我々はマルチモーダル・エージェント・プレイヤーを用いて、特定の長距離目標に向けて世界モデルと対話する。
論文 参考訳(メタデータ) (2026-08-13T17:59:30Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models [84.27290155010533]
本稿では,視覚中心型多機能ゲーム評価(V-MAGE)について紹介する。
V-MAGEは、30以上の慎重に構築された評価シナリオからなる5つの異なるビデオゲームを特徴としている。
V-MAGEは、動的かつインタラクティブな設定において、MLLMの視覚的および推論能力を改善するために実行可能な洞察を提供する。
論文 参考訳(メタデータ) (2025-04-08T15:43:01Z) - clembench-2024: A Challenging, Dynamic, Complementary, Multilingual Benchmark and Underlying Flexible Framework for LLMs as Multi-Action Agents [19.989503513817095]
大きな言語モデルは、特定の能力を探索する会話ゲームに"セルフプレイ"するよう促すことができる。
本稿では,このようなゲームプレイ環境を構築するためのフレームワークの1つを取り上げ,その有効性を評価機器として検証する。
論文 参考訳(メタデータ) (2024-05-31T14:43:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。