論文の概要: PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
- arxiv url: http://arxiv.org/abs/2608.13552v2
- Date: Fri, 14 Aug 2026 09:46:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.245283
- Title: PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
- Title(参考訳): PlayWorld: 長期的目的に対するエージェントプレーヤーによるワールドモデルのベンチマーク
- Authors: Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao,
- Abstract要約: ビデオワールドモデルは、現在の観察とユーザーアクションに基づいて、将来の状態をシミュレートする。
近年のシステムでは、長いシーケンス上での映像の一貫性とアクション制御性が顕著に示されている。
しかし、これらのインタラクティブモデルを比較することは依然として困難だ。
我々はマルチモーダル・エージェント・プレイヤーを用いて、特定の長距離目標に向けて世界モデルと対話する。
- 参考スコア(独自算出の注目度): 86.3073067035531
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video world models simulate future states conditioned on current observations and user actions. Recent systems have demonstrated impressive video consistency and action controllability over long sequences. However, fairly comparing these interactive models remains challenging. In practice, a human player typically evaluates a world model by pursuing long-horizon objectives through interaction. For example, a user may turn around 360 degrees to see whether the environment remains consistent, or walk into the water and inspect whether realistic water ripples are generated. The action sequence required to achieve the same objective may vary substantially between models, making fixed action-conditioned evaluation unsuitable for cross-model comparison. To address this, we employ multi-modal Agent Players to interact with world models toward specified long-horizon objectives. Building on this paradigm, we introduce PlayWorld, a benchmark providing 171 scenarios, each with a specified objective. To evaluate performance thoroughly, we assess models along four core dimensions: geometry consistency, interaction fidelity, out-of-sight evolution, and insight evolution. In addition, we incorporate basic ability metrics for video quality and controllability. Experiments across nine state-of-the-art world models reveal that current models remain unreliable on long-horizon interactive objectives, particularly in maintaining spatial consistency and persistent state evolution. Code and data are available at https://github.com/kxding/PlayWorld.
- Abstract(参考訳): ビデオワールドモデルは、現在の観察とユーザーアクションに基づいて、将来の状態をシミュレートする。
近年のシステムでは、長いシーケンス上での映像の一貫性とアクション制御性が顕著に示されている。
しかし、これらのインタラクティブモデルを比較することは依然として困難である。
実際には、人間プレイヤーは通常、相互作用を通じて長期の目的を追求することで世界モデルを評価する。
例えば、ユーザは360度回転して、環境が安定しているかどうかを確認したり、水の中を歩き、リアルな水滴が生成されるかどうかを調べたりすることができる。
同じ目的を達成するために必要なアクションシーケンスは、モデル間で大きく異なる場合があるため、モデルの相互比較には不適当である。
これを解決するために,マルチモーダルエージェントプレイヤーを用いて,特定の長期的目的に向けて世界モデルと対話する。
このパラダイムに基づいて、171のシナリオを提供するベンチマークであるPlayWorldを紹介します。
性能を徹底的に評価するために、幾何整合性、相互作用の忠実性、視界外進化、洞察進化の4つの中核次元に沿ったモデルを評価する。
さらに,ビデオ品質と制御性に関する基本的な能力指標も取り入れた。
9つの最先端世界モデルに対する実験により、現在のモデルは、特に空間的な一貫性と永続的な状態の進化を維持するために、長期的な対話的な目的に対して信頼できないままであることが明らかとなった。
コードとデータはhttps://github.com/kxding/PlayWorldで公開されている。
関連論文リスト
- Trimming the Long-Tail of Visual World Modeling Evaluation [67.17191772079316]
本論文では,不規則な物理的相互作用をシミュレートするために世界モデルに挑戦するベンチマークであるTailor-Benchを紹介する。
通常のシナリオは共通のツールとタスクのペアを反映し、従来型のツールを属性互換の代替品に置き換え、Impossibleシナリオは属性違反ツールを導入している。
実験結果から,物理世界モデリングの長期的ギャップは明らかであり,共通相互作用を超越した一般化の限界が示唆された。
論文 参考訳(メタデータ) (2026-06-23T07:43:41Z) - WorldOlympiad: Can Your World Model Survive a Triathlon? [39.69359039523777]
我々は,物理忠実度,幾何整合性,相互作用忠実度にまたがるビデオベース世界モデルの診断のためのベンチマークであるWorldOlympiadを紹介する。
WorldOlympiadは、世界モデルの評価を3つの相補的な次元に分解する。
論文 参考訳(メタデータ) (2026-06-09T17:24:36Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation [56.5415838759151]
WBenchはインタラクティブな世界モデルを評価するための総合的なベンチマークである。
ビデオの品質、セッティングアテンジェンス、インタラクションアテンデンス、一貫性、物理コンプライアンスをカバーしている。
289件のテストケースと1,058件のインタラクション・ターンが含まれており、多様なシーン、スタイル、主題、一対三の視点をカバーしている。
論文 参考訳(メタデータ) (2026-05-25T14:01:31Z) - iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework [27.208236690012914]
iWorld-Benchは、インタラクション関連の能力に関するワールドモデルのトレーニングとテストのためのベンチマークである。
330kのビデオクリップによる多様なデータセットを構築し、さまざまな視点、天気、シーンをカバーする2.1kの高品質なサンプルを選択した。
論文 参考訳(メタデータ) (2026-05-05T16:30:03Z) - WorldMark: A Unified Benchmark Suite for Interactive Video World Models [29.83820642224732]
We introduced WorldMark, the first benchmark that provide a common play field for interactive Image-to-Video world models。
ワールドマークは、(1)共通のWASDスタイルのアクション語彙を各モデルのネイティブコントロール形式に変換し、同一のシーンと軌跡の6つの主要モデル間でリンゴとアプリの比較を可能にする統一アクションマッピング層、(2)1人目と3人目、フォトリアリスティックでスタイリングされたシーン、そして容易からハードまでの3つの難易度を含む500の評価ケースの階層的なテストスイート、(3)視覚品質、制御アライメント、世界一貫性のためのモジュラー評価ツールキット
論文 参考訳(メタデータ) (2026-04-23T13:50:47Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z) - GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control [122.65089441381741]
一般化可能なエゴビジョン・マルチモーダル世界モデルであるGEMについて述べる。
参照フレーム、スパース機能、人間のポーズ、エゴ軌道を使って将来のフレームを予測する。
私たちのデータセットは、自律運転、エゴセントリックな人間活動、ドローン飛行など、複数の領域にまたがる4000時間以上のマルチモーダルデータで構成されています。
論文 参考訳(メタデータ) (2024-12-15T14:21:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。