論文の概要: WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
- arxiv url: http://arxiv.org/abs/2608.02603v1
- Date: Mon, 03 Aug 2026 17:59:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.752574
- Title: WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
- Title(参考訳): WorldExam: 鮮明な外観から一貫性のある反応性までのワールドモデルのベンチマーク
- Abstract要約: ビジュアル品質、制御の整合性、空間整合性、世界反応性の4つのレベルにまたがる診断ベンチマークであるWorldExamを紹介した。
8つのタスクにまたがる1,474のケースで構成され、カメラ、アクション、言語駆動モデルパラダイムの統一的な評価をサポートする。
カメラ駆動型モデルはカメラ制御に優れるが,インターフェースは動的相互作用をサポートしていない。
- 参考スコア(独自算出の注目度): 75.96851880065331
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Controllable video generation models are increasingly being developed as world models. Accordingly, evaluating them in this role extends beyond the apparent appearance of generated videos to the inherent reactivity of the worlds they depict: the ability to infer from the scene state how the world should react and to generate plausible consequences not explicitly described in the input. Yet existing benchmarks mainly assess visual quality or explicit instruction fulfillment by checking whether requested actions and interaction outcomes are realized, leaving inherent reactivity underexamined. We introduce WorldExam, a hierarchical diagnostic benchmark spanning four levels: Visual Quality, Control Adherence, Spatial Consistency, and World Reactivity. It comprises 1,474 cases across eight dedicated tasks and supports unified evaluation of camera-, action-, and language-driven model paradigms. The World Reactivity level evaluates scene-conditioned reactions and goal-directed behaviors beyond what is explicitly specified in the input. Evaluation of 20 representative models reveals a clear capability split. Camera-driven models excel at camera control, but their interfaces do not support dynamic interaction; action-driven models control subjects more precisely but often leave the world unresponsive; and language-driven models perform better on interaction but follow complex controls less faithfully. No model combines broad task coverage with consistently strong performance, showing that high visual quality and explicit instruction fulfillment do not guarantee inherent reactivity.
- Abstract(参考訳): 制御可能なビデオ生成モデルは、世界モデルとしてますます発展しつつある。
したがって、これらをこの役割で評価することは、生成されたビデオの見かけから、それらが描写する世界の固有の反応性にまで及んでいる: シーンの状態から世界がどのように反応すべきかを推測し、入力に明示的に記述されていない有望な結果を生成する能力である。
しかし、既存のベンチマークは、要求されたアクションと相互作用の結果が実現されたかどうかを確認し、固有の反応性を過小評価し、視覚的品質または明示的な指示充足を主に評価している。
ビジュアル品質、制御の整合性、空間整合性、世界反応性の4つのレベルにまたがる階層的診断ベンチマークであるWorldExamを紹介した。
8つのタスクにまたがる1,474のケースで構成され、カメラ、アクション、言語駆動モデルパラダイムの統一的な評価をサポートする。
World Reactiveレベルは、入力で明示的に指定されているものを超えて、シーン条件の反応とゴール指向の振る舞いを評価する。
20の代表的なモデルの評価は、明らかな能力分割を明らかにしている。
カメラ駆動モデルは、カメラ制御において優れているが、そのインターフェースは動的相互作用をサポートしない。アクション駆動モデルは、より正確に制御するが、しばしば世界は反応しない。
広範囲なタスクカバレッジと一貫したパフォーマンスを組み合わせたモデルはなく、視覚的品質と明示的な命令充足が固有の反応性を保証していないことを示している。
関連論文リスト
- WorldReward: Reward Modeling for Camera-Conditioned World Models [56.14617966299295]
本稿では,VLMに基づくカメラコンディショニング世界モデルに対するペアワイズ優先報酬モデルであるWorldRewardを紹介する。
WorldRewardは、ペア化されたビデオをアクション整合したチャンクに分解し、各チャンクを構造化された視覚的エビデンスに整理し、ビデオレベルのアクションと視覚的品質の好みに投票することでチャンクレベルの決定を集約する。
WorldReward は GPT-5.5 の3.42 倍、 1.45 倍、および 3.56 倍の3つの次元で最高合意を達成している。
論文 参考訳(メタデータ) (2026-09-03T14:53:53Z) - Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling [44.18914219393549]
エージェントは、タスク固有の、最小限の、意思決定に十分な表現を持つ世界モデルを学ぶことができるかを検討する。
エージェントとワールドモデル間の閉ループシナジーによりこれを実現できる。
論文 参考訳(メタデータ) (2026-07-05T17:02:40Z) - Making Foresight Actionable: Repurposing Representation Alignment in World Action Models [57.23863557252883]
World Action Models (WAMs)は、ビデオ生成モデルを使用して将来のシーンの進化をモデル化することで、ロボット操作のための有望なルートを提供する。
目に見える未来を生み出すことは 必ずしも正確な行動の抽出を 保証するとは限らない
本稿では,Action-Grounded Representation Alignmentの目的であるAGRAを提案する。
論文 参考訳(メタデータ) (2026-06-10T15:31:25Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation [56.5415838759151]
WBenchはインタラクティブな世界モデルを評価するための総合的なベンチマークである。
ビデオの品質、セッティングアテンジェンス、インタラクションアテンデンス、一貫性、物理コンプライアンスをカバーしている。
289件のテストケースと1,058件のインタラクション・ターンが含まれており、多様なシーン、スタイル、主題、一対三の視点をカバーしている。
論文 参考訳(メタデータ) (2026-05-25T14:01:31Z) - iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework [27.208236690012914]
iWorld-Benchは、インタラクション関連の能力に関するワールドモデルのトレーニングとテストのためのベンチマークである。
330kのビデオクリップによる多様なデータセットを構築し、さまざまな視点、天気、シーンをカバーする2.1kの高品質なサンプルを選択した。
論文 参考訳(メタデータ) (2026-05-05T16:30:03Z) - WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models [114.95269118652163]
We introduced WorldArena, an unified benchmark designed for embodied world model across both perceptual and functional dimensions。
WorldArenaは、6つのサブ次元にまたがって16のメトリクスで測定されたビデオ知覚品質、データエンジンとして世界モデルを評価する実施されたタスク機能、ポリシー評価ツール、主観的な人間の評価と統合されたアクションプランナーの3つの次元でモデルを評価する。
14の代表的なモデルに対する広範囲な実験を通して、視覚的品質が必ずしも強い具体的タスク能力に変換されるとは限らないことを示す、重要な知覚-機能的ギャップを明らかにする。
論文 参考訳(メタデータ) (2026-02-09T18:09:20Z) - ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction [35.24704057622881]
身体的認知は、知性は受動的観察よりも知覚的相互作用から生じると主張する。
我々は,エゴセントリックな相互作用から世界モデリングとしての認知の具体化を評価するベンチマークENACTを紹介する。
論文 参考訳(メタデータ) (2025-11-26T00:06:02Z) - Object-Centric World Models for Causality-Aware Reinforcement Learning [13.063093054280946]
カルーサリティ対応強化学習(ASTICA)を用いたEmph Transformer Imaginationを提案する。
オブジェクト中心のトランスフォーマーが世界モデルおよび因果対応ポリシーおよびバリューネットワークとして機能する統合フレームワーク。
オブジェクトリッチベンチマークの実験では、STICAはサンプル効率と最終性能の両方において、最先端のエージェントよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-11-18T08:53:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。