論文の概要: PROWBench: Do Video Models Render What the Program Specifies?
- arxiv url: http://arxiv.org/abs/2610.02205v2
- Date: Mon, 05 Oct 2026 12:29:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.530831
- Title: PROWBench: Do Video Models Render What the Program Specifies?
- Title(参考訳): PROWBench: ビデオモデルはプログラムが指定するものをレンダリングしますか?
- Abstract要約: 本稿では,170の特定エピソードと600のプロキシビデオからなるPROWBenchを紹介する。
PROWBenchは、カメラのフィールドビュー外のものを含むエンティティ状態とタイムスタンプイベントを再生可能なワールドレコードとして記録し、そこから同期表現を描画する。
タイムスタンプ付きエンジン記録イベントの,エンティティ制御,長期記憶,所定のタイムラインへの付着性,および視覚的実現性を評価する。
- 参考スコア(独自算出の注目度): 32.83238556974147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Programmable world models separate executable dynamics from visual generation, offering a promising foundation for next-generation game engines. However, their visual adherence to explicit rules and interactions remains insufficiently evaluated. Existing benchmarks assess visual quality, controllability, and instruction or physical adherence, but rarely test fidelity to fine-grained, program-specified world events. We introduce PROWBench, comprising 170 programmatically constructed episodes and 600 proxy videos covering diverse scenes and interactions. PROWBench logs entity states and timestamped events, including those outside the camera's field of view, as replayable world records, from which it renders synchronized views and proxy representations. This enables generated videos to be checked against the observable consequences of program execution. An extensible framework constructs scenes, controls behaviors, and can render each camera view in different representations, such as coarse 3D, and bounding boxes. The benchmark covers first- and third-person perspectives, with synchronized multi-view observations available for a subset of episodes. Grounded in these records, PROWBench evaluates entity control, long-horizon memory, and, with two VLM-based metrics, Logic-Render Alignment and Interaction Success Rate, adherence to the prescribed timeline and the visual realization of timestamped engine-recorded events.
- Abstract(参考訳): プログラム可能なワールドモデルは、ビジュアル生成から実行可能ダイナミクスを分離し、次世代のゲームエンジンに期待できる基盤を提供する。
しかし、明示的な規則や相互作用に対する視覚的忠実さは、まだ十分に評価されていない。
既存のベンチマークでは、視覚的品質、制御可能性、命令または物理的拘束力を評価するが、細かなプログラムで特定された世界イベントに対する忠実さをテストすることは滅多にない。
本稿では,プログラムで構築したエピソード170と,多様なシーンとインタラクションをカバーする600のプロキシビデオからなるPROWBenchを紹介する。
PROWBenchは、カメラの視野外のものを含むエンティティ状態とタイムスタンプイベントを再生可能なワールドレコードとして記録し、同期されたビューとプロキシ表現を表示する。
これにより、生成されたビデオは、プログラム実行の観測可能な結果に対してチェックできる。
拡張可能なフレームワークはシーンを構築し、振る舞いを制御し、各カメラビューを粗い3Dやバウンディングボックスなど、さまざまな表現でレンダリングすることができる。
ベンチマークでは、エピソードのサブセットで、同期されたマルチビューの観察が可能な、ファーストパーソンとサードパーソンの視点をカバーしている。
これらの記録に基づいて、PROWBenchはエンティティ制御、長期記憶、VLMベースの2つのメトリクス、Logic-Render AlignmentとInteraction Success Rate、所定のタイムラインへの準拠、タイムスタンプされたエンジン記録イベントの視覚的実現を評価する。
関連論文リスト
- MaLiang-Harness: A Programmable Path to Image and Video Generation [131.25289080401856]
本稿では,MLLMによる視覚生成を永続的な構築・検査・修正プロセスにまとめるフレームワークであるMaLiang-Harnessを紹介する。
我々は,MaLiang-IBench上の11個の強力なクローズソースMLLMとMaLiang-VBench上の4つのMLLMを評価し,生成成功,視覚的品質,計算コストを測定した。
論文 参考訳(メタデータ) (2026-09-28T04:48:06Z) - TriWorldBench: A Tri-View Consistency Perspective on Embodied World Models [68.07981098895088]
身体的世界モデルは、学習と計画を支援するロボット行動の結果を予測する。
トリウォルドベンチ(TRIWORLDBENCH)は、シンクロナイズドヘッド、左書き、右書きビデオを通じて、エンボディドワールドモデルを評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-09-22T12:23:14Z) - WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory [60.18419531120148]
我々は、この目的のためにカメラクエリ可能な暗黙的な3Dメモリを学ぶビデオワールドモデルであるWorldCrafterを紹介する。
重要な洞察は、要求された視点をビデオジェネレータの限定トークン予算にマルチビューエビデンスを圧縮する方法を形作ることである。
静的および動的シーンにわたる実験では、長距離一貫性とカメラ制御精度が大幅に向上した。
論文 参考訳(メタデータ) (2026-09-21T17:57:06Z) - WorldReward: Reward Modeling for Camera-Conditioned World Models [56.14617966299295]
本稿では,VLMに基づくカメラコンディショニング世界モデルに対するペアワイズ優先報酬モデルであるWorldRewardを紹介する。
WorldRewardは、ペア化されたビデオをアクション整合したチャンクに分解し、各チャンクを構造化された視覚的エビデンスに整理し、ビデオレベルのアクションと視覚的品質の好みに投票することでチャンクレベルの決定を集約する。
WorldReward は GPT-5.5 の3.42 倍、 1.45 倍、および 3.56 倍の3つの次元で最高合意を達成している。
論文 参考訳(メタデータ) (2026-09-03T14:53:53Z) - VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System [77.32035315337522]
テキストビデオモデルは物理的に一貫したダイナミクスを生成するのに苦労し、シーンの時間的進化は圧縮されたテキストプロンプトから暗黙的に推論されなければならない。
既存のチェーン・オブ・シークレットのアプローチは中間計画や視覚的状態を導入しているが、これらの表現は通常、非計算可能または時間的にスパースである。
我々は,実行可能なBlenderコードがプロセスレベルの思考の連鎖として機能する,エージェント型デュアルエンジンフレームワークであるVideoCoを紹介した。
論文 参考訳(メタデータ) (2026-07-29T18:38:23Z) - WorldOlympiad: Can Your World Model Survive a Triathlon? [39.69359039523777]
我々は,物理忠実度,幾何整合性,相互作用忠実度にまたがるビデオベース世界モデルの診断のためのベンチマークであるWorldOlympiadを紹介する。
WorldOlympiadは、世界モデルの評価を3つの相補的な次元に分解する。
論文 参考訳(メタデータ) (2026-06-09T17:24:36Z) - SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding [48.64661382961745]
本研究では,ビデオ中のすべての参照オブジェクトを同時に検出,追跡,時間的ローカライズするモデルを必要とする新しいタスクである,SVAG(Spatio-temporal Video Action Grounding)を紹介する。
SVAG-Benchは688の動画、19,590の注釈付きレコード、903のユニークな動詞からなる大規模ベンチマークである。
実験の結果、既存のモデルではSVAG、特に密集したシーンや複雑なシーンでは性能が良くないことがわかった。
論文 参考訳(メタデータ) (2025-10-14T22:10:49Z) - Video alignment using unsupervised learning of local and global features [0.0]
フレームのグローバルな特徴と局所的な特徴を利用した非教師なしアライメント手法を提案する。
特に、人物検出、ポーズ推定、VGGネットワークという3つのマシンビジョンツールを用いて、各ビデオフレームに効果的な機能を導入する。
このアプローチの主な利点は、トレーニングを必要とせず、トレーニングサンプルを収集することなく、新しいタイプのアクションに適用できることです。
論文 参考訳(メタデータ) (2023-04-13T22:20:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。