FuguReport

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

著者 Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
所属 Shanghai Jiao Tong University / Huggingface / The University of Hong Kong / Shanghai Innovation Institute / Shanghai AI Laboratory / Krea AI / Alibaba
カテゴリ Evaluation / Benchmarking / Probabilistic alignment evaluation, Method / World Modeling / Video rollout empirical distribution, Application / Video Generation / Evaluating world dynamics samples
ライセンス CC BY 4.0

Abstractの概要

本論文は、動画生成モデルを視覚的世界モデルとして評価するには、単一ロールアウトの妥当性のみを判断するのではなく、固定された観測および行動のもとで起こり得る未来の分布を評価する必要があると主張している。この基準を確率的整合性として定式化し、8つの物理メカニズムグループにわたる50のシナリオからなるベンチマーク「PAWBench」と、反復ロールアウトを経験的な結果分布にマッピングするルーブリックベースのプロトコル「PAWEval」を導入している。PAWBenchは、参照確率が既知の場合と妥当な結果のみを列挙できる場合の両方の評価に対応するため、確率質量の整合性(PAW-Calibration)と妥当なサポートの網羅性(PAW-Coverage)を分離している。11の動画生成モデルを評価した結果、現在のシステムは確率的に整合した世界モデルには大幅に及ばないことが明らかになった。

新規性

本論文は、確率的整合性を動画世界モデルの分布レベルの要件として定義し、同一の初期観測および行動下での反復ロールアウトを通じてそれを実用化した。また、既知の参照確率に対するキャリブレーションの検証と、妥当な結果サポートに対するカバレッジの評価を切り離した、2トラックのPAWBenchおよびPAWEvalフレームワークを確立した。

成果

50のシナリオと11の動画生成モデルにわたる評価において、正確な結果確率、妥当なサポートの広範なカバレッジ、高いシーンレベルの信頼性を同時に達成したモデルは存在しなかった。統制テストでは、モデルは因果的な物理的変化に対して反応が鈍い一方で、非因果的なテキストの妨害要素には影響されやすいことが示された。さらに、プロンプトエンジニアリング、結合ノイズサンプリング、訓練データ調整によって出力を誘導したり探索を広げたりすることは可能であるものの、シーンに応じた正しい未来の分布を確実に回復できる手法はなかった。

論文の注目点

  1. PAWBenchは、固定された初期条件下での反復動画ロールアウトを評価し、50の物理シナリオにわたって確率キャリブレーションと妥当な未来のカバレッジを分離する。
  2. 11の動画生成モデルに対する実証ベンチマークにより、単一動画の妥当性が整合した未来分布を保証するわけではないことが示された。
  3. 言語プロンプト、初期ノイズ結合、パラメータ微調整などの介入を行っても、キャリブレーションされたシーン依存の未来分布を確実に生成することはできない。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。