論文の概要: Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- arxiv url: http://arxiv.org/abs/2606.25306v1
- Date: Wed, 24 Jun 2026 02:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.188444
- Title: Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- Title(参考訳): 物理質問シーングラフ:テキスト・ビデオ生成における物理プラズビリティのきめ細かい評価
- Authors: Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal,
- Abstract要約: 本稿では,階層的な質問に基づく評価パイプラインである物理質問シーングラフ(PQSG)を紹介する。
PQSGは、オブジェクト、アクション、および物理法則に従うプロンプトに対する忠実さをチェックすることによって、生成されたビデオを評価する。
我々は物理に基づくプロンプトとそれに対応する生成されたビデオを含むデータセットであるFinePhyEvalを作成してPQSGを検証する。
- 参考スコア(独自算出の注目度): 72.04671111142191
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation models are increasingly capable of producing realistic videos, but they still struggle to generate videos that follow basic physical laws. Compounding this is a lack of reliable granular evaluation methods for localizing and specifying physical law violations in videos. We address this by introducing Physics Question Scene Graph (PQSG), a hierarchical question-based evaluation pipeline. PQSG evaluates generated videos by checking their faithfulness to a prompt across objects, actions, and adherence to physical laws using a graph-based hierarchy of questions generated by a vision-language model (VLM), guided by high-quality in-context examples. By representing questions as a graph, PQSG introduces logical dependencies within questions, ensuring that each query is contextually valid. Moreover, PQSG provides granular assessments of which qualities of the video violate physical plausibility constraints. We validate PQSG by creating FinePhyEval, a dataset with physics-based prompts and corresponding generated videos from diverse state-of-the-art video generation models (Sora 2, Veo 3, and Wan 2.1), with each video annotated across multiple categories by humans. Using FinePhyEval, we measure the correlation between PQSG's fine-grained scores and human judgments, showing higher overall correlations than prior work. We also find that PQSG ranks closed-source models higher than Wan 2.1 on physical realism. Lastly, we show that the annotations we provide in FinePhyEval can also be used for subtask evaluation: we benchmark two strong VLMs on generating and answering questions, finding that while models can create human-like questions, they still fall short of human performance in answering them.
- Abstract(参考訳): ビデオ生成モデルは、現実的なビデオを作る能力はますます高まっているが、基本的な物理法則に従うビデオを作るのに苦戦している。
これは、ビデオ中の物理法違反をローカライズし特定するための、信頼性の高い粒度評価方法が欠如していることを意味する。
我々は,階層的な質問に基づく評価パイプラインである物理質問シーングラフ(PQSG)を導入することで,この問題に対処する。
PQSGは、視覚言語モデル(VLM)が生成した質問のグラフに基づく階層構造を用いて、オブジェクト、アクション、および物理法則への順守に対する忠実さを高品質なインコンテキストの例によってガイドすることによって、生成されたビデオを評価する。
質問をグラフとして表現することで、PQSGは質問内の論理的依存関係を導入し、各クエリがコンテキスト的に有効であることを保証する。
さらに、PQSGは、ビデオの品質が物理的な可視性制約に違反しているかの詳細な評価を提供する。
我々は、物理に基づくプロンプトと、さまざまな最先端ビデオ生成モデル(Sora 2, Veo 3, Wan 2.1)から生成されたビデオを生成するデータセットであるFinePhyEvalを作成して、PQSGを検証する。
FinePhyEvalを用いて、PQSGの微粒度スコアと人間の判断との相関を計測し、前よりも全体的な相関関係が高くなることを示した。
また、PQSGはWan 2.1よりも物理リアリズムにおいてクローズドソースモデルにランク付けしている。
最後に、FinePhyEvalで提供されるアノテーションは、サブタスクの評価にも使えることを示す: 質問の生成と回答に関して、2つの強力なVLMをベンチマークし、モデルが人間のような質問を生成できるが、答える際の人間のパフォーマンスに欠けていることを発見した。
関連論文リスト
- Physics-IQ Verified [58.94877959578469]
我々は,物理IQベンチマークの体系的な監査を行い,欠点を明らかにする。
本稿では,映像生成モデルの物理的理解を計測する3つの方法を提案する。
得られたベンチマークであるPhysical-IQ Verifiedは、全サンプルの57.6%を精製し、34.8%以上のプロンプトを改善した。
論文 参考訳(メタデータ) (2026-06-17T11:23:52Z) - Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models [14.187604603759784]
本稿では,テキスト・ビデオ・システムの物理的推論能力を評価するためのベンチマークであるPhysVidBenchを紹介する。
各プロンプトに対して、さまざまな最先端モデルを用いてビデオを生成し、3段階評価パイプラインを採用する。
PhysVidBenchは、生成ビデオモデルにおける物理コモンセンスを評価するための構造化、解釈可能なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-07-21T17:30:46Z) - ImplicitQA: Going beyond frames towards Implicit Video Reasoning [39.63171940350552]
ImplicitQAは、人間のような暗黙の推論でビデオQAモデルをテストするために設計された新しいベンチマークである。
ImplicitQAは、1Kの高品質なクリエイティビティビデオクリップから引き出された1Kの微妙な注釈付きQAペアからなる。
論文 参考訳(メタデータ) (2025-06-26T19:53:54Z) - CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models [4.889577550694335]
CausalVQAはビデオ質問応答(VQA)のためのベンチマークデータセットである
それは、物理的世界の因果関係に対するモデルの理解を調査する質問と回答のペアで構成されている。
論文 参考訳(メタデータ) (2025-06-11T17:10:36Z) - Towards Fine-Grained Video Question Answering [17.582244704442747]
本稿では,MOMA-QAデータセットについて述べる。
地上の真実のシーングラフと時間間隔アノテーションにより、MOMA-QAはきめ細かいビデオ理解のためのモデルを開発するのに最適である。
本稿では、シーングラフ予測器、効率的なフレーム検索器、時間的局所化と微粒化の関係理解のための事前学習された大規模言語モデルを含む、新しいビデオ言語モデルSGVLMを提案する。
論文 参考訳(メタデータ) (2025-03-10T01:02:01Z) - VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation [66.58048825989239]
VideoPhy-2は、生成されたビデオの物理的常識を評価するアクション中心のデータセットである。
我々は、生成したビデオのセマンティック・アテンデンス、物理コモンセンス、および物理ルールのグラウンド化を評価する人間の評価を行う。
結果より,最高のモデルでも22%のジョイントパフォーマンスを達成できたことが示唆された。
論文 参考訳(メタデータ) (2025-03-09T22:49:12Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Invariant Grounding for Video Question Answering [72.87173324555846]
Video Question Answering (ビデオQA)は、ビデオに関する質問に答えるタスクである。
先行するビデオQAモデルでは、典型的な学習目標である経験的リスク最小化(ERM)が、ビデオクエストペアと回答の間の表面的相関に基づく。
Invariant Grounding for VideoQA (IGV) という新たな学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-06T04:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。