論文の概要: PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs
- arxiv url: http://arxiv.org/abs/2608.02150v3
- Date: Wed, 05 Aug 2026 06:57:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.15693
- Title: PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs
- Title(参考訳): PhyCheck:ビデオLLMにおける物理法則理解のための細粒Evidence-Groundedデータセット
- Authors: Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin,
- Abstract要約: PhyCheckは、2段階の粒度で整理されたビデオ質問応答データセットである。
データセットには外部因果コンテキストを持つ診断サブセットが含まれており、身体的妥当性に影響を与える隠れた要因を明らかにする。
ファインチューンQwen2.5-VLを用いた実験では、提案したデータによるトレーニングが物理的一貫性の理解を大幅に改善することが示された。
- 参考スコア(独自算出の注目度): 28.86549880751177
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied intelligence and world models require video understanding systems to go beyond recognizing objects and actions and develop an understanding of physical regularities. However, despite their strong performance on general video understanding tasks, current video-language models still struggle to reliably determine whether an observed event conforms to specific physical laws. Existing benchmarks primarily assess the physical quality of generated videos, providing limited support for systematically evaluating and improving the physical-law understanding of Video Large Language Models (VideoLLMs). To address this gap, we introduce PhyCheck, a video question answering dataset organized at two complementary levels of granularity. The coarse-grained subset asks models to determine whether the phenomenon shown in a video conforms to or violates physical laws, while the fine-grained subset further examines whether models can capture physical details responsible for the violation or compliance. We use these subsets as structured supervision to improve physical understanding. In addition, the dataset contains a diagnostic subset with external causal context that reveal hidden factors affecting physical plausibility, assessing whether models can recalibrate their judgments accordingly. Experiments with Fine-tune Qwen2.5-VL show that training with the proposed data substantially improves the understanding of physical-consistency, while evaluations in the diagnostic subset reveal that current models still have difficulty incorporating additional causal conditions into their decisions. These findings highlight the gap between recognizing surface-level inconsistencies and understanding underlying physical mechanisms, and provide a foundation for evaluating and improving physical understanding in Video-LLMs.
- Abstract(参考訳): 身体的なインテリジェンスと世界モデルは、物体や行動を認識し、物理的規則性を理解することを超えて、ビデオ理解システムを必要とする。
しかしながら、一般的なビデオ理解タスクでは高いパフォーマンスを保っているが、現在のビデオ言語モデルは、観測された事象が特定の物理法則に適合するかどうかを確実に判断するのに苦慮している。
既存のベンチマークは、生成したビデオの物理的品質を主に評価し、ビデオ大言語モデル(VideoLLMs)の物理法則理解を体系的に評価し改善するための限定的なサポートを提供する。
このギャップに対処するために,2つの相補的な粒度で編成されたビデオ質問応答データセットであるPhyCheckを紹介した。
粗粒のサブセットは、ビデオに示される現象が物理法則に準拠しているか違反しているかを決定するためにモデルを要求するが、微粒のサブセットは、モデルが違反またはコンプライアンスに責任のある物理的詳細をキャプチャできるかどうかをさらに調べる。
これらのサブセットを構造化された監視として使用して、身体的理解を改善します。
さらに、データセットには、外部因果コンテキストを持つ診断サブセットが含まれており、物理的妥当性に影響を与える隠れた要因を明らかにし、モデルがそれに応じて判断を補正できるかどうかを評価する。
ファインチューンQwen2.5-VLを用いた実験では、提案したデータによるトレーニングは物理的一貫性の理解を大幅に改善する一方、診断サブセットの評価では、現在のモデルでは、決定に因果条件を追加するのが困難であることが示されている。
これらの知見は, 表面的不整合の認識と基盤となる物理的メカニズムの理解のギャップを浮き彫りにし, ビデオLLMにおける身体的理解の評価と改善のための基盤を提供する。
関連論文リスト
- PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning [10.8081248403127]
ビデオ言語モデル(VLM)は,映像理解と視覚的質問応答において優れた性能を発揮している。
トレーニング不要な物理メモリと検証フレームワークであるPhysMRVを提案する。
論文 参考訳(メタデータ) (2026-07-11T08:06:04Z) - PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation [19.33254293516823]
我々は、検索・拡張生成(RAG)を通して映像生成における身体的認識を高める新しいパイプラインであるPhysRAGを紹介する。
WISA-80Kデータセットに基づく2段階データフィルタリングパイプラインを設計する。
物理ビデオデータベースを構築し,学習可能なクエリを用いて物理知識をビデオ拡散モデルに注入する機構を開発する。
論文 参考訳(メタデータ) (2026-06-25T11:53:27Z) - Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation [72.04671111142191]
本稿では,階層的な質問に基づく評価パイプラインである物理質問シーングラフ(PQSG)を紹介する。
PQSGは、オブジェクト、アクション、および物理法則に従うプロンプトに対する忠実さをチェックすることによって、生成されたビデオを評価する。
我々は物理に基づくプロンプトとそれに対応する生成されたビデオを含むデータセットであるFinePhyEvalを作成してPQSGを検証する。
論文 参考訳(メタデータ) (2026-06-24T02:12:54Z) - LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference [57.086932851733145]
ビデオ拡散モデルにおける直感的な物理を評価するトレーニング不要な方法であるLikePhysを紹介した。
現在のビデオ拡散モデルにおける直観的物理理解のベンチマークを行う。
経験的結果は、現在のモデルが複雑でカオス的な力学に苦しむにもかかわらず、モデルキャパシティと推論設定スケールとしての物理理解の改善傾向が明らかであることを示している。
論文 参考訳(メタデータ) (2025-10-13T15:19:07Z) - TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility [70.24211591214528]
ビデオ生成モデルは、浮動、テレポート、モーフィングのような直感的な物理法則に違反したシーケンスを生成する。
既存のビデオランゲージモデル(VLM)は、物理違反の特定に苦慮し、時間的および因果的推論における根本的な制限を明らかにしている。
我々は、バランスの取れたトレーニングデータセットと軌道認識型アテンションモジュールを組み合わせた微調整レシピTRAVLを導入し、モーションエンコーディングを改善する。
言語バイアスを除去し,視覚的時間的理解を分離する300本のビデオ(150本実写150本)のベンチマークであるImplausiBenchを提案する。
論文 参考訳(メタデータ) (2025-10-08T21:03:46Z) - Think Before You Diffuse: Infusing Physical Rules into Video Diffusion [55.046699347579455]
実世界の動き、相互作用、ダイナミクスの複雑さは、データから物理を学ぶ際に大きな困難をもたらす。
DiffPhyは、トレーニング済みの動画拡散モデルを微調整することで、物理的に正確でリアルな映像生成を可能にする汎用的なフレームワークである。
論文 参考訳(メタデータ) (2025-05-27T18:26:43Z) - Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning [53.33388279933842]
本稿では,映像生成における物理的一貫性を実現するために,記号的推論と強化学習を統合することを提案する。
そこで我々は,Phys-ARフレームワークを提案する。第1段階は教師付き微調整を用いて記号的知識を伝達し,第2段階はモデルの推論能力の最適化に強化学習を適用する。
提案手法により,生成したビデオの物理的特性を動的に調整し,改善し,物理法則の遵守を確保することができる。
論文 参考訳(メタデータ) (2025-04-22T14:20:59Z) - Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language Models [11.282655911647483]
視覚言語モデル(VLM)における物理推論の課題
物理コンテキストビルダー(PCB)は,物理シーンの詳細な記述を生成するために,より小型のVLMを微調整したモジュラーフレームワークである。
PCBは、視覚知覚と推論の分離を可能にし、身体的理解に対する相対的な貢献を分析することができる。
論文 参考訳(メタデータ) (2024-12-11T18:40:16Z) - ContPhy: Continuum Physical Concept Learning and Reasoning from Videos [86.63174804149216]
ContPhyは、マシン物理常識を評価するための新しいベンチマークである。
私たちは、さまざまなAIモデルを評価し、ContPhyで満足なパフォーマンスを達成するのに依然として苦労していることがわかった。
また、近年の大規模言語モデルとパーティクルベースの物理力学モデルを組み合わせるためのオラクルモデル(ContPRO)を導入する。
論文 参考訳(メタデータ) (2024-02-09T01:09:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。