論文の概要: World Embedding Benchmark
- arxiv url: http://arxiv.org/abs/2610.03632v1
- Date: Fri, 02 Oct 2026 17:24:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.514854
- Title: World Embedding Benchmark
- Title(参考訳): World Embedding Benchmark
- Abstract要約: 流体力学,固体力学,動力学,光学・電磁学を対象とする80のファミリーから8,000の制御されたシミュレーションケースからなるWorld Embedding Benchmarkを紹介した。
それぞれのケースは、レンダリングされたビデオにシミュレーションから派生した物理的なアノテーションを加え、テキスト-ビデオ検索、物理-プロパティ回帰、複数選択のビデオ-記述ペア分類という3つの補完的なタスクをサポートする。
- 参考スコア(独自算出の注目度): 40.34220852550043
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physical fidelity has received increasing attention in world models and video generation, yet how video representations encode physical information remains less understood. We introduce the World Embedding Benchmark, comprising 8,000 controlled simulation cases from 80 families spanning fluid mechanics, solid mechanics, dynamics, and optics & electromagnetism. Each case pairs a rendered video with simulation-derived physical annotations, supporting three complementary tasks: text-video retrieval, physical-property regression, and multiple-choice video-description pair classification. We use these tasks to distinguish cross-modal physical alignment from the recoverability of quantitative physical information. Evaluated pre-trained omnimodal embedding models show weak retrieval and near-chance within-family pair classification, while lightweight probes recover useful physical information from frozen video embeddings. Continual contrastive training with physics-specific video-text pairs improves retrieval and pair classification but degrades physical-property regression, revealing a trade-off between alignment and quantitative information recoverability. Finally, we use the embeddings to retrieve reference videos for retrieval-augmented generation with MiniMax-H3. Retrieved references improve the physical fidelity of generated videos, with stronger retrieval models yielding larger gains in our experiments. Together, these findings highlight the need to evaluate physical alignment and property recoverability jointly, and demonstrate the utility of physical representations for improving video generation.
- Abstract(参考訳): 物理忠実度は世界モデルやビデオ生成において注目されているが、物理情報をエンコードするビデオ表現の理解はいまだに少ない。
流体力学,固体力学,動力学,光学・電磁学を対象とする80のファミリーから8,000の制御されたシミュレーションケースからなるWorld Embedding Benchmarkを紹介した。
それぞれのケースは、レンダリングされたビデオにシミュレーションから派生した物理的なアノテーションを加え、テキスト-ビデオ検索、物理-プロパティ回帰、複数選択のビデオ-記述ペア分類という3つの補完的なタスクをサポートする。
我々はこれらのタスクを用いて、定量的な物理情報の回復可能性と、モーダルな物理的アライメントを区別する。
事前学習した全方位埋め込みモデルの評価では、弱い検索と家族内ペアの分類が見られ、一方軽量プローブは凍結したビデオ埋め込みから有用な物理情報を復元する。
物理固有のビデオテキストペアによる連続的なコントラストトレーニングは、検索とペアの分類を改善するが、物理プロパリティ回帰を低下させ、アライメントと定量的情報回復性の間のトレードオフを明らかにする。
最後に,MiniMax-H3を用いて参照ビデオの検索を行う。
検索基準により生成した映像の物理忠実度が向上し,より強力な検索モデルが得られた。
これらの知見は、物理的アライメントとプロパティの回復性を共同で評価することの必要性を強調し、映像生成を改善するための物理表現の有用性を実証する。
関連論文リスト
- Learning Explicit Physical Parameter Control and Benchmarking for Video Generation [21.331326205371628]
本稿では,物体レベルの力,質量,摩擦,再生,シーンレベルの重力を条件とした物理誘導映像拡散モデルPhyParamを提案する。
また、PhyParam-Benchは、画像とビデオの生成における物理法則の整合性を示すベンチマークである。
論文 参考訳(メタデータ) (2026-07-21T10:06:55Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - Inferring Dynamic Physical Properties from Video Foundation Models [94.35979242947873]
ビデオから動的物理特性を予測するタスクについて検討する。
時間的情報を必要とする物理的特性として,バウンディング物体の弾性,流動液体の粘度,表面を滑り落ちる物体の動的摩擦について考察する。
論文 参考訳(メタデータ) (2025-10-02T17:59:50Z) - Synthetic Video Enhances Physical Fidelity in Video Synthesis [25.41774228022216]
コンピュータグラフィックスパイプラインから合成したビデオを利用して,映像生成モデルの物理忠実度を高める方法について検討する。
本稿では,合成データをキュレートして統合する手法を提案し,その物理リアリズムをモデルに転送する手法を提案する。
我々の研究は、合成ビデオがビデオ合成における物理的忠実性を高める最初の実証的なデモンストレーションの1つを提供する。
論文 参考訳(メタデータ) (2025-03-26T00:45:07Z) - VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation [66.58048825989239]
VideoPhy-2は、生成されたビデオの物理的常識を評価するアクション中心のデータセットである。
我々は、生成したビデオのセマンティック・アテンデンス、物理コモンセンス、および物理ルールのグラウンド化を評価する人間の評価を行う。
結果より,最高のモデルでも22%のジョイントパフォーマンスを達成できたことが示唆された。
論文 参考訳(メタデータ) (2025-03-09T22:49:12Z) - VideoPhy: Evaluating Physical Commonsense for Video Generation [93.28748850301949]
生成したビデオが現実世界のアクティビティの物理的常識に従うかどうかを評価するためのベンチマークであるVideoPhyを提示する。
そして、さまざまな最先端のテキスト・ビデオ生成モデルからキャプションに条件付けされたビデオを生成する。
人間の評価では、既存のモデルには、与えられたテキストプロンプトに付着したビデオを生成する能力が欠けていることが判明した。
論文 参考訳(メタデータ) (2024-06-05T17:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。