論文の概要: Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
- arxiv url: http://arxiv.org/abs/2609.40358v1
- Date: Wed, 30 Sep 2026 17:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.352338
- Title: Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
- Title(参考訳): Physis-Lang:ビデオワールドモデルのための物理表現としての自己進化型言語
- Abstract要約: 物理言語をデータキュレーション、モデルトレーニング、ビデオ生成にまたがる共有かつ最適化可能な表現として扱うフレームワークであるPhys-Langを紹介する。
Physis-Langは物理プロセスをアトミックなアサーションに分解し、リコールと精度を使ってキャプションを評価する。
WanとCosmosのバックボーンで広く使われている4つの物理ビデオベンチマークの実験は、物理的妥当性が一貫した改善を示している。
- 参考スコア(独自算出の注目度): 65.89360908199338
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video world models are expected to predict how the physical world evolves, yet they often produce visually plausible videos that violate basic physical principles. Existing approaches commonly assume that natural language is insufficient to represent the physical knowledge required for reliable generation, and therefore introduce additional visual, latent, numerical, or planning-based signals. We revisit this assumption and introduce Physis-Lang, a self-evolving framework that treats physical language as a shared and optimizable representation across data curation, model training, and video generation. Physis-Lang represents physical processes through language that describes their relevant entities, causes, interactions, governing principles, temporal evolution, and effects. To improve this representation, we construct PhysCapBench, which decomposes physical processes into atomic assertions and evaluates captions using recall and precision. An agentic loop iteratively analyzes assertion-level errors and refines the instruction used to produce physical captions. Physis-Lang further converts model deficiencies into textual descriptions and uses language-guided retrieval to identify visually diverse videos that cover missing physical processes. Experiments on four widely used physical video benchmarks with Wan and Cosmos backbones demonstrate consistent improvements in physical plausibility. Notably, starting from open-source Cosmos3-Nano backbones, our Physis-Lang-enhanced models surpass the leading proprietary Veo 3.1 model.
- Abstract(参考訳): ビデオワールドモデルは、物理的な世界がどのように進化するかを予測することが期待されているが、基本的な物理原理に反する、視覚的にもっともらしいビデオを生成することが多い。
既存のアプローチでは、自然言語は信頼できる生成に必要な物理的知識を表現するには不十分であり、従って視覚的、潜伏的、数値的、計画に基づく信号を導入する。
この仮定を再考し、物理言語をデータキュレーション、モデルトレーニング、ビデオ生成にまたがる共有かつ最適化可能な表現として扱う自己進化型フレームワークであるPhys-Langを紹介する。
physis-Langは、それらの関連した実体、原因、相互作用、統治原則、時間的進化、影響を記述する言語を通して物理過程を表現する。
この表現を改善するために、PhysCapBenchを構築し、物理プロセスをアトミックなアサーションに分解し、リコールと精度を用いてキャプションを評価する。
エージェントループは、アサーションレベルのエラーを反復的に分析し、物理キャプションを生成するために使用される命令を洗練する。
physis-Langはさらに、モデル欠陥をテキスト記述に変換し、言語誘導検索を使用して、行方不明な物理過程をカバーする視覚的に多様なビデオを特定する。
WanとCosmosのバックボーンで広く使われている4つの物理ビデオベンチマークの実験は、物理的妥当性が一貫した改善を示している。
特に、オープンソースのCosmos3-Nanoのバックボーンから始めて、私たちのPhysics-Lang強化モデルは、主要なプロプライエタリなVeo 3.1モデルを上回っています。
関連論文リスト
- PhiZero: A World Model Built Around Physical Language [50.268271884186845]
PhiZeroは物理言語を中心に構築された物理世界モデルである。
物理言語シーケンスとして将来の世界進化を推論し、推論された遷移をビデオにレンダリングする。
本研究では,現実的かつインタラクティブな世界モデリング,微粒な動作条件シミュレーション,ゼロショットモーショントランスファーの可能性を示す。
論文 参考訳(メタデータ) (2026-07-30T17:59:46Z) - Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning [77.34919361116037]
ビデオ生成モデルは、ストーリーテリング、シミュレーション、エンボディドAIのための世界シミュレータとして、ますます使われている。
既存の評価は、自動化されたメトリクスや、好みやルーリックベースのチェックのような粗い人間の判断に大きく依存している。
5つの最先端モデルによって生成されたビデオにおいて、物理的リアリズムの失敗を診断するための専門家による推論のベンチマークであるPhyllon-Evalを紹介する。
論文 参考訳(メタデータ) (2026-03-20T03:25:41Z) - ProPhy: Progressive Physical Alignment for Dynamic World Simulation [55.456455952212416]
ProPhyは、明示的な物理認識条件付けと異方性生成を可能にするプログレッシブ物理アライメントフレームワークである。
ProPhyは既存の最先端手法よりもリアルでダイナミックで物理的に一貫性のある結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-05T09:39:26Z) - PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning [49.88366485306749]
現代のビデオ生成モデルは、視覚的にリアルなビデオを生成することができるが、物理法則に従わないことが多い。
本稿では,物理認識力を高めるため,映像生成モデルを導くための表現として,物理知識を捉えたPhysMasterを提案する。
論文 参考訳(メタデータ) (2025-10-15T17:59:59Z) - Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models [14.187604603759784]
本稿では,テキスト・ビデオ・システムの物理的推論能力を評価するためのベンチマークであるPhysVidBenchを紹介する。
各プロンプトに対して、さまざまな最先端モデルを用いてビデオを生成し、3段階評価パイプラインを採用する。
PhysVidBenchは、生成ビデオモデルにおける物理コモンセンスを評価するための構造化、解釈可能なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-07-21T17:30:46Z) - Think Before You Diffuse: Infusing Physical Rules into Video Diffusion [55.046699347579455]
実世界の動き、相互作用、ダイナミクスの複雑さは、データから物理を学ぶ際に大きな困難をもたらす。
DiffPhyは、トレーニング済みの動画拡散モデルを微調整することで、物理的に正確でリアルな映像生成を可能にする汎用的なフレームワークである。
論文 参考訳(メタデータ) (2025-05-27T18:26:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。