論文の概要: PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.26916v1
- Date: Thu, 25 Jun 2026 11:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.261104
- Title: PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
- Title(参考訳): PhysRAG:Retrieval-Augmented Generationによるビデオ生成における物理認識の強化
- Authors: Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang,
- Abstract要約: 我々は、検索・拡張生成(RAG)を通して映像生成における身体的認識を高める新しいパイプラインであるPhysRAGを紹介する。
WISA-80Kデータセットに基づく2段階データフィルタリングパイプラインを設計する。
物理ビデオデータベースを構築し,学習可能なクエリを用いて物理知識をビデオ拡散モデルに注入する機構を開発する。
- 参考スコア(独自算出の注目度): 19.33254293516823
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Developing physically aware video generation models remains a significant challenge due to the difficulty in capturing diverse physical phenomena, such as thermal dynamics, mechanics, and optics. In this work, we introduce PhysRAG, a novel pipeline that enhances physical awareness in video generation through Retrieval-Augmented Generation (RAG). To address the issue of limited high-quality data, we design a two-stage data filtering pipeline based on the WISA-80K dataset, resulting in a curated set of 7K high-quality videos for training. Furthermore, we construct a physical video database and develop a mechanism to inject physical knowledge into a video diffusion model using learnable queries. Our method achieves state-of-the-art performance in both visual quality and physical rule compliance, surpassing existing models in benchmarks such as PhyGenBench and VBench. We conduct extensive ablation studies to validate the effectiveness of our key components, including the data filtering pipeline, RAG mechanism, and method for physical information extraction. To facilitate future research, our code, data, and models are prepared for release at https://github.com/sediment1024/PhysRAG.
- Abstract(参考訳): 物理的に認識されたビデオ生成モデルの開発は、熱力学、力学、光学などの多様な物理現象を捉えるのが困難であるため、依然として重要な課題である。
本稿では,映像生成における物理認識を高める新しいパイプラインであるPhysRAGを紹介する。
WISA-80Kデータセットに基づく2段階データフィルタリングパイプラインを設計し、7Kの高品質ビデオのキュレートを行った。
さらに、物理ビデオデータベースを構築し、学習可能なクエリを用いて物理知識をビデオ拡散モデルに注入する機構を開発する。
提案手法は,PhyGenBench や VBench といったベンチマークの既存モデルを上回る,視覚的品質と物理規則順守の両面での最先端性能を実現する。
我々は、データフィルタリングパイプライン、RAG機構、物理情報抽出方法など、重要なコンポーネントの有効性を検証するために、広範囲にわたるアブレーション研究を行っている。
将来の研究を促進するため、コード、データ、モデルをhttps://github.com/sediment1024/PhysRAG.comでリリースする。
関連論文リスト
- MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics [16.350165647919464]
変形可能な物体,流体,運動物体,エミッタなどのリッチな物理現象をカバーする2次元材料ポイント法 (MPM) の物理シミュレーションデータセットを組み立てる。
このデータセット上でのコード生成とビデオ拡散のアプローチについて検討し、物理的に関係する側情報の量を変化させることで、その強みと弱みを識別する。
コード生成モデルは、MPMシミュレーションの自動合成の動作デモ以上のもので、このようなアプローチは視覚的入力から物理パラメータを推測するのに苦労するが、ビデオ拡散とは対照的に、時間とともに物理的および時間的に安定した外挿を生成する。
論文 参考訳(メタデータ) (2026-06-01T01:36:44Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance [2.2606796828967823]
現在のビデオ生成モデルは高品質な美的ビデオを生成するが、現実の物理力学の表現を学ぶのに苦労することが多い。
本稿では、ビデオ生成プロセスに先立って学習可能な物理を組み込む概念実証フレームワークであるPhysVideoGeneratorを提案する。
本稿では,事前学習したビデオジョイント埋め込み予測アーキテクチャから抽出した高レベルな物理特徴を抑圧する軽量な予測器ネットワークPredictorPを紹介する。
論文 参考訳(メタデータ) (2026-01-07T07:38:58Z) - Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement [51.54051161067026]
本稿では,映像生成のための物理対応ガイダンスを提供するための反復的自己再構成フレームワークを提案する。
物理的不整合からのフィードバックに基づいてプロンプトを洗練させるマルチモーダル・チェーン・オブ・シント(MM-CoT)プロセスを導入する。
PhyIQベンチマーク実験の結果,物理IQのスコアは56.31から62.38に改善した。
論文 参考訳(メタデータ) (2025-11-25T13:09:03Z) - Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation [80.89133198952187]
PhysHPOは階層的クロスモーダル直接参照最適化のための新しいフレームワークである。
物理的に妥当なビデオ生成のための微妙な好み調整を可能にする。
また,PhysHPOは,高度なモデルの物理的妥当性と全体的な映像生成品質を著しく向上させることを示した。
論文 参考訳(メタデータ) (2025-08-14T17:30:37Z) - Think Before You Diffuse: Infusing Physical Rules into Video Diffusion [55.046699347579455]
実世界の動き、相互作用、ダイナミクスの複雑さは、データから物理を学ぶ際に大きな困難をもたらす。
DiffPhyは、トレーニング済みの動画拡散モデルを微調整することで、物理的に正確でリアルな映像生成を可能にする汎用的なフレームワークである。
論文 参考訳(メタデータ) (2025-05-27T18:26:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。