論文の概要: VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation
- arxiv url: http://arxiv.org/abs/2607.23472v1
- Date: Sun, 26 Jul 2026 05:55:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.123836
- Title: VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation
- Title(参考訳): VIPER: 物理的に可視なビデオ生成のための視覚的インテクスト物理推論
- Abstract要約: VIPERは、参照誘導画像-ビデオ生成のためのフレームワークである。
マルチモーダル大言語モデルを用いて、参照由来の物理キューを抽出する。
参照/ビデオの物理的類似性が向上し、代表映像生成よりも人間の好みが向上する。
- 参考スコア(独自算出の注目度): 24.373968967561993
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Modern video generation models can synthesize visually compelling and temporally coherent clips, yet controlling their physical behavior remains difficult with standard text and image conditions. The core challenge is a conditioning bottleneck: material response, contact interaction, deformation, and motion trajectory are continuous and relational physical cues that are hard to specify exhaustively in language but can be demonstrated naturally by video. We propose VIPER, a Visual In-Context Physics Reasoning framework for reference-guided image-to-video generation. Given a target image, a brief target prompt, and a reference video, VIPER treats the reference as a dense visual demonstration of the desired physical process rather than an appearance template. It uses a Multimodal Large Language Model (MLLM) to extract reference-derived physical cues and guide a pretrained image-to-video generator through a hierarchical training strategy, enabling physical behavior transfer while preserving the visual prior of the base generator. To support this setting, we construct VIPER-19K, a curated dataset with material, trajectory, and physical-impact annotations, together with filtered reference-target pairs. Experiments on an unseen validation set show that VIPER achieves stronger reference-video physical similarity and higher human preference than representative video generation and video-as-prompt baselines, while maintaining competitive general video quality. Qualitative results further demonstrate that VIPER can transfer reference-derived physical behavior to new target scenes without requiring carefully engineered prompts.
- Abstract(参考訳): 現代のビデオ生成モデルは、視覚的に魅力的で時間的に整合したクリップを合成することができるが、標準的なテキストや画像条件では、その物理的な振る舞いを制御することは難しい。
物質応答、接触相互作用、変形、運動軌道は連続的かつ関係的な物理的手がかりであり、言語で徹底的に特定することは難しいが、ビデオによって自然に示される。
参照誘導画像-映像生成のための視覚的インコンテキスト物理推論フレームワークVIPERを提案する。
ターゲット画像、短いターゲットプロンプト、参照ビデオが与えられた場合、VIPERは、参照を外観テンプレートではなく、所望の物理的プロセスの濃密な視覚的なデモとして扱う。
MLLM (Multimodal Large Language Model) を用いて、参照由来の物理的手がかりを抽出し、階層的なトレーニング戦略を通じて事前訓練された画像から映像へのジェネレータを誘導し、ベースジェネレータの視覚的先行を保ちながら物理行動伝達を可能にする。
この設定をサポートするために、VIPER-19Kという、素材、軌道、物理的インパクトアノテーションを備えたキュレートされたデータセットと、フィルタされた参照ターゲットペアを構築した。
未確認の検証セットの実験では、VIPERは、競争力のある一般的なビデオ品質を維持しながら、代表的なビデオ生成やプロンプトベースラインよりも、より強い参照/ビデオの類似性と高い人間の嗜好を実現する。
定性的な結果は、VIPERが慎重に設計されたプロンプトを必要とせずに、参照由来の物理的振る舞いを新しいターゲットシーンに転送できることをさらに示している。
関連論文リスト
- Learning Explicit Physical Parameter Control and Benchmarking for Video Generation [21.331326205371628]
本稿では,物体レベルの力,質量,摩擦,再生,シーンレベルの重力を条件とした物理誘導映像拡散モデルPhyParamを提案する。
また、PhyParam-Benchは、画像とビデオの生成における物理法則の整合性を示すベンチマークである。
論文 参考訳(メタデータ) (2026-07-21T10:06:55Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics [12.143531149918674]
本稿では,視覚的内容と潜伏する物理力学を共同でモデル化する物理拡散ビデオ生成モデルを提案する。
観測されたビデオフレームと推論された物理状態に基づいて、Phantomは遅延物理的ダイナミクスを共同で予測し、将来のビデオフレームを生成する。
物理認識ビデオ表現の推論を直接ビデオ生成プロセスに統合することにより、Phantomは視覚的にリアルかつ物理的に一貫性のあるビデオシーケンスを生成する。
論文 参考訳(メタデータ) (2026-04-09T17:48:46Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment [23.066204478030627]
ビデオモデル(VDM)は、動的なシーンや環境をシミュレートするための有望なアプローチを提供する。
既存のモデルは、しばしば基本的な物理的直観に反する時間的に一貫性のないコンテンツを生成する。
物理コヒーレントな画像対ビデオI(2V)生成のための効率的なフレームワークであるPhysAlignを提案する。
論文 参考訳(メタデータ) (2026-03-14T05:44:18Z) - Exploring Physical Intelligence Emergence via Omni-Modal Architecture and Physical Data Engine [50.62040226184694]
我々はOmniFysicsについて紹介する。OmniFysicsは、画像、音声、ビデオ、テキスト間の理解を統一するコンパクトなオムニモーダルモデルである。
明示的な物理知識を注入するために、2つのコンポーネントからなる物理データエンジンを構築します。
実験は、標準マルチモーダルベンチマークにおける競合性能を示し、物理指向評価の結果を改善した。
論文 参考訳(メタデータ) (2026-02-05T14:04:51Z) - PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding [50.454084539837005]
PhysChoreoは、単一の画像から多様な制御性と物理的なリアリズムを持つビデオを生成する新しいフレームワークである。
本手法は2つの段階から構成される: まず, 画像中の全ての物体の静的初期特性を, 部分認識の物理的特性再構成により推定する。
そして、時間的に指示され、物理的に編集可能なシミュレーションを通じて、リッチな動的な振る舞いと物理的なリアリズムで高品質な動画を合成する。
論文 参考訳(メタデータ) (2025-11-25T17:59:04Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z) - Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation [80.89133198952187]
PhysHPOは階層的クロスモーダル直接参照最適化のための新しいフレームワークである。
物理的に妥当なビデオ生成のための微妙な好み調整を可能にする。
また,PhysHPOは,高度なモデルの物理的妥当性と全体的な映像生成品質を著しく向上させることを示した。
論文 参考訳(メタデータ) (2025-08-14T17:30:37Z) - Think Before You Diffuse: Infusing Physical Rules into Video Diffusion [55.046699347579455]
実世界の動き、相互作用、ダイナミクスの複雑さは、データから物理を学ぶ際に大きな困難をもたらす。
DiffPhyは、トレーニング済みの動画拡散モデルを微調整することで、物理的に正確でリアルな映像生成を可能にする汎用的なフレームワークである。
論文 参考訳(メタデータ) (2025-05-27T18:26:43Z) - VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior [88.51778468222766]
近年,映像拡散モデル (VDM) が大幅に進歩し,映像のリアル化が進んでいる。
VDMは物理の理解の欠如のため、物理的にもっともらしいビデオを作ることができないことが多い。
本稿では,物理を視覚と言語に明示的に組み込んだ新しい2段階画像・映像生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-30T09:03:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。