論文の概要: SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2606.27741v1
- Date: Fri, 26 Jun 2026 05:39:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.37731
- Title: SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models
- Title(参考訳): SIFT:ビデオ拡散モデルにおける身体的可塑性運動のための自己像微細調整
- Authors: Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu,
- Abstract要約: 動きの絡み合い(英: Motion entanglement)は、カメラの動きや物体の動きのような独立した動き源の意図しない結合である。
本稿では,自作ビデオから学習できるSIFT(Self-Imagination Fine-Tuning)パラダイムを提案する。
- 参考スコア(独自算出の注目度): 53.82339966194578
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video diffusion models have greatly improved visual fidelity, yet their generated motions often violate physical plausibility. We observe a common kinematic failure, "motion entanglement", the unintended coupling of independent motion sources, such as camera movement and object motion. We identify that this issue stems from data bias and the reconstruction-based training design of diffusion models. Training on noisy videos that still retain coarse motion cues inadvertently encourages the model to replicate existing motion without an incentive to learn how to model kinematically-grounded motions. To address this, we propose a Self-Imagination Fine-Tuning (SIFT) paradigm, which enables the model to learn from its own generated videos rather than directly reconstructing real ones, breaking the reconstruction shortcut. We further employ motion-aware discriminative supervision and a progressive hard-case replay strategy to stabilize and accelerate learning. By leveraging freely-generated text prompts, our method can densely cover a broad motion space, including rare or finely-disentangled scenarios that would be costly to collect as video data. Extensive experiments demonstrate that our approach substantially improves the physical realism, motion disentanglement, and controllability of generated videos.
- Abstract(参考訳): 映像拡散モデルの最近の進歩は視覚的忠実度を大幅に向上させたが、その動きは身体的可視性に反することが多い。
我々は、カメラの動きや物体の動きなど、独立運動源の意図しない結合である運動障害「運動絡み」を観察する。
この問題はデータバイアスと拡散モデルの再構成に基づくトレーニング設計に起因している。
粗い動きの手がかりを保ったままのノイズの多いビデオのトレーニングは、故意に既存の動きを再現することを奨励する。
そこで本研究では,実際の映像を直接再構成するのではなく,モデルが生成したビデオから学習し,再構成ショートカットを破ることのできる,SIFT(Self-Imagination Fine-Tuning)パラダイムを提案する。
さらに,学習の安定化と高速化を目的として,動作認識型識別監視と,進行型ハードケース再生戦略を取り入れた。
自由生成されたテキストプロンプトを利用することで、ビデオデータとして収集するのにコストがかかる稀なシナリオや細分化シナリオを含む、広い動き空間を密にカバーすることができる。
広汎な実験により,本手法は生成ビデオの物理的リアリズム,動きのゆがみ,制御性を大幅に改善することが示された。
関連論文リスト
- LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation [24.8120698643545]
本稿では,現在の潜時とプロンプトに条件付きフレーム間潜時変化に先立って潜時動作を定式化するLaMoを提案する。
LaMoは既存のビデオ拡散バックボーンとプラグイン・アンド・プレイされており、アーキテクチャやI/Oの変更は不要である。
VideoPhyとVideoPhy2では、LaMoはCogVideoXバックボーンを改善し、外部監視を使用する最近の物理認識ベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-22T17:34:42Z) - MotiMotion: Motion-Controlled Video Generation with Visual Reasoning [49.243234645532745]
本稿では,動作制御を次世代問題として再定義するフレームワークであるMotiMotionを紹介する。
因果的基盤とコモンセンスと一貫性のある相互作用を促進するために,学習不要な視覚言語推論手法を活用する。
動作の自然性をさらに向上するために,誘導強度を変調する信頼度を考慮した制御方式を提案する。
論文 参考訳(メタデータ) (2026-05-21T17:59:36Z) - DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data [51.316274891736164]
DynaVidは、トレーニングで合成モーションデータを活用するビデオ合成フレームワークである。
ダイナミックモーション生成とカメラモーション制御において,DynaVidはリアリズムと制御性を向上することを示す。
論文 参考訳(メタデータ) (2026-04-02T06:12:38Z) - Moaw: Unleashing Motion Awareness for Video Diffusion Models [71.34328578845721]
Moawは動画拡散モデルのための動き認識を解放するフレームワークである。
我々は、映像から映像へのモダリティを、映像から映像への追跡へとシフトさせ、運動知覚のための拡散モデルを訓練する。
次に、最強の動作情報をエンコードする特徴を識別する動きラベル付きデータセットを構築し、それらを構造的に同一の映像生成モデルに注入する。
論文 参考訳(メタデータ) (2026-01-19T06:45:46Z) - RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism [73.38167494118746]
生成ビデオにおける動きのリアリズムを改善するための枠組みを提案する。
生成フェーズにおける検索機構の導入を提唱する。
私たちのパイプラインは、どんなテキスト間拡散モデルにも適用できるように設計されています。
論文 参考訳(メタデータ) (2025-04-09T08:14:05Z) - MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models [3.2311303453753033]
動画拡散モデルにおける動き伝達のための新しいフレームワークであるMotionFlowを紹介する。
本手法は,空間的・時間的ダイナミクスを正確に把握し,操作するために,クロスアテンションマップを利用する。
実験の結果,MotionFlowは劇的なシーン変化であっても,忠実度と汎用性の両方で既存モデルよりも優れていた。
論文 参考訳(メタデータ) (2024-12-06T18:59:12Z) - MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models [59.10171699717122]
MoTransは、新しいコンテキストにおける類似した動きのビデオ生成を可能にする、カスタマイズされたモーション転送方式である。
再カプセル化されたプロンプトとビデオフレームからのマルチモーダル表現は、外観のモデリングを促進する。
本手法は, 特定の動きパターンを, 単一の参照ビデオや複数参照ビデオから効果的に学習する。
論文 参考訳(メタデータ) (2024-12-02T10:07:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。