MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
Abstractの概要
MVTrack4Genは、カメラ条件のみを使用する新規視点ビデオ拡散モデルのための、モーションを考慮した学習フレームワークである。本論文では、これらのモデルにおける3Dアテンションを分析し、特定の中間層がビュー内の時間的対応と、参照ビデオおよびターゲットビデオ間のクロスビュー対応の両方をエンコードしていることを発見し、これらの対応の失敗がモーションや幾何学的な不整合に関連していることを付言している。この観察に基づき、本手法は補助的なマルチビュー追跡ヘッドと、マルチビューのポイントトラックを用いてアテンションを直接監督する対応関係損失を追加する。このフレームワークはReCamMasterおよびRedirectorに適用されており、推論時の明示的な3D再構成に依存することなく、モーションの忠実度とクロスビューの幾何学的整合性を向上させることを目的としている。
新規性
本論文の特徴的な貢献は、特定の拡散層のアテンションに自然に生じる対応関係を、4Dビデオ生成のための幾何学的監督情報源として扱うことである。アテンションレベルでの対応関係の監督と、補助的なマルチビュー・ポイントトラッキングの目的関数を組み合わせ、共有されたDiT特徴量を用いて時間的なモーションの手がかりとクロス뷰のアライメントの両方を強化している。
成果
DAVISおよびiPhoneベンチマーク全体において、MVTrack4Genはそれが適用された2つのカメラ条件のみのバックボーンを一貫して改善し、特に幾何学的整合性の指標において顕著な向上を示した。DAVISでは、比較手法の中で最も低いMEt3Rおよび動的領域MEt3Rを報告し、あわせて並進誤差とカメラモーションの整合性の改善も示しており、iPhoneではカメラ条件のみのベースラインと比較してPSNR、LPIPS、MEt3Rを向上させている。アブレーション実験から、トラッキングモジュールと対応関係損失は補完的であり、それらを組み合わせることで品質、幾何学、カメラ精度の全体的なトレードオフが最適になることが示されている。
論文の注目点
- 本手法は、ビデオ拡散モデルの特定の中間3Dアテンション層が、強力な時間的およびクロスビューでの対応関係の手がかりを保持していることを示す分析に基づいている。
- MVTrack4Genは、モーション追従性と幾何学的整合性を向上させるために、マルチビュートラッキングヘッドとアテンションマップ上の対応関係損失という2つの監督信号を追加する。
- 本フレームワークは、推論時に明示的な3D再構成を行うことなくReCamMasterやRedirectorを改善し、幾何学的整合性と動的オブジェクトのアライメントにおいて最も顕著な向上が報告されている。
参考リンク
- arXiv: https://arxiv.org/abs/2606.26087v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2606.26087v1
- Hugging Face Papers: https://huggingface.co/papers/2606.26087