論文の概要: MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
- arxiv url: http://arxiv.org/abs/2606.26087v1
- Date: Wed, 24 Jun 2026 17:56:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.422421
- Title: MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
- Title(参考訳): MVTrack4Gen:4Dビデオ生成のための幾何学的スーパービジョンとしてのマルチビューポイントトラッキング
- Authors: JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim,
- Abstract要約: MVTrack4Genは、カメラコンディショニングのみの新規ビュービデオ拡散モデルのためのモーションアウェアトレーニングフレームワークである。
我々の重要な発見は、特定の注意層が強い対応の手がかりを符号化することであり、そこでは、クエリ機能は幾何学的に対応する場所で重要な特徴に付随する。
これらの動き認識対応を明示的に強化することにより、MVTrack4Genは既存のモデルを改善し、参照ビューにおける動きをより良く追従し、クロスビューの幾何的一貫性を維持する。
- 参考スコア(独自算出の注目度): 50.65653874052261
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthesizing a novel-view video from a monocular reference video along a target camera trajectory requires both geometric consistency and motion fidelity with respect to the reference video. Existing methods based on explicit 3D representations are limited by the accuracy of off-the-shelf reconstruction modules, which often produce inaccurate geometry for dynamic objects in monocular videos. In contrast, camera-conditioning-only methods can achieve high visual quality but often struggle to preserve geometric and motion consistency. In this work, we introduce MVTrack4Gen (Multi-View point Tracking for Novel-View Generation), a motion-aware training framework that leverages multi-view point tracking as an additional geometric and motion supervision signal for camera-conditioning-only novel-view video diffusion models. Our key finding is that specific attention layers encode strong correspondence cues, where query features attend to key features at geometrically corresponding locations across views and over time, and the misalignment of these correspondences causes motion inconsistency. Based on this observation, we route these features into an auxiliary multi-view tracking head and jointly train the diffusion model with a point-tracking objective. By explicitly strengthening these motion-aware correspondences, MVTrack4Gen improves existing models to better follow the motion in the reference view and maintain cross-view geometric consistency. Across diverse benchmarks, our method achieves state-of-the-art geometric consistency and competitive camera accuracy.
- Abstract(参考訳): 対象のカメラ軌道に沿って単眼の基準映像から新しい視点映像を合成するには、基準映像に対する幾何学的一貫性と動きの忠実さの両方が必要である。
明示的な3D表現に基づく既存の手法は、既製の再構成モジュールの精度によって制限される。
対照的に、カメラコンディショニングのみの手法は、高い視覚的品質を達成することができるが、幾何学的・運動的整合性を維持するのに苦慮することが多い。
本研究では,カメラコンディショニングのみの新規視点映像拡散モデルのための幾何的および運動監視信号として多視点点追跡を利用する動き認識学習フレームワークであるMVTrack4Genを紹介する。
我々の重要な発見は、特定の注意層が強い対応の手がかりを符号化し、クエリー特徴がビューや時間の経過とともに幾何的に対応する場所のキー特徴に付随し、これらの対応の不整合が動きの不整合を引き起こすことである。
この観測に基づいて,これらの特徴を補助的な多視点追跡ヘッドにルーティングし,点追跡目的の拡散モデルを共同で訓練する。
これらの動き認識対応を明示的に強化することにより、MVTrack4Genは既存のモデルを改善し、参照ビューにおける動きをより良く追従し、クロスビューの幾何的一貫性を維持する。
本手法は,様々なベンチマークにおいて,最先端の幾何整合性および競合カメラの精度を実現する。
関連論文リスト
- Go-with-the-Track: Video Compositing and Motion Control with Point Tracking [50.22693773328114]
フィルム製造は正確な動き制御と参照画像合成を要求する。
複数の参照画像と参照アンコレートされたポイントトラックを共同で条件付けすることで、両方の機能を統一するGo-with-the-Trackを提案する。
Go-with-the-Trackは単一のモデルで優れた動きと参照制御を実現する。
論文 参考訳(メタデータ) (2026-06-18T19:40:03Z) - CalibAnyView: Beyond Single-View Camera Calibration in the Wild [59.66873936532375]
カメラキャリブレーションは、信頼性の高い幾何学的知覚の基本的な前提条件である。
近年の学習に基づく手法では、単一ビューの校正には有望な結果が得られたが、本質的に複数のビューにまたがる幾何的整合性は無視されている。
任意の数の入力ビューをサポートする統一的な定式化であるCalibAnyViewを紹介します。
論文 参考訳(メタデータ) (2026-05-14T09:32:12Z) - UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models [20.550231658763085]
カメラ制御可能な画像編集は、カメラポーズの異なるシーンの新しいビューを合成することを目的としている。
既存の方法は、表現レベルで点雲を注入するなど、断片化された幾何学的ガイダンスに依存している。
カメラ制御可能な新しい編集フレームワークUniGeoを提案する。
論文 参考訳(メタデータ) (2026-04-19T18:11:08Z) - SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis [47.61773799705708]
同期多視点HOIビデオと4Dモーションを共同生成する最初のモデルであるSyncMV4Dを紹介する。
本手法は,視覚リアリズム,運動可視性,多視点整合性において,最先端の代替手段よりも優れた性能を示す。
論文 参考訳(メタデータ) (2025-11-24T17:14:19Z) - Decoupling Dynamic Monocular Videos for Dynamic View Synthesis [50.93409250217699]
動的モノクロビデオからの動的ビュー合成の課題を教師なしで解決する。
具体的には、動的物体の運動を物体の動きとカメラの動きに分離し、教師なし表面の整合性およびパッチベースのマルチビュー制約によって規則化する。
論文 参考訳(メタデータ) (2023-04-04T11:25:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。