論文の概要: Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks
- arxiv url: http://arxiv.org/abs/2606.15534v1
- Date: Sun, 14 Jun 2026 01:23:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.680255
- Title: Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks
- Title(参考訳): Track2View:Paired 3D Point Tracksによる4D連続カメラによるビデオ生成
- Abstract要約: 既存の方法は、フレームごとの埋め込み、ノイズの多いポイントクラウドレンダリング、暗黙の学習対応に依存している。
本研究では,ペアの3Dポイントトラック上でビデオ拡散変換を行うTrack2Viewを提案する。
Track2Viewの中核は、ソースからターゲットビューへ視覚コンテキストを転送するデュアルビュートラックコンディショナーである。
- 参考スコア(独自算出の注目度): 18.57720960197565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Re-rendering an existing video from a novel camera viewpoint requires the output to follow the prescribed camera trajectory while preserving the appearance and dynamics of the original scene across every frame. Existing methods rely on per-frame pose embeddings, noisy point-cloud renderings, or implicit learned correspondences, none of which provides an explicit, temporally continuous link between source and target pixels. We propose Track2View, which conditions a video diffusion transformer on paired 3D point tracks: sparse trajectories of scene points projected into both the source and target camera views. These tracks provide explicit spatiotemporal correspondences that are temporally continuous by construction, encoding what content should appear where and when. At the core of Track2View is a dual-view track conditioner that transfers visual context from source to target view through parameter-free geometric operations and learned temporal aggregation, ensuring generalization to arbitrary camera trajectories without memorizing specific motions. We further introduce a data curation pipeline that extracts one-to-one track correspondences by running a 3D point tracker on temporally concatenated multi-camera view pairs. On a 400-video benchmark spanning static and dynamic scenes, Track2View achieves state-of-the-art results across visual quality, view synchronization, and camera accuracy, reducing rotation error by 30-65% and translation error by 61-72% relative to leading baselines. Project page is available at this https URL: https://qjizhi.github.io/track2view
- Abstract(参考訳): 新たなカメラ視点から既存の映像を再レンダリングするには、各フレームにまたがる元のシーンの外観とダイナミクスを保ちながら、所定のカメラ軌跡に従う必要がある。
既存の方法はフレーム単位のポーズ埋め込み、ノイズの多いポイントクラウドレンダリング、暗黙の学習対応に依存しており、いずれもソースとターゲットピクセル間の明示的で時間的に連続的なリンクを提供していない。
本稿では,映像拡散トランスフォーマを2つの3Dポイントトラックに設定するTrack2Viewを提案する。
これらのトラックは、建設によって時間的に連続した明示的な時空間対応を提供し、どのコンテンツがどこにいつ現れるべきかを符号化する。
Track2Viewのコアとなるデュアルビュートラックコンディショナーは、パラメータフリーな幾何学的操作を通じて、ソースからターゲットビューへ視覚コンテキストを転送し、時間的アグリゲーションを学習し、特定の動きを記憶せずに任意のカメラトラジェクトリへの一般化を保証する。
さらに、時間的に連結されたマルチカメラビューペア上で3Dポイントトラッカーを実行することで、1対1のトラック対応を抽出するデータキュレーションパイプラインを導入する。
静的およびダイナミックなシーンにまたがる400ビデオのベンチマークでは、Track2Viewは、視覚的品質、ビュー同期、カメラの精度にまたがる最先端の結果を達成し、ローテーションエラーを30-65%削減し、翻訳エラーを61-72%削減した。
プロジェクトページは、このhttpsURLで利用可能である。
関連論文リスト
- TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views [50.26507994908593]
この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが、屋内と屋外のドメインにまたがる7つのサブセットにまたがっている。
本研究では,センサ深度,LiDAR,SLAM,SfM点,ヒューマンメッシュ,ポーズされたオブジェクトメッシュ,シミュレーションといった,データセット固有の補助的モダリティを用いてこれらのトラジェクトリを解析し,各シーケンスとトラジェクトリを人間のアノテーションによって視覚的に検証する。
論文 参考訳(メタデータ) (2026-09-01T21:58:51Z) - Go-with-the-Track: Video Compositing and Motion Control with Point Tracking [50.22693773328114]
フィルム製造は正確な動き制御と参照画像合成を要求する。
複数の参照画像と参照アンコレートされたポイントトラックを共同で条件付けすることで、両方の機能を統一するGo-with-the-Trackを提案する。
Go-with-the-Trackは単一のモデルで優れた動きと参照制御を実現する。
論文 参考訳(メタデータ) (2026-06-18T19:40:03Z) - Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation [49.12018869332346]
InfCamは、高ポーズ忠実度でカメラ制御されたビデオ・ビデオ生成フレームワークである。
1)ビデオ拡散モデルの2次元潜在空間内で直接3次元カメラ回転を符号化する。
論文 参考訳(メタデータ) (2025-12-18T20:03:05Z) - C4D: 4D Made from 3D through Dual Correspondences [77.04731692213663]
時間的対応を利用して既存の3次元再構成を4Dに拡張するフレームワークであるC4Dを紹介する。
C4Dは、短期光学フローと長期点追跡の2種類の対応をキャプチャする。
我々は、追加の移動情報を提供する動的認識ポイントトラッカーを訓練する。
論文 参考訳(メタデータ) (2025-10-16T17:59:06Z) - Multi-View 3D Point Tracking [67.21282192436031]
本稿では,複数のカメラビューを用いた動的シーンにおける任意の点の追跡を目的とした,データ駆動型マルチビュー3Dポイントトラッカーについて紹介する。
本モデルでは,現実的な数のカメラを用いて直接3次元対応を推定する。
我々は5K合成多視点Kubricシーケンスをトレーニングし、2つの実世界のベンチマークで評価する。
論文 参考訳(メタデータ) (2025-08-28T17:58:20Z) - SpatialTrackerV2: 3D Point Tracking Made Easy [73.0350898700048]
SpaceTrackerV2はモノクロビデオのフィードフォワード3Dポイントトラッキング手法である。
これは、世界空間の3Dモーションをシーン幾何学、カメラエゴモーション、ピクセルワイドオブジェクトモーションに分解する。
このような異種データから幾何学と運動を共同で学習することで、SpatialTrackerV2は既存の3Dトラッキング方法よりも30%優れています。
論文 参考訳(メタデータ) (2025-07-16T17:59:03Z) - St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World [106.91539872943864]
St4RTrackは、RGB入力から世界座標フレーム内の動的ビデオコンテンツを同時に再構成し、追跡するフレームワークである。
静的および動的シーン幾何学の両方をキャプチャして、同じ世界において、同時に両方のポイントマップを予測する。
統合されたデータ駆動フレームワークの有効性と効率を実証し、世界フレームの再構築と追跡のための新しい広範囲なベンチマークを構築します。
論文 参考訳(メタデータ) (2025-04-17T17:55:58Z) - Fast Encoder-Based 3D from Casual Videos via Point Track Processing [22.563073026889324]
そこで我々は,カジュアルビデオから3D構造とカメラの位置を動的コンテンツから推定できる学習ベースのTracksTo4Dを提案する。
TracksTo4Dは、カジュアルなビデオのデータセットに基づいて教師なしの方法で訓練される。
実験により、TracksTo4Dは、最先端の手法に匹敵する精度で、基礎となるビデオの時間点雲とカメラの位置を再構築できることが示された。
論文 参考訳(メタデータ) (2024-04-10T15:37:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。