論文の概要: Alignment Is All You Need For X-to-4D Generation
- arxiv url: http://arxiv.org/abs/2607.02516v1
- Date: Thu, 02 Jul 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.967109
- Title: Alignment Is All You Need For X-to-4D Generation
- Title(参考訳): X-to-4Dジェネレーションに必要なアライメント
- Abstract要約: 生成拡散モデルは、マルチモーダル制御の下で高品質な画像、ビデオ、および3Dコンテンツを合成するのに優れている。
本稿では,任意のモーダル入力をコヒーレントなビデオ3Dペアに変換するフレキシブルなフレームワークAlign4Dを提案する。
X4DとConsistent4Dの実験は、Align4DがX-to-4D生成における最先端の品質と一貫性を達成することを示した。
- 参考スコア(独自算出の注目度): 20.713176738165988
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative diffusion models excel at synthesizing high-quality images, videos, and 3D content under multimodal control. However, arbitrary user-defined modality-to-4D (X-to-4D) generation remains challenging due to the high cost of constructing diverse datasets and the limited scalability of existing methods. This paper presents Align4D, a flexible framework that translates any-modal input into coherent video-3D pairs, using video to guide 4D motion and 3D data to shape 4D geometry. Align4D introduces three key techniques: (1) Object Distance Alignment, which searches Video-Aligned and Multiview-Aligned Object Distances (VAOD/MAOD), respectively, to reconcile 4D renderings with video and the priors of multiview diffusion models; (2) Motion-Geometry Joint Alignment, which constrains known and unknown views through synchronized video and 3D inputs, ensuring consistent 4D generation; and (3) Asynchronous Optimization, which decouples Gaussian attribute and deformation network training to enhance motion and geometry fidelity. We further propose the X4D dataset, which integrates prompt, image, video, and 3D data for benchmarking. Experiments on X4D and Consistent4D demonstrate that Align4D achieves state-of-the-art quality and consistency in X-to-4D generation. Project page: https://miaoqiaowei.github.io/Align4D/.
- Abstract(参考訳): 生成拡散モデルは、マルチモーダル制御の下で高品質な画像、ビデオ、および3Dコンテンツを合成するのに優れている。
しかし、多様なデータセットを構築するコストが高く、既存のメソッドのスケーラビリティに制限があるため、任意のユーザ定義のModality-to-4D(X-to-4D)生成は依然として困難である。
本稿では,任意のモーダル入力をコヒーレントなビデオ3Dペアに変換するフレキシブルなフレームワークAlign4Dを提案する。
Align4Dは,(1)映像アライテッド・オブジェクト・ディスタンス(VAOD/MAOD)を検索するオブジェクト・ディスタンス・アライメント(オブジェクト・ディスタンス・アライメント),(2)映像と先行のマルチビュー拡散モデルの4Dレンダリングを調合するオブジェクト・ディスタンス・アライメント(オブジェクト・ディスタンス・アライメント),(2)映像と3D入力による未知のビューを制約するモーション・ジオメトリー・ジョイント・アライメント(モーション・ジオメトリー),(3)ガウス属性と変形ネットワークのトレーニングを分離して運動と幾何学的忠実性を向上する非同期最適化(Asynchronous Optimization)という3つの主要な手法を導入している。
さらに、ベンチマークのためのプロンプト、画像、ビデオ、および3Dデータを統合したX4Dデータセットを提案する。
X4DとConsistent4Dの実験は、Align4DがX-to-4D生成における最先端の品質と一貫性を達成することを示した。
プロジェクトページ: https://miaoqiaowei.github.io/Align4D/。
関連論文リスト
- Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis [53.48281548500864]
Motion 3-to-4は、単一のモノクロビデオから高品質な4Dダイナミックオブジェクトを合成するためのフィードフォワードフレームワークである。
我々のモデルは、コンパクトな動き潜在表現を学習し、フレーム単位の軌道を予測して、時間的コヒーレントな幾何である完全なロバスト性を取り戻す。
論文 参考訳(メタデータ) (2026-01-20T18:59:48Z) - VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control [83.92729346325163]
VerseCrafterは、4D対応のビデオワールドモデルであり、カメラとオブジェクトのダイナミクスの両方を明示的で一貫性のある制御を可能にする。
当社のアプローチは,静的な背景点雲を通じて世界状態をエンコードする,新しい4次元幾何制御表現を中心にしている。
これらの4D制御は、事前訓練されたビデオ拡散モデルのための条件付け信号にレンダリングされ、高忠実でビュー一貫性のあるビデオを生成することができる。
論文 参考訳(メタデータ) (2026-01-08T17:28:52Z) - SWiT-4D: Sliding-Window Transformer for Lossless and Parameter-Free Temporal 4D Generation [30.72482055095692]
SWiT-4Dは、損失のないパラメータフリーの時間的4Dメッシュ生成のためのスライディング・ウィンドウ変換器である。
SWiT-4D は任意の Diffusion Transformer (DiT) ベースの Image-to-3D ジェネレータとシームレスに統合される。
高忠実度幾何と安定した時間的整合性を実現し、非常に限られた4D監視下での実用的展開可能性を示す。
論文 参考訳(メタデータ) (2025-12-11T17:54:31Z) - Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image [88.71287865590273]
そこでTrajScene-60Kについて紹介する。
拡散型4次元シーン軌道生成装置(4D-STraG)を提案する。
次に、4Dポイントトラック表現から任意のカメラトラジェクトリでビデオをレンダリングする4Dビュー合成モジュール(4D-Vi)を提案する。
論文 参考訳(メタデータ) (2025-12-04T17:59:10Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - 4DNeX: Feed-Forward 4D Generative Modeling Made Easy [51.79072580042173]
1つの画像から4D(動的3D)シーン表現を生成するための最初のフィードフォワードフレームワークである4DNeXを提案する。
計算集約的な最適化やマルチフレームビデオ入力を必要とする既存の方法とは対照的に、4DNeXは効率的でエンドツーエンドの画像から4D生成を可能にする。
論文 参考訳(メタデータ) (2025-08-18T17:59:55Z) - 4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency [118.15258850780417]
textbf4DGenは、4Dコンテンツ作成のための新しいフレームワークである。
我々のパイプラインは、制御可能な4D生成を容易にし、ユーザがモノクロビデオで動きを指定したり、画像から映像への世代を適用できる。
既存のビデオから4Dのベースラインと比較すると,入力信号の忠実な再構成には優れた結果が得られる。
論文 参考訳(メタデータ) (2023-12-28T18:53:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。