論文の概要: Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis
- arxiv url: http://arxiv.org/abs/2607.01663v1
- Date: Thu, 02 Jul 2026 03:43:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.653776
- Title: Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis
- Title(参考訳): 単分子4次元シーン合成のための統一パノラマ・ガウス表現
- Authors: Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang,
- Abstract要約: 未確認領域での4次元シーン合成としてタスクを再構築する。
カメラ条件付きビデオ生成は、特定のカメラに沿って生成を誘導することで、見えない領域の合成を可能にする。
我々はパノラマ表現を明示的な動的表現に蒸留する統一パノラマ・ガウス表現であるパノラマ・ガウス表現を提案する。
- 参考スコア(独自算出の注目度): 8.854533413046957
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 4D scene synthesis from monocular videos has made significant progress in recent years. However, existing methods are typically constrained by view interpolation. As a result, they struggle to infer unseen regions beyond the observed views. In this paper, we reformulate the task as 4D scene synthesis with unseen regions, which extends beyond traditional interpolation settings. Camera-conditioned video generation enables unseen region synthesis by guiding generation along specified cameras. However, these methods lack explicit 3D priors and are optimized with random camera trajectories. This design leads to severe inconsistencies under large trajectory deviations. To address this limitation, we build a unified training and inference framework with panoramic trajectory guidance. While this design improves cross-view consistency, the panoramic representation alone fails to model dynamic content effectively. Object motion in panoramic space introduces scale and shape distortions. To address this, we propose PanoGaussian, a unified Panoramic-Gaussian representation that distills the panoramic representation into an explicit dynamic Gaussian representation to capture dynamic physical priors of the 4D scene. Experiments demonstrate that PanoGaussian achieves consistent 4D scene synthesis even under large viewpoint variations.
- Abstract(参考訳): 近年,モノクラービデオからの4Dシーンの合成が著しく進歩している。
しかし、既存の手法は一般的にビュー補間によって制約される。
その結果、観測された視点を超えて見えない地域を推測するのに苦労した。
本稿では,従来の補間環境を超えて,未確認領域を用いた4次元シーン合成としてタスクを再構築する。
カメラ条件付きビデオ生成は、特定のカメラに沿って生成を誘導することで、見えない領域の合成を可能にする。
しかし、これらの手法には明示的な3D先行性がなく、ランダムなカメラトラジェクトリで最適化されている。
この設計は、大きな軌道偏差の下で深刻な不整合をもたらす。
この制限に対処するため、パノラマ軌道誘導を用いた統合トレーニングおよび推論フレームワークを構築した。
この設計はビュー間の一貫性を改善するが、パノラマ表現だけでは動的コンテンツを効果的にモデル化できない。
パノラマ空間における物体の動きは、スケールと形状の歪みをもたらす。
これを解決するために,パノラマとガウスの統一表現であるパノガウス表現を提案し,パノラマの表現を明示的な動的ガウス表現に蒸留し,4次元シーンの動的物理的先行を捉える。
実験により、パノガウシアンは大きな視点変化の下でも一貫した4次元シーン合成を実現することが示された。
関連論文リスト
- Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - SEE4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting [83.5106058182799]
SEE4Dは, カジュアルビデオから4次元世界モデリングを行うための, ポーズのないトラジェクトリ・ツー・カメラ・フレームワークである。
モデル内のビュー条件ビデオは、現実的に合成された画像を認知する前に、ロバストな幾何学を学ぶために訓練される。
クロスビュービデオ生成とスパース再構成のベンチマークでSee4Dを検証した。
論文 参考訳(メタデータ) (2025-10-30T17:59:39Z) - 4D Driving Scene Generation With Stereo Forcing [62.47705572424127]
現在の生成モデルは、時間外挿と空間的新規ビュー合成(NVS)をシーンごとの最適化なしで同時にサポートする動的4D駆動シーンの合成に苦慮している。
PhiGenesisは、幾何学的・時間的整合性を持った映像生成技術を拡張する4次元シーン生成のための統合フレームワークである。
論文 参考訳(メタデータ) (2025-09-24T15:37:17Z) - In-2-4D: Inbetweening from Two Single-View Images to 4D Generation [63.68181731564576]
Inbetween-2-4Dという,2枚のシングルビュー画像を補間する4次元(つまり3D + モーション)の生成問題を提案する。
テキストや1つの画像のみからの映像/4D生成とは対照的に、補間タスクはより正確なモーション制御を利用して生成をよりよく制約することができる。
論文 参考訳(メタデータ) (2025-04-11T09:01:09Z) - Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency [49.875459658889355]
Free4Dは、単一の画像から4Dシーンを生成するためのチューニング不要のフレームワークである。
我々の重要な洞察は、一貫した4次元シーン表現のために、事前訓練された基礎モデルを蒸留することである。
結果の4D表現はリアルタイムで制御可能なレンダリングを可能にする。
論文 参考訳(メタデータ) (2025-03-26T17:59:44Z) - 4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives [115.67081491747943]
動的3Dシーン表現と新しいビュー合成はAR/VRおよびメタバースアプリケーションの実現に不可欠である。
我々は,その基礎となる4次元体積を近似として,時間変化の異なる3次元シーンの再構成を再構成する。
ストレージのボトルネックに対処するため、メモリフットプリントを効果的に削減するいくつかのコンパクトなバリエーションを導出する。
論文 参考訳(メタデータ) (2024-12-30T05:30:26Z) - Vidu4D: Single Generated Video to High-Fidelity 4D Reconstruction with Dynamic Gaussian Surfels [35.27805034331218]
単一生成ビデオから4D表現を正確に再構成する新しい再構成モデルVidu4Dを提案する。
Vidu4Dのコアとなるのは、提案した動的ガウスサーフェス(DGS)技術である。
論文 参考訳(メタデータ) (2024-05-27T04:43:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。