論文の概要: UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2608.04701v1
- Date: Wed, 05 Aug 2026 11:10:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.835236
- Title: UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models
- Title(参考訳): UniWorld-View:ビデオ拡散モデルによる大規模ベースラインビュー合成
- Authors: Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan,
- Abstract要約: 単分子入力から制御可能な大ベースライン新規ビュー合成のためのフレームワークUniWorld-Viewを紹介する。
UniWorld-Viewは、正確なカメラ制御と幾何学的に一貫したビュー生成を可能にするために、生成拡散モデリングと明示的な3Dガイダンスを統合している。
- 参考スコア(独自算出の注目度): 46.428624307379266
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The abundance of casually captured monocular videos and images on social media provides a valuable source for immersive content creation, where generating novel views from such sparse observations can greatly enhance user experiences. However, producing photorealistic and geometrically consistent views with precise camera control remains challenging when input coverage is extremely limited. Reconstruction-based approaches such as NeRF and 3D Gaussian Splatting (3DGS) deteriorate severely under sparse inputs and fail to explicitly handle occlusions. Generative methods ease data requirements but still struggle with large-baseline view synthesis due to inaccurate or implicit geometric guidance. To overcome these limitations, we introduce UniWorld-View, a unified framework for controllable large-baseline novel view synthesis from monocular inputs. UniWorld-View integrates explicit 3D guidance with generative diffusion modeling to enable precise camera control and geometrically consistent view generation. The geometric guidance is obtained through an occlusion-aware point cloud rendering strategy that resolves visibility ambiguities and provides accurate priors for diffusion-based synthesis. By coupling this rendering strategy with powerful video diffusion backbones, UniWorld-View achieves high-fidelity novel view generation even under extreme camera motions and wide-baseline changes, and can further provide multi-view videos for downstream dynamic 3DGS reconstruction. Experiments on the WorldScore benchmark and zero-shot NVS benchmarks demonstrate the effectiveness of UniWorld-View in controllability, geometric consistency, and visual fidelity.
- Abstract(参考訳): カジュアルにキャプチャされたモノクラービデオやソーシャルメディア上の画像が豊富であることは、没入型コンテンツ作成の貴重な情報源となり、このようなスパースな観察から新しいビューを生成することによって、ユーザエクスペリエンスを大幅に向上させることができる。
しかし、入力カバレッジが極端に限られている場合には、正確なカメラ制御によるフォトリアリスティックで幾何学的に一貫したビューを生成することは困難である。
NeRFや3D Gaussian Splatting(3DGS)のような再構成に基づくアプローチは、スパース入力下で著しく悪化し、オクルージョンを明示的に扱えない。
生成法はデータ要件を緩和するが、不正確なまたは暗黙的な幾何学的ガイダンスのため、大規模なベースラインビューの合成に苦慮している。
これらの制約を克服するために,単分子入力から制御可能な大ベースライン新規ビュー合成のための統合フレームワークUniWorld-Viewを導入する。
UniWorld-Viewは、正確なカメラ制御と幾何学的に一貫したビュー生成を可能にするために、生成拡散モデリングと明示的な3Dガイダンスを統合している。
幾何学的ガイダンスは、視界の曖昧さを解消し、拡散に基づく合成の正確な事前情報を提供するオクルージョン対応のポイントクラウドレンダリング戦略によって得られる。
このレンダリング戦略を強力なビデオ拡散バックボーンと組み合わせることで、UniWorld-Viewは、極端なカメラモーションやワイドベースラインの変更の下でも、高忠実な新規ビュー生成を実現し、さらに下流のダイナミック3DGS再構成のためのマルチビュービデオを提供することができる。
WorldScoreベンチマークとゼロショットNVSベンチマークの実験では、制御性、幾何学的整合性、視覚的忠実性におけるUniWorld-Viewの有効性が示されている。
関連論文リスト
- OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis [16.645032433380603]
新規ビュー合成(NVS)は、限られた数の既知のビューを条件に、3Dオブジェクトの見えないビューを生成することを目的としている。
軌道ビデオ生成タスクとしてNVSを再構成するOrbitNVSを提案する。
我々は,OrbitNVS が GSO と OmniObject3D ベンチマークにおいて,従来の手法よりも大幅に優れていたことを示す。
論文 参考訳(メタデータ) (2026-03-20T03:40:36Z) - GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis [73.97869945427645]
GeoNVSは、幾何学的忠実度とカメラ制御性の両方を明示的な3D幾何学的ガイダンスによって強化する新規なビューシンセサイザーである。
GS-Adapterは3次元ガウス表現に入力ビュー拡散特徴を持ち上げ、幾何学的に矛盾しない表現を補正するために拡散特徴を適応的に融合させる。
9シーンと18設定の実験では最先端のパフォーマンスを示し、SEVAやCameraCtrlよりも11.3%、14.9%改善されている。
論文 参考訳(メタデータ) (2026-03-16T08:23:00Z) - SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations [44.53106180688135]
この作業は、スパースやシングルビューのインプットから3Dシーンを再構築する上での課題である。
SpatialCrafterは,ビデオ拡散モデルにおける豊富な知識を活用して,可算的な追加観測を生成するフレームワークである。
トレーニング可能なカメラエンコーダと、明示的な幾何学的制約に対するエピポーラアテンション機構により、精密なカメラ制御と3D整合性を実現する。
論文 参考訳(メタデータ) (2025-05-17T13:05:13Z) - ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis [63.169364481672915]
単一またはスパース画像からジェネリックシーンの高忠実な新規ビューを合成する新しい方法である textbfViewCrafter を提案する。
提案手法は,映像拡散モデルの強力な生成能力と,ポイントベース表現によって提供される粗い3D手がかりを利用して高品質な映像フレームを生成する。
論文 参考訳(メタデータ) (2024-09-03T16:53:19Z) - FreeSplat: Generalizable 3D Gaussian Splatting Towards Free-View Synthesis of Indoor Scenes [50.534213038479926]
FreeSplatは、長いシーケンス入力から自由視点合成まで、幾何学的に一貫した3Dシーンを再構築することができる。
ビュー数に関係なく、広いビュー範囲にわたる堅牢なビュー合成を実現するための、シンプルで効果的なフリービュートレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-05-28T08:40:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。