論文の概要: Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences
- arxiv url: http://arxiv.org/abs/2607.00832v1
- Date: Wed, 01 Jul 2026 11:54:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.880862
- Title: Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences
- Title(参考訳): Pano2World: 統一マルチビューシーケンスによるエンドツーエンド3D生成
- Abstract要約: パノ2ワールドは屋内パノラマを入力とし、永続的で探索可能な3Dガウスのシーンを直接出力する。
実験により、Pano2Worldは、マルチポジションパノラマノビュー合成ベンチマークにおいて、既存の手法を著しく上回っていることが示された。
- 参考スコア(独自算出の注目度): 9.89397063309918
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A single panorama captures the full visual sphere from one camera center, yet confines users to looking around in place without enabling true scene exploration. Converting a single panorama into a persistent, renderable 3D representation for free-viewpoint navigation has attracted growing interest; existing methods either adopt iterative per-view completion that propagates inpainting results to update the underlying geometry, leading to progressive error accumulation and cumbersome multi-step pipelines, or leverage the temporal consistency priors of video generation models, yet the continuous-trajectory constraint intrinsic to such models limits their flexibility in covering scenes from multiple directions simultaneously. We present Pano2World, which takes a single indoor panorama as input and directly outputs a persistent, explorable 3D Gaussian scene. Given the source panorama, Pano2World first reconstructs a coarse 3D Gaussian proxy and renders it at adaptively sampled nearby poses to obtain geometrically aligned guidance panoramas; a panoramic diffusion model then jointly denoises all target views via View-Aware Attention Routing, where each target view simultaneously receives geometric constraints from its corresponding guidance panorama and global semantic guidance from the source panorama, naturally enforcing cross-view consistency. To avoid the information loss incurred by decoding the multi-view hidden features formed during joint denoising back to the pixel domain via VAE, we introduce Latent Feature Adapter, a geometry-aware bridge module that directly distills these hidden features into a scene latent, subsequently decoded into the final 3D Gaussian scene. Experiments demonstrate that Pano2World significantly outperforms existing methods on the multi-position panoramic novel-view synthesis benchmark.
- Abstract(参考訳): 1つのパノラマが1つのカメラセンターから全視野をキャプチャするが、真のシーン探索を行なわずに、ユーザーはその場で見回すことができる。
1つのパノラマを、自由視点ナビゲーションのための永続的でレンダリング可能な3D表現に変換することには、注目が集まっている。既存の手法では、インペインティング結果を伝播して、基礎となる幾何学を更新し、プログレッシブなエラーの蓄積と煩雑な多段階パイプラインにつながるか、ビデオ生成モデルの時間的一貫性を活かすか、あるいはそのようなモデルに固有の連続軌道制約は、複数の方向からシーンを同時にカバーすることの柔軟性を制限している。
パノ2ワールドは屋内パノラマを入力とし、永続的で探索可能な3Dガウスのシーンを直接出力する。
ソースパノラマが与えられた場合、パノラマ世界はまず粗い3Dガウシアンプロキシを再構築し、近隣のポーズを適応的にサンプリングし、幾何学的に整列したガイダンスパノラマを得る。パノラマ拡散モデルでは、ビュー・アウェア・アテンション・ルーティングを通じて全てのターゲットビューを共同で識別する。
VAEを介して画素領域に復調する際に生じる多視点隠れ特徴を復号化して得られる情報損失を回避するため,これらの隠蔽特徴を直接潜伏する幾何学的ブリッジモジュールであるLatent Feature Adapterを導入し,その後,最終3次元ガウスシーンに復号する。
実験により、Pano2Worldは、マルチポジションパノラマノビュー合成ベンチマークにおいて、既存の手法を著しく上回っていることが示された。
関連論文リスト
- Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas [101.58587238272462]
テキスト駆動型没入型3Dシーン合成のための統合フレームワークであるStepperを提案する。
Stepperは新しい大規模なマルチビューパノラマデータセットでトレーニングされている。
最先端の忠実さと構造的な一貫性を実現し、以前のアプローチよりも優れています。
論文 参考訳(メタデータ) (2026-03-30T20:26:28Z) - SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views [69.08965991211704]
ユーザ中心のワークフローにおける3Dシーンの拡大について検討する。
固定シーンにおける単純なオブジェクト編集やスタイル転送とは異なり、挿入されたビューは元の再構築と3Dミスアライメントされることが多い。
パラメトリックフィードフォワード3D再構成モデルにテスト時間適応を適用したSceneExpanderを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:04:48Z) - CylinderSplat: 3D Gaussian Splatting with Cylindrical Triplanes for Panoramic Novel View Synthesis [53.231427733457224]
CylinderSplatはパノラマ3DGSのフィードフォワードフレームワークである。
シングルビューおよびマルチビューパノラマノビュー合成において、最先端の結果を達成する。
論文 参考訳(メタデータ) (2026-03-06T04:04:20Z) - PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion [87.13016347332943]
PanoWorld-Xは、多彩なカメラ軌道を持つ高忠実で制御可能なパノラマビデオ生成のための新しいフレームワークである。
動作範囲,制御精度,視覚的品質など,様々な面で優れた性能を示す実験を行った。
論文 参考訳(メタデータ) (2025-09-29T16:22:00Z) - You Need a Transition Plane: Bridging Continuous Panoramic 3D Reconstruction with Perspective Gaussian Splatting [57.44295803750027]
本稿では,連続的なパノラマ3次元シーンをガウススプラッティングで橋渡しするための新しいフレームワークTPGSを提案する。
具体的には、個々の立方体面内で3Dガウスを最適化し、縫合されたパノラマ空間でそれらを微調整する。
屋内、屋外、エゴセントリック、ローミングのベンチマークデータセットの実験は、我々のアプローチが既存の最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-04-12T03:42:50Z) - ExScene: Free-View 3D Scene Reconstruction with Gaussian Splatting from a Single Image [4.366356163044466]
既存の方法は、単一視点からの視野が狭い低一貫性の3Dシーンを再構成するためにしばしば制限される。
任意の単視点画像から没入型3Dシーンを再構成する2段階パイプラインであるExSceneを提案する。
ExSceneは単一ビュー入力のみを使用して一貫した没入的なシーン再構築を実現する。
論文 参考訳(メタデータ) (2025-03-31T09:33:22Z) - DiffPano: Scalable and Consistent Text to Panorama Generation with Spherical Epipolar-Aware Diffusion [60.45000652592418]
本稿では,テキスト駆動型パノラマ生成フレームワークDiffPanoを提案し,拡張性,一貫性,多様なパノラマシーン生成を実現する。
DiffPanoは、不明瞭なテキスト記述とカメラのポーズによって、一貫した多様なパノラマ画像を生成することができることを示す。
論文 参考訳(メタデータ) (2024-10-31T17:57:02Z) - Pano2Room: Novel View Synthesis from a Single Indoor Panorama [20.262621556667852]
Pano2Roomは、1枚のパノラマ画像から高品質な3D屋内シーンを自動的に再構築するように設計されている。
鍵となるアイデアは、最初に入力パノラマから予備メッシュを構築し、パノラマRGBDインペイントを使用して反復的にこのメッシュを洗練することである。
精巧なメッシュは3次元ガウス散乱場に変換され、収集された擬似ノベルビューで訓練される。
論文 参考訳(メタデータ) (2024-08-21T08:19:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。