論文の概要: RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and Generation
- arxiv url: http://arxiv.org/abs/2609.02847v2
- Date: Fri, 04 Sep 2026 10:21:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.624364
- Title: RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and Generation
- Title(参考訳): RoGe: エンド・ツー・エンドのインシシット・コンストラクションと生成による新しいビュー・シンセサイザー
- Authors: Xiaolei Lang, Ze Kang, Zehao Huang, Naiyan Wang,
- Abstract要約: 我々は、エンドツーエンドの統一的な再構築および生成フレームワークであるRoGeを紹介する。
スパースビューで固定されたシーン内でローミングを狙う。
スパース入力ビューから、RoGeはフィードフォワード再構成モデルで暗黙のシーン表現を構築する。
対象のカメラ線でクエリして、ビューごとの幾何学的特徴を得る。
- 参考スコア(独自算出の注目度): 22.7090348393767
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Novel view synthesis from sparse inputs requires both geometric grounding from the observed views and generative priors of unobserved regions, motivating recent hybrid methods that combine reconstruction and generation. However, existing methods bridge the two with rendered images or explicit 3D representations such as point maps or 3D Gaussians. Generation is thus conditioned on a lossy and imperfect projection of the scene, inheriting its errors, and reconstruction receives no signal from generation to correct them. We present RoGe, an end-to-end unified reconstruction and generation framework that removes this explicit bridge. It targets roaming within a scene anchored by sparse views: given a few posed images and a camera trajectory, it synthesizes a temporally coherent video along that trajectory. From the sparse input views, RoGe builds an implicit scene representation with a feed-forward reconstruction model, and queries it with target camera rays to obtain per-view geometric features. These features are injected into a video diffusion model as conditioning, without any 3D intermediate. Both modules are trained jointly, so the generation objective directly shapes its own geometric conditioning. We conduct experiments on DL3DV, where RoGe outperforms reconstruction-based, generation-based, and hybrid baselines on image-level metrics and video-level temporal consistency. Ablations confirm that ray-queried implicit features outperform both raw reconstruction tokens and rendered RGB as conditioning, and that joint training brings further gains. Our project page is at https://jerry-locker.github.io/roge/.
- Abstract(参考訳): スパース入力からの新たなビュー合成には、観測されたビューからの幾何学的グラウンドと、観測されていない領域の生成先行の両方が必要であり、再構築と生成を組み合わせた最近のハイブリッド手法を動機付けている。
しかし、既存の手法は2つの画像をレンダリングした画像や、ポイントマップや3Dガウスのような明示的な3D表現でブリッジする。
これにより、生成はシーンの損失と不完全な投影に条件付けされ、そのエラーを継承し、復元は生成からの信号を受け取って修正する。
私たちは、この明示的なブリッジを除去するエンドツーエンドの統一的な再構築および生成フレームワークであるRoGeを紹介します。
数枚のポーズ画像とカメラの軌跡から、その軌跡に沿って時間的に一貫した映像を合成する。
スパース入力ビューから、RoGeはフィードフォワード再構成モデルで暗黙のシーン表現を構築し、ターゲットのカメラ線でクエリして、ビューごとの幾何学的特徴を得る。
これらの特徴は、3D中間体を使わずに、条件付けとしてビデオ拡散モデルに注入される。
両方のモジュールは共同で訓練されるので、生成対象は直接、自身の幾何学的条件付けを形成する。
我々はDL3DVの実験を行い、RoGeは画像レベルのメトリクスとビデオレベルの時間的一貫性に基づく再構成ベースライン、生成ベース、ハイブリッドベースラインを上回っている。
アブレーションは、レイクエリーされた暗黙の特徴が生の再構成トークンとRGBの条件付けの両方より優れており、共同トレーニングによりさらなる利益がもたらされることを確認した。
私たちのプロジェクトページはhttps://jerry-locker.github.io/roge/です。
関連論文リスト
- GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors [14.045684695919116]
3DGSは、合成において顕著な成功を収めたが、スパースビュー下での再構成は、しばしば顕著な成果を上げている。
本稿では,スパース3DGSの再生品質を向上させるために,新しい3D対応ビデオ復元フレームワークを提案する。
提案手法は,PSNR/SSIM(Pixel- and Structure-level fidelity)を最適に実現し,マルチビューの整合性を向上させる。
論文 参考訳(メタデータ) (2026-08-22T08:47:29Z) - GenRec: Knowing Where to Reconstruct and Where to Generate [106.48347271421765]
GenRecは、再構築世代をそのアーキテクチャ、監督、勾配フローに直接分割するフローマッチングモデルである。
観察された領域で最高の復元忠実度を達成し、また、観測されていない領域では、知覚的品質の純粋に生成的ベースラインを超越する。
論文 参考訳(メタデータ) (2026-08-18T14:31:19Z) - GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction [69.35136600319714]
マルチビューRGB画像から高忠実度3Dシーンを再現する手法を提案する。
シーン再構成を条件付き3次元生成として,空間的局所化,重なり合うチャンクの集合に配置した。
切刃再建法を16%上回る高忠実度結果を得た。
論文 参考訳(メタデータ) (2026-05-22T17:49:59Z) - VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors [79.88300861391114]
VidSplatは、トレーニング不要な生成的再構築フレームワークである。
生成と再構築の効果的な統合を可能にする2つの重要な課題に取り組む。
広範に使用されているベンチマーク実験は、スパースビューのシーン再構成における優れた性能を示している。
論文 参考訳(メタデータ) (2026-05-12T02:20:31Z) - RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations [70.83499963694238]
RnG(Reconstruction and Generation)は、再構成と生成を統合する新しいフィードフォワードトランスである。
可視的幾何学を再構築し、可視的でコヒーレントな不明瞭な幾何学と外観を生成する。
提案手法は, 一般化可能な3次元再構成と新しいビュー生成の両方において, 最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-01T17:25:32Z) - Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction [28.19356197940266]
Gen3RはRGBビデオとカメラポーズ、深度マップ、グローバルポイントクラウドを含む対応する3D幾何学の両方を生成する。
本手法は, 再生先を活用すれば, 復元の堅牢性を高めることができる。
論文 参考訳(メタデータ) (2026-01-07T16:57:30Z) - OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting [78.70702961852119]
OracleGSは、Gaussian Splattingのスパースビューのために、生成的完全性と回帰的忠実性を調整している。
提案手法は,多視点幾何学的証拠に先立って強力な生成条件を定め,幻覚的アーティファクトをフィルタリングし,非拘束領域における可塑性完備を保存している。
論文 参考訳(メタデータ) (2025-09-27T11:19:32Z) - GenFusion: Closing the Loop between Reconstruction and Generation via Videos [24.195304481751602]
本稿では,再現性のあるRGB-Dレンダリングにおける映像フレームの条件付けを学習する再構成駆動型ビデオ拡散モデルを提案する。
また、生成モデルからトレーニングセットへの復元フレームを反復的に追加する循環核融合パイプラインを提案する。
論文 参考訳(メタデータ) (2025-03-27T07:16:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。