論文の概要: DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2609.01516v1
- Date: Tue, 01 Sep 2026 16:45:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.837941
- Title: DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting
- Title(参考訳): DualDiff3D:Dual Structure-Adearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting
- Authors: Qian Wang, Yu Wang, Weiqi Li, Xinhua Cheng, Xiandong Meng, Ronggang Wang, Jian Zhang,
- Abstract要約: 3次元再構成と新規ビュー合成は、しばしばレンダリングされた新規ビューの再現品質とアーティファクトを低下させる。
最近の試みは、強力な拡散前処理を活用しようとするが、通常は1つのネットワークで追加の次元に沿ってレンダリングと参照ビューを処理している。
本稿では,2つの拡散先行処理を,SAAモジュールで実現する新しいパイプラインであるDualDiffを提案する。
提案手法は推論のみの設定でも最先端の手法よりも優れており,さらなる性能向上はトレーニングによって達成できる。
- 参考スコア(独自算出の注目度): 71.316050612276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While 3D Gaussian Splatting (3DGS) has revolutionized 3D reconstruction and novel-view synthesis, scenarios with limited input views often lead to poor reconstruction quality and artifacts in rendered novel views. Recent efforts attempt to utilize powerful diffusion priors, yet they typically process rendered and reference views concatenated along an additional dimension in a single network. These methods overlook an inherent nature that different views should maintain appearance similarity but differ in structure due to view shifts, leading to blur caused by conflicts between the two properties. In this paper, we propose DualDiff, a novel pipeline that leverages dual diffusion priors with a Structure-Appearance Attention (SAA) module to introduce reference guidance for refining low-quality novel views rendered from flawed 3D representations. Specifically, we retain one diffusion branch to focus on extracting structural information from the low-quality novel views, while introducing another branch to ensure appearance consistency with reference views. Furthermore, we present a 3D reconstruction framework named DualDiff3D, which integrates a reliability-enhanced Render-Refine-Optimize (RRO) loop to progressively and robustly incorporate the refined novel views, yielding more accurate 3DGS. Extensive experiments demonstrate that our approach outperforms state-of-the-art methods even in the inference-only setting, with further performance gains achievable through training. Our code and pre-trained weights are available at https://github.com/Akaneqwq/DualDiff3D.
- Abstract(参考訳): 3D Gaussian Splatting (3DGS) は3D再構成と新規ビュー合成に革命をもたらしたが、限られた入力ビューのシナリオは、しばしば新規ビューの描画において、再構築品質とアーティファクトの低下につながる。
最近の試みは、強力な拡散前処理を活用しようとするが、一般的にはレンダリングと参照ビューは単一のネットワークで追加の次元に沿って連結される。
これらの手法は、異なるビューが外観の類似性を維持するべきであるが、ビューシフトによって構造が異なるという固有の性質を見落としている。
本稿では,2つの拡散前処理とSAA(Structure-Appearance Attention)モジュールを併用した新しいパイプラインであるDualDiffを提案する。
具体的には、低品質な新規ビューから構造情報を抽出することに焦点を当て、参照ビューとの外観整合性を確保するために別のブランチを導入する。
さらに,信頼性を向上したRender-Refine-Optimize(RRO)ループを統合したDualDiff3Dという3D再構成フレームワークを提案する。
大規模な実験により,提案手法は推論のみの設定においても最先端の手法よりも優れており,さらなる性能向上はトレーニングによって達成可能であることが示された。
私たちのコードとトレーニング済みのウェイトはhttps://github.com/Akaneqwq/DualDiff3D.comで公開されています。
関連論文リスト
- View-Adaptive Renderer for View-Consistent 2D-to-3D Generation [2.8951915538170288]
単一の画像から3D形状を再構築することは、コンピュータビジョンの根本的な問題でありながら難しい問題である。
従来の単分子3D生成パイプラインは、Neural Radiance Field (NeRF)ベースの再構成を適用する前に、1つの入力画像から複数のビューを合成する。
本稿では、部分的に矛盾したマルチビュー入力をしても頑健な3次元再構成を可能にする視点適応型レンダリングニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T04:28:08Z) - Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentation [58.37682525044409]
Rewis3dは、フィードフォワード3D再構成の最近の進歩を活用し、2D画像上の弱い教師付きセマンティックセグメンテーションを著しく改善するフレームワークである。
Rewis3dはスパース監視における最先端のパフォーマンスを達成し、ラベルの追加や推論オーバーヘッドを必要とせずに既存のアプローチを2~7%上回ることを示す。
論文 参考訳(メタデータ) (2026-03-06T15:25:20Z) - BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model [3.7515646463759698]
我々は,高度にスパースで制約のない写真を用いて,多様な現実世界のシーンに対して,新しいビュー合成(NVS)の品質を高めるアプローチであるBetterSceneを提案する。
BetterSceneは、数十億のフレームで事前訓練されたプロダクション対応の安定ビデオ拡散(SVD)モデルを強力なバックボーンとして活用する。
我々は,挑戦的なDL3DV-10Kデータセットを評価し,最先端手法と比較して優れた性能を示した。
論文 参考訳(メタデータ) (2026-02-26T03:58:42Z) - One-Shot Refiner: Boosting Feed-forward Novel View Synthesis via One-Step Diffusion [57.824020826432815]
スパース画像から高忠実性ノベルビュー合成(NVS)を実現するための新しいフレームワークを提案する。
ViTバックボーンによって制限されることなく高解像度画像を処理できるデュアルドメイン詳細知覚モジュールを設計する。
我々は,修復過程において高周波の詳細を保存できる特徴誘導拡散ネットワークを開発した。
論文 参考訳(メタデータ) (2026-01-20T17:11:55Z) - Splatent: Splatting Diffusion Latents for Novel View Synthesis [6.338499852288994]
本稿では,VAEの潜伏空間における3次元ガウス散乱(3DGS)上での拡散に基づく拡張フレームワークであるSplatentについて述べる。
我々は3次元空間の細粒度を再構築する代わりに、多視点アテンション機構を通じて入力ビューから2次元に復元する。
論文 参考訳(メタデータ) (2025-12-10T18:57:04Z) - Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models [65.90387371072413]
本稿では,3次元再構成と新規ビュー合成を向上する新しいパイプラインであるDifix3D+を紹介する。
このアプローチのコアとなるのは、レンダリングされた新規ビューにおけるアーティファクトの強化と削除のためにトレーニングされた、単一ステップのイメージ拡散モデルであるDifixです。
論文 参考訳(メタデータ) (2025-03-03T17:58:33Z) - Synthesizing Consistent Novel Views via 3D Epipolar Attention without Re-Training [102.82553402539139]
大規模な拡散モデルでは、単一画像からの新規なビュー合成において顕著なゼロショット機能を示す。
これらのモデルは、新規および参照ビュー間の一貫性を維持する上で、しばしば課題に直面します。
入力ビューから重なり合う情報の探索と検索にエピポーラ幾何を用いることを提案する。
この情報はターゲットビューの生成に組み込まれ、トレーニングや微調整の必要がなくなる。
論文 参考訳(メタデータ) (2025-02-25T14:04:22Z) - Sparse3D: Distilling Multiview-Consistent Diffusion for Object
Reconstruction from Sparse Views [47.215089338101066]
スパースビュー入力に適した新しい3D再構成手法であるスパース3Dを提案する。
提案手法は,多視点拡散モデルから頑健な先行情報を抽出し,ニューラルラディアンス場を改良する。
強力な画像拡散モデルから2Dプリエントをタップすることで、我々の統合モデルは、常に高品質な結果をもたらす。
論文 参考訳(メタデータ) (2023-08-27T11:52:00Z) - Generative Novel View Synthesis with 3D-Aware Diffusion Models [96.78397108732233]
単一入力画像から3D対応の新規ビュー合成のための拡散モデルを提案する。
提案手法は既存の2次元拡散バックボーンを利用するが,重要な点として,幾何学的先行を3次元特徴体積の形で組み込む。
新たなビュー生成に加えて,本手法は3次元一貫性シーケンスを自己回帰的に合成する機能を備えている。
論文 参考訳(メタデータ) (2023-04-05T17:15:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。