論文の概要: PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation
- arxiv url: http://arxiv.org/abs/2607.01803v1
- Date: Thu, 02 Jul 2026 07:18:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.71855
- Title: PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation
- Title(参考訳): PixGS: 直接3Dガウススプラッター生成のためのピクセル空間拡散
- Authors: Duy Cao, Phong Nguyen-Ha,
- Abstract要約: PixGSは、高品質な3DGSを直接生成するためのシングルステージパイプラインである。
本手法は3次元ガウス属性を各時間ステップで直接分解することにより,外観と幾何学の両方の正確なスプラレベル正規化を可能にする。
- 参考スコア(独自算出の注目度): 0.6875312133832078
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in 3D content generation from text or images have achieved impressive results, yet view inconsistency from 2D generators and the scarcity of high-quality 3D data remain significant bottlenecks. Existing solutions typically adapt large-scale pre-trained text-to-image latent diffusion models to generate 3D Gaussian Splats (3DGS). However, these approaches often rely on training complex cascade pipelines that are computationally expensive and scalability-limited. Most critically, the quality of generated 3D assets is inherently constrained by each component capacity and compressed latent space, leading to decoding artifacts and accumulated errors. To address these limitations, we propose PixGS, a single-stage pipeline for direct high-quality 3DGS generation, which leverages recent advances in pixel-space diffusion to bypass lossy latent compression while still benefiting from the vast 2D generative priors. By directly denoising 3D Gaussian attributes at each timestep, our method enables precise, splat-level regularization of both appearance and geometry. Furthermore, we introduce a comprehensive supervision strategy that incorporates surface normals, depth, and high-frequency structural information, which is often overlooked in prior works. Experiments demonstrate that PixGS outperforms current state-of-the-art methods while maintaining a fast inference speed (1s on a single A100 GPU), offering a robust and efficient alternative to multi-stage generation pipelines.
- Abstract(参考訳): テキストや画像からの3Dコンテンツ生成の最近の進歩は目覚ましい成果を上げているが、2Dジェネレータの不整合と高品質な3Dデータの不足は大きなボトルネックのままである。
既存の解は通常、大規模に訓練されたテキストから画像への遅延拡散モデルに適応し、3Dガウススプレート(3DGS)を生成する。
しかしながら、これらのアプローチは計算コストが高く、拡張性に制限のある複雑なカスケードパイプラインのトレーニングに依存していることが多い。
最も重要な点として、生成された3Dアセットの品質は、各コンポーネントの容量と圧縮された潜在空間によって本質的に制約され、デコードされたアーティファクトと蓄積されたエラーに繋がる。
これらの制約に対処するために、PixGSを提案する。PixGSは、画素空間拡散の最近の進歩を生かし、損失の少ない潜在圧縮を回避しつつ、2D生成前の大きな利点を享受する。
本手法は3次元ガウス属性を各時間ステップで直接分解することにより,外観と幾何学の両方の正確なスプラレベル正規化を可能にする。
さらに, 表面の正常, 深度, 高周波構造情報を包含する包括的監視戦略を導入し, 先行研究で見落とされがちである。
実験によると、PixGSは高速な推論速度(A100 GPUで1秒)を維持しながら、現在の最先端メソッドよりも優れており、マルチステージ生成パイプラインに対する堅牢で効率的な代替手段を提供する。
関連論文リスト
- F3D-Gaus: Feed-forward 3D-aware Generation on ImageNet with Cycle-Aggregative Gaussian Splatting [35.625593119642424]
本稿では,モノケプラーデータセットから3次元認識を一般化する問題に取り組む。
画素整列型ガウススプラッティングに基づく新しいフィードフォワードパイプラインを提案する。
また,学習した3次元表現において,クロスビューの一貫性を強制する自己教師付きサイクル集約的制約を導入する。
論文 参考訳(メタデータ) (2025-01-12T04:44:44Z) - DSplats: 3D Generation by Denoising Splats-Based Multiview Diffusion Models [67.50989119438508]
本稿では,ガウスをベースとしたレコンストラクタを用いて,リアルな3Dアセットを生成することで,マルチビュー画像を直接認識するDSplatを紹介した。
実験の結果,DSplatsは高品質で空間的に一貫した出力を生成できるだけでなく,単一画像から3次元再構成への新たな標準も設定できることがわかった。
論文 参考訳(メタデータ) (2024-12-11T07:32:17Z) - 3D Convex Splatting: Radiance Field Rendering with 3D Smooth Convexes [87.01284850604495]
多視点画像から幾何学的に有意な放射場をモデル化するためのプリミティブとして3次元滑らかな凸を利用した3次元凸法(3DCS)を提案する。
3DCSは、MipNeizer, Tanks and Temples, Deep Blendingなどのベンチマークで、3DGSよりも優れたパフォーマンスを実現している。
本結果は,高品質なシーン再構築のための新しい標準となる3Dコンベクシングの可能性を強調した。
論文 参考訳(メタデータ) (2024-11-22T14:31:39Z) - PUP 3D-GS: Principled Uncertainty Pruning for 3D Gaussian Splatting [59.277480452459315]
本研究では,視覚的忠実度と前景の細部を高い圧縮比で保持する原理的感度プルーニングスコアを提案する。
また,トレーニングパイプラインを変更することなく,事前訓練した任意の3D-GSモデルに適用可能な複数ラウンドプルーファインパイプラインを提案する。
論文 参考訳(メタデータ) (2024-06-14T17:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。