論文の概要: GaussFusion: Towards Multimodal 3D Gaussian Pretraining
- arxiv url: http://arxiv.org/abs/2607.05906v1
- Date: Tue, 07 Jul 2026 07:01:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.416308
- Title: GaussFusion: Towards Multimodal 3D Gaussian Pretraining
- Title(参考訳): GaussFusion:マルチモーダルな3Dガウス事前訓練を目指して
- Abstract要約: GaussFusionは3Dガウス表現のためのマルチモーダル事前学習フレームワークである。
GaussFusionは、画像とテキストの監督をマスク付きガウスモデルに統合する。
GaussFusion は ModelNet40 で Gaussian-MAE を上回っ、ScanObjectNN (PB-T50-RS) は 0.61%、ScanObjectNN (PB-T50-RS) は 3.85% である。
- 参考スコア(独自算出の注目度): 22.9925711988588
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D Gaussian Splatting provides an explicit representation that jointly models geometry and appearance, serving as a scalable foundation for 3D representation learning. Existing pre-training methods for Gaussian representations, such as masked Gaussian reconstruction, primarily capture local structures but offer limited semantic supervision. In this paper, we propose GaussFusion, a multimodal pre-training framework for 3D Gaussian representations. GaussFusion integrates image and text supervision into masked Gaussian modeling through cross-modal semantic alignment, enabling the Gaussian encoder to learn both visual and language-level semantic information during pre-training. To better adapt masked modeling to the non-uniform distribution of Gaussian primitives, we further propose Gaussian Salience-guided Multi-scale Hole Masking (GSHM). GSHM constructs spatially continuous masked regions based on Gaussian salience. By applying hole masks at multiple scales, GSHM encourages the encoder to capture both fine-grained local patterns and broader structural dependencies. Extensive experiments on downstream tasks demonstrate that GaussFusion improves the transferability of Gaussian representations. Notably, GaussFusion outperforms Gaussian-MAE on ModelNet40 and ScanObjectNN (PB-T50-RS) by 0.61\% and 3.85\%, respectively.
- Abstract(参考訳): 3D Gaussian Splattingは、幾何学と外観を共同でモデル化する明示的な表現を提供し、3D表現学習のスケーラブルな基盤として機能する。
マスク付きガウス再構成のような既存のガウス表現の事前訓練手法は、主に局所構造を捉えるが、限定的な意味的監督を提供する。
本稿では,3次元ガウス表現のためのマルチモーダル事前学習フレームワークであるガウスフュージョンを提案する。
GaussFusionは、画像とテキストの監督をモーダルなセマンティックアライメントを通じてマスク付きガウスモデリングに統合し、ガウスエンコーダは事前学習中に視覚的および言語レベルのセマンティック情報を学ぶことができる。
ガウスのプリミティブの非一様分布にマスク付きモデリングをよりうまく適応させるため,ガウスのサリエンス誘導多スケールホールマスキング(GSHM)を提案する。
GSHMはガウス塩分に基づく空間的に連続したマスキング領域を構成する。
複数のスケールでホールマスクを適用することで、GSHMはエンコーダにきめ細かい局所パターンとより広い構造的依存関係の両方をキャプチャすることを奨励する。
下流タスクに関する広範な実験は、ガウスフュージョンがガウス表現の転送可能性を改善することを示した。
特に、GaussFusion は ModelNet40 で Gaussian-MAE と ScanObjectNN (PB-T50-RS) をそれぞれ 0.61 % と 3.85 % で上回っている。
関連論文リスト
- GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception [13.265767966811312]
本稿では,3次元ガウス表現に基づくマルチモーダル融合のための新しい普遍的枠組みを提案する。
このアプローチは自然に、共有かつ連続な3次元ガウス空間内のマルチモーダル特徴を統一する。
実験はガウスフュージョンの一般性とロバスト性を示す。
論文 参考訳(メタデータ) (2026-07-01T10:28:15Z) - Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction [72.85652875805387]
フリーランジガウス(Free-Range Gaussians)は、4つの画像から非画素、非ボクセル対応の3Dガウスを推定する多視点再構成法である。
再構成の生成的定式化により,非グリッド型3次元データによるモデル管理が可能となった。
論文 参考訳(メタデータ) (2026-04-06T17:24:18Z) - F4Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting [28.800888081472422]
本稿では,フィードフォワード3次元ガウス分割のためのフィードフォワード予測デンシフィケーションを行うF4Splatを提案する。
本モデルでは, 地域ごとの密度化スコアを推定し, 必要なガウス密度を推定し, 最終ガウス予算の明示的な制御を可能にする。
実験により,従来のフィードフォワード法と比較して,本モデルが優れた新規ビュー合成性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-03-22T16:03:56Z) - ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding [7.610505486431266]
オープンボキャブラリ型多モードガウス型3Dシーン理解フレームワークであるShelfGaussianについて紹介する。
既存の手法は、オブジェクトをアノテーション付き3Dラベルで教師される閉集合意味ガウスとしてモデル化し、そのレンダリング能力を無視したり、純粋に2Dの自己スーパービジョンを通じてオープンセットガウス表現を学習する。
論文 参考訳(メタデータ) (2025-12-03T02:06:09Z) - ProtoGS: Efficient and High-Quality Rendering with 3D Gaussian Prototypes [81.48624894781257]
3D Gaussian Splatting (3DGS) は、新しいビュー合成において大きな進歩を遂げてきたが、ガウスプリミティブのかなりの数によって制限されている。
近年の手法では、密度の高いガウスの記憶容量を圧縮することでこの問題に対処しているが、レンダリングの品質と効率の維持には失敗している。
本稿では,ガウスの原始体を表現するためにガウスのプロトタイプを学習するProtoGSを提案し,視覚的品質を犠牲にすることなくガウスの総量を大幅に削減する。
論文 参考訳(メタデータ) (2025-03-21T18:55:14Z) - Gaussian Graph Network: Learning Efficient and Generalizable Gaussian Representations from Multi-view Images [12.274418254425019]
3D Gaussian Splatting (3DGS) は印象的なビュー合成性能を示した。
本稿ではガウスグラフネットワーク(GGN)を提案し,効率よく一般化可能なガウスグラフを生成する。
我々は大規模なRealEstate10KとACIDデータセットの実験を行い、本手法の効率性と一般化を実証した。
論文 参考訳(メタデータ) (2025-03-20T16:56:13Z) - GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction [55.60972844777044]
3Dセマンティック占有予測は、堅牢な視覚中心の自律運転において重要な課題である。
既存のほとんどの手法は、密度の高いグリッドベースのシーン表現を利用しており、運転シーンの空間的空間性を見渡している。
本稿では,各ガウス分布をその周辺領域の確率分布として解釈する確率論的ガウス重ね合わせモデルを提案する。
論文 参考訳(メタデータ) (2024-12-05T17:59:58Z) - PixelGaussian: Generalizable 3D Gaussian Reconstruction from Arbitrary Views [116.10577967146762]
PixelGaussianは、任意の視点から一般化可能な3Dガウス再構成を学習するための効率的なフレームワークである。
提案手法は,様々な視点によく一般化した最先端性能を実現する。
論文 参考訳(メタデータ) (2024-10-24T17:59:58Z) - MeshGS: Adaptive Mesh-Aligned Gaussian Splatting for High-Quality Rendering [61.64903786502728]
本稿では,メッシュ表現を3次元ガウススプラットと統合し,再現された現実世界のシーンの高品質なレンダリングを実現する手法を提案する。
各ガウススプレートとメッシュ表面との距離を, 密接な束縛と緩い束縛の相違点として検討した。
提案手法は,2dB高いPSNRを達成し,メッシュベースのガウス分割法を1.3dBPSNRで上回った。
論文 参考訳(メタデータ) (2024-10-11T16:07:59Z) - GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling [55.05713977022407]
構造的かつ完全明快な放射率表現を導入し、3次元生成モデリングを大幅に促進する。
我々はまず,新しい密度制約付きガウス適合アルゴリズムを用いてガウスキューブを導出する。
非条件およびクラス条件オブジェクト生成、デジタルアバター生成、テキスト・トゥ・3Dによる実験は、我々のモデル合成が最先端の生成結果を達成することを示す。
論文 参考訳(メタデータ) (2024-03-28T17:59:50Z) - Mesh-based Gaussian Splatting for Real-time Large-scale Deformation [58.18290393082119]
ユーザがリアルタイムで大きな変形で暗黙の表現を直接変形または操作することは困難である。
我々は,インタラクティブな変形を可能にする新しいGSベースの手法を開発した。
提案手法は,高いフレームレートで良好なレンダリング結果を維持しつつ,高品質な再構成と効率的な変形を実現する。
論文 参考訳(メタデータ) (2024-02-07T12:36:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。