論文の概要: GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens
- arxiv url: http://arxiv.org/abs/2604.15284v2
- Date: Fri, 17 Apr 2026 07:38:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 13:38:49.408711
- Title: GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens
- Title(参考訳): GlobalSplat: 効率的なフィードフォワード3Dガウシアンスプレイティング
- Abstract要約: 最初にアライメントの原則に基づいて構築されたGlobalSplatを紹介します。
提案手法は,マルチビュー入力を符号化し,クロスビュー対応を解消する,コンパクトでグローバルな潜在シーン表現を学習する。
RealEstate10KとACIDでは,16Kガウスしか利用せず,競合するノベルビュー合成性能を実現している。
- 参考スコア(独自算出の注目度): 41.96744884413287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The efficient spatial allocation of primitives serves as the foundation of 3D Gaussian Splatting, as it directly dictates the synergy between representation compactness, reconstruction speed, and rendering fidelity. Previous solutions, whether based on iterative optimization or feed-forward inference, suffer from significant trade-offs between these goals, mainly due to the reliance on local, heuristic-driven allocation strategies that lack global scene awareness. Specifically, current feed-forward methods are largely pixel-aligned or voxel-aligned. By unprojecting pixels into dense, view-aligned primitives, they bake redundancy into the 3D asset. As more input views are added, the representation size increases and global consistency becomes fragile. To this end, we introduce GlobalSplat, a framework built on the principle of align first, decode later. Our approach learns a compact, global, latent scene representation that encodes multi-view input and resolves cross-view correspondences before decoding any explicit 3D geometry. Crucially, this formulation enables compact, globally consistent reconstructions without relying on pretrained pixel-prediction backbones or reusing latent features from dense baselines. Utilizing a coarse-to-fine training curriculum that gradually increases decoded capacity, GlobalSplat natively prevents representation bloat. On RealEstate10K and ACID, our model achieves competitive novel-view synthesis performance while utilizing as few as 16K Gaussians, significantly less than required by dense pipelines, obtaining a light 4MB footprint. Further, GlobalSplat enables significantly faster inference than the baselines, operating under 78 milliseconds in a single forward pass. Project page is available at https://r-itk.github.io/globalsplat/
- Abstract(参考訳): プリミティブの効率的な空間割当は、表現のコンパクトさ、再構成速度、レンダリングの忠実さの相乗効果を直接規定する3Dガウススプラッティングの基礎となる。
これまでのソリューションは、反復最適化やフィードフォワード推論に基づいても、これらの目標間の大きなトレードオフに悩まされている。
特に、現在のフィードフォワード法は、主にピクセル整列またはボクセル整列である。
ピクセルを密集したビューアライメントプリミティブに投影することで、3Dアセットに冗長性を吹き込む。
より多くのインプットビューを追加すると、表現サイズが増加し、グローバルな一貫性が脆弱になる。
この目的のために、まずアライメントの原則に基づいて構築されたGlobalSplatを紹介し、後にデコードする。
提案手法は,多視点入力を符号化したコンパクトでグローバルなシーン表現を学習し,明示的な3次元幾何学を復号する前に相互対応を解消する。
重要なことに、この定式化は、事前訓練された画素予測バックボーンに頼ることなく、コンパクトで一貫した再構築を可能にし、密度の高いベースラインから潜伏した特徴を再利用する。
徐々にデコード容量を増大させる粗大なトレーニングカリキュラムを利用することで、GlobalSplatは、表現の肥大をネイティブに防止する。
RealEstate10KとACIDでは,16Kガウスの高密度パイプラインよりもはるかに少ない精度で,軽量な4MBフットプリントを実現するとともに,競合する新規ビュー合成性能を実現している。
さらに、GlobalSplatはベースラインよりもはるかに高速な推論が可能で、1回のフォワードパスで78ミリ秒以下で動作する。
プロジェクトページはhttps://r-itk.github.io/globalsplat/で公開されている。
関連論文リスト
- Compact Feed-Forward 3D Gaussians via Saliency-Guided Primitive Merging [16.91050950048738]
本稿では,任意のフィードフォワード法から画素単位のプリミティブを取り込み,それをコンパクトでコンテント適応型ガウス集合に集約する構造対応マージパイプラインを提案する。
後処理モジュールとして、パイプラインはバックボーンに依存しず、既存のフィードフォワードメソッドの長所を活用する。
論文 参考訳(メタデータ) (2026-08-11T09:32:08Z) - InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis [49.87457834078904]
InfiniSplatはフィードフォワードのシングルイメージ3DGSフレームワークで、ピクセル整列表現から表面整列表現へ移行する。
InfiniSplatは、単一イメージのフィードフォワードベースラインと比較して最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-08-03T16:17:39Z) - PointSplat: Compact Gaussian Splatting via Human-Centric Prediction [70.45838533838104]
本研究では,ハエのインプットビューから3次元人間表現を創出する新しい人間中心のアプローチであるPointSplatを提案する。
提案手法は,まず粗い幾何学的プロキシを推定し,冗長点を起点とするレイキャスティングを行う。
その後、ポイント・イメージ・トランスフォーマーを使用して外観と幾何学的特徴を融合させ、ガウスの属性を1つの前方通過で予測する。
論文 参考訳(メタデータ) (2026-06-30T17:59:05Z) - FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation [72.38727895659405]
ビデオ拡散潜水器から直接三角形スプラットをデコードするFLATを導入する。
標準的なベンチマークでは、FLATは最先端のフィードフォワードベースラインに比べて、はるかに優れた幾何学的精度を実現している。
軽量なテスト時間改善ステップにより,予測された三角形のスープが不透明でゲームエンジン対応の表現に変換されることを示す。
論文 参考訳(メタデータ) (2026-06-23T17:53:41Z) - Surflo: Consistent 3D Surface Flow Model with Global State [57.57234680235885]
Surfloは、方向付けられた3次元表面点を、ノイズからフローマッチングを通じて独立して表面へ輸送することでデコードする。
独立なポイント単位の復号化に固有の局所的不整合を抑制するために、光度勾配を注入することにより、推定時間誘導項が近傍の点と相関する。
Surfloは、サーフェスメトリクスのフィードフォワードベースラインにマッチし、数百のビューを必要とする最適化ベースのメソッドよりも桁違いに高速に動作し、グローバルなラテントと任意の解像度のデコーディングを組み合わせた唯一のフィードフォワードアプローチである。
論文 参考訳(メタデータ) (2026-06-11T17:48:38Z) - Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation [28.481044299307346]
暗黙の表現は明示的な構造的手がかりを欠くが、明示的な表現は幾何を保存するが、分解限界と弱一般化に苦しむ。
本稿では,ハイブリッドな表現-構造的潜在点を学習する新しい事前学習フレームワークを提案する。
結果として生じるコンパクト潜水剤は粗い構造的傾向を保ち、正確な幾何学を符号化するのではなく、よりリッチな粗い形状と意味情報をキャプチャする。
論文 参考訳(メタデータ) (2026-05-20T14:48:01Z) - Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction [50.5449251266956]
本稿では,長い映像シーケンスから大規模3Dシーンを再構築する作業について述べる。
近年のフィードフォワード再構成モデルでは,RGB画像からの3次元幾何を,明示的な3次元先行や幾何学的制約なく直接回帰することで,有望な結果を示している。
本稿では,長距離シーン情報を効率よく圧縮し,保持するニューラルグローバルコンテキスト表現を提案する。
論文 参考訳(メタデータ) (2026-04-09T17:59:50Z) - S-VGGT: Structure-Aware Subscene Decomposition for Scalable 3D Foundation Models [15.408916900664783]
フィードフォワード3Dファンデーションモデルは、グローバルな注目によって導入された二次計算コストという、大きな課題に直面している。
構造フレームレベルでの冗長性に対処する新しいアプローチである textbfS-VGGT を導入する。
S-VGGTは完全にトークンレベルの加速法であり、複雑なスピードアップにシームレスに組み合わせることができる。
論文 参考訳(メタデータ) (2026-03-18T11:42:55Z) - Global-Aware Edge Prioritization for Pose Graph Initialization [58.77851776918465]
画像がノードとして機能し、エッジが相対的なポーズをエンコードするStructure-from-Motion(SfM)のコアコンポーネントである。
幾何的検証は高価であるため、SfMパイプラインはポーズグラフを候補エッジのスパース集合に制限する。
本稿では、この制限をエッジ優先順位付けの概念によって解決し、SfMの実用性によって候補エッジをランク付けする。
提案手法は,(1)一貫したエッジ信頼性を予測するために,SfMから指導を受けたGNN,(2)これらのランクで案内されるマルチミニマルスパンニングツリーに基づくポーズグラフ構築,(3)弱い領域を補強する接続性を考慮したスコア変調,の3つの構成要素を有する。
論文 参考訳(メタデータ) (2026-02-25T14:44:53Z) - What matters for Representation Alignment: Global Information or Spatial Structure? [64.67092609921816]
表現アライメント(REPA)は、強い事前訓練された視覚エンコーダから中間拡散特徴への表現を蒸留することにより、生成訓練を導く。
本稿では,対象表現のどの側面が生成に重要であるか,そのテクスト・グロバル・リビジョン・セマンティック・情報について検討する。
我々はREPAの標準射影層を単純な畳み込み層に置き換え、外部表現のための空間正規化層を導入する。
論文 参考訳(メタデータ) (2025-12-11T16:39:53Z) - ${C}^{3}$-GS: Learning Context-aware, Cross-dimension, Cross-scale Feature for Generalizable Gaussian Splatting [16.868578618340262]
Generalizable Gaussian Splattingは、シーンごとの最適化なしに、見えないシーンのための新しいビューを合成することを目的としている。
本稿では,コンテキスト認識,クロスディメンジョン,クロススケール制約を取り入れた特徴学習を支援するフレームワークであるmathbfC3$-GSを提案する。
我々のアーキテクチャは、3つの軽量モジュールを統合レンダリングパイプラインに統合し、機能融合を改善し、追加の監視を必要とせずに合成を可能にする。
論文 参考訳(メタデータ) (2025-08-28T13:12:18Z) - R3GS: Gaussian Splatting for Robust Reconstruction and Relocalization in Unconstrained Image Collections [9.633163304379861]
R3GSは、制約のないデータセットに適した堅牢な再構築と再ローカライゼーションフレームワークである。
過渡的物体の復元過程に対する悪影響を軽減するため,軽量な人検出ネットワークを構築した。
本研究では,屋外シーンにおける空域の課題に対処するために,事前の奥行きを制約として組み込んだ効果的なスカイハンドリング手法を提案する。
論文 参考訳(メタデータ) (2025-05-21T09:25:22Z) - CompGS++: Compressed Gaussian Splatting for Static and Dynamic Scene Representation [60.712165339762116]
CompGS++はコンパクトガウスプリミティブを活用して正確な3Dモデリングを実現する新しいフレームワークである。
私たちの設計は、プリミティブ間の冗長性をなくすという原則に基づいている。
私たちの実装は、さらなる研究を促進するためにGitHubで公開されます。
論文 参考訳(メタデータ) (2025-04-17T15:33:01Z) - MCGS: Multiview Consistency Enhancement for Sparse-View 3D Gaussian Radiance Fields [100.90743697473232]
3Dガウシアンによって表現される放射場は、高いトレーニング効率と高速レンダリングの両方を提供する、新しいビューの合成に優れている。
既存の手法では、高密度推定ネットワークからの奥行き先を組み込むことが多いが、入力画像に固有の多視点一貫性を見落としている。
スパースビューからのシーン再構成が可能な3次元ガウススプラッティングに基づくビュー合成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。