論文の概要: StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2608.01659v2
- Date: Wed, 05 Aug 2026 02:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.099299
- Title: StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting
- Title(参考訳): StreamSplat: フィードフォワード3Dガウススプレイティングのストリーミング
- Authors: Changhao Song, Yuxuan Wang, Qibiao Li, Youcheng Cai, Ligang Liu,
- Abstract要約: StreamSplatはフィードフォワード3DGSフレームワークで、永続的な幾何学的なシーンステートを漸進的に維持する。
実験の結果,StreamSplat はスパース因果入力下での最先端のフィードフォワード 3DGS 法と競合し続けていることがわかった。
StreamSplatは256, 512, 1024ビューで長い入力ストリームにスケールする。
- 参考スコア(独自算出の注目度): 13.605490241534797
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Feed-forward 3D Gaussian Splatting enables efficient novel-view synthesis without per-scene optimization, but most existing methods assume a fixed set of context views and process them jointly. This limits their applicability to online scenarios where calibrated views arrive sequentially and the scene must be updated causally. We present \emph{StreamSplat}, a streaming feed-forward 3DGS framework that incrementally maintains a persistent geometry-grounded scene state and decodes it into renderable 3D Gaussians after each input chunk. StreamSplat centers on a \textbf{Voxel-Aligned Causal Cache (VACC)}, which stores historical 3D tokens in a memory-bounded voxel structure so that memory grows with explored scene geometry rather than stream length. To better reuse history during causal prediction, we introduce \textbf{History-Projected Depth Anchoring (HPDA)} to project cached geometry as depth guidance for current cost-volume estimation, and \textbf{Cache-Guided Feature Injection (CGFI)} to inject cached latent evidence into Gaussian-token regression. Experiments on DL3DV, RealEstate10K, and ScanNet show that StreamSplat remains competitive with state-of-the-art feed-forward 3DGS methods under sparse causal inputs, despite not using future views or full-scene context. More importantly, it scales to long input streams with 256, 512, and 1024 views where fixed-view baselines run out of memory, yielding sustained improvements in novel-view synthesis quality as more observations arrive. The code will be made publicly available upon acceptance.
- Abstract(参考訳): フィードフォワード3Dガウススプラッティングは、シーンごとの最適化なしに効率的な新規ビュー合成を可能にするが、既存のほとんどの手法ではコンテキストビューの固定セットを仮定し、それらを共同で処理する。
これにより、キャリブレーションされたビューが順次到着し、シーンを慎重に更新する必要があるオンラインシナリオへの適用性が制限される。
本稿では,3DGS のストリーミングフィードフォワードフレームワークである \emph{StreamSplat} について述べる。
StreamSplatは、歴史ある3Dトークンをメモリバウンドのボクセル構造に格納し、ストリーム長ではなく探索的なシーン幾何学でメモリが成長するようにする、textbf{Voxel-Aligned Causal Cache (VACC)} を中心にしている。
因果予測における履歴の再利用を改善するため,現在のコスト-ボリューム推定のための深度ガイダンスとして,キャッシュされた幾何学をプロジェクションする‘textbf{history-Projected Depth Anchoring(HPDA)’と,キャッシュされた潜伏証拠をガウス-トケン回帰に注入する‘textbf{Cache-Guided Feature Injection(CGFI)を導入している。
DL3DV、RealEstate10K、ScanNetの実験によると、StreamSplatは、将来のビューやフルシーンコンテキストを使用しないにもかかわらず、疎結合な因果入力の下で、最先端のフィードフォワード3DGSメソッドと競合し続けている。
さらに重要なことは、256, 512, 1024ビューの長い入力ストリームにスケールし、固定ビューのベースラインがメモリを使い果たせず、より多くの観測が届くにつれて、新規ビューの合成品質が持続的に向上する。
コードは受理時に公開されます。
関連論文リスト
- FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation [72.38727895659405]
ビデオ拡散潜水器から直接三角形スプラットをデコードするFLATを導入する。
標準的なベンチマークでは、FLATは最先端のフィードフォワードベースラインに比べて、はるかに優れた幾何学的精度を実現している。
軽量なテスト時間改善ステップにより,予測された三角形のスープが不透明でゲームエンジン対応の表現に変換されることを示す。
論文 参考訳(メタデータ) (2026-06-23T17:53:41Z) - Stream3D: Sequential Multi-View 3D Generation via Evidential Memory [20.313446116978586]
Stream3Dは、凍結したビューコンディショニングされた3Dジェネレータを、一定のクロスチャンクメモリを備えたストリーミングジェネレータに変える、トレーニング不要のストリーミングメカニズムである。
リアル・ストリーミング・ベンチマークと シンセサイザー・ストリーミング・ベンチマークで評価しました
論文 参考訳(メタデータ) (2026-05-20T17:55:16Z) - Triangle Splatting+: Differentiable Rendering with Opaque Triangles [54.18495204764292]
微分可能なスティングフレームワーク内での三角形を直接最適化するTriangle Splatting+を導入する。
本手法は, 視覚的忠実度において, より効率的かつ高速なトレーニングを継続しながら, 従来のスプレイティング手法を超越した手法である。
結果として生じるセミコネクテッドメッシュは、物理ベースのシミュレーションやインタラクティブなウォークスルーのような下流のアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-09-29T17:43:46Z) - AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views [68.94737256959661]
AnySplatは、未校正画像コレクションから新しいビューを合成するためのフィードフォワードネットワークである。
単一のフォワードパスは、シーン幾何学と外観の両方をコードする3Dガウスプリミティブのセットを生成する。
広範囲なゼロショット評価では、AnySplatはスパースと高密度の両方のビューシナリオにおいて、ポーズを意識するベースラインの品質にマッチする。
論文 参考訳(メタデータ) (2025-05-29T17:49:56Z) - FlowR: Flowing from Sparse to Dense 3D Reconstructions [60.28571003356382]
そこで本研究では,疎度な再現から密度な再構成に期待できるレンダリングまで,新しいビューレンダリングを接続するためのフローを学習するフローマッチングモデルを提案する。
我々のモデルは3.6Mイメージペアの新たなデータセットに基づいてトレーニングされており、単一のフォワードパスで1つのH100 GPU上で540x960解像度(91Kトークン)で45ビューまで処理できる。
論文 参考訳(メタデータ) (2025-04-02T11:57:01Z) - MVPGS: Excavating Multi-view Priors for Gaussian Splatting from Sparse Input Views [27.47491233656671]
新規ビュー合成(NVS)は3次元視覚アプリケーションにおいて重要な課題である。
我々は,3次元ガウススプラッティングに基づくマルチビュー先行を探索する数ショットNVS法である textbfMVPGS を提案する。
実験により,提案手法はリアルタイムレンダリング速度で最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2024-09-22T05:07:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。