論文の概要: StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference
- arxiv url: http://arxiv.org/abs/2607.08808v1
- Date: Thu, 09 Jul 2026 16:32:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.71989
- Title: StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference
- Title(参考訳): StereoSplat+:Diffusion-Assisted Progressive Inference を用いたフィードフォワード型 Stereo Gaussian Splatting の検討
- Authors: Zihua Liu, Masatoshi Okutomi,
- Abstract要約: 3D Gaussian Splatting (3DGS) は、新規ビュー合成のための高品質でレンダリング可能なシーン表現を実現している。
既存の3DGSパイプラインのほとんどは、十分なカバレッジを達成するために、マルチビューの観測に依存している。
本稿では,単一のステレオペアから因果的再構成を可能にする拡散促進フィードフォワードフレームワークであるStereoSplat+を提案する。
- 参考スコア(独自算出の注目度): 18.13347835114754
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent advances in 3D Gaussian Splatting (3DGS) have enabled high-quality, render-ready scene representations for novel-view synthesis. However, most existing 3DGS pipelines rely on multi-view observations (or non-causal access to future frames) to achieve sufficient coverage, which is often unavailable in on-device robotics and AR settings where sensing is restricted to a single stereo rig. Recovering a high-quality 3DGS scene from one stereo observation, therefore, remains challenging due to occlusions, limited field of view, and missing geometry. We present StereoSplat+, a diffusion-enhanced feed-forward framework that enables causal reconstruction from a single stereo pair. Our method builds on two key components. First, we propose StereoSplat, an input-invariant feed-forward 3D Gaussian estimator that takes a variable number of posed stereo pairs as input and predicts high-quality 3D Gaussians. StereoSplat fuses complementary geometry cues via a cost-volume branch and a triplane-based 3D volume branch and leverages continuous pose encoding to generalize across view counts and camera configurations. Second, since multiple posed stereo pairs are typically unavailable at inference time, we introduce a diffusion-enhanced one-shot progressive inference scheme called StereoSplat+: starting from one stereo pair, we render novel stereo views from the predicted 3DGS, refine them with a one-step diffusion enhancer, and feed them back as additional inputs to update the 3DGS. Experiments on the KITTI-360 dataset show that StereoSplat+ improves novel-view rendering quality and geometry accuracy, especially in occluded regions and under strong view extrapolation, outperforming recent feed-forward 3DGS baselines.
- Abstract(参考訳): 近年の3Dガウススティング(3DGS)の進歩により、新規なビュー合成のための高品質でレンダリング可能なシーン表現が可能になった。
しかし、既存の3DGSパイプラインのほとんどは、十分なカバレッジを達成するために、マルチビューの観測(または将来のフレームへの非因果的アクセス)に依存しており、センサーが単一のステレオリグに限定されるオンデバイスロボティクスやAR設定では利用できないことが多い。
1つのステレオ観測から高品質な3DGSシーンを復元することは、オクルージョン、視野の制限、幾何学の欠如によって依然として困難である。
本稿では,単一のステレオペアから因果的再構成を可能にする拡散促進フィードフォワードフレームワークであるStereoSplat+を提案する。
我々の手法は2つの重要な要素の上に成り立っている。
まず,入力不変なフィードフォワード3次元ガウス推定器であるStereoSplatを提案する。
StereoSplatは、コストボリュームブランチとトリプレーンベースの3Dボリュームブランチを通じて相補的な幾何学的手がかりを融合し、連続的なポーズエンコーディングを活用して、ビューカウントとカメラ構成を一般化する。
第2に,複数のステレオペアが推論時に利用できないため,StereoSplat+と呼ばれる拡散促進型1ショットプログレッシブ推論スキームを導入する: 1つのステレオペアから始まり,予測された3DGSから新しいステレオビューを描画し,1ステップの拡散エンハンサーでそれらを洗練し,追加入力としてフィードバックして3DGSを更新する。
KITTI-360データセットの実験により、StereoSplat+は、特に閉鎖領域や強い視野外挿の下で、新しいビューレンダリング品質と幾何精度を改善し、最近のフィードフォワード3DGSベースラインを上回っていることが示された。
関連論文リスト
- StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors [0.9326260051834822]
3D Gaussian Splatting (3DGS) は、リアルタイムの新規なビュー合成において顕著な成功を収めた。
幾何的制約が不十分なため、スパースビュー設定下で厳しいオーバーフィッティングに悩まされる。
両眼の安定性を確立するためにステレオ先行情報を統合した新しいスパースビュー3DGSフレームワークであるStereoGSを提案する。
論文 参考訳(メタデータ) (2026-06-29T16:45:57Z) - PointGS: Point Attention-Aware Sparse View Synthesis with Gaussian Splatting [4.451779041553596]
3D Gaussian splatting (3DGS) は、レンダリング速度と視覚品質の両方において、ニューラル放射場(NeRF)を超える革新的なレンダリング技術である。
本稿では,スパーストレーニングビューからリアルタイムかつ高品質なレンダリングを可能にするポイントワイズ特徴認識型ガウス分割フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-12T04:07:07Z) - Epipolar-Free 3D Gaussian Splatting for Generalizable Novel View Synthesis [25.924727931514735]
一般化可能な3DGSは、フィードフォワード推論方式でスパースビュー観測から新しいシーンを再構築することができる。
既存の手法は、複雑な現実世界のシーンでは信頼できないエピポーラ先行に大きく依存している。
一般化可能な新規ビュー合成のための効率的なフィードフォワード3DGSモデルであるeFreeSplatを提案する。
論文 参考訳(メタデータ) (2024-10-30T08:51:29Z) - FreeSplat: Generalizable 3D Gaussian Splatting Towards Free-View Synthesis of Indoor Scenes [50.534213038479926]
FreeSplatは、長いシーケンス入力から自由視点合成まで、幾何学的に一貫した3Dシーンを再構築することができる。
ビュー数に関係なく、広いビュー範囲にわたる堅牢なビュー合成を実現するための、シンプルで効果的なフリービュートレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-05-28T08:40:14Z) - Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion [45.171150395915056]
3Dセマンティックシーン補完(SSC)は、限られた観測から密集した3Dシーンを推定する必要がある不適切な認識課題である。
従来のカメラベースの手法は、固有の幾何学的曖昧さと不完全な観察のため、正確なセマンティックシーンを予測するのに苦労した。
我々は,SSCにおけるステレオマッチング技術と鳥眼ビュー(BEV)表現学習を利用して,そのような問題に対処する。
論文 参考訳(メタデータ) (2023-03-24T12:33:44Z) - DSGN++: Exploiting Visual-Spatial Relation forStereo-based 3D Detectors [60.88824519770208]
カメラベースの3Dオブジェクト検出器は、LiDARセンサーよりも広い展開と低価格のため歓迎されている。
我々は3次元幾何学と意味論の両方を表現するステレオボリューム構造について、以前のステレオモデリングDSGNを再考する。
本稿では,2次元から3次元のパイプラインを通しての情報フローを改善することを目的としたDSGN++を提案する。
論文 参考訳(メタデータ) (2022-04-06T18:43:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。