論文の概要: InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
- arxiv url: http://arxiv.org/abs/2608.02437v2
- Date: Tue, 04 Aug 2026 03:15:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.437161
- Title: InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
- Title(参考訳): InfiniSplat:大ベースライン単分子ビュー合成のための暗黙のガウスデコーディング
- Authors: Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng,
- Abstract要約: InfiniSplatはフィードフォワードのシングルイメージ3DGSフレームワークで、ピクセル整列表現から表面整列表現へ移行する。
InfiniSplatは、単一イメージのフィードフォワードベースラインと比較して最先端のパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 49.87457834078904
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Single-image feed-forward 3D Gaussian Splatting (3DGS) aims to directly generate a renderable 3D scene representation from one input image, avoiding the cost of multi-view capture and per-scene optimization. However, existing methods are often constrained by a pixel-aligned representation, where Gaussians are predicted from fixed image-grid locations. Such pixel-aligned primitives can produce promising nearby-view renderings, but they remain weakly coupled to underlying scene surfaces and struggle to preserve coherent structures under large viewpoint shifts. We present InfiniSplat, a feed-forward single-image 3DGS framework that moves from a pixel-aligned representation toward a surface-aligned representation. InfiniSplat constructs this representation by first using geometry-guided sampling to place 2D supports according to depth-induced local surface structure, and then applying a query-conditioned implicit decoder to predict Gaussian attributes from the image features queried at these supports. By grounding support locations in geometry while decoupling Gaussian prediction from fixed pixel centers, InfiniSplat produces Gaussian layouts that better follow scene surfaces and reduce scattered primitives caused by grid discretization. Across multiple cross-dataset NVS evaluations, InfiniSplat achieves state-of-the-art performance compared with single-image feed-forward baselines, and demonstrates zero-shot generalization from Hypersim indoor synthetic training to complex open-world scenes. Project page: https://zju3dv.github.io/InfiniSplat.
- Abstract(参考訳): シングルイメージフィードフォワード3Dガウススメッティング(3DGS)は、1つの入力画像からレンダリング可能な3Dシーン表現を直接生成することを目的としており、マルチビューキャプチャとシーンごとの最適化のコストを回避している。
しかし、既存の手法は、ガウスが固定された画像グリッド位置から予測されるピクセル整列表現によって制約されることが多い。
このようなピクセルアライメントのプリミティブは、将来有望な近傍ビューレンダリングを生成することができるが、基盤となるシーン表面と弱い結合を維持し、大きな視点シフトの下でコヒーレントな構造を維持するのに苦労している。
InfiniSplatは、フィードフォワードの単一イメージ3DGSフレームワークで、ピクセル整列表現から表面整列表現へ移行する。
InfiniSplatはこの表現を、まずジオメトリ誘導サンプリングを用いて、深度誘導された局所表面構造に従って2Dを配置し、次いでクエリ条件付き暗黙デコーダを適用して、これらのサポートでクエリされた画像特徴からガウス属性を予測する。
InfiniSplatは、固定されたピクセル中心からガウス予測を分離しながら、幾何学におけるサポート位置を接地することで、シーン表面をより良く追従し、グリッドの離散化による散逸したプリミティブを減らすガウスレイアウトを生成する。
InfiniSplatは、複数のクロスデータセットNVS評価において、シングルイメージフィードフォワードベースラインと比較して最先端のパフォーマンスを実現し、Hypersim屋内合成トレーニングから複雑なオープンワールドシーンへのゼロショットの一般化を実証している。
プロジェクトページ: https://zju3dv.github.io/InfiniSplat
関連論文リスト
- PointSplat: Compact Gaussian Splatting via Human-Centric Prediction [70.45838533838104]
本研究では,ハエのインプットビューから3次元人間表現を創出する新しい人間中心のアプローチであるPointSplatを提案する。
提案手法は,まず粗い幾何学的プロキシを推定し,冗長点を起点とするレイキャスティングを行う。
その後、ポイント・イメージ・トランスフォーマーを使用して外観と幾何学的特徴を融合させ、ガウスの属性を1つの前方通過で予測する。
論文 参考訳(メタデータ) (2026-06-30T17:59:05Z) - PointSplat: Efficient Geometry-Driven Pruning and Transformer Refinement for 3D Gaussian Splatting [2.5823344978857388]
3D Gaussian Splattingは最近、明示的な3Dプリミティブを使用してシーンを表現することによって、リアルタイムで高忠実なノベルビュー合成をアンロックした。
従来の手法では複雑なシーンを捉えるために何百万人ものガウシアンを必要とすることが多く、メモリとストレージの要求が大きくなった。
近年のアプローチでは、ガウスパラメータのプルーニングとシーン毎の微調整によってこの問題に対処し、視覚的品質を維持しながらモデルサイズを削減している。
論文 参考訳(メタデータ) (2026-04-10T20:56:18Z) - AnchorSplat: Feed-Forward 3D Gaussian Splatting with 3D Geometric Priors [23.943522711585597]
シーンレベルの再構築のための新しいフィードフォワード3DGSフレームワークであるAnchorSplatを提案する。
アンカーアラインのガウス表現は3次元幾何学的先行によって導かれる。
設計により、必要なガウス人の数は大幅に減少する。
論文 参考訳(メタデータ) (2026-04-08T13:04:54Z) - CATSplat: Context-Aware Transformer with Spatial Guidance for Generalizable 3D Gaussian Splatting from A Single-View Image [18.445769892372528]
単視点3Dシーン再構成のための新しい一般化可能なトランスフォーマーベースのフレームワークであるCATSplatを紹介する。
シーン固有のコンテキストの詳細をテキスト埋め込みからクロスアテンションに組み込むことで、コンテキスト認識の再構築の道を開く。
大規模データセットを用いた実験により, 単視点3次元シーン再構成におけるCATSplatの最先端性能が実証された。
論文 参考訳(メタデータ) (2024-12-17T13:32:04Z) - FreeSplat: Generalizable 3D Gaussian Splatting Towards Free-View Synthesis of Indoor Scenes [50.534213038479926]
FreeSplatは、長いシーケンス入力から自由視点合成まで、幾何学的に一貫した3Dシーンを再構築することができる。
ビュー数に関係なく、広いビュー範囲にわたる堅牢なビュー合成を実現するための、シンプルで効果的なフリービュートレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-05-28T08:40:14Z) - Hybrid Explicit Representation for Ultra-Realistic Head Avatars [55.829497543262214]
我々は,超現実的な頭部アバターを作成し,それをリアルタイムにレンダリングする新しい手法を提案する。
UVマップされた3Dメッシュは滑らかな表面のシャープでリッチなテクスチャを捉えるのに使われ、3Dガウス格子は複雑な幾何学構造を表現するために用いられる。
モデル化された結果が最先端のアプローチを上回る実験を行ないました。
論文 参考訳(メタデータ) (2024-03-18T04:01:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。