論文の概要: DensiTok: Making Feed-Forward 3D Gaussian Splatting See More Views Than It Is Given
- arxiv url: http://arxiv.org/abs/2610.07958v1
- Date: Tue, 06 Oct 2026 08:29:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.897501
- Title: DensiTok: Making Feed-Forward 3D Gaussian Splatting See More Views Than It Is Given
- Title(参考訳): DensiTok:フィードフォワード型3Dガウシアン・スプラッティングは、現在よりも多くのビューを表示
- Abstract要約: DensiTokは、事前訓練されたフィードフォワード3DGSモデルのプラグインモジュールである。
内部の幾何学的トークンを直接密度付けし、凍ったバックボーンが与えられたよりも多くのビューを観測したかのように振る舞う。
スパースビューの再構築を継続的に改善し、高密度ビューの再構築へのギャップの多くを回復する。
- 参考スコア(独自算出の注目度): 40.29465730575355
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Feed-forward 3D Gaussian Splatting (3DGS) reconstructs a scene in a single forward pass, replacing per-scene optimization with a network trained across many scenes. Its quality, however, degrades sharply as the number of input images drops. The bottleneck is upstream of the reconstruction heads: from a few unposed views, the internal representation they read carries no evidence for unobserved regions, leaving holes, floaters, and blur. The common remedy supplies that evidence as pixels, synthesizing extra views with an image or video generator and re-encoding them, which is costly and not 3D-consistent by construction. We instead densify the evidence itself. We present DensiTok, a plug-in module for pretrained feed-forward 3DGS models that densifies their internal geometry tokens directly, making a frozen backbone behave as though it had observed many more views than it was given. DensiTok compresses those tokens into a compact latent space, completes the latents of the unobserved viewpoints in a single flow-matching step conditioned on camera geometry, and decodes them back into tokens that the original reconstruction heads. The same module design can be integrated into different pretrained predictors while keeping each backbone and its reconstruction heads frozen. Completion in a low-dimensional latent space requires no image synthesis or additional encoder passes. Across three pretrained backbones and two benchmarks, DensiTok consistently improves sparse-view reconstruction and recovers much of the gap to dense-view reconstruction.
- Abstract(参考訳): Feed-forward 3D Gaussian Splatting (3DGS)は、1つのフォワードパスでシーンを再構築し、シーンごとの最適化を多くのシーンで訓練されたネットワークに置き換える。
しかし、入力画像の数が減少するにつれて、その品質は急激に低下する。
ボトルネックは、復元ヘッドの上流にある。いくつかの未提示のビューから、彼らが読んだ内部表現は、観測されていない領域の証拠を一切持っておらず、穴、フローター、ぼやけている。
一般的な治療法は、その証拠をピクセルとして提供し、画像やビデオジェネレータで余分なビューを合成し、それらを再エンコードする。
その代わり、証拠そのものを固める。
本稿では,事前にトレーニングされたフィードフォワード3DGSモデルのプラグインモジュールであるDensiTokについて紹介する。
DensiTokはこれらのトークンをコンパクトな潜伏空間に圧縮し、カメラ幾何学に基づく単一のフローマッチングステップで観測されていない視点の潜伏を完了し、元の再構成の先頭にあるトークンに復号する。
同じモジュール設計は、各バックボーンとリコンストラクションヘッドを凍結させながら、異なる事前訓練された予測器に統合することができる。
低次元の潜在空間における完了は、画像合成や追加エンコーダパスを必要としない。
3つの事前訓練されたバックボーンと2つのベンチマークで、DensiTokはスパースビューの再構築を一貫して改善し、高密度ビューの再構築へのギャップの多くを回復する。
関連論文リスト
- SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis [42.23526579547921]
SplatGuideは、3つの補完的な役割で1つの3DGSシーンを再利用する。
ガウス単位のソースビューインデックスは、ターゲットビュー投票マップに描画される。
レコンストラクショントークンは、クロスアテンションを介して特徴レベルのガイダンスを提供する。
論文 参考訳(メタデータ) (2026-08-17T17:45:57Z) - S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs [53.597239706600455]
Sparse to Dense lifting (S2D)は、2つの表現をブリッジし、最小限の入力で高品質な3DGS再構成を実現するパイプラインである。
実験により、S2Dは、異なる入力空間下で、新しいビューガイダンスと第1階層のスパースビュー再構成品質を生成する際に、最良の整合性を達成することが示された。
論文 参考訳(メタデータ) (2026-03-11T15:37:20Z) - RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations [70.83499963694238]
RnG(Reconstruction and Generation)は、再構成と生成を統合する新しいフィードフォワードトランスである。
可視的幾何学を再構築し、可視的でコヒーレントな不明瞭な幾何学と外観を生成する。
提案手法は, 一般化可能な3次元再構成と新しいビュー生成の両方において, 最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-01T17:25:32Z) - ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model [16.14713604672497]
ReconXは、時間生成タスクとして曖昧な再構築課題を再編成する、新しい3Dシーン再構築パラダイムである。
提案したReconXはまずグローバルポイントクラウドを構築し、3D構造条件としてコンテキスト空間にエンコードする。
この条件に導かれ、ビデオ拡散モデルは、ディテール保存され、高い3D一貫性を示すビデオフレームを合成する。
論文 参考訳(メタデータ) (2024-08-29T17:59:40Z) - Denoising Diffusion via Image-Based Rendering [54.20828696348574]
実世界の3Dシーンの高速かつ詳細な再構築と生成を可能にする最初の拡散モデルを提案する。
まず、大きな3Dシーンを効率よく正確に表現できる新しいニューラルシーン表現であるIBプレーンを導入する。
第二に,2次元画像のみを用いて,この新たな3次元シーン表現の事前学習を行うためのデノイング拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-05T19:00:45Z) - Pix2Vox++: Multi-scale Context-aware 3D Object Reconstruction from
Single and Multiple Images [56.652027072552606]
Pix2Vox++という,単一ビューと複数ビューの3Dオブジェクト再構成のための新しいフレームワークを提案する。
良く設計されたエンコーダデコーダを用いて、各入力画像から粗い3Dボリュームを生成する。
次に、マルチスケールコンテキスト対応融合モジュールを導入し、全ての粗い3Dボリュームから異なる部分の高品質な再構成を適応的に選択し、融合した3Dボリュームを得る。
論文 参考訳(メタデータ) (2020-06-22T13:48:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。