論文の概要: IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion
- arxiv url: http://arxiv.org/abs/2508.13153v1
- Date: Mon, 18 Aug 2025 17:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-08-19 14:49:11.527449
- Title: IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion
- Title(参考訳): IGFuse:Multi-Scans Fusionによる対話型3次元ガウスシーン再構成
- Abstract要約: IGFuseは対話型ガウスシーンを複数のスキャンから観測することで再構成する新しいフレームワークである。
本手法は,ガウス場を意識したセグメンテーションを構築し,スキャン間の双方向光度・セマンティック一貫性を実現する。
IGFuseは、密度の高い観測や複雑なパイプラインを使わずに、高忠実なレンダリングとオブジェクトレベルのシーン操作を可能にする。
- 参考スコア(独自算出の注目度): 15.837932667195037
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reconstructing complete and interactive 3D scenes remains a fundamental challenge in computer vision and robotics, particularly due to persistent object occlusions and limited sensor coverage. Multiview observations from a single scene scan often fail to capture the full structural details. Existing approaches typically rely on multi stage pipelines, such as segmentation, background completion, and inpainting or require per-object dense scanning, both of which are error-prone, and not easily scalable. We propose IGFuse, a novel framework that reconstructs interactive Gaussian scene by fusing observations from multiple scans, where natural object rearrangement between captures reveal previously occluded regions. Our method constructs segmentation aware Gaussian fields and enforces bi-directional photometric and semantic consistency across scans. To handle spatial misalignments, we introduce a pseudo-intermediate scene state for unified alignment, alongside collaborative co-pruning strategies to refine geometry. IGFuse enables high fidelity rendering and object level scene manipulation without dense observations or complex pipelines. Extensive experiments validate the framework's strong generalization to novel scene configurations, demonstrating its effectiveness for real world 3D reconstruction and real-to-simulation transfer. Our project page is available online.
- Abstract(参考訳): 完全かつインタラクティブな3Dシーンの再構築は、コンピュータビジョンとロボティクスの基本的な課題であり、特に永続的なオブジェクト閉塞と限られたセンサーカバレッジのためである。
単一のシーンスキャンからのマルチビュー観察は、しばしば完全な構造的詳細を捉えるのに失敗する。
既存のアプローチでは、セグメンテーションやバックグラウンド補完、インペイントといったマルチステージパイプラインに依存したり、オブジェクトごとの密度スキャンを必要とする。
IGFuseは,複数のスキャンから観測を融合させることで,対話型ガウスシーンを再構築する新しいフレームワークである。
本手法は,ガウス場を意識したセグメンテーションを構築し,スキャン間の双方向光度・セマンティック一貫性を実現する。
空間的不整合に対処するために,図形を洗練するための協調的共同作業戦略とともに,一貫したアライメントのための擬似中間シーン状態を導入する。
IGFuseは、密度の高い観測や複雑なパイプラインを使わずに、高忠実なレンダリングとオブジェクトレベルのシーン操作を可能にする。
大規模な実験により、このフレームワークは新たなシーン構成への強力な一般化を実証し、実世界の3D再構成と実物間移動の有効性を実証した。
私たちのプロジェクトページはオンラインで閲覧できます。
関連論文リスト
- Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction [77.75911117889915]
現在のエンドツーエンドのマルチビュー3D再構成手法は、目覚ましい結果を得るが、制限的な静的仮定に依存している。
この理想的な入力への依存は、最も高度なメソッドでさえ、現実世界の設定で失敗する原因となる。
非一貫性の視点から頑健な再構築を行うためのエンドツーエンドフレームワークであるWildにおけるビジュアルジオメトリトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2026-06-22T02:52:22Z) - SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration [32.39337008619354]
単一画像の3Dシーン生成を3つの構造化ステージに分解するマルチエージェントオーケストレーションフレームワークを提案する。
ポイントマップから導出される疎幾何学的事前情報によって教師される幾何学的レイアウト予測器を提案する。
本手法は,幾何学的精度,空間的整合性,知覚的リアリズムにおいて,従来手法よりも常に優れていた。
論文 参考訳(メタデータ) (2026-06-07T01:38:39Z) - Ψ-Map: Panoptic Surface Integrated Mapping Enables Real2Sim Transfer [24.777932568749446]
幾何学的強化, エンドツーエンドの汎光学学習, 効率的なレンダリングを統合した包括的フレームワークを提案する。
提案システムは,40FPSを超える推論率を維持しながら,大規模シーンにおいて優れた幾何学的・パノプティックな再現性を実現する。
論文 参考訳(メタデータ) (2026-04-13T04:41:00Z) - Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow [80.05357398241574]
Seen2Sceneは、シーンの完成と生成のために、不完全で現実世界の3Dスキャンをトレーニングする最初のフローマッチングベースのアプローチである。
Seen2Sceneは、現実世界の非完全な3Dスキャンから直接学習することで、複雑で散らかった実環境のためのリアルな3Dシーン補完を可能にする。
論文 参考訳(メタデータ) (2026-03-30T15:08:38Z) - SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views [69.08965991211704]
ユーザ中心のワークフローにおける3Dシーンの拡大について検討する。
固定シーンにおける単純なオブジェクト編集やスタイル転送とは異なり、挿入されたビューは元の再構築と3Dミスアライメントされることが多い。
パラメトリックフィードフォワード3D再構成モデルにテスト時間適応を適用したSceneExpanderを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:04:48Z) - Pano360: Perspective to Panoramic Vision with Geometric Consistency [7.713672589538202]
我々は新しいトランスフォーマーベースのアーキテクチャを採用し、すべての視点で3D認識とグローバル情報を集約する。
評価ベンチマークを確立し,ネットワークをトレーニングするために,実世界のシーンの大規模データセットを構築した。
論文 参考訳(メタデータ) (2026-03-12T14:56:14Z) - Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion [4.679314646805623]
3Dセグメンテーションは、高密度なレイアウトとマルチスケールオブジェクトを持つ複雑なシーンを理解するために重要である。
既存の3Dポイントベースの手法はコストのかかるアノテーションを必要とするが、画像誘導方式はビュー間のセマンティックな不整合に悩まされることが多い。
本稿では,階層的な画像誘導型3次元セグメンテーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-07T15:15:52Z) - MS-GS: Multi-Appearance Sparse-View 3D Gaussian Splatting in the Wild [47.52462219920857]
野生の写真コレクションは、しばしば限られた量の画像を含んでおり、複数の外観を示す。
3DGS を用いたスパースビューシナリオにおけるマルチアジュアンス機能を備えた新しいフレームワーク MS-GS を提案する。
我々は,MS-GSが様々な難解な視界とマルチアジュアンス条件下でフォトリアリスティックレンダリングを実現することを実証した。
論文 参考訳(メタデータ) (2025-09-19T03:06:49Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z) - SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations [44.53106180688135]
この作業は、スパースやシングルビューのインプットから3Dシーンを再構築する上での課題である。
SpatialCrafterは,ビデオ拡散モデルにおける豊富な知識を活用して,可算的な追加観測を生成するフレームワークである。
トレーニング可能なカメラエンコーダと、明示的な幾何学的制約に対するエピポーラアテンション機構により、精密なカメラ制御と3D整合性を実現する。
論文 参考訳(メタデータ) (2025-05-17T13:05:13Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation [16.00575923179227]
3Dシーンは非常に複雑な構造を持ち、出力が密度が高く、一貫性があり、必要な全ての構造を含むことを保証する必要がある。
現在の3Dシーン生成法は、事前訓練されたテキスト・画像拡散モデルと単眼深度推定器に依存している。
クロスモーダルシーン生成のための軽量な3次元ガウススプラッティングであるBloomSceneを提案する。
論文 参考訳(メタデータ) (2025-01-15T11:33:34Z) - Large Spatial Model: End-to-end Unposed Images to Semantic 3D [79.94479633598102]
大空間モデル(LSM)は、RGB画像を直接意味的放射場に処理する。
LSMは、単一のフィードフォワード操作における幾何学、外観、意味を同時に推定する。
新しい視点で言語と対話することで、多目的ラベルマップを生成することができる。
論文 参考訳(メタデータ) (2024-10-24T17:54:42Z) - CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph
Diffusion [83.30168660888913]
シーングラフを対応する制御可能な3Dシーンに変換する完全生成モデルであるCommonScenesを提案する。
パイプラインは2つのブランチで構成されており、1つは変分オートエンコーダでシーン全体のレイアウトを予測し、もう1つは互換性のある形状を生成する。
生成されたシーンは、入力シーングラフを編集し、拡散モデルのノイズをサンプリングすることで操作することができる。
論文 参考訳(メタデータ) (2023-05-25T17:39:13Z) - CompNVS: Novel View Synthesis with Scene Completion [83.19663671794596]
本稿では,スパースグリッドに基づくニューラルシーン表現を用いた生成パイプラインを提案する。
画像特徴を3次元空間に符号化し、幾何学的完備化ネットワークとその後のテクスチャ塗布ネットワークを用いて、欠落した領域を外挿する。
フォトリアリスティック画像列は、整合性関連微分可能レンダリングによって最終的に得られる。
論文 参考訳(メタデータ) (2022-07-23T09:03:13Z) - Neural Part Priors: Learning to Optimize Part-Based Object Completion in
RGB-D Scans [27.377128012679076]
本稿では,部分情報付き3次元形状の大規模合成データセットを活用してニューラル部品の先行学習を提案する。
実世界でスキャンされた3Dシーンをテスト時に適合させるために、学習した部分を最適化できます。
ScanNetデータセットの実験では、NPPは部分分解とオブジェクト補完において、技術の状態を大幅に上回っている。
論文 参考訳(メタデータ) (2022-03-17T15:05:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。