論文の概要: Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning
- arxiv url: http://arxiv.org/abs/2607.16805v1
- Date: Sat, 18 Jul 2026 12:51:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.262867
- Title: Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning
- Title(参考訳): Scene-SAM3D:ファインチューニングなしのマルチビューシーンアセット生成
- Abstract要約: Scene-SAM3Dは、SAM3Dをシングルビューオブジェクト生成からマルチビューシーンアセット生成まで拡張する、トレーニング不要のフレームワークである。
Scene-SAM3Dは、補完的なビューのコンパクトなセットを選択し、観察冗長性を低減し、個々のビューに隠された領域のさらなる証拠を提供する。
ステップ効率の遅延速度融合を行い、多視点エビデンスを統合し、標準空間におけるクロスビュー競合を抑制する。
- 参考スコア(独自算出の注目度): 51.11861596631423
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality 3D scene assets are critical for embodied applications such as robotic manipulation, navigation, and simulation. Despite their strong object priors, recent single-image 3D generation models such as SAM3D remain insufficient for real-world scenes, where severe occlusions, redundant observations, and cross-view inconsistencies make reliable scene generation challenging. We introduce Scene-SAM3D, a training-free framework that extends SAM3D from single-view object generation to calibrated multi-view scene asset generation. Scene-SAM3D selects a compact set of complementary views, reducing observation redundancy while providing additional evidence for regions occluded in individual views. Based on the selected views, it performs step-efficient latent velocity fusion to integrate multi-view evidence and suppress cross-view conflicts in canonical space. Finally, a lightweight rigid-object Gaussian optimization refines the scene layout within 200 iterations while preserving the generated object geometry. Experiments on Replica and ScanNet++ demonstrate consistent improvements at both instance and scene levels, with our method reducing scene-level CD by 43.8% on Replica and 30.9% on ScanNet++, while cutting flow-model sampling FLOPs and wall-time latency by nearly 20% under the same multi-view setting. Code will be released at https://github.com/xibi777/Scene-SAM3D.
- Abstract(参考訳): 高品質な3Dシーンアセットは、ロボット操作、ナビゲーション、シミュレーションなどの具体的応用に不可欠である。
強力なオブジェクト先行にもかかわらず、SAM3Dのような最近のシングルイメージの3D生成モデルは、深刻な閉塞、冗長な観察、およびクロスビューの不整合により、信頼性の高いシーン生成が困難となる現実世界のシーンには不十分なままである。
Scene-SAM3Dは、SAM3Dをシングルビューオブジェクト生成からキャリブレーションされたマルチビューシーンアセット生成まで拡張する、トレーニング不要のフレームワークである。
Scene-SAM3Dは、補完的なビューのコンパクトなセットを選択し、観察冗長性を低減し、個々のビューに隠された領域のさらなる証拠を提供する。
選択されたビューに基づいて、多視点エビデンスを統合し、標準空間におけるクロスビュー競合を抑制するためにステップ効率の潜時速度融合を行う。
最後に、軽量な剛体オブジェクトガウス最適化は、生成したオブジェクトの形状を保ちながら200イテレーション以内のシーンレイアウトを洗練させる。
Replica と ScanNet++ の実験では,シーンレベルの CD を Replica で43.8%,ScanNet++ で30.9% 削減し,フローモデルサンプリング FLOP と壁面遅延を同じマルチビュー設定で約20%削減した。
コードはhttps://github.com/xibi777/Scene-SAM3Dでリリースされる。
関連論文リスト
- WorldSculpt: Generating Compositional Worlds from Grounded Videos [50.427204240556854]
本研究では,数百個のオブジェクトを含む散在するシーンの合成3次元表現を生成する問題について検討する。
この課題は、物体が互いに強く干渉し合うような密集したシーンにおいて挑戦的であり、それぞれのビューはその幾何のごく一部しか明らかにしない。
多視点観察に先立ち、強い単物体3D生成を適応させることにより、数百個の物体からなる複雑なシーンを合成的に生成できることが示される。
論文 参考訳(メタデータ) (2026-09-04T17:59:35Z) - Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling [11.305288161442995]
構成可能なシーンモデリングは、実際の屋内シーンを、観察されたように配置された完全な編集可能なオブジェクトアセットとして復元することを目的としている。
Luciaはビデオをシーングラフに解析し、ノードはインスタンスごとのマルチビューのエビデンスを持っている。
Luciaは、マルチターンGUIインタラクションとして配置するVLMポリシーであるGizmoActで資産を配置する。
論文 参考訳(メタデータ) (2026-08-31T14:03:20Z) - ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures [18.468596508491967]
ReSceneは、パイプライン全体のマルチビュージオメトリを統一前のものとしてスレッドするフレームワークである。
HierViewはセマンティックな一貫性と3Dカバレッジに基づいた再構築ビューを優先する。
ReSceneは、ScanNetの一連のシーンで、幾何学、レンダリング、知覚的品質をまたいだ、新しい最先端のアートをセットする。
論文 参考訳(メタデータ) (2026-06-26T13:08:40Z) - SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views [69.08965991211704]
ユーザ中心のワークフローにおける3Dシーンの拡大について検討する。
固定シーンにおける単純なオブジェクト編集やスタイル転送とは異なり、挿入されたビューは元の再構築と3Dミスアライメントされることが多い。
パラメトリックフィードフォワード3D再構成モデルにテスト時間適応を適用したSceneExpanderを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:04:48Z) - I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation [56.33710337846449]
I3DMは、一貫した映像シーン生成のための暗黙的な3D対応メモリ機構である。
われわれのアプローチの核心は3D対応メモリ検索戦略である。
検索した履歴フレームをフル活用するために,3次元メモリインジェクションモジュールを導入する。
論文 参考訳(メタデータ) (2026-03-24T16:45:40Z) - MV-SAM3D: Adaptive Multi-View Fusion for Layout-Aware 3D Generation [19.245305728103748]
MV-SAM3Dは、レイアウト対応の3D生成を多視点一貫性と物理的妥当性で拡張する、トレーニング不要のフレームワークである。
注意-エントロピー重み付けと可視性重み付けという2つの適応重み付け戦略を提案する。
標準的なベンチマークと実世界のマルチオブジェクトシーンの実験は、再構築の忠実度とレイアウトの妥当性を大きく改善したことを示している。
論文 参考訳(メタデータ) (2026-03-12T07:53:35Z) - Fake It To Make It: Virtual Multiviews to Enhance Monocular Indoor Semantic Scene Completion [0.8669877024051931]
Indoor Semantic Scene Completionは、屋内シーンの単一のRGB画像から3Dセマンティック占有マップを再構築することを目的としている。
我々は、新しいビュー合成とマルチビュー融合を活用する革新的なアプローチを導入する。
我々は、NYUv2データセット上の既存のSSCネットワークと統合した場合、Scene Completionの最大2.8%、Semantic Scene Completionの4.9%のIoUスコアの改善を実証する。
論文 参考訳(メタデータ) (2025-03-07T02:09:38Z) - MegaScenes: Scene-Level View Synthesis at Scale [69.21293001231993]
NVS (Scene-level novel view synthesis) は多くの視覚やグラフィックスの応用に基礎を置いている。
MegaScenesと呼ばれるインターネット写真コレクションから大規模なシーンレベルのデータセットを作成し、世界中の動き(SfM)から100K以上の構造を復元する。
我々は、最先端NVS手法の故障事例を分析し、生成一貫性を大幅に改善する。
論文 参考訳(メタデータ) (2024-06-17T17:55:55Z) - Zero-Shot Multi-Object Scene Completion [59.325611678171974]
1枚のRGB-D画像から複雑なシーンにおける複数の見えない物体の完全な形状を復元する3Dシーン補完法を提案する。
提案手法は, 合成および実世界の両方のデータセットにおいて, 現在の最先端技術よりも優れている。
論文 参考訳(メタデータ) (2024-03-21T17:59:59Z) - SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation [24.733049281032272]
3DシーンのゼロショットインスタンスセグメンテーションにSAMPro3Dを導入する。
提案手法は,2次元フレームに事前訓練されたセグメンション任意のモデル(SAM)を適用することで,3次元インスタンスをセグメント化する。
提案手法は,従来のゼロショットや完全教師付きアプローチと比較して,同等あるいは優れた性能を実現する。
論文 参考訳(メタデータ) (2023-11-29T15:11:03Z) - CabiNet: Scaling Neural Collision Detection for Object Rearrangement
with Procedural Scene Generation [54.68738348071891]
私たちはまず、さまざまな日常環境において、650万以上の散らばったシーン(前よりも桁違いに多い)を生成します。
このデータから合成部分点雲をレンダリングし、それをCabiNetモデルアーキテクチャのトレーニングに使用します。
CabiNetは、オブジェクトとシーンポイントの雲を受け入れる衝突モデルである。
論文 参考訳(メタデータ) (2023-04-18T21:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。