論文の概要: ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
- arxiv url: http://arxiv.org/abs/2606.28060v1
- Date: Fri, 26 Jun 2026 13:08:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.490259
- Title: ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
- Title(参考訳): ReScene:マルチビューキャプチャによる屋内シーンの構造化
- Abstract要約: ReSceneは、パイプライン全体のマルチビュージオメトリを統一前のものとしてスレッドするフレームワークである。
HierViewはセマンティックな一貫性と3Dカバレッジに基づいた再構築ビューを優先する。
ReSceneは、ScanNetの一連のシーンで、幾何学、レンダリング、知覚的品質をまたいだ、新しい最先端のアートをセットする。
- 参考スコア(独自算出の注目度): 18.468596508491967
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Constructing simulation-ready 3D scenes from multi-view captures is a key bottleneck for Embodied Artificial Intelligence, as downstream tasks require object-level structure, explicit inter-object relations, and physical plausibility. Existing approaches either rely on specialized capture hardware, suffer from single-view bias in object reconstruction, or yield layouts that are geometrically reasonable but physically inconsistent. We identify that the problem is not single-object reconstruction but cross-view relation fusion and physically plausible scene assembly. To address this challenge, we present ReScene, a framework that threads multi-view geometry throughout the pipeline as a unifying prior. Our method consists of two main components: HierView prioritizes reconstruction views based on semantic consistency and 3D coverage completeness, replacing the largest-mask heuristic that conflates image occupancy with object coverage; and Relation-Aware Assembly fuses multi-frame relation predictions from a vision-language model with geometric and room-shell priors into a confidence-weighted scene graph, enabling physically consistent scene assembly. ReScene sets a new state of the art across geometry, rendering, and perceptual quality on a set of ScanNet scenes, achieving a 17% reduction in Chamfer Distance and 26% in LPIPS over the strongest prior baseline, while running up to 10x faster than prior multi-view methods. Based on the reconstructed scenes, we also generate an embodied visual question answering dataset, on which fine-tuned Qwen-VL approaches the performance of strong closed-source models on several spatial reasoning tasks.
- Abstract(参考訳): マルチビューキャプチャーからシミュレーション可能な3Dシーンを構築することは、下流タスクにはオブジェクトレベルの構造、明示的なオブジェクト間関係、物理的妥当性を必要とするため、Embodied Artificial Intelligenceにとって重要なボトルネックである。
既存のアプローチは、特殊なキャプチャハードウェアに依存するか、オブジェクト再構成の単一ビューバイアスに悩まされるか、幾何学的に合理的だが物理的に矛盾する利得レイアウトに依存する。
単一オブジェクト再構成ではなく、相互参照関係の融合と物理的に妥当なシーンアセンブリである。
この課題に対処するために、パイプライン全体にわたってマルチビュー幾何を統一するフレームワークであるReSceneを紹介します。
提案手法は2つの主要コンポーネントから構成される: HierViewは、画像占有率とオブジェクトカバレッジを混在させる最大のマスクヒューリスティックを置き換えることで、セマンティック一貫性と3次元カバレッジ完全性に基づいて再構成ビューを優先順位付けする。
ReSceneは、ScanNetの一連のシーンにおいて、幾何学、レンダリング、知覚的品質をまたいだ新しい最先端技術を設定し、最強のベースラインに対して、Chamfer Distanceの17%、LPIPSの26%を達成し、従来のマルチビューメソッドよりも最大10倍高速な実行を実現している。
再構成されたシーンに基づいて、具体化された視覚的質問応答データセットも生成し、細調整されたQwen-VLは、複数の空間的推論タスクにおいて強力なクローズドソースモデルの性能にアプローチする。
関連論文リスト
- WorldSculpt: Generating Compositional Worlds from Grounded Videos [50.427204240556854]
本研究では,数百個のオブジェクトを含む散在するシーンの合成3次元表現を生成する問題について検討する。
この課題は、物体が互いに強く干渉し合うような密集したシーンにおいて挑戦的であり、それぞれのビューはその幾何のごく一部しか明らかにしない。
多視点観察に先立ち、強い単物体3D生成を適応させることにより、数百個の物体からなる複雑なシーンを合成的に生成できることが示される。
論文 参考訳(メタデータ) (2026-09-04T17:59:35Z) - GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images [61.2170105836525]
本稿では,RGBのみのフレームワークを提案する。このフレームワークは,再構成を物理的に地上に配置したシーンファクタ化として再構成し,構造化されたハイブリッドシーン表現を出力する。
結果として得られる表現は、明示的な剛体と分離された背景を組み合わせることで、視覚的リアリズムを維持しながら直接物理シミュレーションを可能にする。
論文 参考訳(メタデータ) (2026-06-02T17:13:01Z) - AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model [29.087865646035695]
カジュアルキャプチャーからシーンをモデリングするためにはスパースビュー3D再構成が不可欠であるが、非生成的再構築には依然として困難である。
我々は任意のスパース入力から復元するスケーラブルなフレームワークであるAnyReconを提案する。
実験では、不規則な入力、大きな視点ギャップ、長い軌道をまたいだ堅牢でスケーラブルな再構築が示されている。
論文 参考訳(メタデータ) (2026-04-21T17:59:47Z) - MessyKitchens: Contact-rich object-level 3D scene reconstruction [26.192713922771244]
乱雑な環境を特徴とする現実世界のシーンを備えた新しいデータセットであるMessyKitchensを紹介した。
近年のSAM 3Dによる単一オブジェクト再構成手法をベースとして,複数オブジェクトデコーダ(MOD)を用いてオブジェクトレベルの共同再構成を実現している。
論文 参考訳(メタデータ) (2026-03-17T17:59:51Z) - IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion [15.837932667195037]
IGFuseは対話型ガウスシーンを複数のスキャンから観測することで再構成する新しいフレームワークである。
本手法は,ガウス場を意識したセグメンテーションを構築し,スキャン間の双方向光度・セマンティック一貫性を実現する。
IGFuseは、密度の高い観測や複雑なパイプラインを使わずに、高忠実なレンダリングとオブジェクトレベルのシーン操作を可能にする。
論文 参考訳(メタデータ) (2025-08-18T17:59:47Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z) - SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning [46.441761732998536]
プロキシジェネレーションとチューニング(SCORP)によるシーン一貫性オブジェクトリファインメント(Scene-Consistent Object Refinement)について紹介する。
SCORP は、3D 生成に先立って細粒度なオブジェクトの形状と外観を復元する新しい3D拡張フレームワークである。
これは、新しいビュー合成と幾何完成タスクの両方において、最近の最先端のベースラインに対して一貫した利得を達成する。
論文 参考訳(メタデータ) (2025-06-30T13:26:21Z) - EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the Wild [79.71523320368388]
本研究の目的は,手動物体のインタラクションを単一視点画像から再構築することである。
まず、手ポーズとオブジェクト形状を推定する新しいパイプラインを設計する。
最初の再構築では、事前に誘導された最適化方式を採用する。
論文 参考訳(メタデータ) (2024-11-21T16:33:35Z) - Single-view 3D Mesh Reconstruction for Seen and Unseen Categories [69.29406107513621]
シングルビュー3Dメッシュ再構成は、シングルビューRGB画像から3D形状を復元することを目的とした、基本的なコンピュータビジョンタスクである。
本稿では,一視点3Dメッシュ再構成に取り組み,未知のカテゴリのモデル一般化について検討する。
我々は、再構築におけるカテゴリ境界を断ち切るために、エンドツーエンドの2段階ネットワークであるGenMeshを提案する。
論文 参考訳(メタデータ) (2022-08-04T14:13:35Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。