論文の概要: ArticuTable: Generating Instance-Level Interactive Rigid-Articulated 3D Tabletop Scenes from a Single Image
- arxiv url: http://arxiv.org/abs/2610.05249v1
- Date: Sun, 04 Oct 2026 14:26:34 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:41:46.205063
- Title: ArticuTable: Generating Instance-Level Interactive Rigid-Articulated 3D Tabletop Scenes from a Single Image
- Title(参考訳): ArticuTable: 単一画像からインスタンスレベルインタラクティブなRigid-Articulated 3Dテーブルトップシーンを生成する
- Abstract要約: ArticuTableはシングルイメージの3D再構成フレームワークで、実行可能部分レベルの調音と入力ビューに一貫性のあるシーンレイアウトの両方を復元する。
オブジェクトモデリングには,多モーダルな大言語モデルと意味的状態推論を併用したGRAM(Generation-robust articulation Modeling)を導入する。
シーンレイアウトにはプログレッシブ・セマンティック・ジオメトリ・シーン登録(PSGSR)を導入する。
- 参考スコア(独自算出の注目度): 38.262212514073674
- License:
- Abstract: Embodied agents benefit from 3D environments that combine visual fidelity to real-world observations with physical interactivity. Existing single-image tabletop reconstruction methods recover plausible scene geometry but typically represent objects as monolithic rigid bodies, limiting interaction to whole-object rigid motion and precluding executable part-level articulation. Meanwhile, recovering a scene layout consistent with the input view remains challenging because a single observation may admit multiple plausible pose-scale configurations. We present ArticuTable, a single-image 3D tabletop reconstruction framework that recovers both executable part-level articulation and an input-view-consistent scene layout. For object modeling, we introduce generation-robust articulation modeling (GRAM), which combines joint fitting guided by a multimodal large language model with semantic state reasoning to recover reliable joint parameters and valid motion ranges from imperfect monolithic proxy meshes, thereby converting them into executable articulated assets. For scene layout, we introduce progressive semantic-geometric scene registration (PSGSR), which progressively narrows the pose-scale search space under complementary metric, planar, and input-view constraints and resolves orientation ambiguity through structure-aware semantic correspondences, yielding a scene layout consistent with the input view. We further contribute ArticuTable-100, a curated collection of 100 simulation-ready tabletop scenes. Extensive evaluation, including a user study, demonstrates strong performance across visual fidelity, input-view consistency, articulation quality, physical plausibility, and simulation readiness.
- Abstract(参考訳): 身体的エージェントは、視覚的忠実さと現実世界の観察と物理的相互作用を結合した3D環境の恩恵を受ける。
既存のシングルイメージのテーブルトップ再構成手法は、可塑性シーンの形状を復元するが、通常、物体をモノリシックな剛体として表現する。
一方、1つの観測で複数のポーズスケール構成が可能である可能性があるため、入力ビューと整合したシーンレイアウトの復元は依然として困難である。
本稿では,単一イメージの3次元テーブルトップ再構築フレームワークであるArticuTableについて述べる。
オブジェクトモデリングでは,マルチモーダルな大言語モデルで導かれた結合フィッティングとセマンティックな状態推論を組み合わせることで,不完全なモノリシックなメッシュメッシュから信頼性の高い関節パラメータと有効な動作範囲を復元し,それらを実行可能な音響アセットに変換する。
シーンレイアウトには、プログレッシブ・セマンティック・ジオメトリ・シーン・レジストレーション(PSGSR)を導入し、プログレッシブ・セマンティック・シーン・レジストレーション(PSGSR)を導入し、プログレッシブ・セマンティック・シーン・レジストレーション(PSGSR)は相補的メートル法、プラナー、インプット・ビューの制約を徐々に狭め、構造認識のセマンティクス・アマンティクス・アマンティクス・アマンティクス(セマンティクス・アマンティクス・アマンティクス)を通して方向のあいまいを解消し、入力ビューと整合する。
さらに、シミュレーション可能な100のテーブルトップシーンのキュレートされたコレクションであるArticuTable-100をコントリビュートする。
ユーザスタディを含む広範囲な評価は、視覚的忠実度、インプット・ビューの整合性、調音品質、身体的可視性、シミュレーションの準備ができていることを示す。
関連論文リスト
- φ-RIE: From Photorealistic Reconstruction to Interactive Environments [57.657253059351795]
-RIEは、残りの復元を保ちながら、選択したオブジェクトを移動可能なシミュレータアセットに変換する。
シーン・オブザーバは、結合されたシーン・コンストラクションの証拠を共有した。
50のScanNet++シーンでは、エビデンスベースの選択と登録リトライが20mmのF1と、固定保持時の0.336から0.383に一致した。
論文 参考訳(メタデータ) (2026-09-22T17:59:52Z) - Fysiverse-3D-Vision Technical Report: Generating Executable 3D Worlds from Images through Unified Spatial Reasoning [62.09790533047924]
生成モデルは、高度な画像条件付き3Dコンテンツ生成が可能だが、単一の画像から制御可能で実行可能な3Dシーンを生成することは、依然として困難である。
本研究では,Fysiverse-3D-Visionを提案する。Fysiverse-3D-Visionは1つの画像から生成した3次元シーンの再構成と実行可能アセット構築のための統合視覚言語-幾何学フレームワークである。
本フレームワークは,既存の手法と比較して,幾何学的整合性,レイアウト推定,レンダリング品質,物理的特性の理解に優れる。
論文 参考訳(メタデータ) (2026-09-22T06:22:31Z) - TabletopGen: Instance-Level Interactive 3D Tabletop Scene Generation from Text or Single Image [22.08471897328577]
TabletopGenは、多様なインスタンスレベルのインタラクティブな3Dテーブルトップシーンを生成する、トレーニング不要で完全に自動化されたフレームワークである。
そこで,TabletopGenは,視覚的忠実度,レイアウト精度,物理的妥当性において,既存の手法をはるかに上回り,最先端の性能を実現していることを示す。
論文 参考訳(メタデータ) (2025-12-01T02:38:52Z) - REACT3D: Recovering Articulations for Interactive Physical 3D Scenes [96.27769519526426]
REACT3Dは静的な3Dシーンを一貫した幾何学を持つシミュレーション可能なインタラクティブなレプリカに変換するフレームワークである。
室内の様々な場面における検出・分離・調音計測における最先端性能について検討した。
論文 参考訳(メタデータ) (2025-10-13T12:37:59Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - Reconstructing Interactive 3D Scenes by Panoptic Mapping and CAD Model
Alignments [81.38641691636847]
エンボディエージェントの観点から,シーン再構築の問題を再考する。
rgb-dデータストリームを用いてインタラクティブシーンを再構築する。
この再構成されたシーンは、密集したパノプティカルマップのオブジェクトメッシュを、部分ベースのCADモデルに置き換える。
論文 参考訳(メタデータ) (2021-03-30T05:56:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。