論文の概要: ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
- arxiv url: http://arxiv.org/abs/2607.11673v2
- Date: Tue, 14 Jul 2026 04:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.724387
- Title: ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
- Title(参考訳): ABot-3DWorld 0: あらゆる3D空間を探索するユニバーサルワールドモデル
- Abstract要約: ABot-3DWorld 0は、テキスト、画像、ビデオの入力を高忠実で探索可能な3D世界に変換する、普遍的なマルチモーダルな3Dワールドモデルである。
- 参考スコア(独自算出の注目度): 49.372892542771886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present ABot-3DWorld 0, a universal multimodal 3D world model that turns text, image, and video inputs into high-fidelity, explorable 3D worlds. At the heart of our framework is a unified Spatial Generative Primitive (SGP), a compact tuple of a high-quality panorama and a spatial point cloud that delivers an efficient description of any 3D space. Multimodal inputs are first lifted into this primitive; a 3D-consistent panoramic video generator then explores the primitive along a planned trajectory; finally, our panoramic video reconstruction engine converts the generated video into a clean, photorealistic 3D Gaussian Splatting (3DGS) world. This pipeline covers two regimes: rich inputs (multi-view sets, casual video) are lifted into the SGP through a geometry-rigorous recovery that mirrors the observed scene, while a single image or sentence is completed generatively into a creative world. The result is one low-barrier engine for general 3D content creation that further anchors generated worlds to geographic points of interest, enabling map-native spatial exploration at consumer scale. Experiments show that ABot-3DWorld 0 sets the state of the art among open-source methods and demonstrates stronger scene fidelity than Marble under rich multimodal inputs.
- Abstract(参考訳): ABot-3DWorld 0は、テキスト、画像、ビデオの入力を高忠実で探索可能な3D世界に変換する、普遍的なマルチモーダルな3Dワールドモデルである。
我々のフレームワークの中心は、高品質パノラマのコンパクトタプルである空間生成原始(SGP)と、任意の3次元空間の効率的な記述を提供する空間点雲である。
マルチモーダルなインプットはまずこのプリミティブに持ち上げられ、3D一貫性のあるパノラマビデオジェネレータが計画された軌道に沿ってプリミティブを探索し、最後に、パノラマビデオ再構成エンジンが生成されたビデオをクリーンでフォトリアリスティックな3Dガウススプラッティング(3DGS)の世界に変換する。
リッチインプット(マルチビューセット、カジュアルビデオ)は、観察されたシーンを反映する幾何学的厳密なリカバリによってSGPに持ち上げられ、一方、単一の画像や文は創造的な世界へと生成的に完成される。
その結果、一般の3Dコンテンツ作成のためのローバリアエンジンが、生成した世界を地理的な関心点に固定し、地図ネイティブな空間探索を消費者規模で実現した。
実験により,ABot-3DWorld 0はオープンソース手法の最先端を定め,マルチモーダルな入力条件下ではマーブルよりもシーンの忠実度が強いことを示す。
関連論文リスト
- PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation [51.385664546670284]
PAIWorldは3つのコアコンポーネントを通じて拡散変圧器の世界モデルを拡張するフレームワークである。
ロボットベンチマークで最先端のマルチビュー3D一貫性を実現し、WorldArenaのリーダーボードで1位、AgiBot-Challenge2026のリーダーボードで2位にランクインした。
論文 参考訳(メタデータ) (2026-06-16T18:23:23Z) - Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models [38.45163624089566]
Rein3Dは、完全な360度屋内環境を再構築するフレームワークである。
我々は不完全なパノラマ動画のレンダリングに放射状探査戦略を採用している。
これらの配列はパノラマビデオ・ビデオ拡散モデルにより復元され、高忠実度幾何やテクスチャを合成するためにビデオ超解像によりさらに拡張される。
論文 参考訳(メタデータ) (2026-04-12T10:55:14Z) - WonderZoom: Multi-Scale 3D World Generation [24.211362383859406]
WonderZoomは、単一の画像から複数の空間スケールにわたるコンテンツを持つ3Dシーンを生成する。
提案手法では,ユーザが3D領域に“ズームイン”し,これまで存在していなかった詳細情報を自動回帰的に合成する。
論文 参考訳(メタデータ) (2025-12-09T22:21:07Z) - Terra: Explorable Native 3D World Model with Point Latents [74.90179419859415]
本稿では,本質的な3次元潜伏空間における探索可能な環境を表現・生成する,ネイティブな3次元世界モデルTerraを提案する。
具体的には、3次元入力を潜在点表現に符号化する新しい点対ガウス変分オートエンコーダ(P2G-VAE)を提案する。
次に、潜伏点表現を生成するためのスパース点フローマッチングネットワーク(SPFlow)を導入し、同時に潜伏点の位置と特徴を識別する。
論文 参考訳(メタデータ) (2025-10-16T17:59:56Z) - Matrix-3D: Omnidirectional Explorable 3D World Generation [20.568791715708134]
広視野全方位3次元世界生成のためのパノラマ表現を利用するフレームワークMatrix-3Dを提案する。
まず,シーンメッシュレンダリングを条件として,軌跡誘導パノラマ動画拡散モデルを訓練する。
本研究では, パノラマシーン映像を3次元世界へ持ち上げるために, (1) 高速3次元シーン再構成のためのフィードフォワード大パノラマ再構成モデル, (2) 正確かつ詳細な3次元シーン再構成のための最適化ベースパイプラインの2つの方法を提案する。
論文 参考訳(メタデータ) (2025-08-11T15:29:57Z) - Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation [66.95956271144982]
本稿では,単一画像から一貫した3Dポイントクラウドシーケンスを生成する新しいビデオ拡散フレームワークであるVoyagerを紹介する。
既存のアプローチとは異なり、Voyagerはフレーム間で固有の一貫性を持って、エンドツーエンドのシーン生成と再構築を実現している。
論文 参考訳(メタデータ) (2025-06-04T17:59:04Z) - WorldExplorer: Towards Generating Fully Navigable 3D Scenes [48.16064304951891]
WorldExplorerは、幅広い視点で一貫した視覚的品質で、完全にナビゲート可能な3Dシーンを構築する。
私たちは、シーンを深く探求する、短く定義された軌道に沿って、複数のビデオを生成します。
我々の新しいシーン記憶は、各ビデオが最も関連性の高い先行ビューで条件付けされている一方、衝突検出機構は劣化を防止している。
論文 参考訳(メタデータ) (2025-06-02T15:41:31Z) - DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting [56.101576795566324]
テキストから3D 360$circ$のシーン生成パイプラインを提示する。
提案手法は, 2次元拡散モデルの生成力を利用して, 自己複製を促進する。
当社の手法は,360ドル(約3万2000円)の視野内で,グローバルに一貫した3Dシーンを提供する。
論文 参考訳(メタデータ) (2024-04-10T10:46:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。