論文の概要: World2Minecraft: Occupancy-Driven Simulated Scenes Construction
- arxiv url: http://arxiv.org/abs/2604.27578v1
- Date: Thu, 30 Apr 2026 08:30:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.995387
- Title: World2Minecraft: Occupancy-Driven Simulated Scenes Construction
- Title(参考訳): World2Minecraft: 運用駆動シミュレートされたシーンの構築
- Authors: Lechao Zhang, Haoran Xu, Jingyu Gong, Xuhong Wang, Yuan Xie, Xin Tan,
- Abstract要約: 身体知性は、知覚と意思決定を支援するために高忠実度シミュレーション環境を必要とする。
実世界のシーンを3次元セマンティック占有予測に基づいて構成されたマインクラフト環境に変換するためにWorld2Minecraftを提案する。
- 参考スコア(独自算出の注目度): 25.741358841151754
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied intelligence requires high-fidelity simulation environments to support perception and decision-making, yet existing platforms often suffer from data contamination and limited flexibility. To mitigate this, we propose World2Minecraft to convert real-world scenes into structured Minecraft environments based on 3D semantic occupancy prediction. In the reconstructed scenes, we can effortlessly perform downstream tasks such as Vision-Language Navigation(VLN). However, we observe that reconstruction quality heavily depends on accurate occupancy prediction, which remains limited by data scarcity and poor generalization in existing models. We introduce a low-cost, automated, and scalable data acquisition pipeline for creating customized occupancy datasets, and demonstrate its effectiveness through MinecraftOcc, a large-scale dataset featuring 100,165 images from 156 richly detailed indoor scenes. Extensive experiments show that our dataset provides a critical complement to existing datasets and poses a significant challenge to current SOTA methods. These findings contribute to improving occupancy prediction and highlight the value of World2Minecraft in providing a customizable and editable platform for personalized embodied AI research. Project page:https://world2minecraft.github.io/.
- Abstract(参考訳): Embodied Intelligenceは、知覚と意思決定をサポートするために高忠実なシミュレーション環境を必要とするが、既存のプラットフォームはデータ汚染と限られた柔軟性に悩まされることが多い。
これを軽減するために,実世界のシーンを3Dセマンティック占有予測に基づいて構成されたマインクラフト環境に変換するWorld2Minecraftを提案する。
再構成されたシーンでは、VLN(Vision-Language Navigation)のような下流のタスクを強制的に実行することができる。
しかし,既存のモデルでは,データ不足や一般化の低さにより,再現品質は正確な占有率予測に大きく依存している。
我々は、カスタマイズされた占有データセットを作成するための低コストで自動化されたスケーラブルなデータ取得パイプラインを導入し、その効果を、リッチな室内シーン156の100,165の画像を特徴とする大規模データセットであるMinecraftOccを通じて実証した。
大規模な実験により、我々のデータセットは既存のデータセットに重要な補完を提供し、現在のSOTAメソッドに重大な課題をもたらすことが示された。
これらの発見は、占有率予測の改善に寄与し、パーソナライズされたAI研究のためのカスタマイズ可能で編集可能なプラットフォームを提供することで、World2Minecraftの価値を強調している。
プロジェクトページ:https://world2minecraft.github.io/.com
関連論文リスト
- FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation [75.74617373156902]
FreeScaleは、限られた現実世界の画像シーケンスを、高品質なトレーニングデータのスケーラブルなソースに変換するフレームワークである。
フィードフォワードNVSモデルのトレーニングをスケールアップし,PSNRにおける2.7dBの顕著なゲインを達成することにより,FreeScaleの有効性を示す。
私たちの仕事は、3Dビジョンの根本的なボトルネックを克服するために、実用的で強力なデータ生成エンジンを提供します。
論文 参考訳(メタデータ) (2026-04-12T08:00:53Z) - Mirage2Matter: A Physically Grounded Gaussian World Model from Video [87.9732484393686]
我々は、グラフィック駆動の世界モデリングおよびシミュレーションフレームワークであるSimulate Anythingを紹介する。
実世界の環境を3次元ガウススプレイティング(3DGS)による写実的シーン表現に再構築する。
次に、生成モデルを利用して、物理的に現実的な表現を復元し、精度校正ターゲットを介してシミュレーション環境に統合する。
論文 参考訳(メタデータ) (2026-01-24T07:43:57Z) - InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts [36.53189513184921]
InternScenesは、およそ4万の多様なシーンからなる、大規模でシミュレート可能な屋内シーンデータセットである。
シーン内の大量の小さなアイテムを保存し、結果として、領域ごとの平均41.5オブジェクトの現実的で複雑なレイアウトを実現します。
InternScenesの価値を、シーンレイアウト生成とポイントゴールナビゲーションの2つのベンチマークアプリケーションで示す。
論文 参考訳(メタデータ) (2025-09-13T14:25:17Z) - SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model [1.3700170633913733]
本稿では,世界モデルに基づくシミュレーション条件付きシーン生成エンジンを提案する。
実世界のシーンと一致したシミュレーションシステムを構築することで、シミュレーションデータとラベルを世界モデルにおけるデータ生成の条件として、任意のシーンに対して収集することができる。
その結果,これらの画像は下流知覚モデルの性能を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-03-18T06:41:02Z) - Kick Back & Relax++: Scaling Beyond Ground-Truth Depth with SlowTV &
CribsTV [50.616892315086574]
本稿では,SlowTV と CribsTV の2つの新しいデータセットを提案する。
これらは、一般公開されているYouTubeビデオから収集された大規模なデータセットで、合計200万のトレーニングフレームが含まれている。
我々はこれらのデータセットを活用し、ゼロショット一般化の難しい課題に取り組む。
論文 参考訳(メタデータ) (2024-03-03T17:29:03Z) - LiveHPS: LiDAR-based Scene-level Human Pose and Shape Estimation in Free
Environment [59.320414108383055]
シーンレベルの人間のポーズと形状推定のための単一LiDARに基づく新しいアプローチであるLiveHPSを提案する。
多様な人間のポーズを伴う様々なシナリオで収集される巨大な人間の動きデータセットFreeMotionを提案する。
論文 参考訳(メタデータ) (2024-02-27T03:08:44Z) - WorldGen: A Large Scale Generative Simulator [12.886022807173337]
我々は、無数の構造化された非構造化の3Dフォトリアリスティックシーンを自律的に生成する、オープンソースのフレームワークWorldGenを紹介する。
WorldGenは、ユーザに対して、テクスチャ、オブジェクト構造、モーション、カメラ、レンズプロパティなどの機能への完全なアクセスとコントロールを提供して、より汎用性を高めている。
論文 参考訳(メタデータ) (2022-10-03T05:07:42Z) - TRoVE: Transforming Road Scene Datasets into Photorealistic Virtual
Environments [84.6017003787244]
本研究では、シミュレーションデータセットに存在する困難とドメインギャップに対処する合成データ生成パイプラインを提案する。
既存のデータセットからアノテーションや視覚的手がかりを利用すれば、自動マルチモーダルデータ生成が容易になることを示す。
論文 参考訳(メタデータ) (2022-08-16T20:46:08Z) - Kubric: A scalable dataset generator [73.78485189435729]
KubricはPythonフレームワークで、PyBulletやBlenderとインターフェースして写真リアリスティックなシーンを生成する。
本研究では,3次元NeRFモデルの研究から光フロー推定まで,13種類の異なるデータセットを提示することで,Kubricの有効性を実証する。
論文 参考訳(メタデータ) (2022-03-07T18:13:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。