論文の概要: Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator
- arxiv url: http://arxiv.org/abs/2607.05765v1
- Date: Tue, 07 Jul 2026 02:42:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.372778
- Title: Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator
- Title(参考訳): 画像2Sim:生成型ニューラルシミュレータによる身体的ナビゲーションのスケーリング
- Abstract要約: Embodied Navigationは、マルチモーダルな目標を解釈し、3D空間を推論し、現実の世界で確実に目的地に到達するエージェントを構築することを目的としている。
本稿では,RGB-D画像シーケンスから高品質な対話環境を構築するリアルタイムニューラルネットワークフレームワークであるImage2Simを紹介する。
- 参考スコア(独自算出の注目度): 70.34667754804168
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.
- Abstract(参考訳): Embodied Navigationは、マルチモーダルな目標を解釈し、3D空間を推論し、現実の世界で確実に目的地に到達するエージェントを構築することを目的としている。
しかし、拡張性、高忠実性、物理的に接地されたインタラクティブ環境の欠如により、進歩は依然として制限されている。
実世界のスキャンされたデータセットは視覚的リアリズムを提供するが、スケールによって制限される。
対照的に、合成シミュレータはより容易にスケールするが、しばしば大きなsim-to-realギャップを示す。
本稿では,RGB-D画像シーケンスから高品質な対話環境を構築するリアルタイムニューラルネットワークフレームワークであるImage2Simを紹介する。
中心となる考え方は、3次元空間アンカーを光現実的な観測合成から切り離すことである。
シーン構築には、Image2Simはフィードフォワード特徴ガウスモデルを使用し、RGB-Dの観測結果を1パスで3D特徴ガウス表現に持ち上げる。
レンダリングのために,粗いガウス射影を高品質なパノラマRGB-D観測に変換するジオメトリー対応ワンステップカメラフローモデルを提案する。
Image2Simは、高忠実度観測、実行可能なアクション、大規模での多様なナビゲーション命令を生成する、完全に自動化された実施データエンジンとしても機能する。
大量のビデオや画像を20万近いインタラクティブなシーンに変換し、1000万以上のナビゲーショントレーニングサンプルを合成する。
これらのニューラルネットワーク環境で完全にトレーニングされたナビゲーションモデルは、主要なベンチマークを強力に改善し、現実世界のゼロショット設定に効果的に転送する。
これらの結果から,スケーラブルなニューラルネットワークは,大規模ナビゲーションの実践的なトレーニング基盤として機能することが示唆された。
関連論文リスト
- ABot-Earth 0.5: Generative 3D Earth Model [30.627822427932273]
ABot-Earth 0.5は、ユビキタスで地理的に参照された衛星画像から巨大なシームレスな3D環境を合成するために設計された3Dフレームワークである。
推測では、1平方キロメートルあたり10分未満のスケーラブルな速度で、衛星画像のみに照らされた新しい3Dシーンを合成する。
論文 参考訳(メタデータ) (2026-06-08T17:58:02Z) - GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning [55.272458304179025]
GS-Playgroundは、エンド・ツー・エンドの知覚学習を促進するために設計されたマルチモーダル・シミュレーション・フレームワークである。
このシステムは640x480の解像度で104 FPSのスループットを達成し、大規模な視覚的RLの障壁を著しく低減する。
論文 参考訳(メタデータ) (2026-04-28T10:05:39Z) - Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting [83.60803397468139]
Habitat-GSはナビゲーション中心のAIシミュレータで、3Dフォトリアリスティックなシーンレンダリングとドライビング可能なガウスアバターを統合している。
動的人体モデリングでは、ガウスアバターモジュールを導入し、それぞれのアバターを光現実的な視覚的実体と効果的なナビゲーション障害物として同時に機能させることができる。
論文 参考訳(メタデータ) (2026-04-14T11:52:59Z) - NVSim: Novel View Synthesis Simulator for Large Scale Indoor Navigation [0.39198548406564604]
NVSimは,一般的な画像列のみから大規模でナビゲート可能な屋内シミュレータを自動構築するフレームワークである。
クリーンでナビゲーション可能な地上面と,メッシュフリーなトラバーサビリティチェックアルゴリズムを実現するために,Floor-Aware Gaussian Splattingを導入する。
実世界のデータから有効な大規模ナビゲーショングラフを生成する能力を示す。
論文 参考訳(メタデータ) (2025-10-28T11:57:33Z) - GaussGym: An open-source real-to-sim framework for learning locomotion from pixels [78.05453137978132]
本稿では,3次元ガウススプラッティングをベクトル化物理シミュレータのドロップインとして統合した光現実的ロボットシミュレーションを提案する。
これにより、コンシューマGPUで毎秒10万ステップを超える、前例のないスピードを実現している。
また,シミュレーティブ・トゥ・リアル・ロボティクス・セッティングにおける適用性を実証した。
論文 参考訳(メタデータ) (2025-10-17T06:34:52Z) - Simple and Effective Synthesis of Indoor 3D Scenes [78.95697556834536]
1枚以上の画像から3D屋内シーンを没入する問題について検討する。
我々の狙いは、新しい視点から高解像度の画像とビデオを作成することである。
本稿では,不完全点雲の再投影から高解像度のRGB-D画像へ直接マップするイメージ・ツー・イメージのGANを提案する。
論文 参考訳(メタデータ) (2022-04-06T17:54:46Z) - GeoSim: Photorealistic Image Simulation with Geometry-Aware Composition [81.24107630746508]
GeoSimは、新しい都市の運転シーンを合成するジオメトリ認識の画像合成プロセスです。
まず、センサーデータからリアルな形状と外観の両方を備えた多様な3Dオブジェクトのバンクを構築します。
得られた合成画像は、フォトリアリズム、トラフィック認識、幾何学的一貫性があり、画像シミュレーションが複雑なユースケースにスケールできる。
論文 参考訳(メタデータ) (2021-01-16T23:00:33Z) - Photorealism in Driving Simulations: Blending Generative Adversarial
Image Synthesis with Rendering [0.0]
我々は、運転シミュレーションの視覚的忠実度を改善するために、ハイブリッドな生成型ニューラルネットワークパイプラインを導入する。
テクスチャのない単純なオブジェクトモデルからなる3次元シーンから2次元のセマンティック画像を生成する。
これらのセマンティックイメージは、現実の運転シーンで訓練された最先端のジェネレーティブ・アドリア・ネットワーク(GAN)を用いて、フォトリアリスティックなRGBイメージに変換される。
論文 参考訳(メタデータ) (2020-07-31T03:25:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。