論文の概要: AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration
- arxiv url: http://arxiv.org/abs/2607.09260v1
- Date: Fri, 10 Jul 2026 10:21:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.819176
- Title: AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration
- Title(参考訳): AnythingReality: オープンなVocabulary VR Scene ExplorationのためのロバストオンラインガウシアンスプレイティングSLAM
- Abstract要約: 本稿では,ロバストなオンライン3Dガウススプラッティング,リアルタイムVR探索,音声駆動型ビジョン・ランゲージ・モデルインタラクションのための新しい統合アーキテクチャを提案する。
クリーンな奥行きや外部のポーズを仮定する手法とは異なり、ORB-SLAM3に基づくポーズ推定と、ノイズの多い実世界のデータに対するオンラインガウス再構成を組み合わせたシステムである。
セマンティックモジュールは音声コマンドを書き起こし、シーン記述を生成し、興味のあるポイントを記録する。
- 参考スコア(独自算出の注目度): 2.2935396753701065
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present a novel integrated architecture for robust online 3D Gaussian splatting, real-time VR exploration, and speech-driven Vision-Language-Model interaction. Unlike methods assuming clean depth or external poses, our system combines ORB-SLAM3-based pose estimation with online Gaussian reconstruction for noisy real-world data. A VR pipeline enables immersive exploration of incremental reconstructions; a semantic module transcribes voice commands, generates scene descriptions, and records points of interest. Against state-of-the-art online Gaussian splatting methods, we improve image quality on our dataset (+14.5% PSNR, +8.6% SSIM, -14.3% LPIPS) and TUM-RGBD (+11.7% PSNR, +7.8% SSIM, -21.6% LPIPS), with comparable or superior frame rates via quality-speed configurations. We achieve an 88% VLM object-recognition rate.
- Abstract(参考訳): 本稿では,ロバストなオンライン3Dガウススプラッティング,リアルタイムVR探索,音声駆動型ビジョン・ランゲージ・モデルインタラクションのための新しい統合アーキテクチャを提案する。
クリーンな奥行きや外部のポーズを仮定する手法とは異なり、ORB-SLAM3に基づくポーズ推定と、ノイズの多い実世界のデータに対するオンラインガウス再構成を組み合わせたシステムである。
セマンティックモジュールは音声コマンドを書き起こし、シーン記述を生成し、興味のあるポイントを記録する。
最先端のオンラインガウシアンスプレイティング手法に対して、我々のデータセット(+14.5% PSNR、+8.6% SSIM、-14.3% LPIPS)とTUM-RGBD(+11.7% PSNR、+7.8% SSIM、-21.6% LPIPS)の画質は、品質-速度設定によって同等または優れたフレームレートで改善する。
我々は88%のVLMオブジェクト認識率を達成した。
関連論文リスト
- LightSplat: Real-Time High-Fidelity 3D Gaussian SLAM with Loop Closure [19.174690314969737]
LightSplatはハイブリッド表現RGB-D SLAMフレームワークである。
デュアルスレッドバックエンドで堅牢で高速なトラッキングのために、ローカルスパース機能をシナジする。
高忠実度ガウス写像のオンライン再構築を実現している。
論文 参考訳(メタデータ) (2026-09-07T09:37:03Z) - Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation [63.04937864192328]
Instant NuRecはフィードフォワード型ニューラルリコンストラクションモデルで、短いマルチビュー駆動ログを1つの前方パスで3次元の世界に変換する。
このモデルはカメラリグからのマルチビュー入力を受け取り、静的および動的3DGS層、スカイキューブマップ、およびカメラごとのISP補正からなる層出力を出力する。
約1.5秒で10-20秒のマルチカメラシーンを再構成し、最も評価の高いベースラインより2.01dBのPSNRを達成する。
論文 参考訳(メタデータ) (2026-07-15T17:50:23Z) - MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization [30.454991269099967]
我々は,グローバルな$textSim(3)$最適化と統合された,堅牢で効率的なオンライン3DGS再構築フレームワークを提案する。
提案手法は,リアルタイムの効率を保ちながら,カメラポーズ推定精度とレンダリング品質の両面における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-06-16T13:43:35Z) - LEG-SLAM: Real-Time Language-Enhanced Gaussian Splatting for SLAM [0.0]
LEG-SLAMは、最適化されたガウススプラッティング実装と視覚言語の特徴抽出を融合した新しいアプローチである。
提案手法は,高品質なフォトリアリスティック画像とセマンティックラベル付きシーンマップを同時に生成する。
自律型ロボティクス、拡張現実、その他の対話型ドメインへの潜在的な応用により、LEG-SLAMはリアルタイムなセマンティック3DガウスベースのSLAMにおける重要な一歩である。
論文 参考訳(メタデータ) (2025-06-03T16:51:59Z) - EVolSplat: Efficient Volume-based Gaussian Splatting for Urban View Synthesis [61.1662426227688]
既存のNeRFおよび3DGSベースの手法は、フォトリアリスティックレンダリングを実現する上で有望な結果を示すが、スローでシーンごとの最適化が必要である。
本稿では,都市景観を対象とした効率的な3次元ガウススプレイティングモデルEVolSplatを紹介する。
論文 参考訳(メタデータ) (2025-03-26T02:47:27Z) - SplatMAP: Online Dense Monocular SLAM with 3D Gaussian Splatting [7.2305711760924085]
本稿では,高忠実度3DGSに高密度SLAMを組み込むことにより,リアルタイム・高密度化を実現するフレームワークを提案する。
本手法では,SLAMから高密度点雲を利用することにより,ガウスモデルを動的に更新・密度化するSLAM-Informed Adaptive Densificationを導入する。
ReplicaとTUM-RGBDデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2025-01-13T02:28:13Z) - VR-Splatting: Foveated Radiance Field Rendering via 3D Gaussian Splatting and Neural Points [4.962171160815189]
本稿では,パフォーマンススイートスポットに関する両点描画方向の長所を結合した,新しいハイブリッドアプローチを提案する。
焦点のみの場合、我々は小さなピクセルフットプリントのために畳み込みニューラルネットワークでニューラルネットワークを使用し、鋭く詳細な出力を提供する。
提案手法は,標準的なVR対応3DGS構成と比較して,シャープネスとディテールが向上することを確認した。
論文 参考訳(メタデータ) (2024-10-23T14:54:48Z) - MM3DGS SLAM: Multi-modal 3D Gaussian Splatting for SLAM Using Vision, Depth, and Inertial Measurements [59.70107451308687]
カメラ画像と慣性測定による地図表現に3Dガウスアンを用いることで、精度の高いSLAMが実現できることを示す。
我々の手法であるMM3DGSは、より高速なスケール認識と軌道追跡の改善により、事前レンダリングの限界に対処する。
また,カメラと慣性測定ユニットを備えた移動ロボットから収集したマルチモーダルデータセットUT-MMもリリースした。
論文 参考訳(メタデータ) (2024-04-01T04:57:41Z) - VR-NeRF: High-Fidelity Virtualized Walkable Spaces [55.51127858816994]
本稿では,高忠実度キャプチャ,モデル再構成,リアルタイムレンダリングのためのエンドツーエンドシステムを提案する。
論文 参考訳(メタデータ) (2023-11-05T02:03:14Z) - UncLe-SLAM: Uncertainty Learning for Dense Neural SLAM [60.575435353047304]
我々は、高密度ニューラルネットワークの同時局所化とマッピング(SLAM)のための不確実性学習フレームワークを提案する。
本稿では,2次元入力データのみから自己教師付きで学習可能なセンサ不確実性推定のためのオンラインフレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-19T16:26:25Z) - Simple and Effective Synthesis of Indoor 3D Scenes [78.95697556834536]
1枚以上の画像から3D屋内シーンを没入する問題について検討する。
我々の狙いは、新しい視点から高解像度の画像とビデオを作成することである。
本稿では,不完全点雲の再投影から高解像度のRGB-D画像へ直接マップするイメージ・ツー・イメージのGANを提案する。
論文 参考訳(メタデータ) (2022-04-06T17:54:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。