論文の概要: GaussFly: Contrastive Reinforcement Learning for Visuomotor Policies in 3D Gaussian Fields
- arxiv url: http://arxiv.org/abs/2604.05062v1
- Date: Mon, 06 Apr 2026 18:10:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.429099
- Title: GaussFly: Contrastive Reinforcement Learning for Visuomotor Policies in 3D Gaussian Fields
- Title(参考訳): GaussFly:3次元ガウス場におけるビジュモータ政策のコントラスト強化学習
- Authors: Yuhang Zhang, Mingsheng Li, Yujing Shang, Zhuoyuan Yu, Chao Yan, Jiaping Xiao, Mir Feroskhan,
- Abstract要約: GaussFlyは、ポリシー最適化から表現学習を明示的に分離する新しいフレームワークである。
複雑なテクスチャを持つ、目に見えない現実世界環境へのロバストでゼロショットのポリシー転送を可能にする。
- 参考スコア(独自算出の注目度): 10.10713417247828
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning visuomotor policies for Autonomous Aerial Vehicles (AAVs) relying solely on monocular vision is an attractive yet highly challenging paradigm. Existing end-to-end learning approaches directly map high-dimensional RGB observations to action commands, which frequently suffer from low sample efficiency and severe sim-to-real gaps due to the visual discrepancy between simulation and physical domains. To address these long-standing challenges, we propose GaussFly, a novel framework that explicitly decouples representation learning from policy optimization through a cohesive real-to-sim-to-real paradigm. First, to achieve a high-fidelity real-to-sim transition, we reconstruct training scenes using 3D Gaussian Splatting (3DGS) augmented with explicit geometric constraints. Second, to ensure robust sim-to-real transfer, we leverage these photorealistic simulated environments and employ contrastive representation learning to extract compact, noise-resilient latent features from the rendered RGB images. By utilizing this pre-trained encoder to provide low-dimensional feature inputs, the computational burden on the visuomotor policy is significantly reduced while its resistance against visual noise is inherently enhanced. Extensive experiments in simulated and real-world environments demonstrate that GaussFly achieves superior sample efficiency and asymptotic performance compared to baselines. Crucially, it enables robust and zero-shot policy transfer to unseen real-world environments with complex textures, effectively bridging the sim-to-real gap.
- Abstract(参考訳): 自律飛行車(AAV)の単眼視のみに頼りながら、自走自走車(AAV)の学習は魅力的だが、非常に難しいパラダイムである。
既存のエンド・ツー・エンドの学習手法は、高次元のRGB観測を直接アクションコマンドにマッピングする。
このような長年にわたる課題に対処するため,我々はGaussFlyを提案する。GaussFlyは,表現学習を政策最適化から密集した現実からシミュレート・トゥ・リアルパラダイムを通じて明確に分離するフレームワークである。
まず, 3D Gaussian Splatting (3DGS) を用いて, 明瞭な幾何学的制約を付加したトレーニングシーンを再構築する。
第二に、ロバストなsim-to-real転送を保証するために、これらのフォトリアリスティック・シミュレートされた環境を活用し、コントラスト表現学習を用いて、レンダリングされたRGB画像からコンパクトでノイズ耐性の潜在的特徴を抽出する。
この事前学習エンコーダを用いて、低次元の特徴入力を提供することにより、視覚ノイズに対する耐性を本質的に向上させながら、ビジュモータポリシーの計算負担を著しく低減する。
シミュレーションおよび実世界の環境における広範囲な実験により、GaussFlyはベースラインよりも優れたサンプル効率と漸近性能を達成することが示された。
重要なことは、複雑なテクスチャで目に見えない現実世界環境へのロバストでゼロショットのポリシー転送を可能にし、シミュレートとリアルのギャップを効果的に埋める。
関連論文リスト
- R-PGA: Robust Physical Adversarial Camouflage Generation via Relightable 3D Gaussian Splatting [59.29134814041703]
物理的敵対的なカモフラージュは、自律運転システムに深刻なセキュリティ上の脅威をもたらす。
現在の手法は、様々な幾何学的(例えば、視線構成)とラジオメトリックのバリエーションにまたがる一般化に失敗する。
Relightable Physical 3D Gaussian Splatting framework (R-PGA)を提案する。
論文 参考訳(メタデータ) (2026-03-27T04:38:04Z) - Zero-Shot UAV Navigation in Forests via Relightable 3D Gaussian Splatting [11.31291385822484]
受動的単眼視を用いた非構造屋外環境におけるUAVナビゲーションは、シミュレーションと現実の間のかなりの視覚領域のギャップによって妨げられる。
本研究では,非構造化屋外への効率的なゼロショット転送を目的とした,エンドツーエンドの強化学習フレームワークを提案する。
本研究では, 複雑な森林環境において, 最大10m/sの速さで, 頑健で無衝突な航法を実現することを実証した。
論文 参考訳(メタデータ) (2026-02-06T15:51:03Z) - ExoGS: A 4D Real-to-Sim-to-Real Framework for Scalable Manipulation Data Collection [27.18540416686717]
ExoGSはロボットフリーの4D Real-to-Sim-to-Realフレームワークである。
実世界の静的環境と動的相互作用の両方をキャプチャし、それらをシミュレートされた環境にシームレスに転送する。
スケーラブルなデータ収集とポリシー学習のための新しいソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-26T16:04:12Z) - Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer [59.02729900344616]
GPUを加速したフォトリアリスティックなシミュレーションは、ロボット学習のためのスケーラブルなデータ生成パスを開いた。
視覚に基づくヒューマノイドロコ操作のための教師-学生-ブートストラップ学習フレームワークを開発した。
これは、純粋なRGB知覚を用いた多様な調音ロコ操作が可能な初めてのヒューマノイド・シム・トゥ・リアル政策である。
論文 参考訳(メタデータ) (2025-11-30T20:07:13Z) - EmbodiedSplat: Personalized Real-to-Sim-to-Real Navigation with Gaussian Splats from a Mobile Device [33.22697339175522]
Embodied AIは主に、トレーニングと評価のシミュレーションに頼っている。
シン・トゥ・リアル・トランスファーは依然として大きな課題だ。
EmbodiedSplatは、ポリシートレーニングをパーソナライズする新しいアプローチである。
論文 参考訳(メタデータ) (2025-09-22T07:22:31Z) - HoliGS: Holistic Gaussian Splatting for Embodied View Synthesis [59.25751939710903]
本稿では,長い単眼RGBビデオのエンボディドビュー合成に対処する,変形可能なガウススプラッティングフレームワークを提案する。
提案手法は,非可逆ガウス散乱変形ネットワークを利用して大規模動的環境を正確に再構築する。
その結果、現実のシナリオにおけるEVSの実用的でスケーラブルなソリューションが浮かび上がっています。
論文 参考訳(メタデータ) (2025-06-24T03:54:40Z) - EnvGS: Modeling View-Dependent Appearance with Environment Gaussian [78.74634059559891]
EnvGSは、環境の反射を捉えるための明示的な3D表現として、ガウスプリミティブのセットを利用する新しいアプローチである。
これらの環境を効率的にレンダリングするために,高速レンダリングにGPUのRTコアを利用するレイトレーシングベースのリフレクションを開発した。
複数の実世界および合成データセットから得られた結果は,本手法がより詳細な反射を生成することを示す。
論文 参考訳(メタデータ) (2024-12-19T18:59:57Z) - MCGS: Multiview Consistency Enhancement for Sparse-View 3D Gaussian Radiance Fields [100.90743697473232]
3Dガウシアンによって表現される放射場は、高いトレーニング効率と高速レンダリングの両方を提供する、新しいビューの合成に優れている。
既存の手法では、高密度推定ネットワークからの奥行き先を組み込むことが多いが、入力画像に固有の多視点一貫性を見落としている。
スパースビューからのシーン再構成が可能な3次元ガウススプラッティングに基づくビュー合成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:39:05Z) - Transferable Active Grasping and Real Embodied Dataset [48.887567134129306]
ハンドマウント型RGB-Dカメラを用いて把握可能な視点を探索する方法を示す。
現実的な3段階の移動可能な能動把握パイプラインを開発し、未確認のクラッタシーンに適応する。
本研究のパイプラインでは,カテゴリ非関連行動の把握と確保において,スパース報酬問題を克服するために,新しいマスク誘導報酬を提案する。
論文 参考訳(メタデータ) (2020-04-28T08:15:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。