論文の概要: Hyperbolic Multiview Pretraining for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2603.04848v2
- Date: Thu, 12 Mar 2026 05:29:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.928722
- Title: Hyperbolic Multiview Pretraining for Robotic Manipulation
- Title(参考訳): ロボットマニピュレーションのための双曲型マルチビュー事前学習
- Authors: Jin Yang, Ping Wei, Yixin Chen, Nanning Zheng,
- Abstract要約: HyperMVPは、3D対応のビジュアル事前トレーニングのための自己教師型フレームワークである。
我々は,複数種類の3D点雲からなる大規模データセットである3D-MOVを導入し,事前学習をサポートする。
本研究は,ロバストで汎用的なロボット操作ポリシーを学習するための,非ユークリッド空間における3D認識事前学習の可能性を強調した。
- 参考スコア(独自算出の注目度): 46.15923928117646
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D-aware visual pretraining has proven effective in improving the performance of downstream robotic manipulation tasks. However, existing methods are constrained to Euclidean embedding spaces, whose flat geometry limits their ability to model structural relations among embeddings. As a result, they struggle to learn structured embeddings that are essential for robust spatial perception in robotic applications. To this end, we propose HyperMVP, a self-supervised framework for \underline{Hyper}bolic \underline{M}ulti\underline{V}iew \underline{P}retraining. Hyperbolic space offers geometric properties well suited for capturing structural relations. Methodologically, we extend the masked autoencoder paradigm and design a GeoLink encoder to learn multiview hyperbolic representations. The pretrained encoder is then finetuned with visuomotor policies on manipulation tasks. In addition, we introduce 3D-MOV, a large-scale dataset comprising multiple types of 3D point clouds to support pretraining. We evaluate HyperMVP on COLOSSEUM, RLBench, and real-world scenarios, where it consistently outperforms strong baselines across diverse tasks and perturbation settings. Our results highlight the potential of 3D-aware pretraining in a non-Euclidean space for learning robust and generalizable robotic manipulation policies.
- Abstract(参考訳): 3D認識による視覚前訓練は、下流ロボット操作タスクの性能向上に有効であることが証明された。
しかし、既存の手法はユークリッド埋め込み空間に制約され、平坦な幾何学は埋め込みの間の構造的関係をモデル化する能力を制限する。
結果として、ロボットアプリケーションにおいて、堅牢な空間知覚に不可欠な構造的埋め込みを学ぶのに苦労する。
この目的のために, 自己教師型フレームワークであるHyperMVPを提案する。
双曲空間は構造的関係を捉えるのに適した幾何学的性質を提供する。
手法的に、マスク付きオートエンコーダのパラダイムを拡張し、多視点双曲表現を学習するためのGeoLinkエンコーダを設計する。
事前訓練されたエンコーダは、操作タスクのビジュモータポリシーで微調整される。
さらに,複数種類の3D点雲からなる大規模データセットである3D-MOVを導入し,事前学習をサポートする。
COLOSSEUM、RLBench、および現実世界のシナリオ上でHyperMVPを評価します。
本研究は,ロバストで汎用的なロボット操作ポリシーを学習するための,非ユークリッド空間における3D認識事前学習の可能性を強調した。
関連論文リスト
- ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning [31.000965640377128]
ABot-M0は、システマティックデータキュレーションパイプラインを構築するフレームワークである。
これは不均一な生データを統一的で効率的な表現にエンドツーエンドに変換することを可能にする。
ABot-M0はデュアルストリーム機構を通じてモジュール認識をサポートする。
論文 参考訳(メタデータ) (2026-02-11T16:47:01Z) - CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining [4.039082584778385]
3次元多視点動作記述型ロボットマニピュレーション事前学習(CLAMP)のコントラスト学習について紹介する。
RGB-D画像とカメラ外部画像から計算した統合点雲から、深度と3次元座標によるマルチビュー4チャンネル画像観察を再レンダリングした。
事前訓練されたエンコーダは、オブジェクトの幾何学的および位置的情報とロボットのアクションパターンを関連付けることを学習する。
論文 参考訳(メタデータ) (2026-01-31T23:32:54Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation [52.136378691610524]
本稿では、3次元認識と動的インフォームド三面体特徴を学習する表現学習フレームワークDynaRendを紹介する。
マルチビューRGB-Dビデオデータに基づく事前トレーニングにより、DynaRendは空間幾何学、将来のダイナミクス、タスク意味を統合された三面体表現で共同でキャプチャする。
我々は、RLBenchとColosseumという2つの挑戦的なベンチマークでDynaRendを評価し、政策成功率、環境摂動の一般化、様々な操作タスクにおける実世界の適用性などを大幅に改善した。
論文 参考訳(メタデータ) (2025-10-28T10:17:11Z) - CL3R: 3D Reconstruction and Contrastive Learning for Enhanced Robotic Manipulation Representations [19.71090711790973]
本稿では,ロボット操作ポリシーの強化を目的とした,新しい3D事前学習フレームワークを提案する。
提案手法は,Masked Autoencoderを用いて空間認識と意味理解を統合した。
我々は、カメラビューのあいまいさを軽減し、一般化を改善し、テスト時間における新しい視点からの堅牢な認識を可能にする。
論文 参考訳(メタデータ) (2025-07-11T02:16:32Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z) - 3D-MVP: 3D Multiview Pretraining for Robotic Manipulation [53.45111493465405]
マスク付きオートエンコーダを用いた3次元マルチビュー事前学習のための新しいアプローチである3D-MVPを提案する。
我々は,多視点トランスを用いたロボットビュートランス(RVT)を利用して3Dシーンを理解し,ポーズ動作を予測する。
論文 参考訳(メタデータ) (2024-06-26T08:17:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。