論文の概要: R3D: Revisiting 3D Policy Learning
- arxiv url: http://arxiv.org/abs/2604.15281v1
- Date: Thu, 16 Apr 2026 17:50:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:32.037813
- Title: R3D: Revisiting 3D Policy Learning
- Title(参考訳): R3D:3D政策学習の再考
- Authors: Zhengdong Hong, Shenrui Wu, Haozhe Cui, Boyi Zhao, Ran Ji, Yiyang He, Hangxing Zhang, Zundong Ke, Jun Wang, Guofeng Zhang, Jiayuan Gu,
- Abstract要約: 3Dポリシー学習は、より優れた一般化とクロス・エボディメント・トランスファーを約束する。
しかし、トレーニングの不安定さや過度なオーバーフィッティングによって進歩が妨げられている。
本稿では,スケーラブルなトランスフォーマーベース3Dエンコーダと拡散デコーダを結合した新しいアーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 11.23458588452973
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D policy learning promises superior generalization and cross-embodiment transfer, but progress has been hindered by training instabilities and severe overfitting, precluding the adoption of powerful 3D perception models. In this work, we systematically diagnose these failures, identifying the omission of 3D data augmentation and the adverse effects of Batch Normalization as primary causes. We propose a new architecture coupling a scalable transformer-based 3D encoder with a diffusion decoder, engineered specifically for stability at scale and designed to leverage large-scale pre-training. Our approach significantly outperforms state-of-the-art 3D baselines on challenging manipulation benchmarks, establishing a new and robust foundation for scalable 3D imitation learning. Project Page: https://r3d-policy.github.io/
- Abstract(参考訳): 3Dポリシー学習は、より優れた一般化とクロス・エボディメント・トランスファーを約束するが、強力な3D知覚モデルが採用される前に、トレーニングの不安定さと過度なオーバーフィッティングによって進歩が妨げられている。
本研究では,これらの障害を系統的に診断し,3次元データ拡張の欠落とバッチ正規化の悪影響を原因として同定する。
本稿では,スケーラブルなトランスフォーマーベースの3Dエンコーダと拡散デコーダを結合したアーキテクチャを提案する。
われわれのアプローチは、最先端の3Dベースラインを挑戦的な操作ベンチマークで上回り、スケーラブルな3D模倣学習のための新しい堅牢な基盤を確立している。
Project Page: https://r3d-policy.github.io/
関連論文リスト
- 3D-Fixup: Advancing Photo Editing with 3D Priors [32.83193513442457]
3D-Fixupは、学習した3Dプリエントによってガイドされた2Dイメージを編集する新しいフレームワークである。
拡散モデルの生成力を利用するトレーニングベースアプローチを利用する。
3D-Fixupは複雑でアイデンティティの整合した3D認識編集を効果的にサポートする。
論文 参考訳(メタデータ) (2025-05-15T17:59:51Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - P3P: Pseudo-3D Pre-training for Scaling 3D Voxel-based Masked Autoencoders [34.64343313442465]
本稿では,数百万の画像を3次元事前学習コーパスに組み込んだ,自己教師型事前学習フレームワークを提案する。
本手法は,3次元分類,少数ショット学習,および3次元分割における最先端性能を実現する。
論文 参考訳(メタデータ) (2024-08-19T13:59:53Z) - FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models [59.13757801286343]
クラス増分学習(class-incremental learning)は、モデルが限られたデータで漸進的にトレーニングされている場合、破滅的な忘れの問題を軽減することを目的としている。
本稿では,特徴空間の不整合のための冗長特徴除去器 (RFE) と,重要な雑音に対する空間ノイズ補償器 (SNC) の2つの新しいコンポーネントを備えたFILP-3Dフレームワークを紹介する。
論文 参考訳(メタデータ) (2023-12-28T14:52:07Z) - PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm [111.16358607889609]
本稿では,効率的な3D表現の獲得を容易にするために,新しいユニバーサル3D事前学習フレームワークを提案する。
PonderV2は、11の室内および屋外ベンチマークで最先端のパフォーマンスを達成したことで、その効果が示唆された。
論文 参考訳(メタデータ) (2023-10-12T17:59:57Z) - Advancing 3D Medical Image Analysis with Variable Dimension Transform
based Supervised 3D Pre-training [45.90045513731704]
本稿では,革新的でシンプルな3Dネットワーク事前学習フレームワークを再考する。
再設計された3Dネットワークアーキテクチャにより、データ不足の問題に対処するために、修正された自然画像が使用される。
4つのベンチマークデータセットに関する総合的な実験により、提案した事前学習モデルが収束を効果的に加速できることが示されている。
論文 参考訳(メタデータ) (2022-01-05T03:11:21Z) - Exemplar Fine-Tuning for 3D Human Model Fitting Towards In-the-Wild 3D
Human Pose Estimation [107.07047303858664]
3次元の地平線アノテーションを持つ大規模な人的データセットは、野生では入手が困難である。
既存の2Dデータセットを高品質な3Dポーズマッチングで拡張することで、この問題に対処する。
結果として得られるアノテーションは、3Dのプロシージャネットワークをスクラッチからトレーニングするのに十分である。
論文 参考訳(メタデータ) (2020-04-07T20:21:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。