Fugu-MT 論文翻訳(概要): Adapt3R: Adaptive 3D Scene Representation for Domain Transfer in Imitation Learning

論文の概要: Adapt3R: Adaptive 3D Scene Representation for Domain Transfer in Imitation Learning

arxiv url: http://arxiv.org/abs/2503.04877v2
Date: Thu, 15 May 2025 20:49:51 GMT
ステータス: 翻訳完了
システム内更新日: 2025-05-19 14:36:12.382848
Title: Adapt3R: Adaptive 3D Scene Representation for Domain Transfer in Imitation Learning
Title（参考訳）: Adapt3R:模倣学習におけるドメイン転送のための適応型3次元シーン表現
Authors: Albert Wilcox, Mohamed Ghanem, Masoud Moghani, Pierre Barroso, Benjamin Joffe, Animesh Garg,
Abstract要約: 模倣学習は、ロボットに複雑な多様な操作タスクを実行するよう訓練することができるが、学習されたポリシーはトレーニング分布外の観察で不安定である。本稿では,キャリブレーションされたRGBDカメラのデータを任意のILアルゴリズムの条件付けとして使用できるベクトルに合成する汎用3D観測エンコーダAdapt3Rを提案する。 93のシミュレーションと6つの実際のタスクを、さまざまなILアルゴリズムでエンドツーエンドにトレーニングすると、Adapt3Rはこれらのアルゴリズムの学習能力を維持しながら、新しいエボディメントやカメラのポーズへのゼロショット転送を可能にします。
参考スコア（独自算出の注目度）: 28.80962812015936
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Imitation Learning can train robots to perform complex and diverse manipulation tasks, but learned policies are brittle with observations outside of the training distribution. 3D scene representations that incorporate observations from calibrated RGBD cameras have been proposed as a way to mitigate this, but in our evaluations with unseen embodiments and camera viewpoints they show only modest improvement. To address those challenges, we propose Adapt3R, a general-purpose 3D observation encoder which synthesizes data from calibrated RGBD cameras into a vector that can be used as conditioning for arbitrary IL algorithms. The key idea is to use a pretrained 2D backbone to extract semantic information, using 3D only as a medium to localize this information with respect to the end-effector. We show across 93 simulated and 6 real tasks that when trained end-to-end with a variety of IL algorithms, Adapt3R maintains these algorithms' learning capacity while enabling zero-shot transfer to novel embodiments and camera poses.
Abstract（参考訳）: 模倣学習は、ロボットに複雑な多様な操作タスクを実行するよう訓練することができるが、学習されたポリシーはトレーニング分布外の観察で不安定である。キャリブレーションされたRGBDカメラからの観察を取り入れた3次元シーン表現は,これを緩和する方法として提案されている。これらの課題に対処するために,キャリブレーションされたRGBDカメラからデータを任意のILアルゴリズムの条件付けとして使用できるベクトルに合成する汎用3D観測エンコーダAdapt3Rを提案する。鍵となるアイデアは、事前訓練された2Dバックボーンを使用してセマンティック情報を抽出し、3Dを媒体として、エンドエフェクタに関してこの情報をローカライズすることである。 93のシミュレーションと6つの実際のタスクを、さまざまなILアルゴリズムでエンドツーエンドにトレーニングすると、Adapt3Rはこれらのアルゴリズムの学習能力を維持しながら、新しいエボディメントやカメラのポーズへのゼロショット転送を可能にします。

関連論文リスト

Easi3R: Estimating Disentangled Motion from DUSt3R Without Training [48.87063562819018]
Easi3Rは,4次元再構成のための簡易かつ効率的なトレーニングフリー手法である。提案手法は,事前学習やネットワークファインチューニングの必要性を排除し,推論中の注意適応を適用した。実世界のダイナミックビデオの実験では、従来の最先端手法よりも軽量な注意適応が著しく優れていたことが示されている。
論文参考訳（メタデータ） (2025-03-31T17:59:58Z)
Discovering an Image-Adaptive Coordinate System for Photography Processing [51.164345878060956]
曲線演算を行う前にRGB色空間における画像適応座標系を学習するための新しいアルゴリズム IAC を提案する。このエンドツーエンドのトレーニング可能なアプローチにより、共同で学習した画像適応座標系と曲線を用いて、画像の効率よく調整できる。
論文参考訳（メタデータ） (2025-01-11T06:20:07Z)
Implicit-Zoo: A Large-Scale Dataset of Neural Implicit Functions for 2D Images and 3D Scenes [65.22070581594426]
Implicit-Zoo"は、この分野の研究と開発を容易にするために、数千のGPUトレーニング日を必要とする大規模なデータセットである。 1)トランスモデルのトークン位置を学習すること、(2)NeRFモデルに関して直接3Dカメラが2D画像のポーズを取ること、である。これにより、画像分類、セマンティックセグメンテーション、および3次元ポーズ回帰の3つのタスクすべてのパフォーマンスが向上し、研究のための新たな道が開けることになる。
論文参考訳（メタデータ） (2024-06-25T10:20:44Z)
NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance Fields [57.617972778377215]
提案手法は,RGB画像から有効な3D表現を生成する方法を示す。我々は、この表現を、提案した擬似RGBデータに基づいて、180万枚以上の画像で事前訓練する。我々は,NeRFの自己教師型プレトレーニングであるNeRF-MAE(NeRF-MAE)を目覚ましいスケールで実施し,様々な3Dタスクの性能向上を実現した。
論文参考訳（メタデータ） (2024-04-01T17:59:55Z)
Self-supervised Learning of LiDAR 3D Point Clouds via 2D-3D Neural Calibration [107.61458720202984]
本稿では,自律走行シーンにおける3次元知覚を高めるための,新しい自己教師型学習フレームワークを提案する。本稿では,画像とポイントクラウドデータの領域ギャップを埋めるために,学習可能な変換アライメントを提案する。我々は剛性ポーズを推定するために密度の高い2D-3D対応を確立する。
論文参考訳（メタデータ） (2024-01-23T02:41:06Z)
Joint 3D Shape and Motion Estimation from Rolling Shutter Light-Field Images [2.0277446818410994]
本研究では,ローリングシャッターセンサを備えた光界カメラで撮影した1枚の画像からシーンを3次元再構成する手法を提案する。本手法は、光場に存在する3次元情報キューと、ローリングシャッター効果によって提供される動き情報を利用する。本稿では,このセンサの撮像プロセスの汎用モデルと再投射誤差を最小化する2段階アルゴリズムを提案する。
論文参考訳（メタデータ） (2023-11-02T15:08:18Z)
PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm [114.47216525866435]
本稿では,効率的な3D表現の獲得を容易にするために,新しいユニバーサル3D事前学習フレームワークを提案する。 PonderV2は、11の室内および屋外ベンチマークで最先端のパフォーマンスを達成したことで、その効果が示唆された。
論文参考訳（メタデータ） (2023-10-12T17:59:57Z)
AutoDecoding Latent 3D Diffusion Models [95.7279510847827]
本稿では,3次元オートデコーダをコアとした静的・明瞭な3次元アセットの生成に対して,新しいアプローチを提案する。 3D Autodecoderフレームワークは、ターゲットデータセットから学んだプロパティを潜時空間に埋め込む。次に、適切な中間体積潜在空間を特定し、ロバストな正規化と非正規化演算を導入する。
論文参考訳（メタデータ） (2023-07-07T17:59:14Z)
FlowCam: Training Generalizable 3D Radiance Fields without Camera Poses via Pixel-Aligned Scene Flow [26.528667940013598]
ポーズ画像からの3次元ニューラルネットワークの再構成は、自己教師付き表現学習の有望な方法として現れている。これらの3Dシーンの学習者が大規模ビデオデータに展開するのを防ぐ重要な課題は、構造から移動までの正確なカメラポーズに依存することである。本稿では,オンラインと1つのフォワードパスでカメラポーズと3Dニューラルシーン表現を共同で再構築する手法を提案する。
論文参考訳（メタデータ） (2023-05-31T20:58:46Z)
3D Data Augmentation for Driving Scenes on Camera [50.41413053812315]
本稿では,Drive-3DAugと呼ばれる3次元データ拡張手法を提案する。まずNeural Radiance Field(NeRF)を用いて,背景および前景の3次元モデルの再構成を行う。そして、予め定義された背景の有効領域に適応した位置と向きの3Dオブジェクトを配置することにより、拡張駆動シーンを得ることができる。
論文参考訳（メタデータ） (2023-03-18T05:51:05Z)
Visual Reinforcement Learning with Self-Supervised 3D Representations [15.991546692872841]
運動制御のための3次元表現の自己教師型学習のための統一的な枠組みを提案する。本手法は,2次元表現学習法と比較して,シミュレーション操作タスクにおけるサンプル効率の向上を享受する。
論文参考訳（メタデータ） (2022-10-13T17:59:55Z)
Unsupervised Learning of Efficient Geometry-Aware Neural Articulated Representations [89.1388369229542]
本稿では,3次元幾何認識による音声オブジェクトの表現学習のための教師なし手法を提案する。私たちは、GANトレーニングで表現を学ぶことで、このニーズを回避します。実験は,本手法の有効性を実証し,GANに基づくトレーニングにより,制御可能な3次元表現を,監督なしで学習できることを示す。
論文参考訳（メタデータ） (2022-04-19T12:10:18Z)
Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled Representation [57.11299763566534]
空間校正カメラで撮影した多視点画像から3次元ポーズを復元する手法を提案する。我々は3次元形状を利用して、入力画像をカメラ視点から切り離したポーズの潜在表現に融合する。アーキテクチャは、カメラプロジェクション演算子に学習した表現を条件付け、ビュー当たりの正確な2次元検出を生成する。
論文参考訳（メタデータ） (2020-04-05T12:52:29Z)
Learning Precise 3D Manipulation from Multiple Uncalibrated Cameras [13.24490469380487]
本稿では,3次元な精密な操作タスクをエンド・ツー・エンドで学習するための効果的なマルチビュー手法を提案する。提案手法は,ポイントクラウドやボクセルグリッドのような明示的な3D表現を構築することなく,静的に配置された複数のRGBカメラビューを用いて,これらのタスクを達成できることを学習する。
論文参考訳（メタデータ） (2020-02-21T03:28:42Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。