論文の概要: Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification
- arxiv url: http://arxiv.org/abs/2607.10706v1
- Date: Sun, 12 Jul 2026 10:58:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.508063
- Title: Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification
- Title(参考訳): アクションマップポリシー: ピクセル分類による3Dクローズドループ操作の学習
- Authors: Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters,
- Abstract要約: Action Map Policyは、画像空間における分類問題として、3Dクローズドループ操作ポリシー学習を論じている。
AMPは高いベースラインを上回り,高い成功率,高速推論,空間推論の強化を実現している。
- 参考スコア(独自算出の注目度): 22.850651559843104
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The action space poses a major challenge in robot learning, since it is often high-dimensional, can span long time horizons, and frequently admits multi-modal optimal solutions. A good choice of action representation and loss function can help to address these concerns, but there are often trade offs. We propose Action Map Policy (AMP), which casts 3D closed-loop manipulation policy learning as a classification problem in image space. While classification has been an effective formulation in generative language models, applying it to robot action learning is difficult because naively discretizing high-dimensional continuous actions explodes the token vocabulary. Our key idea is to project 3D actions onto the camera image planes and treat each pixel location as a discrete class, thus controlling dimensionality while retaining multi-modality. This method supports millimeter-level precision for high-dimensional actions without requiring a prohibitively large vocabulary, while preserving fine-grained pixel-wise visual signals. Furthermore, it can predict the entire action chunk in a single forward pass, avoiding complex noise scheduling and iterative denoising while achieving substantially faster inference than diffusion policies. Experiments on various manipulation tasks show that AMP outperforms strong baselines, achieving higher success rates, faster inference, and enhanced spatial reasoning.
- Abstract(参考訳): アクション空間は、しばしば高次元であり、長い時間的地平線にまたがることができ、マルチモーダル最適解をしばしば認めるため、ロボット学習において大きな課題となる。
アクション表現と損失関数のよい選択は、これらの懸念に対処するのに役立ちますが、しばしばトレードオフがあります。
本稿では,画像空間の分類問題として3Dクローズドループ操作ポリシー学習を取り入れた行動マップポリシー(AMP)を提案する。
分類は生成言語モデルにおいて有効な定式化であるが,高次元連続行動の識別がトークン語彙を爆発させるため,ロボット行動学習に適用することは困難である。
我々のキーとなるアイデアは、カメラ画像平面に3Dアクションを投影し、各ピクセルの位置を離散クラスとして扱うことで、マルチモーダルを維持しながら次元性を制御することである。
本手法は,高次元動作に対するミリレベルの精度を,微細な画素ワイドな視覚信号を保持しつつも,極めて大きな語彙を必要とすることなく支援する。
さらに、単一の前方通過におけるアクションチャンク全体を予測し、複雑なノイズスケジューリングや反復的なデノゲーションを回避し、拡散ポリシーよりもはるかに高速な推論を実現する。
様々な操作タスクの実験では、AMPは強いベースラインを上回り、より高い成功率、高速な推論、空間推論の強化を実現している。
関連論文リスト
- Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation [67.16145181790522]
本稿では,視覚・言語・行動モデル(VLA)における空間認識と操作の課題に取り組む。
幾何学的ガイダンスに基づいて多視点特徴を整列する幾何誘導型ゲート変換器(G3T)を提案する。
動作学習効率を向上させるために,有効な動作多様体上での動作を直接予測するアクション・マニフォールド・ラーニング(AML)を導入する。
論文 参考訳(メタデータ) (2026-05-12T09:21:29Z) - VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning [29.62906091681386]
VolumeDPは空間アライメントを3Dで明示的に推論することで復元するポリシーアーキテクチャである。
LIBEROシミュレーションベンチマークでは、最先端の平均成功率は88.8%に達する。
論文 参考訳(メタデータ) (2026-03-18T13:40:24Z) - CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining [4.039082584778385]
3次元多視点動作記述型ロボットマニピュレーション事前学習(CLAMP)のコントラスト学習について紹介する。
RGB-D画像とカメラ外部画像から計算した統合点雲から、深度と3次元座標によるマルチビュー4チャンネル画像観察を再レンダリングした。
事前訓練されたエンコーダは、オブジェクトの幾何学的および位置的情報とロボットのアクションパターンを関連付けることを学習する。
論文 参考訳(メタデータ) (2026-01-31T23:32:54Z) - DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation [52.136378691610524]
本稿では、3次元認識と動的インフォームド三面体特徴を学習する表現学習フレームワークDynaRendを紹介する。
マルチビューRGB-Dビデオデータに基づく事前トレーニングにより、DynaRendは空間幾何学、将来のダイナミクス、タスク意味を統合された三面体表現で共同でキャプチャする。
我々は、RLBenchとColosseumという2つの挑戦的なベンチマークでDynaRendを評価し、政策成功率、環境摂動の一般化、様々な操作タスクにおける実世界の適用性などを大幅に改善した。
論文 参考訳(メタデータ) (2025-10-28T10:17:11Z) - Object-centric 3D Motion Field for Robot Learning from Human Videos [56.9436352861611]
本稿では,人間ビデオからのロボット学習の動作を表現するために,物体中心の3次元運動場を提案する。
ゼロショット制御のためのビデオからこの表現を抽出するための新しいフレームワークを提案する。
実験の結果,提案手法は最新の手法に比べて3次元動作推定誤差を50%以上削減できることがわかった。
論文 参考訳(メタデータ) (2025-06-04T17:59:06Z) - LLMI3D: MLLM-based 3D Perception from a Single 2D Image [77.13869413871028]
マルチモーダルな大言語モデル(MLLM)は、一般的な能力では優れているが、3Dタスクでは性能が劣る。
本稿では,3次元局所空間物体認識の弱さ,テキストに基づく幾何学的数値出力の低さ,カメラ焦点変動の処理能力の低下に対する解決策を提案する。
我々は,事前学習したMLLMに対してパラメータ効率の良い微調整を採用し,強力な3次元知覚MLLMであるLLMI3Dを開発した。
論文 参考訳(メタデータ) (2024-08-14T10:00:16Z) - 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations [19.41216557646392]
3次元拡散政策(DP3)は、新しい視覚模倣学習手法である。
実験では、DP3は10のデモでほとんどのタスクを処理し、24.2%の相対的な改善でベースラインを超えた。
実際のロボット実験では、DP3は頻繁に行う基準法とは対照的に、安全要件にほとんど違反しない。
論文 参考訳(メタデータ) (2024-03-06T18:58:49Z) - LocATe: End-to-end Localization of Actions in 3D with Transformers [91.28982770522329]
LocATeは、3Dシーケンスでアクションを共同でローカライズし認識するエンドツーエンドのアプローチである。
画像やパッチの特徴を入力として考えるトランスフォーマーベースのオブジェクト検出や分類モデルとは異なり、LocATeのトランスフォーマーモデルはシーケンス内のアクション間の長期的な相関をキャプチャすることができる。
BABEL-TAL-20 (BT20) という新しい,挑戦的で,より現実的なベンチマークデータセットを導入する。
論文 参考訳(メタデータ) (2022-03-21T03:35:32Z) - Unsupervised Learning of Visual 3D Keypoints for Control [104.92063943162896]
高次元画像からの感覚運動制御ポリシーの学習は、基礎となる視覚表現の品質に大きく依存する。
本稿では,画像から3次元幾何学的構造を直接教師なしで学習するフレームワークを提案する。
これらの発見された3Dキーポイントは、時間と3D空間の両方で一貫した方法で、ロボットの関節と物体の動きを有意義にキャプチャする傾向がある。
論文 参考訳(メタデータ) (2021-06-14T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。