論文の概要: Geometry-Aware Motion Latents for Learning Robust Manipulation Policies
- arxiv url: http://arxiv.org/abs/2607.04714v1
- Date: Mon, 06 Jul 2026 06:34:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.062365
- Title: Geometry-Aware Motion Latents for Learning Robust Manipulation Policies
- Title(参考訳): ロバスト操作ポリシー学習のための幾何学的動作遅延器
- Abstract要約: 我々はGeoMoLaを紹介した。これは、操作中に点雲がどのように進化するかを予測することで、離散的な動き潜時符号を学習する。
GeoMoLaは、単一ビューのRGB-D入力のみを使用して最先端のパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 17.407684641239083
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Learning motion latents for robotic manipulation heavily relies on extracting motion patterns from visual sequences, yet effective action abstractions require understanding three-dimensional geometric transformations. Here, we introduce GeoMoLa (Geometry-Aware Motion Latents), which learns discrete motion latent codes by predicting how point clouds evolve during manipulation rather than reconstructing visual observations. This four-dimensional objective -- spatial geometry changing through time -- forces latent representations to encode actual physical motion rather than appearance patterns. GeoMoLa achieves state-of-the-art performance using only single-view RGB-D input, while existing methods require multi-view reconstruction, succeeding across diverse manipulation benchmarks. Our ablations reveal that geometric prediction is the key to driving performance, quantitatively validating that manipulation depends on spatial understanding. Furthermore, the learned codes exhibit effective motion abstraction: applying them to novel scenes produces physically consistent transformations regardless of visual context. Our real-world experiments also confirm this robustness capability, achieving robust manipulation with minimal demonstrations in cluttered environments where geometric reasoning determines success. Thus, we demonstrate that effective motion latents for robot control can better emerge from understanding motion through its three-dimensional effects rather than pixel-level patterns.
- Abstract(参考訳): ロボット操作のための学習動作潜伏者は、視覚的シーケンスから動きパターンを抽出することに大きく依存するが、効果的な動作抽象化は三次元幾何学的変換を理解する必要がある。
ここではGeoMoLa(Geometry-Aware Motion Latents)を導入し、視覚的な観察を再構築するのではなく、操作中に点雲がどのように進化するかを予測することによって、離散的な動き潜時符号を学習する。
この4次元の目的 -- 時間とともに変化する空間幾何学 -- は、潜在表現に、外観パターンよりも実際の身体運動をエンコードするように強制する。
GeoMoLaは、単一ビューのRGB-D入力のみを使用して最先端のパフォーマンスを達成し、既存の手法ではマルチビューの再構築が必要であり、様々な操作ベンチマークで成功している。
我々の主張は、幾何学的予測が性能を駆動する鍵であることを示し、操作が空間的理解に依存することを定量的に検証する。
さらに、学習されたコードには効果的な動作抽象化が示されており、視覚的コンテキストに関係なく、それらを新しいシーンに適用すると物理的に一貫した変換が生成される。
我々の実世界の実験は、幾何学的推論が成功を決定する散らばった環境において、最小限のデモンストレーションで頑健な操作を実現することで、この堅牢性も確認しています。
そこで本研究では,ロボット制御のための効果的な動作潜伏剤が,画素レベルのパターンよりも3次元的効果を通じて動作を理解することにより,より効果的に実現できることを実証する。
関連論文リスト
- GeoLAM: Learning Geometry-Grounded Latent Actions from Unlabeled Human Videos [8.414561051327915]
そこで,GeoLAMについて紹介する。GeoLAMは,アクションフリーな人間のビデオから幾何学的特徴を学習するためのフレームワークである。
GeoLAMは、凍結した幾何学的特徴階層による将来のフレーム再構築と、トレーニング専用の4D幾何学教師の運動監督を組み合わせる。
論文 参考訳(メタデータ) (2026-09-15T12:31:34Z) - Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision [2.5899040911480182]
本研究は,ロボットグリップリファインメントのための強化学習に基づくフレームワークを提案する。
幾何に基づくアルゴリズムは、提案フレームワークによって反復的に洗練される初期把握候補を生成する。
Dex-Netデータセットから300のオブジェクトに対して実施された実験は、フレームワークの有効性を実証している。
論文 参考訳(メタデータ) (2026-08-18T10:44:58Z) - ODeform: Learning Continuous 4D Motion for Shape Deformation with Neural ODEs [21.51657616248173]
本稿では、3次元空間における変形可能な物体の連続4次元ダイナミクスに対するニューラル正規微分方程式の新たな拡張であるODeformを提案する。
本手法は3次元点雲と物理的条件(材料特性など)を統一潜在空間に変換する。
得られた通常の微分方程式を時間とともに解くことにより、この学習された埋め込み内での連続的な流れとして変形をモデル化し、計算効率を維持しながら離散的な時間ステップを不要にする。
論文 参考訳(メタデータ) (2026-07-22T19:08:31Z) - GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation [6.488530751190965]
全体移動操作には移動基地とマニピュレータの調整が必要である。
我々は、シンプルな原理に基づいて構築された、エンドツーエンドの拡散ベースのフレームワークGeoHATを提案する。
ManiSkill-HABシミュレーションベンチマークの実験では、GeoHATが79.3%の成功率を達成した。
論文 参考訳(メタデータ) (2026-06-11T14:25:09Z) - GenMatter: Perceiving Physical Objects with Generative Matter Models [50.121713214509604]
人間は、独立して移動可能な物質塊を構成する移動体をしっかりと分断する。
既存のコンピュータビジョンシステムは、様々な設定で機能する統一されたアプローチを欠いている。
階層的に低レベルの運動キューと高レベルの外観特徴を粒子にグループ化する生成モデルを提案する。
論文 参考訳(メタデータ) (2026-04-24T02:18:18Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - OWL: A Novel Approach to Machine Perception During Motion [0.0]
動作中の3次元知覚の複雑な課題に対処するために,知覚関連機能OWLを導入する。
その値は2つの基本的な視覚運動キューから直接導出され、1ポイント当たりの1セットのキュー値が瞬時に得られる。
OWLは、重要な知覚能力を強化し、単純化する統一的で分析的な時間ベースのアプローチを提供する。
論文 参考訳(メタデータ) (2026-03-05T21:22:17Z) - GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry [61.24189040578178]
そこで本研究では,注目機構を介し,潜在特徴表現から移動対象を直接推論する完全学習型アプローチを提案する。
我々の重要な洞察は、明示的な対応推定を回避し、代わりに、モデルが暗黙的にオブジェクトとカメラの動きを歪めることを学ぶことである。
提案手法は,最先端の動作セグメンテーション性能を高い効率で達成する。
論文 参考訳(メタデータ) (2026-02-25T11:36:33Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation [52.136378691610524]
本稿では、3次元認識と動的インフォームド三面体特徴を学習する表現学習フレームワークDynaRendを紹介する。
マルチビューRGB-Dビデオデータに基づく事前トレーニングにより、DynaRendは空間幾何学、将来のダイナミクス、タスク意味を統合された三面体表現で共同でキャプチャする。
我々は、RLBenchとColosseumという2つの挑戦的なベンチマークでDynaRendを評価し、政策成功率、環境摂動の一般化、様々な操作タスクにおける実世界の適用性などを大幅に改善した。
論文 参考訳(メタデータ) (2025-10-28T10:17:11Z) - ACID: Action-Conditional Implicit Visual Dynamics for Deformable Object
Manipulation [135.10594078615952]
本稿では,体積変形可能なオブジェクトに対する動作条件の視覚力学モデルであるACIDを紹介する。
ベンチマークには17,000以上のアクション・トラジェクトリー、6種類のぬいぐるみと78種類の変種が含まれている。
我々のモデルは、幾何学、対応、力学の予測において最高の性能を達成する。
論文 参考訳(メタデータ) (2022-03-14T04:56:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。