論文の概要: AnyViewDex: View-Invariant Dexterous Manipulation from RGB Observations
- arxiv url: http://arxiv.org/abs/2609.20107v1
- Date: Thu, 17 Sep 2026 12:07:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.254347
- Title: AnyViewDex: View-Invariant Dexterous Manipulation from RGB Observations
- Title(参考訳): AnyViewDex: RGB観測によるビュー不変デキスタラスマニピュレーション
- Abstract要約: ビュー不変制御は、明示的なテスト時間3Dセンシングなしで実現できることを示す。
非対称なトレーニングパイプラインであるAnyViewDexについて述べる。
- 参考スコア(独自算出の注目度): 0.23421882957715123
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Visuomotor policies for multi-fingered dexterous manipulation are highly sensitive to camera viewpoint shifts. To achieve view invariance, recent methods increasingly rely on explicit 3D modalities like RGB-D or point clouds, which can introduce hardware dependencies, calibration requirements, and vulnerability to sensor noise during real-world deployment. In this work, we show that view-invariant control can be achieved without explicit test-time 3D sensing by encoding geometric knowledge into the visual representation during simulation. We present AnyViewDex, an asymmetric training pipeline that combines multi-view contrastive alignment with privileged 3D geometric supervision. By regressing absolute 3D object coordinates during simulated training, this auxiliary objective provides a geometric grounding signal that mitigates the spatial collapse of the globally pooled contrastive embedding. At deployment, the policy operates zero-shot using only uncalibrated monocular RGB and proprioception. We validate this approach across both reinforcement learning and student-teacher distillation. In hardware evaluation on an xArm7 with a 16-DoF LEAP Hand, AnyViewDex reaches 76.7% grasping success across eight unseen objects and six uncalibrated viewpoints (480 trials; 2,400 across all ablation conditions), indicating that geometrically grounded monocular policies transfer zero-shot without test-time depth. Project Page: https://anyviewdex.github.io/
- Abstract(参考訳): マルチフィンガーデキスタラス操作のためのビジュモータポリシーは、カメラの視点シフトに非常に敏感である。
ビューの不変性を達成するため、最近の手法では、RGB-Dやポイントクラウドのような明示的な3Dモダリティにますます依存している。
本研究では,幾何学的知識をシミュレーション中に視覚表現に符号化することにより,明示的なテスト時間3Dセンシングを行なわずにビュー不変制御を実現することができることを示す。
非対称なトレーニングパイプラインであるAnyViewDexについて述べる。
この補助的目的は、シミュレーショントレーニング中に絶対的な3次元オブジェクト座標を回帰することにより、グローバルプールされたコントラスト埋め込みの空間的崩壊を緩和する幾何学的接地信号を提供する。
配備において、ポリシーは、未調整の単分子RGBとプロプレセプションのみを使用してゼロショットを運用する。
我々は、強化学習と学生・教師の蒸留の両方にまたがって、このアプローチを検証した。
16-DoF LEAPハンドを搭載したxArm7のハードウェア評価では、AnyViewDexは8つの未確認オブジェクトと6つの未調整視点(480のトライアル、2,400のアブレーション条件)で76.7%の精度で成功し、幾何学的に基底された単分子ポリシーがテスト時間深度なしでゼロショットを転送することを示している。
Project Page: https://anyviewdex.github.io/
関連論文リスト
- R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies [86.2249156068836]
R2RDreamerは実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-
視覚的補完を2次元ビデオ空間に移動させながら、3次元のアクション・オブザーブレーション編集の幾何的整合性を維持する。
論文 参考訳(メタデータ) (2026-06-15T17:56:19Z) - ViserDex: Visual Sim-to-Real for Robust Dexterous In-hand Reorientation [9.303398221598739]
複雑なタスクのダイナミクスを扱うには、オブジェクトのポーズを正確に見積もる必要がある。
RGBセンシングはポーズトラッキングのためのリッチなセマンティックキューを提供するが、既存のソリューションはマルチカメラのセットアップや高価なレイトレーシングに依存している。
本稿では,3次元ガウススプラッティング(3DGS)を統合して視覚的シム-リアルギャップを埋めるモノクラーRGBの直交配向フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-13T07:50:41Z) - HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images [81.42866295265443]
高忠実度3Dハンドジオメトリはコンピュータビジョンにおいて重要な課題である。
スケーラブルなアプリケーションは、正確性とデプロイメントの柔軟性の両方を必要とします。
本研究では、3Dハンドメッシュとカメラのポーズを非校正視点から推定するフィードフォワードアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-03-25T06:54:34Z) - ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations [19.02933938928656]
ManiVID-3Dはロボット操作のための新しい3Dビジュアル強化学習アーキテクチャである。
自己教師付き不整形特徴学習を通じて、ビュー不変表現を学習する。
現状の手法よりも44.7%高い成功率を達成する。
論文 参考訳(メタデータ) (2025-09-14T06:31:04Z) - GaussRender: Learning 3D Occupancy with Gaussian Rendering [86.89653628311565]
GaussRenderは、投影的一貫性を強制することによって3D占有学習を改善するモジュールである。
提案手法は,不整合な2次元プロジェクションを生成する3次元構成をペナライズすることにより,より一貫性のある3次元構造を実現する。
論文 参考訳(メタデータ) (2025-02-07T16:07:51Z) - Touch-GS: Visual-Tactile Supervised 3D Gaussian Splatting [13.895893586777802]
光触覚センサを用いた3次元ガウス撮影シーンの監視手法を提案する。
我々は、DenseTact光触覚センサとRealSense RGB-Dカメラを活用し、この方法でタッチとビジョンを組み合わせることで、視覚やタッチ単独よりも定量的に質的に優れた結果が得られることを示す。
論文 参考訳(メタデータ) (2024-03-14T21:09:59Z) - RGB-based Category-level Object Pose Estimation via Decoupled Metric
Scale Recovery [72.13154206106259]
本研究では、6次元のポーズとサイズ推定を分離し、不完全なスケールが剛性変換に与える影響を緩和するパイプラインを提案する。
具体的には,事前学習した単分子推定器を用いて局所的な幾何学的情報を抽出する。
別個のブランチは、カテゴリレベルの統計に基づいてオブジェクトのメートル法スケールを直接復元するように設計されている。
論文 参考訳(メタデータ) (2023-09-19T02:20:26Z) - Self-supervised Wide Baseline Visual Servoing via 3D Equivariance [35.93323183558956]
本稿では,広視野ベースライン画像に対する自己教師付き視覚サーボ手法を提案する。
絶対カメラがオブジェクトに対して作用する既存のアプローチでは、オブジェクトの3D地上真理データが必要である。
平均誤差が35%以上減少し,90%以上の成功率と3cmの誤差耐性が得られた。
論文 参考訳(メタデータ) (2022-09-12T17:38:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。