論文の概要: You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact
- arxiv url: http://arxiv.org/abs/2606.28899v1
- Date: Sat, 27 Jun 2026 13:12:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.726394
- Title: You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact
- Title(参考訳): 一度だけ触れる:6-DoFオブジェクトの1つの触覚接触によるポス推定
- Abstract要約: YOTOは、一対の同時接触から全6-DoFオブジェクトのポーズを復元する触覚のみのポーズ推定システムである。
YOTOは、各触覚接触を局所的な3D点雲として表現し、粗いネットワークを介して物体表面に局在させる。
4つの幾何学的多彩な物体に対する実験は、正確な触覚接触位置定位とポーズ推定、視覚ベースおよび幾何学的ベースラインよりも優れた性能を示す。
- 参考スコア(独自算出の注目度): 42.491016490387466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate 6-DoF object pose estimation is fundamental to robotic manipulation, yet vision-based methods often fail under occlusion, poor lighting, and reflective or transparent surfaces. We present YOTO, a tactile-only pose estimation system that recovers the full 6-DoF object pose from a single pair of simultaneous contacts, without requiring contact history. YOTO represents each tactile contact as a local 3D point cloud and localizes it on the object surface through a coarse-to-fine network. The two localized contacts, together with the calibrated sensor poses, are then fed to a closed-form normal-aware SVD solver that recovers the full 6-DoF object pose in one step. To reduce real-data requirements, the localization network is pretrained on virtual tactile patches sampled from the object model and fine-tuned with a small number of real contacts. We further show that YOTO can operate on object models reconstructed from consumer-grade mobile scans, and quantify the gap relative to CAD-based models. Experiments on four geometrically diverse objects demonstrate accurate tactile contact localization and pose estimation, outperforming vision-based and geometric baselines, especially when visual perception is unreliable. Code, trained models, and the real GelSight dataset will be released upon publication.
- Abstract(参考訳): 正確な6-DoFオブジェクトのポーズ推定はロボット操作の基本であるが、視覚に基づく手法は、隠蔽、照明の弱さ、反射面または透明な表面下で失敗することが多い。
触覚のみのポーズ推定システムであるYOTOを,接触履歴を必要とせず,一対の同時接触から全6-DoFオブジェクトのポーズを復元する。
YOTOは、各触覚接触を局所的な3D点雲として表現し、粗いネットワークを介して物体表面に局在させる。
2つの局所的な接触と、校正されたセンサーのポーズは、クローズドフォームの通常のSVDソルバに送られ、完全な6-DoFオブジェクトのポーズを1ステップで回収する。
実データ要求を減らすため、ローカライゼーションネットワークはオブジェクトモデルからサンプリングされた仮想触覚パッチ上で事前訓練され、少数の実接触で微調整される。
さらに、コンシューマグレードのモバイルスキャンから再構成したオブジェクトモデル上でYOTOが動作可能であることを示し、CADベースのモデルとのギャップを定量化する。
4つの幾何学的多彩な物体に対する実験は、特に視覚的知覚が信頼できない場合に、正確な触覚接触位置定位とポーズ推定、視覚ベースおよび幾何学的ベースラインよりも優れたパフォーマンスを示す。
コード、トレーニングされたモデル、実際のGelSightデータセットは公開時にリリースされる。
関連論文リスト
- PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects [36.94429692322632]
PIXIEは、オブジェクトの6Dポーズを、文脈のない3Dモデルのみを使用してRGB画像から推定するゼロショットフレームワークである。
我々は、広く使われている公開ベンチマークを評価し、オブジェクト固有のトレーニングを伴わずにテクスチャのないオブジェクトに対して結果を報告し、現実の応用性を示すための新しいデータセットを紹介した。
論文 参考訳(メタデータ) (2026-07-17T14:48:43Z) - CHOIR: Contact-aware 4D Hand-Object Interaction Reconstruction [73.97421249653412]
単眼カメラ用コンタクト対応HOI再構成フレームワークであるCHOIRについて述べる。
ChoIRは、まず、オープンワールドの視覚的先行から、粗い接触に依存しない4D HOI配列を初期化する。
次に、生成したHOI空間補正モジュールを導入し、光深度補正を予測し、手動相対配置を補正する。
最後に、動的に更新された接触制約を伴う接触認識関節最適化は、幾何学的、時間的、接触整合性を強制する。
論文 参考訳(メタデータ) (2026-05-20T10:31:10Z) - TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches [18.3533066960967]
触覚の疎度測定から3次元再構成を行うための意味的および幾何学的先行モデルとして,事前学習した視覚拡散モデルを利用するフレームワークであるTouchAnythingを提案する。
本手法は,数個の接点から正確なジオメトリを再構成し,既存のベースラインを上回り,未確認のオブジェクトのオープンワールド3D再構成を可能にする。
論文 参考訳(メタデータ) (2026-04-10T04:26:36Z) - InteractVLM: 3D Interaction Reasoning from 2D Foundational Models [85.76211596755151]
InactVLMは、人体と物体の3次元接触点を、ワン・イン・ザ・ワイルド画像から推定する新しい手法である。
既存の方法は、高価なモーションキャプチャシステムや面倒な手動ラベリングを通じて収集された3Dコンタクトアノテーションに依存している。
本稿では,人間の接触予測を対象のセマンティクス上で明示的に条件付けするセマンティック・ヒューマン・コンタクト推定というタスクを提案する。
論文 参考訳(メタデータ) (2025-04-07T17:59:33Z) - Decaf: Monocular Deformation Capture for Face and Hand Interactions [77.75726740605748]
本稿では,単眼のRGBビデオから人間の顔と対話する人間の手を3Dで追跡する手法を提案する。
動作中の非剛性面の変形を誘発する定形物体として手をモデル化する。
本手法は,マーカーレスマルチビューカメラシステムで取得した現実的な顔変形を伴う手動・インタラクションキャプチャーデータセットに頼っている。
論文 参考訳(メタデータ) (2023-09-28T17:59:51Z) - Learning Explicit Contact for Implicit Reconstruction of Hand-held
Objects from Monocular Images [59.49985837246644]
我々は,手持ちの物体を暗黙的に再構築する上で,明示的な方法で接触をモデル化する方法を示す。
まず,1つの画像から3次元手オブジェクトの接触を直接推定するサブタスクを提案する。
第2部では,ハンドメッシュ面から近傍の3次元空間へ推定された接触状態を拡散する新しい手法を提案する。
論文 参考訳(メタデータ) (2023-05-31T17:59:26Z) - FingerSLAM: Closed-loop Unknown Object Localization and Reconstruction
from Visuo-tactile Feedback [5.871946269300959]
FingerSLAMは、指先での局所触覚センシングと、手首マウントカメラからのグローバル視覚センシングを組み合わせた、クローズドループ係数グラフに基づくポーズ推定装置である。
トレーニング中に見つからない6つの物体の定量的および定性的な実世界評価により,信頼性の高いビジュオ触覚ポーズ推定と形状再構成を実証した。
論文 参考訳(メタデータ) (2023-03-14T15:48:47Z) - Tac2Pose: Tactile Object Pose Estimation from the First Touch [6.321662423735226]
触覚ポーズ推定のためのオブジェクト固有のアプローチであるTac2Poseを提案する。
我々は、高密度な物体のポーズがセンサーに生み出す接触形状をシミュレートする。
我々は、RGBの触覚観測を2値の接触形状にマッピングする、物体に依存しないキャリブレーションステップでセンサから接触形状を得る。
論文 参考訳(メタデータ) (2022-04-25T14:43:48Z) - Tactile Object Pose Estimation from the First Touch with Geometric
Contact Rendering [19.69677059281393]
本稿では, 既知物体に対する第1タッチからの触覚ポーズ推定手法を提案する。
実際の触覚観測から接触形状への物体認識マップを作成する。
既知の幾何を持つ新しい物体に対して、シミュレーションで完全に調整された知覚モデルを学ぶ。
論文 参考訳(メタデータ) (2020-12-09T18:00:35Z) - Single View Metrology in the Wild [94.7005246862618]
本研究では,物体の3次元の高さや地上のカメラの高さで表現されるシーンの絶対的なスケールを再現する,単一ビューメロジに対する新しいアプローチを提案する。
本手法は,被写体の高さなどの3Dエンティティによる未知のカメラとの相互作用から,弱い教師付き制約を抑えるために設計されたディープネットワークによって学習されたデータ駆動の先行情報に依存する。
いくつかのデータセットと仮想オブジェクト挿入を含むアプリケーションに対して、最先端の定性的かつ定量的な結果を示す。
論文 参考訳(メタデータ) (2020-07-18T22:31:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。