論文の概要: Equivariant Visual-Tactile Diffusion Policy for Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2610.03333v1
- Date: Fri, 02 Oct 2026 14:04:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.410834
- Title: Equivariant Visual-Tactile Diffusion Policy for Contact-Rich Manipulation
- Title(参考訳): コンタクトリッチマニピュレーションのための等価な視覚触覚拡散政策
- Abstract要約: コンタクトリッチな操作のための模倣学習には、取得に費用がかかる高品質な専門家データが必要である。
VISTA(ワークスペース同値変種ビズオタクタクタクタブル拡散ポリシー)を提案する。
シミュレーションと実世界のロボット環境での実験は、VISTAがデータ効率を大幅に改善することを示している。
- 参考スコア(独自算出の注目度): 33.21079061912328
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imitation learning for contact-rich manipulation requires high-quality expert data that is expensive to obtain. This makes learning a sample-efficient policy a key issue. To address this, we propose VISTA, a workspace-level equivariant visuotactile diffusion policy for data-efficient contact-rich imitation learning. VISTA projects visual and tactile observations into spherical tokens, injects tactile contact cues into visual spherical directions through permutation-equivariant spherical fusion, and rotates the fused harmonic representation using the end-effector orientation. The resulting representation conditions an equivariant diffusion policy to predict spatially consistent actions. Extensive experiments in both simulation and real-world robotic settings show that VISTA substantially improves data efficiency over strong visuotactile imitation learning baselines. Project website: https://vista-paper.github.io/
- Abstract(参考訳): コンタクトリッチな操作のための模倣学習には、取得に費用がかかる高品質な専門家データが必要である。
これにより、サンプル効率のよいポリシを学ぶことが重要な問題になります。
そこで本研究では、データ効率の良い接触リッチな模倣学習のためのワークスペースレベルの同変ビゾタクティル拡散ポリシであるVISTAを提案する。
VISTAは、視覚的および触覚的な観察を球面トークンに投影し、置換同変球面融合により触覚接触キューを視覚的球面方向に注入し、終端エフェクタ配向を用いて融合調和表現を回転させる。
結果の表現条件は、空間的に一貫した行動を予測するための同変拡散ポリシーである。
シミュレーションと実世界のロボット環境での大規模な実験により、VISTAは強力なビゾタクティル模倣学習ベースラインよりもデータ効率を大幅に向上することが示された。
プロジェクトウェブサイト:https://vista-paper.github.io/
関連論文リスト
- VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation [10.246144615395378]
VISTA-Policyは視覚変形場(VDF)を利用した模倣学習パラダイムである。
論文 参考訳(メタデータ) (2026-08-26T14:44:29Z) - Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning [45.2217589644315]
PointGoalナビゲーションにおける視覚表現学習のためのセンサ誘導適応型コントラスト学習フレームワークを提案する。
トレーニング中、特権付きLiDARセンシングは、幾何学的類似度メトリックと適応温度スケーリングを通じて、対照的な目標を導出する。
得られたエンコーダは、独立して事前訓練され、凍結され、強化学習のバックボーンとして使用される。
論文 参考訳(メタデータ) (2026-06-03T23:15:50Z) - Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Representation [51.463992799813816]
コンタクトリッチな操作における主要なボトルネックは、現実世界のデータ収集の難しさである。
物理原理に基づく効果的な触覚表現であるCenter-of-Pressureを紹介する。
我々は2つのブラインドで困難なコンタクトリッチな操作タスクについてCoPを評価する。
論文 参考訳(メタデータ) (2026-05-27T17:59:02Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning [52.86018040861575]
本稿では,単一のネットワークに視覚計画と反応力制御を統合した,一貫したエンドツーエンドの視覚力拡散政策を提案する。
本稿では,非同期な視覚と力のトークンを同時に処理するための因果的注意力を利用した構造的スローフォールストラーニングを紹介する。
コンタクトリッチタスクの実験では、ImplicitRDPは視覚のみのベースラインと階層的なベースラインの両方で著しく優れていた。
論文 参考訳(メタデータ) (2025-12-11T18:59:46Z) - Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation [58.95799126311524]
人間は視覚と触覚を使って、外的変化に対する迅速な応答や接触力の適応制御のような非常に反応性の高い能力で、コンタクトリッチなタスクを達成できる。
既存の視覚模倣学習アプローチは、複雑な振る舞いをモデル化するためにアクションチャンキングに依存している。
本稿では,Augmented Realityを通じてリアルタイム触覚フィードバックを提供する,低コスト遠隔操作システムであるTactARを紹介する。
論文 参考訳(メタデータ) (2025-03-04T18:58:21Z) - Multimodal and Force-Matched Imitation Learning with a See-Through Visuotactile Sensor [14.492202828369127]
我々は、模倣学習(IL)の枠組みの中でマルチモーダル・ビゾタクタクタブル・センサを活用して、コンタクトリッチなタスクを実行する。
本稿では,IL改善のための補完手法として,触覚力マッチングと学習モード切替という2つのアルゴリズム的貢献を紹介する。
以上の結果から, 力の一致が平均政策成功率62.5%, ビズオタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタク
論文 参考訳(メタデータ) (2023-11-02T14:02:42Z) - Enhancing Deformable Local Features by Jointly Learning to Detect and
Describe Keypoints [8.390939268280235]
局所特徴抽出は、画像マッチングや検索といった重要なタスクに対処するためのコンピュータビジョンにおける標準的なアプローチである。
鍵点を共同で検出・記述する新しい変形認識ネットワークであるDALFを提案する。
提案手法は、変形可能なオブジェクト検索と、非剛性な3次元表面登録という、2つの実世界のアプリケーションの性能を向上させる。
論文 参考訳(メタデータ) (2023-04-02T18:01:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。