論文の概要: Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation
- arxiv url: http://arxiv.org/abs/2606.29941v1
- Date: Mon, 29 Jun 2026 08:20:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.124516
- Title: Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation
- Title(参考訳): 運動から触覚を見る: 触覚と触覚の相関を考慮した統一されたモダリティ・アウェア・ビジュオ触覚政策
- Abstract要約: 光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
本研究では,触覚を触覚で認識し,触覚を触覚で表現する手法を提案する。
- 参考スコア(独自算出の注目度): 74.87716678195099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visuo-Tactile policies leveraging optical tactile sensors have shown great promise in contact-rich manipulation. These sensors achieve high spatial resolution and multi-dimensional force sensing by utilizing an internal camera to monitor the deformation of their elastic gel surface, thereby indirectly inferring tactile cues. Despite their advantages, extracting fine-grained contact states necessary for contact-rich manipulation remains an open challenge. Existing methods typically use either raw images or cumulative motion fields to represent tactile cues. However, both are prone to perception ambiguity. Raw tactile images mainly capture appearance changes, while cumulative motion fields only reflect the aggregate gel deformation. Consequently, distinct fine-grained contact states can exhibit highly similar patterns, making it difficult to explicitly distinguish subtle contact variations. To address this issue, we explore the dynamic priors of tactile motion and discover that the correlation between transient and cumulative motion can explicitly distinguish fine-grained contact states. Based on this insight, we propose a motion-aware tactile representation to facilitate contact-rich manipulation. Beyond tactile representation, effective fusion of tactile and visual modalities is also critical. Most existing fusion methods either directly concatenate features from each modality or train modality-specific networks separately and fuse their outputs. However, these strategies struggle to simultaneously model cross-modal interactions and preserve modality-specific characteristics. In this work, we take advantage of the Mixture-of-Transformers architecture and propose a unified modality-aware visuo-tactile policy that captures cross-modal complementarity while maintaining modality-specific properties.
- Abstract(参考訳): 光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらのセンサは、内部カメラを利用して、弾性ゲル表面の変形を監視し、触覚的手がかりを間接的に推測することにより、高空間分解能及び多次元力センシングを実現する。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
既存の方法は、通常、触覚の手がかりを表すために生画像または累積運動場を使用する。
しかし、両者は曖昧さを感じる傾向にある。
触覚画像は主に外観変化を捉え、累積運動場はゲル変形のみを反映する。
その結果、微粒な接触状態は極めて類似したパターンを示すことができ、微粒な接触変化をはっきりと区別することは困難である。
この問題に対処するため,触覚運動の動的先行を探索し,過渡運動と累積運動の相関がきめ細かな接触状態を明確に識別できることを見出した。
この知見に基づいて,接触リッチな操作を容易にする動き認識型触覚表現を提案する。
触覚表現以外にも、触覚と視覚の効果的な融合も重要である。
既存の融合法の多くは、各モダリティから直接特徴を結合するか、モダリティ固有のネットワークを個別に訓練し、出力を融合させる。
しかしながら、これらの戦略は、相互モーダル相互作用を同時にモデル化し、モダリティ固有の特性を維持するのに苦労する。
本研究では、Mixture-of-Transformersアーキテクチャを活用し、モダリティ固有の特性を維持しつつ、モダリティ間の相補性をキャプチャする統一的なモダリティ対応型ビズオ触覚ポリシーを提案する。
関連論文リスト
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion [60.79507611737292]
人間は視覚知覚と触覚フィードバックをシームレスに統合することで、安定的で適応的な把握を実現する。
既存のロボットグルーピングアプローチは、視覚入力と接触後の触覚誘導適応機構の欠如に依存している。
本稿では, 把握生成, 実現可能性予測, 適応的改善を統合した統合型ビジュオタクティル・フュージョン・グリーティング・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T16:29:11Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z) - Multi-Modal Manipulation via Multi-Modal Policy Consensus [62.49978559936122]
本稿では,ロボット操作のための多様な感覚モダリティを統合するための新しいアプローチを提案する。
提案手法は,それぞれが単一の表現に特化している拡散モデルの集合にポリシーを分解する。
我々は、RLBenchにおけるシミュレーション操作タスクと、隠蔽対象のピック、手作業のスプーン再配向、パズル挿入といった実世界のタスクについて評価した。
論文 参考訳(メタデータ) (2025-09-27T19:43:04Z) - Touch in the Wild: Learning Fine-Grained Manipulation with a Portable Visuo-Tactile Gripper [7.618517580705364]
触覚センサーを内蔵した携帯型軽量グリップについて述べる。
視覚信号と触覚信号を統合するクロスモーダル表現学習フレームワークを提案する。
試験管挿入や管状流体移動などの細粒度タスクに対する本手法の有効性を検証した。
論文 参考訳(メタデータ) (2025-07-20T17:53:59Z) - AnyRotate: Gravity-Invariant In-Hand Object Rotation with Sim-to-Real Touch [9.606323817785114]
我々は,高密度のsim-to-realタッチを用いた重力不変多軸物体回転システムであるAnyRotateを提案する。
我々の定式化により、統一されたポリシーの訓練により、任意の回転軸に関する未知の物体を任意の方向で回転させることができる。
リッチな多指触覚センシングは不安定な把握を検知し、ポリシーの堅牢性を改善するリアクティブな振る舞いを提供する。
論文 参考訳(メタデータ) (2024-05-12T22:51:35Z) - Elastic Tactile Simulation Towards Tactile-Visual Perception [58.44106915440858]
触覚シミュレーションのための粒子の弾性相互作用(EIP)を提案する。
EIPは、触覚センサを協調粒子群としてモデル化し、接触時の粒子の変形を制御するために弾性特性を適用した。
さらに,触覚データと視覚画像間の情報融合を可能にする触覚知覚ネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-11T03:49:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。