論文の概要: AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors
- arxiv url: http://arxiv.org/abs/2502.12191v3
- Date: Tue, 01 Apr 2025 08:17:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-04-02 16:16:39.988564
- Title: AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors
- Title(参考訳): AnyTouch: 複数のビンスオ触覚センサを用いた静的動的統一表現の学習
- Abstract要約: Visuo-Tactileセンサーは、人間の触覚をエミュレートし、ロボットが物体を理解して操作できるようにする。
そこで本研究では,4種類のビジュオ触覚センサを用いたマルチモーダル触覚マルチセンサデータセットであるTacQuadを紹介する。
マルチレベル構造を持つ静的動的マルチセンサ表現学習フレームワークであるAnyTouchを提案する。
- 参考スコア(独自算出の注目度): 11.506370451126378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visuo-tactile sensors aim to emulate human tactile perception, enabling robots to precisely understand and manipulate objects. Over time, numerous meticulously designed visuo-tactile sensors have been integrated into robotic systems, aiding in completing various tasks. However, the distinct data characteristics of these low-standardized visuo-tactile sensors hinder the establishment of a powerful tactile perception system. We consider that the key to addressing this issue lies in learning unified multi-sensor representations, thereby integrating the sensors and promoting tactile knowledge transfer between them. To achieve unified representation of this nature, we introduce TacQuad, an aligned multi-modal multi-sensor tactile dataset from four different visuo-tactile sensors, which enables the explicit integration of various sensors. Recognizing that humans perceive the physical environment by acquiring diverse tactile information such as texture and pressure changes, we further propose to learn unified multi-sensor representations from both static and dynamic perspectives. By integrating tactile images and videos, we present AnyTouch, a unified static-dynamic multi-sensor representation learning framework with a multi-level structure, aimed at both enhancing comprehensive perceptual abilities and enabling effective cross-sensor transfer. This multi-level architecture captures pixel-level details from tactile data via masked modeling and enhances perception and transferability by learning semantic-level sensor-agnostic features through multi-modal alignment and cross-sensor matching. We provide a comprehensive analysis of multi-sensor transferability, and validate our method on various datasets and in the real-world pouring task. Experimental results show that our method outperforms existing methods, exhibits outstanding static and dynamic perception capabilities across various sensors.
- Abstract(参考訳): Visuo-Tactileセンサーは、人間の触覚をエミュレートし、ロボットがオブジェクトを正確に理解し、操作できるようにする。
長年にわたり、多くの精密に設計された粘性触覚センサーがロボットシステムに統合され、様々なタスクを完了させた。
しかし、これらの低規格のビジュオ触覚センサの異なるデータ特性は、強力な触覚認識システムの構築を妨げる。
この問題に対処する鍵は、統合されたマルチセンサー表現を学習することであり、それによってセンサーを統合し、それらの間の触覚的知識伝達を促進することであると考えている。
この性質の統一的な表現を実現するために,4つの異なるビジュオ触覚センサから協調したマルチモーダル・マルチモーダル触覚データセットであるTacQuadを導入し,各種センサの明示的な統合を実現する。
テクスチャや圧力変化などの多様な触覚情報を取得し,人間が物理的環境を知覚していることを認識し,静的・動的両面から統一されたマルチセンサー表現を学習することを提案する。
触覚画像とビデオを統合することで、AnyTouchは、総合的な知覚能力の向上と効果的なクロスセンサー転送の実現を目的とした、マルチレベル構造を備えた、静的な動的マルチセンサー表現学習フレームワークである。
このマルチレベルアーキテクチャは、マスク付きモデリングによる触覚データからの画素レベルの詳細をキャプチャし、マルチモーダルアライメントとクロスセンサーマッチングを通じてセマンティックレベルのセンサ非依存の特徴を学習することにより、知覚と伝達性を向上させる。
マルチセンサの転送可能性に関する総合的な分析を行い,本手法を様々なデータセットや実世界の注水タスクで検証する。
実験の結果,本手法は既存の手法よりも優れており,様々なセンサにまたがる優れた静的・動的知覚能力を示すことがわかった。
関連論文リスト
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion [60.79507611737292]
人間は視覚知覚と触覚フィードバックをシームレスに統合することで、安定的で適応的な把握を実現する。
既存のロボットグルーピングアプローチは、視覚入力と接触後の触覚誘導適応機構の欠如に依存している。
本稿では, 把握生成, 実現可能性予測, 適応的改善を統合した統合型ビジュオタクティル・フュージョン・グリーティング・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T16:29:11Z) - VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios [7.9567869558684094]
VQ-Touchは、クロスセンサーとマルチシナリオアプリケーションの両方をサポートする触覚生成フレームワークである。
データから複雑な変形やテクスチャの特徴を効率的に抽出するために,DM-VQGANを提案する。
本稿では,画像やラベルなどのマルチモーダル生成タスクをサポートする統一された条件付けインタフェースを備えた離散拡散デコーダを提案する。
論文 参考訳(メタデータ) (2026-07-16T08:53:41Z) - TactX: Learning Shared Tactile Representations Across Diverse Sensors [18.127088232068456]
本稿では,センサ間の触覚表現を伝達可能なフレームワークであるTactXを提案する。
TactXは、対の接触データに基づいて訓練されたモダリティ固有のエンコーダを通して、異質な触覚観測を共有潜在空間にマッピングする。
実験によると、TactXはオブジェクトレベルの接触情報を保存しながら、センサー間で触覚表現を調整している。
論文 参考訳(メタデータ) (2026-06-30T07:09:40Z) - Multi-Resolution Tactile Imitation Learning for Contact-Rich Robotic Manipulation [22.015203192700586]
異なる時間分解能で動作する複数の触覚センサを利用する表現フレームワークMiTaSを提案する。
MiTaSの平均成功率は80%であり、視覚のみ(31と視覚触覚(54のベースラインではタスクを確実に解決できない)である。
詳細なセンサ読み取りと注意分析により、タスクの実行を通して異なるセンサーの重要性が明らかになる。
論文 参考訳(メタデータ) (2026-06-04T15:23:03Z) - UniForce: A Unified Latent Force Model for Robot Manipulation with Diverse Tactile Sensors [51.88112610411651]
そこで本研究では,多様な触覚センサにまたがる共用潜在力空間を学習する,新しい統合された触覚表現学習フレームワークを提案する。
UniForceは、逆ダイナミクス(image-to-force)とフォワードダイナミクス(force-to-image)を共同モデリングすることで、クロスセンサー領域シフトを低減する
高価な外部力/トルクセンサ(F/T)への依存を避けるため,静的平衡を利用して直接センサ・オブジェクト・センサ・インタラクションを介して力対効果データを収集する。
論文 参考訳(メタデータ) (2026-02-01T11:03:01Z) - Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities [19.45726946555448]
触覚は視覚と言語に豊かで相補的な情報を提供し、ロボットはきめ細かい物体の性質を知覚することができる。
既存の手法では、触覚、言語、視覚のモダリティ間の中間的コミュニケーションを完全に統合することができない。
TLV-CoReは,CLIPをベースとした触覚・言語・視覚協調表現学習手法である。
論文 参考訳(メタデータ) (2025-11-14T17:34:20Z) - TwinTac: A Wide-Range, Highly Sensitive Tactile Sensor with Real-to-Sim Digital Twin Sensor Model [4.668679765548824]
我々は、物理的な触覚センサーとデジタルツインモデルを組み合わせたシステムであるTwinTacを紹介する。
ハードウェアセンサーは高感度で広い測定範囲に設計されている。
デジタルツインセンサによって生成されたシミュレーションデータにより,実世界のデータを効果的に増強し,精度を向上できることを示す。
論文 参考訳(メタデータ) (2025-09-12T08:51:28Z) - SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing Images [17.304106221330414]
最近のディープラーニングモデルは、単一のセンサーや固定された組み合わせに特化していることが多い。
SMARTIESは、センサ依存/依存の取り組みを持ち上げる汎用的で汎用的な基礎モデルである。
多様なセンサーにまたがる単一タスクとマルチモーダルタスクにおいて、SMARTIESはセンサー固有の事前訓練に依存する以前のモデルより優れている。
論文 参考訳(メタデータ) (2025-06-24T12:51:39Z) - Sensor-Invariant Tactile Representation [11.153753622913843]
高解像度触覚センサーは、知覚の具体化やロボット操作に欠かせないものとなっている。
この分野における重要な課題は、設計と製造のバリエーションによるセンサー間の伝達性の欠如である。
本稿では,光触覚センサ間のゼロショット転送を可能にする,SITR(Sensor-Invariant Tactile Representations)の抽出手法を提案する。
論文 参考訳(メタデータ) (2025-02-27T00:12:50Z) - MSSIDD: A Benchmark for Multi-Sensor Denoising [55.41612200877861]
我々は,マルチセンサSIDDデータセットという新しいベンチマークを導入する。これは,認知モデルのセンサ伝達性を評価するために設計された,最初の生ドメインデータセットである。
そこで本研究では,センサに不変な特徴を認知モデルで学習することのできるセンサ一貫性トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-18T13:32:59Z) - ACROSS: A Deformation-Based Cross-Modal Representation for Robotic Tactile Perception [1.5566524830295307]
ACROSSは、センサーの変形情報を利用して触覚センサ間でデータを翻訳するフレームワークである。
我々は、低次元の触覚表現から高次元の触覚表現への移行という最も難しい問題へのアプローチを実証する。
論文 参考訳(メタデータ) (2024-11-13T11:29:14Z) - Controllable Visual-Tactile Synthesis [28.03469909285511]
一つのスケッチから視覚と触覚の両方の出力を合成する条件生成モデルを開発した。
次に,電気接着型触覚デバイスに高品質な視覚・触覚出力を描画するパイプラインを導入する。
論文 参考訳(メタデータ) (2023-05-04T17:59:51Z) - Tactile-Filter: Interactive Tactile Perception for Part Mating [54.46221808805662]
人間は触覚と触覚に頼っている。
視覚ベースの触覚センサーは、様々なロボット認識や制御タスクに広く利用されている。
本稿では,視覚に基づく触覚センサを用いた対話的知覚手法を提案する。
論文 参考訳(メタデータ) (2023-03-10T16:27:37Z) - Learning to Detect Slip with Barometric Tactile Sensors and a Temporal
Convolutional Neural Network [7.346580429118843]
本研究では,バロメトリック・触覚センサを用いたスリップ検出手法を提案する。
我々は、スリップを検出するために時間畳み込みニューラルネットワークを訓練し、高い検出精度を実現する。
データ駆動学習と組み合わせたバロメトリック触覚センシング技術は,スリップ補償などの操作作業に適している,と我々は主張する。
論文 参考訳(メタデータ) (2022-02-19T08:21:56Z) - Dynamic Modeling of Hand-Object Interactions via Tactile Sensing [133.52375730875696]
本研究では,高分解能な触覚グローブを用いて,多種多様な物体に対して4種類のインタラクティブな動作を行う。
我々は,クロスモーダル学習フレームワーク上にモデルを構築し,視覚処理パイプラインを用いてラベルを生成し,触覚モデルを監督する。
この研究は、高密度触覚センシングによる手動物体相互作用における動的モデリングの一歩を踏み出す。
論文 参考訳(メタデータ) (2021-09-09T16:04:14Z) - Elastic Tactile Simulation Towards Tactile-Visual Perception [58.44106915440858]
触覚シミュレーションのための粒子の弾性相互作用(EIP)を提案する。
EIPは、触覚センサを協調粒子群としてモデル化し、接触時の粒子の変形を制御するために弾性特性を適用した。
さらに,触覚データと視覚画像間の情報融合を可能にする触覚知覚ネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-11T03:49:59Z) - Under Pressure: Learning to Detect Slip with Barometric Tactile Sensors [7.35805050004643]
本稿では,バロメトリック触覚センサを用いたスリップ検出法を提案する。
我々は91%以上のスリップ検出精度を達成することができる。
バロメトリック触覚センシング技術とデータ駆動学習の組み合わせは、多くの複雑な操作タスクに適しています。
論文 参考訳(メタデータ) (2021-03-24T19:29:03Z) - Semantics-aware Adaptive Knowledge Distillation for Sensor-to-Vision
Action Recognition [131.6328804788164]
本稿では,視覚・センサ・モダリティ(動画)における行動認識を強化するためのフレームワーク,Semantics-Aware Adaptive Knowledge Distillation Networks (SAKDN)を提案する。
SAKDNは複数のウェアラブルセンサーを教師のモダリティとして使用し、RGB動画を学生のモダリティとして使用している。
論文 参考訳(メタデータ) (2020-09-01T03:38:31Z) - OmniTact: A Multi-Directional High Resolution Touch Sensor [109.28703530853542]
既存の触覚センサーは、平らで、感度が小さいか、低解像度の信号のみを提供する。
我々は,多方向高解像度触覚センサOmniTactを紹介する。
我々は,ロボット制御の課題に対して,OmniTactの能力を評価する。
論文 参考訳(メタデータ) (2020-03-16T01:31:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。