論文の概要: FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation
- arxiv url: http://arxiv.org/abs/2607.20683v1
- Date: Wed, 22 Jul 2026 19:32:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.207982
- Title: FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation
- Title(参考訳): FELT: Visuo-Tactile マニピュレーションのための視覚から触覚信号を生成する
- Authors: Zinan Li, Yiyang Ling, Yuming Gu, Binghao Huang, Chenhao Liang, Sharfin Islam, Hisham Bedri, John Chirikjian, Yunzhu Li, Stefanos Nikolaidis, Daniel Seita,
- Abstract要約: RGB観測から指ごとの圧力触覚画像を合成する学習フレームワークであるFeature-Extracted Latent Tactile (FELT)を提案する。
FELTは、大きな凍結されたビジュアルエンコーダと軽量なクエリデコーダを使用して、単一のフィードフォワードパスで触覚信号を予測する。
4つの接触リッチな操作タスクの実験は、生成した触覚画像と潜伏した触覚特徴の両方がポリシーの成功を改善することを示した。
- 参考スコア(独自算出の注目度): 19.661583133282477
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The sense of touch is central to manipulation, especially when vision is occluded or ambiguous. Although combining vision and touch improves manipulation, learning robust visuo-tactile policies requires substantial tactile data. Such data remains scarcer than visual data, because tactile sensors are fragile, specialized, and hard to standardize. To address this, we present Feature-Extracted Latent Tactile (FELT), a learning-based framework that synthesizes per-finger pressure tactile images from RGB observations, reducing the need for tactile-equipped data collection. FELT uses a large frozen visual encoder and a lightweight query decoder to predict tactile signals in a single feed-forward pass. To respect the physical topology of dual-finger tactile sensors, FELT decodes the left and right tactile sensor panels through separate branches, capturing the asymmetric contact patterns during interactions such as wiping, insertion, and in-hand rotation. At inference time, FELT only requires RGB data, allowing us to augment existing vision-only data with tactile observations, either as generated tactile images or as latent tactile features. Experiments on four contact-rich manipulation tasks demonstrate that both generated tactile images and latent tactile features improve policy success over vision-only baselines, with latent feature requiring no real tactile sensor during policy training or deployment. Supplementary material is available on our anonymous website: https://felt-tactile.github.io/.
- Abstract(参考訳): 触覚は操作の中心であり、特に視覚が妨げられている場合や曖昧である場合である。
視覚とタッチの組み合わせは操作を改善するが、堅牢な視覚触覚ポリシーの学習にはかなりの触覚データが必要である。
触覚センサーは脆弱で、専門的で、標準化が難しい。
そこで本研究では,RGB観測から指ごとの圧力触覚画像を合成し,触覚情報収集の必要性を低減した,学習ベースのフレームワークであるFeature-Extracted Latent Tactile(FELT)を提案する。
FELTは、大きな凍結されたビジュアルエンコーダと軽量なクエリデコーダを使用して、単一のフィードフォワードパスで触覚信号を予測する。
デュアルフィンガー触覚センサの物理的トポロジーを尊重するために、FELTは左右の触覚センサパネルを別々の枝でデコードし、ワイピング、挿入、手動回転などのインタラクション中に非対称な接触パターンをキャプチャする。
推測時には、FELTはRGBデータのみを必要とするため、既存の視覚のみのデータを触覚観測で拡張することができる。
4つのコンタクトリッチな操作タスクの実験では、生成した触覚画像と潜時触覚特徴の両方が、視力のみのベースラインよりもポリシーの成功を改善することを示した。
追加資料は当社の匿名ウェブサイトで入手できます。
関連論文リスト
- Imagining the Sense of Touch: Touch-Informed Manipulation via Imagined Tactile Representations [4.954401349140998]
本稿では,触覚を視覚やプロプレセプションから予測し,生成した信号を用いて操作ポリシーを導出する触覚想像フレームワークであるTacImagを紹介する。
6つのシミュレーションと4つの実世界の操作タスクでTacImagを評価した。
実世界の実験では、想像力場は接触感性タスクを平均44.4%改善する一方、触覚イメージはテクスチャ感性タスクを23.3%改善する。
論文 参考訳(メタデータ) (2026-07-02T04:27:11Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation [66.22092641373067]
FTP-1は、トランスファー可能な触覚操作能力を取得するために事前訓練された最初の一般基盤触覚ポリシーである。
画像、配列、状態ベースの信号を含む様々な触覚入力をサポートする。
プレトレーニング中に見られるセンサーを超える触覚スキルを学習する。
論文 参考訳(メタデータ) (2026-06-11T09:30:09Z) - TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation [50.608989079323784]
データと表現の両方の観点から,触覚コモンセンス推論をオープンワールドに拡張する触覚言語フレームワークであるTouchThinkerを提案する。
まず,Textbf415オブジェクト, textbf8シナリオ, textbf7センサタイプをカバーする,100万規模のマルチソース触覚推論データセットであるTouchThinker-1Mを構築した。
そこで本研究では,触覚表現効率を向上し,効率的な推論を可能にする行動認識モデリング機構を提案する。
論文 参考訳(メタデータ) (2026-06-10T03:58:32Z) - OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction [93.88239833545623]
OpenTouchは、最初のインザワイルドなエゴセントリックなフルハンド触覚データセットです。
触覚信号は,理解のためのコンパクトで強力なキューを提供する。
我々は,マルチモーダルな自我中心の知覚,具体的学習,接触に富むロボット操作の促進を目指す。
論文 参考訳(メタデータ) (2025-12-18T18:18:17Z) - RA-Touch: Retrieval-Augmented Touch Understanding with Enriched Visual Data [10.059624183053499]
視覚触覚は、テクスチャ、柔らかさ、剛性などの物体の触覚特性を理解することを目的としている。
我々は,触覚のセマンティクスに富んだ視覚データを活用することで,視触覚知覚を改善する検索拡張フレームワークであるRA-Touchを紹介する。
論文 参考訳(メタデータ) (2025-05-20T12:23:21Z) - Towards Generalization of Tactile Image Generation: Reference-Free Evaluation in a Leakage-Free Setting [25.355424080824996]
触覚は人間の知覚に重要であり、コンピュータビジョン、ロボティクス、マルチモーダル学習の応用を支えている。
触覚データは入手が困難でコストがかかることが多いため、合成触覚画像の生成は、実世界の測定を拡大するためのスケーラブルなソリューションを提供する。
一般的なデータセットにおける重なり合うトレーニングとテストサンプルは、パフォーマンス指標を増大させ、触覚モデルの真の一般化可能性を見極めることを実証する。
論文 参考訳(メタデータ) (2025-03-10T02:37:22Z) - Multimodal and Force-Matched Imitation Learning with a See-Through Visuotactile Sensor [14.492202828369127]
我々は、模倣学習(IL)の枠組みの中でマルチモーダル・ビゾタクタクタブル・センサを活用して、コンタクトリッチなタスクを実行する。
本稿では,IL改善のための補完手法として,触覚力マッチングと学習モード切替という2つのアルゴリズム的貢献を紹介する。
以上の結果から, 力の一致が平均政策成功率62.5%, ビズオタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタク
論文 参考訳(メタデータ) (2023-11-02T14:02:42Z) - Elastic Tactile Simulation Towards Tactile-Visual Perception [58.44106915440858]
触覚シミュレーションのための粒子の弾性相互作用(EIP)を提案する。
EIPは、触覚センサを協調粒子群としてモデル化し、接触時の粒子の変形を制御するために弾性特性を適用した。
さらに,触覚データと視覚画像間の情報融合を可能にする触覚知覚ネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-11T03:49:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。