論文の概要: Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.14609v1
- Date: Thu, 16 Jul 2026 06:12:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.009766
- Title: Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation
- Title(参考訳): コンタクトリッチロボットマニピュレーションのための表現対応触覚接地
- Abstract要約: 触覚をアクションによって引き起こされる接触のダイナミクスの監視に変えるため、将来の予測はタッチを使用するための有望な方法である。
我々はこれを表現アライメント問題として研究する。
この観察により、我々は軽量な潜伏触覚予測器を導入した。
- 参考スコア(独自算出の注目度): 33.650798630141594
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Tactile-enhanced vision-language-action (VLA) policies have been introduced for contact-rich manipulation, where critical interaction states are often hidden from vision. Future tactile prediction is a promising way to use touch because it turns tactile outcomes into supervision for action-induced contact dynamics. Yet VLA policies contain representations with different roles, from perceptual encoding to motor prediction, making it unclear where this supervision should be applied. We study this as a representation-alignment problem. Through a linear probe analysis, we find that future tactile states are most predictable from intermediate action-expert features, rather than from vision-language features or final action states. Motivated by this observation, we introduce a lightweight Latent Tactile Predictor (LTP), which predicts compact future tactile embeddings from the identified intermediate representation. By avoiding direct prediction of noisy raw tactile signals, LTP provides an action-outcome grounding signal that aligns intermediate action representations with future contact consequences. Experiments on real-world contact-rich manipulation tasks show that representation-aligned tactile grounding outperforms less aligned or multi-interface tactile prediction, highlighting the importance of where tactile supervision is applied.
- Abstract(参考訳): 触覚強化視覚言語反応(VLA)ポリシーは、しばしば視覚から重要な相互作用状態が隠蔽されるコンタクトリッチな操作のために導入された。
将来の触覚予測は、触覚の結果をアクションによって引き起こされる接触ダイナミクスの監視に変換するため、タッチを使用するための有望な方法である。
しかし、VLAポリシーには、知覚的エンコーディングから運動予測まで、異なる役割を持つ表現が含まれており、この監督をどこに適用すべきかははっきりしない。
我々はこれを表現アライメント問題として研究する。
線形プローブ解析により、将来の触覚状態は視覚言語の特徴や最終的な動作状態からではなく、中間的な行動経験的特徴から最も予測可能であることがわかった。
そこで本研究では,この中間表現から,コンパクトな将来の触覚埋め込みを予測する軽量な潜時触覚予測器 (LTP) を提案する。
ノイズの多い生の触覚信号の直接予測を避けることで、LCPは、中間動作表現と将来の接触結果とを整合させるアクションアウトカムグラウンド信号を提供する。
実世界の接触に富んだ操作タスクの実験では、表象に整列した触覚接地は、整列や多面的な触覚予測よりも優れており、触覚の監督が適用される場所の重要性を強調している。
関連論文リスト
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion [60.79507611737292]
人間は視覚知覚と触覚フィードバックをシームレスに統合することで、安定的で適応的な把握を実現する。
既存のロボットグルーピングアプローチは、視覚入力と接触後の触覚誘導適応機構の欠如に依存している。
本稿では, 把握生成, 実現可能性予測, 適応的改善を統合した統合型ビジュオタクティル・フュージョン・グリーティング・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T16:29:11Z) - τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation [25.354845550739302]
ResTacVLAはスパース触覚信号を密度の高い高値情報ゲインに変換する。
我々は、視覚的事前の不確実性を利用して、適応的に触覚統合をゲートする。
その結果、ResTacVLAは、多様なコンタクトリッチな操作タスクにおいて、すべてのベースラインを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-07-03T14:42:30Z) - VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation [22.0330577788623]
コンタクトリッチな操作には、局所的な変形、圧力、滑り、摩擦に反応するポリシーが必要である。
既存の視覚触覚ポリシーは通常、触覚観察を直接行動予測に供給する。
本稿では,未来の視覚予測,触覚変形予測,行動予測を共同で学習する視覚触覚世界行動モデルであるVT-WAMを紹介する。
論文 参考訳(メタデータ) (2026-07-02T17:58:36Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation [74.87716678195099]
光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
本研究では,触覚を触覚で認識し,触覚を触覚で表現する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T08:20:18Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding [5.936373185672394]
Contact-Grounded Policy (CGP) は、実際のロボット状態と触覚フィードバックの複合軌跡を予測することで、多点接触を根拠とするビゾタクティルポリシーである。
CGPは, (i) 圧縮潜在空間における将来のロボットの状態と触覚フィードバックを予測する条件拡散モデル, (ii) 学習された接触一貫性マッピングの2つのコンポーネントから構成される。
指先触覚センサDgit360を用いた4本指のAllegro V5手と,高密度全手触覚アレイを用いた5本指のTesollo DG-5F手を用いてCGPを評価した。
論文 参考訳(メタデータ) (2026-03-05T21:22:49Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z) - Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation [14.221542785249524]
本稿では,VLAモデルを接点物理学の基盤として,未来感を学習するフレームワークであるDreamTacVLAを紹介する。
我々のモデルは、高解像度の触覚画像がマイクロビジョン入力として機能する階層的認識方式を採用している。
より詳細な接触力学の理解を深めるために,将来的な触覚信号を予測する触覚世界モデルを用いてシステムを微調整する。
論文 参考訳(メタデータ) (2025-12-29T21:06:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。