論文の概要: TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2607.07287v1
- Date: Wed, 08 Jul 2026 11:28:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.360559
- Title: TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
- Title(参考訳): TouchWorld: ディクサラスマニピュレーションのための予測的かつリアクティブな触覚基礎モデル
- Abstract要約: 日常環境における有害な操作には、予測と反応の両方が必要である。
我々は,デクスタラス操作のための予測・反応型触覚基礎モデルであるTouchWorldを紹介する。
- 参考スコア(独自算出の注目度): 14.063238637690597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dexterous manipulation in everyday environments requires both anticipation and reaction: a robot must predict how contact should evolve while rapidly correcting local errors caused by slip, misalignment, unstable grasping, or force mismatch. Vision and language provide semantic and geometric guidance, but they cannot reliably reveal hidden contact states such as force, slip, and contact stability. Although tactile sensing exposes these physical cues, most existing policies treat touch as a low-frequency observation stream within a monolithic action model, coupling slow task reasoning, action generation, and fast contact feedback in a single loop. We introduce TouchWorld, a predictive-and-reactive tactile foundation model for dexterous manipulation. TouchWorld uses a hierarchical policy that separates vision-language subtask planning, tactile world-model prediction, visuo-tactile goal-conditioned action generation, and high-frequency tactile residual refinement. A High-Level Planning Layer produces executable subtasks and predicts tactile subgoals; a Visuo-Tactile Goal-Conditioned Policy generates nominal action chunks; and a Tactile-Conditioned Refinement Policy performs online residual correction using recent tactile and proprioceptive feedback. By using touch as both a predictive contact reference and a fast feedback signal, TouchWorld preserves the semantic generalization of vision-language-action policies while improving local contact adaptation. Across six long-horizon and contact-rich dexterous manipulation tasks, TouchWorld achieves 65.0% success in the clean setting and 53.7% success under human perturbations, outperforming the strongest baseline by 15.7 and 18.5 percentage points, respectively.
- Abstract(参考訳): ロボットは、スリップ、ミスアライメント、不安定な把握、力のミスマッチによって生じる局所的なエラーを迅速に修正しながら、接触がどのように進化すべきかを予測しなければならない。
視覚と言語は意味的および幾何学的なガイダンスを提供するが、力、すべり、接触安定性などの隠れた接触状態を確実に明らかにすることはできない。
触覚センサーはこれらの物理的な手がかりを露呈するが、既存のほとんどのポリシーはタッチをモノリシックなアクションモデル内の低周波観測ストリームとして扱い、遅いタスク推論、アクション生成、高速な接触フィードバックを単一のループで結合する。
我々は,デクスタラス操作のための予測・反応型触覚基礎モデルであるTouchWorldを紹介する。
TouchWorldは、視覚言語によるサブタスク計画、触覚世界モデル予測、ビジュオ触覚目標条件付きアクション生成、高周波触覚残留改善を分離する階層的なポリシーを使用している。
高レベルプランニングレイヤは、実行可能なサブタスクを生成し、触覚サブゴールを予測し、Viuso-Tactile-Goal-Conditioned Policyは名目上のアクションチャンクを生成し、Tactile-Conditioned Refinement Policyは、最近の触覚および固有受容フィードバックを使用してオンラインの残留補正を行う。
TouchWorldは、タッチを予測的接触基準と迅速なフィードバック信号の両方として使用することにより、局所的な接触適応を改善しつつ、視覚言語対応ポリシーのセマンティックな一般化を保っている。
6つの長い水平と接触に富んだ操作タスクの中で、TouchWorldはクリーンな設定で65.0%成功し、人間の摂動で53.7%成功し、それぞれ15.7と18.5ポイントで最強のベースラインを上回っている。
関連論文リスト
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion [60.79507611737292]
人間は視覚知覚と触覚フィードバックをシームレスに統合することで、安定的で適応的な把握を実現する。
既存のロボットグルーピングアプローチは、視覚入力と接触後の触覚誘導適応機構の欠如に依存している。
本稿では, 把握生成, 実現可能性予測, 適応的改善を統合した統合型ビジュオタクティル・フュージョン・グリーティング・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T16:29:11Z) - ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction [42.34171808182058]
本稿では,コンタクトリッチなデクスタラス操作をサポートする視覚言語-アクションモデル(VLA)ReTouchを紹介する。
ReTouchは、触覚表現とクローズドループアクション生成の2つの主要なイノベーションの上に構築されている。
論文 参考訳(メタデータ) (2026-08-03T07:31:10Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - Inference-time Policy Steering via Vision and Touch [19.707194684285223]
推論時ステアリングは、実行前に候補動作を検証することにより、デプロイ中に事前訓練された生成ロボットポリシーを適用する。
両レベル最適化問題としてマルチモーダルガイダンスを定式化するビジュオ触覚推論時ステアリングフレームワークであるViTaLを紹介する。
ViTaLは基本方針を51%上回り、単調ステアリングを少なくとも33%上回り、単純マルチモーダル核融合を20%以上上回っている。
論文 参考訳(メタデータ) (2026-06-12T22:03:21Z) - TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation [50.608989079323784]
データと表現の両方の観点から,触覚コモンセンス推論をオープンワールドに拡張する触覚言語フレームワークであるTouchThinkerを提案する。
まず,Textbf415オブジェクト, textbf8シナリオ, textbf7センサタイプをカバーする,100万規模のマルチソース触覚推論データセットであるTouchThinker-1Mを構築した。
そこで本研究では,触覚表現効率を向上し,効率的な推論を可能にする行動認識モデリング機構を提案する。
論文 参考訳(メタデータ) (2026-06-10T03:58:32Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - Learning Tactile-Aware Quadrupedal Loco-Manipulation Policies [33.25194785586049]
階層構造を有する触覚対応ロコ操作ポリシー学習パイプラインを提案する。
まず、実世界の人間のデモを活用して、触覚条件付きビゾタクタクタブルな高レベルポリシーを訓練する。
第2に,触覚を意識した全身制御政策を学習するために,シミュレーションにおいて大規模強化学習を行う。
論文 参考訳(メタデータ) (2026-04-29T21:46:58Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding [5.936373185672394]
Contact-Grounded Policy (CGP) は、実際のロボット状態と触覚フィードバックの複合軌跡を予測することで、多点接触を根拠とするビゾタクティルポリシーである。
CGPは, (i) 圧縮潜在空間における将来のロボットの状態と触覚フィードバックを予測する条件拡散モデル, (ii) 学習された接触一貫性マッピングの2つのコンポーネントから構成される。
指先触覚センサDgit360を用いた4本指のAllegro V5手と,高密度全手触覚アレイを用いた5本指のTesollo DG-5F手を用いてCGPを評価した。
論文 参考訳(メタデータ) (2026-03-05T21:22:49Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。