論文の概要: UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models
- arxiv url: http://arxiv.org/abs/2606.31723v1
- Date: Tue, 30 Jun 2026 14:24:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.267427
- Title: UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models
- Title(参考訳): UniTacVLA:視覚言語行動モデルにおける統合触覚理解と予測
- Authors: Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan,
- Abstract要約: コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
- 参考スコア(独自算出の注目度): 32.87879913150572
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models have achieved strong performance in many robotic manipulation tasks, yet remain limited in contact-rich dexterous manipulation. To overcome this limitation, recent vision-tactile-language-action (VTLA) methods incorporate tactile sensing into VLA models to provide direct contact information. However, they typically treat tactile signals as passive auxiliary inputs, making it difficult to model tactile semantics and future physical interactions. To this end, we propose a unified tactile learning framework for contact-rich manipulation that models tactile signals as dynamic interaction cues for both contact understanding and prediction. Specifically, we construct a unified tactile latent space and jointly model current tactile states and future contact changes through tactile chain-of-thought reasoning and coarse-to-fine future tactile prediction, thereby forming a state-aware and dynamics-aware tactile prior. Based on this prior, we introduce a tactile-action mixed controller that combines real-time and predicted tactile feedback to refine low-frequency action chunks with high-frequency corrections. Real-world experiments on four categories of contact-rich tasks, including adjustment, insertion, wiping, and assembly, under both clean and externally perturbed settings, show that our method improves success rate, manipulation accuracy, and contact robustness over existing methods, demonstrating its effectiveness in dexterous physical interaction.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、多くのロボット操作タスクにおいて強力な性能を達成しているが、接触に富むデクスタラス操作には制限が残っている。
この制限を克服するため、最近の視覚触覚言語反応(VTLA)法では、触覚をVLAモデルに組み込んで直接接触情報を提供する。
しかし、通常、触覚信号は受動的補助入力として扱うため、触覚のセマンティクスや将来の物理的相互作用をモデル化することは困難である。
そこで本研究では,触覚信号を動的相互作用キューとしてモデル化し,接触理解と予測を両立させる,統合された触覚学習フレームワークを提案する。
具体的には、統合された触覚潜在空間を構築し、現在の触覚状態と将来の接触変化を、触覚連鎖推論と粗い未来の触覚予測によってモデル化し、状態認識および動的認識の触覚を前もって形成する。
これに基づいて,触覚フィードバックをリアルタイムと予測した触覚フィードバックを組み合わせて,低周波動作チャンクを高周波補正で洗練する触覚反応混合制御装置を提案する。
調整,挿入,拭き取り,組立の4つの分野における実世界の実験により,既存の方法よりも成功率,操作精度,接触堅牢性を向上し,不規則な物理的相互作用における有効性を実証した。
関連論文リスト
- Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding [5.936373185672394]
Contact-Grounded Policy (CGP) は、実際のロボット状態と触覚フィードバックの複合軌跡を予測することで、多点接触を根拠とするビゾタクティルポリシーである。
CGPは, (i) 圧縮潜在空間における将来のロボットの状態と触覚フィードバックを予測する条件拡散モデル, (ii) 学習された接触一貫性マッピングの2つのコンポーネントから構成される。
指先触覚センサDgit360を用いた4本指のAllegro V5手と,高密度全手触覚アレイを用いた5本指のTesollo DG-5F手を用いてCGPを評価した。
論文 参考訳(メタデータ) (2026-03-05T21:22:49Z) - Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation [14.221542785249524]
本稿では,VLAモデルを接点物理学の基盤として,未来感を学習するフレームワークであるDreamTacVLAを紹介する。
我々のモデルは、高解像度の触覚画像がマイクロビジョン入力として機能する階層的認識方式を採用している。
より詳細な接触力学の理解を深めるために,将来的な触覚信号を予測する触覚世界モデルを用いてシステムを微調整する。
論文 参考訳(メタデータ) (2025-12-29T21:06:33Z) - VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback [21.08021535027628]
VLA-Touchは、触覚センサを用いた汎用ロボットポリシーを強化するアプローチである。
提案手法では,(1)高レベルタスク計画のためのセマンティックな触覚フィードバックを提供する事前学習された触覚言語モデルを利用するパイプラインと,(2)コンタクトリッチな操作のための触覚信号を用いたVLA生成動作を洗練する拡散型コントローラの2つを導入している。
論文 参考訳(メタデータ) (2025-07-23T07:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。