論文の概要: VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2607.02503v1
- Date: Thu, 02 Jul 2026 17:58:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.962439
- Title: VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation
- Title(参考訳): VT-WAM:コンタクトリッチ操作のための視覚触覚世界行動モデル
- Authors: Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao,
- Abstract要約: コンタクトリッチな操作には、局所的な変形、圧力、滑り、摩擦に反応するポリシーが必要である。
既存の視覚触覚ポリシーは通常、触覚観察を直接行動予測に供給する。
本稿では,未来の視覚予測,触覚変形予測,行動予測を共同で学習する視覚触覚世界行動モデルであるVT-WAMを紹介する。
- 参考スコア(独自算出の注目度): 22.0330577788623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contact-rich manipulation requires policies to react to local deformation, pressure, slip, and friction, yet these cues are temporally sparse and often invisible in visual observations. Existing visual-tactile policies usually feed tactile observations directly into action prediction, but rarely model tactile deformation dynamics during action generation. In this paper, we introduce VT-WAM, a Visual-Tactile World Action Model that jointly learns future visual prediction, tactile deformation prediction, and action prediction within a unified flow matching framework. In particular, VT-WAM introduces (1) Asymmetric Mixture-of-Transformers (MoT) attention to bridge a first-frame visual anchor with temporal tactile dynamics, and (2) contact-gated Action-Visual-Tactile Attention Guidance (AVTAG) to encourage action queries to rely on tactile evidence during contact phases. Across six real-world contact-rich manipulation tasks, VT-WAM achieves a 71.67% average success rate, outperforming Fast-WAM by 26.67% and OmniVTLA by 35.84%. Ablations demonstrate that modeling tactile deformation dynamics and guiding contact-phase tactile attention are both important for contact-rich tasks. Project website: https://vt-wam.github.io/.
- Abstract(参考訳): コンタクトリッチな操作は局所的な変形、圧力、滑り、摩擦に反応するポリシーを必要とするが、これらの手段は時間的に疎く、視覚的な観察では見えないことが多い。
既存の視覚触覚ポリシーは、通常、触覚観察を直接アクション予測に供給するが、アクション生成中に触覚変形のダイナミクスをモデル化することは滅多にない。
本稿では,将来的な視覚的予測,触覚的変形予測,行動予測を統合フローマッチングフレームワーク内で共同で学習する視覚触覚世界行動モデルであるVT-WAMを紹介する。
特に、VT-WAMでは、(1)非対称混合変換器(MoT)の注意を時間的触覚力学で一フレームの視覚的アンカーを橋渡しし、(2)接触相における触覚的エビデンスに依存するアクションクエリーを促進するための接触ゲート型アクション・触覚注意誘導(AVTAG)を導入している。
VT-WAMは6つの実世界のコンタクトリッチな操作タスクの中で71.67%の平均的な成功率を達成し、Fast-WAMを26.67%、OmniVTLAを35.84%上回った。
アブレーションは, 触覚変形ダイナミクスのモデル化と接触相触覚注意の誘導が, 接触に富むタスクにおいて重要であることを示した。
プロジェクトウェブサイト:https://vt-wam.github.io/.com
関連論文リスト
- UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation [74.87716678195099]
光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
本研究では,触覚を触覚で認識し,触覚を触覚で表現する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T08:20:18Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation [40.81290792381617]
本研究では,統合された触覚・世界行動モデルであるDream-Tacを提案する。
具体的には、 (i) 触覚信号と (ii) 接触認識の注意バイアスを選択的に統合し、(i) 交差モーダル相互作用をよりよく制御するために、 (i) 接触ゲート型ビゾタクタクチル融合を導入する。
6つのコンタクトリッチな操作タスクの中で、ドリームタックは平均でアクション精度を31.7%改善し、統合された視覚的世界モデリングの有効性を実証した。
論文 参考訳(メタデータ) (2026-06-07T17:18:23Z) - VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation [14.094740703476903]
本稿では,物理相互作用力の高次元触覚観測を基盤としたTaF-VLAについて紹介する。
TaF-VLAポリシは、最先端の触覚と視覚のみのベースラインを、コンタクトリッチなタスクで大幅に上回る。
論文 参考訳(メタデータ) (2026-01-28T07:34:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。