論文の概要: DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
- arxiv url: http://arxiv.org/abs/2609.09119v1
- Date: Tue, 08 Sep 2026 17:47:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.708698
- Title: DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
- Title(参考訳): DeCAL: 接触認識型遅延共画像による身体周囲の脱軸視-言語-反応モデルを目指して
- Abstract要約: 有害な操作は、物理的世界との接触豊かできめ細かな相互作用を伴う。
本稿では,コンタクトリッチな操作のための理解,想像,行動生成を統一した視覚言語行動モデルであるDeCALを提案する。
- 参考スコア(独自算出の注目度): 39.716584408571265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dexterous manipulation involves contact-rich and fine-grained interactions with the physical world, posing significant challenges for existing vision-language-action (VLA) models due to severe visual occlusions and complex contact dynamics. While recent works have incorporated tactile sensing into robotic manipulation, most approaches still rely on homogeneous multimodal fusion, lacking adaptive tactile integration and explicit modeling of physical dynamics. In this work, we present DeCAL, a physically-grounded dexterous vision-language-action model that unifies understanding, imagination and action generation for contact-rich dexterous manipulation. Built upon a Mixture-of-Transformers (MoT) architecture, DeCAL leverages specialized experts for each capability while enabling efficient information flow among them. To effectively leverage tactile information, we introduce Adaptive Visuo-Tactile Fusion that dynamically regulates tactile interactions via a contact-aware gating strategy. Furthermore, we propose Visuo-Tactile Latent Co-Imagination to jointly model visual and tactile dynamics, equipping the policy with implicit physical world knowledge. Experimental results show that DeCAL consistently achieves state-of-the-art performance across all tasks, attaining a 71% average success rate and an 83.4% progress success rate, while also demonstrating strong generalization to unseen scenarios. The website is available at https://aureleopku.github.io/DeCAL.
- Abstract(参考訳): 有害な操作は、物理的な世界との接触が豊富できめ細かな相互作用を伴い、視覚的閉塞と複雑な接触ダイナミクスのために既存の視覚言語アクション(VLA)モデルに重大な課題を提起する。
最近の研究は触覚センシングをロボット操作に取り入れているが、ほとんどのアプローチは相同的な多モード融合に依存しており、適応的な触覚統合や物理力学の明示的なモデリングは欠如している。
そこで本研究では,コンタクトリッチなデクスタラス操作のための理解,想像,行動生成を統一する,物理的に座屈したデクスタラス視覚言語行動モデルであるDeCALを提案する。
Mixture-of-Transformers (MoT)アーキテクチャに基づいて構築されたDeCALは、各機能に専門的な専門家を活用しながら、それらの間の効率的な情報フローを実現する。
触覚情報を効果的に活用するために,接触認識ゲーティング戦略を用いて触覚インタラクションを動的に制御するAdaptive Visuo-Tactile Fusionを導入する。
さらに,視覚と触覚のダイナミックスを共同でモデル化し,暗黙の物理世界知識を取り入れたViuso-Tactile Latent Co-Imaginationを提案する。
実験結果から、DeCALは、すべてのタスクにおける最先端のパフォーマンスを一貫して達成し、平均成功率71%、成功率83.4%を達成し、また、目に見えないシナリオに対する強力な一般化を示した。
ウェブサイトはhttps://aureleopku.github.io/DeCALで公開されている。
関連論文リスト
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion [60.79507611737292]
人間は視覚知覚と触覚フィードバックをシームレスに統合することで、安定的で適応的な把握を実現する。
既存のロボットグルーピングアプローチは、視覚入力と接触後の触覚誘導適応機構の欠如に依存している。
本稿では, 把握生成, 実現可能性予測, 適応的改善を統合した統合型ビジュオタクティル・フュージョン・グリーティング・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T16:29:11Z) - τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training [79.94818813802682]
TACOは触覚を意識したワールドモデル駆動型フレームワークで,コンタクトリッチな操作において,スケーラブルなVLAポストトレーニングを実現する。
TACOは、触覚矯正をVLA後トレーニングに組み込むため、知識を取り入れた触覚適応と有利な条件のトレーニングを組み合わせる。
論文 参考訳(メタデータ) (2026-07-03T00:23:30Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Tactile Modality Fusion for Vision-Language-Action Models [22.788833830429766]
本稿では,視覚触覚信号と視覚言語アクション(VLA)モデルを統合する軽量なモーダルフュージョンアプローチであるTacFiLMを提案する。
その結果, 成功率, 直接挿入性能, 完了時間, 負荷安定性の両面において一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-03-15T20:57:51Z) - Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation [14.221542785249524]
本稿では,VLAモデルを接点物理学の基盤として,未来感を学習するフレームワークであるDreamTacVLAを紹介する。
我々のモデルは、高解像度の触覚画像がマイクロビジョン入力として機能する階層的認識方式を採用している。
より詳細な接触力学の理解を深めるために,将来的な触覚信号を予測する触覚世界モデルを用いてシステムを微調整する。
論文 参考訳(メタデータ) (2025-12-29T21:06:33Z) - Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset [113.25650486482762]
4000時間以上の対面インタラクション映像の大規模な収集であるSeamless Interactionデータセットを紹介した。
このデータセットは、ダイドの具体的ダイナミクスを理解するAIテクノロジの開発を可能にする。
そこで我々は,このデータセットを用いて,人間の発話に適応した動作ジェスチャーと表情を生成するモデル群を開発した。
論文 参考訳(メタデータ) (2025-06-27T18:09:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。