論文の概要: CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2608.01102v1
- Date: Sun, 02 Aug 2026 09:04:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.083934
- Title: CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation
- Title(参考訳): CAAT:データ効率の良いコンタクトリッチマニピュレーションのための接触注意スケーリングと触覚マスキング
- Abstract要約: 接触に富んだ操作では、視覚的な観察は自由空間における動きを導くが、触覚的な観察は接触中に特に有益になる。
標準トランスフォーマーベースのvisuo-tactileポリシーは一般的にトークンの連結か学習可能なゲーティングに依存する。
本稿では,注意スケーリングと動的触覚マスキングにより,接触先行情報を明示的に組み込んだ軽量な接触認識フレームワークであるCAATを提案する。
- 参考スコア(独自算出の注目度): 10.252675409218057
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In contact-rich manipulation, visual observations primarily guide motion in free space, whereas tactile observations become particularly informative during contact. However, standard Transformer-based visuo-tactile policies typically rely on either token concatenation or learnable gating. These approaches lack explicit contact-aware priors, making it difficult to efficiently learn effective cross-modal representations from demonstrations. To address this limitation, we propose CAAT, a lightweight contact-aware framework that explicitly incorporates contact priors through attention scaling and dynamic tactile masking. Specifically, CAAT emphasizes visual information before contact and tactile information during contact. It also suppresses static background tokens by comparing the current tactile observation with a non-contact reference. CAAT can be integrated into commonly used Transformer-based policies without modifying their action decoders. In simulation, integrating CAAT with ACT improves the average success rate by 18.0 percentage points over direct visuo-tactile fusion and by 10.0 percentage points over gated fusion. In real-world experiments using a visuo-tactile UMI platform, CAAT achieves an average success rate of 60.0% across ACT, Diffusion Policy, and $π_0$, outperforming the strongest baseline by an average of 21.1 percentage points. These results demonstrate that explicit contact priors and dynamic tactile masking are effective in improving visuo-tactile policy learning and task performance of diverse policy architectures. https://mrjiangjm.github.io/caat/
- Abstract(参考訳): 接触に富んだ操作では、視覚的な観察は主に自由空間における動きを導くが、触覚的な観察は接触中に特に有益になる。
しかし、標準的なTransformerベースのvisuo-tactileポリシーは一般的にトークンの連結か学習可能なゲーティングのいずれかに依存している。
これらのアプローチには、明示的な接触認識の事前が欠如しており、デモから効果的なクロスモーダル表現を効率的に学習することは困難である。
この制限に対処するため,注意スケーリングと動的触覚マスキングにより,接触先行情報を明示的に組み込む軽量な接触認識フレームワークであるCAATを提案する。
特に、CAATは接触前の視覚情報と接触時の触覚情報を強調する。
また、現在の触覚観察を非接触参照と比較することにより、静的な背景トークンを抑制する。
CAATは、アクションデコーダを変更することなく、一般的に使用されるTransformerベースのポリシーに統合することができる。
シミュレーションでは、ACTとCAATを統合することにより、直接的ビジュオ触子核融合よりも平均成功率が18.0ポイント、ゲート核融合より10.0ポイント向上する。
仮想触覚UMIプラットフォームを用いた実世界の実験において、CAATはACT、拡散政策、π_0$の平均成功率を平均21.1ポイント上回る平均成功率を達成している。
これらの結果から,明示的な接触先行と動的触覚マスキングが,多様な政策アーキテクチャのビジュオ・触覚政策学習とタスクパフォーマンス向上に有効であることが示唆された。
https://mrjiangjm.github.io/caat/
関連論文リスト
- Visible Touch: Rendering Contact for Visuomotor Policies [5.457564982234203]
接触情報は、バイスモータポリシーの堅牢な操作に不可欠である。
現在のアプローチでは、特殊な触覚ハードウェア、別個の触覚エンコーダの追加、非イメージポリシーバックボーンへのコミットが必要となっている。
私たちはVisible Touchのこの洞察を、カスタムの低コストの磁気接触センサーと組み合わせて運用しています。
論文 参考訳(メタデータ) (2026-09-12T21:15:56Z) - VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation [22.0330577788623]
コンタクトリッチな操作には、局所的な変形、圧力、滑り、摩擦に反応するポリシーが必要である。
既存の視覚触覚ポリシーは通常、触覚観察を直接行動予測に供給する。
本稿では,未来の視覚予測,触覚変形予測,行動予測を共同で学習する視覚触覚世界行動モデルであるVT-WAMを紹介する。
論文 参考訳(メタデータ) (2026-07-02T17:58:36Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation [74.87716678195099]
光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
本研究では,触覚を触覚で認識し,触覚を触覚で表現する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T08:20:18Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation [27.000763540977506]
VLA(Vision-Language-Action)モデルは、ロボット操作において大きな優位性を示している。
本稿では,触覚モーダルを変換器のポリシーに組み込んだ微調整VLAモデルTacVLAを提案する。
本稿では,接触検出時にのみ触覚トークンを選択的に活性化する接触認識ゲーティング機構を提案する。
論文 参考訳(メタデータ) (2026-03-13T05:20:41Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking [47.900334665380115]
シミュレーションベースのビジュオ触覚データプラットフォームUniVTACを提案する。
大規模なシミュレーション合成データに基づいて訓練されたビジュオ触覚エンコーダであるUniVTACエンコーダを紹介する。
代表的な8つのビジュオ触覚操作タスクからなるUniVTACベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-10T18:57:00Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。