論文の概要: Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation
- arxiv url: http://arxiv.org/abs/2607.03387v2
- Date: Tue, 07 Jul 2026 03:40:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.251052
- Title: Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation
- Title(参考訳): 未発見:ResTacVLAを用いた残留触覚表現によるコンタクトリッチマニピュレーション
- Authors: Pengwei Zhang, Bin Xie, Ce Hao, Xinpan Meng, Xinyu Guo, Fang Deng, Long Cheng, Tiancai Wang,
- Abstract要約: ResTacVLAはスパース触覚信号を密度の高い高値情報ゲインに変換する。
我々は、視覚的事前の不確実性を利用して、適応的に触覚統合をゲートする。
その結果、ResTacVLAは、多様なコンタクトリッチな操作タスクにおいて、すべてのベースラインを一貫して上回っていることがわかった。
- 参考スコア(独自算出の注目度): 25.354845550739302
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tactile perception is indispensable for contact-rich manipulation, yet integrating it into Vision-Language-Action (VLA) models often induces modality collapse, where high-bandwidth visual features overshadow sparse tactile cues. Inspired by Predictive Coding, a neural mechanism where the brain attenuates predictable inputs to prioritize surprising stimuli, we propose ResTacVLA. Rather than treating tactile data as raw input, we reformulate it as a Residual Tactile Representation capturing the discrepancy between visual priors and physical sensations. By filtering out visually predictable dynamics, this formulation transforms sparse tactile signals into dense, high-value information gain, thereby inherently resolving the bandwidth mismatch. These residuals are discretized through a Vector Quantized (VQ) bottleneck into Latent Contact Primitives that capture critical events missed by vision. Analogous to the neural surprise signal, we leverage the uncertainty of the visual prior to adaptively gate tactile integration, prioritizing residuals specifically during visually unreliable phases to explicitly prevent visual dominance. Experimental results show that ResTacVLA consistently outperforms all baselines on a diverse set of contact-rich manipulation tasks, while remaining robust to unexpected dynamic disturbances. Project page: https://awilekong.github.io/ResTacVLA/
- Abstract(参考訳): 触覚はコンタクトリッチな操作には不可欠であるが、VLA(Vision-Language-Action)モデルに組み込むと、高帯域幅の視覚的特徴が疎い触覚を覆い、モダリティが崩壊する。
予測的符号化(Predictive Coding)は、脳が予期せぬ刺激を優先するために予測可能な入力を減衰させる神経機構であり、ResTacVLAを提案する。
触覚データを生の入力として扱うのではなく、視覚的先行と身体的感覚の相違を捉えた残留触覚表現として再構成する。
視覚的に予測可能なダイナミクスをフィルタリングすることにより、この定式化はスパース触覚信号を密度の高い高値情報ゲインに変換し、帯域幅ミスマッチを本質的に解消する。
これらの残留物は、ベクトル量子化(VQ)ボトルネックを通じて、視覚によって見逃された臨界事象を捉える潜在接触プリミティブに識別される。
ニューラル・サプライズ信号とは対照的に,適応ゲート型触覚統合に先立つ視覚的先行の不確実性を活用し,視覚的優位性を明確に抑えるために,視覚的に信頼性の低い位相において残像を優先する。
実験結果から、ResTacVLAは、様々なコンタクトリッチな操作タスクにおいて、すべてのベースラインを一貫して上回りながら、予期せぬ動的障害に対して頑健であることがわかった。
プロジェクトページ: https://awilekong.github.io/ResTacVLA/
関連論文リスト
- Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation [74.87716678195099]
光触覚センサーを利用した視覚触覚ポリシーは、コンタクトリッチな操作において大きな可能性を秘めている。
これらの利点にもかかわらず、接触リッチな操作に必要なきめ細かい接触状態の抽出は未解決の課題である。
本研究では,触覚を触覚で認識し,触覚を触覚で表現する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T08:20:18Z) - TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models [12.700838638661047]
アーキテクチャの変更ではなく,視覚的な拡張を通じて触覚フィードバックを提供する,シンプルなフレームワークを提案する。
アーキテクチャは非タッチであるため、触覚による事前トレーニングは不要で、無視可能な計算を追加し、事前トレーニングの分布に近づき続ける。
4つのコンタクト豊富なタスクの中で、TAP-VLAは78%の試験で成功し、視覚のみの微調整と代替の触覚融合ベースラインでは50%以下である。
論文 参考訳(メタデータ) (2026-06-27T21:06:06Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation [27.000763540977506]
VLA(Vision-Language-Action)モデルは、ロボット操作において大きな優位性を示している。
本稿では,触覚モーダルを変換器のポリシーに組み込んだ微調整VLAモデルTacVLAを提案する。
本稿では,接触検出時にのみ触覚トークンを選択的に活性化する接触認識ゲーティング機構を提案する。
論文 参考訳(メタデータ) (2026-03-13T05:20:41Z) - TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation [14.094740703476903]
本稿では,物理相互作用力の高次元触覚観測を基盤としたTaF-VLAについて紹介する。
TaF-VLAポリシは、最先端の触覚と視覚のみのベースラインを、コンタクトリッチなタスクで大幅に上回る。
論文 参考訳(メタデータ) (2026-01-28T07:34:41Z) - Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation [14.221542785249524]
本稿では,VLAモデルを接点物理学の基盤として,未来感を学習するフレームワークであるDreamTacVLAを紹介する。
我々のモデルは、高解像度の触覚画像がマイクロビジョン入力として機能する階層的認識方式を採用している。
より詳細な接触力学の理解を深めるために,将来的な触覚信号を予測する触覚世界モデルを用いてシステムを微調整する。
論文 参考訳(メタデータ) (2025-12-29T21:06:33Z) - Generative Partial Visual-Tactile Fused Object Clustering [81.17645983141773]
オブジェクトクラスタリングのためのGenerative Partial Visual-Tactile Fused(GPVTF)フレームワークを提案する。
条件付きクロスモーダルクラスタリング生成逆ネットワークを開発し、一方のモダリティ条件を他方のモダリティ上で合成する。
最後に、擬似ラベルに基づく2つのKL分割損失を用いて、対応するモダリティ固有エンコーダを更新する。
論文 参考訳(メタデータ) (2020-12-28T02:37:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。