論文の概要: TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation
- arxiv url: http://arxiv.org/abs/2606.29173v2
- Date: Tue, 30 Jun 2026 17:07:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.720502
- Title: TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation
- Title(参考訳): TacGen: Touchは物理世界の表現に必要な次元である -- スケーラブルな視覚とタッチのアライメントと生成による触覚データスカシティに対処する
- Authors: Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li,
- Abstract要約: TacGenは、予め特定されたV+Tコントラストアライメントと潜在空間残留MLP V->Tジェネレータを組み合わせることで、触覚データ不足のボトルネックを軽減する。
マッチしたDINOv2のバックボーン、分割、プローブにより、V+Tは質量、密度、硬さ、不確実帯力ラベルでマッチしたVのみを改善する。
ジェネレータは交雑種+0.589に到達し、実際の触覚+0.585は種子間隔内に存在する。
- 参考スコア(独自算出の注目度): 28.54532903356491
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Touch resolves the physical-property ambiguity left by vision: exploratory contact recovers shape, texture, compliance, and material, and visuo-haptic object representations converge in ventral visual cortex. We ask whether representation learning can reproduce this grounding. TacGen mitigates the tactile-data scarcity bottleneck by combining pre-specified V+T contrastive alignment with a latent-space residual-MLP V->T generator that synthesizes tactile latents from RGB for tactile-data scaling. With matched DINOv2 backbones, splits, and probes, V+T improves matched V-only on mass (Delta R^2=+0.570), density (Delta acc=+0.067), hardness (+0.117), and uncertainty-banded force labels (Delta R^2=+0.281); all CIs exclude zero. The same representation lifts matched-capacity TACTO manipulation 0.246->0.979 while V-only capacity scaling accounts for only 4.5% of the gap, preserving 95.5%. The generator reaches cross-seed +0.589, with real tactile +0.585 inside the seed interval; the architecture comparison shows a 13pp downstream gap between reconstruction quality and representation utility. Across five-seed SSVTP/TVL reproductions, YCB-Sight transfer, three-backbone checks, permutation/random-feature controls, hash-verified manifests, and measured-force validation checks, the evidence supports the claim that touch supplies a necessary physical evidence channel for representations of contact-dependent properties.
- Abstract(参考訳): 探索的接触は形状、テクスチャ、コンプライアンス、材料を回復し、粘性触覚の物体表現は腹側視覚野に収束する。
表現学習がこの基礎を再現できるかを問う。
TacGenは、予め規定されたV+Tコントラストアライメントと、RGBから触覚データスケーリングのために触覚潜在物質を合成する潜在空間残留MLP V->Tジェネレータを組み合わせることで、触覚データ不足のボトルネックを軽減する。
一致するDINOv2のバックボーン、分割、プローブにより、V+Tは質量(Delta R^2=+0.570)、密度(Delta acc=+0.067)、硬さ(+0.117)、不確実帯力ラベル(Delta R^2=+0.281)を改良し、すべてのCIはゼロを除いた。
同じ表現は一致容量のTACTO操作 0.246->0.979 を持ち上げ、Vのみの容量スケーリングはギャップのわずか4.5%を占め、95.5%が保存されている。
ジェネレータはシード間隔内に実際の触覚+0.585を持つクロスシード+0.589に達する。
5シードのSSVTP/TVL複製、YCB-Sight転送、3バックボーンチェック、置換/ランダム機能制御、ハッシュ検証されたマニフェスト、および測定力検証チェックを含む証拠は、タッチが接触依存特性の表現に必要な物理的エビデンスチャネルを提供するという主張を支持している。
関連論文リスト
- HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision [7.104046531938793]
HT-Benchは、デキスタラスなフルハンド触覚センシングのための大規模なベンチマークである。
HandTouchはベクトル量子化された視覚触覚エンコーダで、プログレッシブな空間、クロスモーダル、時間的トレーニングを通じて触覚表現を学習する。
論文 参考訳(メタデータ) (2026-06-17T15:01:30Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - ReTac-ACT: A State-Gated Vision-Tactile Fusion Transformer for Precision Assembly [10.687495099840659]
精密な組み立てには、接触に富んだ「ラストミリ」領域でサブミリ秒の補正が必要である。
ReTac-ACTは3つのメカニズムを通じてこの問題に対処する。
90%のホール成功を達成し、視覚のみの手法と一般的な手法を大きく上回り、0.1mmペグで成功を維持する。
論文 参考訳(メタデータ) (2026-03-10T12:09:22Z) - TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation [14.094740703476903]
本稿では,物理相互作用力の高次元触覚観測を基盤としたTaF-VLAについて紹介する。
TaF-VLAポリシは、最先端の触覚と視覚のみのベースラインを、コンタクトリッチなタスクで大幅に上回る。
論文 参考訳(メタデータ) (2026-01-28T07:34:41Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - PseudoTouch: Efficiently Imaging the Surface Feel of Objects for Robotic Manipulation [8.997347199266592]
低次元センサ信号に高次元構造情報をリンクするPseudoTouchを提案する。
低次元の視覚触覚埋め込みを学習し、そこから触覚信号を復号する深度パッチを符号化する。
学習したPseudoTouchモデルの有用性を、物体認識と把握安定性予測という2つの下流タスクで実証する。
論文 参考訳(メタデータ) (2024-03-22T10:51:31Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z) - Vision Transformers are Robust Learners [65.91359312429147]
ビジョントランスフォーマー(ViT)の一般的な腐敗や摂動、分布シフト、自然逆転例に対する堅牢性について検討します。
ViTsが実際により堅牢な学習者である理由を説明するために、定量的および定性的な指標を提供する分析を提示します。
論文 参考訳(メタデータ) (2021-05-17T02:39:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。