論文の概要: BiView-Touch: Learning Bimanual Tactile Representations by Cross-Hand Completion
- arxiv url: http://arxiv.org/abs/2609.23352v1
- Date: Sun, 20 Sep 2026 04:38:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.784923
- Title: BiView-Touch: Learning Bimanual Tactile Representations by Cross-Hand Completion
- Title(参考訳): BiView-Touch: クロスハンドコンプリートによる双方向触覚表現の学習
- Abstract要約: BiView-Touchは触覚のみのフレームワークで、残りの目に見えるターゲットハンド領域からマスクされたターゲットハンドレイトを補完する。
制御されたアブレーションとソースコンテキストの介入は、BiView-Touchが時間的整列と解剖学的に組織化された対側的コンテキストに対する構造化された相互依存を学習することを示している。
- 参考スコア(独自算出の注目度): 6.118874003424523
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bimanual interaction produces complementary tactile views of the same physical process, yet existing tactile representation learning largely models the two hands independently or combines them only for downstream prediction, leaving their cross-hand relationship unexplored. To exploit this overlooked structure, we introduce BiView-Touch, a tactile-only framework that completes masked target-hand latents from the remaining visible target-hand regions and the synchronized full contralateral hand. A student encoder with a geometry-conditioned directional decoder predicts full-view EMA latent targets, while temporal and layout counterfactuals encourage sensitivity to synchronized and anatomically organized source information. Controlled ablations and source-context interventions show that BiView-Touch learns structured cross-hand dependence on temporally aligned and anatomically organized contralateral tactile context, rather than benefiting from bilateral input alone. On the public HumanTouch dataset, its frozen representations consistently outperform representative self-supervised baselines across low-label settings. With only 5\% downstream labels, BiView-Touch achieves relative balanced-accuracy gains of 7.1\% on bilateral wrist-motion recognition and 14.1\% on force-derived interaction-phase recognition. We further introduce BVT-20, a 20-task bilateral tactile dataset, and demonstrate transfer across recording sessions and pretraining corpora, including transfer to a held-out bimanual task. Our code and dataset details are available on the anonymous project page: https://anonymous.4open.science/w/biview-touch-review-site-050C/.
- Abstract(参考訳): 双方向の相互作用は、同じ物理的プロセスの相補的な触覚ビューを生成するが、既存の触覚表現学習は、主に2つの手を独立にモデル化するか、下流の予測のためにのみ組み合わせて、その相互関係を未解明のまま残す。
この見過ごされた構造を利用するために,残りの可視的ターゲットハンド領域と,同期された全対向的ハンドからマスクされたターゲットハンドラテントを補完する,触覚のみのフレームワークであるBiView-Touchを導入する。
幾何条件の指向デコーダを持つ学生エンコーダは、時間的およびレイアウト上のカウンターファクトは、同期および解剖学的に組織されたソース情報に対する感受性を促進する。
BiView-Touchは、双方向入力のみの恩恵を受けるのではなく、時間的整列と解剖学的に整列された対側触覚コンテキストに対する構造的相互依存を学習する。
パブリックなHumanTouchデータセットでは、その凍結表現は、低ラベル設定で代表的な自己監督ベースラインを一貫して上回る。
下流のラベルは5\%しかなく、BiView-Touchは両手首の動き認識では7.1\%、力による相互作用位相認識では14.1\%という相対的バランスの取れた精度の上昇を達成している。
さらに,20タスクの両側触覚データセットであるBVT-20を導入し,保持されたバイマニュアルタスクへの移動を含む,録音セッションと事前学習コーパス間の移動を示す。
私たちのコードとデータセットの詳細は、匿名プロジェクトのページで確認できる。
関連論文リスト
- TouchSight: Bare-Handed Tactile Prediction from Egocentric Video via Generative Visual Augmentation [7.514180931864231]
我々は,高密度全手接触力予測のための単眼自我中心型視覚フレームワークであるTouchSightを提案する。
TwinTouch-20H: 20時間ペアの視覚データを構築し, 生成的ビデオモデルが手作業で記録した記録を手作業で再現する。
TouchSightは、光沢のあるビデオと生成された裸手ビデオの両方から高密度な力を予測し、OakInk2の以前の接触予測方法より優れています。
論文 参考訳(メタデータ) (2026-09-17T13:58:43Z) - Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - SECOND-Grasp: Semantic Contact-guided Dexterous Grasping [60.1519218638742]
Second-Grasp (Semantic Contact-guided Dexterous Grasping) は、ロボットハンドが意味論的推論に基づいて把握戦略を調整できる統合されたフレームワークである。
我々のアプローチは、目に見えるカテゴリーと目に見えないカテゴリの両方で成功率を上げるために、一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-13T07:37:00Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - Gesture-Aware Pretraining and Token Fusion for 3D Hand Pose Estimation [3.0979829079231447]
ジェスチャーのセマンティクスが3次元ポーズ推定の強力な帰納的バイアスとなることを示す。
本稿では,情報埋め込み空間を学習するジェスチャー認識事前学習という2段階のフレームワークを提案する。
InterHand2.6Mの実験では、ジェスチャー認識による事前学習が一貫した精度の向上を実証している。
論文 参考訳(メタデータ) (2026-03-18T06:18:46Z) - OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction [93.88239833545623]
OpenTouchは、最初のインザワイルドなエゴセントリックなフルハンド触覚データセットです。
触覚信号は,理解のためのコンパクトで強力なキューを提供する。
我々は,マルチモーダルな自我中心の知覚,具体的学習,接触に富むロボット操作の促進を目指す。
論文 参考訳(メタデータ) (2025-12-18T18:18:17Z) - Grasp Like Humans: Learning Generalizable Multi-Fingered Grasping from Human Proprioceptive Sensorimotor Integration [26.351720551267846]
触覚と審美的知覚は、人間の器用な操作に欠かせないものであり、感覚運動器統合による物体の確実な把握を可能にしている。
本研究では,人間の直感的・自然な操作から模倣学習に基づくロボット実行へのスキル伝達を把握するための,新しい手袋による触覚的知覚予測フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-10T07:44:12Z) - Learning Fine-grained View-Invariant Representations from Unpaired
Ego-Exo Videos via Temporal Alignment [71.16699226211504]
我々は,エゴセントリックな映像とエゴセントリックな映像を時間内に整列させることにより,視点に不変なきめ細かいアクション特徴を学習することを提案する。
そこで本研究では,2つの鍵設計を持つ自己教師型埋め込み手法であるAE2を提案する。
評価のために,エゴ・エクソ・コンテキストにおけるきめ細かい映像理解のためのベンチマークを構築した。
論文 参考訳(メタデータ) (2023-06-08T19:54:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。