論文の概要: STAR: Sparse Tactile Representation Learning in Vision-Tactile-Language-Action Models for Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2609.12549v1
- Date: Fri, 11 Sep 2026 07:57:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.662105
- Title: STAR: Sparse Tactile Representation Learning in Vision-Tactile-Language-Action Models for Dexterous Manipulation
- Title(参考訳): STAR: Dexterous Manipulationのための視触覚・言語反応モデルにおけるスパース触覚表現学習
- Abstract要約: 悪質な操作には、協調した多指制御と効果的な触覚フィードバックが必要である。
ロボットプラットフォームと遠隔操作システムを構築し,200時間の両面的な操作データセットを収集する。
視覚触覚-言語-アクションモデルのための統合学習法STARを提案する。
- 参考スコア(独自算出の注目度): 24.489844571043808
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Dexterous manipulation requires coordinated multi-finger control and effective tactile feedback, yet learning these capabilities remains challenging due to the lack of large-scale real-world data and the difficulty of extracting effective representations from sparse tactile signals. We build a robot platform and teleoperation system to collect a 200-hour bimanual dexterous manipulation dataset with synchronized visual, tactile, and language annotations, comprising 10,576 trajectories across 65 tasks, 69.5% of which involve dexterous multi-finger manipulation. We further propose STAR, an integrated training recipe for vision-tactile-language-action (VTLA) models that addresses the spatial, temporal, and informational sparsity of tactile signals through visual-tactile joint pre-training, sparse-global tactile token representation, and sparse future tactile prediction. Trained on this dataset, STAR achieves a 61% average success rate across four real-world tasks with 100 post-training trajectories per task, demonstrating dexterous performance under task-specific post-training.
- Abstract(参考訳): 有害な操作には、協調したマルチフィンガー制御と効果的な触覚フィードバックが必要であるが、大規模な実世界のデータがないことと、疎い触覚信号から効果的な表現を抽出することの難しさから、これらの能力の習得は依然として困難である。
ロボットプラットフォームと遠隔操作システムを構築し,視覚,触覚,言語アノテーションを同期した200時間の両眼的操作データセットを収集する。
さらに,視覚触覚-言語-アクション(VTLA)モデルのための統合学習手法STARを提案し,触覚信号の空間的,時間的,情報的間隔を視覚触覚ジョイント前訓練,スパース・グロバル・触覚トークン表現,スパース未来の触覚予測を行う。
このデータセットに基づいてトレーニングされ、STARは4つの実世界のタスクの平均成功率を61%達成し、タスクごとに100のポストトレーニングトラジェクトリを処理し、タスク固有のポストトレーニング下での厳密なパフォーマンスを示す。
関連論文リスト
- τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation [33.12343137426091]
本稿では,人間データに基づく精密なロボット作業のための触覚学習システムであるTransferable Tactile Pre-Training(TTP)を提案する。
TTPは、人間からロボットへの移動を通じて、スケーラブルな触覚事前訓練の道を開く。
論文 参考訳(メタデータ) (2026-07-01T15:26:26Z) - HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision [7.104046531938793]
HT-Benchは、デキスタラスなフルハンド触覚センシングのための大規模なベンチマークである。
HandTouchはベクトル量子化された視覚触覚エンコーダで、プログレッシブな空間、クロスモーダル、時間的トレーニングを通じて触覚表現を学習する。
論文 参考訳(メタデータ) (2026-06-17T15:01:30Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation [50.608989079323784]
データと表現の両方の観点から,触覚コモンセンス推論をオープンワールドに拡張する触覚言語フレームワークであるTouchThinkerを提案する。
まず,Textbf415オブジェクト, textbf8シナリオ, textbf7センサタイプをカバーする,100万規模のマルチソース触覚推論データセットであるTouchThinker-1Mを構築した。
そこで本研究では,触覚表現効率を向上し,効率的な推論を可能にする行動認識モデリング機構を提案する。
論文 参考訳(メタデータ) (2026-06-10T03:58:32Z) - VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation [10.08235353271524]
近年、身体知能は急速に進歩しているが、特に接触に富むタスクにおけるバイマニュアル操作は依然として困難である。
これは主に、リッチな物理的相互作用信号、システマティックなタスク編成、十分なスケールのデータセットが不足しているためである。
VTOUCHデータセットを導入し、高忠実な物理的相互作用信号を提供し、マトリックススタイルのタスク設計を採用し、実世界の需要駆動シナリオをカバーする自動データ収集パイプラインを採用する。
論文 参考訳(メタデータ) (2026-04-22T11:08:08Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - DexViTac: Collecting Human Visuo-Tactile-Kinematic Demonstrations for Contact-Rich Dexterous Manipulation [4.463599051210204]
大規模で高品質なマルチモーダルデモは、接触に富むデキスタス操作のロボット学習に不可欠である。
本稿では,コンタクトリッチなデキスタラス操作に適した携帯型人中心データ収集システムであるDexViTacを紹介する。
論文 参考訳(メタデータ) (2026-03-18T15:39:58Z) - UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking [47.900334665380115]
シミュレーションベースのビジュオ触覚データプラットフォームUniVTACを提案する。
大規模なシミュレーション合成データに基づいて訓練されたビジュオ触覚エンコーダであるUniVTACエンコーダを紹介する。
代表的な8つのビジュオ触覚操作タスクからなるUniVTACベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-10T18:57:00Z) - Dexterity from Touch: Self-Supervised Pre-Training of Tactile
Representations with Robotic Play [15.780086627089885]
T-Dexは、触覚に基づくデキスタリティの新しいアプローチで、2つのフェーズで動作する。
第1フェーズでは、2.5時間のプレイデータを収集し、自動教師付き触覚エンコーダの訓練に使用する。
第2段階では, 触覚観察と視覚的観察を組み合わせた非パラメトリックな政策を学習する。
論文 参考訳(メタデータ) (2023-03-21T17:59:20Z) - BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning [108.41464483878683]
本稿では,視覚に基づくロボット操作システムにおいて,新しいタスクを一般化することの課題について検討する。
実演と介入の両方から学ぶことができるインタラクティブで柔軟な模倣学習システムを開発した。
実際のロボットにおけるデータ収集を100以上のタスクにスケールすると、このシステムは平均的な成功率44%で24の目に見えない操作タスクを実行できる。
論文 参考訳(メタデータ) (2022-02-04T07:30:48Z) - Visual Imitation Made Easy [102.36509665008732]
本稿では,ロボットへのデータ転送を容易にしながら,データ収集プロセスを単純化する,模倣のための代替インターフェースを提案する。
我々は、データ収集装置やロボットのエンドエフェクターとして、市販のリーチ・グラブラー補助具を使用する。
我々は,非包括的プッシュと包括的積み重ねという2つの課題について実験的に評価した。
論文 参考訳(メタデータ) (2020-08-11T17:58:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。