論文の概要: UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking
- arxiv url: http://arxiv.org/abs/2602.10093v1
- Date: Tue, 10 Feb 2026 18:57:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.337345
- Title: UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking
- Title(参考訳): UniVTAC: Visuo-Tactile 操作データ生成,学習,ベンチマークのための統一シミュレーションプラットフォーム
- Abstract要約: シミュレーションベースのビジュオ触覚データプラットフォームUniVTACを提案する。
大規模なシミュレーション合成データに基づいて訓練されたビジュオ触覚エンコーダであるUniVTACエンコーダを紹介する。
代表的な8つのビジュオ触覚操作タスクからなるUniVTACベンチマークを提案する。
- 参考スコア(独自算出の注目度): 47.900334665380115
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic manipulation has seen rapid progress with vision-language-action (VLA) policies. However, visuo-tactile perception is critical for contact-rich manipulation, as tasks such as insertion are difficult to complete robustly using vision alone. At the same time, acquiring large-scale and reliable tactile data in the physical world remains costly and challenging, and the lack of a unified evaluation platform further limits policy learning and systematic analysis. To address these challenges, we propose UniVTAC, a simulation-based visuo-tactile data synthesis platform that supports three commonly used visuo-tactile sensors and enables scalable and controllable generation of informative contact interactions. Based on this platform, we introduce the UniVTAC Encoder, a visuo-tactile encoder trained on large-scale simulation-synthesized data with designed supervisory signals, providing tactile-centric visuo-tactile representations for downstream manipulation tasks. In addition, we present the UniVTAC Benchmark, which consists of eight representative visuo-tactile manipulation tasks for evaluating tactile-driven policies. Experimental results show that integrating the UniVTAC Encoder improves average success rates by 17.1% on the UniVTAC Benchmark, while real-world robotic experiments further demonstrate a 25% improvement in task success. Our webpage is available at https://univtac.github.io/.
- Abstract(参考訳): ロボット操作は視覚言語アクション(VLA)ポリシーによって急速に進歩している。
しかし、視力だけでは挿入のようなタスクをしっかりと完成させることが難しいため、視覚触覚はコンタクトリッチな操作に不可欠である。
同時に、物理的世界における大規模で信頼性の高い触覚データを取得することはコストがかかり難いままであり、統一された評価プラットフォームが欠如していることは、政策学習と体系的な分析をさらに制限している。
これらの課題に対処するために,シミュレーションベースのビジュオ触覚データ合成プラットフォームであるUniVTACを提案する。
このプラットフォームをベースとしたUniVTAC Encoderは,大規模なシミュレーション合成データに設計したスーパーバイザ信号で訓練された,下流操作タスクのための触覚中心の触覚表現を提供する。
さらに,触覚によるポリシー評価のための8つの代表的ビジュオ触覚操作タスクからなるUniVTACベンチマークを提案する。
実験の結果、UniVTACエンコーダの統合により、UniVTACベンチマークでは平均成功率が17.1%向上し、実際のロボット実験ではタスク成功の25%改善が示されている。
私たちのWebページはhttps://univtac.github.io/.com/で公開されています。
関連論文リスト
- $\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence [0.0]
$mathcalN$-Foundationは触覚対応の操作のためのパラダイムである。
我々は、視覚ベースの触覚センサ、触覚のユニバーサルマニピュレーションインタフェース(UMI)、ビジュオ触覚データ収集システムを含む、スケーラブルなデータ収集のためのインフラを設計した。
実ロボット遠隔操作とUMIベースのデモを混合して収集した,6つの実施形態,450のタスク,数十億のペアリングRGBおよび触覚フレームにまたがる,30000時間以上の視覚的および触覚的デモンストレーションを含むNeoDataを構築した。
論文 参考訳(メタデータ) (2026-08-30T06:46:18Z) - Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation [45.09609338527887]
視覚ベースの触覚センサ(VBTS)は、接触によるソフトインターフェースの変形を即興に変換することで、強力な代替手段を提供する。
本稿では,VBTSパイプライン全体を調査し,センサハードウェア,学習方法,シミュレーション,データセットを統合型センシング・アンド・ラーニングシステムとして扱う。
論文 参考訳(メタデータ) (2026-08-16T02:39:12Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation [66.22092641373067]
FTP-1は、トランスファー可能な触覚操作能力を取得するために事前訓練された最初の一般基盤触覚ポリシーである。
画像、配列、状態ベースの信号を含む様々な触覚入力をサポートする。
プレトレーニング中に見られるセンサーを超える触覚スキルを学習する。
論文 参考訳(メタデータ) (2026-06-11T09:30:09Z) - HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning [24.64460457808404]
HapTileは、視覚のみのトラジェクトリデータセットを超えて前進する、接地型ビズオタクティル操作データセットである。
データ収集プラットフォームは、触覚フィードバックを直接遠隔操作コントローラに統合し、オペレータがリアルタイムでコンタクトインタラクションを知覚できるようにする。
データセットは、ピック・アンド・プレイス、折り畳み、押圧、積み重ね、その他のルーチンアクティビティを含む、幅広いコンタクト豊富なスキルにまたがる日々の操作タスクで構成されている。
論文 参考訳(メタデータ) (2026-06-03T12:48:17Z) - VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation [10.08235353271524]
近年、身体知能は急速に進歩しているが、特に接触に富むタスクにおけるバイマニュアル操作は依然として困難である。
これは主に、リッチな物理的相互作用信号、システマティックなタスク編成、十分なスケールのデータセットが不足しているためである。
VTOUCHデータセットを導入し、高忠実な物理的相互作用信号を提供し、マトリックススタイルのタスク設計を採用し、実世界の需要駆動シナリオをカバーする自動データ収集パイプラインを採用する。
論文 参考訳(メタデータ) (2026-04-22T11:08:08Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [60.609604885961716]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - DexViTac: Collecting Human Visuo-Tactile-Kinematic Demonstrations for Contact-Rich Dexterous Manipulation [4.463599051210204]
大規模で高品質なマルチモーダルデモは、接触に富むデキスタス操作のロボット学習に不可欠である。
本稿では,コンタクトリッチなデキスタラス操作に適した携帯型人中心データ収集システムであるDexViTacを紹介する。
論文 参考訳(メタデータ) (2026-03-18T15:39:58Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z) - Towards Generalization of Tactile Image Generation: Reference-Free Evaluation in a Leakage-Free Setting [25.355424080824996]
触覚は人間の知覚に重要であり、コンピュータビジョン、ロボティクス、マルチモーダル学習の応用を支えている。
触覚データは入手が困難でコストがかかることが多いため、合成触覚画像の生成は、実世界の測定を拡大するためのスケーラブルなソリューションを提供する。
一般的なデータセットにおける重なり合うトレーニングとテストサンプルは、パフォーマンス指標を増大させ、触覚モデルの真の一般化可能性を見極めることを実証する。
論文 参考訳(メタデータ) (2025-03-10T02:37:22Z) - Learning Precise, Contact-Rich Manipulation through Uncalibrated Tactile Skins [17.412763585521688]
我々は、トランスフォーマーベースのポリシーを使用して、皮膚センサーデータを視覚情報とともに追加トークンとして扱うシンプルなアプローチであるVisuo-Skin(ViSk)フレームワークを提案する。
ViSkは、視力のみと光触覚に基づくポリシーの両方で著しく優れています。
さらに、触覚と視覚のモダリティを組み合わせることで、政策性能と空間的一般化が向上し、タスク全体で平均27.5%の改善が達成される。
論文 参考訳(メタデータ) (2024-10-22T17:59:49Z) - Learning Visuotactile Skills with Two Multifingered Hands [80.99370364907278]
マルチフィンガーハンドとバイソタクティブルデータを用いたバイマニアルシステムを用いて,人間の実演からの学習を探索する。
以上の結果から,バイスオタクティブルデータからの両指多指操作における有望な進歩が示唆された。
論文 参考訳(メタデータ) (2024-04-25T17:59:41Z) - Multimodal and Force-Matched Imitation Learning with a See-Through Visuotactile Sensor [14.492202828369127]
我々は、模倣学習(IL)の枠組みの中でマルチモーダル・ビゾタクタクタブル・センサを活用して、コンタクトリッチなタスクを実行する。
本稿では,IL改善のための補完手法として,触覚力マッチングと学習モード切替という2つのアルゴリズム的貢献を紹介する。
以上の結果から, 力の一致が平均政策成功率62.5%, ビズオタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタク
論文 参考訳(メタデータ) (2023-11-02T14:02:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。