論文の概要: The Potential of Haptic Foundation Models
- arxiv url: http://arxiv.org/abs/2608.28664v1
- Date: Sun, 23 Aug 2026 03:30:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.69547
- Title: The Potential of Haptic Foundation Models
- Title(参考訳): ハプティック・ファンデーション・モデルの可能性
- Abstract要約: 本稿では,ハプティック・ファンデーション・モデル(HFM)の変容ポテンシャルと発達軌道について考察する。
受動的大言語モデルと視覚言語モデルから4つの中核次元にわたるアクティブなHFMへの移行に必要なパラダイムシフトについて詳述する。
既存の大規模データセットとベンチマークUniTouch,AnyTouch,T3,SparshをTacBench上で合成し,力推定,スリップ検出,相対ポーズ推定を行う。
- 参考スコア(独自算出の注目度): 16.607448939025225
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the success of foundation models in language and vision, their expansion into embodied AI is bottlenecked by a lack of generalized touch sensing. This limitation is especially relevant to consumer electronics, where smartphones, wearables, VR controllers, home robots, and health monitoring devices require safe and adaptive physical interaction. Constrained by hardware heterogeneity and the necessity of active physical data collection, current haptic models remain rigidly task-specific. To overcome these limitations, this article explores the transformative potential and developmental trajectory of Haptic Foundation Models (HFMs). We detail the paradigm shift required to transition from passive Large Language Models and Vision Language Models into active HFMs across four core dimensions: action coupling, physical dynamical representation space, continuous time-series data granularity, and action-conditioned future state prediction. Furthermore, we synthesize existing large-scale tactile datasets and benchmark UniTouch, AnyTouch, T3, and Sparsh on TacBench for force estimation, slip detection, and relative pose estimation.
- Abstract(参考訳): 言語とビジョンにおける基礎モデルの成功にもかかわらず、その具体化されたAIへの拡張は、一般化されたタッチセンシングの欠如によってボトルネックになっている。
この制限は、スマートフォン、ウェアラブル、VRコントローラー、ホームロボット、健康モニタリングデバイスが安全かつ適応的な物理的相互作用を必要とする消費者電子製品に特に関係している。
ハードウェアの不均一性とアクティブな物理データ収集の必要性に制約され、現在のハプティックモデルは厳密なタスク固有のままである。
これらの制約を克服するために,本稿では,ハプティック・ファンデーション・モデル(HFM)の変容ポテンシャルと発達軌道について考察する。
我々は、受動的大言語モデルと視覚言語モデルから、アクション結合、物理力学表現空間、連続時系列データ粒度、行動条件付き将来の状態予測という4つの中核次元にわたるアクティブなHFMへの移行に必要なパラダイムシフトについて詳述する。
さらに,既存の大規模触覚データセットとベンチマークUniTouch,AnyTouch,T3,SparshをTacBench上で合成し,力推定,スリップ検出,相対ポーズ推定を行う。
関連論文リスト
- Model Predictive Control of Tensegrity Robots via Contact-Aware Graph Neural Dynamics Model [7.6062899503507815]
本研究では,学習グラフニューラルネットワーク(GNN)ダイナミックスモデルにより駆動される3バー張力ロボットのためのモデル予測経路積分(MPPI)コントローラを提案する。
MuJoCoでは、壁の障害物、傾斜線、狭い廊下、低クリアランス構造、複合3D障害物コースを含む5つのナビゲーションタスクで実験が行われている。
その結果, 複雑な接触環境下では, 学習力学とサンプリングベースモデル予測制御が組み合わさって, 強靭な引張ナビゲーションを可能にすることがわかった。
論文 参考訳(メタデータ) (2026-09-08T16:14:25Z) - τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models [96.64934195520802]
我々は、世界モデルの物理的信頼性をストレステストするために設計された物理地上評価フレームワークであるCrashTwinを紹介する。
CrashTwinは、25K制御可能な合成12K実世界の衝突シーケンスを含む、多様なマルチエージェント衝突シナリオのデータセットを結合している。
本稿では,時間的一貫性,運動量,運動エネルギーの保存,世界力学の整合性という3つの次元を体系的に評価する診断スイートを提案する。
論文 参考訳(メタデータ) (2026-06-27T06:13:35Z) - Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics [23.400128774539812]
本稿では,HOI 生成におけるデータ・スカシティのボトルネックを克服する新しい枠組みを提案する。
提案手法は,未知の物体への一般化の促進と長軸生成の能力を示す。
論文 参考訳(メタデータ) (2026-06-22T03:32:35Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation [14.094740703476903]
本稿では,物理相互作用力の高次元触覚観測を基盤としたTaF-VLAについて紹介する。
TaF-VLAポリシは、最先端の触覚と視覚のみのベースラインを、コンタクトリッチなタスクで大幅に上回る。
論文 参考訳(メタデータ) (2026-01-28T07:34:41Z) - Learning Primitive Embodied World Models: Towards Scalable Robotic Learning [50.32986780156215]
我々は,世界モデリングのための新しいパラダイム--Primitive Embodied World Models (PEWM)を提案する。
ビデオ生成を固定的な短地平線に制限することにより,ロボット行動の言語概念と視覚的表現の微妙なアライメントを可能にする。
我々のフレームワークは、きめ細かい物理的相互作用と高レベルの推論のギャップを埋め、スケーラブルで解釈可能で汎用的なインテリジェンスへの道を開く。
論文 参考訳(メタデータ) (2025-08-28T14:31:48Z) - Dynamic Modeling of Hand-Object Interactions via Tactile Sensing [133.52375730875696]
本研究では,高分解能な触覚グローブを用いて,多種多様な物体に対して4種類のインタラクティブな動作を行う。
我々は,クロスモーダル学習フレームワーク上にモデルを構築し,視覚処理パイプラインを用いてラベルを生成し,触覚モデルを監督する。
この研究は、高密度触覚センシングによる手動物体相互作用における動的モデリングの一歩を踏み出す。
論文 参考訳(メタデータ) (2021-09-09T16:04:14Z) - Physics-Integrated Variational Autoencoders for Robust and Interpretable
Generative Modeling [86.9726984929758]
我々は、不完全物理モデルの深部生成モデルへの統合に焦点を当てる。
本稿では,潜在空間の一部が物理によって基底づけられたVAEアーキテクチャを提案する。
合成および実世界のデータセットの集合に対して生成的性能改善を示す。
論文 参考訳(メタデータ) (2021-02-25T20:28:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。