論文の概要: GeoTLM: Geometry-aware Tactile-Language Models for Contact Motion Orientation Reasoning of Dynamic Objects
- arxiv url: http://arxiv.org/abs/2606.15909v1
- Date: Sun, 14 Jun 2026 16:37:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:04.929051
- Title: GeoTLM: Geometry-aware Tactile-Language Models for Contact Motion Orientation Reasoning of Dynamic Objects
- Title(参考訳): GeoTLM:動的物体の接触運動方向推論のための幾何認識触覚言語モデル
- Abstract要約: GeoTLM は動的接触事象の知覚のための幾何学的表現誘導 TLM である。
軽量な(わずか14kのパラメータしか持たない)新しい幾何学的表現法(DGR)を提案する。
具体的には、DGRはせん断場における接触マスク誘導表現を学習し、反対称な7領域プール設計によってそれを集約する。
- 参考スコア(独自算出の注目度): 3.0501972844045273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern tactile-language models (TLMs) have shown potential for robot learning tasks, such as material and texture recognition. However, for contact-rich scenarios, these TLMs struggle to understand the physical properties of dynamic objects, such as rotation and sliding directions. For instance, our preliminary experiments reveal that popular TLMs, such as Sparsh and AnyTouch2, exhibit weak performance on basic rotation direction reasoning from GelSight Mini tactile data. This surprising gap inspires us to explore a novel research question: Can we inject physically grounded geometric priors into TLMs to enable reliable contact orientation reasoning of dynamic object properties? To this end, we propose GeoTLM, a novel geometric representation-guided TLM for the perception of dynamic contact events. Our key idea is to preserve and structure tactile shear-field geometry before language-level reasoning, rather than forcing low-resolution tactile tokens into fragile closed-form physics operators. To achieve this, we propose a lightweight (only 14k parameters) yet novel Differentiable Geometric Representation (DGR). Specifically, DGR learns a contact-mask-guided representation in the shear field and aggregates it through an antisymmetric seven-region pooling design, motivated by the physical intuition that rotational contact produces antisymmetric deformation patterns. We conduct experiments on two representative tasks: rotation direction and sliding direction reasoning. Extensive experiments show that GeoTLM improves novel-object rotation accuracy by +14.6% and real-sensor sliding accuracy by +16.2% over the same backbone without the geometric encoder. Overall, our work paves a new way for physically grounded tactile-language reasoning, with strong potential for dynamic object understanding and contact-rich robotic manipulation.
- Abstract(参考訳): 現代の触覚言語モデル(TLM)は、材料やテクスチャ認識などのロボット学習タスクの可能性を示している。
しかし、接触に富むシナリオでは、これらのTLMは回転や滑り方向などの動的物体の物理的性質を理解するのに苦労する。
例えば,Sparsh や AnyTouch2 などの一般的な TLM は,GelSight Mini の触覚データから推定される基本回転方向に対して弱い性能を示す。
動的オブジェクト特性の信頼性の高い接触方向推論を可能にするために、物理的に接地された幾何学的事前をTLMに注入できますか?
そこで本研究では,動的接触イベントの知覚のための幾何学的表現誘導TLMであるGeoTLMを提案する。
我々のキーとなる考え方は、低解像度の触覚トークンを脆弱な閉形物理学演算子に強制するのではなく、言語レベルでの推論よりも前に触覚的せん断場形状を保存・構成することである。
そこで本研究では,DGR(Dariable Geometric Representation)を新たに提案する。
具体的には、DGRはせん断場における接触マスク誘導表現を学習し、回転接触が反対称変形パターンを生成するという物理的直観に動機づけられた、反対称な7領域プール設計を通じてそれを集約する。
我々は、回転方向とすべり方向の推論という2つの代表的なタスクについて実験を行う。
大規模な実験により、GeoTLMは新奇物体の回転精度を+14.6%改善し、実センサスライディング精度を+16.2%向上させた。
全体として、我々の研究は、動的物体の理解と接触に富んだロボット操作に強い可能性を持つ、物理的に接地された触覚言語推論の新しい方法を生み出している。
関連論文リスト
- Geometry-Aware Motion Latents for Learning Robust Manipulation Policies [17.407684641239083]
我々はGeoMoLaを紹介した。これは、操作中に点雲がどのように進化するかを予測することで、離散的な動き潜時符号を学習する。
GeoMoLaは、単一ビューのRGB-D入力のみを使用して最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-06T06:34:14Z) - TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches [18.3533066960967]
触覚の疎度測定から3次元再構成を行うための意味的および幾何学的先行モデルとして,事前学習した視覚拡散モデルを利用するフレームワークであるTouchAnythingを提案する。
本手法は,数個の接点から正確なジオメトリを再構成し,既存のベースラインを上回り,未確認のオブジェクトのオープンワールド3D再構成を可能にする。
論文 参考訳(メタデータ) (2026-04-10T04:26:36Z) - Make Geometry Matter for Spatial Reasoning [62.61667611352403]
視覚言語モデル(VLM)は、強いイメージと映像理解を実現するが、静的シーンとダイナミックビデオの両方で空間的推論を行う能力は限られている。
近年の進歩は、事前訓練された3次元基礎モデルから幾何学トークンをVLMに注入することで、この制限に対処しようとしている。
我々は、VLMが幾何トークンで積極的に推論するように促すことにより、幾何学的問題を作るためのフレームワークGeoSRを提案する。
論文 参考訳(メタデータ) (2026-03-27T17:45:12Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception [25.926187751777903]
ToucHDは、触覚のアトミックアクション、実世界操作、タッチフォースペアデータにまたがる大規模な階層的触覚データセットである。
我々は,様々な光触覚センサのための汎用触覚表現学習フレームワークであるAnyTouch 2を提案する。
論文 参考訳(メタデータ) (2026-02-10T10:05:53Z) - SIGHT: Synthesizing Image-Text Conditioned and Geometry-Guided 3D Hand-Object Trajectories [124.24041272390954]
手動物体の相互作用をモデル化することは、ロボットと具体化されたAIシステムを前進させる大きな可能性を秘めている。
SIGHTは、1つの画像から現実的で物理的に妥当な3Dハンドオブジェクトインタラクショントラジェクトリを生成することに焦点を当てた,新しいタスクである。
SIGHT-Fusionは,データベースから最もよく似た3Dオブジェクトメッシュを抽出し,この課題に対処する,新しい拡散型画像文条件付き生成モデルを提案する。
論文 参考訳(メタデータ) (2025-03-28T20:53:20Z) - Semi-Supervised Disentanglement of Tactile Contact~Geometry from
Sliding-Induced Shear [12.004939546183355]
触覚は人間の器用さに根ざしている。
ロボットタッチ、特にソフトな光触覚センサーで模倣すると、動きに依存したせん断による歪みに悩まされる。
本研究では,接触情報のみを保存しながらせん断を除去する半教師付き手法を提案する。
論文 参考訳(メタデータ) (2022-08-26T08:30:19Z) - Elastic Tactile Simulation Towards Tactile-Visual Perception [58.44106915440858]
触覚シミュレーションのための粒子の弾性相互作用(EIP)を提案する。
EIPは、触覚センサを協調粒子群としてモデル化し、接触時の粒子の変形を制御するために弾性特性を適用した。
さらに,触覚データと視覚画像間の情報融合を可能にする触覚知覚ネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-11T03:49:59Z) - Active 3D Shape Reconstruction from Vision and Touch [66.08432412497443]
人間は、視覚と触覚を共同で利用して、活発な物体探索を通じて世界の3D理解を構築する。
3次元形状の再構成では、最新の進歩はRGB画像、深度マップ、触覚読影などの限られた感覚データの静的データセットに依存している。
1)高空間分解能視覚に基づく触覚センサを応用した3次元物体のアクティブタッチに活用した触覚シミュレータ,2)触覚やビジュオクティビティルを先導するメッシュベースの3次元形状再構成モデル,3)触覚やビジュオのいずれかを用いたデータ駆動型ソリューションのセットからなるシステムを導入する。
論文 参考訳(メタデータ) (2021-07-20T15:56:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。