論文の概要: TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios
- arxiv url: http://arxiv.org/abs/2607.05131v1
- Date: Mon, 06 Jul 2026 14:17:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.189113
- Title: TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios
- Title(参考訳): TacReasoner: リアルタイムシナリオにおけるインタラクティブ推論のための動的触覚言語フレームワーク
- Authors: Kailin Lyu, Di Wu, Long Xiao, Jianning Zeng, Jianwei He, Chang Lin, Lianyu Hu, Lin Shu, Jie Hao, Ce Hao,
- Abstract要約: 現実シナリオにおける対話型推論のための動的触覚言語フレームワークであるTacReasonerを提案する。
まず、TacReasonerは動的触覚信号の知覚と表現を高めるためにDynamic-Aware Tactileを組み込んでいる。
我々は動的触覚知覚と実世界のコモンセンス推論を体系的に評価するためにDynTac-Benchを確立する。
- 参考スコア(独自算出の注目度): 8.86126866988006
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Among the five primary human senses, tactile is arguably the most fundamental to survival, as it enables the perception of physical contact and interaction in real-world environments. In this paper, we explore two key challenges of integrating tactile sensing into intelligent systems for multimodal reasoning: (i) insufficient modeling of dynamic tactile signals, which restricts reasoning over temporally evolving properties, and (ii) hallucination in tactile foundation models caused by the absence of explicit reasoning mechanisms, leading to unstable real-world inference. To address these challenges, we propose TacReasoner, a dynamic tactile-language framework for interactive reasoning in real-world scenarios. First, TacReasoner incorporates a Dynamic-aware Tactile Encoder to enhance the perception and representation of dynamic tactile signals. More importantly, we introduce TouchCoT-10k, the first tactile chain-of-thought dataset for structured reasoning over tactile inputs. Upon it, we establish DynTac-Bench to systematically evaluate dynamic tactile perception and real-world commonsense reasoning. Experimental results demonstrate that TacReasoner achieves competitive performance against state-of-the-art models across multiple datasets. Notably, despite using only 7B parameters, TacReasoner outperforms the 14B VTV-LLM model on most subtasks, highlighting its effectiveness and efficiency in tactile commonsense reasoning.
- Abstract(参考訳): 5つの主要な人間の感覚の中で、触覚は、現実世界の環境における物理的接触と相互作用の知覚を可能にするため、おそらく生存に最も基本的なものである。
本稿では,マルチモーダル推論のための知的システムに触覚を組み込むための2つの重要な課題について考察する。
一 時間的に進化する特性に対する推論を制限する動的触覚信号のモデリングが不十分であること、及び
(II) 触覚基礎モデルにおける幻覚は, 明確な推論機構の欠如によって引き起こされ, 不安定な実世界の推論につながった。
これらの課題に対処するために,現実シナリオにおける対話的推論のための動的触覚言語フレームワークであるTacReasonerを提案する。
まず、TacReasonerは動的に認識可能な触覚エンコーダを組み込んで、動的触覚信号の知覚と表現を強化する。
さらに重要なことは、触覚入力に対する構造化推論のための最初の触覚連鎖データセットであるTouchCoT-10kを紹介します。
そこで我々は,動的触覚知覚と実世界のコモンセンス推論を体系的に評価するDynTac-Benchを確立する。
実験により、TacReasonerは複数のデータセットにわたる最先端モデルと競合する性能を発揮することが示された。
特に、7Bパラメータしか使用していないにもかかわらず、TacReasonerは、ほとんどのサブタスクで14B VTV-LLMモデルよりも優れており、触覚コモンセンス推論の有効性と効率性を強調している。
関連論文リスト
- UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation [50.608989079323784]
データと表現の両方の観点から,触覚コモンセンス推論をオープンワールドに拡張する触覚言語フレームワークであるTouchThinkerを提案する。
まず,Textbf415オブジェクト, textbf8シナリオ, textbf7センサタイプをカバーする,100万規模のマルチソース触覚推論データセットであるTouchThinker-1Mを構築した。
そこで本研究では,触覚表現効率を向上し,効率的な推論を可能にする行動認識モデリング機構を提案する。
論文 参考訳(メタデータ) (2026-06-10T03:58:32Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - Touch-R1: Reinforcing Touch Reasoning in MLLMs [7.657861449099524]
我々は,大規模なマルチモーダルデータセットであるTouchReason-1Mと,触覚知覚とコンフリクト解決を評価するための厳密なフレームワークであるTouchReason-Benchを紹介する。
Touch-R1は、オーディナル・アウェアの精度、クロスセンサーの物理的整合性、構造化フォーマット制御、入力側の触覚接地目的を組み合わせた触覚接地目的によって訓練される。
TouchReason-Benchでは、Touch-R1-7BがOctopi-13Bを18.4%、GPT-4oを24.7%上回っている。
論文 参考訳(メタデータ) (2026-05-26T15:14:56Z) - Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms [70.51538670020267]
本稿では,フィールドを2つの主次元(マルチモーダルデータセットとマルチモーダルメソッド)に分類する階層型分類法を提案する。
データ側では、Tactile-Visionデータセット、Tactile-Languageデータセット、Tactile-Vision-Languageデータセット、Tactile-Vision-Otherデータセットを含むリソースを分類する。
提案手法は,(1)マルチモーダル認識・認識,(2)クロスモーダル生成,(2)触覚・視覚・テキスト間の双方向翻訳,(3)マルチモーダルインタラクション,フィードバック制御と言語誘導操作の3つの柱に先行して構成する。
論文 参考訳(メタデータ) (2026-05-17T09:09:30Z) - AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception [25.926187751777903]
ToucHDは、触覚のアトミックアクション、実世界操作、タッチフォースペアデータにまたがる大規模な階層的触覚データセットである。
我々は,様々な光触覚センサのための汎用触覚表現学習フレームワークであるAnyTouch 2を提案する。
論文 参考訳(メタデータ) (2026-02-10T10:05:53Z) - SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios [44.650313509143984]
本稿では,マルチモーダル推論のための知的システムに触覚を組み込むことの課題について考察する。
自己言語型タッチランゲージフレームワークであるSToLaを紹介する。
我々は、総合的な触覚コモンセンス推論データセットとベンチマークを示す。
論文 参考訳(メタデータ) (2025-05-07T07:55:35Z) - Dynamic Modeling of Hand-Object Interactions via Tactile Sensing [133.52375730875696]
本研究では,高分解能な触覚グローブを用いて,多種多様な物体に対して4種類のインタラクティブな動作を行う。
我々は,クロスモーダル学習フレームワーク上にモデルを構築し,視覚処理パイプラインを用いてラベルを生成し,触覚モデルを監督する。
この研究は、高密度触覚センシングによる手動物体相互作用における動的モデリングの一歩を踏み出す。
論文 参考訳(メタデータ) (2021-09-09T16:04:14Z) - Elastic Tactile Simulation Towards Tactile-Visual Perception [58.44106915440858]
触覚シミュレーションのための粒子の弾性相互作用(EIP)を提案する。
EIPは、触覚センサを協調粒子群としてモデル化し、接触時の粒子の変形を制御するために弾性特性を適用した。
さらに,触覚データと視覚画像間の情報融合を可能にする触覚知覚ネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-11T03:49:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。