論文の概要: TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction
- arxiv url: http://arxiv.org/abs/2607.28391v1
- Date: Thu, 30 Jul 2026 15:47:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.630243
- Title: TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction
- Title(参考訳): TacWAM:メカニクス対応触覚予測を用いたアンカーガイド世界行動モデル
- Abstract要約: World Action Models (WAM) は将来の状態予測とロボットアクション生成を組み合わせるが、既存のアプローチは視覚的未来に大きく依存している。
本稿では、この課題に3つのステップで対処する、メカニック対応の触覚WAMであるTacWAMを紹介する。
筆者らは, 脆弱な把握, 表面接触, 動的手動操作を含む4つの実世界の接触リッチな操作タスクに対して, TacWAMを評価した。
- 参考スコア(独自算出の注目度): 15.274487606802124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World Action Models (WAMs) combine future-state prediction with robot action generation, but existing approaches largely rely on visual futures. Visual prediction captures scene structure and object motion, yet provides limited supervision for force, deformation, shear, and slip during contact-rich manipulation. This creates two design requirements: tactile futures should carry meaningful physical information, and they should not become privileged cues for action generation. We present TacWAM, a mechanics-aware tactile WAM that addresses this challenge in three steps. First, a Spatially Aligned Fusion (SAF) Tactile Encoder maps tactile appearance, dense force fields, and deformation flow into a shared latent prediction space, with bilateral force and torque reconstruction preserving global contact information. Second, a tactile history encoder provides temporal context so future tactile prediction reflects how force and deformation change beyond the current tactile observation. Third, Anchor-Guided Tri-Modal (AGT) Attention separates current visual and tactile anchors, future prediction tokens, and action tokens, allowing future tactile states to supervise training without being directly read by the action branch. We evaluate TacWAM on four real-world contact-rich manipulation tasks covering fragile grasping, sustained surface contact, and dynamic in-hand manipulation. TacWAM achieves an average success rate of 75.0%, exceeding the strongest evaluated baseline by 37.5 percentage points. Staged ablations show consistent degradation when tactile history is removed and access to future prediction targets is relaxed. These results indicate that future tactile supervision can improve contact-aware action learning when combined with informative tactile representations and deployment-consistent information constraints.
- Abstract(参考訳): World Action Models (WAM) は将来の状態予測とロボットアクション生成を組み合わせるが、既存のアプローチは視覚的未来に大きく依存している。
視覚的予測はシーン構造や物体の動きを捉えるが、接触リッチ操作時の力、変形、せん断、すべりの監督は限定的である。
触覚未来は意味のある物理的情報を持ち、アクション生成のための特権的な手がかりになるべきではない。
本稿では、この課題に3つのステップで対処する、メカニック対応の触覚WAMであるTacWAMを紹介する。
第一に、空間整合核融合(SAF)触覚エンコーダは、触覚の外観、密度の強い力場、変形の流れを、グローバルな接触情報を保存した両力とトルク再構成を用いて、共有潜在予測空間にマッピングする。
第二に、触覚履歴エンコーダは時間的文脈を提供し、将来の触覚予測は、現在の触覚観測を超える力と変形がどのように変化するかを反映する。
第3に、Anchor-Guided Tri-Modal (AGT) Attentionは、現在の視覚的および触覚的アンカー、将来の予測トークン、アクショントークンを分離し、将来の触覚状態がアクションブランチから直接読まれることなくトレーニングを監督できるようにする。
筆者らは, 脆弱な把握, 表面接触, 動的手動操作を含む4つの実世界の接触リッチな操作タスクに対して, TacWAMを評価した。
TacWAMは75.0%の平均成功率を達成し、評価ベースラインを37.5ポイント上回っている。
段階的な改善は、触覚履歴を除去し、将来の予測ターゲットへのアクセスを緩和するときに一貫した劣化を示す。
これらの結果から,将来の触覚指導は,情報的触覚表現と展開に一貫性のある情報制約を併用することで,接触認識行動学習を改善することが示唆された。
関連論文リスト
- Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models [4.240284950848863]
Oracle Visuo-Tactile Foresight (OVTF)は、シミュレーションで検証された軌道から、ペア化されたRGBと触覚未来を提供する。
OVTF内では、視覚記憶が将来のビジョンを読み取る非対称位相ローカル・フューチャーメモリ(AFM)を提案する。
AFM と IFM (Modality-Isolated Future Memory) を比較した。
論文 参考訳(メタデータ) (2026-08-01T09:04:43Z) - τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation [22.0330577788623]
コンタクトリッチな操作には、局所的な変形、圧力、滑り、摩擦に反応するポリシーが必要である。
既存の視覚触覚ポリシーは通常、触覚観察を直接行動予測に供給する。
本稿では,未来の視覚予測,触覚変形予測,行動予測を共同で学習する視覚触覚世界行動モデルであるVT-WAMを紹介する。
論文 参考訳(メタデータ) (2026-07-02T17:58:36Z) - UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models [32.87879913150572]
コンタクトリッチな操作のための統合された触覚学習フレームワークを提案する。
提案手法は,既存手法よりも成功率,操作精度,接触堅牢性を向上することを示す。
論文 参考訳(メタデータ) (2026-06-30T14:24:00Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation [50.608989079323784]
データと表現の両方の観点から,触覚コモンセンス推論をオープンワールドに拡張する触覚言語フレームワークであるTouchThinkerを提案する。
まず,Textbf415オブジェクト, textbf8シナリオ, textbf7センサタイプをカバーする,100万規模のマルチソース触覚推論データセットであるTouchThinker-1Mを構築した。
そこで本研究では,触覚表現効率を向上し,効率的な推論を可能にする行動認識モデリング機構を提案する。
論文 参考訳(メタデータ) (2026-06-10T03:58:32Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance [53.35296919674763]
TouchGuideは、低次元のアクション空間内でモダリティを融合させる、クロス政治的なビズオ触覚融合パラダイムである。
TouchGuideは、事前訓練された拡散またはフローマッチングビズモータポリシーをガイドする2つの段階で動作する。
高品質で費用対効果の高いデータによるTouchGuideトレーニングを容易にするために,データ収集システムであるTacUMIを導入する。
論文 参考訳(メタデータ) (2026-01-28T04:22:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。