論文の概要: Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control
- arxiv url: http://arxiv.org/abs/2609.20761v2
- Date: Fri, 18 Sep 2026 22:13:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.163853
- Title: Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control
- Title(参考訳): Agile-WAM: コンタクトリッチロボット制御のためのアジャイル触覚ワールドアクションモデル
- Abstract要約: 我々は,コンタクトリッチロボット制御のためのアジャイル触覚ワールドアクションモデルであるAgile-WAMを紹介する。
Agile-WAMは視覚的および触覚的な観察を共有潜伏者にエンコードする。
アクションチャンクの潜伏表現と将来の視覚/触覚潜伏表現を共同で生成することができる。
- 参考スコア(独自算出の注目度): 10.095868966005598
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: World Action Models (WAMs) advance beyond conventional visuomotor policies by jointly predicting future world states and robot actions, enabling the policy to learn phys- ical dynamics that support effective control. However, recent tactile WAMs often rely on large-scale pretrained generative backbones to capture contact-rich physical dynamics, which limit their inference efficiency and flexible deployment. In this paper, we present Agile-WAM, an agile tactile World Action Model for contact-rich robot control. Agile-WAM encodes visual and tactile observations into a shared latent that serves as the source of a direct vision-tactile-to-action flow-matching process, which can jointly generate latent representations of action chunks and future visual/tactile latents. A key observation is that vision and tactile signals evolve at inherently different timescales: adjacent visual frames are often highly similar, whereas tactile signals can change abruptly upon contact. We therefore introduce multi-horizon multimodal prediction in Agile-WAM, which provides supervision for visual latent at a larger temporal offset while predicting the tactile latent in the next frame to capture fine-grained contact dynamics. Across nine simulated and five real-world contact-rich ma- nipulation tasks, Agile-WAM demonstrates strong and robust performance, outperforming the strongest baseline in success rate while maintaining low inference latency. In particular, in five real-world experiments, Agile-WAM yields a relative gain of 29.4% in overall success rates while achieving inference latency of 11.9 ms. These results demonstrate that multimodal WAM can be achieved with an agile architecture suitable for precise and high-frequency robot control. More details are available on our project page.
- Abstract(参考訳): 世界行動モデル(WAM)は、将来の世界状態とロボットのアクションを共同で予測し、効果的な制御を支援するフィス-カルダイナミクスを学べるようにすることで、従来のビズモータ政策を超えて前進する。
しかし、最近の触覚WAMは、しばしば接触に富む物理力学を捉え、推論効率と柔軟な展開を制限するために、大規模な事前訓練された生成バックボーンに依存している。
本稿では,コンタクトリッチロボット制御のためのアジャイル触覚世界行動モデルであるAgile-WAMを紹介する。
Agile-WAMは、視覚的および触覚的な観察を、直接視触覚からアクションへのフローマッチングプロセスの源となる共有潜水器にエンコードし、アクションチャンクの潜水表現と将来の視覚/触覚潜水器を共同で生成する。
視覚と触覚信号は本質的に異なる時間スケールで進化し、隣接する視覚フレームはしばしば非常によく似ているが、触覚信号は接触によって突然変化する。
そこで我々は,Agile-WAMにマルチホライゾン・マルチモーダル・予測を導入し,視覚的潜伏者を時間的オフセットで監視するとともに,触覚潜伏者を次のフレームで予測し,微粒な接触ダイナミクスを捉える。
9つのシミュレーションと5つの実世界のコンタクトリッチなma-nipulationタスクの中で、Agile-WAMは、強い、堅牢なパフォーマンスを示し、低い推論レイテンシを維持しながら、成功率で最強のベースラインを上回ります。
特に5つの実世界の実験において、Agile-WAMは総成功率29.4%の相対的な上昇を示し、推論遅延は11.9msである。これらの結果は、マルチモーダルWAMが正確で高周波のロボット制御に適したアジャイルアーキテクチャで達成可能であることを示している。
詳細はプロジェクトのページで確認できます。
関連論文リスト
- τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation [0.0]
我々は,将来の視覚と将来の接触の両方を予測する,接触リッチな操作のための触覚的世界行動モデルを提案する。
我々の知る限り、これは大規模に訓練された最初の触覚世界行動モデルであり、コンタクトリッチなタスクに強い能力を示す。
我々は、力に基づく統合された触覚表現であるNeoForceを使用して、アクション生成を条件とした物理的接点信号を形成する。
論文 参考訳(メタデータ) (2026-07-26T17:58:53Z) - ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation [30.004466515831634]
ViTacWorldは、スケーラブルなコンタクトリッチロボット操作のためのアクションコンディション付きビズオ触覚世界モデルである。
これは触覚信号が物理的接触に直接接しており、純粋に視覚的な観察よりもシミュレーションと現実のギャップが小さいという事実を利用する。
ロボットの視覚触覚行動軌跡生成と政策評価に世界モデルを用いた最初のフレームワークである。
論文 参考訳(メタデータ) (2026-07-24T17:59:33Z) - T-Rex: Tactile-Reactive Dexterous Manipulation [139.71263755530654]
本稿では,新しい時相触覚VQ-VAEエンコーダを備えた可変レートMixture-of-Transformers (MoT)アーキテクチャを提案する。
微妙な力制御と変形可能な物体操作を必要とする12の操作課題に対して,触覚反応が有効であることを示す。
論文 参考訳(メタデータ) (2026-06-15T17:59:55Z) - VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。