論文の概要: $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2607.23783v1
- Date: Sun, 26 Jul 2026 17:58:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.225945
- Title: $N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
- Title(参考訳): $N_0$-TWAM:接触リッチマニピュレーションのための触覚Native World-Action Modelのスケーリング
- Authors: NeoteAI Team, Fudan TEAI Team,
- Abstract要約: 我々は,将来の視覚と将来の接触の両方を予測する,接触リッチな操作のための触覚的世界行動モデルを提案する。
我々の知る限り、これは大規模に訓練された最初の触覚世界行動モデルであり、コンタクトリッチなタスクに強い能力を示す。
我々は、力に基づく統合された触覚表現であるNeoForceを使用して、アクション生成を条件とした物理的接点信号を形成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present $N_0$-TWAM, a tactile-native world-action model for contact-rich manipulation that predicts both future vision and future contact. To our knowledge, it is the first tactile world-action model trained at large scale, and it shows strong capability on contact-rich tasks. We pre-train $N_0$-TWAM at large scale with visuo-tactile joint training over tactile-rich demonstrations spanning six embodiments and 450 tasks. We use NeoForce, a unified force-based tactile representation, to form a physically grounded contact signal that conditions action generation. To improve long-horizon and multi-stage manipulation, we introduce tactile contact events for task staging and advance through them during execution. For real-time efficiency, we adopt an asymmetric Mixture-of-Transformers architecture that pairs a full-width expert for video prediction with slim experts for downstream action and tactile prediction. Evaluations on both real and simulated benchmarks justify the capabilities of $N_0$-TWAM across a range of contact-rich tasks, and demonstrate the benefit of data scaling for precise tactile and action prediction. In summary, $N_0$-TWAM endows a world-action model with predictive capabilities to foresee vision, touch and action, building a solid foundation for fine-grained manipulation on open contact-rich tasks. The codebase and model checkpoints will be made publicly available to foster further research and development in tactile-enabled robotic manipulation.
- Abstract(参考訳): N_0$-TWAMは触覚的世界行動モデルであり、将来の視覚と将来の接触の両方を予測するコンタクトリッチな操作を行う。
我々の知る限り、これは大規模に訓練された最初の触覚世界行動モデルであり、コンタクトリッチなタスクに強い能力を示す。
6つの実施形態と450の課題にまたがる触覚豊かな実演に対して,Visuo-Tactileジョイントトレーニングを併用して,大規模にN_0$-TWAMを事前訓練した。
我々は、力に基づく統合された触覚表現であるNeoForceを使用して、アクション生成を条件とした物理的接点信号を形成する。
長時間の操作と多段階操作を改善するため,タスクステージングのための触覚接触イベントを導入し,実行中に進行させる。
リアルタイムの効率向上のために,非対称なMixture-of-Transformersアーキテクチャを採用する。
実際のベンチマークとシミュレーションベンチマークの両方での評価は、コンタクトリッチなタスクにまたがる$N_0$-TWAMの能力を正当化し、正確な触覚とアクション予測のためのデータスケーリングの利点を実証する。
要約すると、$N_0$-TWAMは、ビジョン、タッチ、アクションを予見し、オープンなコンタクトリッチなタスクをきめ細かな操作するためのしっかりとした基盤を構築するための予測能力を持つ世界アクションモデルを提供する。
コードベースとモデルチェックポイントは、触覚対応ロボット操作のさらなる研究と開発を促進するために公開されている。
関連論文リスト
- $N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens [0.0]
本稿では,触覚知覚と触覚フィードバック制御を併用した接触リッチな微粒化操作が可能な視覚触覚言語反応(VTLA)基盤モデルを提案する。
本研究では, 触覚前訓練, 段階的触覚-パスウェイ統合, 利点条件付きオフラインポリシー改善からなる触覚統合のトレーニングレシピを提案する。
論文 参考訳(メタデータ) (2026-07-26T17:58:47Z) - ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation [30.004466515831634]
ViTacWorldは、スケーラブルなコンタクトリッチロボット操作のためのアクションコンディション付きビズオ触覚世界モデルである。
これは触覚信号が物理的接触に直接接しており、純粋に視覚的な観察よりもシミュレーションと現実のギャップが小さいという事実を利用する。
ロボットの視覚触覚行動軌跡生成と政策評価に世界モデルを用いた最初のフレームワークである。
論文 参考訳(メタデータ) (2026-07-24T17:59:33Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation [46.82050380051203]
接触に富んだ操作では、ロボットは物理的な動的接触遷移や複雑な表面ジオメトリを継続的に制御し、制御する必要がある。
近年の模倣学習手法は触覚や力のフィードバックを取り入れて接触認識制御を改善するが、大域的な力や局所的な触覚の非対称的な役割をモデル化することは滅多にない。
リアルタイム操作のための軽量な力量予測フレームワークであるTacForeSightを提案する。
論文 参考訳(メタデータ) (2026-06-09T17:59:03Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation [62.58034332427291]
ForceVLAは、新しいエンドツーエンド操作フレームワークである。
外部力センシングは、VLAシステム内の第一級のモダリティとして扱う。
論文 参考訳(メタデータ) (2025-05-28T09:24:25Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。