論文の概要: TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training
- arxiv url: http://arxiv.org/abs/2607.02840v1
- Date: Fri, 03 Jul 2026 00:23:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:22:59.843745
- Title: TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training
- Title(参考訳): TACO: スケーラブルVLAポストトライニングのためのセルフコレクタとしての触覚世界モデル
- Abstract要約: TACOは触覚を意識したワールドモデル駆動型フレームワークで,コンタクトリッチな操作において,スケーラブルなVLAポストトレーニングを実現する。
TACOは、触覚矯正をVLA後トレーニングに組み込むため、知識を取り入れた触覚適応と有利な条件のトレーニングを組み合わせる。
- 参考スコア(独自算出の注目度): 79.94818813802682
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have shown promising generalization in robotic manipulation, but they still struggle with contact-rich tasks, where minor contact perturbations can cause unrecoverable failures that are hard to detect from vision alone. Since these failures are localized rather than task-level semantic errors, tactile-aware corrective post-training offers an efficient way to improve recovery. However, scaling such supervision through human intervention is costly. Recent works have explored world models to synthesize imagined rollouts for policy improvement, but vision-only world models may produce visually plausible yet contact-inconsistent trajectories. We therefore introduce TACO, a tactile-aware world-model-driven framework for scalable VLA post-training in contact-rich manipulation. Given real robot rollouts, TACO follows a Recognize-Imagine-Label loop with a tactile-aware world model: a unified progress-action model recognizes failure-adjacent states using progress estimates, a visuo-tactile generation model imagines local correction segments, and the progress-action model labels them with executable corrective actions. To incorporate tactile corrective supervision into VLA post-training, TACO combines knowledge-insulated tactile adaptation with advantage-conditioned training, enabling the policy to learn from imagined corrections without degrading pretrained visual-language priors. These components enable TACO to convert real-world failures into imagined visuo-tactile corrections for iterative VLA post-training. Experiments on real-world contact-rich manipulation tasks show that TACO achieves 44% absolute success rate improvement over the base policy and 32% over the policy without knowledge-insulated tactile adaptation.
- Abstract(参考訳): Vision-Language-Action(VLA)モデルは、ロボット操作の有望な一般化を示しているが、それでも接触の多いタスクに苦戦している。
これらの障害はタスクレベルのセマンティックエラーではなく、ローカライズされるため、触覚認識による修正後トレーニングは、回復を改善する効率的な方法を提供する。
しかし、人間の介入によってこのような監督を拡大することはコストがかかる。
近年の研究では、政策改善のための想像上のロールアウトを合成する世界モデルが検討されているが、視覚のみのワールドモデルは、視覚的に可視だが接触のない軌道を生成できる可能性がある。
そこで,触覚を意識した世界モデル駆動型フレームワークであるTACOを導入する。
統合プログレス・アクション・モデル(英語版)は、進捗推定を用いて故障した状態を認識する、ビジュオ・タクティル生成モデル(英語版)は局所的な修正セグメントを想像し、プログレス・アクション・モデル(英語版)はそれらを実行可能な修正アクションでラベル付けする。
TACOは、VLA後のトレーニングに触覚補正を組み込むため、知識を取り入れた触覚適応と有利な条件のトレーニングを組み合わせることで、事前訓練された視覚言語を劣化させることなく、想像された修正から学習することができる。
これらのコンポーネントにより、TACOは実世界の故障を、反復的なVLA後トレーニングのための想像上のビジュオ触覚補正に変換することができる。
実世界のコンタクトリッチな操作タスクの実験では、TACOは基本方針よりも絶対的な成功率を44%向上し、知識を含まない触覚適応よりも32%向上した。
関連論文リスト
- $N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens [0.0]
本稿では,触覚知覚と触覚フィードバック制御を併用した接触リッチな微粒化操作が可能な視覚触覚言語反応(VTLA)基盤モデルを提案する。
本研究では, 触覚前訓練, 段階的触覚-パスウェイ統合, 利点条件付きオフラインポリシー改善からなる触覚統合のトレーニングレシピを提案する。
論文 参考訳(メタデータ) (2026-07-26T17:58:47Z) - TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models [12.700838638661047]
アーキテクチャの変更ではなく,視覚的な拡張を通じて触覚フィードバックを提供する,シンプルなフレームワークを提案する。
アーキテクチャは非タッチであるため、触覚による事前トレーニングは不要で、無視可能な計算を追加し、事前トレーニングの分布に近づき続ける。
4つのコンタクト豊富なタスクの中で、TAP-VLAは78%の試験で成功し、視覚のみの微調整と代替の触覚融合ベースラインでは50%以下である。
論文 参考訳(メタデータ) (2026-06-27T21:06:06Z) - TacCoRL: Integrating Tactile Feedback into VLA via Simulation [38.963250081631834]
視覚言語アクション(VLA)モデルは、ロボット操作のための強力な視覚、言語、行動の優先順位を提供する。
我々は、VLAポリシーに触覚フィードバックを注入するスケーラブルなフレームワークであるTacCoRLを提案する。
我々は,接触操作のためのクローズドループトレーニング環境として,実列シミュレータを用いる。
論文 参考訳(メタデータ) (2026-06-10T07:20:36Z) - EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - Reinforcing VLAs in Task-Agnostic World Models [15.056103368344596]
強化学習(RL)による後学習型ビジョン・ランゲージ・アクション(VLA)モデルは、コストのかかる実世界の相互作用を伴わずに新しいタスクに適応するための効果的な戦略として登場した。
我々は、世界と報酬モデルがゼロショット推論を可能にする転送可能な物理的事前をキャプチャすべきであると主張している。
我々は、下流のタスク依存から世界モデル学習を完全に切り離す新しいパラダイムであるRAW-Dreamを提案する。
論文 参考訳(メタデータ) (2026-05-12T16:16:15Z) - VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - Tactile Modality Fusion for Vision-Language-Action Models [22.788833830429766]
本稿では,視覚触覚信号と視覚言語アクション(VLA)モデルを統合する軽量なモーダルフュージョンアプローチであるTacFiLMを提案する。
その結果, 成功率, 直接挿入性能, 完了時間, 負荷安定性の両面において一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-03-15T20:57:51Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。