論文の概要: Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models
- arxiv url: http://arxiv.org/abs/2608.00547v1
- Date: Sat, 01 Aug 2026 09:04:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.767318
- Title: Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models
- Title(参考訳): Visuo-Tactileの遠近視 - 世界アクションモデルのためのOracle主導のインターフェースディスカバリ
- Authors: Zihang Yao, Chaoyue Ding, Yingying Yu,
- Abstract要約: Oracle Visuo-Tactile Foresight (OVTF)は、シミュレーションで検証された軌道から、ペア化されたRGBと触覚未来を提供する。
OVTF内では、視覚記憶が将来のビジョンを読み取る非対称位相ローカル・フューチャーメモリ(AFM)を提案する。
AFM と IFM (Modality-Isolated Future Memory) を比較した。
- 参考スコア(独自算出の注目度): 4.240284950848863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Contact-rich manipulation remains challenging because successful control depends on physical interaction cues that are often weakly observable from vision alone. Recent tactile world action models jointly model future visual observations and tactile signals to guide action generation, but how such futures should be structured for effective use by the action expert remains underexplored. Directly studying this question with learned world action models is difficult because end-to-end behavior entangles physically invalid visual futures, unreliable predictions, inaccurate or cross-modally inconsistent tactile forecasts, and an unreadable future-to-action interface. To make this interface independently studyable, we introduce Oracle Visuo-Tactile Foresight (OVTF), a controlled framework that supplies paired RGB and tactile futures from successful trajectories verified in simulation. By fixing the future provider, OVTF isolates the interface and asks a cleaner question: if the future is successful and physically executable, what representation allows the action expert to absorb its benefit? Within OVTF, we propose Asymmetric Phase-Local Future Memory (AFM), in which visual memory reads future vision, each tactile memory jointly attends to its own tactile stream and phase-aligned future vision, and cross-tactile access is blocked. We compare AFM with Modality-Isolated Future Memory (IFM), which removes visual-to-tactile access and processes each future modality independently. Across seven tasks on the UniVTAC simulation benchmark, AFM achieves 32.0% average success, compared with 23.7% for IFM and 14.9% for UniVTAC-ACT. This controlled comparison shows that selective phase-aligned visual-tactile routing provides a more actionable future-to-action bridge than complete modality isolation.
- Abstract(参考訳): コントロールを成功させるには、視覚のみから弱く観察可能な物理的相互作用の方法に依存するため、コンタクトリッチな操作は依然として難しい。
近年の触覚世界行動モデルでは、将来の視覚的観察と触覚信号を組み合わせて行動生成を誘導しているが、アクション専門家による効果的な使用のためにそのような未来がどのように構成されるべきかは未定である。
エンド・ツー・エンドの行動は、物理的に無効な視覚的未来、信頼できない予測、不正確または相互に相反する触覚的予測、読めない未来から行動的インターフェースを絡み合わせるため、この問題を学習の世界行動モデルで直接研究することは困難である。
Oracle Visuo-Tactile Foresight(OVTF)は、シミュレーションで検証された軌道からRGBと触覚の未来をペアで提供するコントロールフレームワークである。
将来的なプロバイダを修正することで、OVTFはインターフェースを分離し、よりクリーンな質問を行う。
OVTF内では、視覚記憶が将来の視覚を読み取る非対称位相ローカル・フューチャーメモリ(AFM)を提案し、各触覚記憶は、それぞれの触覚ストリームと相整合将来のビジョンに共用し、クロス触覚アクセスをブロックする。
AFM と IFM (Modality-Isolated Future Memory) を比較した。
UniVTACシミュレーションベンチマークの7つのタスクの中で、AFMは平均的な成功率を32.0%、IMMは23.7%、UniVTAC-ACTは14.9%と達成している。
この制御された比較は、選択的な位相整列型視覚触覚ルーティングは、完全なモダリティ分離よりも、より実用的な未来対アクションブリッジを提供することを示している。
関連論文リスト
- TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction [15.274487606802124]
World Action Models (WAM) は将来の状態予測とロボットアクション生成を組み合わせるが、既存のアプローチは視覚的未来に大きく依存している。
本稿では、この課題に3つのステップで対処する、メカニック対応の触覚WAMであるTacWAMを紹介する。
筆者らは, 脆弱な把握, 表面接触, 動的手動操作を含む4つの実世界の接触リッチな操作タスクに対して, TacWAMを評価した。
論文 参考訳(メタデータ) (2026-07-30T15:47:01Z) - τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision [43.426795127841075]
本稿では,視覚の視覚的監視から触覚表現を学習するタッチ拡張型視覚・言語・アクション(VLA)フレームワークを提案する。
また、4つの代表的なコンタクトリッチな操作タスクにまたがって、同期視覚、プロプレセプション、および視覚ベースの触覚信号のデータセットであるTacAuraを紹介する。
論文 参考訳(メタデータ) (2026-07-27T14:25:15Z) - Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention [53.84395207661823]
触覚非対称注意機構(TAAM)を備えたタッチ対応WAMであるTactile-WAMを提案する。
ManiFeelでは、Tactile-WAMは平均成功率を38.9%改善し、コンタクトリッチタスクでは86%改善した。
論文 参考訳(メタデータ) (2026-06-25T06:54:56Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation [57.133721026727706]
textbfOmniViTacは,16ドルのタスクと100ドル以上のオブジェクトからなる21,000ドル以上のトラジェクトリからなる大規模ビズオタクティルアクションデータセットである。
我々は4つの密結合モジュールを統合する世界モデルベースのビジュオ触覚操作フレームワークである textbf OmniVTA を提案する。
論文 参考訳(メタデータ) (2026-03-19T17:52:42Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。