論文の概要: ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- arxiv url: http://arxiv.org/abs/2607.28993v1
- Date: Fri, 31 Jul 2026 03:44:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.583483
- Title: ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- Title(参考訳): ST-WAM:視覚分布変化下におけるロバスト操作のための意味的・時間的世界行動モデル
- Authors: Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li,
- Abstract要約: トレーニング・ディストリビューション・ハロシン化(英語: Training-Distribution Hallucination)とは、現在のシーンに忠実に留まらず、視覚的に変化した観察で条件付けられた未来がトレーニング領域の内容に幻覚を与える現象である。
本稿では,DINOv3 を将来予測と履歴検索のための共有意味表現として用き,詳細なVAE のダイナミクスを維持しつつ,アクションロバスト性を向上させるセマンティック・テンポラル WAM (ST-WAM) を提案する。
- 参考スコア(独自算出の注目度): 24.959404195743744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) have emerged as a promising paradigm by jointly modeling robot actions and future visual dynamics. However, their reliance on pixel-generative future supervision can entangle action-relevant state transitions with task-irrelevant visual content, limiting robustness under visual distribution shifts. We identify Training-Distribution Hallucination, a recurring phenomenon in which futures conditioned on visually shifted observations hallucinate training-domain content rather than remain faithful to the current scene. A controlled frame-triplet diagnosis further shows that DINOv3 features remain more stable across visual shifts while better preserving task-state distinctions than Wan-VAE latents. Rather than correcting the predicted futures, we propose Semantic-Temporal WAM (ST-WAM) to improve action robustness by using DINOv3 as a shared semantic representation for future prediction and history retrieval while retaining fine-grained VAE dynamics. Its Dual-Space Future Experts (DSFE) jointly predict future VAE latents and DINO features, while Current-Anchored Intent Retrieval (CAIR) retrieves task-relevant evidence from recent DINO history under the current visual-language context. ST-WAM is trained end-to-end without additional embodied pretraining or task-specific annotations, and requires no explicit future generation at inference. It achieves 98.7% on LIBERO and 92.8% on RoboTwin 2.0; more importantly, compared with Fast-WAM, it improves zero-shot LIBERO-Plus performance by 21.3 percentage points and more than doubles real-world success under visual shifts from 25.8% to 61.5%. These results demonstrate that semantic-temporal modeling effectively complements pixel-generative dynamics for robust manipulation.
- Abstract(参考訳): 世界行動モデル(WAM)は、ロボットアクションと将来の視覚力学を共同でモデル化することで、将来的なパラダイムとして登場した。
しかしながら、ピクセル生成による将来の監視への依存は、アクション関連状態遷移とタスク関連視覚コンテンツとの絡み合いがあり、視覚分布シフトによるロバスト性を制限する。
本研究では,現在現場に忠実であり続けるのではなく,視覚的に変化した学習領域の内容に未来が調和する繰り返し現象であるトレーニング・ディストリビューション・ハロシン化を同定する。
制御されたフレーム・トリップレットの診断により、DINOv3の機能は、Wan-VAE潜伏者よりもタスク状態の区別を保ちながら、視覚的なシフトによってより安定したままであることが示された。
予測された未来を補正する代わりに、DINOv3を将来予測と履歴検索のための共有意味表現として使用し、詳細なVAEダイナミクスを維持しつつ、アクションロバスト性を改善するためのセマンティック・テンポラルWAM(ST-WAM)を提案する。
そのDual-Space Future Experts(DSFE)は、将来のVAE潜伏者やDINOの特徴を共同で予測し、Cair(Current-Anchored Intent Retrieval)は、現在の視覚的文脈の下で最近のDINOの歴史からタスク関連エビデンスを検索する。
ST-WAMは、追加の具体的事前トレーニングやタスク固有のアノテーションなしでエンドツーエンドで訓練されており、推論時に明確な将来生成を必要としない。
LIBEROで98.7%、RoboTwin 2.0で92.8%を達成し、Fast-WAMと比較してゼロショットのLIBERO-Plusのパフォーマンスを21.3%改善し、25.8%から61.5%のビジュアルシフトで実世界の成功を2倍以上に向上させた。
これらの結果から, セマンティック・テンポラル・モデリングは, 頑健な操作のための画素生成力学を効果的に補完することを示した。
関連論文リスト
- FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation [14.178611843420683]
データ効率のよいVLA適応のための未来指向コンディショニングフレームワークFOCAを紹介する。
FOCAはタスク・グラウンドの将来の相互作用の埋め込みの明示的な予測と将来の目標観測への暗黙のアライメントを組み合わせている。
実験では、LIBEROで20回のデモを行い、FOCAが95.7%成功し、RoboCasaで7-12%改善し、実際のロボットで最大26%の絶対ゲインを達成している。
論文 参考訳(メタデータ) (2026-06-18T18:54:51Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution [27.399648455932397]
FUTURE-VLAは、長期制御と将来の予測をモノリシックなシーケンス生成タスクとして再構成する統一アーキテクチャである。
FUTURE-VLAはLIBEROで99.2%、RoboTwinで75.4%、現実世界のPiperプラットフォームで78.0%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-05T14:27:43Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model [102.60980325911106]
潜在時空間連鎖(CoT)を介して行動する前に効率的に推論できるフレームワークを提案する。
具体的には,未来の視覚力学,3次元構造情報,ロボットの受容状態をモデル化したトークン効率の潜在CoT空間を導入し,時間的に一貫した暗黙的推論軌道を可能にするためにこれらの表現をさらに拡張する。
論文 参考訳(メタデータ) (2026-01-08T18:59:53Z) - Self-Regulated Learning for Egocentric Video Activity Anticipation [147.9783215348252]
自己制御学習(SRL)は、中間表現を連続的に制御し、現在のタイムスタンプのフレームにおける新しい情報を強調する表現を作り出すことを目的としている。
SRLは2つのエゴセントリックなビデオデータセットと2つの第三者のビデオデータセットにおいて、既存の最先端技術よりも大幅に優れています。
論文 参考訳(メタデータ) (2021-11-23T03:29:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。