論文の概要: CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
- arxiv url: http://arxiv.org/abs/2609.18462v2
- Date: Thu, 17 Sep 2026 01:35:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.763806
- Title: CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
- Title(参考訳): CSWAM:世界行動モデルにおけるアウト・オブ・ディストリビューション一般化のためのより良い因果意味表現
- Abstract要約: 本稿では,V-JEPA 2.1上に構築された因果的セマンティック・ワールド・アクション・モデル(CSWAM)について述べる。
V-JEPAは、外観特有の詳細に依存しない、意味的状態の変化と動きの時間的基底表現を提供する。
推論では、CSWAM条件は現在のビデオ状態にノイズを発し、セマンティックヒストリーを観察し、効率的なアクションのみの推論を保持する。
- 参考スコア(独自算出の注目度): 13.382056730999517
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: FastWAM-style world action models enable efficient action-only inference, but generalize poorly under visual distribution shifts. Their reconstruction-oriented representations emphasize appearance-specific details, limiting generalization to unseen scenes and objects. Without observation history, the model also lacks temporal evidence for robustly identifying task-relevant state changes and motion in unfamiliar visual conditions. To address these limitations, we present the Causal Semantic World Action Model (CSWAM), which augments FastWAM with a causal semantic expert built on V-JEPA 2.1. V-JEPA provides temporally grounded representations of semantic state changes and motion with less dependence on appearance-specific details. The expert learns their future evolution from a sparse history of current and past observations and shares the history-derived context with both the video and action streams through causal attention. At inference, CSWAM conditions action denoising on the current video state and observed semantic history, retaining efficient action-only inference. We conduct simulation and real-robot experiments to evaluate generalization under distribution shifts. With embodied pretraining, CSWAM raises Randomized success on RoboTwin 2.0 Clean-to-Randomized transfer from 10.16% to 45.18%, a gain of 35.02 percentage points over FastWAM. Across two real-robot tasks and three OOD difficulty levels, CSWAM improves average success over FastWAM by 42.5 percentage points, from 27.5% to 70.0%.
- Abstract(参考訳): FastWAMスタイルのワールドアクションモデルは、効率的なアクションのみの推論を可能にするが、視覚分布シフト下では一般化が不十分である。
彼らの再構成指向の表現は外観に特有な詳細を強調し、一般化は見えないシーンやオブジェクトに限られている。
観察履歴がなければ、このモデルは不慣れな視覚条件下でのタスク関連状態の変化や動きを確実に識別する時間的証拠も欠如している。
これらの制約に対処するため、我々は、V-JEPA 2.1上に構築された因果的セマンティックなセマンティック・ワールド・アクション・モデル(CSWAM)を提案する。
V-JEPAは、外観特有の詳細に依存しない、意味的状態の変化と動きの時間的基底表現を提供する。
専門家は、現在の観測と過去の観察のまばらな歴史から将来の進化を学び、因果的注意を通して、ビデオとアクションストリームの両方で歴史にまつわる文脈を共有する。
推論では、CSWAM条件は現在のビデオ状態にノイズを発し、セマンティックヒストリーを観察し、効率的なアクションのみの推論を保持する。
分布シフト下での一般化を評価するためにシミュレーションおよび実ロボット実験を行う。
プレトレーニングの実施により、CSWAMはRoboTwin 2.0におけるランダム化の成功率を10.16%から45.18%に引き上げ、FastWAMよりも35.02ポイント向上した。
2つの実際のロボットタスクと3つのOOD障害レベルの中で、CSWAMはFastWAMの平均成功率を27.5%から70.0%に42.5ポイント改善している。
関連論文リスト
- GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation [63.853929983870955]
本稿では,ジェニー・エンスペクタ法 2.0 (GE-Act 2.0) について紹介する。
制御指向オートエンコーダ(CoAE)、ワンステップビジュアルプランナー(SVP)、逆ダイナミクスモデル(IDM)を組み合わせている。
それらのコンポーネントは、知識に整合した選択最適化(KASO)で共同で訓練され、記録された行動に適合していると判断された予測された未来のみを選択することで、ミスマッチした監視を減らす。
論文 参考訳(メタデータ) (2026-09-04T17:16:48Z) - Vid2WAM: Distilling Video Diffusion Priors into World Action Models [59.28345153395937]
世界行動モデル(WAM)は、将来の視覚力学とアクションを共同でモデル化することで、ロボットポリシー学習を改善する。
大規模なビデオ基礎モデルからコンパクトなWAM学生へ視覚拡散を先取りするオフライン蒸留フレームワークであるVid2WAMを提案する。
Vid2WAMは、限られた専門家によるデモンストレーションにおいて、新しいタスクの一般化とデータ効率を向上させる。
論文 参考訳(メタデータ) (2026-08-09T08:02:49Z) - ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts [24.959404195743744]
トレーニング・ディストリビューション・ハロシン化(英語: Training-Distribution Hallucination)とは、現在のシーンに忠実に留まらず、視覚的に変化した観察で条件付けられた未来がトレーニング領域の内容に幻覚を与える現象である。
本稿では,DINOv3 を将来予測と履歴検索のための共有意味表現として用き,詳細なVAE のダイナミクスを維持しつつ,アクションロバスト性を向上させるセマンティック・テンポラル WAM (ST-WAM) を提案する。
論文 参考訳(メタデータ) (2026-07-31T03:44:56Z) - From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model [76.88595728131288]
VLA(Vision-Language-Action)モデルは、分散シフト時にしばしば性能劣化に悩まされる。
時間的コヒーレントな行動表現の学習を通じて堅牢な操作を容易にするフレームワークである textbfBehaviorVLA を提案する。
RoboTwin 2.0、LIBERO、CALVINの実験では、最先端の成功率は58%、98%、および4.36(Avg.Len)である。
論文 参考訳(メタデータ) (2026-05-21T16:14:19Z) - V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning [46.89986408533846]
V-JEPA 2.1は、画像とビデオの両方の濃密で高品質な視覚表現を学習する自己教師型モデルのファミリーである。
V-JEPA 2.1は、密集した視覚的理解と世界モデリングにおける最先端の進歩を示す。
論文 参考訳(メタデータ) (2026-03-15T17:02:40Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - World Action Models are Zero-shot Policies [111.91938055103633]
本稿では,予めトレーニングされたビデオ拡散バックボーン上に構築されたワールドアクションモデル(WAM)であるDreamZeroを紹介する。
ビデオとアクションを共同でモデリングすることで、DreamZeroは異種ロボットデータから多様なスキルを効果的に学習する。
ビデオのみによる他のロボットや人間によるデモは、目に見えないタスクのパフォーマンスに対して42%以上の相対的な改善をもたらす。
論文 参考訳(メタデータ) (2026-02-17T15:04:02Z) - Robotic VLA Benefits from Joint Learning with Motion Image Diffusion [114.60268819583017]
VLA(Vision-Language-Action)モデルは、マルチモーダルな観察と指示を直接行動にマッピングすることで、ロボット操作において顕著な進歩を遂げた。
動き推論機能を備えたVLAモデルを強化する新しい戦略である動き画像拡散を用いた共同学習を提案する。
シミュレーションと実世界の両方の環境での実験により、モーション画像拡散による共同学習がpiシリーズVLAの成功率を97.5%に向上させることが示された。
論文 参考訳(メタデータ) (2025-12-19T19:07:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。