論文の概要: SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
- arxiv url: http://arxiv.org/abs/2608.01397v1
- Date: Sun, 02 Aug 2026 17:25:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.194048
- Title: SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
- Title(参考訳): SG-WAM:幾何学的政策空間における自己ガイド型世界モデリング
- Authors: Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu,
- Abstract要約: World Action Models (WAM)は、将来の状態を予測するアクション生成を結合する。
本稿では,SG-WAMを提案する。SG-WAMは,政策由来の表現空間において,幾何学的行動条件の動的性を直接学習する自己誘導型フレームワークである。
- 参考スコア(独自算出の注目度): 12.198811616220835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) couple action generation with prediction of future states. Their effectiveness depends on whether future dynamics are modeled in a space that is both aligned with action generation and sufficiently geometry-aware to capture where and how actions change the scene. Existing WAMs typically satisfy only part of this requirement, relying on either perceptually heavy observation-space targets or auxiliary latent spaces that are not jointly structured for action relevance and geometry. We propose SG-WAM, a self-guided framework that learns geometry-aware action-conditioned dynamics directly in the policy-derived representation space. SG-WAM introduces learnable dynamics tokens and a Self-Guided World Predictor that forecasts their future latent states conditioned on intervening robot actions. Prediction targets are generated by an exponential moving average copy of the same policy backbone, providing stable supervision within the representation family used by the action expert. Geometric supervision further structures the policy image-token representations, providing spatially grounded context for the dynamics tokens and yielding a future-alignment space that is both action-relevant and geometry-aware. Latent future prediction, geometric grounding, and flow-matching action generation are jointly optimized end-to-end in a unified framework. Built on a 0.9B model without large-scale embodied pretraining, SG-WAM achieves 98.5% average success on LIBERO and 73% on LIBERO-Plus, while outperforming strong baselines in both in-distribution and out-of-distribution real-world evaluations.
- Abstract(参考訳): World Action Models (WAM)は、将来の状態を予測するアクション生成を結合する。
それらの効果は、将来のダイナミクスがアクション生成と十分な幾何学的認識の両方に整合した空間でモデル化され、どこでどのようにアクションがシーンを変えるかにかかっている。
既存のWAMは、一般的にこの要件の一部のみを満たすものであり、知覚的に重い観測空間の標的か、アクションの関連性や幾何学について共同で構造化されていない補助的な潜在空間に依存している。
本稿では,SG-WAMを提案する。SG-WAMは,政策由来の表現空間において,幾何学的行動条件の動的性を直接学習する自己誘導型フレームワークである。
SG-WAMは学習可能なダイナミックストークンと、対話型ロボットアクションで条件付けられた将来の潜伏状態を予測するセルフガイド型世界予測器を導入している。
予測ターゲットは、同じポリシーバックボーンの指数平均コピーによって生成され、アクションエキスパートが使用する表現ファミリー内で安定した監視を提供する。
幾何学的監督は、ポリシーイメージ・トーケン表現をさらに構成し、ダイナミックストークンの空間的基盤付きコンテキストを提供し、アクション関連および幾何学的認識の両方を持つ将来のアライメント空間を提供する。
将来予測, 幾何学的接地, フローマッチング動作生成は, 統一されたフレームワークで協調的に最適化されたエンド・ツー・エンドである。
SG-WAMは、大規模な実施前トレーニングなしで0.9Bモデルに基づいており、LIBEROで98.5%、LIBERO-Plusで73%の平均的な成功を達成している。
関連論文リスト
- Geometric Action Model for Robot Policy Learning [68.6657929619782]
汎用ロボットポリシーは、オブジェクト、カメラ、ロボットアクションが3D物理世界でどのように相互作用するかを推論しながら、ユーザーの指示に従う必要がある。
最近の視覚言語行動モデル(VLA)とビデオ世界行動モデル(WAM)は、大規模基盤モデルから強い意味や時間的先行を継承する。
本稿では,言語条件の操作ポリシーであるGeometric Action Model (GAM)を提案する。
論文 参考訳(メタデータ) (2026-06-15T17:58:03Z) - GeoSem-WAM: Geometry- and Semantic-Aware World Action Models [13.18627268862803]
本稿では,幾何学的・意味的監督を通じて潜在表現を強化する構造化世界モデリングフレームワークを提案する。
提案手法は,テスト時の映像生成や自動ロールアウトを回避し,効率的な推論を行う。
論文 参考訳(メタデータ) (2026-06-02T05:48:02Z) - World Action Models: The Next Frontier in Embodied AI [123.5787299299832]
VLA(Vision-Language-Action)モデルは、具体的政策学習のための強力なセマンティックな一般化を実現している。
彼らは、物理的な世界が介入の下でどのように進化するかを明示的にモデル化することなく、リアクティブな観察から行動へのマッピングを学ぶ。
成長するこの制限には、世界モデル、環境ダイナミクスの予測モデル、アクション生成パイプラインを統合することで対処する。
論文 参考訳(メタデータ) (2026-05-12T13:10:52Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation [30.24537271257149]
STARRYは、空間的時間的予測と行動生成を整合させる世界モデル強化アクションジェネレーションポリシーである。
RoboTwin 2.0では、クリーンでランダムな設定で平均93.82% / 93.30%の成功を達成した。
これらの結果は,ロボット操作の空間的・時間的要求に対する行動中心型時空間世界モデリングの有効性を示す。
論文 参考訳(メタデータ) (2026-04-29T16:13:39Z) - LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation [45.02469804709771]
拡散モデルを用いて将来の状態の潜伏空間を予測する世界モデルLaDi-WMを提案する。
LIBERO-LONGベンチマークでは,LaDi-WMが27.9%,現実シナリオでは20%,政策性能が著しく向上することを示した。
論文 参考訳(メタデータ) (2025-05-13T04:42:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。