論文の概要: DreamWAM: Beyond RGB Future Prediction for World Action Models
- arxiv url: http://arxiv.org/abs/2608.04996v1
- Date: Wed, 05 Aug 2026 16:04:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.981301
- Title: DreamWAM: Beyond RGB Future Prediction for World Action Models
- Title(参考訳): DreamWAM: ワールドアクションモデルにおけるRGBの将来予測を超えて
- Authors: Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang,
- Abstract要約: 本稿では,RGBを超える構造化世界モデリングとして,将来の予測を再構築するDreamWAMを紹介する。
DreamWAM は LIBERO の RGB のみのベースラインを一貫して改善している。
同じロバスト性は現実世界での操作にまで拡張され、DreamWAMの平均成功率は74.4%に達した。
- 参考スコア(独自算出の注目度): 41.050457488028314
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) learn action-relevant representations by predicting how the observed world will evolve. Most existing WAMs define this future in RGB space, where task-relevant state transitions are entangled with nuisance variations in texture, illumination, background, and viewpoint. We argue that WAMs should explicitly predict action-relevant future state rather than relying on RGB prediction alone. We introduce DreamWAM, which reformulates future prediction as structured world modeling beyond RGB, representing future states through complementary views of appearance, motion, geometry, and semantics. During training, DreamWAM combines joint latent denoising of RGB and motion with lightweight gated residual branches for geometry and semantics. Shared attention between VideoDiT and ActionDiT allows the action branch to learn from these future-state predictions, while all beyond-RGB supervision branches are disabled at inference and deployment remains RGB-only. Across both no-rollout and joint video-action inference, DreamWAM consistently improves the matched RGB-only baselines on LIBERO, from 97.30\% to 98.40\% and from 98.00\% to 98.90\%, respectively. The gains become larger under unseen LIBERO-Plus perturbations, from 51.36\% to 63.44\% and from 69.16\% to 75.47\%. The same robustness extends to real-world manipulation, where DreamWAM attains an average success rate of 74.4\% across unseen changes in lighting, background, and object layout, compared with 55.6\% for Fast-WAM-Joint. These results show that robust world-action learning depends not only on predicting the future, but on representing it in a form that matters for action. The code and models are publicly released at https://github.com/hustvl/DreamWAM.
- Abstract(参考訳): 世界行動モデル(WAM)は、観察された世界がどのように進化するかを予測することによって、行動関連表現を学ぶ。
ほとんどの既存のWAMは、タスク関連状態遷移がテクスチャ、照明、背景、視点のニュアンス変化と絡み合ったRGB空間でこの未来を定義している。
我々は、WAMはRGB予測のみに頼るのではなく、行動関連将来の状態を明示的に予測すべきであると主張する。
本稿では,外見,運動,幾何学,意味論の相補的な視点を通じて,将来の状態を表現し,RGBを超える構造化世界モデリングとして将来の予測を再構築するDreamWAMを紹介する。
トレーニング中、DreamWAMはRGBとモーションを併用し、幾何学と意味論のための軽量ゲート残枝を合成する。
VideoDiTとActionDiTの共通注意により、アクションブランチはこれらの将来の状態予測から学ぶことができる。
ノンロールとジョイントなビデオアクション推論の両方で、DreamWAMは一致したRGBのみのベースラインを 97.30\% から 98.40\% に、それぞれ 98.00\% から 98.90\% に改善している。
LIBERO-Plus摂動では51.36\%から63.44\%、69.16\%から75.47\%に上昇する。
同じロバスト性は現実の操作にまで拡張され、DreamWAMは光、背景、オブジェクトレイアウトの見知らぬ変更に対して平均74.4\%の成功率に達し、Fast-WAM-Jointでは55.6\%となる。
これらの結果は、堅牢な世界行動学習は、未来を予測することだけでなく、行動に重要な形で表現することにも依存していることを示している。
コードとモデルはhttps://github.com/hustvl/DreamWAM.comで公開されている。
関連論文リスト
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space [12.198811616220835]
World Action Models (WAM)は、将来の状態を予測するアクション生成を結合する。
本稿では,SG-WAMを提案する。SG-WAMは,政策由来の表現空間において,幾何学的行動条件の動的性を直接学習する自己誘導型フレームワークである。
論文 参考訳(メタデータ) (2026-08-02T17:25:08Z) - KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation [12.364119683882015]
KAM-WMは,凍結遅延ビデオワールドモデルから粗い方向の相互作用キューを抽出するフレームワークである。
LIBEROとRoboTwin2.0全体で、KAM-WMは平均で90.6%の成功、65.7%、22.4%の成功となっている。
論文 参考訳(メタデータ) (2026-07-06T04:17:15Z) - DIM-WAM: World-Action Modeling with Diverse Historical Event Memory [23.350949759638056]
世界行動モデルは、将来の視覚状態と行動を共同で予測することで、有望なロボット操作性能を示す。
マルチスケールの歴史的文脈、ローカルな未来のダイナミクス、グローバルなタスク進捗を統合したメモリ拡張ワールドアクションモデルであるDiM-WAMを紹介する。
RMBenchでは、DiM-WAMが平均28.4%、LingBot-VAが69.8%、メモリメモリのMem-0ベースラインが42.0%である。
論文 参考訳(メタデータ) (2026-06-26T03:17:39Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning [67.93052893044603]
本研究では,抽象的推論を伴う視覚的未来のシミュレーションを,モデルがどのように実行し,検証し,統合するかを考察する。
PF-OPSDは、教師側の特権的文脈としてのみ、地道な未来のビデオと回答を使用して、政治上の具体的な軌道を評価する。
論文 参考訳(メタデータ) (2026-06-02T13:07:49Z) - GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation [54.671815855499034]
視覚言語アクション(VLA)ポリシーは、セマンティック先行をアクション生成に転送することで、言語条件のロボット操作を進化させた。
標準的な行動模倣学習は、しばしば明示的な3次元空間情報、密集した幾何学的監督、将来の環境進化の十分なモデリングを欠いている。
フィードフォワード3Dガウス世界モデルプラグインである textbfGaussianDream を提案する。
論文 参考訳(メタデータ) (2026-05-20T05:51:30Z) - VFMF: World Modeling by Forecasting Vision Foundation Model Features [67.09340259579761]
本稿では,視覚基礎モデルの特徴空間における自己回帰フローマッチングを行う生成予測器を提案する。
この潜伏情報の方がPCAベースの代替案よりも効果的であることを示す。
一致したアーキテクチャと計算により、本手法はすべてのモダリティにおける回帰よりもシャープで正確な予測を生成する。
論文 参考訳(メタデータ) (2025-12-12T02:10:05Z) - HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy [61.668591984635846]
HAMLETは、行動予測中の歴史的状況に対応するためにビジョン・ランゲージ・アクションモデルを適用するためのフレームワークである。
HAMLETは、最先端のVLAを履歴認識ポリシーに変換することに成功していることを示す。
GR00T N1.5に加えて、HAMLETは歴史に依存した実世界のタスクで平均76.4%の成功率を達成した。
論文 参考訳(メタデータ) (2025-10-01T09:15:52Z) - FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation [31.743202585058302]
本稿では,3次元シーンフローを明示的な動作表現として採用したFlowDreamerを紹介する。
FlowDreamerは、モジュール化された性質にもかかわらず、エンドツーエンドで訓練されている。
論文 参考訳(メタデータ) (2025-05-15T08:27:16Z) - Handling Geometric Domain Shifts in Semantic Segmentation of Surgical RGB and Hyperspectral Images [67.66644395272075]
本稿では,幾何学的アウト・オブ・ディストリビューションデータに直面する場合の,最先端のセマンティックセマンティックセマンティクスモデルの最初の解析を行う。
本稿では, 汎用性を高めるために, 有機移植(Organ Transplantation)と呼ばれる拡張技術を提案する。
我々の拡張技術は、RGBデータに対して最大67%、HSIデータに対して90%のSOAモデル性能を改善し、実際のOODテストデータに対して、分配内パフォーマンスのレベルでのパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-08-27T19:13:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。