論文の概要: WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2511.09515v1
- Date: Thu, 13 Nov 2025 01:59:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-13 22:34:54.605813
- Title: WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- Title(参考訳): WMPO:ビジョンランゲージ・アクションモデルのための世界モデルに基づく政策最適化
- Abstract要約: VLA(Vision-Language-Action)モデルは汎用ロボット操作の強力な可能性を示している。
WMPO(World-Model-based Policy Optimization)は、実環境と対話することなく、オンラインVLAのための原則的フレームワークである。
- 参考スコア(独自算出の注目度): 22.01666177489494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have shown strong potential for general-purpose robotic manipulation, but their reliance on expert demonstrations limits their ability to learn from failures and perform self-corrections. Reinforcement learning (RL) addresses these through self-improving interactions with the physical environment, but suffers from high sample complexity on real robots. We introduce World-Model-based Policy Optimization (WMPO), a principled framework for on-policy VLA RL without interacting with the real environment. In contrast to widely used latent world models, WMPO focuses on pixel-based predictions that align the "imagined" trajectories with the VLA features pretrained with web-scale images. Crucially, WMPO enables the policy to perform on-policy GRPO that provides stronger performance than the often-used off-policy methods. Extensive experiments in both simulation and real-robot settings demonstrate that WMPO (i) substantially improves sample efficiency, (ii) achieves stronger overall performance, (iii) exhibits emergent behaviors such as self-correction, and (iv) demonstrates robust generalization and lifelong learning capabilities.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、汎用ロボット操作の強力な可能性を示しているが、専門家によるデモンストレーションへの依存は、失敗から学び、自己補正を行う能力を制限している。
強化学習(RL)は、物理的環境との自己改善的な相互作用を通じてこれらに対処するが、実際のロボットでは高いサンプルの複雑さに悩まされる。
WMPO(World-Model-based Policy Optimization)は、実環境と対話することなく、オンラインVLA RLの原則的フレームワークである。
広く使われている潜在世界モデルとは対照的に、WMPOは「想像された」軌跡とWebスケールの画像で事前訓練されたVLA特徴とを一致させるピクセルベースの予測に焦点を当てている。
重要な点として、WMPOは、しばしば使用されるオフ・ポリティィ法よりも強力なパフォーマンスを提供する、オン・ポリティィGRPOの実行を可能にする。
WMPOのシミュレーションと実ロボット設定における大規模な実験
i) 試料効率を大幅に改善する。
(ii)全体的なパフォーマンスが向上する。
(三)自己訂正等の突発的な行動を示すこと、
(iv)は、堅牢な一般化と生涯学習能力を示す。
関連論文リスト
- HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy [22.534022126501373]
汎用ロボット政策は、ロボット操作タスクにまたがる強力な一般化を実証している。
リアルロボットのオンライン強化学習による視覚言語アクション(VLA)ポリシーの改善
世界モデルは、想定されたロールアウトでポリシー最適化を可能にすることで、有望な代替手段を提供する。
本研究では,世界モデルを用いたVLA政策後トレーニングのための閉ループ強化学習パイプラインであるHaWMPOを提案する。
論文 参考訳(メタデータ) (2026-09-09T09:33:25Z) - Q-Learning With World Models [69.63968749241239]
本稿では,Qラーニング上の実測軌道上でテスト時間探索を行い,高価値な行動を選択するために世界モデルを活用するフレームワークを提案する。
QWMは, 試料効率と性能の両方において, 従来の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2026-08-17T22:00:42Z) - HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning [15.872908522637957]
本稿では,VLA(Vision-Language-Action)モデルのための,プラグイン・アンド・プレイファインチューニングパイプラインを提案する。
VLA生成したアクションを統一インターフェースとして概念化し、残留ポリシーをトレーニングする。
オンラインのRLトレーニングを1.5時間以内に行うと、実際のロボットの平均成功率は95%を超えます。
論文 参考訳(メタデータ) (2026-06-22T05:07:08Z) - Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training [19.013714390803052]
あるアプローチは、学習した世界モデルを生成シミュレータとして扱い、「想像」内での政策最適化を可能にする
しかしながら、LIBEROベンチマークのような特定の環境のシミュレータとしてデプロイされる場合、既存のWorld Modelは一般化が貧弱で長い水平誤差の蓄積に悩まされることが多い。
我々はこれらの問題を緩和するために、堅牢なワールドモデルフレームワークであるSwordを提案する。
論文 参考訳(メタデータ) (2026-05-08T05:54:33Z) - Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models [35.944951371813296]
VLA(Vision-Language-Action)モデルは、ロボット制御の強力な一般化を示すが、強化学習(RL)を用いてそれらを微調整することは、現実世界の相互作用のコストと安全性のリスクに制約される。
VLAファインタニングにおけるこれらの問題に対処するための実践的なフレームワークであるVLA-MBPOを提案する。
データ効率のよい世界モデリングのための統一マルチモーダルモデルへの適応 (i) マルチビュー整合性を実現するためのインターリーブビューデコーディング機構 (ii) エラー合成を緩和するためのチャンクレベル分岐ロールアウト (iii) の3つの主要な設計選択がある。
論文 参考訳(メタデータ) (2026-03-21T02:44:39Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL [30.884160045861616]
我々は、VLAポリシーの訓練後、信頼性の高い世界モデルに基づく強化学習フレームワークであるWoVRを提案する。
制御可能なアクション条件付きビデオワールドモデルによってロールアウト安定性を向上させる。
また、Keyframe-evolutiond Rolloutsによる効果的なエラー深度を低減するために、想像上のインタラクションを再確認する。
論文 参考訳(メタデータ) (2026-02-15T03:48:20Z) - VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model [87.75549463328836]
本研究の目的は、反復的なオンラインインタラクションにより、視覚言語アクション(VLA)モデルの性能と信頼性を向上させることである。
本稿では,実世界のロールアウトデータを用いて,世界モデルの忠実度を向上する簡易な反復改善アルゴリズムを提案する。
基本方針よりも39.2%の絶対成功率向上と、生成した合成ロールアウトによるトレーニングによる11.6%の改善を実現している。
論文 参考訳(メタデータ) (2026-02-12T15:21:47Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - From Word to World: Can Large Language Models be Implicit Text-based World Models? [82.47317196099907]
エージェント強化学習は、経験駆動のスケーリングにますます依存している。
世界モデルは、シミュレートされた経験を通して学習効率を改善する潜在的方法を提供する。
大規模言語モデルがこの役割を確実に果たせるか,どのような条件でエージェントに有意義な利益をもたらすかを検討する。
論文 参考訳(メタデータ) (2025-12-21T17:28:42Z) - Learning Generalizable Visuomotor Policy through Dynamics-Alignment [13.655111993491674]
ビデオ予測モデルを利用した最近のアプローチは、大規模データセットからリッチな表現を学習することで、有望な結果を示している。
本稿では,ダイナミックス予測をポリシ学習に統合するDAP(Dynamics-Aligned Flow Matching Policy)を提案する。
提案手法では,ポリシーモデルと動的モデルが相互に行動生成のフィードバックを与え,自己補正を実現し,一般化を向上するアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-10-31T02:29:33Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - Unified Vision-Language-Action Model [86.68814779303429]
我々は、視覚、言語、行動信号を離散トークンシーケンスとして自動回帰モデル化する、統一的でネイティブなマルチモーダルVLAモデルUniVLAを提案する。
提案手法は, CALVIN, LIBERO, Simplenv-Bridge など, 広く使用されているシミュレーションベンチマークにまたがって, 最新の結果を設定する。
さらに、現実世界のALOHA操作と自律運転に適用可能であることを実証する。
論文 参考訳(メタデータ) (2025-06-24T17:59:57Z) - ROSA: Harnessing Robot States for Vision-Language and Action Alignment [24.426285156386715]
VLM(Vision-Language Models)は、エンドツーエンドのロボット制御において大きな進歩を遂げた。
本稿では,ロボットの状態推定を利用して視覚言語と行動空間のアライメントを改善する新しいトレーニングパラダイムROSAを提案する。
論文 参考訳(メタデータ) (2025-06-16T16:34:20Z) - LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation [45.02469804709771]
拡散モデルを用いて将来の状態の潜伏空間を予測する世界モデルLaDi-WMを提案する。
LIBERO-LONGベンチマークでは,LaDi-WMが27.9%,現実シナリオでは20%,政策性能が著しく向上することを示した。
論文 参考訳(メタデータ) (2025-05-13T04:42:14Z) - Pre-Trained Video Generative Models as World Simulators [59.546627730477454]
本研究では,事前学習した映像生成モデルを制御可能な世界シミュレータに変換するための動的世界シミュレーション(DWS)を提案する。
条件付き動作と生成した視覚的変化の正確なアライメントを実現するために,軽量で普遍的な動作条件付きモジュールを導入する。
実験により、DWSは拡散モデルと自己回帰変換モデルの両方に汎用的に適用可能であることが示された。
論文 参考訳(メタデータ) (2025-02-10T14:49:09Z) - Strengthening Generative Robot Policies through Predictive World Modeling [25.45350191178106]
生成予測制御(英: Generative predictive Control、GPC)は、専門家による実証から生成拡散ベースのポリシーをクローンする学習制御フレームワークである。
GPCは、状態ベースの設定と視覚ベースの設定の両方において、振舞いのクローンを一貫して上回っている。
論文 参考訳(メタデータ) (2025-02-02T01:21:19Z) - Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics [50.191655141020505]
この研究は、長期水平予測、エラー蓄積、およびsim-to-real転送の課題に対処することで、モデルに基づく強化学習を前進させる。
スケーラブルでロバストなフレームワークを提供することで、現実のアプリケーションにおいて適応的で効率的なロボットシステムを実現することができる。
論文 参考訳(メタデータ) (2025-01-17T10:39:09Z) - ReCoRe: Regularized Contrastive Representation Learning of World Model [21.29132219042405]
対照的な教師なし学習と介入不変正規化器を用いて不変特徴を学習する世界モデルを提案する。
提案手法は,現状のモデルベースおよびモデルフリーのRL法より優れ,iGibsonベンチマークで評価された分布外ナビゲーションタスクを大幅に改善する。
論文 参考訳(メタデータ) (2023-12-14T15:53:07Z) - Addressing Optimism Bias in Sequence Modeling for Reinforcement Learning [5.09191791549438]
最近の研究は、主に決定論的なオフラインAtariとD4RLベンチマークにおいて、最先端の結果を達成した。
本稿では,この楽観主義バイアスに対処する手法を提案する。
シミュレーションにおいて,様々な自律運転タスクにおいて,提案手法の優れた性能を示す。
論文 参考訳(メタデータ) (2022-07-21T04:12:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。