論文の概要: PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration
- arxiv url: http://arxiv.org/abs/2607.16602v1
- Date: Sat, 18 Jul 2026 02:42:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.19423
- Title: PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration
- Title(参考訳): PAVXploreRL:アクション探索による物理アクション・ビジュアル世界モデル強化学習
- Authors: Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee,
- Abstract要約: アクション条件付き世界モデルは、スケーラブルなポリシー評価ツールとして機能する、実施中のAIの重要なコンポーネントである。
PAVXploreRLは、事前訓練された潜在世界モデルに基づいて構築された強化学習フレームワークである。
実験の結果、PAVXploreRLはトレーニング済みのベースラインより一貫して優れていた。
- 参考スコア(独自算出の注目度): 14.41395827272972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Action-conditioned world models are a key component of embodied AI, serving as scalable policy evaluators that reduce reliance on expensive real-world rollouts. To accurately capture diverse action-induced dynamics, such models should satisfy three key objectives-Physical Plausibility (P), Action Adherence (A), and Visual Fidelity (V), collectively referred to as PAV-while remaining robust to both in-distribution (ID) expert demonstrations and out-of-distribution (OOD) actions. However, existing methods primarily rely on ID action-video pairs and pixel-level reconstruction losses, which do not explicitly optimize PAV objectives and generalize poorly beyond expert data. To address this, we propose PAVXploreRL, a reinforcement learning framework built on a pretrained latent world model that explicitly optimizes PAV objectives through reward-driven training. To improve action generalization, our method jointly leverages ID trajectories and noise-driven OOD action exploration, without paired video supervision. Experiments show that PAVXploreRL consistently outperforms pretrained baselines, achieving a 5.6% average gain across benchmarks and producing higher-quality PAV properties. As a policy evaluator, it also yields more reliable performance estimates and reduces the overestimation bias of prior expert-only world models such as Ctrl-World. Code: https://github.com/Social-AI-Studio/PAVXploreRL
- Abstract(参考訳): アクション条件付き世界モデルは、高価な現実世界のロールアウトへの依存を減らすスケーラブルなポリシー評価ツールとして機能する、実施済みAIの重要なコンポーネントである。
多様な行動誘発動態を正確に把握するためには、これらのモデルはP(Physical Plausibility)、A(A)、V(Visual Fidelity)の3つの重要な目標を満たす必要がある。
しかし、既存の手法は、主にIDアクションビデオ対とピクセルレベルの再構成損失に依存しており、PAVの目的を明示的に最適化せず、専門家データを超えて一般化が不十分である。
そこで本稿では,PAVXploreRLを提案する。PAVXploreRLは,事前学習された潜在世界モデルに基づいて構築された強化学習フレームワークで,報奨駆動トレーニングによってPAV目標を明示的に最適化する。
動作の一般化を改善するために,ペアビデオの監視なしに,IDトラジェクトリとノイズ駆動型OOD動作探索を併用する。
実験の結果、PAVXploreRLはトレーニング済みのベースラインを一貫して上回り、ベンチマークの平均利得を5.6%達成し、高品質のPAV特性を生み出した。
政策評価器として、より信頼性の高い性能推定値が得られ、Ctrl-Worldのような従来の専門家専用世界モデルの過大評価バイアスが低減される。
コード:https://github.com/Social-AI-Studio/PAVXploreRL
関連論文リスト
- ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving [19.081114003415863]
我々は,意味のある探索と密集した監視を実現するために,統合された理解・生成の枠組みを提案する。
我々は、高密度世界モデリングの目的として、将来のRGBと深度画像生成による軌道予測を強化した。
我々は、この探索信号を安全性の高い報酬に組み込んで、ポリシーを最適化する。
論文 参考訳(メタデータ) (2026-04-03T04:14:13Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model [31.013109374489442]
VLA(Vision-Language-Action)モデルは、最近、具体化されたタスク間で強力なパフォーマンスを示した。
本稿では,拡散行動専門家が複数の候補アクションチャンクをドラフトし,VLMが各候補を1つの前方パスに1つの難易度基準でスコア付けして1つを選択することを提案する。
マッチしたバックボーン、トレーニングデータ、アクション・チャンク長では、ADVは拡散ベースのベースラインよりも実世界の+4.3ポイント、+19.7ポイントで成功率を向上させる。
論文 参考訳(メタデータ) (2026-03-18T09:16:20Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model [87.75549463328836]
本研究の目的は、反復的なオンラインインタラクションにより、視覚言語アクション(VLA)モデルの性能と信頼性を向上させることである。
本稿では,実世界のロールアウトデータを用いて,世界モデルの忠実度を向上する簡易な反復改善アルゴリズムを提案する。
基本方針よりも39.2%の絶対成功率向上と、生成した合成ロールアウトによるトレーニングによる11.6%の改善を実現している。
論文 参考訳(メタデータ) (2026-02-12T15:21:47Z) - WorldCompass: Reinforcement Learning for Long-Horizon World Models [81.03997753254023]
この研究は、インタラクティブなビデオベースの世界モデルのための新しい強化学習(RL)フレームワークであるWorldを提示する。
本稿では,自己回帰ビデオ生成パラダイムに合わせた3つのコアイノベーションを紹介する。
様々なシナリオにおけるインタラクションの精度と視覚的忠実度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2026-02-09T18:59:47Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards [41.87267797252411]
視覚言語アクション(VLA)モデルは、最近様々な具体的タスクにおいて有望な性能を示したが、信頼性と一般化が不足している。
トレーニング済みのNORAバックボーンから構築したVLAモデルであるNORA-1.5について,フローマッチングに基づくアクションエキスパートを付加して紹介する。
堅牢性とタスクの成功をさらに改善するため、我々はVLAポリシーの訓練後の報酬モデルを開発した。
論文 参考訳(メタデータ) (2025-11-18T16:55:48Z) - Safe, Efficient, and Robust Reinforcement Learning for Ranking and Diffusion Models [2.231476498067998]
論文は、強化学習手法が安全で、サンプル効率が高く、堅牢であるようにどのように設計できるかを調査する。
コンテキスト帯域RLの統一的な視点から判断されたこの作業は、ランキングとレコメンデーション、テキストから画像への拡散モデルという2つの主要なアプリケーション領域に対処する。
論文 参考訳(メタデータ) (2025-10-17T08:37:38Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - Reinforcement Learning with Inverse Rewards for World Model Post-training [29.19830208692156]
ビデオワールドモデルにおける動作追跡を改善するために,逆回帰を用いた強化学習を提案する。
RLIRは、逆ダイナミクスモデルを用いて生成されたビデオから入力アクションを復元することにより、検証可能な報酬信号を導出する。
論文 参考訳(メタデータ) (2025-09-28T16:27:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。