論文の概要: PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies
- arxiv url: http://arxiv.org/abs/2608.30378v2
- Date: Wed, 02 Sep 2026 09:43:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.745077
- Title: PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies
- Title(参考訳): PAVE:World-Action Policiesの予測アライメントとバリューガイドによる進化
- Authors: Botong Zhao, Fang Yu, Tim Yu, Senhua Zhu, Xinyuan Chen, Yue Lu,
- Abstract要約: 直接視覚-言語-アクションポリシーは、継続的なロボット動作を効率的に生成するが、標準的な行動クローンは2つの相補的なギャップを残している。
結果に依存しない予測学習と結果認識型政策改善を組み合わせた,直接的な世界行動政策である方法を紹介する。
- 参考スコア(独自算出の注目度): 17.87859739145508
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct vision-language-action policies generate continuous robot actions efficiently, but standard behavior cloning leaves two complementary gaps: their representations are not explicitly required to describe how the scene evolves over multiple time scales, and deployment trajectories of unequal quality are often reused without separating useful dynamics from undesirable behavior. We introduce \method, a direct world-action policy that combines outcome-agnostic predictive learning with outcome-aware policy improvement. \method first retains a local fixed-offset JEPA objective and adds trajectory-relative multi-horizon transition alignment at 25%, 50%, 75%, and 100% of the remaining episode. These training-only targets require the current policy representation to preserve both local physical changes and longer-range task progress, without supplying explicit future tokens to the action head. \method then trains an independent distributional value critic on cumulative deployment trajectories, computes action-chunk-aligned $N$-step advantages, and converts them into positive, negative, or null text conditions for a flow-matching actor. Thus, every valid trajectory can teach what physically happened, while the actor is deployed only under the condition associated with relatively better actions. The multi-horizon predictor and critic are removed from online execution, preserving direct action generation from the current observation, language instruction, and proprioception. \redclaim{Across the three simulation benchmarks, \method achieves the strongest overall performance while preserving the direct actor's online execution path.}
- Abstract(参考訳): 直接的な視覚-言語-アクションポリシーは、継続的なロボット動作を効率的に生成するが、標準的な行動クローニングは2つの相補的なギャップを残している。
結果に依存しない予測学習と結果認識型政策改善を組み合わせた,直接的な世界行動政策である‘method’を導入する。
最初は局所的な固定オフセットJEPAの目標を維持し、残りのエピソードの25%、50%、75%、100%の軌道相対的な多水平遷移アライメントを追加する。
これらのトレーニングのみのターゲットは、アクションヘッドに明示的な将来トークンを供給せずに、ローカルな物理的変化と長距離タスクの進捗の両方を保存するために現在のポリシー表現を必要とします。
次に、Shamethodは累積デプロイメントトラジェクトリに対して独立した分散価値評価をトレーニングし、アクションチャンクに整合した$N$-stepの利点を計算し、フローマッチングアクターに対して正、負、または無効のテキスト条件に変換する。
したがって、すべての有効な軌跡は物理的に何が起こったかを教えることができ、アクターは比較的優れたアクションに関連する条件下でのみ展開される。
マルチホライズン予測器と批評家はオンライン実行から排除され、現在の観察から直接アクション生成、言語指導、プロプリセプションを保存する。
3つのシミュレーションベンチマークの中で、Shamethodは、直接アクターのオンライン実行パスを保持しながら、最も高い全体的なパフォーマンスを達成する。
※
関連論文リスト
- Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning [53.77164209208635]
本稿では,視覚的整合性と軌跡アライメントを用いて,より広い行動分布を探索するWorldEchoを紹介する。
本稿では,3つの軸に沿った行動(分布カバレッジ,表現的接地,介入効果のアライメント)を強化するWorldSyncを提案する。
RoboTwinベンチマークと実ロボットタスクの実験は、WorldSyncがWorldEchoメトリクスを改善し、反復的なポリシー改善のためのより信頼性の高いシミュレータとして機能していることを示している。
論文 参考訳(メタデータ) (2026-08-25T17:59:49Z) - Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning [1.96243636752331]
実際のロボットのためのHIL(Human-in-the-loop)オンライン強化学習は、人間の介入を素早く吸収し、人間の先行性を超えて改善し続けなければならない。
本稿では,この2つのコンポーネントをベースとしたトレーニング手法を提案する。
emphMC Q-chunk 批判者は、モンテカルロへのチャンクレベルのアクション値をリプレイバッファから返します。
emphmax-Qの選択的な模倣は、各状態において、現在のポリシーアクションとバッファサンプルの間の高額なQ$アクションを模倣することでアクターを更新する。
論文 参考訳(メタデータ) (2026-08-15T07:13:59Z) - PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation [17.66354304197193]
政策改善には段階的な信用信号が要求され、タスクを進行させる行動と停滞または後退する行動とを区別する。
PACEは,長期操作のポストトレーニングのためのクレジットアサインメントフレームワークである。
論文 参考訳(メタデータ) (2026-08-15T04:25:16Z) - Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement [27.695600755960736]
自己誘導型フローマッチングポリシであるForesightFlowを紹介した。
それぞれの生成されたアクションチャンクを、学習された成功可能性軌道で拡張する。
候補アクションをスコア付けし、外部の批評家なしで$K$の推論を可能にする。
論文 参考訳(メタデータ) (2026-06-03T14:49:35Z) - Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry [46.0185525503119]
Implicit Drifting Policy (IDP)は、ロボット制御のための一段階の模倣学習フレームワークである。
IDPは、明示的なベクトル場推定なしでポリシー学習にドリフトの訓練時間補正をもたらす。
論文 参考訳(メタデータ) (2026-05-31T08:39:57Z) - Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning [10.037416068775853]
本稿では,多段階フローマッチングポリシと蒸留ワンステップアクタを結合したガイドフローポリシーを提案する。
アクターは、重み付けされた振る舞いのクローンを通じてフローポリシーを指示し、データセットから高価値なアクションのクローンに集中する。
この相互誘導により、GFPは144の状態およびピクセルベースのタスクで最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-12-03T17:05:58Z) - Dense Policy: Bidirectional Autoregressive Learning of Actions [51.60428100831717]
本稿では,行動予測における自己回帰的政策の新たなパラダイムを確立するために,Dense Policyと呼ばれる双方向拡張学習手法を提案する。
軽量なエンコーダのみのアーキテクチャを使用して、アクションシーケンスを初期単一フレームからターゲットシーケンスへ粗い方法で反復的に展開する。
実験により、我々の密集した政策は自己回帰学習能力に優れており、既存の全体的生成ポリシーを超越できることが示された。
論文 参考訳(メタデータ) (2025-03-17T14:28:08Z) - Let Offline RL Flow: Training Conservative Agents in the Latent Space of
Normalizing Flows [58.762959061522736]
オフライン強化学習は、追加の環境相互作用なしに、事前に記録された、固定されたデータセット上でポリシーをトレーニングすることを目的としている。
我々は、最近、潜在行動空間における学習ポリシーを基礎として、生成モデルの構築に正規化フローの特別な形式を用いる。
提案手法が最近提案したアルゴリズムより優れていることを示すため,様々な移動タスクとナビゲーションタスクについて評価を行った。
論文 参考訳(メタデータ) (2022-11-20T21:57:10Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。