論文の概要: VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models
- arxiv url: http://arxiv.org/abs/2603.19370v1
- Date: Thu, 19 Mar 2026 18:04:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.830164
- Title: VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models
- Title(参考訳): VAMPO:ビデオアクションモデルにおける視覚ダイナミクス改善のためのポリシー最適化
- Authors: Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang,
- Abstract要約: 政策最適化により映像アクションモデルにおける視覚力学を直接改善する後学習フレームワークであるVAMPOを提案する。
私たちのキーとなるアイデアは、シーケンシャルな決定プロセスとしてマルチステップの認知を定式化し、専門家の視覚力学上で定義された認知の報酬を最適化することです。
多様なシミュレートされた実世界の操作タスクにまたがって、VAMPOはタスク関連視覚力学を改善し、より下流でのアクション生成とより強力な一般化をもたらす。
- 参考スコア(独自算出の注目度): 46.94937828558026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video action models are an appealing foundation for Vision--Language--Action systems because they can learn visual dynamics from large-scale video data and transfer this knowledge to downstream robot control. Yet current diffusion-based video predictors are trained with likelihood-surrogate objectives, which encourage globally plausible predictions without explicitly optimizing the precision-critical visual dynamics needed for manipulation. This objective mismatch often leads to subtle errors in object pose, spatial relations, and contact timing that can be amplified by downstream policies. We propose VAMPO, a post-training framework that directly improves visual dynamics in video action models through policy optimization. Our key idea is to formulate multi-step denoising as a sequential decision process and optimize the denoising policy with rewards defined over expert visual dynamics in latent space. To make this optimization practical, we introduce an Euler Hybrid sampler that injects stochasticity only at the first denoising step, enabling tractable low-variance policy-gradient estimation while preserving the coherence of the remaining denoising trajectory. We further combine this design with GRPO and a verifiable non-adversarial reward. Across diverse simulated and real-world manipulation tasks, VAMPO improves task-relevant visual dynamics, leading to better downstream action generation and stronger generalization. The homepage is https://vampo-robot.github.io/VAMPO/.
- Abstract(参考訳): ビデオアクションモデルは、大規模ビデオデータから視覚力学を学習し、この知識を下流のロボット制御に伝達できるため、視覚-言語系にとって魅力的な基盤である。
しかし、現在の拡散に基づくビデオ予測器は、操作に必要な精度クリティカルな視覚力学を明示的に最適化することなく、グローバルに妥当な予測を促進する、確率代理目的で訓練されている。
この客観的なミスマッチは、しばしば、下流のポリシーによって増幅されるオブジェクトのポーズ、空間的関係、接触タイミングの微妙なエラーを引き起こす。
政策最適化により映像アクションモデルにおける視覚力学を直接改善する後学習フレームワークであるVAMPOを提案する。
我々のキーとなる考え方は、逐次決定プロセスとして多段階の認知を定式化し、潜在空間における専門的な視覚力学上で定義された報酬で認知ポリシーを最適化することである。
この最適化を実用化するために,第1段階のみ確率性を注入するEuler Hybrid samplerを導入し,残りの軌道のコヒーレンスを保ちながら,トラクタブルな低分散政策勾配推定を可能にする。
さらに、この設計をGRPOと検証可能な非敵報酬と組み合わせる。
多様なシミュレートされた実世界の操作タスクにまたがって、VAMPOはタスク関連視覚力学を改善し、より下流でのアクション生成とより強力な一般化をもたらす。
ホームページはhttps://vampo-robot.github.io/VAMPO/。
関連論文リスト
- GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Reinforcement Learning with Inverse Rewards for World Model Post-training [29.19830208692156]
ビデオワールドモデルにおける動作追跡を改善するために,逆回帰を用いた強化学習を提案する。
RLIRは、逆ダイナミクスモデルを用いて生成されたビデオから入力アクションを復元することにより、検証可能な報酬信号を導出する。
論文 参考訳(メタデータ) (2025-09-28T16:27:47Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - Pre-Trained Video Generative Models as World Simulators [59.546627730477454]
本研究では,事前学習した映像生成モデルを制御可能な世界シミュレータに変換するための動的世界シミュレーション(DWS)を提案する。
条件付き動作と生成した視覚的変化の正確なアライメントを実現するために,軽量で普遍的な動作条件付きモジュールを導入する。
実験により、DWSは拡散モデルと自己回帰変換モデルの両方に汎用的に適用可能であることが示された。
論文 参考訳(メタデータ) (2025-02-10T14:49:09Z) - Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback [130.090296560882]
テキスト・ビデオ・モデルにおけるオブジェクトの動的性を高めるためのフィードバックの利用について検討する。
本手法は,動的インタラクションにおける映像品質の大幅な向上を駆動するバイナリAIフィードバックを用いて,多様な報酬を効果的に最適化できることを示す。
論文 参考訳(メタデータ) (2024-12-03T17:44:23Z) - Continual Visual Reinforcement Learning with A Life-Long World Model [55.05017177980985]
視覚力学モデリングのための新しい連続学習手法を提案する。
まず,タスク固有の潜在ダイナミクスを学習する長寿命世界モデルを紹介する。
そして,探索・保守的行動学習手法を用いて,過去の課題に対する価値推定問題に対処する。
論文 参考訳(メタデータ) (2023-03-12T05:08:03Z) - Dyna-DepthFormer: Multi-frame Transformer for Self-Supervised Depth
Estimation in Dynamic Scenes [19.810725397641406]
シーン深度と3次元運動場を協調的に予測する新しいDyna-Depthformerフレームワークを提案する。
まず,多視点の相関を一連の自己・横断的層を通じて活用し,深度特徴表現の強化を図る。
第2に,動的物体の運動場をセマンティック・プレセプションを使わずに推定するワーピングに基づく運動ネットワークを提案する。
論文 参考訳(メタデータ) (2023-01-14T09:43:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。