論文の概要: ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.08168v1
- Date: Thu, 09 Apr 2026 12:28:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.91128
- Title: ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
- Title(参考訳): ViVa: ロボット強化学習のためのビデオ生成価値モデル
- Authors: Jindi Lv, Hao Li, Jie Li, Yifei Nie, Fankun Kong, Yang Wang, Xiaofeng Wang, Zheng Zhu, Chaojun Ni, Qiuping Deng, Hengtao Li, Jiancheng Lv, Guan Huang,
- Abstract要約: 視覚言語アクション(VLA)モデルは、大規模な事前訓練を通じて高度なロボット操作を行うが、部分的な観測可能性と遅延したフィードバックのため、現実の展開は困難なままである。
本稿では、事前学習したビデオ生成器を付加して値推定を行うビデオ生成値モデルViVaを提案する。
- 参考スコア(独自算出の注目度): 44.25872641897863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) models have advanced robot manipulation through large-scale pretraining, but real-world deployment remains challenging due to partial observability and delayed feedback. Reinforcement learning addresses this via value functions, which assess task progress and guide policy improvement. However, existing value models built on vision-language models (VLMs) struggle to capture temporal dynamics, undermining reliable value estimation in long-horizon tasks. In this paper, we propose ViVa, a video-generative value model that repurposes a pretrained video generator for value estimation. Taking the current observation and robot proprioception as input, ViVa jointly predicts future proprioception and a scalar value for the current state. By leveraging the spatiotemporal priors of a pretrained video generator, our approach grounds value estimation in anticipated embodiment dynamics, moving beyond static snapshots to intrinsically couple value with foresight. Integrated into RECAP, ViVa delivers substantial improvements on real-world box assembly. Qualitative analysis across all three tasks confirms that ViVa produces more reliable value signals, accurately reflecting task progress. By leveraging spatiotemporal priors from video corpora, ViVa also generalizes to novel objects, highlighting the promise of video-generative models for value estimation.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、大規模な事前訓練を通じて高度なロボット操作を行うが、部分的な観測可能性と遅延したフィードバックのため、現実の展開は困難なままである。
強化学習(Reinforcement learning)は、タスクの進捗を評価し、ポリシー改善を導くバリュー関数を通じてこの問題に対処する。
しかしながら、視覚言語モデル(VLM)上に構築された既存の価値モデルは、時間的ダイナミクスを捉えるのに苦労し、長期的タスクにおける信頼性の高い価値推定を損なう。
本稿では,事前学習したビデオ生成器を付加して価値推定を行うビデオ生成値モデルViVaを提案する。
現在の観察とロボットの受容を入力として、ViVaは将来の受容と現在の状態のスカラー値を共同で予測する。
事前学習したビデオジェネレータの時空間的先行性を活用することで,本手法は期待されるエンボディメントダイナミクスの値推定を基礎とし,静的スナップショットを超えて,本質的な値とフォレストとのカップリングを行う。
RECAPに統合されたViVaは、現実世界のボックスアセンブリを大幅に改善する。
3つのタスクの質的分析により、Vivaはタスクの進捗を正確に反映し、より信頼性の高い値信号を生成する。
ビデオコーパスからの時空間的先行性を活用することで、Vivaは新たなオブジェクトに一般化し、価値推定のためのビデオ生成モデルの約束を強調する。
関連論文リスト
- ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics [46.912038830356714]
本稿では,ロボット作業の進捗を推定する時間的価値関数TOPRewardを紹介する。
130以上の異なる実世界のタスクに対するゼロショット評価では、TOPRewardはQwen3-VL上で0.947の平均値順序相関(VOC)を達成する。
我々は,TOPRewardがダウンストリームアプリケーションのための汎用ツールであることを示す。
論文 参考訳(メタデータ) (2026-02-22T19:25:48Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention [24.446865513189433]
VLA(Vision-Language-Action)モデルは、AIタスクを具現化する際、顕著な能力を示した。
現行のVLAモデルは、通常、各時間ステップごとに独立して濃密な視覚入力を処理する。
このアプローチは、タスクをマルコフ決定プロセス(MDP)として暗黙的にモデル化する。
本稿では,部分観測可能なマルコフ決定プロセス(POMDP)の観点から問題を再構成し,AVA-VLAという新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-24T10:22:28Z) - VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models [49.78447737655287]
VITAはゼロショット値関数学習法であり、テスト時間適応によって両方の能力を増強する。
オフライン強化学習において,VITAのゼロショット値推定が報酬形成に有効であることを示す。
論文 参考訳(メタデータ) (2025-06-11T18:05:33Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z) - Vision Language Models are In-Context Value Learners [89.29486557646624]
本稿では、視覚言語モデル(VLM)に埋め込まれた世界的知識を活用してタスクの進捗を予測する普遍的価値関数推定器である生成価値学習(GVL)を提案する。
ロボットやタスク固有のトレーニングがなければ、GVLは300以上の異なる現実世界のタスクに対して、ゼロショットと数ショットの効果的な値をインコンテキストで予測することができる。
論文 参考訳(メタデータ) (2024-11-07T09:17:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。