論文の概要: VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.00483v1
- Date: Wed, 01 Jul 2026 06:11:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.747049
- Title: VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning
- Title(参考訳): VLM-AR3L:強化学習における絶対的・相対的リワードのための視覚言語モデル
- Abstract要約: 本稿では,強化学習のための絶対報酬と相対報酬の両方を学習するフレームワークであるVLM-AR3Lを提案する。
VLM-AR3Lは、自然言語タスクゴールの文脈でエージェントの視覚的観察を解釈し、VLMの生成した選好ラベルから絶対値と相対値の両方の報酬を学習する。
VLM-AR3Lを古典的な制御、操作、オープンワールドの具体化タスクにまたがるベンチマークで評価し、特にMinecraftに焦点を当てた。
- 参考スコア(独自算出の注目度): 10.085586108389718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Designing effective reward functions remains a major challenge in reinforcement learning (RL), particularly in open-ended environments where task goals are abstract and difficult to quantify. In this work, we present VLM-AR3L, a framework that leverages Vision-Language Models (VLMs) to provide both absolute and relative rewards for RL. VLM-AR3L interprets an agent's visual observations in the context of a natural language task goal, and learns both absolute and relative rewards from VLM-generated preference labels. The absolute reward model predicts scalar evaluations for individual states, while the relative reward model compares consecutive observations to infer progress or regression toward the task goal. Their integration combines the stability of state-based evaluation with the robustness of comparative supervision. We evaluate VLM-AR3L across benchmarks spanning classic control, manipulation, and open-world embodied tasks, with a particular focus on Minecraft given its visual complexity and long-horizon decision-making requirements. Experimental results show that VLM-AR3L consistently outperforms prior VLM-based reward learning methods.
- Abstract(参考訳): 効果的な報酬関数の設計は、特にタスク目標が抽象的で定量化が難しいオープンエンド環境では、強化学習(RL)において依然として大きな課題である。
本稿では,ビジョン・ランゲージ・モデル(VLM)を活用するフレームワークであるVLM-AR3Lについて述べる。
VLM-AR3Lは、自然言語タスクゴールの文脈でエージェントの視覚的観察を解釈し、VLMの生成した選好ラベルから絶対値と相対値の両方の報酬を学習する。
絶対報酬モデルは個々の状態に対するスカラー評価を予測し、相対報酬モデルは連続した観測結果を比較し、タスク目標に対する進捗や回帰を推定する。
それらの統合は、状態に基づく評価の安定性と比較監督の堅牢性を組み合わせたものである。
VLM-AR3Lを古典的な制御、操作、オープンワールドの具体化タスクにまたがるベンチマークで評価する。
実験結果から, VLM-AR3L は, 従来の VLM に基づく報酬学習法よりも一貫して優れていた。
関連論文リスト
- StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning [12.563247818737294]
本稿では,視覚言語モデル(VLM)をオブジェクト検出やオブジェクト状態のローカライゼーションに適応させる新しいトレーニング手法を提案する。
我々は、このトレーニング戦略を活用して、細粒度オブジェクト表現を知覚し、学習するために設計された新しいモデルであるStateVLMを開発した。
また,ARLのないモデルと比較して,ARLはモデル性能を平均1.6%改善することを示した。
論文 参考訳(メタデータ) (2026-05-05T16:19:02Z) - LIBERO-X: Robustness Litmus for Vision-Language-Action Models [32.29541801424534]
この研究は、評価とデータの観点からVLAベンチマークを体系的に再考する。
LIBERO-Xは階層的評価プロトコルを特徴とするベンチマークで,3つのコア機能を対象とした進行難度レベルを示す。
代表的なVLAモデルを用いた実験では、累積摂動下での大幅な性能低下が示されている。
論文 参考訳(メタデータ) (2026-02-06T09:59:12Z) - Vision-aligned Latent Reasoning for Multi-modal Large Language Model [82.26044667101011]
VaLR(Vision-aligned Latent Reasoning)は、思考の連鎖の推論ステップの前に動的に視覚対応の潜在トークンを生成するフレームワークである。
VaLRは、MLLMの中間埋め込みを視覚エンコーダのものと整合させることにより、推論中の視覚的知識の保存を訓練する。
論文 参考訳(メタデータ) (2026-02-04T12:04:02Z) - VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models [43.09726338623949]
Vision-Language-Action(VLA)モデルは、事前訓練された大規模なVision-Language Models(VLM)をポリシーバックボーンに統合する。
本稿では、VLMの選択と能力が下流のVLAポリシーのパフォーマンスにどのように変換されるかという、体系的に研究されることは滅多にない。
VLM4VLAは、汎用的なVLMを、学習可能なパラメータの小さなセットのみを用いてVLAポリシーに変換する、最小限の適応パイプラインである。
論文 参考訳(メタデータ) (2026-01-06T09:58:24Z) - Revisiting the Learning Objectives of Vision-Language Reward Models [19.768973349254285]
一般化可能な報酬関数の学習は、インテリジェンスにおける中核的な課題である。
最近の研究は、人間の監督なしに高密度でドメインに依存しない報酬を得るために、対照的な視覚言語モデル(VLM)を活用している。
我々は、同じバックボーン、微調整データ、評価環境を備えた統合フレームワーク下で、最近のVLMベースの報酬モデルを評価する。
論文 参考訳(メタデータ) (2025-12-20T19:50:36Z) - Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning [124.48672228625821]
Vlaser - 相乗的具体的推論機能を備えたビジョン・ランゲージ・アクション・モデルを紹介する。
Vlaserは、様々な具体的推論ベンチマークで最先端のパフォーマンスを達成する。
提案手法は,WidowXベンチマークの最先端結果と,Google Robotベンチマークの競合性能を実現する。
論文 参考訳(メタデータ) (2025-10-13T05:51:22Z) - Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models [63.69856480318313]
AGILEは、対話的なプロセスとしてジグソー解決を定式化し、モデルが環境に徐々に関与できるようにする。
我々は AGILE がジグソータスクの性能を大幅に向上させることを示す。
また、9つの一般的な視覚タスクに対して強力な一般化を示し、平均3.1%の改善を実現した。
論文 参考訳(メタデータ) (2025-10-01T17:58:05Z) - Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme [36.34443944082215]
本研究は、視覚モデル(VLM)における強化学習(RL)のための透明でゼロスクラッチなフレームワークを導入する。
複数のモデルとデータセットにまたがって検証される、最小限の機能を備えた4ステップパイプラインを提供する。
さらに、トレーニング力学と反射行動を評価するために、標準化された評価手法を提案する。
論文 参考訳(メタデータ) (2025-04-03T13:53:28Z) - Vision Language Models are In-Context Value Learners [89.29486557646624]
本稿では、視覚言語モデル(VLM)に埋め込まれた世界的知識を活用してタスクの進捗を予測する普遍的価値関数推定器である生成価値学習(GVL)を提案する。
ロボットやタスク固有のトレーニングがなければ、GVLは300以上の異なる現実世界のタスクに対して、ゼロショットと数ショットの効果的な値をインコンテキストで予測することができる。
論文 参考訳(メタデータ) (2024-11-07T09:17:50Z) - AutoBench-V: Can Large Vision-Language Models Benchmark Themselves? [65.92331309449015]
本稿では,モデル能力の特定の側面に基づいてLVLMをベンチマークする,オンデマンドで評価を行う自動フレームワークであるAutoBench-Vを紹介する。
5つの要求されたユーザ入力に対して9つの人気のあるLVLMを広範囲に評価することにより、このフレームワークの有効性と信頼性を示す。
論文 参考訳(メタデータ) (2024-10-28T17:55:08Z) - Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models [73.40350756742231]
視覚条件付き言語モデル(VLM)は、視覚対話、シーン理解、ロボットタスク計画などのアプリケーションに採用されている。
新しいリリースの量は多いが、イメージ前処理、アーキテクチャ、最適化に関する重要な設計決定は未調査である。
論文 参考訳(メタデータ) (2024-02-12T18:21:14Z) - Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models [61.28463542324576]
視覚言語モデル(VLM)は近年,人間のような出力を生成できる視覚アシスタントとして,強力な有効性を示している。
我々は、既存の最先端のVLMを評価し、最高の性能モデルでさえ、強力な視覚的推論能力と一貫性を示すことができないことを発見した。
本稿では,VLMの推論性能と一貫性の向上を目的とした2段階トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-08T17:49:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。