論文の概要: CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.01721v1
- Date: Thu, 02 Jul 2026 05:20:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.68234
- Title: CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning
- Title(参考訳): CoRe: 優先強化学習のための視覚言語モデルフィードバックを組み合わせたリワード
- Abstract要約: CoReは、FR(Formal Rewards)とRR(Residual Rewards)を視覚言語モデル(VLM)のフィードバックと統合して、優先的なポリシーを実現するフレームワークである。
課題知識と嗜好フィードバックに基づくFRを反復的に設計し,トレーニング中のポリシーの継続的な改善を実現するための形式的リワードモジュール(FRM)を提案し,また,VLMを用いてビデオレベルの嗜好からRRを学習し,FRを補完し,FRを補完するニュアンスド報酬を捕捉するResidual Reward Module(RRM)を提案する。
- 参考スコア(独自算出の注目度): 6.874780979291594
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward design remains a central challenge in reinforcement learning (RL). Hand-crafted rewards are often difficult to specify and may lead to suboptimal policies, while learned rewards from preferences can suffer from inefficiency and unstable training. Inspired by the dual nature of human learning explored in cognitive science, we decompose rewards into two complementary components: Formal Rewards (FR), explicitly designed based on task knowledge, and Residual Rewards (RR), learned from observations to capture implicit and nuanced preferences. Based on this decomposition, we propose CoRe, a hybrid framework that integrates FR and RR with vision-language models (VLMs) feedback to achieve preference-aligned policies without human involvement. Our contributions are twofold: (1) We propose a Formal Reward Module (FRM) that leverages VLMs to iteratively design and optimize FR based on task knowledge and preference feedback, enabling the continual improvement of policy during training; (2) We introduce a Residual Reward Module (RRM) that learns RR from video-level preference by employing VLMs to generate preference labels and capturing nuanced rewards that complement FR, ensuring alignment with human intent. Through the synergy of FRM and RRM, CoRe enables the automatic construction of reliable rewards that are efficient and preference-aligned. Extensive experiments demonstrate that CoRe outperforms existing approaches in terms of policy learning effectiveness and efficiency on ten robotic manipulation tasks in simulation and five real-worlds. Videos can be found on our project website: https://core-2026.github.io/
- Abstract(参考訳): リワードデザインは、強化学習(RL)における中心的な課題である。
手作りの報酬はしばしば特定が困難であり、最適以下の政策につながる可能性があるが、好みから学んだ報酬は非効率で不安定な訓練に悩まされる。
認知科学における人間の学習の二重性に触発されて、我々は報酬を2つの相補的な構成要素に分解する: 形式的リワード(FR)はタスク知識に基づいて明示的に設計され、残留リワード(RR)は暗黙的およびニュアンスな好みを捉えるために観察から学んだ。
本研究では,FRとRRを視覚言語モデル(VLM)のフィードバックと統合したハイブリッドフレームワークであるCoReを提案する。
我々は,(1)タスク知識と嗜好フィードバックに基づいて,FRを反復的に設計・最適化し,トレーニング中のポリシーの継続的な改善を可能にする形式的リワードモジュール(FRM)を提案し,(2)VLMを用いてビデオレベルの嗜好からRRを学習し,FRを補完し,人間の意図と整合性を確保するためのニュアンスド報酬を収集するResidual Reward Module(RRM)を提案する。
FRM と RRM の相乗効果により、CoRe は効率よく好みに整合した信頼性の高い報酬の自動構築を可能にした。
大規模な実験により、CoReは、シミュレーションにおける10のロボット操作タスクと5つの実世界において、ポリシー学習の有効性と効率の点で、既存のアプローチよりも優れていることが示された。
ビデオはプロジェクトのWebサイト(https://core-2026.github.io/)で見ることができる。
関連論文リスト
- Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning [18.91502176461499]
機械学習は、訓練された言語モデルからの特定の知識を、完全なリトレーニングなしで取り除こうとする。
最近の研究は、未学習をReinforcement Learning with Verifiable Rewards (RLVR)問題として再考している。
報奨設計が強化アンラーニングフレームワークにおける非学習効率に与える影響について検討する。
論文 参考訳(メタデータ) (2026-07-30T10:15:59Z) - Automating Potential-based Reward Shaping with Vision Language Model Guidance [2.8360662552057323]
本稿では視覚言語モデルからのフィードバックから直接潜在的な機能を学ぶVLM誘導PBRSフレームワークを紹介する。
このアプローチはポテンシャルに基づく報酬形成に基づいているため、元の最適ポリシーを保っている。
結果として得られた選好ラベルは精度が低いが、実証的な証拠は、選好ラベルが学習を加速するためにも使用できることを示している。
論文 参考訳(メタデータ) (2026-06-25T15:45:57Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning [29.373324685358753]
本稿では,自然言語記述から実行可能報酬関数コードを生成し,改善するためのフレームワークであるPROFと,単一専門家の軌跡を提案する。
また,環境相互作用やRLトレーニングを必要とせず,新たな報酬関数品質評価とランキング戦略であるReward Preference Ranking(RPR)を提案する。
論文 参考訳(メタデータ) (2025-11-14T14:38:02Z) - LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning [0.27528170226206433]
本稿では,過度な報酬を伴う環境下での学習エージェントの効率向上を目的とした,本質的なモチベーション戦略の2つの組み合わせについて検討する。
本稿では,変分自動エンコーダ(VAE)の報奨状態の新規性を,大言語モデル(LLM)から派生した帰納的報奨手法を用いて,変分状態を内在的リワード(VSIMR)として統合することを提案する。
実験の結果, この組み合わせ戦略は, 各戦略を個別に使用した場合と比較して, エージェント性能と効率を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-25T19:10:58Z) - A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models [103.88578274567784]
MeRF(Motivation-enhanced Reinforcement Finetuning)は、大規模共振モデルの強化微調整を強化する直感的かつ効果的な方法である。
MeRFは報酬仕様を直接プロンプトに注入し、最適化目標を認識するためのコンテキスト内モチベーションとして機能する。
MeRFはRLVRベースラインよりもパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2025-06-23T10:37:57Z) - Learning to Reason without External Rewards [100.27210579418562]
RLVR(Reinforcement Learning with Verifiable Rewards)による複雑な推論のための大規模言語モデル(LLM)の訓練は、費用がかかるドメイン固有の監督に依存して効果的であるが制限されている。
内部フィードバックからの強化学習(Reinforcement Learning from Internal Feedback, RLIF)は、LLMが外部の報酬やラベル付きデータなしで本質的な信号から学習できるフレームワークである。
本稿では,モデル自身の信頼度を利用したRLIF手法であるIntuitorについて,その唯一の報奨信号として自己確実性(self-certainty)を提案する。
論文 参考訳(メタデータ) (2025-05-26T07:01:06Z) - Dense Reward for Free in Reinforcement Learning from Human Feedback [64.92448888346125]
我々は報酬モデルが単にスカラー出力よりも多くの情報を含んでいるという事実を活用している。
私たちは、これらの注意重みを使って、完了全体に沿って報酬を再分配します。
経験的に、トレーニングを安定化し、学習速度を加速し、実際は、より良い局所最適性をもたらす可能性があることを示す。
論文 参考訳(メタデータ) (2024-02-01T17:10:35Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Deep Reinforcement Learning from Hierarchical Preference Design [99.46415116087259]
本稿では,特定の構造を利用することにより,報酬設計プロセスの容易性を示す。
シナリオのための階層的な報酬モデリングフレームワーク -- HERONを提案する。 (I) フィードバック信号は自然に階層構造を呈し、 (II) 報酬は希少であるが、政策学習を支援するためにあまり重要でないサロゲートフィードバックを持つ。
論文 参考訳(メタデータ) (2023-09-06T00:44:29Z) - Language Reward Modulation for Pretraining Reinforcement Learning [61.76572261146311]
本稿では,強化学習のための事前学習信号としてLRFの機能を活用することを提案する。
我々の VLM プレトレーニングアプローチは,従来の LRF の使い方とは違い,ロボット操作タスクにおけるサンプル効率の学習を温めることができる。
論文 参考訳(メタデータ) (2023-08-23T17:37:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。