論文の概要: LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
- arxiv url: http://arxiv.org/abs/2607.29559v1
- Date: Fri, 31 Jul 2026 15:50:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.788613
- Title: LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
- Title(参考訳): LEMUR: 優先フィードバックから多目的強化学習に適応する学習
- Authors: Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo Cangelosi,
- Abstract要約: LEMUR: 優先フィードバックを用いた多目的強化学習を学習する。
エージェントが複数の人の好みから対話的に学習し、最適な多目的ポリシーを学習する新しいフレームワークである。
提案手法は人的フィードバックからポリシーと複数の目標固有報酬モデルを共同で学習し,エージェントが競合する目的を効果的にバランスさせることを可能にする。
- 参考スコア(独自算出の注目度): 4.210862582629798
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning (RL) systems are typically trained using a single, well-specified scalar reward function. However, real-world decision-making tasks often involve multiple, competing objectives, such as performance versus efficiency, where ground-truth reward functions are difficult to specify or inaccessible. While Multi-Objective RL (MORL) addresses such trade-offs by modeling rewards as vectors, existing approaches typically assume access to a well-specified reward function for each objective, inheriting the same challenges faced by single-objective RL. Meanwhile, Preference-based RL (PbRL) has shown great potential in solving complex tasks without access to a pre-defined reward function through reward learning from human feedback, yet has largely been studied in single-objective settings. In this work, we bridge this gap with LEMUR: Learning to Align with Multi-Objective Reinforcement Learning with Preference feedback, a novel framework where an agent interactively learns from the preferences of multiple humans to learn optimal multi-objective policies. Our approach jointly learns policies and multiple objective-specific reward models from human feedback, enabling agents to effectively balance competing objectives during learning. We evaluate LEMUR on a variety of benchmark multi-objective tasks, and empirical results demonstrate its superior performance over baseline methods. Our method presents a promising direction for solving multi-objective decision-making tasks without pre-defined reward functions.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)システムは、通常、単一の、明確に定義されたスカラー報酬関数を用いて訓練される。
しかし、実世界の意思決定タスクには、性能対効率といった、複数の競合する目的が伴うことが多い。
MORL(Multi-Objective RL)は、ベクトルとして報酬をモデル化することでそのようなトレードオフに対処するが、既存のアプローチは、通常、目的ごとに明確に定義された報酬関数にアクセスし、単一目的RLが直面する課題を継承する。
一方、Preference-based RL (PbRL) は、人間のフィードバックからの報酬学習を通じて、事前に定義された報酬関数にアクセスせずに複雑なタスクを解く大きな可能性を示しているが、主に単目的設定で研究されている。
エージェントが複数の人の好みから対話的に学習し、最適な多目的ポリシーを学ぶ新しいフレームワークである。
提案手法は人的フィードバックからポリシーと複数の目標固有報酬モデルを共同で学習し、エージェントは学習中に競合する目的を効果的にバランスさせることができる。
各種ベンチマーク多目的タスクにおけるLEMURの評価を行い,ベースライン法よりも優れた性能を示す実験結果を得た。
提案手法は,予め定義された報酬関数を使わずに,多目的意思決定タスクを解くための有望な方向を示す。
関連論文リスト
- A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning [19.061803766467627]
多目的強化学習(MORL)における報酬不要強化学習(RFRL)の活用を提案する。
RFRLは歴史的にMORLとは独立に研究されており、未知のユーザー嗜好を扱うというMORLの課題に自然に適合している。
提案手法は,MO-Gymnasiumタスクにまたがる最先端のMORL手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-04-27T14:32:44Z) - MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With Deep Reinforcement Learning [68.91090643731987]
深部強化学習(RL)は複雑な意思決定問題を解決するために広く応用されている。
既存のアプローチは、別々のフィールドに限られており、単一の目的でマルチエージェントの意思決定しか処理できない。
マルチオブジェクト型マルチエージェント強化学習(MOMARL)問題の解法としてMO-mixを提案する。
論文 参考訳(メタデータ) (2026-02-28T16:25:22Z) - Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback [14.81819959351561]
我々は、多目的RLAIFが、努力的な報酬工学を使わずに、異なるユーザの優先順位を反映したバランスの取れたトレードオフをもたらすポリシーを作成できることを示した。
RLAIFを多目的RLに統合することは、ユーザによるポリシー学習へのスケーラブルなパスを提供する、と我々は主張する。
論文 参考訳(メタデータ) (2026-02-24T09:47:25Z) - EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning [6.675088737484839]
本稿では,効率と柔軟性を向上させるために,複数のモデルを個別に微調整するEnsemble Multi-Objective RL (EMORL) フレームワークを提案する。
提案手法は,複数の対象からコンテキスト情報を組み込んで,個々のモデルの隠れた状態を初めて集約する手法である。
PAIR と Psych8k データセットの実験において,EMORL の既存のベースラインに対する利点を示す。
論文 参考訳(メタデータ) (2025-05-05T11:30:46Z) - UCB-driven Utility Function Search for Multi-objective Reinforcement Learning [51.00436121587591]
マルチオブジェクト強化学習(MORL)エージェントでは、意思決定行動の最適化を行う。
重みベクトル w でパラメトリした線型効用関数の場合に焦点を当てる。
学習過程の異なる段階で最も有望な重みベクトルを効率的に探索する上信頼境界に基づく手法を提案する。
論文 参考訳(メタデータ) (2024-05-01T09:34:42Z) - MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization [45.410121761165634]
RLに基づく手法は、ターゲット言語モデルに入力されると、ユーザ特定報酬関数の集合を最大化するプロンプトを探索するために用いられる。
現在の技術は報酬関数の平均値の最大化に重点を置いており、必ずしも報酬間の均衡を達成するプロンプトに繋がるとは限らない。
論文 参考訳(メタデータ) (2024-02-18T21:25:09Z) - Utility-Based Reinforcement Learning: Unifying Single-objective and
Multi-objective Reinforcement Learning [3.292607871053364]
実用性に基づくパラダイムを、単目的強化学習(RL)の文脈に拡張する。
本稿では,不確実な目標,リスク認識型RL,割引,安全RLに関連するタスクに対して,多目的学習を行う能力などの潜在的なメリットについて概説する。
また、ユーティリティベースのアプローチを採用する際のアルゴリズム的意味についても検討する。
論文 参考訳(メタデータ) (2024-02-05T01:42:28Z) - MORAL: Aligning AI with Human Norms through Multi-Objective Reinforced
Active Learning [14.06682547001011]
最先端の手法は通常、単一の報酬モデルを学ぶことに集中します。
本稿では,多目的強化型アクティブラーニング(MORAL)を提案する。
提案手法では,複数ポリシの計算を不要にしながら,さまざまな好みに対して深いRLエージェントを対話的にチューニングすることが可能である。
論文 参考訳(メタデータ) (2021-12-30T19:21:03Z) - Provable Multi-Objective Reinforcement Learning with Generative Models [98.19879408649848]
目的の選好から最適な政策を学習する単一政策 MORL の問題について検討する。
既存の方法は、多目的決定プロセスの正確な知識のような強い仮定を必要とする。
モデルベースエンベロップ値 (EVI) と呼ばれる新しいアルゴリズムを提案し, 包含された多目的$Q$学習アルゴリズムを一般化する。
論文 参考訳(メタデータ) (2020-11-19T22:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。