論文の概要: Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability
- arxiv url: http://arxiv.org/abs/2607.11432v1
- Date: Mon, 13 Jul 2026 11:37:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.454839
- Title: Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability
- Title(参考訳): 嗜好に基づく強化学習の一般化--非互換性の合理性モデル
- Authors: Simone Drago, Marco Mussi, Leonardo Bianconi, Alberto Maria Metelli,
- Abstract要約: 本研究では,人間専門家による一対の軌跡比較から強化学習問題を考察した。
我々は,非競合性を効果的に捉え,多次元報酬関数を推論する新しいBradley-Terry-Inspireed rationalityモデルを提案する。
- 参考スコア(独自算出の注目度): 34.13173603982829
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we study the reinforcement learning (RL) problem from pairwise trajectory comparisons provided by a human expert. We generalize preference-based RL by formalizing a novel setting in which the expert can also label trajectory pairs as incomparable, i.e., when neither trajectory dominates the other. We introduce the learning problem and the desiderata that its solution should satisfy. Then, we propose a novel Bradley-Terry-inspired rationality model that effectively captures incomparabilities and infers a multi-dimensional reward function, and we study its properties. We provide a sample complexity analysis for learning the model parameters when a dataset is available. Finally, we evaluate our model's ability to reconstruct a reward function that aligns with the expert's comparisons in simulated environments and to recover the Pareto frontier of policies, along with a robustness analysis across varying levels of expert rationality.
- Abstract(参考訳): 本研究では,人間の専門家による一対の軌跡比較から,強化学習(RL)問題を考察する。
我々は, どちらが支配的でも, 専門家が相容れない軌道対をラベル付けできるような, 新たな設定を定式化することによって, 嗜好に基づくRLを一般化する。
学習問題と,そのソリューションが満たすべきデシラタについて紹介する。
そこで我々は,非競合性を効果的に捉え,多次元の報酬関数を推論する新しいBradley-Terry-Inspireed rationalityモデルを提案し,その特性について検討する。
データセットが利用可能になったとき、モデルパラメータを学習するための複雑性分析のサンプルを提供する。
最後に、シミュレーション環境における専門家の比較と整合した報酬関数を再構築し、ポリシーのParetoフロンティアを復元し、様々なレベルの専門家合理性のロバスト性解析を行う能力を評価する。
関連論文リスト
- Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - Provable Reward-Agnostic Preference-Based Reinforcement Learning [61.39541986848391]
PbRL(Preference-based Reinforcement Learning)は、RLエージェントが、軌道上のペアワイドな嗜好に基づくフィードバックを用いてタスクを最適化することを学ぶパラダイムである。
本稿では,隠れた報酬関数の正確な学習を可能にする探索軌道を求める理論的報酬非依存PbRLフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T15:00:09Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Single-Trajectory Distributionally Robust Reinforcement Learning [21.955807398493334]
本研究では,分散ロバストRL (DRRL) を提案する。
既存のDRRLアルゴリズムはモデルベースか、1つのサンプル軌道から学習できないかのいずれかである。
単一軌道を用いた分散ロバストQ-ラーニング(DRQ)と呼ばれる,完全モデルフリーなDRRLアルゴリズムを設計する。
論文 参考訳(メタデータ) (2023-01-27T14:08:09Z) - USCO-Solver: Solving Undetermined Stochastic Combinatorial Optimization
Problems [9.015720257837575]
入力-解対のサンプルから高品質な最適化解を推定することを目的として,空間間の回帰を考察する。
基礎学習にはPAC-Bayesianフレームワークを用いて学習エラー分析を行う。
我々は,合成データセットと実世界のデータセットの両方において,古典的な問題に対する高い励振実験結果を得た。
論文 参考訳(メタデータ) (2021-07-15T17:59:08Z) - A bandit-learning approach to multifidelity approximation [7.960229223744695]
マルチファイデリティ近似は、科学計算とシミュレーションにおいて重要な技術である。
異なる忠実度のデータを利用して正確な推定を行うためのバンディットラーニング手法を紹介します。
論文 参考訳(メタデータ) (2021-03-29T05:29:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。