論文の概要: Subspace Inference Enables Efficient Active Reward Learning from Preferences
- arxiv url: http://arxiv.org/abs/2609.04066v1
- Date: Thu, 03 Sep 2026 16:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.1568
- Title: Subspace Inference Enables Efficient Active Reward Learning from Preferences
- Title(参考訳): Subspace Inferenceは、推論から効率的なアクティブリワード学習を可能にする
- Authors: Yutai Zhou, Erdem Bıyık,
- Abstract要約: 人間からのフィードバックからの強化学習(RLHF)は、人間の好みから報酬モデルを学ぶための強力な、しかしサンプル非効率なアプローチとして現れている。
ベイズフィルタの逐次問題として,アクティブな選好学習をフレーミングすることで,報酬モデルの不確実性を追跡する,サンプル効率のよいアプローチであるPreferenceEKFを導入する。
提案手法は,ニューラルネットワークパラメータをスケーラブルにサンプリングすることで,能動的報酬学習のための獲得関数を効率的に計算する。
- 参考スコア(独自算出の注目度): 0.8730865124496984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning from human feedback (RLHF) has emerged as a powerful yet sample-inefficient approach for learning reward models from human preferences, making active learning a critical component in synthesizing informative preference queries. However, effective uncertainty quantification required for active learning remains a key challenge for large neural network reward models. In this paper, we introduce PreferenceEKF, a sample-efficient approach that tracks reward model uncertainty by framing active preference learning as a sequential Bayesian filtering problem. Instead of relying on computationally prohibitive posterior inference over the full neural network parameter space, our method performs sequential inference via an extended Kalman filter within a low-dimensional parameter subspace, continuously updating the reward model posterior as new preference queries arrive. Our approach enables scalable sampling of neural network parameters to efficiently compute acquisition functions for active reward learning. Experiments on the D4RL and V-D4RL benchmarks demonstrate that our approach achieves better sample efficiency, runtime, scalability, and calibration compared to other Bayesian deep learning approaches, and the learned reward models lead to competitive offline reinforcement learning policy performance. This highlights the potential of scalable Bayesian methods for preference-based reward modeling in RLHF. Our code is available at https://github.com/yutaizhou/bnn_pref.
- Abstract(参考訳): 人間からのフィードバックからの強化学習(RLHF)は、人間の嗜好から報酬モデルを学ぶための強力な非効率なアプローチとして現れ、情報的嗜好クエリを合成する上で重要な要素となっている。
しかし、アクティブラーニングに必要な効果的な不確実性定量化は、大きなニューラルネットワーク報酬モデルにとって重要な課題である。
本稿では, 逐次ベイズフィルタ問題として能動選好学習をフレーミングすることで, 報酬モデルの不確実性を追跡するサンプル効率の高いアプローチであるPreferenceEKFを紹介する。
提案手法は,ニューラルネットワークのパラメータ空間全体に対する計算的に禁止された後部推論に代えて,低次元パラメータ部分空間内で拡張カルマンフィルタを介して逐次推論を行い,新たな優先クエリが到着するにつれて報酬モデル後部を継続的に更新する。
提案手法は,ニューラルネットワークパラメータをスケーラブルにサンプリングすることで,能動的報酬学習のための獲得関数を効率的に計算する。
D4RL と V-D4RL のベンチマーク実験により,ベイズ深層学習手法と比較して,本手法がサンプル効率,ランタイム,スケーラビリティ,キャリブレーションを向上し,学習した報酬モデルが競合するオフライン強化学習ポリシー性能をもたらすことを示した。
このことは、RLHFにおける嗜好に基づく報酬モデリングのためのスケーラブルなベイズ手法の可能性を強調している。
私たちのコードはhttps://github.com/yutaizhou/bnn_pref.comから入手可能です。
関連論文リスト
- Can RLHF be More Efficient with Imperfect Reward Models? A Policy Coverage Perspective [31.956232187102465]
本稿では,オンラインRLHFにおける不完全な報酬モデルから知識を伝達する方法を検討する。
本稿では,新しい伝達学習原理と理論的アルゴリズムを提案する。
我々は、計算効率を向上したウィンレートベースの転送ポリシー選択戦略を開発する。
論文 参考訳(メタデータ) (2025-02-26T16:03:06Z) - Best Policy Learning from Trajectory Preference Feedback [11.896067099790962]
推論ベースの強化学習(PbRL)は、より堅牢な代替手段を提供する。
本稿では, PbRLにおける最適政策識別問題について検討し, 生成モデルの学習後最適化を動機とした。
本稿では,Top-Two Thompson Smplingにヒントを得た新しいアルゴリズムであるPosterior Smpling for Preference Learning(mathsfPSPL$)を提案する。
論文 参考訳(メタデータ) (2025-01-31T03:55:10Z) - Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment [65.15914284008973]
我々は、報酬モデルと政策モデルを同時に構築するために、逆強化学習(IRL)技術を活用することを提案する。
提案アルゴリズムはIRL問題の定常解に収束することを示す。
その結果,アライメントプロセス全体を通じて報酬学習を活用することは有益であることが示唆された。
論文 参考訳(メタデータ) (2024-05-28T07:11:05Z) - Sample Complexity of Preference-Based Nonparametric Off-Policy
Evaluation with Deep Networks [58.469818546042696]
我々は、OPEのサンプル効率を人間の好みで研究し、その統計的保証を確立する。
ReLUネットワークのサイズを適切に選択することにより、マルコフ決定過程において任意の低次元多様体構造を活用できることが示される。
論文 参考訳(メタデータ) (2023-10-16T16:27:06Z) - Provable Reward-Agnostic Preference-Based Reinforcement Learning [61.39541986848391]
PbRL(Preference-based Reinforcement Learning)は、RLエージェントが、軌道上のペアワイドな嗜好に基づくフィードバックを用いてタスクを最適化することを学ぶパラダイムである。
本稿では,隠れた報酬関数の正確な学習を可能にする探索軌道を求める理論的報酬非依存PbRLフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T15:00:09Z) - Gone Fishing: Neural Active Learning with Fisher Embeddings [55.08537975896764]
ディープニューラルネットワークと互換性のあるアクティブな学習アルゴリズムの必要性が高まっている。
本稿では,ニューラルネットワークのための抽出可能かつ高性能な能動学習アルゴリズムBAITを紹介する。
論文 参考訳(メタデータ) (2021-06-17T17:26:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。