論文の概要: Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences
- arxiv url: http://arxiv.org/abs/2607.12466v1
- Date: Tue, 14 Jul 2026 07:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.080925
- Title: Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences
- Title(参考訳): ロボットにおける展開可能な人間の選好アライメント:多種多様な人の選好から代表的報酬を学ぶ
- Authors: Taehyung Kim, Gwangmo Lee, Minjun Chang, Sunghyun Lim, Jongeun Choi,
- Abstract要約: ユーザごとのアライメントアプローチでは、好みのフィードバックは少ないことが多いため、学習は不安定になり、人間の好みのノイズに対して脆弱になる。
ユーザアライメントに対する単一の共有ポリシアプローチは、このコストを回避するが、不均一な選好をキャプチャできず、少数派選好を無視することが多い。
提案するPreference-based Reward Clustering (PREC) は,多様なユーザによって提供される2進選好ラベルから,コンパクトなポリシーセットを学習する新しいフレームワークである。
- 参考スコア(独自算出の注目度): 2.0531872026357383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning robot policies with human preferences is essential for deployment to diverse end users. In per-user alignment approach, preference feedback is often sparse, so learning becomes unstable and vulnerable to human preference noise, and a growing number of individualized policies makes validation difficult before deployment. A single shared policy approach to user alignment avoids this cost but fails to capture heterogeneous preferences and often neglects minority preferences. To address these challenges, we introduce Preference-based REward Clustering (PREC), a novel framework that learns a compact set of policies from binary preference labels provided by diverse users. From a dataset of user trajectories and their preference labels, PREC first sets the labels aside and aggregates trajectories across users to learn a population-level shared trajectory encoder, alleviating limited per-user coverage and avoiding label noise during representation learning. Using this representation, PREC jointly assigns users to preference-coherent clusters and learns a representative reward model per cluster using preference labels, from which a policy is optimized for each cluster. Clustering similar users compensates for the limited number of labels available from each user and mitigates the effect of label noise. At the same time, maintaining a manageable number of reward models reduces the validation burden at deployment. Experiments across diverse simulated locomotion environments show that PREC groups users who label different trajectory subsets into preference-coherent clusters more accurately than baseline methods. Under sparse and noisy feedback, policies trained with PREC improve all three social welfare metrics over an existing single shared-policy user-alignment approach and even outperform per-user alignment approaches.
- Abstract(参考訳): 多様なエンドユーザーに展開するには、ロボットポリシーを人間の好みで調整することが不可欠である。
ユーザごとのアライメントアプローチでは、好みのフィードバックは少ないことが多いため、学習は不安定になり、人間の好みのノイズに弱いものになり、個別化されたポリシーが増えているため、デプロイ前に検証が困難になる。
ユーザアライメントに対する単一の共有ポリシアプローチは、このコストを回避するが、不均一な選好をキャプチャできず、少数派選好を無視することが多い。
これらの課題に対処するために,多種多様なユーザによって提供される2進選好ラベルからコンパクトなポリシーセットを学習する,Preference-based Reward Clustering (PREC)を導入する。
PreCは、ユーザトラジェクトリとその嗜好ラベルのデータセットから、まずラベルを別々に設定し、ユーザ間でトラジェクトリを集約して、人口レベルの共有トラジェクトリエンコーダを学習し、ユーザ単位のカバレッジを緩和し、表現学習中のラベルノイズを回避する。
この表現を用いることで、PreCはユーザを嗜好整合クラスタに共同で割り当て、選好ラベルを使用してクラスタ毎に代表報酬モデルを学び、そこから各クラスタにポリシーを最適化する。
類似したユーザのクラスタ化は、各ユーザから利用可能なラベル数の制限を補償し、ラベルノイズの影響を軽減する。
同時に、管理可能な多数の報酬モデルを維持することで、デプロイメントの検証の負担が軽減される。
様々な模擬ロコモーション環境における実験により、異なる軌道部分集合をベースライン法よりも正確に選好整合クラスタにラベル付けするPreCグループユーザーが示された。
まばらで騒々しいフィードバックの下で、PreCで訓練されたポリシーは、既存の共有政治のユーザアライメントアプローチよりも3つの社会福祉指標をすべて改善し、ユーザ毎のアライメントアプローチよりも優れています。
関連論文リスト
- Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework [17.343792633458254]
大言語モデル(LLM)のパーソナライゼーションは、モデルの振る舞いを個々のユーザの好みに合わせることを目的としている。
既存の手法は、ユーザー間の差異の本質的な役割を無視して、孤立したユーザー履歴に焦点を当てることが多い。
C-BPO(C-BPO)は、好み校正されたバイナリ信号を介してLLMをパーソナライズするフレームワークである。
論文 参考訳(メタデータ) (2026-05-11T06:12:24Z) - Response Time Enhances Alignment with Heterogeneous Preferences [49.69696266152175]
簡易な二次信号で選好データセットを増大させることで、住民の平均選好の識別性を回復できることを示す。
私たちの結果は、将来的なデータ収集パイプラインに約束と新たな機会をもたらします。
論文 参考訳(メタデータ) (2026-05-07T22:05:23Z) - Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models [63.70401095689976]
VLM(Vision-Language Models)は、医療や金融といったプライバシに敏感な分野において大きな可能性を秘めている。
ヘテロジニアスVLMのためのGRPOとMixture-of-Rewardsを組み合わせた協調アライメントフレームワークであるMoRを提案する。
MoRは、一般化とクロスクライアント適応性において、フェデレートされたアライメントベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T07:02:50Z) - FB-NLL: A Feature-Based Approach to Tackle Noisy Labels in Personalized Federated Learning [2.750124853532831]
ユーザクラスタリングを反復的なトレーニングダイナミクスから切り離す機能中心のフレームワークであるFB-NLLを提案する。
我々のフレームワークは、平均精度と性能の安定性の観点から、常に最先端のベースラインを上回ります。
論文 参考訳(メタデータ) (2026-04-21T17:51:58Z) - RCC-PFL: Robust Client Clustering under Noisy Labels in Personalized Federated Learning [8.37314799155978]
本稿では,RCC-PFLというラベルに依存しない類似性に基づくクラスタリングアルゴリズムを提案する。
平均精度と分散低減率で複数のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2025-03-25T17:50:54Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - Improved Diversity-Promoting Collaborative Metric Learning for Recommendation [127.08043409083687]
CML(Collaborative Metric Learning)は、リコメンデーションシステムにおいて人気のある手法として最近登場した。
本稿では,ユーザが複数のカテゴリの関心を持つ,困難なシナリオに焦点をあてる。
textitDiversity-Promoting Collaborative Metric Learning (DPCML) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-09-02T07:44:48Z) - The Minority Matters: A Diversity-Promoting Collaborative Metric
Learning Algorithm [154.47590401735323]
CML(Collaborative Metric Learning)は、リコメンデーションシステムにおいて人気のある手法として最近登場した。
本稿では,ユーザが複数のカテゴリの関心を持つ,困難なシナリオに焦点をあてる。
textitDiversity-Promoting Collaborative Metric Learning (DPCML) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2022-09-30T08:02:18Z) - Overcoming Data Sparsity in Group Recommendation [52.00998276970403]
グループレコメンデータシステムは、ユーザの個人的な好みだけでなく、嗜好集約戦略も正確に学習できなければならない。
本稿では,BGEM(Bipartite Graphding Model)とGCN(Graph Convolutional Networks)を基本構造として,グループとユーザ表現を統一的に学習する。
論文 参考訳(メタデータ) (2020-10-02T07:11:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。