論文の概要: Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity
- arxiv url: http://arxiv.org/abs/2605.09119v1
- Date: Sat, 09 May 2026 19:07:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.071265
- Title: Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity
- Title(参考訳): パーソナライズされたアライメントの再考: ユーザ多様性の必要性と十分性
- Abstract要約: パーソナライズされたアライメントO(1)はオンラインの後悔とログ(1/epsilon)オフラインサンプルの複雑さを実現する。
本研究は,個人識別の基本的な要因として,ユーザの多様性を同定するものである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalized alignment aims to adapt large language models to heterogeneous user preferences, yet the precise theoretical conditions for its statistical efficiency have not been formally established. This paper characterizes the conditions under which personalized alignment achieves O(1) online regret and log(1/epsilon) offline sample complexity. We show that these optimal rates depend on a specific user-diversity condition: the population of user-specific heads must span the latent reward directions that can alter the optimal response. We prove that this condition is both necessary and sufficient. When it holds, simple greedy algorithms achieve benchmark efficiency; when it fails, every learner in a natural admissible class incurs at least logarithmic regret. Our results identify user diversity as the fundamental driver of personalized identifiability.
- Abstract(参考訳): パーソナライズされたアライメントは、大きな言語モデルを異種ユーザの好みに適応させることを目的としているが、その統計的効率の正確な理論的条件は正式に確立されていない。
本稿では,O(1)オンラインの後悔とログ(1/epsilon)オフラインサンプルの複雑さを,個別にアライメントすることで,O(1)オンラインの後悔とログ(1/epsilon)オフラインの複雑さを実現する条件を特徴付ける。
これらの最適レートは、特定のユーザ多様性条件に依存しており、ユーザ固有の頭部の個体数は、最適応答を変化させることのできる潜在報酬方向にまたがる必要がある。
この条件は必要かつ十分であることを示す。
失敗すると、自然に許容できるクラスの学習者は、少なくとも対数的後悔を引き起こす。
本研究は,個人識別の基本的な要因として,ユーザの多様性を同定するものである。
関連論文リスト
- Response Time Enhances Alignment with Heterogeneous Preferences [49.69696266152175]
簡易な二次信号で選好データセットを増大させることで、住民の平均選好の識別性を回復できることを示す。
私たちの結果は、将来的なデータ収集パイプラインに約束と新たな機会をもたらします。
論文 参考訳(メタデータ) (2026-05-07T22:05:23Z) - P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling [66.55381105691818]
P-GenRM(Personalized Generative Reward Model)を提案する。
P-GenRMは、選好信号を適応的なペルソナとスコアリングルーリックを導出する構造化評価チェーンに変換する。
さらにユーザをユーザプロトタイプにクラスタリングし、二重粒度スケーリングメカニズムを導入している。
論文 参考訳(メタデータ) (2026-02-12T16:07:22Z) - EXACT: Explicit Attribute-Guided Decoding-Time Personalization [11.035465374731563]
EXACTは新しいデコード時のパーソナライゼーションで、生成とペアの好みのフィードバックを限定的に調整する。
EXACTは、好みのモデリング精度やパーソナライズされた生成品質など、強いベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-06T14:53:37Z) - Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings [0.0]
GatedBiasは知識グラフのための軽量な推論時パーソナライズフレームワークである。
プロファイル固有の機能は、グラフ由来のバイナリゲートと組み合わせて、解釈可能な、パーエンタリティバイアスを生成する。
2つのベンチマークデータセット上でGatedBiasを評価する。
論文 参考訳(メタデータ) (2025-12-26T22:30:37Z) - Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences [14.686788596611246]
Reinforcement Learning from Human Feedback (RLHF) は、大きな言語モデルと人間の価値の整合の中心となっている。
最近の選択肢であるDPO(Direct Preference Optimization)は、好みを直接最適化することでパイプラインを単純化している。
生成モデルアライメントにおける多様なユーザに対する公平性とパーソナライズのための理論的かつアルゴリズム的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-17T15:00:40Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Personalized Reasoning: Just-In-Time Personalization and Why LLMs Fail At It [81.50711040539566]
現在の大規模言語モデル(LLM)開発は、タスク解決と優先順位調整を別の課題として扱う。
静的ベンチマークを対話型パーソナライズタスクに変換する評価手法であるPreFDISCOを紹介する。
我々のフレームワークは、ユーザコンテキストに応じて、同じ質問が異なる推論チェーンを必要とするシナリオを作成します。
論文 参考訳(メタデータ) (2025-09-30T18:55:28Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - Test-Time Alignment via Hypothesis Reweighting [56.71167047381817]
大規模な事前訓練されたモデルは、しばしば未指定のタスクで苦労する。
テストタイムのユーザ意図にモデルを整合させるという課題に対処する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-11T23:02:26Z) - Direct Preference Optimization With Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences [14.686788596611246]
Reinforcement Learning from Human Feedback (RLHF) は、大きな言語モデルと人間の価値の整合の中心となっている。
最近の選択肢であるDPO(Direct Preference Optimization)は、好みを直接最適化することでパイプラインを単純化している。
生成モデルアライメントにおける多様なユーザに対する公平性とパーソナライズのための理論的かつアルゴリズム的なフレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-23T21:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。