論文の概要: PrefReward: Learning User Preference Matrix for Personalized Text Generation
- arxiv url: http://arxiv.org/abs/2607.21067v1
- Date: Thu, 23 Jul 2026 09:00:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.339482
- Title: PrefReward: Learning User Preference Matrix for Personalized Text Generation
- Title(参考訳): PrefReward:パーソナライズされたテキスト生成のためのユーザ嗜好行列の学習
- Authors: Yue Wu, Chengbing Wang, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Fuli Feng,
- Abstract要約: パーソナライズのための好み認識型生成フレームワークであるPrefRewardを提案する。
PrefRewardは構造化された好み行列を通じてユーザスタイルを明示的にモデル化し、それを報酬信号としてデコーディングプロセスに統合する。
LongLaMPデータセットの実験では、PrefRewardは、生成品質とパーソナライゼーションの両面で、非個人化ベースラインと検索ベースラインを上回っている。
- 参考スコア(独自算出の注目度): 41.05380951849894
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have demonstrated remarkable ability in generating personalized content by leveraging user histories and contextual cues. However, most existing personalization approaches rely on implicit representations within model parameters, making it difficult to interpret user-specific preferences or effectively handle long-context dependencies. To address these challenges, we propose PrefReward, a novel preference-aware generative framework that explicitly models user styles through a structured preference matrix and integrates it into the decoding process as a reward signal. PrefReward consists of two stages: (1) extracting a user-specific preference matrix that summarizes individual stylistic tendencies, and (2) using the matrix to guide generation via a KL-divergence-based reward function. Experiments on the LongLaMP dataset show that PrefReward outperforms non-personalized and retrieval-based baselines in both generation quality and personalization interpretability.
- Abstract(参考訳): 大規模言語モデル(LLM)は,ユーザ履歴と文脈的手がかりを活用することで,パーソナライズされたコンテンツを生成する優れた能力を示した。
しかし、既存のパーソナライゼーションアプローチのほとんどはモデルパラメータ内の暗黙の表現に依存しており、ユーザー固有の好みを解釈したり、長いコンテキスト依存を効果的に扱うことは困難である。
このような課題に対処するために,構造化された嗜好行列を用いてユーザスタイルを明示的にモデル化し,報酬信号として復号処理に統合する,新規な嗜好認識生成フレームワークであるPrefRewardを提案する。
PrefReward は,(1) 個々のスタイル傾向を要約したユーザ固有の嗜好行列を抽出し,(2) 行列を用いて KL 分割に基づく報酬関数を導出する。
LongLaMPデータセットの実験では、PrefRewardは、生成品質とパーソナライゼーションの解釈可能性の両方において、非個人化ベースラインと検索ベースラインを上回っている。
関連論文リスト
- Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation [67.23759365022279]
パーソナライズされた画像生成のための新しい嗜好調整フレームワークであるPremierを提案する。
Premierは、各ユーザの好みを学習可能な埋め込みとして表現し、テキストプロンプトに埋め込まれたユーザを融合させる好みアダプタを導入する。
実験により、Premierは、同じ履歴長で以前の方法より優れていることが示された。
論文 参考訳(メタデータ) (2026-03-21T09:19:12Z) - Synthetic Interaction Data for Scalable Personalization in Large Language Models [67.31884245564086]
本稿ではPersonaGymという高忠実な合成データ生成フレームワークを紹介する。
パーソナライゼーションを静的なペルソナ-参照ペアとして扱う以前の作業とは異なり、PersonaGymは動的な選好プロセスをモデル化する。
我々は,高忠実度マルチターンパーソナライズされたインタラクショントラジェクトリの大規模かつ高品質で多様な合成データセットであるPersonaAtlasをリリースする。
論文 参考訳(メタデータ) (2026-02-12T20:41:22Z) - Reasoning-Based Personalized Generation for Users with Sparse Data [120.94029850012045]
スパースコンテキスト下でパーソナライズされたテキスト生成を強化する新しいフレームワークであるGraSPerを紹介する。
GraSPerは、ユーザが将来的に対話する可能性のあるアイテムを予測することで、ユーザコンテキストを初めて強化する。
推論アライメントによって、これらのインタラクションのためのテキストを生成して、拡張されたコンテキストを豊かにする。
最終的に、実際の履歴と合成履歴の両方に基づいて、パーソナライズされた出力を生成する。
論文 参考訳(メタデータ) (2026-01-31T01:54:23Z) - Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models [16.152962349146275]
本稿では、コンテンツ生成をアライメントから切り離してパーソナライズパラダイムを再定義するフレームワークであるリフレクティブパーソナライズ最適化(RPO)を提案する。
RPOは2つの異なる段階で動作する: まず、ベースモデルが高品質で汎用的な応答を生成し、その後、外部反射モジュールがこの出力を明示的に書き直してユーザの好みに合わせる。
LaMPベンチマークの総合的な実験により、RPOはパーソナライゼーションからコンテンツ生成を分離することで、最先端のベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2025-11-07T14:48:49Z) - Personalize Before Retrieve: LLM-based Personalized Query Expansion for User-Centric Retrieval [34.298743064665395]
Personalize Before Retrieve (PBR) は、ユーザ固有の信号を検索前にクエリ拡張に組み込むフレームワークである。
PBRは一貫して強力なベースラインを上回り、PersonaBenchはリトリーバー全体で最大10%の利益を得ている。
論文 参考訳(メタデータ) (2025-10-10T02:24:09Z) - Embedding-to-Prefix: Parameter-Efficient Personalization for Pre-Trained Large Language Models [6.445337954429245]
大規模言語モデル(LLM)は、文脈に関連のあるコンテンツを生成するのに優れている。
本研究では,LLMの隠れ表現空間にコンテキスト埋め込みを注入するパラメータ効率の高いEmbeding-to-Prefix(E2P)を提案する。
我々は2つの公開データセットとプロダクション環境でのE2Pの評価を行い、ペルソナチャットでの対話パーソナライゼーション、PENSにおける文脈的見出し生成、音楽とポッドキャストの大規模パーソナライゼーションについて検討した。
論文 参考訳(メタデータ) (2025-05-16T13:34:25Z) - Personalized Text Generation with Contrastive Activation Steering [63.60368120937822]
そこで本研究では,ベクタとしてパーソナライズされた書体スタイルを分離し,表現する学習自由フレームワークを提案する。
本フレームワークは,PEFT法よりも1700倍のストレージ要求を削減しつつ,パーソナライズ生成において,8%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-03-07T08:07:15Z) - PMG : Personalized Multimodal Generation with Large Language Models [20.778869086174137]
本稿では,大規模言語モデル(LLM)を用いたパーソナライズされたマルチモーダル生成手法を提案する。
2つのデータセットに関する広範な実験を通じて、その応用を実証し、その性能を検証する。
PMGのパーソナライゼーションはLPIPSで最大8%向上し, 生成精度は向上した。
論文 参考訳(メタデータ) (2024-04-07T03:05:57Z) - Modeling Dynamic User Preference via Dictionary Learning for Sequential
Recommendation [133.8758914874593]
ユーザの好みのダイナミックさを捉えることは、ユーザの将来の行動を予測する上で非常に重要です。
浅いものも深いものも含む、既存のレコメンデーションアルゴリズムの多くは、このようなダイナミクスを独立してモデル化することが多い。
本稿では、ユーザのシーケンシャルな振る舞いを、ユーザ好みの潜伏した空間に埋め込むことの問題について考察する。
論文 参考訳(メタデータ) (2022-04-02T03:23:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。