論文の概要: Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.09507v2
- Date: Wed, 12 Aug 2026 10:18:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.502541
- Title: Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning
- Title(参考訳): 言語モデルパーソナライズのための言語強化学習による学習優先適応
- Abstract要約: タスク固有の問題に普遍的な選好要約を適応するためのトレーニング不要なメタ学習フレームワークであるtextscXada を提案する。
textscAlignXadaは平均3.82ポイントの上昇を達成し、33の細胞を改良し、元のプロファイルトークンの22.8%しか保持せず、36の細胞でRAGを上回っている。
- 参考スコア(独自算出の注目度): 17.507528344271858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural language user preferences provide an interpretable interface for LLM personalization. However, universal preference summaries often contain information irrelevant to a particular downstream task. Directly supplying the full preference summary therefore wastes context capacity and introduces cross-task distraction, while manually designing task-specific preference views is difficult to scale. In this work, we study \emph{task-specific preference adaptation}: given a universal user preference summary and a downstream task, derive a task-conditioned representation that preserves sufficient decision-relevant evidence while removing redundant context. To this end, we propose \textsc{AlignXada}, a training-free meta-learning framework that induces reusable textual refinement policies for adapting universal preference summaries to task-specific ones. The refinement policy is iteratively optimized by a meta learner through verbal reinforcement learning. Across 13 tasks and three downstream models (39 task--model cells), \textsc{AlignXada} achieves an average gain of 3.82 points, improving 33 cells while retaining only 22.8\% of the original profile tokens and outperforming RAG in 36 cells. An extended faithfulness analysis further shows that the refined profiles remain largely grounded in the source preferences while preserving task-relevant personalization signals, suggesting that profile-side adaptation serves as a practical complement to universal memory construction for lifelong personalized agents.
- Abstract(参考訳): 自然言語ユーザの好みは、LLMパーソナライズのための解釈可能なインターフェースを提供する。
しかしながら、普遍的な選好要約は、特定の下流タスクに関係のない情報を含むことが多い。
そのため、タスク固有の選好ビューを手動で設計するのは難しいが、完全な選好サマリーを直接供給することはコンテキストキャパシティを浪費し、タスク間の気晴らしをもたらす。
本研究は, 普遍的なユーザ嗜好要約と下流タスクを与えられた場合, 冗長なコンテキストを除去しながら十分な意思決定関連証拠を保持するタスク条件付き表現を導出する。
この目的のために,タスク固有の問題に普遍的な選好要約を適用するために,再利用可能なテキスト修正ポリシーを誘導する,トレーニング不要なメタラーニングフレームワークである‘textsc{AlignXada} を提案する。
洗練政策は、言語強化学習を通じてメタ学習者によって反復的に最適化される。
13のタスクと3つの下流モデル(39のタスク-モデル細胞)にまたがって、textsc{AlignXada}は平均3.82ポイントを達成し、元のプロファイルトークンの22.8 %しか保持せず、36のセルでRAGを上回りながら33のセルを改善した。
拡張された忠実度分析により、改善されたプロファイルは、タスク関連パーソナライズ信号を保持しながら、ソースの好みに大きく根ざしたままであり、プロファイル側適応は、生涯にわたるパーソナライズされたエージェントのユニバーサルメモリ構築の事実上の補完となることが示唆された。
関連論文リスト
- Evaluating the Hidden Costs of Personalization in Large Language Models [55.07935163900691]
我々は,(1)無関係なパーソナライゼーション,(2)不必要な文脈で個人情報を参照するモデル,(2)好みの絞り込み,(2)情報エコーチャンバーを補強するモデル,(3)覚醒バイアス,(3)モデルがユーザの意見に過度に同意するモデル,の3つのリスクを識別する。
我々は、現在のAIアシスタントの体系的な制限を明らかにするために、自動データ生成と調整されたメトリクスを備えた動的評価フレームワークであるPRISKを提案する。
論文 参考訳(メタデータ) (2026-08-28T20:05:12Z) - CLIPer: Tailoring Diverse User Preference via Classifier-Guided Inference-Time Personalization [28.672568353736335]
軽量なパーソナライゼーションアプローチであるtextbfCLIPer (textbfClassifier-guided textbfInference-time textbfPersonalization) を導入する。
提案手法では, 微調整が不要となり, 計算オーバーヘッドが増大する。
論文 参考訳(メタデータ) (2026-05-08T02:47:30Z) - EXACT: Explicit Attribute-Guided Decoding-Time Personalization [11.035465374731563]
EXACTは新しいデコード時のパーソナライゼーションで、生成とペアの好みのフィードバックを限定的に調整する。
EXACTは、好みのモデリング精度やパーソナライズされた生成品質など、強いベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-06T14:53:37Z) - POPI: Personalizing LLMs via Optimized Natural Language Preference Inference [42.25870704040321]
POPIは、不均一なユーザ信号を簡潔な自然言語要約に変換するための選好推論モデルを導入する一般的なフレームワークである。
これらの要約は、パーソナライズされた応答を生成するために共有生成モデルを必要とする透明でコンパクトで、転送可能なパーソナライズ表現として機能する。
4つのパーソナライズベンチマークによる大規模な実験により、POPIはパーソナライズ精度を常に改善し、コンテキストオーバーヘッドを大きなマージンで低減することを示した。
論文 参考訳(メタデータ) (2025-10-17T23:07:57Z) - Personalized Reasoning: Just-In-Time Personalization and Why LLMs Fail At It [81.50711040539566]
現在の大規模言語モデル(LLM)開発は、タスク解決と優先順位調整を別の課題として扱う。
静的ベンチマークを対話型パーソナライズタスクに変換する評価手法であるPreFDISCOを紹介する。
我々のフレームワークは、ユーザコンテキストに応じて、同じ質問が異なる推論チェーンを必要とするシナリオを作成します。
論文 参考訳(メタデータ) (2025-09-30T18:55:28Z) - Personalized Vision via Visual In-Context Learning [62.85784251383279]
パーソナライズされた視覚のためのビジュアル・イン・コンテキスト・ラーニング・フレームワークを提案する。
PICOは基盤となる変換を推測し、再トレーニングせずに新しい入力に適用する。
また,効率的な推論スケーリングによる信頼性向上を目的とした注意誘導型シードスコアラを提案する。
論文 参考訳(メタデータ) (2025-09-29T17:58:45Z) - VLP: Vision-Language Preference Learning for Embodied Manipulation [29.7387976970634]
具体的操作タスクに対する好みフィードバックを提供するための視覚言語選好モデルを提案する。
選好モデルは言語に関連する特徴を抽出し、様々な下流タスクにおいて選好アノテータとして機能する。
提案手法は,未知のタスクや未知の言語命令に対して,精度の高い選好と一般化を提供し,ベースラインを大きなマージンで上回る。
論文 参考訳(メタデータ) (2025-02-17T15:32:14Z) - Guided Profile Generation Improves Personalization with LLMs [3.2685922749445617]
勧告、ランク付け、Eコマースプラットフォームを含む現代の商業システムでは、パーソナライズコンテキストを大型言語モデル(LLM)への入力として取り入れる傾向にある。
本稿では,自然言語で個人プロファイルを生成するための汎用手法であるGPGを提案する。
実験の結果,GAGはLLMのパーソナライズ能力を向上させることが示され,例えば,LLMを生の個人的コンテキストで直接供給するよりも,個人の嗜好を予測する上で37%の精度が向上することがわかった。
論文 参考訳(メタデータ) (2024-09-19T21:29:56Z) - Self-regulating Prompts: Foundational Model Adaptation without
Forgetting [112.66832145320434]
本稿では,PromptSRCと呼ばれる自己正規化フレームワークを提案する。
PromptSRCはタスク固有の汎用表現とタスクに依存しない汎用表現の両方に最適化するプロンプトを導く。
論文 参考訳(メタデータ) (2023-07-13T17:59:35Z) - SPEC: Summary Preference Decomposition for Low-Resource Abstractive
Summarization [21.037841262371355]
本稿では,ソースコーパスからターゲットコーパスへ数発の学習プロセスを転送するフレームワークを提案する。
提案手法は, ROUGE-1/2/Lを10例, 100例で平均改良した6種類のコーパスに対して, 30.11%/33.95%/27.51%, 26.74%/31.14%/24.48%の最先端性能を実現する。
論文 参考訳(メタデータ) (2023-03-24T14:07:03Z) - Cross-lingual Spoken Language Understanding with Regularized
Representation Alignment [71.53159402053392]
外部リソースを使わずに言語間で単語レベルの表現と文レベルの表現を整列する正規化手法を提案する。
言語間言語理解タスクの実験により、我々のモデルは、数ショットとゼロショットの両方のシナリオにおいて、最先端の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2020-09-30T08:56:53Z) - Pre-training via Paraphrasing [96.79972492585112]
教師なし多言語パラフレージング目的を用いて学習した,事前学習されたシーケンス・ツー・シーケンスモデルであるMARGEを紹介する。
ランダムな初期化のみを前提として,検索と再構築を共同で行うことができることを示す。
例えば、追加のタスク固有のトレーニングがなければ、文書翻訳のBLEUスコアは最大35.8に達する。
論文 参考訳(メタデータ) (2020-06-26T14:43:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。