論文の概要: Rubric-Aware On-Policy Self-Distillation for LLM Personalization
- arxiv url: http://arxiv.org/abs/2609.35262v1
- Date: Mon, 28 Sep 2026 14:21:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 07:09:37.771472
- Title: Rubric-Aware On-Policy Self-Distillation for LLM Personalization
- Title(参考訳): LLMパーソナライゼーションのためのルーブリック型オンポリシィ自己蒸留
- Abstract要約: GRASPは、ユーザ固有のルーリックな側面を、きめ細かいトークンレベルの監視に変換する。
GRASPは、配布不要の学生とルーブリックインフォームド教師をペアリングする。
RTVは、教師が十分に対象の側面をカバーするインスタンスのみを保持する。
- 参考スコア(独自算出の注目度): 12.310826168709172
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM personalization aims to generate responses aligned with individual users' preferences and needs. User-specific rubrics make these expectations explicit, providing direct supervision on what a satisfactory answer should cover. Existing rubric-guided approaches, however, exploit such guidance only at a coarse granularity, either by using rubrics to supervise the prediction of relevant aspects for subsequent generation or by reducing aspect coverage to a single response-level reward for reinforcement learning. This leaves a gap between specifying what a personalized answer should contain and teaching the model how to generate it. To bridge this gap, we propose GRASP, a rubric-aware on-policy self-distillation framework for LLM personalization that turns user-specific rubric aspects into fine-grained, token-level supervision. Specifically, GRASP pairs a rubric-free student with a rubric-informed teacher that additionally receives the target user-specific rubrics. By aligning their next-token distributions along on-policy trajectories generated by the student, GRASP transfers the teacher's rubric-conditioned guidance into the student, translating user-specific semantic requirements into dense token-level supervision. Since rubric-informed teachers can still produce inadequate supervision, we further introduce Rubric-based Teacher Validation (RTV), which retains only instances where the teacher sufficiently covers the target aspects, improving both supervision quality and training efficiency. Experiments on the LaMP-QA benchmark for personalized question answering demonstrate that GRASP achieves state-of-the-art performance across multiple backbones, supporting the effectiveness of rubric-guided token-level supervision for personalization. To ensure reproducibility, our code is available at https://github.com/SnowCharmQ/GRASP.
- Abstract(参考訳): LLMパーソナライゼーションは、個々のユーザの好みやニーズに応じた応答を生成することを目的としている。
ユーザ固有のルーリックは、これらの期待を明確にし、満足のいく回答がカバーすべきものを直接監督します。
しかし、既存のルーブリック誘導アプローチは、粗粒度のみにしか利用できないため、ルーブリックを用いてその後の生成に関連する側面の予測を監督するか、あるいは強化学習のための単一の応答レベル報酬にアスペクトカバレッジを還元する。
このことは、パーソナライズされた回答に含めるべきものを指定することと、モデルにそれを生成する方法を教えることのギャップを残します。
このギャップを埋めるために,ユーザ固有のルーリックな側面をきめ細かなトークンレベルの監視に変換するLLMパーソナライズのための,ルーリック対応の自己蒸留フレームワークGRASPを提案する。
具体的には、GRASPは、対象のユーザ固有のルーリックを受信するルーリックインフォームド教師と、ルーリックフリーの学生をペアリングする。
GRASPは、学生が生み出したオンライントラジェクトリに沿って、次のTokenディストリビューションをアライメントすることで、教師のルーリック条件のガイダンスを学生に転送し、ユーザ固有のセマンティック要件を、密集したトークンレベルの監視に変換する。
ルーブリック・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォームド・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション・インフォメーション(RTV)を導入した。
パーソナライズされた質問応答のためのLaMP-QAベンチマークの実験では、GRASPが複数のバックボーンにまたがる最先端のパフォーマンスを実現し、ルーリック誘導トークンレベルのパーソナライゼーションの有効性を実証している。
再現性を確保するため、私たちのコードはhttps://github.com/SnowCharmQ/GRASP.orgで利用可能です。
関連論文リスト
- TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment [70.40748464576045]
強力な教師モデルから小さな学生への蒸留はギャップカースに面している。
教師がより高度に成長するにつれて、複雑な分布は生徒が近似できるものから多様化し、パフォーマンスが低下する。
本研究では,教師がデータを捨てたり,推論品質を劣化させたりすることなく,直接生徒の分布に適応する教師アライメントを提案する。
論文 参考訳(メタデータ) (2026-09-27T10:13:54Z) - BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception [39.275142281870984]
BAS-OPDは,限られたクエリ予算の下で教師の監督を割り当てる,予算に配慮した選択型OPDフレームワークである。
BAS-OPDは教師の監督コストを大幅に削減しつつ, 高い性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-09-22T08:57:40Z) - Learning from the Future: Privileged Self-Distillation for Sequential Recommendation [51.993699802866956]
本稿では,学習時間情報と推論時間情報とを分離するフレームワークを提案する。
Privileged Self-Distillation (PSD)は、学習時間情報を推論時間情報から分離する。
PSDは1つの段階でエンドツーエンドに最適化され、デプロイされたモデルと推論コストは変わらない。
論文 参考訳(メタデータ) (2026-07-29T15:47:22Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation [13.207215458280698]
On-policy Self-distillation (OPSD)は、自身のロールアウトでモデルをトレーニングし、フリーズコピーを使用して、参照ターゲットに条件付けされた密集したトークンレベルターゲットを提供する。
MLLMポストトレーニングのための視覚的基盤を持つフレームワークであるViGOSを提案する。
論文 参考訳(メタデータ) (2026-06-17T14:33:38Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。