論文の概要: Reward Guided Decoding for Generative Recommendation
- arxiv url: http://arxiv.org/abs/2607.25344v1
- Date: Tue, 28 Jul 2026 06:46:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.736866
- Title: Reward Guided Decoding for Generative Recommendation
- Title(参考訳): Reward Guided Decoding for Generative Recommendation
- Authors: Ruochen Yang, Yusheng Huang, Youfeng Zheng, Shuang Wen, Liangliang Chen, Pengbo Xu, Xiaoyu Zhang, Shijun Wang, Shuang Yang, Zhaojie Liu, Lantao Hu, Wenwu Ou, Jiawei Sheng, Tingwen Liu,
- Abstract要約: 我々は、KL正規化報酬レコメンデーション問題として値誘導復号法を定式化する。
テストタイムコントローラとして報酬モデルを導入し、各デコードステップに報酬を注入し、ジェネレータを再学習することなく探索軌道を再構成する。
当社のアプローチはKuaishouプラットフォームにデプロイされており、現実のレコメンデーションシナリオを一貫した改善を実現しています。
- 参考スコア(独自算出の注目度): 31.411371973118975
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative recommendation formulates recommendation task into an SID sequence autoregressive generation paradigm, but the decoding process is often dominated by generation likelihood. This may conflict with real-world business objectives, where high-value candidates can receive low generation probability and be pruned early during beam search. Existing reranking or training-time alignment methods either intervene too late or require costly model retraining when business preferences change. To this end, we propose \textbf{R}eward \textbf{G}uided \textbf{D}ecoding, named \textbf{RGD}, a controllable decoding framework for industrial value-oriented generative recommendation. We formulate value-guided decoding as a KL-regularized reward maximization problem, deriving a closed-form reward guided decoding distribution that principledly combines generation probability with reward signals. RGD treats the base generator as a reference policy and introduces a reward model as a test-time controller, injecting reward into each decoding step to reshape the search trajectory without retraining the generator. Extensive offline and online experiments demonstrate the effectiveness of our approach for aligning personalization and business value. RGD has been deployed on the Kuaishou platform, bringing consistent improvements in real-world recommendation scenarios.
- Abstract(参考訳): 生成レコメンデーションは、レコメンデーションタスクをSIDシーケンスの自動回帰生成パラダイムに定式化するが、デコードプロセスは生成可能性によって支配されることが多い。
これは、高価値候補が低い生成確率を受け取り、ビームサーチ中に早期に刈り取られる現実世界のビジネス目標と矛盾する可能性がある。
既存のリグレードやトレーニングタイムアライメントの手法は遅すぎるか、ビジネスの好みが変わった場合、コストのかかるモデル再トレーニングを必要とします。
この目的のために,産業価値指向の生成レコメンデーションのための制御可能なデコードフレームワークである \textbf{R}eward \textbf{G}uided \textbf{D}ecoding を提案する。
我々は、KL正規化報酬最大化問題として値誘導復号を定式化し、生成確率と報奨信号とを原理的に結合した閉形式報酬誘導復号分布を導出した。
RGDは、基準ポリシとしてベースジェネレータを扱い、テストタイムコントローラとして報酬モデルを導入し、各デコードステップに報酬を注入して、ジェネレータを再トレーニングすることなく検索軌道を再構築する。
大規模なオフラインおよびオンライン実験は、パーソナライズとビジネス価値を整合させるアプローチの有効性を示している。
RGDはKuaishouプラットフォームにデプロイされ、現実世界のレコメンデーションシナリオに一貫した改善が加えられた。
関連論文リスト
- DeGRe: Dense-supervised Generative Reranking for Recommendation [22.41679588580571]
オフラインの探索とオンラインの効率のギャップを、密集した監督によって埋める、ジェネレーティブ・リグレード・フレームワークであるDeGReを提案する。
トレーニング中、評価器から高密度の監視信号に変換し、それらを軽量オンラインジェネレータに蒸留する。
私たちは、Taobao Flash ShoppingにDeGReをうまくデプロイし、オンラインレコメンデーションを大幅に改善しました。
論文 参考訳(メタデータ) (2026-05-25T12:00:42Z) - DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding [59.16244104797919]
本稿では,リスク制約付き復号法(DARC)*による分散アライメント(Disagreement-Aware Alignment)を提案する。
DARCは応答選択を、分布的に堅牢で、リスクに敏感な意思決定として捉えている。
アライメントベンチマークの実験では、DARCは競合平均品質を維持しながら、不一致と尾のリスクを低減する。
論文 参考訳(メタデータ) (2026-03-09T09:21:29Z) - Learning to Reflect and Correct: Towards Better Decoding Trajectories for Large-Scale Generative Recommendation [14.679550929790151]
Generative Recommendation (GR) は大規模レコメンデーションシステムにおいて有望なパラダイムとなっている。
本稿では,GRC(Generation-Reflection-Correction)プロセスに標準デコードを拡張するGRのための構造化反射補正フレームワークを提案する。
本稿では,効率的なオンラインサービスを実現するために,高不確実性復号化により多くの補正予算を動的に割り当てる Entropy-Guided Reflection Scheduling (EGRS) 戦略を提案する。
論文 参考訳(メタデータ) (2026-02-27T03:22:58Z) - Generative Actor Critic [74.04971271003869]
Generative Actor Critic (GAC) は、軌道上での関節分布の生成モデル学習として、テキスト政治評価を反映して、シーケンシャルな意思決定を分離する新しいフレームワークである。
Gym-MuJoCoとMaze2Dベンチマークの実験では、GACの強いオフライン性能と、最先端の手法と比較してオフラインからオフラインへの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-12-25T06:31:11Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization [55.14484317645865]
我々は,オフライン強化学習タスクにおいて,例外的な品質向上を促す条件拡散モデルを構築した。
本稿では,Promptディフューザがプロンプトチューニングプロセスの堅牢かつ効果的なツールであることを示し,メタRLタスクにおいて高い性能を示す。
論文 参考訳(メタデータ) (2024-11-02T07:38:02Z) - Complexity-Aware Deep Symbolic Regression with Robust Risk-Seeking Policy Gradients [20.941908494137806]
本稿では,データ駆動型数式発見の堅牢性と解釈可能性を高めるために,新しい記号回帰手法を提案する。
我々の研究は、データ固有の式生成器の学習に焦点を当てた、一般的なDSRフレームワークと一致しています。
論文 参考訳(メタデータ) (2024-06-10T19:29:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。