論文の概要: Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation
- arxiv url: http://arxiv.org/abs/2608.11980v2
- Date: Sat, 15 Aug 2026 11:55:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.028706
- Title: Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation
- Title(参考訳): 理解不能なリワードからの学習: 生成的リコメンデーションのためのヒントコンディション強化学習
- Abstract要約: Semantic-ID生成レコメンデータは、各項目を個別のセマンティックトークンの短いシーケンスとして表現し、このトークンシーケンスを自動回帰生成することで次の項目を予測する。
このパラダイムは、アイテムID、履歴、アイテムテキストのための統一された生成インターフェースを実現するが、報酬ベースのポストトレーニング中に構造化された最適化ボトルネックも生成する。
このようなハードトレーニングインスタンスの学習信号を復元するセマンティックID生成レコメンデーションフレームワークHCGRecを提案する。
HCGRecは、教師付き微調整とバニラ報酬に基づくポストトレーニングを大幅に改善し、ゼロアドバンテージトレーニングサンプルを70%以上から20%以下に削減する。
- 参考スコア(独自算出の注目度): 39.5807784132569
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic-ID generative recommenders represent each item as a short sequence of discrete semantic tokens and predict the next item by autoregressively generating this token sequence. This paradigm enables a unified generation interface for item IDs, histories, and item text, but it also creates a structured optimization bottleneck during reward-based post-training: when an early semantic token enters the wrong branch of the item-token space, finite rollout groups rarely reach the ground-truth item, so group-relative optimization receives identical zero rewards and produces no useful advantage. We propose Hint-Conditioned Generative Recommendation (HCGRec), a semantic-ID generative recommendation framework that recovers learning signal for such hard training instances. HCGRec diagnoses each instance with checkpoint rollouts and supplies a minimal target-prefix hint only when the current generator cannot reach the correct item. The model then generates the unhinted suffix under the hinted semantic branch, turning zero-reward groups into informative comparisons over item-token completions. Hinting also changes token identity: hinted prefix tokens are oracle-provided item context, while unhinted suffix tokens are sampled generation actions. We therefore introduce hint-aware credit decomposition, using supervised learning to preserve item-semantic and prefix-structure alignment for hinted tokens and GRPO to optimize the sampled suffix. Experiments on sequential recommendation benchmarks show that HCGRec substantially improves over supervised fine-tuning and vanilla reward-based post-training, while reducing zero-advantage training samples from over 70% to below 20%. The code is accessible at https://github.com/WncFht/GRec.
- Abstract(参考訳): Semantic-ID生成レコメンデータは、各項目を個別のセマンティックトークンの短いシーケンスとして表現し、このトークンシーケンスを自動回帰生成することで次の項目を予測する。
このパラダイムは、アイテムID、履歴、アイテムテキストの統一的な生成インターフェースを実現するが、報酬ベースのポストトレーニング中に構造化された最適化ボトルネックを生成する: 初期セマンティックトークンがアイテム・ツーケン空間の間違った分岐に入ると、有限ロールアウトグループがグラウンド・トゥルース・アイテムに到達することは滅多になく、グループ相対最適化はゼロ報酬を受け取り、有用な利点を生まない。
本研究では,Hint-Conditioned Generative Recommendation (HCGRec)を提案する。
HCGRecはチェックポイントロールアウトで各インスタンスを診断し、現在のジェネレータが正しいアイテムに到達できない場合にのみ、最小限のターゲット修正ヒントを提供する。
モデルは、ヒント付きセマンティックブランチの下で隠れた接尾辞を生成し、ゼロ逆群をアイテムの完了に対する情報的比較に変換する。
ヒント付きプレフィックストークンはオラクルが提供するアイテムコンテキストであり、隠れた接尾辞トークンはサンプル生成アクションである。
そこで,教師付き学習を用いてヒント付きトークンの項目意味的およびプレフィックス構造的アライメントを保ち,GRPOを用いてサンプル接尾辞を最適化する。
シーケンシャルレコメンデーションベンチマークの実験では、HCGRecは教師付き微調整とバニラ報酬に基づくポストトレーニングよりも大幅に改善し、ゼロアドバンテージトレーニングサンプルを70%以上から20%以下に削減した。
コードはhttps://github.com/WncFht/GRecでアクセスできる。
関連論文リスト
- Preserving Item Semantics for Free: Rethinking Token Initialization in LLM-Based Generative Recommendation [33.094341397930776]
生成レコメンデーションシステムでは、アイテムはしばしばセマンティックID(SID)を通して表現される
標準的な語彙展開は、これらのトークンをランダムなガウスベクトルとして初期化し、SIDの基礎となる連続幾何学を捨てる。
本稿では,SIDトークンの埋め込みをセマンティックな埋め込み空間において対応するセントロイドから直接初期化する,シンプルなパラメータフリーな介入を提案する。
論文 参考訳(メタデータ) (2026-08-07T23:33:08Z) - VaLiDRec: Variable-Length LLM-Aligned Semantic IDs for Generative Recommendation [39.59701442467294]
VaLiDRecは、可変長LLM対応セマンティック識別子に基づく生成レコメンデーションフレームワークである。
ユーザの好みをモデル化するために、VaLiDRecはグラフ対応のソフトプロンプトを導入し、トークンセット予測としてレコメンデーションを再構成する。
実世界の4つのデータセットの実験では、VaLiDRecは、強い、シーケンシャルな生成推奨ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-28T02:29:10Z) - SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation [43.98709365191658]
生成レコメンデーションは、次点予測を自己回帰的アイテム識別生成として扱う。
最近の研究は、このパラダイムを推論トレースで強化し、検証可能な報酬で強化学習を通じて最適化している。
大局的なレコメンデーションでは、生成されたSIDに対する正確なマッチングフィードバックは、最終項目が正しいかどうかのみを報告する。
論文 参考訳(メタデータ) (2026-05-17T20:53:08Z) - RAGR: Review-Augmented Generative Recommendation [61.29879991713178]
Review-Augmented Generative Recommendation (RAGR)は、レビューフィードバックを直接生成ユーザシーケンスに組み込む新しいGRフレームワークである。
RAGRは、すべてのメトリクスにわたる強力なGRバックボーンよりも一貫性があり、大きな利益をもたらす。
論文 参考訳(メタデータ) (2026-05-17T05:21:23Z) - CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation [55.783414010717074]
CoFiRecは、アイテム情報をセマンティックレベルに分解する新しい生成レコメンデーションフレームワークである。
我々は、CoFiRecが既存の手法より優れており、ジェネレーティブレコメンデーションの新しい視点を提供することを示す。
論文 参考訳(メタデータ) (2025-11-27T18:59:35Z) - Pre-training Generative Recommender with Multi-Identifier Item Tokenization [78.87007819266957]
本稿では, MTGRecを用いて, 生成Recommender事前学習のためのトークンシーケンスデータを拡張する手法を提案する。
このアプローチには、マルチアイデンティティーアイテムトークン化とカリキュラムレコメンデータ事前トレーニングという、2つの重要なイノベーションがあります。
3つの公開ベンチマークデータセットに対する大規模な実験は、MTGRecが従来の推奨基準と生成推奨基準の両方を大きく上回っていることを示している。
論文 参考訳(メタデータ) (2025-04-06T08:03:03Z) - Order-agnostic Identifier for Large Language Model-based Generative Recommendation [94.37662915542603]
アイテムは、ユーザ履歴をエンコードし、次のアイテムを生成するために、LLM(Large Language Models)の識別子に割り当てられる。
既存のアプローチでは、トークンシーケンス識別子を使用して、アイテムを個別のトークンシーケンスとして表現するか、IDまたはセマンティック埋め込みを使用して単一トークン識別子を使用する。
本稿では,セマンティック・トークンライザを利用するSETRecを提案する。
論文 参考訳(メタデータ) (2025-02-15T15:25:38Z) - Enhancing Item Tokenization for Generative Recommendation through Self-Improvement [67.94240423434944]
生成レコメンデーションシステムは大規模言語モデル(LLM)によって駆動される
現在のアイテムトークン化手法には、テキスト記述、数値文字列、離散トークンのシーケンスの使用が含まれる。
自己改善アイテムトークン化手法を提案し,LLMがトレーニングプロセス中に独自のアイテムトークン化を洗練できるようにする。
論文 参考訳(メタデータ) (2024-12-22T21:56:15Z) - Learning Multi-Aspect Item Palette: A Semantic Tokenization Framework for Generative Recommendation [55.99632509895994]
マルチアスペクトセマンティックトークン化のための新しいアプローチであるLAMIAを紹介する。
単一の埋め込みを使用するRQ-VAEとは異なり、LAMIAは独立的でセマンティックな並列な埋め込みの集合である「アイテムパレット」を学習する。
その結果,提案手法よりも提案手法の精度が大幅に向上した。
論文 参考訳(メタデータ) (2024-09-11T13:49:48Z) - Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic
Segmentation [59.37587762543934]
本稿では,弱開語彙セマンティックセマンティックセグメンテーション(WOVSS)の問題点について検討する。
既存の方法は、グループトークンの使用に関する粒度の矛盾に悩まされる。
マルチモーダル正規化を組み込んだプロトタイプ誘導ネットワーク(PGSeg)を提案する。
論文 参考訳(メタデータ) (2023-10-29T13:18:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。