論文の概要: RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation
- arxiv url: http://arxiv.org/abs/2607.25901v1
- Date: Tue, 28 Jul 2026 15:59:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.910274
- Title: RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation
- Title(参考訳): RecoReward:レコメンデーションのためのレコメンデーションガイド付きマルチモーダル記述生成
- Authors: Guohong Mu, Yueyang Liu, Jiangxia Cao, Changxin Lao, Zijie Zhuang, Yuhui Zhang, Jiaqi Feng, Ruochen Yang, Shuang Yang, Zhaojie Liu, Qibin Hou,
- Abstract要約: RecoRewardは、トレーニング中に行動由来の報酬を使用し、コンテンツのみの推論を保存する。
RecoRewardは、コンテンツのみのサービスを維持しながら、下流のレコメンデーションに役立つアイテム機能を作成するためにMLLMを訓練している。
- 参考スコア(独自算出の注目度): 41.239756064223776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) can convert multimodal item content into structured descriptions used as semantic features for recommendation. Conventional content-only generation, however, cannot use downstream user signals to determine which semantics should be emphasized. Recent user-conditioned methods incorporate these signals through user histories or profiles, but they require user information at inference and make generation user-dependent. In this paper, we introduce RecoReward, which instead uses behavior-derived rewards during training and preserves content-only inference. To instantiate this idea in live-stream recommendation, we treat historically engaged users as a proxy for future target users and use observational non-target users to estimate affinity shared broadly across users. The Recommender Affinity Score (RAS) contrasts these signals to provide user-selective feedback for reinforcement learning, allowing the learned policy to generate a single shared description without user inputs. In our offline benchmark, RecoReward-9B outperforms its Qwen3.5-9B baseline and all other evaluated models across seven recall metrics. Online A/B testing also shows performance gains. These results show that RecoReward trains the MLLM to produce item features that benefit downstream recommendation while retaining content-only serving.
- Abstract(参考訳): MLLM(Multimodal large language model)は、マルチモーダル項目の内容をセマンティックな特徴として使用する構造化記述に変換する。
しかし、従来のコンテンツのみの生成では、どのセマンティクスを強調するべきかを決定するために下流のユーザー信号を使用することはできない。
近年のユーザコンディショニング手法では,ユーザ履歴やプロファイルを通じてこれらの信号を組み込んでいるが,推論時にユーザ情報が必要であり,ユーザ依存を生成する必要がある。
本稿では,RecoRewardについて紹介する。このRecoRewardは,トレーニング中に行動由来の報酬を使用し,コンテンツのみの推論を保存する。
このアイデアをライブストリームのレコメンデーションでインスタンス化するために、私たちは、過去のエンゲージメントユーザを将来のターゲットユーザのためのプロキシとして扱い、観察対象でないユーザを使用して、ユーザ間で広く共有される親近感を推定する。
Recommender Affinity Score(RAS)は、これらの信号と対比して、強化学習のためのユーザ選択的なフィードバックを提供する。
オフラインベンチマークでは、RecoReward-9Bは、Qwen3.5-9Bベースラインと7つのリコール指標で評価された他のすべてのモデルを上回っています。
オンラインA/Bテストもパフォーマンスの向上を示している。
これらの結果は、RecoRewardがMLLMをトレーニングして、コンテンツのみのサービスを維持しながら、下流のレコメンデーションに利益をもたらすアイテム機能を作成していることを示している。
関連論文リスト
- RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation [74.86562505934961]
言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
論文 参考訳(メタデータ) (2026-07-17T08:10:37Z) - Toward User Preference Alignment in LLM Recommendation via Explicit Context Feedback [46.88440233575785]
我々は,次世代のLarge Language Models(LLM)ベースのRecSysにおいて,明示的な文脈フィードバックの優先順位付けを提唱する。
よりパーソナライズされ、透明で、説明可能なRecSysオンラインプラットフォームを促進することを目指している。
論文 参考訳(メタデータ) (2026-05-27T22:10:33Z) - RecoWorld: Building Simulated Environments for Agentic Recommender Systems [55.979427290369216]
エージェントレコメンデータシステムに適したシミュレーション環境を構築するための青写真であるRecoWorldを提示する。
ユーザシミュレータは、推奨項目をレビューし、その考え方を更新し、潜在的なユーザ切り離しを感知すると、反射指示を生成する。
エージェント推奨者は、これらのユーザ命令と推論トレースを取り入れ、ダイナミックなフィードバックループを作成することで、そのレコメンデーションに適応する。
論文 参考訳(メタデータ) (2025-09-12T16:44:34Z) - Multi-agents based User Values Mining for Recommendation [52.26100802380767]
効率的なユーザ値抽出のためのゼロショットマルチLLM協調フレームワークを提案する。
本研究は,本質的な意味を保ちながら,項目内容のコンデンスにテキスト要約手法を適用した。
幻覚を緩和するために,評価役と監督役の2つの特殊エージェントの役割を導入する。
論文 参考訳(メタデータ) (2025-05-02T04:01:31Z) - SymCERE: Symmetric Contrastive Learning for Robust Review-Enhanced Recommendation [2.087411180679868]
提案するSymCEREは,提案する偽陰性に対処するコントラスト学習手法である。
3つのプラットフォームからの15のデータセットの実験では、SymCEREがいくつかの強力なベースラインを上回っていることが示されている。
論文 参考訳(メタデータ) (2025-04-03T00:40:09Z) - LLM-based User Profile Management for Recommender System [15.854727020186408]
PUREは、ユーザレビューから重要な情報を体系的に抽出し、要約することによって、進化するユーザプロファイルを構築し、維持する。
我々は、レビューを時間とともに追加し、予測を漸進的に更新することで、現実のシナリオを反映した連続的なレコメンデーションタスクを導入する。
Amazonデータセットに対する実験結果から、PUREは既存のLCMベースの手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-20T13:20:19Z) - Lusifer: LLM-based User SImulated Feedback Environment for online Recommender systems [0.0]
強化学習(RL)レコメンデータシステムは、現実のシナリオにおけるユーザの好みの性質を変えることなく、流体をキャプチャできない静的データセットに依存することが多い。
LLMベースのシミュレーション環境であるLulsiferを導入し、RLベースのレコメンデータトレーニングのための動的で現実的なユーザフィードバックを生成する。
論文 参考訳(メタデータ) (2024-05-22T05:43:15Z) - Latent User Intent Modeling for Sequential Recommenders [92.66888409973495]
逐次リコメンデータモデルは、プラットフォーム上での氏のインタラクション履歴に基づいて、ユーザが次に対話する可能性のあるアイテムを予測することを学習する。
しかし、ほとんどのシーケンシャルなレコメンデータは、ユーザの意図に対する高いレベルの理解を欠いている。
したがって、インテントモデリングはユーザー理解と長期ユーザーエクスペリエンスの最適化に不可欠である。
論文 参考訳(メタデータ) (2022-11-17T19:00:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。