論文の概要: Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning
- arxiv url: http://arxiv.org/abs/2607.14192v2
- Date: Mon, 20 Jul 2026 20:30:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.183623
- Title: Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning
- Title(参考訳): モデルに依存しない下流リワード学習による長期ユーザエンゲージメント最適化
- Authors: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven Badani, Yijie Dylan Wang,
- Abstract要約: 本稿では,大規模レコメンデーションシステムにおいて,長期ユーザ価値を最適化するための統一的,モデルに依存しないダウンストリーム報酬フレームワークを提案する。
複数のソースで観測されたユーザ行動パターンから得られたモデルに依存しないダウンストリーム報酬信号を提案する。
オンラインA/B実験は、エンゲージメントと保持関連メトリクスの一貫性のある改善を示している。
- 参考スコア(独自算出の注目度): 2.66348673166416
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As recommender systems mature in the past few years, their optimization objectives have evolved from a primary focusing on short-term behavioral signals to a broader emphasis on long-term user engagement and retention. However, directly optimizing retention is difficult because return signals are sparse, delayed, and only partially attributable to earlier recommendations. Prior work has addressed this challenge with sequential modeling and reinforcement learning, but these approaches typically require task specific reward engineering, substantial computational overhead, and surface specific implementations that are difficult to generalize. In this paper, we present a unified, model-agnostic downstream reward framework for optimizing long-term user value in large-scale recommendation systems. First, we formulate the downstream reward learning problem and develop an offline screening framework to identify session level behaviors that are both observable early and predictive of future retention. We then propose several model-agnostic downstream rewards signals derived from observed user action patterns across multiple sources. We further discuss the engineering effort to productionize the proposed rewards derivations and challenges we faced when adding them to our ranking models. Online A/B experiments demonstrate consistent improvements in engagement and retention-related metrics, and the framework has been deployed across multiple Pinterest surfaces, including Homefeed, Related Pins, Search, and Notifications.
- Abstract(参考訳): 過去数年間に成熟したレコメンデーターシステムは、短期的な行動信号に重点を置いた最適化目標から、長期的なユーザエンゲージメントと維持を重視した最適化目標へと進化してきた。
しかし、リターン信号が疎く、遅延しており、部分的には以前の推奨に起因しているため、直接保持を最適化することは困難である。
従来の研究は、逐次モデリングと強化学習でこの問題に対処してきたが、これらのアプローチには通常、タスク固有の報酬工学、かなりの計算オーバーヘッド、一般化が難しい表面的な特定の実装が必要である。
本稿では,大規模レコメンデーションシステムにおける長期ユーザ価値を最適化するための,モデルに依存しない統一的なダウンストリーム報酬フレームワークを提案する。
まず、下流の報酬学習問題を定式化し、早期に観測可能なセッションレベルの動作と将来の保持を予測可能なセッションレベルの挙動を識別するオフラインスクリーニングフレームワークを開発する。
次に,複数のソースにまたがる観察されたユーザ行動パターンから得られる,モデルに依存しないダウンストリーム報酬信号を提案する。
さらに、ランク付けモデルにそれらを追加する際に直面する報酬の導出と課題を生産するエンジニアリングの取り組みについて論じる。
オンラインA/B実験は、エンゲージメントと保持関連メトリクスの一貫性のある改善を示し、フレームワークは、Homefeed、Related Pins、Search、Notificationsなど、複数のPinterestサーフェスにデプロイされている。
関連論文リスト
- GEMs: Breaking the Long-Sequence Barrier in Generative Recommendation with a Multi-Stream Decoder [54.64137490632567]
本稿では,長期的履歴からユーザのシーケンスをキャプチャする新しい統一フレームワークを提案する。
GEM(Generative Multi-streamer)は、ユーザのシーケンスを3つのストリームに分割する。
大規模産業データセットに対する大規模な実験により、GEMは推奨精度において最先端の手法を大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-14T06:42:56Z) - Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following [19.550149895505683]
Climber-Pilotは統合された生成検索フレームワークである。
TAMIP(Time-Aware Multi-Item Prediction)は、遺伝的検索において固有の近視を緩和する新しいトレーニングパラダイムである。
また,ビジネス制約をスパース・アテンションを介して生成プロセスに直接組み込むコンディションガイド付きスパース・アテンション(CGSA)を提案する。
論文 参考訳(メタデータ) (2026-02-14T03:46:06Z) - Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation [24.788289121071575]
ショートビデオレコメンデータシステムは、通常、クリックやウォッチタイムなどの密集したユーザの行動信号を使用してランキングモデルを最適化する。
近年,高品質なダイレクトアライメント監視として,アンケートを通じて収集した明確な満足度フィードバックが出現している。
本研究では,EASQ と呼ばれる質問紙によるユーザ満足度をエンド・ツー・エンドにすることで,ランキングモデルのリアルタイムアライメントと真のユーザ満足度を実現するための新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-01-28T03:32:21Z) - Don't Waste It: Guiding Generative Recommenders with Structured Human Priors via Multi-head Decoding [36.10174210922267]
生成的推薦者のエンド・ツー・エンドトレーニングに直接、人間の先入観を直接シームレスに統合するバックボーン非依存の枠組みを導入する。
本手法は精度と超精度の両方を著しく向上させる。
論文 参考訳(メタデータ) (2025-11-13T16:59:22Z) - Retentive Relevance: Capturing Long-Term User Value in Recommendation Systems [29.596401271139797]
本稿では,新しいコンテンツレベル調査に基づくフィードバック尺度であるRetentive Relevanceを紹介する。
Retentive Relevanceは、ユーザーが同様のコンテンツのためにプラットフォームに戻る意図を直接評価する。
これらの結果から,Retentive Relevanceは,エンゲージメント信号および他の調査指標よりも,翌日のリテンションの予測に優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-10-08T23:38:57Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Slow Thinking for Sequential Recommendation [88.46598279655575]
本稿では,STREAM-Recという新しいスローシンキングレコメンデーションモデルを提案する。
弊社のアプローチは、過去のユーザの振る舞いを分析し、多段階の熟考的推論プロセスを生成し、パーソナライズされたレコメンデーションを提供する。
具体的には,(1)レコメンデーションシステムにおける適切な推論パターンを特定すること,(2)従来のレコメンデーションシステムの推論能力を効果的に刺激する方法を検討すること,の2つの課題に焦点を当てる。
論文 参考訳(メタデータ) (2025-04-13T15:53:30Z) - Long-Sequence Recommendation Models Need Decoupled Embeddings [49.410906935283585]
我々は、既存の長期推薦モデルにおいて無視された欠陥を識別し、特徴付ける。
埋め込みの単一のセットは、注意と表現の両方を学ぶのに苦労し、これら2つのプロセス間の干渉につながります。
本稿では,2つの異なる埋め込みテーブルを別々に学習し,注意と表現を完全に分離する,DARE(Decoupled Attention and Representation Embeddings)モデルを提案する。
論文 参考訳(メタデータ) (2024-10-03T15:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。