論文の概要: RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation
- arxiv url: http://arxiv.org/abs/2607.15730v1
- Date: Fri, 17 Jul 2026 08:10:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.789187
- Title: RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation
- Title(参考訳): RECAP:ショートビデオレコメンデーションのためのフィードバック駆動ストリーミングセマンティックユーザプロファイル
- Abstract要約: 言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
- 参考スコア(独自算出の注目度): 74.86562505934961
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language-based user profiles convert long behavioral histories into explicit semantic representations for recommendation. However, most profile generators are optimized in an open loop: they may summarize past behavior fluently, but are not directly trained to improve future recommendation. We study this problem in real-world short-video recommendation, where user behaviors continuously arrive as streams and profiles must be incrementally updated under limited capacity. This requires maintaining a consistent bounded profile state and constructing profile-targeted semantic feedback from industrial implicit behavior logs. We propose RECAP, an offline closed-loop framework for optimizing streaming structured semantic profiles with historical recommendation feedback. RECAP maintains each profile as a bounded structured memory by combining LLM-based semantic updates with deterministic lifecycle and capacity control. RECAP constructs profile-targeted semantic feedback by filtering label-consistent behavior pairs with an LLM judge and training a dual-tower evaluator whose matching score serves as a GRPO reward. Experiments on Kuaishou short-video data show that RECAP improves uAUC by 0.0084 and Recall@2000 by about 4.9% over the base generator. Further analyses confirm the benefits of feedback construction and policy optimization, and show more grounded refinement and user-level abstraction in profile updates. A seven-day online A/B test further shows a statistically significant 0.139% improvement in average application usage time per user.
- Abstract(参考訳): 言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
しかし、ほとんどのプロファイルジェネレータは、オープンループで最適化されている。過去の振る舞いをシームレスに要約するが、将来の推奨を改善するために直接訓練されることはない。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
これにより、一貫したプロファイル状態を維持し、産業的な暗黙の振る舞いログからプロファイルをターゲットとしたセマンティックフィードバックを構築する必要がある。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
RECAPは、LCMベースのセマンティックアップデートと決定論的ライフサイクルとキャパシティコントロールを組み合わせることで、各プロファイルを有界な構造化メモリとして維持する。
RECAPは、ラベルと一貫性のある動作ペアをLLM判定器でフィルタリングし、一致するスコアがGRPO報酬として機能するデュアルトワー評価器を訓練することにより、プロファイルをターゲットとしたセマンティックフィードバックを構築する。
Kuaishou短ビデオデータの実験では、RECAPはuAUCを0.0084改善し、Recall@2000はベースジェネレータの約4.9%改善した。
さらに、フィードバック構築とポリシー最適化の利点を確認し、プロファイル更新においてより基礎的な洗練とユーザレベルの抽象化を示す。
7日間のオンラインA/Bテストはさらに、統計学的に有意な0.139%の改善を示している。
関連論文リスト
- Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models [77.02066500576528]
Enoughは、行動記録を反復的に付加する手法であり、適応長のプロファイルを構築するためにSTOPを出力する。
有効性と効率の両面で、強力で検索の強化されたベースラインをはるかに上回ります。
論文 参考訳(メタデータ) (2026-09-08T03:09:19Z) - RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation [41.239756064223776]
RecoRewardは、トレーニング中に行動由来の報酬を使用し、コンテンツのみの推論を保存する。
RecoRewardは、コンテンツのみのサービスを維持しながら、下流のレコメンデーションに役立つアイテム機能を作成するためにMLLMを訓練している。
論文 参考訳(メタデータ) (2026-07-28T15:59:00Z) - Prediction Is Not Memory: Dual-Timescale Gated Profile Writing for Persistent User Modeling [0.0]
永続的なユーザプロファイルは、リコメンデータシステムにおける再利用可能なメモリとしてますます役立っている。
我々はこの境界を選択的プロファイル書き込み制御として定式化する。
コントローラをSPW-Gate, 長期的, 短期的, 候補となるドリフト機能を用いたライトライトリスクゲートとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-07-03T14:49:15Z) - Long-Term Optimization for Large-Scale Generative Retrieval with Off-Policy REINFORCE [0.0]
セッションレベルのシーケンシャルな意思決定問題としてレコメンデーションを定式化する。
本稿では、事前収集データに基づいて、外部のREINFORCEを用いて生成検索者を訓練するための自己回帰的アプローチを提案する。
論文 参考訳(メタデータ) (2026-07-02T23:13:36Z) - LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation [26.684846150915153]
本稿では、パーソナライゼーションを表すフレームワークであるLATTE(Latent Trajectory Tracking and Extrapolation)を提案する。
LATTEは、検索、要約メモリ、静的潜時プロファイル、差認識潜時プロファイル、ソフトプロンプト圧縮ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-26T06:50:45Z) - StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios [38.37032285408029]
本稿では,ストリーミングユーザの詳細なプロファイリングのベンチマークであるStreamProfileBenchを紹介する。
5つの多様なプラットフォームにまたがる7,000以上の実際のユーザから12万以上のポストの、非常に正確なデータセットをキュレートします。
ユーザの関心の時間的相関を利用して,新しいアノテーションのない評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T12:10:15Z) - Prompt Tuning as User Inherent Profile Inference Machine [68.16976932088708]
本稿では,ユーザプロファイルの推測にプロンプトチューニングを用いるUserIP-Tuningを提案する。
UserIP-Tuningは最先端のレコメンデーションアルゴリズムより優れている。
提案されたソリューションは2025年5月からHuawei AppGalleryのExploreページにデプロイされている。
論文 参考訳(メタデータ) (2024-08-13T02:25:46Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z) - Lusifer: LLM-based User SImulated Feedback Environment for online Recommender systems [0.0]
強化学習(RL)レコメンデータシステムは、現実のシナリオにおけるユーザの好みの性質を変えることなく、流体をキャプチャできない静的データセットに依存することが多い。
LLMベースのシミュレーション環境であるLulsiferを導入し、RLベースのレコメンデータトレーニングのための動的で現実的なユーザフィードバックを生成する。
論文 参考訳(メタデータ) (2024-05-22T05:43:15Z) - RLVF: Learning from Verbal Feedback without Overgeneralization [94.19501420241188]
本稿では,このような過度な一般化を伴わずに,言語フィードバックを取り入れることの課題について検討する。
制約付き選好最適化(C3PO)を用いた新しい文脈的批評手法を開発した。
提案手法は,他の文脈に対する既存行動を維持しながら,関連するシナリオに対して効果的な言語フィードバックを適用する。
論文 参考訳(メタデータ) (2024-02-16T18:50:24Z) - Recommender Transformers with Behavior Pathways [50.842316273120744]
Recommender Transformer (RETR) を新しいパスウェイアテンション機構で構築する。
実世界の7つのデータセットにおけるRETRの有効性を実証的に検証する。
論文 参考訳(メタデータ) (2022-06-13T08:58:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。