論文の概要: Uncertainty-Calibrated Recommendations for Low-Active Users
- arxiv url: http://arxiv.org/abs/2605.17788v2
- Date: Mon, 25 May 2026 01:59:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 16:32:37.65362
- Title: Uncertainty-Calibrated Recommendations for Low-Active Users
- Title(参考訳): 低活性ユーザのための不確実性校正勧告
- Abstract要約: 低アクティブユーザ(LAU)と高アクティブユーザ(HAU)の多様性のバランスをとる必要があると我々は主張する。
差別化戦略を推進するために不確実性を校正する、統一的で生産可能なフレームワークを導入します。
具体的には、モデル不確実性に基づくリスクボイス政策をLAUに対して実施し、信頼性の低いレコメンデーションを抑えるとともに、HAUに対するリスク検索アッパー信頼境界(UCB)戦略を用いて探索を促進する。
- 参考スコア(独自算出の注目度): 5.352737097777987
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A fundamental challenge in recommender systems is balancing reliability for Low-Active Users (LAUs) with diversity for High-Active Users (HAUs). The key to this balance lies in quantifying model uncertainty, which approximates the risk of prediction errors and reveals the limits of the model's current knowledge. On large-scale short-video and livestream platforms, model uncertainty can warn of low-quality recommendations that may lead to disengagement of LAUs and at the same time identify opportunities to diversify content recommendation for HAUs. To leverage this dichotomy, we introduce a unified, production-ready framework that calibrates uncertainty to drive differentiated strategies. Specifically, we implement a model-uncertainty-based risk-averse deboosting policy for LAUs to suppress unreliable recommendations, while employing a risk-seeking Upper Confidence Bound (UCB) strategy for HAUs to encourage exploration. Validated on a major livestream platform, our framework demonstrates significant improvements in retention (active hours) and satisfaction (quality watch time ratio) for LAUs as well as remarkable increases in interest diversity and category coverage for HAUs, proving the value of uncertainty-aware recommendation in industrial settings.
- Abstract(参考訳): 推薦システムにおける基本的な課題は、低アクティブユーザ(LAU)と高アクティブユーザ(HAU)の多様性のバランスをとることである。
このバランスの鍵はモデルの不確実性を定量化し、予測エラーのリスクを近似し、モデルの現在の知識の限界を明らかにすることである。
大規模なショートビデオおよびライブストリームプラットフォームでは、モデル不確実性は、LAUの離脱につながる低品質なレコメンデーションを警告すると同時に、HAUのコンテンツレコメンデーションを多様化する機会を特定することができる。
この二分法を活用するために、不確実性を校正し、差別化された戦略を駆動する統一された生産可能なフレームワークを導入する。
具体的には、モデル不確実性に基づくリスク回避政策をLAUに対して実施し、信頼性の低いレコメンデーションを抑えるとともに、HAUに対するリスク検索アッパー信頼境界(UCB)戦略を用いて探索を促進する。
主要ライブストリームプラットフォーム上で検証した結果,LAUの維持率(アクティブ時間)と満足度(品質視聴時間比)の大幅な改善,HAUの関心の多様性とカテゴリーカバレッジの顕著な増加,産業環境における不確実性を考慮した推薦の価値が示された。
関連論文リスト
- Improving Safety Alignment via Balanced Direct Preference Optimization [36.066367724362614]
大規模言語モデル(LLM)の安全性向上のため,人間フィードバックからの強化学習(RLHF)が採用されている。
直接優先度最適化(DPO)は安全アライメントに広く用いられている。
本稿では,モデルのトレーニングデータの理解の観点から,オーバーフィッティング現象を再考する。
論文 参考訳(メタデータ) (2026-03-24T06:04:09Z) - Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models [57.006252510102506]
強化学習(Reinforcement Learning, RL)は、最適な意思決定と制御のための強力なフレームワークである。
本稿では,未知および非線形連続力学系に対する安全性を低くした安全RLを実現するための新しい回復型遮蔽フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T22:03:35Z) - Uncertainty-aware Generative Recommendation [52.0751022792023]
Uncertainty-aware Generative Recommendation (UGR)は、適応最適化のための重要な信号として不確実性を利用する統一的なフレームワークである。
UGRは優れたレコメンデーション性能を得るだけでなく、トレーニングを根本的に安定化させ、標準手法でよく見られる性能劣化を防ぐ。
論文 参考訳(メタデータ) (2026-02-12T08:48:51Z) - Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems [3.937681476010311]
本稿では,不確実性と公平性の評価が大規模言語モデル(LLM)の精度,一貫性,信頼性に与える影響について検討する。
我々は(エントロピーを通じて)予測の不確実性を定量化し、Google DeepMindのGemini 1.5 Flashが特定の機密属性に対して体系的に不確実性を示すことを示した。
本稿では,RecLLMに対する新たな不確実性評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-31T17:18:13Z) - Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation [56.92367609590823]
Long Chain-of-Thought (Long CoT)推論は、Large Language Models (LLMs)において有望であることを示している。
我々はLong CoTが本質的にシーケンシャルなレコメンデーションドメインに不適合であると主張している。
提案するRISER(Reinforced Item Space Exploration framework for Recommendation)を提案する。
論文 参考訳(メタデータ) (2026-01-31T10:02:43Z) - Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning [78.92934995292113]
本稿では,既知の偽造と新規な偽造の信頼のバランスをとる,信頼を意識した非対称学習(CAL)フレームワークを提案する。
CALは従来手法を一貫して上回り、既知の偽造と新しい偽造の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-12-14T12:31:28Z) - A Novel Generative Model with Causality Constraint for Mitigating Biases in Recommender Systems [20.672668625179526]
遅延共起バイアスは、ユーザのフィードバックとアイテムの露出の間の真の因果関係を曖昧にする可能性がある。
本稿では,Recommender Systemsにおける表現学習のための遅延因果制約(Latent Causality Constraints)と呼ばれる新しい生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-22T14:09:39Z) - Deterministic Uncertainty Propagation for Improved Model-Based Offline Reinforcement Learning [12.490614705930676]
本稿では,ベルマン目標計算によって得られたモンテカルロ試料数に対する準最適性の強い依存性を示す理論的結果を示す。
我々の主な貢献は、進行モーメントマッチングを利用するベルマン目標に対する決定論的近似である。
我々は,既存のモンテカルロサンプリング手法よりもMOMBOの準最適性について,より厳密な保証を提供することが可能であることを示す。
論文 参考訳(メタデータ) (2024-06-06T13:58:41Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - Safe Deployment for Counterfactual Learning to Rank with Exposure-Based
Risk Minimization [63.93275508300137]
本稿では,安全な配置を理論的に保証する新たなリスク認識型対実学習ランク法を提案する。
提案手法の有効性を実験的に検証し,データが少ない場合の動作不良の早期回避に有効であることを示す。
論文 参考訳(メタデータ) (2023-04-26T15:54:23Z) - CausPref: Causal Preference Learning for Out-of-Distribution
Recommendation [36.22965012642248]
現在のレコメンデータシステムは、現実的なシナリオにおけるユーザやアイテムの配布シフトに対して、依然として脆弱である。
本稿では,推奨特化DAG学習者を因果選好に基づく推薦フレームワークCausPrefに組み込むことを提案する。
当社のアプローチは、アウト・オブ・ディストリビューション・セッティングのタイプにおいて、ベンチマークモデルを大幅に上回っている。
論文 参考訳(メタデータ) (2022-02-08T16:42:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。