Fugu-MT 論文翻訳(概要): Learning from a Learning User for Optimal Recommendations

論文の概要: Learning from a Learning User for Optimal Recommendations

arxiv url: http://arxiv.org/abs/2202.01879v1
Date: Thu, 3 Feb 2022 22:45:12 GMT
ステータス: 翻訳完了
システム内更新日: 2022-02-07 16:02:48.828265
Title: Learning from a Learning User for Optimal Recommendations
Title（参考訳）: 最適勧告のための学習者からの学習
Authors: Fan Yao, Chuanhao Li, Denis Nekipelov, Hongning Wang and Haifeng Xu
Abstract要約: 我々は「学習ユーザ」を捕捉し、効率的なシステム側学習ソリューションを設計するためのモデルを定式化する。ユーザ学習の収束率が悪化するにつれて,RAESの後悔は良好に悪化することを示す。本研究は,リコメンデーション問題におけるフィードバックループのモデル化に関する新たな視点を提供する。
参考スコア（独自算出の注目度）: 43.2268992294178
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: In real-world recommendation problems, especially those with a formidably large item space, users have to gradually learn to estimate the utility of any fresh recommendations from their experience about previously consumed items. This in turn affects their interaction dynamics with the system and can invalidate previous algorithms built on the omniscient user assumption. In this paper, we formalize a model to capture such "learning users" and design an efficient system-side learning solution, coined Noise-Robust Active Ellipsoid Search (RAES), to confront the challenges brought by the non-stationary feedback from such a learning user. Interestingly, we prove that the regret of RAES deteriorates gracefully as the convergence rate of user learning becomes worse, until reaching linear regret when the user's learning fails to converge. Experiments on synthetic datasets demonstrate the strength of RAES for such a contemporaneous system-user learning problem. Our study provides a novel perspective on modeling the feedback loop in recommendation problems.
Abstract（参考訳）: 現実世界のレコメンデーション問題、特に非常に大きなアイテムスペースを持つ場合には、ユーザーは、以前消費されたアイテムに関する経験から、新しいレコメンデーションの効用を徐々に見積もる必要がある。これはシステムとのインタラクションのダイナミクスに影響を与え、全能的なユーザの仮定に基づいて構築された以前のアルゴリズムを無効にすることができる。本稿では,このような"学習ユーザ"をキャプチャするモデルを定式化し,ノイズロバストアクティブ楕円型探索(raes)という効率的なシステム側学習ソリューションを設計し,非定常フィードバックによる課題に対処した。興味深いことに,ユーザ学習の収束率が悪化するにつれて,ユーザの学習が収束しない場合の線形後悔に達するまで,raesの後悔は優雅に低下する。このような同時学習問題に対するRAESの強度を示す合成データセットの実験を行った。本研究は,レコメンデーション問題におけるフィードバックループのモデル化に関する新しい視点を提供する。

関連論文リスト

Customized Retrieval-Augmented Generation with LLM for Debiasing Recommendation Unlearning [11.187910465178078]
CRAGRUは、効率的でユーザ固有のアンラーニングのための新しいフレームワークである。推奨品質を維持しながら、未学習のバイアスを軽減する。我々の研究は、堅牢でプライバシ保護のレコメンデータシステムを構築するためのRAGベースのアーキテクチャの約束を強調します。
論文参考訳（メタデータ） (2025-09-10T08:49:58Z)
Towards a Real-World Aligned Benchmark for Unlearning in Recommender Systems [49.766845975588275]
推薦システムにおける非学習のためのより現実的なベンチマークの開発を導くために,設計デシダータと研究質問のセットを提案する。我々は、現実世界の削除要求の逐次的で時間に敏感な性質を反映した、未学習のセットアップについて論じる。本稿では,提案したdesiderataをベースとした次世代レコメンデーションセッティングの予備実験を行い,アンラーニングが逐次レコメンデーションモデルにも有効であることを確認した。
論文参考訳（メタデータ） (2025-08-23T16:05:40Z)
Pre-training for Recommendation Unlearning [14.514770044236375]
UnlearnRecはモデルに依存しない事前学習パラダイムであり、効率的な未学習操作のためのシステムを準備している。本手法は,再学習手法に比べて10倍以上の高速化を実現した。
論文参考訳（メタデータ） (2025-05-28T17:57:11Z)
Search-Based Interaction For Conversation Recommendation via Generative Reward Model Based Simulated User [117.82681846559909]
会話レコメンデーションシステム(CRS)は、マルチターンインタラクションを使用してユーザの好みを捉え、パーソナライズされたレコメンデーションを提供する。本稿では,CRSと自動インタラクションを行うための生成報酬モデルに基づくシミュレーションユーザGRSUを提案する。
論文参考訳（メタデータ） (2025-04-29T06:37:30Z)
Interactive Visualization Recommendation with Hier-SUCB [52.11209329270573]
本稿では,従来のインタラクションからユーザフィードバックを学習する対話型パーソナライズドビジュアライゼーションレコメンデーション(PVisRec)システムを提案する。よりインタラクティブで正確なレコメンデーションのために、PVisRec設定における文脈的半帯域であるHier-SUCBを提案する。
論文参考訳（メタデータ） (2025-02-05T17:14:45Z)
Interactive Counterfactual Exploration of Algorithmic Harms in Recommender Systems [3.990406494980651]
本研究では,レコメンデーションシステムにおけるアルゴリズム的害の影響を理解し,探索するための対話型ツールを提案する。視覚化、反事実的説明、インタラクティブなモジュールを活用することで、ユーザは誤校正などのバイアスがレコメンデーションにどのように影響するかを調査できる。
論文参考訳（メタデータ） (2024-09-10T23:58:27Z)
CURE4Rec: A Benchmark for Recommendation Unlearning with Deeper Influence [55.21518669075263]
CURE4Recは、レコメンデーションアンラーニング評価のための最初の包括的なベンチマークである。さまざまな影響レベルのデータに対する推薦公正性と堅牢性に対するアンラーニングの影響について検討する。
論文参考訳（メタデータ） (2024-08-26T16:21:50Z)
Improving the Validity of Automatically Generated Feedback via Reinforcement Learning [50.067342343957876]
強化学習(RL)を用いた正当性と整合性の両方を最適化するフィードバック生成フレームワークを提案する。具体的には、直接選好最適化(DPO)によるトレーニングのための拡張データセットにおいて、GPT-4のアノテーションを使用してフィードバックペアよりも好みを生成する。
論文参考訳（メタデータ） (2024-03-02T20:25:50Z)
Learning from Negative User Feedback and Measuring Responsiveness for Sequential Recommenders [13.762960304406016]
シーケンシャルレコメンデータのトレーニング目標に、明示的かつ暗黙的なネガティブなユーザフィードバックを導入する。大規模産業レコメンデーションシステムを用いた実演実験により,本手法の有効性を実証する。
論文参考訳（メタデータ） (2023-08-23T17:16:07Z)
Simulating Bandit Learning from User Feedback for Extractive Question Answering [51.97943858898579]
教師付きデータを用いたフィードバックのシミュレーションにより,ユーザフィードバックからの学習を抽出的質問応答に適用する。当初は少数の例でトレーニングしたシステムが,モデル予測された回答に対するユーザからのフィードバックを劇的に改善できることが示される。
論文参考訳（メタデータ） (2022-03-18T17:47:58Z)
SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning [168.89470249446023]
我々は、大量のラベルなしサンプルとデータ拡張を利用する半教師付き報酬学習フレームワークSURFを提案する。報奨学習にラベルのないサンプルを活用するために,選好予測器の信頼性に基づいてラベルのないサンプルの擬似ラベルを推定する。本実験は, ロボット操作作業における嗜好に基づく手法のフィードバック効率を有意に向上させることを実証した。
論文参考訳（メタデータ） (2022-03-18T16:50:38Z)
WSLRec: Weakly Supervised Learning for Neural Sequential Recommendation Models [24.455665093145818]
我々は、WSLRecと呼ばれる新しいモデルに依存しないトレーニング手法を提案し、3段階のフレームワーク(事前学習、トップ$k$マイニング、本質的、微調整)を採用する。 WSLRec は、BR や ItemCF のようなモデルフリーメソッドから、余分な弱い監督のモデルを事前訓練することで、不完全性の問題を解決すると同時に、最上位の$k のマイニングを活用して、微調整のための弱い監督の信頼性の高いユーザ・イテム関連を検査することで、不正確な問題を解消する。
論文参考訳（メタデータ） (2022-02-28T08:55:12Z)
Context Uncertainty in Contextual Bandits with Applications to Recommender Systems [16.597836265345634]
本稿では,リカレントサーベイネットワーク(REN)と呼ばれる新しいタイプのリカレントニューラルネットワークを提案する。我々の理論的分析は,RENが学習表現に不確実性がある場合でも,速度-線形準最適後悔を保てることを示す。我々の実証研究は、RENが合成および実世界のレコメンデーションデータセットに満足な長期報酬を得られることを示した。
論文参考訳（メタデータ） (2022-02-01T23:23:50Z)
Recency Dropout for Recurrent Recommender Systems [23.210278548403185]
本稿では,リコメンデータシステムにおけるリコメンデーションバイアスを軽減するために,簡易かつ効果的なデータ拡張手法であるリコメンデーションドロップアウト手法を提案する。シミュレーション実験,オフライン実験,大規模産業レコメンデーションプラットフォームでのライブ実験など,各種実験環境における遅延降下の有効性を実証する。
論文参考訳（メタデータ） (2022-01-26T15:50:20Z)
Generative Inverse Deep Reinforcement Learning for Online Recommendation [62.09946317831129]
オンラインレコメンデーションのための新しい逆強化学習手法InvRecを提案する。 InvRecは、オンラインレコメンデーションのために、ユーザの行動から報酬関数を自動的に抽出する。
論文参考訳（メタデータ） (2020-11-04T12:12:25Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。