論文の概要: Planning over Matrix-Factorization MDPs for Candidate Generation
- arxiv url: http://arxiv.org/abs/2607.02115v1
- Date: Thu, 02 Jul 2026 12:50:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.831707
- Title: Planning over Matrix-Factorization MDPs for Candidate Generation
- Title(参考訳): 候補生成のための行列ファクトリゼーションMDPの計画
- Abstract要約: 我々は、暗黙のALS後段$(A-1,u)$に対して、トップ$K$検索をMDPとしてキャストすることを提案する。
ワンステップのルックアヘッドはすでに利益のほとんどを捉えているので、軽量のプランニング層は静的のトップ$K$スコアを短い決定に切り替える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: For a recommender service, we view the customer journey as a chain of item recommendations: a useful item changes the user's state and therefore what should be retrieved next. Standard matrix-factorization retrieval ignores this -- it builds one user vector and returns the top-$K$ items by a static score, treating them as independent. We ask a narrow question: when is it worth planning over the user-state dynamics that fold-in induces? To answer it we propose casting top-$K$ retrieval as an MDP over the implicit-ALS posterior $(A^{-1},u)$, where an action is an item and the transition is a closed-form rank-one fold-in, and the trajectory reward combines a relevance similarity with a posterior-alignment term. Under the same fixed embeddings we compare static retrieval, one-step planning, and horizon-$K$ MCTS across five datasets and two protocols: a per-user leave-last-$n$ split and a stricter global time split. Dynamics-aware planning tends to overcome static retrieval on all datasets under leave-last-$n$, and the gains hold on MovieLens-1M and the VK-LSVD slices under the global time split. A single step of lookahead already captures most of the gain, so the lightweight planning layer turns static top-$K$ scoring into a short decision and improves retrieval over fixed collaborative-filtering embeddings, with no retraining and no change to the representation. These gains depend on measuring relevance with cosine rather than inner-product similarity, which is otherwise entangled with item popularity.
- Abstract(参考訳): 推奨サービスでは、顧客ジャーニーをアイテムレコメンデーションの連鎖として見る: 有用なアイテムはユーザの状態を変えて、次に取得すべきものを取り出す。
標準的な行列分解検索は、これを無視する -- 1つのユーザベクトルを構築し、静的スコアで上位$K$アイテムを返却し、それらを独立したものとして扱う。
折りたたみインが引き起こすユーザ状態のダイナミクスについて、いつ計画する価値があるのか?
これに対応するために、暗黙のALS後段$(A^{-1},u)$に対して、上位$K$検索をMDPとしてキャストすることを提案する。
同じ固定埋め込みの下で、静的検索、ワンステッププランニング、地平線$K$MCTSを5つのデータセットと2つのプロトコルで比較します。
ダイナミクスを意識したプランニングは、残高の$n$ですべてのデータセットの静的検索を克服する傾向があり、グローバルタイムスプリットではMovieLens-1MとVK-LSVDスライスが上昇する。
ライトウェイトなプランニングレイヤは、静的のトップ$K$スコアを短い決定に変換し、修正された協調フィルタリングの埋め込みよりも、再トレーニングなしで検索を改善する。
これらの利得は、内産物の類似性ではなく、コサインとの関連性を測定することに依存しており、それ以外はアイテムの人気と絡み合っている。
関連論文リスト
- Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval [37.821022474615994]
Generative Retrieval (GR) は、クエリを直接セマンティックID(SID)にマッピングし、候補項目の強力な表現能力を持つ、有望なパラダイムとして登場した。
アイテムコンテンツから派生した既存のSIDはセマンティックギャップを生成し、動的クエリインテントと静的なアイテム表現の整合に失敗する。
本稿では,個別のSIDを合成してユーザ動作をモデル化し,詳細なセマンティック・リファインメントのための構造ガイダンスと連続表現を行う,新しいパーソナライズされたGRフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-31T10:30:22Z) - DIRECTOR: Dynamic Index-based Recommendation with Transport-Optimized Retrieval [47.419173509430834]
Re rankは、要求固有の候補セットから高ユーティリティスレートを選択し、注文することを目的とした決定問題である。
本稿では,トランスポート誘導並列化フレームワークであるTransport-d Retrievalを用いた動的インデックスベースのRecommendationを提案する。
実験により、DIRECTORは強いリグレードベースラインを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-07-29T03:03:03Z) - SemJoin: Semantic Join Optimization [5.770286315818393]
意味結合は大きな言語モデル(LLM)で評価できるが、すべての述語を比較するにはO(M x N)の呼び出しが必要であり、スケールでコストを抑えることができる。
本稿では,下層のテーブルの実行戦略を一致させることで,意味結合を最適化するLLM型意思決定パイプラインを提案する。
論文 参考訳(メタデータ) (2026-06-28T17:57:10Z) - Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization [37.913511223407056]
埋め込みベースの検索は、共有ベクトル空間内のクエリと類似度でアイテムをランク付けする。
我々はこれをパターン保存属性検索として定式化する。
そこで我々は,MO-DiT+HPPOを提案する。MO-DiT+HPPO,生系列事前学習,メートル順序継続事前学習,テールセントロイド微調整,HPPO。
論文 参考訳(メタデータ) (2026-06-25T11:29:51Z) - Scaling Self-Evolving Agents via Parametric Memory [69.96398842169002]
既存のメモリ拡張LDMエージェントは、過去の経験をプロンプト空間にのみ保存する。
自己進化型パラメトリックメモリフレームワークである textttTMEM を導入する。
textttTMEMは、様々なモデルスケールで要約ベースのベースラインと検索ベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-03T07:18:31Z) - Memento: Personalized RAG-Style Long-Retention Data Scaling for META Ads Recommendation [16.367591533012273]
我々は,履歴ユーザのエンゲージメントをドキュメントコーパスとして扱い,広告要求をクエリとして扱う,パーソナライズされた検索拡張フレームワークであるMementoを紹介した。
Mementoは1日10ms以下のレイテンシで処理し、クリックスルーと変換予測の両方で0.25-0.3%の正規化エントロピーゲインを得る。
論文 参考訳(メタデータ) (2026-05-22T00:12:38Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Improving Robustness of Tabular Retrieval via Representational Stability [17.799512825169504]
トランスフォーマーベースのテーブル検索システムは、構造化テーブルをトークンシーケンスにフラット化し、シリアライズの選択に敏感な検索を可能にする。
意味論的に等価なシリアライゼーションは、ベンチマークや検索ファミリ間でかなり異なる埋め込みや検索結果を生成することができることを示す。
単一シリアライズ埋め込みをセントロイドターゲットにマッピングする冷凍エンコーダ上に,軽量な残差ボトルネックアダプタを導入する。
論文 参考訳(メタデータ) (2026-04-27T04:52:48Z) - Reinforcement Learning from Adversarial Preferences in Tabular MDPs [62.73758165845971]
我々は,敵対的嗜好を持つエピソードマルコフ決定プロセス(MDP)の新たな枠組みを導入する。
PbMDP では、標準的なエピソード MDP とは異なり、学習者は2つの候補アーム間の好みを観察する。
我々は、既知遷移の下で、T2/3$という残差境界を達成するアルゴリズムを開発する。
論文 参考訳(メタデータ) (2025-07-15T20:19:32Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - MMGRec: Multimodal Generative Recommendation with Transformer Model [81.61896141495144]
MMGRecは、マルチモーダルレコメンデーションに生成パラダイムを導入することを目指している。
まず,階層的な量子化手法であるGraph CF-RQVAEを考案し,各項目にRec-IDを割り当てる。
次に、Transformerベースのレコメンデータをトレーニングし、過去のインタラクションシーケンスに基づいて、ユーザが推奨するアイテムのRec-IDを生成する。
論文 参考訳(メタデータ) (2024-04-25T12:11:27Z) - Revisiting Neural Retrieval on Accelerators [20.415728886298915]
検索の重要な構成要素は、(ユーザ、アイテム)類似性をモデル化することである。
その人気にもかかわらず、ドット製品は多面的であり、おそらく高いランクにある複雑なユーザとイテムのインタラクションをキャプチャすることはできない。
本稿では,基本類似度関数の適応的構成として,ユーザ,アイテムの類似度をモデル化したロジットのテキストミックス(MoL)を提案する。
論文 参考訳(メタデータ) (2023-06-06T22:08:42Z) - Online Recommendations for Agents with Discounted Adaptive Preferences [17.501559059079806]
エージェントの選好が過去の選択の関数として進化するバンディットレコメンデーション問題。
本稿では,$textitentire$ item simplexに対して,効率的なサブ線形後悔を求めるアルゴリズムを示す。
論文 参考訳(メタデータ) (2023-02-12T22:04:27Z) - You can't pick your neighbors, or can you? When and how to rely on
retrieval in the $k$NN-LM [65.74934004876914]
Retrieval-enhanced Language Model (LM) は、大規模な外部データストアから取得したテキストにそれらの予測を条件付ける。
そのようなアプローチの1つ、$k$NN-LMは、既存のLMの予測を$k$-nearest近くのモデルの出力と補間する。
本研究では,2つの英語モデルデータセットに対するアプローチの有効性を実証的に測定する。
論文 参考訳(メタデータ) (2022-10-28T02:57:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。