論文の概要: Deep-learning Causal Retrieval Optimization for Efficient e-commerce Distribution in Pinterest
- arxiv url: http://arxiv.org/abs/2607.14161v1
- Date: Tue, 14 Jul 2026 23:02:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.846391
- Title: Deep-learning Causal Retrieval Optimization for Efficient e-commerce Distribution in Pinterest
- Title(参考訳): Pinterestにおける効率的なeコマース流通のためのディープラーニング因果検索最適化
- Authors: Junpeng Hou, XianXing Zhang, Sai Xiao, Derek Cheng, Darren Reger, Olafur Gudmundsson, Mehdi Ben Ayed, Zhiqing Rao, Huizhong Duan,
- Abstract要約: Pinterestで運用システムをデプロイし、パーソナライズされ、コンテキスト化されたトリガポリシを学びます。
ディープマルチタスクモデルは、複数のイベントの結果と上昇を共同で予測する。
線形時間オフラインリプレイは、しきい値と予測ポリシーの影響を選択するように設計されている。
- 参考スコア(独自算出の注目度): 0.7827524915894094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pinterest is where people turn inspiration into action as users browse ideas, then take steps toward realization, often by discovering shoppable content. To support this journey, we must distribute commerce content when it helps, not when it distracts. We frame this as a causal decision of triggering shopping candidate generators in early retrieval and deploy a production system at Pinterest that learns personalized and contextualized triggering policies. A deep multi-task model jointly predicts outcomes and uplift of multiple events, trained with a doubly-robust pseudo-outcome alongside calibrated outcome losses for stable, single-robust uplift learning. A randomized data logging supplies counterfactual coverage, and the model is evaluated by both regular and reverse metrics for full assessment. A linear-time offline replay is designed to select thresholds and forecast policy impact with extremely high consistency with online results. For productionization, the model runs in parallel with remote retrieval calls without end-to-end latency regression. At web scale, we cut shopping triggers by up to 85% while holding key shopping sessions neutral, improving important total sessions (+0.26%) and Pin saves (+1.10%), with significant infrastructure savings. By unifying deep causal learning with reliable offline replay and demonstrating production-grade deployment, this work provides a generally practical recipe for early-retrieval optimizations in modern cascading recommenders beyond shopping, aligning exploration and cost with user intent at scale.
- Abstract(参考訳): Pinterestは、ユーザーがアイデアを閲覧するときにインスピレーションを行動に変える場所だ。
この旅を支援するためには、助けられたときにではなく、助けられたときにコマースコンテンツを配布する必要がある。
これは、ショッピング候補ジェネレータを早期の検索でトリガーし、Pinterestでパーソナライズされ、コンテキスト化されたトリガーポリシーを学ぶプロダクションシステムをデプロイするという因果的な決定である。
深層マルチタスクモデルでは,複数事象の結果とアップリフトを共同で予測し,2倍の確率で擬似アウトカムをトレーニングし,安定したシングルタスクアップリフト学習のための校正結果の損失を判定する。
ランダム化されたデータロギングは、反ファクトのカバレッジを提供し、モデルは完全に評価するために、正規値と逆値の両方で評価される。
線形時間オフラインリプレイは、オンライン結果と極めて整合性の高いしきい値と予測ポリシーの影響を選択するように設計されている。
プロダクション化では、モデルはエンドツーエンドの遅延遅延なしでリモート検索コールと並行して実行される。
Webスケールでは、主要なショッピングセッションを中立にしながら、ショッピングトリガーを最大85%削減し、重要なトータルセッション(+0.26%)とPinセーブ(+1.10%)を改善し、インフラの大幅な節約を実現しました。
深い因果学習を信頼性のあるオフラインリプレイで統一し、プロダクショングレードのデプロイメントを実証することにより、この作業は、ショッピング以外の現代のカスケーディング推奨者の早期検索最適化のための一般的なレシピを提供し、大規模なユーザ意図と探索とコストを整合させる。
関連論文リスト
- Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion [52.722575491987904]
ICL と SFT は,事前学習とデータ信号対雑音比の相互関係によって決定される。
どちらのパーソナライズ手法も、計算負荷が増大する可能性があるにもかかわらず、プラットフォームの最大利益を損なうことはないことを実証する。
論文 参考訳(メタデータ) (2026-07-15T21:17:42Z) - CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search [16.32525191514382]
今回紹介するCoReは、毎週5か月以上、大規模なショートビデオ検索エンジンに再デプロイするシステムだ。
我々の報酬は、デプロイされたマルチモーダルレバレンスモデルをソースとし、生産核融合代数を反映する乗法比形式を用いる。
半オンラインMixed Preference Optimizationループは、この報酬を毎週数百万のインスタンススケールで手頃な価格で提供する。
論文 参考訳(メタデータ) (2026-06-12T05:19:40Z) - Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights [6.143744262581817]
トラベリングセールスマン問題(TSP)のようなヒューリスティックスは、一般的に安価な近似として使用される。
実際の軌道は、最短経路から平均で28%ずれており、精度と実用性の間のトレードオフを強調している。
本稿では,軌道予測を最大エントロピー強化学習として活用するエージェントベースモデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-18T14:17:51Z) - SPARC: Soft Probabilistic Adaptive multi-interest Retrieval Model via Codebooks for recommender system [0.0]
現在の多目的検索手法には3つの大きな課題がある。
オンライン推論では、通常過剰な戦略が採用される。
我々は,「ソフト確率適応検索モデル」という新しい検索フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-12T17:16:37Z) - Reinforcement Learning with Action Chunking [56.66655947239018]
本稿では,長時間のスパース・リワード作業における強化学習アルゴリズムの改良手法であるQ-chunkingを提案する。
我々のレシピはオフラインからオンラインまでのRL設定のために設計されており、オンライン学習のサンプル効率を最大化するためにオフライン前のデータセットを活用することが目的である。
実験の結果,Q-chunkingはオフライン性能とオンラインサンプル効率が優れており,長時間のスパース・リワード操作タスクにおいて,最良オフライン-オンライン手法よりも優れていた。
論文 参考訳(メタデータ) (2025-07-10T17:48:03Z) - Continuous Attribution of Episodical Outcomes for More Efficient and
Targeted Online Measurement [4.361526134899724]
本研究では,段階的に観察される主指標を用いて,長期的結果のモデル化に因果サロガシーを適用した。
Airbnbのゲスト予約基準にこのアプローチを適用することで、50%から85%のばらつきが大幅に低減された。
論文 参考訳(メタデータ) (2022-10-28T19:20:20Z) - Approaching sales forecasting using recurrent neural networks and
transformers [57.43518732385863]
深層学習技術を用いて,日・店・店レベルでの顧客販売予測問題に対処する3つの方法を開発した。
実験結果から,データ前処理を最小限に抑えた単純なシーケンスアーキテクチャを用いて,優れた性能を実現することができることを示す。
提案した解は約0.54の RMSLE を達成し、Kaggle コンペティションで提案された問題に対する他のより具体的な解と競合する。
論文 参考訳(メタデータ) (2022-04-16T12:03:52Z) - Provably Efficient Causal Reinforcement Learning with Confounded
Observational Data [135.64775986546505]
オフラインで収集されたデータセット(観測データ)を組み込んで、オンライン環境でのサンプル効率を改善する方法について検討する。
提案手法は,観測データを効率よく組み込んだ,分解された楽観的値反復 (DOVI) アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-06-22T14:49:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。