論文の概要: DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search
- arxiv url: http://arxiv.org/abs/2608.25635v1
- Date: Wed, 26 Aug 2026 11:02:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.774997
- Title: DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search
- Title(参考訳): D CEO:Eコマース検索における長期ユーザ価値モデリングのための直接的な因果効果最適化
- Abstract要約: 我々は、アイテムレベルのプロキシスコアを学習するためのデータ駆動フレームワークであるDCEOを提案する。
D CEOは大規模な産業用eコマースサーチシステムに展開され、従来のGMVプロキシを41日間のオンラインA/Bテストで0.36%上回った。
- 参考スコア(独自算出の注目度): 11.364213846656904
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Industrial e-commerce search systems ultimately aim to optimize the user-level long-term objective, such as n-day cumulative purchases or gross merchandise value (GMV) per user. However, such objectives are defined at the user level, whereas search ranking is based on item-level scores within each request. Existing methods typically bridge this granularity gap through manually designed multi-objective fusion, where predictions of multiple item-level objectives, such as clicks, carts, purchases, and transaction value, are combined into a ranking score that serves as a proxy for the ultimate objective. Such hand-crafted fusion schemes rely on a small set of manually tuned weights, limiting fine-grained personalization and leading to suboptimal alignment with the ultimate objective. In this paper, we propose DCEO (Direct Causal Effect Optimization), a data-driven framework for learning item-level proxy scores that are better aligned with the ultimate objective. We first aggregate the item-level proxy scores into a user-level proxy metric and quantify its alignment with the ultimate objective using a relative causal effect. We then develop an actor-critic framework, where the critic estimates the ultimate objective for a given user-level proxy metric, and the actor dynamically generates context-dependent fusion weights over multiple objectives to construct the item-level proxy scores and is trained to directly optimize the relative causal effect. Extensive offline experiments and analyses demonstrate the effectiveness and interpretability of DCEO. In addition, DCEO has been deployed in a large-scale industrial e-commerce search system, outperforming the conventional GMV proxy by 0.36% in GMV in a 41-day online A/B test.
- Abstract(参考訳): 産業用eコマース検索システムは、最終的に、n日累積購入や1ユーザー当たりの総商品価値(GMV)といった、ユーザーレベルの長期目標を最適化することを目的としている。
しかし,このような目的はユーザレベルで定義されているのに対し,検索ランキングは各要求の項目レベルのスコアに基づいている。
既存の方法は、通常、この粒度のギャップを、手動で設計された多目的融合を通じて橋渡しし、クリック、カート、購入、トランザクション値などの複数のアイテムレベルの目標の予測を、最終的な目的のプロキシとして機能するランキングスコアに結合する。
このような手作りの融合スキームは、手動で調整された小さな重みのセットに依存し、細かいパーソナライゼーションを制限し、最終的な目的と最適以下のアライメントをもたらす。
本稿では、アイテムレベルのプロキシスコアを学習するためのデータ駆動型フレームワークであるD CEO(Direct Causal Effect Optimization)を提案する。
まず、項目レベルのプロキシスコアをユーザレベルのプロキシメトリックに集約し、相対因果効果を用いて最終的な目標との整合性を定量化する。
次に,評価者が与えられたユーザレベルのプロキシメトリックの最終的な目的を推定し,アクタが動的にコンテキスト依存の融合重み付けを生成して項目レベルのプロキシスコアを構築し,相対因果効果を直接最適化するように訓練するアクタ批判フレームワークを開発する。
大規模なオフライン実験と分析は、D CEOの有効性と解釈可能性を示している。
さらに、DCEOは大規模な工業用eコマースサーチシステムに展開され、従来のGMVプロキシを41日間のオンラインA/Bテストで0.36%上回った。
関連論文リスト
- Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking [10.224056739324702]
セールスリードのコンバージョンは、長い意思決定サイクルと多段階のファンネルのために、eコマースのレコメンデーションとは根本的に異なる。
従来のリードスコアリング手法では、スパース監視、非構造化CRMログのセマンティックギャップ、相対的なリード優先度の取得が不可能といった深刻な課題に直面しています。
我々は、構造化CRM機能と非構造化顧客インタラクションの連成モデリングを支援するLLMベースのセールスリードスコアリングのための差別的フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-06-03T03:05:57Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment [55.97027207627]
Fed PDPO(Federated Personalized Direct Preference Optimization)は、大規模言語モデル(LLM)の優先順位調整のためのパーソナライズされたフレームワークである。
パラメータ効率の良い微調整アーキテクチャを採用し、各クライアントはLow-Rank Adaptation (LoRA)アダプタで拡張された凍結したLLMバックボーンを維持し、通信効率のよいアグリゲーションを可能にする。
複数の嗜好データセットの実験では、最先端のパフォーマンスを示し、フェデレーション付きドメイン内およびクロスドメイン設定の平均精度が4.80%向上した。
論文 参考訳(メタデータ) (2026-03-20T08:24:49Z) - RankGR: Rank-Enhanced Generative Retrieval with Listwise Direct Preference Optimization in Recommendation [36.297513746770456]
提案するRangGRは、リストワイズ直接選好最適化をレコメンデーションに組み込んだジェネレーティブ検索手法である。
IAPでは、新しいリストワイズ直接選好最適化戦略をGRに組み込んで、階層的ユーザの選好をより包括的に理解する。
トレーニングとデプロイメントにおいていくつかの実践的な改善を実現し、最終的には毎秒1万近いリクエストを処理可能なリアルタイムシステムを実現しています。
論文 参考訳(メタデータ) (2026-02-09T12:13:43Z) - HarmonRank: Ranking-aligned Multi-objective Ensemble for Live-streaming E-commerce Recommendation [17.992877606615533]
ライブストリーミングのeコマースは、購入とユーザーとストリームの双方のインタラクションのバランスをとるためのランキングメカニズムを必要とする。
本稿では,複数目的のアンサンブルフレームワークであるHarmonRankを提案する。
提案手法は,4億DAUのライブストリーミングEコマースレコメンデーションプラットフォームに完全デプロイされ,2%以上の購入率に寄与している。
論文 参考訳(メタデータ) (2026-01-06T11:59:02Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search [43.94443394870866]
OneSearchは、eコマース検索のための最初の産業向けエンドツーエンド生成フレームワークである。
OneSearchは運用費を75.40%削減し、Model FLOPsの利用を3.26%から27.32%に改善した。
このシステムはKuaishouの複数の検索シナリオにまたがって展開され、数百万のユーザーにサービスを提供している。
論文 参考訳(メタデータ) (2025-09-03T11:50:04Z) - In-context Ranking Preference Optimization [65.5489745857577]
In-context Ranking Preference Optimization (IRPO) フレームワークを提案する。
IRPOは標準のDPO手法よりも高い性能を示し、LLMと直接文脈内ランキング設定の整合性を強調した。
論文 参考訳(メタデータ) (2025-04-21T23:06:12Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - Learning Fair Ranking Policies via Differentiable Optimization of
Ordered Weighted Averages [55.04219793298687]
本稿では,学習からランクへの学習ループに,効率よく解ける公正ランキングモデルを組み込む方法について述べる。
特に,本論文は,OWA目標の制約された最適化を通じてバックプロパゲーションを行う方法を示す最初のものである。
論文 参考訳(メタデータ) (2024-02-07T20:53:53Z) - BOtied: Multi-objective Bayesian optimization with tied multivariate ranks [33.414682601242006]
本稿では,非支配解と結合累積分布関数の極端量子化との自然な関係を示す。
このリンクにより、我々はPareto対応CDFインジケータと関連する取得関数BOtiedを提案する。
種々の合成および実世界の問題に対する実験により,BOtied は最先端MOBO 取得関数より優れていることが示された。
論文 参考訳(メタデータ) (2023-06-01T04:50:06Z) - Entity-Graph Enhanced Cross-Modal Pretraining for Instance-level Product
Retrieval [152.3504607706575]
本研究の目的は, 細粒度製品カテゴリを対象とした, 弱制御型マルチモーダル・インスタンスレベルの製品検索である。
まず、Product1Mデータセットをコントリビュートし、2つの実際のインスタンスレベルの検索タスクを定義します。
我々は、マルチモーダルデータから重要な概念情報を組み込むことができるより効果的なクロスモーダルモデルを訓練するために活用する。
論文 参考訳(メタデータ) (2022-06-17T15:40:45Z) - Conditional Sequential Slate Optimization [15.10459152219771]
検索ランキングシステムは通常、検索結果を独立したクエリ文書スコアで順序付けし、検索結果のスレートを生成する。
本稿では,従来のランク付け指標の最適化と,スレート内の文書の所定の分布基準を共同で学習する条件付きシーケンシャルスレート最適化(CSSO)を提案する。
提案手法は,eコマース検索結果の多様性の強化,トップ検索結果のバイアス軽減,結果のパーソナライズなど,現実的な課題に適用できる。
論文 参考訳(メタデータ) (2021-08-12T09:14:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。