論文の概要: SalesLoop: Reinforcement Learning from Performance Feedback for Sales Lead Ranking
- arxiv url: http://arxiv.org/abs/2607.20655v1
- Date: Wed, 22 Jul 2026 18:26:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.189435
- Title: SalesLoop: Reinforcement Learning from Performance Feedback for Sales Lead Ranking
- Title(参考訳): セールスループ:営業トップランキングでパフォーマンスフィードバックから強化学習
- Abstract要約: SalesLoopは、ランク付け位置と変換速度によって重み付けされた変換結果をエンコードするパフォーマンス対応の報酬である。
SalesLoopはNDCG@Kを+7.9%改善し、P@Kを+15.8%改善した。
- 参考スコア(独自算出の注目度): 3.337528987886516
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Lead ranking in Customer Relationship Management (CRM) systems faces a persistent challenge: models achieving high offline accuracy often underperform in production. We identify three fundamental gaps responsible for this disconnect: offline-online metric mismatch, pointwise-listwise objective misalignment, and temporal distribution drift. To address these gaps, we propose SalesLoop, a reinforcement learning framework that establishes a closed feedback loop between model predictions and real-world business outcomes. Our approach introduces (1) a performance-aware reward that encodes conversion outcomes weighted by ranking position and conversion velocity, and (2) Discriminative GRPO, a listwise optimization objective that adapts Group Relative Policy Optimization to discriminative ranking models. SalesLoop improves NDCG@K by +7.9\% and P@K by +15.8\% over the strongest static baseline. A 160-day production A/B test at a New Energy Vehicle manufacturer, spanning 16.5M leads and 280 sales specialists across two provincial markets, validates statistically significant cumulative lift of +4.7\% ($p=0.047$) and +8.7\% ($p=0.002$). In production, the ranking backbone achieves Top-10\% recall of 44.1\% and surfaces high-intent leads at $2.3\times$ the conversion rate of specialist baselines.
- Abstract(参考訳): CRM(Customer Relationship Management)システムにおけるトップランキングでは、高いオフライン精度を達成するモデルは、運用環境ではパフォーマンスが劣る、という永続的な課題に直面しています。
この切断の原因となる3つの基本的ギャップを同定する:オフライン-オンライン計量ミスマッチ、ポイントワイズ対物的ミスアライメント、時間分布ドリフト。
これらのギャップに対処するために,モデル予測と実世界のビジネス成果との間に密着したフィードバックループを確立する強化学習フレームワークであるSalesLoopを提案する。
提案手法では,(1)ランク付け位置と変換速度によって重み付けされた変換結果を符号化する性能認識報酬,(2)グループ相対ポリシー最適化を識別的ランク付けモデルに適用するリストワイド最適化目的の識別的GRPOを提案する。
SalesLoop は NDCG@K を +7.9\%、P@K を +15.8\% 改善している。
ニューエナジー・ビークルのメーカーで160日間のA/Bテストが行われ、16.5Mのリードと280人の販売スペシャリストが2つの州市場で行われ、統計学的に重要な累積リフトは+4.7\%(p=0.047$)と+8.7\%(p=0.002$)である。
生産では、ランキングバックボーンは44.1\%の上位10\%リコールを達成し、高いインテントリードを2.3\times$スペシャリストベースラインの変換レートで表面化する。
関連論文リスト
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking [10.224056739324702]
セールスリードのコンバージョンは、長い意思決定サイクルと多段階のファンネルのために、eコマースのレコメンデーションとは根本的に異なる。
従来のリードスコアリング手法では、スパース監視、非構造化CRMログのセマンティックギャップ、相対的なリード優先度の取得が不可能といった深刻な課題に直面しています。
我々は、構造化CRM機能と非構造化顧客インタラクションの連成モデリングを支援するLLMベースのセールスリードスコアリングのための差別的フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-06-03T03:05:57Z) - FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking [0.6356558256426569]
大規模言語モデル(LLM)をトレーニングするための統合されたデータ効率フレームワークを提案する。
実際のデプロイメント制約の下で、回答の品質、引用グラウンド、キャリブレーション、拒否を最適化します。
システムは40以上の金融機関で展開され、クエリの解決で7.1ポイント改善されている。
論文 参考訳(メタデータ) (2026-05-06T22:04:44Z) - Sell More, Play Less: Benchmarking LLM Realistic Selling Skill [1.1560747347923173]
SalesLLMベンチマークは、Financial ServicesとConsumer Goodsをカバーする現実的なアプリケーションから構築されている。
SalesLLMベンチマークのスコアは、専門家の人間格付けと強く相関している。
論文 参考訳(メタデータ) (2026-04-08T13:06:37Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange [9.300614085821612]
大規模レコメンデーションシステムに展開された、最初の完全自律型LCMによるランキング最適化エージェントであるSortifyを提案する。
エージェントは、評価最適化を継続的影響交換として再設定し、診断からパラメータ展開までの完全なループを人間の介入なしに閉じる。
論文 参考訳(メタデータ) (2026-03-29T16:58:29Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems [25.34524038198569]
本稿では,プロアクティブな意図予測のための閉ループアライメントフレームワーク RGAlign-Rec を提案する。
また、マルチステージトレーニングパラダイムであるRGA(Ranning-Guided Alignment)も導入する。
我々のフレームワークはGAUCで0.12%向上し、エラー率を3.52%削減し、Recall@3で0.56%改善した。
論文 参考訳(メタデータ) (2026-02-13T14:38:02Z) - MURPHY: Multi-Turn GRPO for Self Correcting Code Generation [55.66642560374686]
Murphyは、トレーニング中に反復的な自己補正を導入することでGRPOを拡張するマルチターン反射最適化フレームワークである。
Murphy は GRPO に対して 8% の相対的な利得を達成し,同様の計算予算で性能を継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-11-11T05:03:22Z) - GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning [53.894789613838654]
我々は、複雑な実世界のビデオにバランスの取れた知覚と推論を必要とするベンチマークであるSEED-Bench-R1を紹介する。
SEED-Bench-R1を用いて、標準GRPOは解の精度を向上する一方で、推論ステップと解の論理的コヒーレンスを57.9%の一貫性で減少させる。
応答の正しさと推論コヒーレンスの両方を明示的な監督なしに最適化する整合性を考慮したRLフレームワークGRPO-CAREを提案する。
論文 参考訳(メタデータ) (2025-06-19T08:49:13Z) - Improving Auto-Augment via Augmentation-Wise Weight Sharing [123.71986174280741]
自動拡張検索の重要な要素は、特定の拡張ポリシーの評価プロセスである。
本稿では,モデルの強化トレーニングのダイナミクスについて検討する。
我々は,Augmentation-Wise Weight Sharing (AWS)に基づいて,高速かつ高精度な評価プロセスを構築するために,強力で効率的なプロキシタスクを設計する。
論文 参考訳(メタデータ) (2020-09-30T15:23:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。