論文の概要: AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing
- arxiv url: http://arxiv.org/abs/2606.26787v1
- Date: Thu, 25 Jun 2026 09:21:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.225107
- Title: AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing
- Title(参考訳): AIGP:Eコマース価格の長期価値アライメントのためのLLMベースのフレームワーク
- Abstract要約: 我々は,Large Language Model (LLM) を利用して,解釈可能な知識を考慮した価格決定を行う新しいフレームワークであるAIGPを提案する。
AIGPの中心はLong-Term Value Estimator (LTVE)であり、過去のデータに対するオフラインの強化学習を通じてトレーニングされている。
- 参考スコア(独自算出の注目度): 33.50355926354667
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Traditional dynamic pricing models in large-scale e-commerce suffer from limited interpretability, poor utilization of unstructured information, and misalignment with long-term business objectives such as cumulative Gross Merchandise Value (GMV), Return on Investment (ROI) and milestone achievement. We propose AIGP, a novel framework that leverages a Large Language Model (LLM) prompted with domain knowledge, structured data and textual context to make interpretable, knowledge-aware pricing decisions. For efficient deployment while maintaining high-quality outputs, we employ supervised fine-tuning for knowledge distillation. Central to AIGP is the Long-Term Value Estimator (LTVE), trained via offline reinforcement learning on historical data, which serves as a reward model to score candidate pricing actions and select preference pairs for Direct Preference Optimization (DPO), thereby aligning the pricing policy with long-term business objectives. Extensive offline evaluations and large-scale online A/B tests on Tao Factory demonstrate that AIGP achieves significant improvements: +13.21% in GMV, +7.59% in ROI, and +8.20% in milestone achievement rate over 14 days compared to the production baseline, while simultaneously providing interpretable and transparent pricing rationales.
- Abstract(参考訳): 大規模なeコマースにおける伝統的な動的価格モデルには、限定的な解釈可能性、構造化されていない情報の活用の低さ、累積的なGross Merchandise Value(GMV)、リターン・オン・インベストメント(ROI)、マイルストーン達成といった長期的なビジネス目標との相違がある。
本稿では,Large Language Model(LLM)を利用した新たなフレームワークであるAIGPを提案する。
高品質な出力を維持しつつ効率よく展開するために,我々は知識蒸留のための教師付き微調整を採用している。
AIGPの中心はLTVE(Long-Term Value Estimator)であり、過去のデータをオフラインで強化学習することでトレーニングされている。
Tao Factoryの大規模なオフライン評価と大規模なオンラインA/Bテストにより、AIGPは、GMVの+13.21%、ROIの+7.59%、生産ベースラインと比べて14日間のマイルストーン達成率の+8.20%という大幅な改善を達成し、同時に解釈可能かつ透明な価格の根拠を提供する。
関連論文リスト
- High-Frequency Pricing at Scale for E-Commerce [2.3507764516448497]
本稿では,ファッション電子商取引における販売キャンペーンのための予測最適化アルゴリズム価格設定ツールの設計,開発,実装について述べる。
販売イベントには、不安定な需要パターン、急激な価格決定、短期的な収益と長期的な利益とのバランスの必要性など、価格に関するユニークな課題がある。
本稿では,勾配木を用いた日次需要予測と多目的最適化フレームワークを組み合わせたアプローチについて述べる。
論文 参考訳(メタデータ) (2026-06-11T13:01:44Z) - Graph-Attentive MAPPO for Dynamic Retail Pricing [0.0]
本稿では,小売価格最適化のためのマルチエージェント強化学習の体系的研究について述べる。
強MAPPOベースラインとグラフ付加型MAPPO+GATの比較を行った。
その結果,MAPPOはポートフォリオレベルの価格管理のための堅牢で再現可能な基盤を提供することが示された。
論文 参考訳(メタデータ) (2025-10-28T00:15:59Z) - Transfer Learning for Nonparametric Contextual Dynamic Pricing [17.420508136662257]
動的価格戦略は、市場条件や顧客特性に基づいて価格を調整することで、企業が収益を最大化する上で不可欠である。
この制限を克服するための有望なアプローチの1つは、関連する製品や市場からの情報を活用して、焦点となる価格決定を知らせることである。
本稿では,ソースドメインからの事前収集データを効果的に活用し,対象ドメインの価格決定を効率化する,新しいTLDPアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-01-31T01:05:04Z) - Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning [70.22819290458581]
人間のフィードバックによる強化学習(RLHF)は、現在の大規模言語モデルパイプラインにおいて広く採用されているアプローチである。
提案手法では,(1)OODを回避するためのオン・ポリシー・クエリと,(2)プライオリティ・クエリの最も情報性の高いデータを選択するためのアクティブ・ラーニングという2つの重要なイノベーションを導入している。
論文 参考訳(メタデータ) (2024-07-02T10:09:19Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z) - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning [55.96599486604344]
本稿では,Large Language Models (LLMs) の推論能力向上を目的とした,反復的な選好学習プロセスによるアプローチを提案する。
我々は、MCTS(Monte Carlo Tree Search)を用いて好みデータを反復的に収集し、そのルックアヘッド機能を利用して、インスタンスレベルの報酬をよりきめ細かいステップレベルの信号に分解する。
提案アルゴリズムはDPO(Direct Preference Optimization)を用いて,新たに生成されたステップレベルの優先度データを用いてLCMポリシーを更新する。
論文 参考訳(メタデータ) (2024-05-01T11:10:24Z) - A Bargaining-based Approach for Feature Trading in Vertical Federated
Learning [54.51890573369637]
本稿では,垂直的フェデレートラーニング(VFL)において,経済的に効率的な取引を促進するための交渉型特徴取引手法を提案する。
当社のモデルでは,収益ベース最適化の目的を考慮し,パフォーマンスゲインベースの価格設定を取り入れている。
論文 参考訳(メタデータ) (2024-02-23T10:21:07Z) - Harnessing the Web and Knowledge Graphs for Automated Impact Investing
Scoring [2.4107880640624706]
持続可能な開発目標のフレームワークを作成するプロセスを自動化するための,データ駆動システムについて説明する。
本稿では,異なるWebソースからテキストのデータセットを収集・フィルタリングする新しい手法と,企業の集合に関連する知識グラフを提案する。
以上の結果から,我々の最高性能モデルでは,マイクロ平均F1スコア0.89でSDGスコアを正確に予測できることがわかった。
論文 参考訳(メタデータ) (2023-08-04T15:14:16Z) - Revenue Management without Demand Forecasting: A Data-Driven Approach
for Bid Price Generation [25.53238782264327]
本稿では、需要予測と最適化技術の必要性を排除したデータ駆動型の収益管理手法を提案する。
我々はニューラルネットワークアルゴリズムを用いて入札価格を将来に向けて予測する。
以上の結果から,我々のデータ駆動手法は,幅広い設定において理論的に最適(1%の収益格差)に近いままであることがわかった。
論文 参考訳(メタデータ) (2023-04-14T21:10:13Z) - Dynamic Pricing with Volume Discounts in Online Settings [102.00782184214326]
本稿では,電子商取引における客観的機能が利益であり,取引データのみが利用可能である場合の価格設定に焦点を当てる。
我々の研究は、異なるボリューム閾値で最適な価格を定め、異なるクラスのユーザーに提供する価格戦略を見つけることを目的としている。
我々は、オンライン形式でデータを活用できる2段階のオンライン学習アルゴリズムBを設計する。
論文 参考訳(メタデータ) (2022-11-17T16:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。