論文の概要: JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing
- arxiv url: http://arxiv.org/abs/2604.05845v1
- Date: Tue, 07 Apr 2026 13:11:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.842925
- Title: JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing
- Title(参考訳): JD-BP: 自動入札と価格決定のための共同決定生成フレームワーク
- Authors: Linghui Meng, Chun Gan, Shengsheng Niu, Chengcheng Zhang, Chenchen Li, Chuan Yang, Yi Mao, Xin Zhu, Jie He, Zhangang Lin, Ching Law,
- Abstract要約: 自動入札サービスは、キーパフォーマンス指標(KPI)制約の下で広告主のリアルタイム入札戦略を最適化する。
モデル予測エラーやフィードバック遅延などの不確実性は、入札戦略をポストの最適性から逸脱させる可能性がある。
本稿では,ビディングとプライシングのための共同生成決定フレームワークであるJD-BPを提案する。
- 参考スコア(独自算出の注目度): 15.898784873581677
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Auto-bidding services optimize real-time bidding strategies for advertisers under key performance indicator (KPI) constraints such as target return on investment and budget. However, uncertainties such as model prediction errors and feedback latency can cause bidding strategies to deviate from ex-post optimality, leading to inefficient allocation. To address this issue, we propose JD-BP, a Joint generative Decision framework for Bidding and Pricing. Unlike prior methods, JD-BP jointly outputs a bid value and a pricing correction term that acts additively with the payment rule such as GSP. To mitigate adverse effects of historical constraint violations, we design a memory-less Return-to-Go that encourages future value maximizing of bidding actions while the cumulated bias is handled by the pricing correction. Moreover, a trajectory augmentation algorithm is proposed to generate joint bidding-pricing trajectories from a (possibly arbitrary) base bidding policy, enabling efficient plug-and-play deployment of our algorithm from existing RL/generative bidding models. Finally, we employ an Energy-Based Direct Preference Optimization method in conjunction with a cross-attention module to enhance the joint learning performance of bidding and pricing correction. Offline experiments on the AuctionNet dataset demonstrate that JD-BP achieves state-of-the-art performance. Online A/B tests at JD.com confirm its practical effectiveness, showing a 4.70% increase in ad revenue and a 6.48% improvement in target cost.
- Abstract(参考訳): 自動入札サービスは、主要なパフォーマンス指標(KPI)制約の下で、投資や予算に対する目標リターンなどの広告主のリアルタイム入札戦略を最適化する。
しかし、モデル予測エラーやフィードバック遅延などの不確実性は、入札戦略をポストの最適性から逸脱させ、非効率な割り当てをもたらす可能性がある。
そこで本稿では,バイディングとプライシングのための共同生成決定フレームワークであるJD-BPを提案する。
従来の方法とは異なり、JD-BPはGSPのような支払いルールに付加的に作用する入札値と価格補正項を共同で出力する。
過去の制約違反の悪影響を軽減するため,メモリレスのReturn-to-Goを設計し,累積バイアスを価格補正で処理しながら入札行動の最大化を図る。
さらに,既存のRL/世代入札モデルから,提案アルゴリズムの効率的なプラグ・アンド・プレイ展開を可能にするために,(おそらく任意の)基本入札ポリシーから共同入札価格トラジェクトリを生成するトラジェクトリ拡張アルゴリズムを提案する。
最後に,提案手法では,提案手法とクロスアテンションモジュールを併用して,入札と価格補正の協調学習性能を向上させる。
AuctionNetデータセットのオフライン実験は、JD-BPが最先端のパフォーマンスを達成することを示す。
JD.comのオンラインA/Bテストでは、広告収入が4.70%増加し、目標コストが6.48%改善した。
関連論文リスト
- Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - Learning Personalized Ad Impact via Contextual Reinforcement Learning under Delayed Rewards [36.029144318322686]
広告入札をコンテキストマルコフ決定プロセス(CMDP)としてモデル化し,ポアソンの報酬を遅延させる。
効率的な推定法として,データ分割戦略と組み合わせた2段階の最大推定器を提案する。
我々は、効率的な個人化入札戦略を導出するための強化学習アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-10-22T22:08:36Z) - Generative Bid Shading in Real-Time Bidding Advertising [7.7746704524695485]
本稿では,生成バイドシェーディング(GBS)をエンドツーエンド生成モデルとして紹介する。
これは、段階的に残差報酬モデルを取得することで比率を生成する自己回帰的アプローチを取り入れている。
Meitプラットフォーム上で毎日何十億もの入札リクエストを処理している。
論文 参考訳(メタデータ) (2025-08-06T03:34:49Z) - Cost-aware Stopping for Bayesian Optimization [46.95172329282389]
本稿では,様々な評価コストに適応し,チューニングが不要なベイズ最適化のためのコスト対応停止則を提案する。
我々は,最先端の取得関数と組み合わせた場合,停止規則によって得られる期待累積評価コストを拘束する理論的な保証を証明した。
論文 参考訳(メタデータ) (2025-07-16T17:54:14Z) - BAT: Benchmark for Auto-bidding Task [67.56067222427946]
本稿では,最も普及している2種類のオークション形式を含むオークションベンチマークを提案する。
我々は,新しいデータセットに基づいて,一連の堅牢なベースラインを実装した。
このベンチマークは、研究者や実践者が革新的なオートバイディングアルゴリズムを開発し、洗練するための、ユーザフレンドリで直感的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-05-13T12:12:34Z) - Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer [52.09480867526656]
人間の嗜好を学習する際の分布変化と不確実性の一形態として,不一致の原因を同定する。
過度な最適化を緩和するために、まず、逆選択された報酬モデルに最適なポリシーを選択する理論アルゴリズムを提案する。
報奨モデルとそれに対応する最適ポリシーの等価性を用いて、優先最適化損失と教師付き学習損失を組み合わせた単純な目的を特徴とする。
論文 参考訳(メタデータ) (2024-05-26T05:38:50Z) - Demystifying Advertising Campaign Bid Recommendation: A Constraint
target CPA Goal Optimization [19.857681941728597]
本稿では,広告主が望むtCPA目標を達成するための入札最適化シナリオを提案する。
我々は厳格に定式化された制約付き最適化問題を解くことで決定を下すために最適化エンジンを構築した。
提案モデルでは,広告主の過去のオークション行動に対する推測を行うことで,広告主の期待に応える入札を自然に推奨することができる。
論文 参考訳(メタデータ) (2022-12-26T07:43:26Z) - Reserve Price Optimization for First Price Auctions [14.18752189817994]
本研究では, 入札者のリザーブ・ショックに対する応答性の推定値に基づいて, リザーブ・プライスを適応的に更新し, 最適化する勾配に基づくアルゴリズムを提案する。
第一価格オークションにおける収益は、オンデマンドコンポーネントとエンフビジンコンポーネントに分解することができ、各コンポーネントのばらつきを低減する技術を導入することができる。
論文 参考訳(メタデータ) (2020-06-11T15:35:19Z) - Optimal Bidding Strategy without Exploration in Real-time Bidding [14.035270361462576]
予算制約によるユーティリティの最大化は、リアルタイム入札(RTB)システムにおける広告主の主要な目標である。
それまでの作品は、検閲された国家の困難を和らげるために競売に敗れたことを無視していた。
本稿では,リアルタイムトラフィックで観測される真の分布の挙動を模倣するために,最大エントロピー原理を用いた新しい実用的枠組みを提案する。
論文 参考訳(メタデータ) (2020-03-31T20:43:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。