論文の概要: Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.28065v1
- Date: Fri, 28 Aug 2026 08:35:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.254208
- Title: Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning
- Title(参考訳): オフラインモデルに基づく強化学習による広告インセンティブのアロケート学習
- Abstract要約: インセンティブ付き広告では、プラットフォームはユーザーが下流の広告収入を見る前にボーナスを約束し、クリックして広告を完成させることを奨励する。
その後実現した収益に対して、事前に約束されたインセンティブのバランスをとる必要がある。
コスト制御可能な逐次インセンティブアロケーションのためのオフラインモデルベースのRLフレームワークを開発した。
- 参考スコア(独自算出の注目度): 12.901979770261278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Complete your ad view and grab a 5-cent bonus! In incentivized advertising, a platform promises users a bonus before observing downstream ad revenue, encouraging them to click and complete ads. It must balance the incentive promised in advance against the revenue realized afterward: insufficient incentives forfeit monetization opportunities, whereas excessive incentives reduce net profit. Because current incentives may also shape user expectations and future engagement, incentive allocation is a sequential decision problem with delayed revenue, cost sensitivity, and carryover effects. Existing work has not studied decision-making algorithms for this setting. Auto-bidding assumes available ad opportunities, while targeted promotion optimizes incentives outside the ad monetization pipeline. We formulate the problem as an MDP and develop an offline model-based RL framework for cost-controllable sequential incentive allocation. It learns a world model of user feedback and ad revenue, then performs conservative policy optimization. An independent counterfactual scorer evaluates each learned policy on held-out logs, enabling pre-launch selection without costly online exposure. Experiments on large-scale industrial data and online A/B tests show that the scorer provides a stable offline signal. The deployment path from causal inference to offline RL and then Offline-MBRL further validates the framework: MB-IQL improves per-user net profit by 7.96\% over TD3+BC, whereas reverting to plain IQL reduces it by 6.56\% (both \(p<0.0001\)).
- Abstract(参考訳): 広告ビューを完了して、ボーナスを5セント獲得!
インセンティブ付き広告では、プラットフォームはユーザーが下流の広告収入を見る前にボーナスを約束し、クリックして広告を完成させることを奨励する。
収益化の機会を失わせるインセンティブが不十分であるのに対して、過剰なインセンティブは純利益を減少させる。
現在のインセンティブは、ユーザの期待や将来的なエンゲージメントを形作る可能性があるため、インセンティブの割り当ては、遅延した収益、コストの感度、輸送効果といったシーケンシャルな決定の問題である。
既存の研究は、この設定のための意思決定アルゴリズムを研究していない。
自動入札は広告の機会を想定し、ターゲットのプロモーションは広告収益化パイプラインの外でインセンティブを最適化する。
MDPとして問題を定式化し、コスト制御可能な逐次インセンティブアロケーションのためのオフラインモデルベースのRLフレームワークを開発する。
ユーザフィードバックと広告収益の世界モデルを学び、その後、保守的なポリシー最適化を実行する。
独立対物スコアラは、学習した各ポリシーをホールトアウトログで評価し、オンラインでの露出を犠牲にすることなく、プレローンチ選択を可能にする。
大規模産業データとオンラインA/Bテストの実験は、スコアラーが安定したオフライン信号を提供することを示している。
MB-IQLはTD3+BCよりもユーザ当たりの利益を7.96倍改善しますが、プレーンなIQLへの回帰は6.56倍(どちらもp<0.0001%)削減します。
関連論文リスト
- Optimizing Monetization Strategies for Generative AI Firms: Implications for Search Engagement [0.0]
我々は、検索クエリエンゲージメントを維持しながら、GenAI企業がコストを回復する上で、広告支援による新たなマネタイズモデルが有効であることを示す。
広告による収益化モデルの導入は、ユーザのアップグレードやダウングレードの決定に影響を及ぼす。
情緒的・認知的評価は、時間的侵入性のある広告支援モデルに対する嗜好を媒介するが、視覚的・視覚的効果を抑えるものではない。
論文 参考訳(メタデータ) (2026-07-30T19:11:01Z) - Adaptive Ad Load Design for Sponsored Search Markets: Evidence, Theory, and Deployment [0.0]
広告のロードデザインは、スポンサード検索における中心的なサプライサイドの判断である。
このトレードオフを,Android App Storeの大規模ランダム化フィールド実験を用いて検討した。
我々は、新しい適応アルゴリズムをデプロイする -- 探索強化ローカル適応広告ロード(e-LAAL)
論文 参考訳(メタデータ) (2026-07-15T23:12:26Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems [54.709976343045824]
現在のオフライン強化学習(RL)手法は、スパース広告シナリオに適用した場合、重大な課題に直面している。
MTORLは,2つの主要な目標を対象とする,新しいマルチタスクオフラインRLモデルである。
我々はマルチタスク学習を用いて行動と報酬をデコードし、同時にチャネルレコメンデーションと予算配分に対処する。
論文 参考訳(メタデータ) (2025-06-29T05:05:13Z) - External Evaluation of Discrimination Mitigation Efforts in Meta's Ad Delivery [47.418845064441605]
本稿では,Metaによって実装された可変還元システム(VRS)が,個人にとっての機会へのアクセスを有意義に改善していないことを示す。
そして、現実世界の広告でVRSを評価する実験を行い、VRSがばらつきを減らす一方で、広告主のコストも上昇させることを示した。
当社のアプローチは,すべてのグループからのユーザに対する広告露出の増加と,広告主に対するコスト削減によって,VRSよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-06-19T19:29:26Z) - Augmenting Unsupervised Reinforcement Learning with Self-Reference [63.68018737038331]
人間は、新しいタスクを学ぶ際に、過去の経験を明確に表現する能力を持っている。
本稿では,歴史情報を活用するためのアドオンモジュールとして,自己参照(SR)アプローチを提案する。
提案手法は,非教師付き強化学習ベンチマークにおけるIQM(Interquartile Mean)性能と最適ギャップ削減の両面から,最先端の成果を実現する。
論文 参考訳(メタデータ) (2023-11-16T09:07:34Z) - Adversarial Learning for Incentive Optimization in Mobile Payment
Marketing [17.645000197183045]
支払いプラットフォームは、ユーザーがアプリケーションを通じて支払いを奨励するインセンティブを割り当てる大規模なマーケティングキャンペーンを開催している。
投資のリターンを最大化するために、インセンティブアロケーションは2段階の手順で一般的に解決される。
本稿では,この障害を克服するためのバイアス補正対向ネットワークを提案する。
論文 参考訳(メタデータ) (2021-12-28T07:54:39Z) - A framework for massive scale personalized promotion [18.12992386307048]
消費者向けプラットフォームを構築するテクノロジー企業は、大規模なユーザー人口にアクセスできるかもしれない。
定量化インセンティブによるプロモーションは、このようなプラットフォーム上でアクティブユーザを増やすための一般的なアプローチとなっている。
本稿では,大規模プロモーションキャンペーンのROIを最適化する実用的な2段階フレームワークを提案する。
論文 参考訳(メタデータ) (2021-08-27T03:03:18Z) - Offline Reinforcement Learning as Anti-Exploration [49.72457136766916]
我々は、新たなオフラインRLエージェントを設計するためのボーナスベースの探索に関する文献から着想を得た。
中心となるアイデアは、探索のために追加するのではなく、報酬から予測ベースの探査ボーナスを減じることだ。
我々のエージェントは、連続的な制御ロコモーションと操作タスクのセットにおいて、最先端技術と競合していることを示す。
論文 参考訳(メタデータ) (2021-06-11T14:41:30Z) - Optimizing AD Pruning of Sponsored Search with Reinforcement Learning [14.583308909225552]
産業支援検索システム(SSS)は,キーワードマッチング,広告検索,ランキングの3つのモジュールに論理的に分割することができる。
システム収益を最大化するために、$N$候補から最高の$K$アイテムをどうやって取り出すか、という問題に対処します。
本稿では,この問題を解決するためのモデルなし強化学習手法を提案する。
論文 参考訳(メタデータ) (2020-08-05T09:19:10Z) - Dynamic Knapsack Optimization Towards Efficient Multi-Channel Sequential
Advertising [52.3825928886714]
我々は、動的knapsack問題として、シーケンシャルな広告戦略最適化を定式化する。
理論的に保証された二段階最適化フレームワークを提案し、元の最適化空間の解空間を大幅に削減する。
強化学習の探索効率を向上させるため,効果的な行動空間削減手法も考案した。
論文 参考訳(メタデータ) (2020-06-29T18:50:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。