論文の概要: Generative Optimization for Incentivized Advertising with Global Level Constraints
- arxiv url: http://arxiv.org/abs/2608.04421v1
- Date: Wed, 05 Aug 2026 04:04:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.706148
- Title: Generative Optimization for Incentivized Advertising with Global Level Constraints
- Title(参考訳): グローバルレベルの制約を考慮したインセンティブ広告のための生成最適化
- Authors: Gege Chen, Ning Luo, Hao Jiang, Da Li, Wenzheng Shu, Teng Sha, Yanxiang Zeng, Wenxin Tai, Fan Zhou, Xialong Liu,
- Abstract要約: GOALは条件付きシーケンス生成問題としてインセンティブアロケーションを定式化する制約対応生成フレームワークである。
GOALは,強いベースラインに比べてROI違反率を大幅に低減しつつ,長期的収益とユーザ維持を改善していることを示す。
- 参考スコア(独自算出の注目度): 22.46351828626369
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Incentivized advertising allocates monetary or virtual rewards to drive user engagement, where a key challenge is optimizing continuous incentive magnitudes under strict global constraints. This problem is complicated by high-frequency interactions, delayed feedback, and non-Markovian user dynamics such as fatigue, which limit the effectiveness of existing uplift modeling and constrained reinforcement learning approaches. To address these challenges, we propose GOAL, a constraint-aware generative framework that formulates incentive allocation as a conditional sequence generation problem. GOAL directly generates incentive magnitudes conditioned on user histories and system-level global pressure, and integrates a hierarchical causal state encoder to capture both local behavioral dynamics and long-range dependencies. To enable flexible constraint control, we introduce \textbf{S}afe \textbf{C}onstrained \textbf{P}olicy \textbf{O}ptimization (SCPO), which learns a single generative policy that generalizes across a spectrum of ROI constraints without retraining. Experiments on large-scale real-world data and a synthetic fatigue-aware environment show that GOAL improves long-term revenue and user retention while substantially reducing ROI violation rates compared to strong baselines.
- Abstract(参考訳): インセンティブ付き広告は、ユーザーのエンゲージメントを促進するために金銭や仮想報酬を割り当てる。
この問題は、高周波相互作用、遅延フィードバック、疲労のようなマルコフでないユーザダイナミクスによって複雑になり、既存のアップリフトモデリングと制約付き強化学習アプローチの有効性が制限される。
これらの課題に対処するために,条件付きシーケンス生成問題としてインセンティブアロケーションを定式化する制約対応生成フレームワークGOALを提案する。
GOALは、ユーザー履歴とシステムレベルの大域的な圧力に基づいて、直接インセンティブのマグニチュードを生成し、階層的な因果状態エンコーダを統合して、局所的な振る舞いのダイナミクスと長距離依存の両方をキャプチャする。
フレキシブルな制約制御を実現するために、リトレーニングなしでROI制約のスペクトルをまたいで一般化する単一の生成ポリシーを学習する、 \textbf{S}afe \textbf{C}onstrained \textbf{P}olicy \textbf{O}ptimization (SCPO)を導入する。
大規模実世界のデータと合成疲労環境の実験により、GOALは、強いベースラインに比べてROI違反率を大幅に低減しつつ、長期的な収益とユーザ維持を改善していることが示された。
関連論文リスト
- Federated Learning for Feature Generalization with Convex Constraints [9.335487623272604]
フェデレートラーニング(FL)は、異種クライアントデータによる一般化に苦慮することが多い。
我々は,グローバルモデルのパラメータ強度に基づいて,更新サイズを適応的に変調するFedCONSTを提案する。
論文 参考訳(メタデータ) (2026-06-12T12:50:33Z) - LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner [15.619469979987429]
強化学習微調整(RFT)の安定化と退化の防止には制約が不可欠である。
微調整モデルの進化能力に適応するテクスチャ力学的制約を提案する。
対話とコード生成の実験は、動的制約がKL正規化と非制約ベースラインの両方より優れていることを示している。
論文 参考訳(メタデータ) (2026-03-18T08:37:31Z) - Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning [74.5532558466687]
群 Relative Reward Rescaling (GR$3$) は、一般的な、連続かつ報酬に依存したゲーティング機構である。
GR$3$は、標準のGRPOに匹敵するトレーニングダイナミクスとダウンストリームのパフォーマンスを維持する。
それは長さのインフレーションを著しく軽減し、最先端の長周期正規化ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-03-11T08:41:34Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Constraint-Aware Generative Auto-bidding via Pareto-Prioritized Regret Optimization [8.514099612407062]
PRO-Bidは2つの相乗的メカニズムに基づく制約対応な自動入札フレームワークである。
最先端のベースラインに比べて、制約満足度や価値獲得に優れています。
論文 参考訳(メタデータ) (2026-02-09T04:41:30Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning [52.03884701766989]
オフライン強化学習(RL)アルゴリズムは、通常、アクション選択に制約を課す。
本稿では,Bellmanターゲットにおける行動選択を,データセットアクションの近傍の結合に制限する新しい地区制約を提案する。
我々は,この制約を満たす目標動作を用いてQ学習を行うための,単純で効果的なアルゴリズムであるAdaptive Neighborhood-Constrained Q Learning(ANQ)を開発した。
論文 参考訳(メタデータ) (2025-11-04T13:42:05Z) - Feasible and Desirable Counterfactual Generation by Preserving Human
Defined Constraints [6.123324869194193]
本稿では,グローバルかつ局所的な実現可能性の制約を保った対実的(CF)説明を生成するための,ループ内の人間的アプローチを提案する。
提案手法は,これらの制約に違反する勾配ステップを拒否することでCF説明を生成するために,この知識を効果的に活用する。
CF生成中に因果制約を組み込むことで,参加者への実現可能性や望ましさの観点から,より優れた説明ができることを示す。
論文 参考訳(メタデータ) (2022-10-12T08:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。