論文の概要: HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising
- arxiv url: http://arxiv.org/abs/2607.24779v1
- Date: Wed, 17 Jun 2026 15:00:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.060085
- Title: HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising
- Title(参考訳): HOBA: 適応型オンライン広告のための階層型オンライン入札エージェント
- Abstract要約: HOBAは、戦略的推論、モデル選択、入札実行を3つのタイムスケールで分離する階層的な強化学習フレームワークである。
AuctionNetベンチマークと大規模A/Bテストの実験は、最先端のベースラインよりも一貫した改善を示している。
- 参考スコア(独自算出の注目度): 4.325040293861279
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online advertising bidding systems typically deploy multiple offline-trained expert models (e.g., PID controllers, model predictive control, offline RL policies) but face two critical limitations: lack of online adaptability to non-stationary auction markets, and reliance on costly manual tuning of hyperparameters such as bid bounds and budget pacing constraints. We propose HOBA (Hierarchical On-policy Bidding Agents), a hierarchical reinforcement learning framework that decouples strategic reasoning, model selection, and bid execution across three time scales. At the high level, a large language model infers hyperparameters from contextual signals through a Think-Act-Observe-Reflect loop with historical experience retrieval. At the mid level, a SARSA agent dynamically selects among expert models, incorporating causal adjustment to eliminate selection bias. At the low level, a dynamic expert pool (PID, MPC, IQL, Decision Transformer) executes bids under high-level constraints. This design confines online learning to discrete expert selection rather than continuous bid optimization, significantly reducing exploration risk while maintaining adaptability. Experiments on the AuctionNet benchmark and a large-scale A/B test demonstrate consistent improvements over state-of-the-art baselines. In a large-scale online deployment, HOBA delivered substantial business value, achieving a +3.6\% increase in target cost, proving the effectiveness of our hierarchical multi-agent bidding paradigm.
- Abstract(参考訳): オンライン広告入札システムは、通常、複数のオフライントレーニングされたエキスパートモデル(例えば、PIDコントローラ、モデル予測制御、オフラインRLポリシー)をデプロイするが、2つの重要な制限に直面している。
戦略的推論,モデル選択,入札実行を3つの時間スケールで分離する階層的強化学習フレームワークであるHOBA(Hierarchical On-policy Bidding Agents)を提案する。
高レベルでは、大きな言語モデルは、歴史的経験検索を伴うThink-Act-Observe-Reflectループを通してコンテキスト信号からハイパーパラメータを推論する。
中間レベルでは、SARSAエージェントが専門家モデルの中から動的に選択し、選択バイアスを排除するために因果調整を取り入れる。
低レベルでは、動的エキスパートプール(PID、MPC、IQL、Decision Transformer)が高レベルの制約の下で入札を実行する。
この設計は、連続入札最適化よりも個別の専門家選択にオンライン学習を限定し、適応性を維持しながら探索リスクを著しく低減する。
AuctionNetベンチマークと大規模A/Bテストの実験は、最先端のベースラインよりも一貫した改善を示している。
大規模なオンライン展開において、HOBAは大きなビジネス価値を提供し、ターゲットコストの+3.6\%増加を実現し、階層的なマルチエージェント入札パラダイムの有効性を証明しました。
関連論文リスト
- AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization [23.02295184305076]
自動入札はオンライン広告において重要な役割を担い、広告主が商業目標を最適化するための入札を自動的に調整する。
推論機能によるAI生成入札を強化することを目的とした,階層的な自己進化型自動入札フレームワークであるAIGB-R1を提案する。
オフライン事前学習とトレーニング後アライメントの2段階パイプラインを採用し,戦略展開のための対話型入札シミュレーション環境を構築した。
論文 参考訳(メタデータ) (2026-07-19T14:59:12Z) - Selective Ensemble Based on Preference-Directed Multi-Objective Bandits [90.75513823660775]
我々は、部分的に指定された線形選好の下で逐次決定問題を定式化する。
次に、嗜好指向の高信頼度境界(PrefUCB)アルゴリズムを提案する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法が検証された。
論文 参考訳(メタデータ) (2026-06-20T07:52:46Z) - DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation [39.181584470241354]
オフライン強化学習とTransformerベースのシーケンスモデリングは、ログデータから入札ポリシーを学ぶことを約束している。
我々は、オフライン自動入札のための意思決定から候補アクション生成を分離する統合トランスフォーマーベースのフレームワークDRIVEを提案する。
AuctionNetと追加のオフライン強化学習ベンチマークの実験は、DRIVEが一貫して入札性能を改善し、複数のTransformerベースのメソッドでうまく一般化していることを示している。
論文 参考訳(メタデータ) (2026-06-12T07:21:07Z) - AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - AHBid: An Adaptable Hierarchical Bidding Framework for Cross-Channel Advertising [8.53485049764747]
AHBidは、生成計画とリアルタイム制御を統合するAdaptable Hierarchical Biddingフレームワークである。
大規模なオフラインデータセットとオンラインA/Bテストによる実験は、AHBidの有効性を実証している。
論文 参考訳(メタデータ) (2026-02-26T06:07:28Z) - SEGB: Self-Evolved Generative Bidding with Local Autoregressive Diffusion [9.051746879211764]
Self-Evolved Generative Bidding (SEGB)は、積極的に計画し、完全にオフラインで洗練するフレームワークである。
SEGBはまず、各入札をガイドするために、もっともらしい短水平状態の状態を合成し、エージェントに決定的かつダイナミックな監視を提供する。
そして、外部の介入なしに優れた戦略を反復的に発見するために、価値誘導された政策改善を行う。
論文 参考訳(メタデータ) (2025-12-31T09:05:59Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Steerable Adversarial Scenario Generation through Test-Time Preference Alignment [58.37104890690234]
対立シナリオ生成は、自律運転システムの安全性評価のためのコスト効率の良いアプローチである。
textbfSteerable textbfAdversarial scenario textbfGEnerator (SAGE) という新しいフレームワークを導入する。
SAGEは、逆境とリアリズムの間のトレードオフを、再トレーニングなしできめ細かいテストタイムコントロールを可能にします。
論文 参考訳(メタデータ) (2025-09-24T13:27:35Z) - Generative Large-Scale Pre-trained Models for Automated Ad Bidding Optimization [5.460538555236247]
GRAD(Generative Reward-driven Ad-bidding with Mixture-of-Experts)を提案する。
GRADはプラットフォーム収益を大幅に向上させ、現代の広告主の進化的かつ多様な要求に対処する上での有効性を強調した。
論文 参考訳(メタデータ) (2025-08-04T02:46:18Z) - Nash Equilibrium Constrained Auto-bidding With Bi-level Reinforcement Learning [64.2367385090879]
本稿では,プラットフォームの観点から,自動入札問題の新たな定式化を提案する。
これは、$epsilon$-NE制約の下ですべての広告主の社会的福祉を最大化することを目的としている。
NCB問題は、その制約された二段階構造と、典型的には多くの広告主が関与しているため、重大な課題を提起している。
論文 参考訳(メタデータ) (2025-03-13T12:25:36Z) - Plan Better Amid Conservatism: Offline Multi-Agent Reinforcement
Learning with Actor Rectification [74.10976684469435]
オフライン強化学習(RL)アルゴリズムは、直接マルチエージェント設定に転送することができる。
本稿では,この重要な課題に対処するために,Actor Rectification (OMAR) を用いたオフラインマルチエージェント RL を提案する。
OMARはマルチエージェント連続制御ベンチマークにおける最先端性能と強いベースラインを著しく上回る。
論文 参考訳(メタデータ) (2021-11-22T13:27:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。