論文の概要: Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue
- arxiv url: http://arxiv.org/abs/2608.03142v1
- Date: Tue, 04 Aug 2026 05:14:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.041545
- Title: Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue
- Title(参考訳): マルチモーダル収益を伴う最小半パラメトリックコンテキスト動的価格設定
- Abstract要約: コンテキスト動的価格をBounded, おそらくノンバイナリ購入量で検討する。
我々は、一様の最適価格を許すため、円滑さも強力なモダリティも収益に課さない。
- 参考スコア(独自算出の注目度): 6.201103695201767
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study contextual dynamic pricing with arbitrary covariate sequences and bounded, possibly nonbinary purchase quantities. Demand follows a semiparametric surplus-index model with an unknown linear valuation parameter and an unknown Hölder-smooth response. We impose neither concavity nor strong unimodality on revenue and allow nonunique optimal prices. We develop a pilot-corrected layered decision-partitioning policy that combines directional pilot estimation, local polynomial learning, predictable data assignment, and global action elimination. Pilot correction removes the first-order effect of valuation-parameter error, while permanent labels enable concentration under adaptive sampling. The policy attains the minimax smoothness-dependent horizon rate up to logarithmic factors; a matching lower bound already holds for a constant-context binary-demand subclass.
- Abstract(参考訳): 任意の共変量列と有界、あるいは非二項購入量を用いてコンテキスト動的価格について検討する。
需要は、未知の線形評価パラメータと未知のヘルダー・スムース応答を持つ半パラメトリック余剰指数モデルに従う。
当社は、不均等でかつ一律な収益を課しておらず、不均一な最適価格を許容している。
我々は,指向性パイロット推定,局所多項式学習,予測可能なデータ割り当て,グローバルアクション除去を組み合わせた,パイロット修正階層決定分割ポリシを開発する。
パイロット補正は評価パラメータ誤差の1次効果を除去する一方、恒久的ラベルは適応サンプリング下での集中を可能にする。
このポリシーは、対数係数までミニマックスの滑らかさに依存した水平速度を達成する。
関連論文リスト
- Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions [51.50375419691955]
分布的に堅牢なマルコフ決定プロセスは、モデルの不確実性の下でのシーケンシャルな意思決定のための原則化されたフレームワークを提供する。
我々は,平均回帰基準の下で,$varepsilon$-Optimal robust policyを学習するのに必要なサンプル数と十分なサンプル数について検討した。
論文 参考訳(メタデータ) (2026-08-06T19:49:48Z) - On Non-Stationary Dynamic Pricing: Adaptivity and Optimality [2.3037277758579364]
非定常条件下でのコンテキスト動的価格問題について検討する。
ある企業は商品を、時間とともに変化する未知の需要モデルに従って、順次到着する消費者にT$で売っている。
最適な収益(すなわち、少なくとも後悔)を達成するためには、会社は、潜在的な変化を監視しながら、未知のGLMを学習し、活用する必要がある。
論文 参考訳(メタデータ) (2026-07-27T07:56:56Z) - Optimal Contextual Pricing under Agnostic Non-Lipschitz Demand [24.75795278671755]
任意のジャンプと原子を持つ非Lipschitzの要求曲線が誘導されるような線形評価と有界支持雑音によるコンテキスト動的価格について検討する。
本稿では,ランダム化パラメータ推定,保守的残留グリッド探索,信頼に基づくワンステップリダイレクトを組み合わせた時間アルゴリズムであるReserve-Markdown Redirect-UCB Pricingを提案する。
論文 参考訳(メタデータ) (2026-05-07T02:57:14Z) - Adversarial learning for nonparametric regression: Minimax rate and adaptive estimation [3.244945627960733]
逆数$L_risks と $1 leq leq infty$ の最小収束率を確立し、極大最適性を達成する部分的局所推定器を提案する。
我々は、対数係数の中で、非対数クラスと対数クラスの広い範囲で最適な速度を達成することが示されるデータ駆動適応推定器を構築する。
論文 参考訳(メタデータ) (2025-06-02T02:38:47Z) - Decision from Suboptimal Classifiers: Excess Risk Pre- and Post-Calibration [52.70324949884702]
バッチ二分決定における近似的後続確率を用いた余剰リスクの定量化を行う。
我々は、再校正のみが後悔のほとんどに対処する体制と、後悔が集団的損失に支配される体制を識別する。
NLP実験では、これらの量によって、より高度なポストトレーニングの期待値が運用コストに値するかどうかが分かる。
論文 参考訳(メタデータ) (2025-03-23T10:52:36Z) - Minimax Optimality in Contextual Dynamic Pricing with General Valuation Models [8.981637739384674]
意思決定者は、観測可能なコンテキストに基づいてパーソナライズされた価格を投稿する。
それぞれのバリュエーションはコンテキストの未知の潜在関数としてモデル化され、独立性と同一に分散された市場ノイズによって破損する。
論文 参考訳(メタデータ) (2024-06-24T23:43:56Z) - Contextual Dynamic Pricing: Algorithms, Optimality, and Local Differential Privacy Constraints [10.057344315478709]
我々は、企業が商品をT$シーケンシャルに販売するコンテキスト動的価格問題について研究する。
まず、最適な後悔は対数的因子の次数$sqrtdT$であることを示す。
我々の研究は、複雑なプライバシー制約の下で動的価格に拡張され、公開データを活用することにより、プライバシーとユーティリティのトレードオフが改善されます。
論文 参考訳(メタデータ) (2024-06-04T15:44:10Z) - Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement
Learning: Adaptivity and Computational Efficiency [90.40062452292091]
本稿では,不整合雑音を持つ線形帯域に対する計算効率のよい最初のアルゴリズムを提案する。
我々のアルゴリズムは未知のノイズの分散に適応し、$tildeO(d sqrtsum_k = 1K sigma_k2 + d)$ regretを達成する。
また、強化学習において、線形混合マルコフ決定過程(MDP)に対する分散適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-02-21T00:17:24Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z) - Doubly Robust Distributionally Robust Off-Policy Evaluation and Learning [59.02006924867438]
オフ政治評価と学習(OPE/L)は、オフラインの観察データを使用してより良い意思決定を行う。
近年の研究では、分散ロバストなOPE/L (DROPE/L) が提案されているが、この提案は逆正則重み付けに依存している。
KL分散不確実性集合を用いたDROPE/Lの最初のDRアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-02-19T20:00:44Z) - On Dynamic Pricing with Covariates [6.6543199581017625]
UCBとThompsonのサンプリングに基づく価格設定アルゴリズムは、$O(dsqrtTlog T)$ regret upper boundを実現できることを示す。
私たちの後悔に対する上限は、対数的要因までの下位境界と一致します。
論文 参考訳(メタデータ) (2021-12-25T16:30:13Z) - Nearly Dimension-Independent Sparse Linear Bandit over Small Action
Spaces via Best Subset Selection [71.9765117768556]
本研究では,高次元線形モデルの下での文脈的帯域問題について考察する。
この設定は、パーソナライズされたレコメンデーション、オンライン広告、パーソナライズされた医療など、不可欠な応用を見出す。
本稿では,最適部分集合選択法を用いて2重成長エポックを推定する手法を提案する。
論文 参考訳(メタデータ) (2020-09-04T04:10:39Z) - Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation [49.502277468627035]
本稿では,関数近似を用いたバッチデータ強化学習の統計的理論について検討する。
記録履歴から新たな対象政策の累積値を推定するオフ・ポリティクス評価問題を考察する。
論文 参考訳(メタデータ) (2020-02-21T19:20:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。