論文の概要: Differentiating Through Dual Prices: End-to-End Policy Learning Under Capacity Constraints
- arxiv url: http://arxiv.org/abs/2608.04669v1
- Date: Wed, 05 Aug 2026 10:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.824211
- Title: Differentiating Through Dual Prices: End-to-End Policy Learning Under Capacity Constraints
- Title(参考訳): デュアル価格による差別化:容量制約下でのエンドツーエンドの政策学習
- Authors: Mohammadsaeed Haghi, Mahdi Salmani, Nima Kelidari,
- Abstract要約: 我々は、ログ化された観測データからそのような割当てポリシーを学習する方法を研究する。
標準パイプラインは決定盲(Decision-blind)である。
代わりに、結果モデルをエンドツーエンドにトレーニングし、二重価格を通じて政治外の見積もりを差別化します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many social services assign scarce resources, such as housing assistance or hospital interventions, to people who arrive one at a time: each arrival must receive a decision immediately, and the long-run usage of every resource must stay within its capacity. We study how to learn such an assignment policy from logged observational data. The standard pipeline is decision-blind: fit one outcome model per arm by regression, price each capacitated resource from the fitted models, and assign each arrival the arm whose predicted outcome minus price is largest. We instead train the outcome models end-to-end, differentiating an off-policy estimate of the deployed policy's value through the dual prices themselves. We study two formulations: an exact nonconvex one, and a convex relaxation whose optimum always satisfies the capacity constraints in expectation and which is suboptimal by at most a term linear in the smoothing temperature and logarithmic in the number of arms. Every method is evaluated in a queueing simulation with resources replenished at their capacity rates. Across six datasets, the two end-to-end variants take the top slots on a deployment-adjusted value index at every delay cost, including zero; when capacities are binding, decision-blind baselines frequently violate them and incur much longer queueing delays. On the largest dataset, a hospital cohort of seventy thousand patients, end-to-end training also achieves significantly higher policy value, a margin that survives a capacity-matched neural baseline. Flexible decision-blind regression remains the stronger pure predictor where ground truth is measurable; end-to-end training is best suited to settings where resources are genuinely scarce and feasibility matters.
- Abstract(参考訳): 多くの社会サービスは、住居援助や病院の介入など不足する資源を、一度に1人ずつ到着する人々に割り当てている。
我々は、ログ化された観測データからそのような割当てポリシーを学習する方法を研究する。
標準パイプラインは、レグレッションによって各アームに1つの結果モデルが適合し、各容量化されたリソースが適合したモデルから価格が設定され、予測された結果が最大となる各アームが割り当てられる。
代わりに、私たちは結果モデルをエンドツーエンドにトレーニングし、二重価格自体を通じて、デプロイされたポリシーの価値の非政治的な見積もりを区別します。
正確な非凸式と、常に期待されるキャパシティ制約を満たす凸緩和式と、アーム数における滑らかな温度と対数において少なくとも1つの項で最適である2つの定式化について検討する。
各手法は, キャパシティ・レートで資源を補充した待ち行列シミュレーションで評価される。
6つのデータセットにまたがって、2つのエンドツーエンドの亜種は、ゼロを含む遅延コストを含むすべての遅延コストにおいて、デプロイメント調整された値インデックスのトップスロットを取ります。
最大のデータセットでは、70万人の患者からなる病院コホートで、エンドツーエンドのトレーニングは、能力にマッチした神経ベースラインを生き残るためのマージンである、非常に高い政策価値も達成します。
柔軟な意思決定による回帰は、根本的真実が測定可能な強力な純粋予測器であり、エンドツーエンドのトレーニングは、リソースが本当に不足し、実現可能性に最も適しています。
関連論文リスト
- Generative Frontier Planning for Adaptive Peer-Referral Recruitment under Covariate-Dependent Arrivals [28.082278231005997]
ピア・リフレラル・リクルートシステムは、感染症に罹患する隠れた集団の研究と介入に不可欠である。
ステップごとのモンテカルロサンプリングを決定論的バックアップに置き換えるモデルベースプランナーであるemphGenerative Frontier Planning (GFP)を提案する。
GFPはランダム、強化学習、すなわち動的プログラミングのベースラインを4つの割引因子で上回る。
論文 参考訳(メタデータ) (2026-06-06T22:31:07Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Optimal patient allocation for echocardiographic assessments [0.0]
我々は,患者のノショー確率を推定し,到着時間と受験期間の経験的分布を導出する。
我々は,SimPyを用いて離散イベントシミュレーションモデルを開発し,オープンソースPythonライブラリと統合する。
胎児と非胎児の比1:6、胎児と非胎児の比4:2の病院構成を考えると、オン・ザ・フライアロケーションは一般的により優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-05-17T17:51:23Z) - Decision from Suboptimal Classifiers: Excess Risk Pre- and Post-Calibration [52.70324949884702]
バッチ二分決定における近似的後続確率を用いた余剰リスクの定量化を行う。
我々は、再校正のみが後悔のほとんどに対処する体制と、後悔が集団的損失に支配される体制を識別する。
NLP実験では、これらの量によって、より高度なポストトレーニングの期待値が運用コストに値するかどうかが分かる。
論文 参考訳(メタデータ) (2025-03-23T10:52:36Z) - Learning Optimal and Fair Policies for Online Allocation of Scarce Societal Resources from Data Collected in Deployment [4.659762505466962]
当社は、予算制約を満たしつつ、期待される成果を最大化するオンラインポリシーを設計するために、デプロイメントで収集された管理データを使用します。
当社の政策は,ホームレスからの退去率を5.16%向上させ,人種ごとの配分や結果に公平な政策は,フェアネスの非常に低い価格で得られることを示す。
論文 参考訳(メタデータ) (2023-11-23T01:40:41Z) - Pessimistic Minimax Value Iteration: Provably Efficient Equilibrium
Learning from Offline Datasets [101.5329678997916]
両プレイヤーゼロサムマルコフゲーム(MG)をオフライン環境で研究する。
目標は、事前収集されたデータセットに基づいて、近似的なナッシュ均衡(NE)ポリシーペアを見つけることである。
論文 参考訳(メタデータ) (2022-02-15T15:39:30Z) - Estimation of Optimal Dynamic Treatment Assignment Rules under Policy Constraints [0.0]
本研究は,各段階の個人に対して,その履歴に基づいて最適な治療課題を導出する最適動的治療体制の推定について検討する。
提案手法は, 下位帰納的帰納的帰納的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属
論文 参考訳(メタデータ) (2021-06-09T12:42:53Z) - Universal Off-Policy Evaluation [64.02853483874334]
ユニバーサルオフ政治推定器(UnO)への第一歩を踏み出す
我々は, 平均, 分散, 分位数/中間数, 分位数範囲, cvar, および累積分布全体の推定と同時結合に uno を用いる。
論文 参考訳(メタデータ) (2021-04-26T18:54:31Z) - Coordinated Online Learning for Multi-Agent Systems with Coupled
Constraints and Perturbed Utility Observations [91.02019381927236]
本研究では, 資源制約を満たすため, エージェントを安定な集団状態へ誘導する新しい手法を提案する。
提案手法は,ゲームラグランジアンの拡張によるリソース負荷に基づく分散リソース価格設定手法である。
論文 参考訳(メタデータ) (2020-10-21T10:11:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。