論文の概要: Learning Optimization Proxies for Sequential Contextual Stochastic Programs: An Order Fulfillment Application
- arxiv url: http://arxiv.org/abs/2606.25362v1
- Date: Wed, 24 Jun 2026 03:45:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.209377
- Title: Learning Optimization Proxies for Sequential Contextual Stochastic Programs: An Order Fulfillment Application
- Title(参考訳): 逐次文脈確率型プログラムのための学習最適化プロキシ:順序フルフィルメントアプリケーション
- Abstract要約: 逐次的文脈プログラムは、各時間が不確実な動作にコミットするリアルタイム決定システムをモデル化する。
オフザシェルフ最適化は高い意思決定品質をオフラインで達成するが、通常インスタンス毎に秒から数分で実行される。
本稿では,学習に基づく最適化プロキシを開発する。解決器生成ラベルをオフラインでトレーニングしたシナリオ埋め込みニューラルネットワークと,実現可能性を実現するデコーダとをオンラインでペアリングする。
- 参考スコア(独自算出の注目度): 12.486418828615077
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Sequential contextual stochastic programs model real-time decision systems in which each time epoch commits to an action under uncertainty whose consequences propagate into future decisions. In many practical contexts, these programs require obtaining solutions rapidly as new information becomes available. These problems can be represented through scenario approximations to be solved by off-the-shelf optimization solvers, which achieve high decision quality offline but typically run in seconds to minutes per instance, falling short of the sub-second responses that peak periods of planning require. This paper develops a learning-based optimization proxy: a scenario-embedded neural network trained offline on solver-generated labels, paired online with a decoder that enforces feasibility, replacing the per-epoch solve with a single forward pass. The framework is specialized to omnichannel order fulfillment, where each arriving order requires a sub-second assignment of products to distribution centers and carrier services under stochastic delivery times and future demand. A two-stage contextual stochastic program is introduced to formulate this problem, and its contextual sample average approximation (C-SAA) supplies the offline labels, while a composite training loss combines label imitation, a constraint-violation penalty, and self-supervised cost alignment. In a calibrated simulator built from JD.com transactional records, a detailed computational study is provided. The proxy reduces decision latency by roughly 2800x relative to the online finite-sample C-SAA reference and improves over it by 3.3% in realized fulfillment cost. Relative to established fulfillment policies, the proxy lowers total realized cost by at least 10.7% and roughly halves the late-delivery rate.
- Abstract(参考訳): 逐次的文脈確率的プログラムはリアルタイムな意思決定システムをモデル化し、エポックの毎回、結果が将来の決定に伝播する不確実性の下での行動にコミットする。
多くの実践的な文脈において、これらのプログラムは新たな情報が利用可能になると迅速に解を得る必要がある。
これらの問題は、オフザシェルフ最適化ソルバによって解決されるシナリオ近似によって表現され、高い意思決定品質をオフラインで達成するが、通常、インスタンス毎に秒から数分で実行される。
シナリオ埋め込みニューラルネットワークは、解決器生成ラベルをオフラインでトレーニングし、デコーダとオンラインでペアリングし、実現可能性を強化し、画期的な解決を1つの前方パスに置き換える。
このフレームワークは、オムニチャネルの注文充足に特化しており、各注文は、確率的な配送時間と将来の需要の下で、配電所やキャリアサービスへの製品のサブ秒の割り当てを必要とする。
この問題を定式化するために2段階の文脈確率プログラムを導入し、その文脈サンプル平均近似(C-SAA)はオフラインラベルを供給し、複合トレーニング損失はラベルの模倣、制約違反のペナルティ、自己監督コストアライメントを組み合わせる。
JD.comトランザクショナルレコードから構築された校正シミュレータでは、詳細な計算研究が提供される。
プロキシは、オンラインの有限サンプルC-SAA参照に対して、決定遅延を約2800倍削減し、実現された実行コストで3.3%改善する。
確立されたフルフィルメント政策とは対照的に、プロキシは実現された総コストを少なくとも10.7%削減し、納期遅れ率をほぼ半分にする。
関連論文リスト
- End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services [13.04369901641143]
大規模言語モデル(LLM)を使用したエージェントAIサービスでは、低レイテンシ推論がますます求められている。
本研究では,各要求に対する送信,プリフィル,再分配レベル復号化,キー値キャッシュの進化をキャプチャするクロススロット推論モデルを開発した。
本稿では,Lyapunov最適化による長期負荷分散制約を変換するLYREO手法を提案する。
論文 参考訳(メタデータ) (2026-09-15T13:50:54Z) - A Self-Triggered Agentic Push Recommendation System [77.13502692161426]
プッシュ通知は、大規模プラットフォームにおける重要なレコメンデーションシナリオである。
本稿では,プロアクティブ・セルフトリガー・エンド・ツー・エンドのエージェント・プッシュ・レコメンデーションシステムを提案する。
STEPSはすでにDouyinに10億人以上のユーザーを抱えている。
論文 参考訳(メタデータ) (2026-08-03T09:20:53Z) - Bi-Level Online Provisioning and Scheduling with Switching Costs and Cross-Level Constraints [1.639795325203038]
本稿では,ネットワークリソース割り当てを動機とした,双方向のオンラインプロビジョニングとスケジューリング問題について検討する。
我々は,上層オンライン凸最適化問題と下層制約マルコフ決定プロセスを用いて,この2段階の相互作用をモデル化する。
論文 参考訳(メタデータ) (2026-01-26T20:16:13Z) - Decentralized Nonconvex Composite Federated Learning with Gradient Tracking and Momentum [78.27945336558987]
分散サーバ(DFL)はクライアント・クライアント・アーキテクチャへの依存をなくす。
非滑らかな正規化はしばしば機械学習タスクに組み込まれる。
本稿では,これらの問題を解決する新しいDNCFLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-17T08:32:25Z) - Federated Q-Learning: Linear Regret Speedup with Low Communication Cost [4.380110270510058]
本稿では,FedQ-HoeffdingとFedQ-Bernsteinという2つの連合Qラーニングアルゴリズムを提案する。
時間的地平線が十分に大きい場合, 対応する全後悔は, 単エージェントと比較して直線的なスピードアップを達成することを示す。
これらの結果は、エージェントとサーバ間のイベントトリガー同期機構に依存します。
論文 参考訳(メタデータ) (2023-12-22T19:14:09Z) - Learning-Assisted Algorithm Unrolling for Online Optimization with
Budget Constraints [27.84415856657607]
我々はLAAU(Learning-Assisted Algorithm Unrolling)と呼ばれる新しい機械学習支援アンローリング手法を提案する。
バックプロパゲーションによる効率的なトレーニングには、時間とともに決定パイプラインの勾配を導出します。
また、トレーニングデータがオフラインで利用可能で、オンラインで収集できる場合の2つのケースの平均的なコスト境界も提供します。
論文 参考訳(メタデータ) (2022-12-03T20:56:29Z) - Byzantine-Robust Online and Offline Distributed Reinforcement Learning [60.970950468309056]
本稿では,複数のエージェントが環境を探索し,その経験を中央サーバを通じて伝達する分散強化学習環境について考察する。
エージェントの$alpha$-fractionは敵対的であり、任意の偽情報を報告することができる。
我々は、これらの対立エージェントの存在下で、マルコフ決定プロセスの根底にある準最適政策を特定することを模索する。
論文 参考訳(メタデータ) (2022-06-01T00:44:53Z) - Approaching sales forecasting using recurrent neural networks and
transformers [57.43518732385863]
深層学習技術を用いて,日・店・店レベルでの顧客販売予測問題に対処する3つの方法を開発した。
実験結果から,データ前処理を最小限に抑えた単純なシーケンスアーキテクチャを用いて,優れた性能を実現することができることを示す。
提案した解は約0.54の RMSLE を達成し、Kaggle コンペティションで提案された問題に対する他のより具体的な解と競合する。
論文 参考訳(メタデータ) (2022-04-16T12:03:52Z) - Online Allocation with Two-sided Resource Constraints [44.5635910908944]
我々は,要求が順次到着する,リソース制約の低いオンラインアロケーション問題を考える。
提案手法では, リクエスト全体を知るオフライン問題に対して, 1-O (fracepsilonalpha-epsilon)$-competitive ratioを求めるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-12-28T02:21:06Z) - Better than the Best: Gradient-based Improper Reinforcement Learning for
Network Scheduling [60.48359567964899]
パケット遅延を最小限に抑えるため,制約付き待ち行列ネットワークにおけるスケジューリングの問題を考える。
我々は、利用可能な原子ポリシーよりも優れたスケジューラを生成するポリシー勾配に基づく強化学習アルゴリズムを使用する。
論文 参考訳(メタデータ) (2021-05-01T10:18:34Z) - Application-Driven Learning: A Closed-Loop Prediction and Optimization Approach Applied to Dynamic Reserves and Demand Forecasting [41.94295877935867]
我々は、予測と意思決定のプロセスが統合され、協調最適化される新しいクローズドループフレームワークであるアプリケーション駆動学習を提案する。
提案手法は拡張性があり,標準のオープンループ手法よりも一貫して性能が向上することを示す。
論文 参考訳(メタデータ) (2021-02-26T02:43:28Z) - Combining Deep Learning and Optimization for Security-Constrained
Optimal Power Flow [94.24763814458686]
セキュリティに制約のある最適電力フロー(SCOPF)は、電力システムの基本である。
SCOPF問題におけるAPRのモデル化は、複雑な大規模混合整数プログラムをもたらす。
本稿では,ディープラーニングとロバスト最適化を組み合わせた新しい手法を提案する。
論文 参考訳(メタデータ) (2020-07-14T12:38:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。