論文の概要: A Policy Decomposition Framework for Dynamic Order Fulfillment Operations
- arxiv url: http://arxiv.org/abs/2607.04056v1
- Date: Sat, 04 Jul 2026 23:46:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.807722
- Title: A Policy Decomposition Framework for Dynamic Order Fulfillment Operations
- Title(参考訳): 動的次数 Fulfillment Operations のためのポリシ分解フレームワーク
- Authors: Gal Neria, Michal Tzur, Marlin W. Ulmer,
- Abstract要約: 本稿では,論理的課題を統一する新しい問題クラスである動的順序充足問題(DOFP)を紹介する。
本稿では,新しいポリシレベル分解を利用したDDF-VFA(Decomposition-Driven Framework with Value Function Approximation)を開発した。
DDF-VFAは、2つのステージを独立または共同で分解することなく最適化するベンチマークを一貫して上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern supply chains span diverse operational environments, ranging from e-commerce distribution networks to customized production-to-order manufacturing lines. Across these settings, operational efficiency depends on coordinating two highly interdependent stages: order preparation and downstream delivery. Although these stages are traditionally managed in isolation, real-world fulfillment systems must satisfy stringent delivery expectations under dynamic stochastic order arrivals. To bridge this gap, we introduce the Dynamic Order Fulfillment Problem (DOFP), a new problem class unifying logistical challenges previously studied separately. We model DOFP as a Markov decision process whose state and decision spaces are partitioned into preparation and delivery sub-spaces, linked by synchronization constraints. While recent approaches attempt to optimize both fulfillment stages simultaneously over myopic rolling horizons, our framework isolates and optimizes the downstream delivery policy, treating preparation strictly as a state-level constraint filter. To solve this, we develop the Decomposition-Driven Framework with Value Function Approximation (DDF-VFA), which utilizes a novel policy-level decomposition. This design partitions the search into a delivery-stage master problem and a preparation-stage compatibility subproblem, iteratively refined via feedback loops. DDF-VFA executes this strategy by combining a large-neighborhood search over partial delivery decisions with a neural-network value function approximation for the cost-to-go. Numerical illustrations on two example variants using real-world datasets show that DDF-VFA consistently outperforms benchmarks that optimize the two stages independently or jointly without decomposition. Finally, the framework naturally scales to accommodate additional real-world complexities such as batched or multi-stage preparation.
- Abstract(参考訳): 現代のサプライチェーンは、eコマースの流通ネットワークから、生産から注文までの製造ラインのカスタマイズまで、さまざまな運用環境にまたがっている。
これらの設定全体では、運用効率は2つの高度に相互依存したステージ、すなわち注文準備とダウンストリーム配信の調整に依存する。
これらのステージは伝統的に独立して管理されるが、現実のフルフィルメントシステムは、動的確率的注文の到着時に、厳密なデリバリ期待を満たす必要がある。
このギャップを埋めるために、我々は以前別々に研究された論理的課題を統一する新しい問題クラスである動的順序充足問題(DOFP)を導入する。
我々は、状態と決定空間を、同期制約によってリンクされた準備と配送のサブ空間に分割したマルコフ決定プロセスとしてDOFPをモデル化する。
近年のアプローチでは,両処理段階をミオピック圧延地平線上で同時に最適化する手法が試みられているが,本フレームワークは下流の配送方針を分離し,最適化し,厳密な処理を州レベルの制約フィルタとして扱う。
そこで我々は,新しいポリシレベル分解を利用したDDF-VFA(Decomposition-Driven Framework with Value Function Approximation)を開発した。
この設計は、探索をデリバリステージマスター問題と、フィードバックループを介して反復的に洗練される準備ステージ互換性サブプロブレムに分割する。
DDF-VFAはこの戦略を,部分的配送決定に対する大規模検索と,費用対費用のニューラルネットワーク値関数近似を組み合わせることで実現している。
実世界のデータセットを用いた2つのサンプル変種に関する数値図では、DFF-VFAは2つのステージを独立あるいは共同で分解することなく最適化するベンチマークを一貫して上回っている。
最後に、このフレームワークはバッチ処理やマルチステージの準備など、現実世界のさらなる複雑さに対応するために自然にスケールする。
関連論文リスト
- A Sliding-Window-Based Reinforcement Learning for Dynamic Assembly Flow Shop Scheduling with Multi-Product Delivery [16.636736248446233]
ハイブリッド製造システムにおけるリアルタイムスケジューリングには,マルチキット配信が大きな課題となっている。
本稿では,エンド・ツー・エンドのオンラインスケジューリングのためのスライディングウインドウに基づく強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-03T04:27:52Z) - Diff2SP: Diffusion Models for Correlated Scenario Generation in Stochastic Programming [4.788907888889963]
Diff2SPは拡散に基づく生成フレームワークで、下流最適化の目的を直接シナリオ生成に組み込む。
シナリオ生成と意思決定を別々のステップとして扱う従来の方法とは異なり、Diff2SPはトレーニングプロセスに最適化を組み込む。
Diff2SPは、統計的忠実度と下流最適化結果の両方を一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-06-04T03:27:51Z) - Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning [57.10440766103372]
Trajectory Regularized Merging (TRM) は、拡張されたトラジェクトリ部分空間内の最適化プロセスとしてマージフェーズを再構成するフレームワークである。
本フレームワークは,タスクアライメント,予測整合性,勾配応答性といった3つの相乗的目標を統合し,統合モデルの履歴安定性と再活性化最適化のダイナミクスを同時に保存する。
論文 参考訳(メタデータ) (2026-05-08T14:07:32Z) - Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs [84.3271821505699]
カオス・オブ・モダリティ(Chain of Modality, CoM)は、マルチモーダル融合を受動的結合から動的オーケストレーションに移行するエージェントフレームワークである。
CoMはトレーニングフリーまたはデータ効率のSFT設定で動作し、様々なベンチマークで堅牢で一貫した一般化を実現する。
論文 参考訳(メタデータ) (2026-04-16T01:21:14Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - Formalizing the Sampling Design Space of Diffusion-Based Generative Models via Adaptive Solvers and Wasserstein-Bounded Timesteps [4.397130429878499]
拡散に基づく生成モデルは、様々な領域で顕著な性能を達成してきたが、その実践的展開は、しばしば高いサンプリングコストによって制限されている。
本稿では,数値解法を拡散軌道の固有特性と整合する原理的枠組みであるSDMを提案する。
ODE のダイナミクスを解析することにより,低次解法は初期高雑音で十分であり,高次解法は後段の非線形性の増加に対応するために段階的に展開可能であることを示す。
論文 参考訳(メタデータ) (2026-02-13T05:02:07Z) - Adaptive Linear Path Model-Based Diffusion [52.84663832658799]
リニアパスモデルベース拡散(LP-MBD)を導入し、分散保存スケジュールをフローマッチング線形確率パスに置き換える。
また,適応型LP-MBD(ALP-MBD)を提案し,タスクの複雑さや環境条件に応じて拡散ステップやノイズレベルを調整する。
論文 参考訳(メタデータ) (2026-02-02T21:33:03Z) - Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making [48.998030470623384]
オフラインの意思決定は、さらなるインタラクションを伴わずに、固定データセットからの信頼性の高い振る舞いを必要とする。
i)タスク整列軌道を多様に生成するプランナー,(ii)システム力学との整合性を強制するダイナミクスモデル,(iii)タスク目標に整合した動作を選択するランサーモジュールからなる構成モデルに基づく拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T06:26:02Z) - Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models [48.15777554876988]
伝統的なアライメント手法では、しばしば大きな事前訓練されたモデルを再訓練する必要がある。
本稿では,アライメント処理を重要サンプリングの一種として形式化する新しいtextitResidual Alignment Model (textitRAM) を提案する。
本稿では,トークンレベルの復号化を反復的に行う再サンプリングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-05-26T08:53:02Z) - Exploring the Boundary of Diffusion-based Methods for Solving Constrained Optimization [46.75288477458697]
本稿では,DiOptと呼ばれる連続制約最適化問題に対する拡散に基づく新しいフレームワークを提案する。
DiOptは2つの異なるフェーズで動作し、最初のウォームスタートフェーズは教師付き学習によって実装され、その後ブートストラップフェーズが続く。
問題の制約を厳格に満たしつつ、反復的に解を洗練し、目的関数を改善するように設計されている。
論文 参考訳(メタデータ) (2025-02-14T17:43:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。