論文の概要: OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items
- arxiv url: http://arxiv.org/abs/2609.01933v2
- Date: Fri, 04 Sep 2026 00:47:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.565049
- Title: OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items
- Title(参考訳): OR-Transformer: リアルタイム意思決定を1,000項目にスケールアップする
- Authors: Shuze Daniel Liu, David Simchi-Levi, Claire Chen, Chutong Gao, Shangtong Zhang,
- Abstract要約: 本稿では, OR-Transformerについて紹介する。
最大1,024の在庫項目を含む問題に対して、OR-Transformerは、スケールが拡大するにつれて、学習ベースおよびローリングホライゾンMILPベースラインを上回っている。
また、MILPソルバの400万倍以上のオンライン意思決定時間を短縮し、サプライチェーンの運用において、リアルタイムで大規模な深いRLを可能にする。
- 参考スコア(独自算出の注目度): 33.727687780636394
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern supply chain operations can require coordinating replenishment across thousands of heterogeneous items under correlated stochastic demand, heterogeneous lead times, and shared fixed ordering costs, yielding observation spaces exceeding $10^4$ dimensions. At this scale, rolling-horizon stochastic mixed-integer linear programs (MILPs) become prohibitively slow, while standard reinforcement learning (RL) methods face increasingly challenging credit assignment in high-dimensional action spaces. We introduce OR-Transformer, a deep reinforcement learning framework for joint replenishment under stochastic demand, with an item-permutation-equivariant Transformer architecture and pathwise-gradient training through the inventory dynamics. Across problem sizes up to 1,024 inventory items, OR-Transformer increasingly outperforms learning-based and rolling-horizon MILP baselines as scale grows. It also reduces online decision-making time by over 4 million times relative to MILP solvers, enabling real-time, large-scale deep RL in supply chain operations.
- Abstract(参考訳): 現代のサプライチェーンの運用では、相関した確率的需要、不均一なリードタイム、共有された固定順序コストの下で数千の異質なアイテムの調整が必要となり、観測空間は10^4$を超える。
このスケールでは、ローリングホライゾン確率混合整数線形プログラム(MILP)は違法に遅くなり、一方、標準強化学習(RL)法は高次元の行動空間においてますます困難なクレジット割り当てに直面している。
本稿では,確率的要求下での継手補充のための深層強化学習フレームワークであるOR-Transformerについて紹介する。
最大1,024の在庫項目を含む問題に対して、OR-Transformerは、スケールが拡大するにつれて、学習ベースおよびローリングホライゾンMILPベースラインを上回っている。
また、MILPソルバの400万倍以上のオンライン意思決定時間を短縮し、サプライチェーンの運用において、リアルタイムで大規模な深いRLを可能にする。
関連論文リスト
- MMOE: Modernizing Diffusion Transformers with Efficient Expert Design [76.86793131833551]
現代の大規模言語モデルは、キャパシティの増大と効率のペアリング、トーケン毎の維持、およびキャパシティの増大に伴うデプロイメントコストの制御によって、うまくスケールする。
近年の取り組みは, LLMのスケーリングを実践する効率メカニズムをインポートすることなく, 全パラメータ数と空間比を大きくした。
我々は、ルーティングされた専門家、共有および軽量の専門家、ゲート-残留ルーティング、AIGC生成へのアテンション-残留情報再利用に対応する、SiTスタイルの拡散変換器の近代化であるModernMOEを紹介する。
論文 参考訳(メタデータ) (2026-07-27T17:05:04Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models [10.372430331898608]
強化学習(RL)は,大規模言語モデル(LLM)のポストトレーニングにおいて重要な要素となっている。
本稿では,効率的なエージェントRLのためのスケーラブルなシステムEARLを提案する。
論文 参考訳(メタデータ) (2025-10-07T13:52:51Z) - Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning [17.821508944254237]
市場メイキング(MM)における取引所の遅延は、ハードウェアの制限、システム処理時間、取引所からのデータの受信遅延、市場に到達するのに注文の送信に要する時間などにより避けられない。
マーケットメイキング(MM)のための既存の強化学習(RL)手法は、これらの遅延の影響を無視する。
本稿では,待ち時間と在庫リスク問題に対処するRLに基づくMM手法であるRelaverを提案する。
論文 参考訳(メタデータ) (2025-05-18T15:43:41Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z) - Iterative Multi-Agent Reinforcement Learning: A Novel Approach Toward Real-World Multi-Echelon Inventory Optimization [0.6990493129893112]
マルチエケロン在庫最適化(MEIO)は、効果的なサプライチェーン管理において重要であるが、その固有の複雑さは重大な課題を引き起こす可能性がある。
近年の研究では、深層強化学習(DRL)が従来の強化学習の代替として有望であることがわかった。
本論文は複雑化に伴うMEIO問題に対するDRLの適用性について考察する。
論文 参考訳(メタデータ) (2025-03-23T20:52:21Z) - Stop Regressing: Training Value Functions via Classification for
Scalable Deep RL [109.44370201929246]
分類的クロスエントロピーを用いた値関数のトレーニングにより,様々な領域における性能とスケーラビリティが向上することを示す。
例えば、SoftMoEによるAtari 2600ゲームでのシングルタスクRL、大規模ResNetによるAtariでのマルチタスクRL、Q-トランスフォーマーによるロボット操作、検索なしでチェスをプレイする、高容量トランスフォーマーによる言語エージェントWordleタスクなどがある。
論文 参考訳(メタデータ) (2024-03-06T18:55:47Z) - Action-Quantized Offline Reinforcement Learning for Robotic Skill
Learning [68.16998247593209]
オフライン強化学習(RL)パラダイムは、静的な行動データセットを、データを収集したポリシーよりも優れたパフォーマンスのポリシーに変換するためのレシピを提供する。
本稿では,アクション量子化のための適応型スキームを提案する。
IQL,CQL,BRACといった最先端のオフラインRL手法が,提案手法と組み合わせることで,ベンチマークのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-10-18T06:07:10Z) - Transfer Q-learning [46.69861865164196]
時間不均一な有限水平マルコフ決定過程 (MDP) は動的処理系における意思決定のモデル化によく用いられる。
これらの分野、特に医療とビジネスは、高次元状態空間やMDPプロセスの時間的不均一性といった課題に直面していることが多い。
対象のRLタスクと関連する複数のソースタスクからのデータを活用することにより,時間的不均一な有限水平MDP内の知識伝達について検討する。
論文 参考訳(メタデータ) (2022-02-09T20:08:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。