論文の概要: DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
- arxiv url: http://arxiv.org/abs/2603.19621v1
- Date: Fri, 20 Mar 2026 03:58:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.985297
- Title: DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
- Title(参考訳): DeepStock: インベントリ管理のためのポリシ正規化による強化学習
- Abstract要約: Deep Reinforcement Learning (DRL)は、ビッグデータと計算を活用可能なインベントリポリシをトレーニングするための汎用方法論を提供する。
DRLのオフザシェルフ実装は、訓練中に使用されるハイパーパラメータに対する高感度に悩まされることが多いため、様々な成功を収めている。
本研究では,「ベースストック」のような古典的在庫概念を基礎として政策規則化を行うことで,ハイパーパラメータチューニングを著しく加速し,複数のDRL手法の最終的な性能を向上させることができることを示す。
- 参考スコア(独自算出の注目度): 11.55428845446959
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep Reinforcement Learning (DRL) provides a general-purpose methodology for training inventory policies that can leverage big data and compute. However, off-the-shelf implementations of DRL have seen mixed success, often plagued by high sensitivity to the hyperparameters used during training. In this paper, we show that by imposing policy regularizations, grounded in classical inventory concepts such as "Base Stock", we can significantly accelerate hyperparameter tuning and improve the final performance of several DRL methods. We report details from a 100% deployment of DRL with policy regularizations on Alibaba's e-commerce platform, Tmall. We also include extensive synthetic experiments, which show that policy regularizations reshape the narrative on what is the best DRL method for inventory management.
- Abstract(参考訳): Deep Reinforcement Learning (DRL)は、ビッグデータと計算を活用可能なインベントリポリシをトレーニングするための汎用方法論を提供する。
しかし、DRLの既製の実装は様々な成功を収めており、しばしば訓練中に使用されるハイパーパラメータに対する高感度に悩まされている。
本稿では,「ベースストック」のような古典的在庫概念を基盤とした政策規則化を導入することで,ハイパーパラメータチューニングを著しく加速し,複数のDRL手法の最終的な性能を向上させることができることを示す。
当社は、AlibabaのeコマースプラットフォームであるTmallにポリシーレギュレーションを施したDRLの100%デプロイの詳細を報告します。
また, 在庫管理に最適なDRL法について, 政策正則化が物語を形作ることを示す, 広範な総合的な実験も含んでいる。
関連論文リスト
- RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization [65.23034604711489]
大規模な推論モデルをトレーニングするための自己改善フレームワークであるRLoopを紹介します。
RLoopはまず、RLを使用して所定のポリシからソリューション空間を探索し、成功したトラジェクトリをフィルタリングしてエキスパートデータセットを作成する。
実験の結果、RLoopsは一般化を忘れて大幅に改善し、平均精度は9%、pass@32はバニラRLに比べて15%以上向上した。
論文 参考訳(メタデータ) (2025-11-06T11:27:16Z) - Reinforcement Learning on Pre-Training Data [55.570379963147424]
我々は,大規模言語モデル(LLM)を最適化するための新しい訓練時間スケーリングパラダイムである,事前学習データ(R)の強化学習を紹介する。
Rは、有意義な軌道を自律的に探索し、事前学習データから学び、強化学習(RL)を通してその能力を向上させる。
複数のモデルにわたる一般領域および数学的推論ベンチマークの広範な実験は、Rの有効性を検証した。
論文 参考訳(メタデータ) (2025-09-23T17:10:40Z) - Structure-Informed Deep Reinforcement Learning for Inventory Management [8.697068617006964]
本稿では,古典的在庫管理問題に対するDeep Reinforcement Learningの適用について検討する。
我々はDirectBackpropに基づくDRLアルゴリズムをいくつかの基本的な在庫管理シナリオに適用する。
本稿では,我々の汎用DRL実装が,確立したベンチマークや分布に対して競争的に,あるいは性能的に優れていることを示す。
論文 参考訳(メタデータ) (2025-07-29T17:41:45Z) - LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models [42.53342297631436]
政策探究は強化学習(RL)において重要であり、既存のアプローチには欲求、ガウス過程などが含まれる。
大規模言語モデル(LLM)を用いたタスク固有探索戦略を適応的に生成するLLM-Explorerを設計する。
我々の設計は、DQNシリーズ、DDPG、TD3など、広く使われているRLアルゴリズムと互換性のあるプラグインモジュールである。
論文 参考訳(メタデータ) (2025-05-21T09:24:23Z) - Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone [72.17534881026995]
ポリシーに依存しないRL(PA-RL)と呼ばれるオフラインおよびオンラインの微調整手法を開発する。
オンラインRLファインチューニングアルゴリズムであるCal-QLを用いて、7BジェネラリストロボットポリシーであるOpenVLAのファインチューニングに成功した最初の結果を示す。
論文 参考訳(メタデータ) (2024-12-09T17:28:03Z) - Boosting Offline Reinforcement Learning via Data Rebalancing [104.3767045977716]
オフライン強化学習(RL)は、学習ポリシーとデータセットの分散シフトによって問題となる。
本稿では,データセットの再サンプリングが分散サポートを一定に保っているという観察に基づいて,オフラインRLアルゴリズムをシンプルかつ効果的に向上させる手法を提案する。
ReD(Return-based Data Re Balance)メソッドをダブします。これは10行未満のコード変更で実装でき、無視できる実行時間を追加します。
論文 参考訳(メタデータ) (2022-10-17T16:34:01Z) - Jump-Start Reinforcement Learning [68.82380421479675]
本稿では、オフラインデータやデモ、あるいは既存のポリシーを使ってRLポリシーを初期化するメタアルゴリズムを提案する。
特に,タスク解決に2つのポリシーを利用するアルゴリズムであるJump-Start Reinforcement Learning (JSRL)を提案する。
実験により、JSRLは既存の模倣と強化学習アルゴリズムを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-04-05T17:25:22Z) - Deep Controlled Learning for Inventory Control [0.0]
在庫管理への深層強化学習(DRL)の適用は、新たな分野である。
従来のDRLアルゴリズムは、もともとゲームプレイングやロボティクスといった多様な分野向けに開発されたもので、在庫管理によって引き起こされる特定の課題には適していない。
本稿では,高数値問題を対象とした新しいDRLアルゴリズムであるDeep Learning (DCL)を提案する。
論文 参考訳(メタデータ) (2020-11-30T18:53:08Z) - Critic Regularized Regression [70.8487887738354]
批判正規化回帰(CRR)形式を用いてデータからポリシーを学習するための新しいオフラインRLアルゴリズムを提案する。
CRRは驚くほどよく動作し、高次元の状態と行動空間を持つタスクにスケールする。
論文 参考訳(メタデータ) (2020-06-26T17:50:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。