論文の概要: Automated Design of Inventory Policy with Large Language Models: An Exploratory Study
- arxiv url: http://arxiv.org/abs/2609.08071v1
- Date: Tue, 08 Sep 2026 00:27:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.537826
- Title: Automated Design of Inventory Policy with Large Language Models: An Exploratory Study
- Title(参考訳): 大規模言語モデルによる発明政策の自動設計:探索的研究
- Authors: Fenghua Yang, Preet Baxi, Yi Zhang, Stefanus Jasin, Yanzhe Lei, Mo Liu, Parshan Pakiman,
- Abstract要約: 本研究では,運用データ,最適化ツール,大規模言語モデル(LLM)を組み合わせた統合フレームワークを開発し,在庫政策設計を自動化する。
30個以上の在庫在庫は、ベースストックベンチマークと比較して平均的なコスト削減率を17.5%から10世代で37.5%に引き上げている。
発見された3つの政策クラスは10,064の新しい在庫インスタンスに対して21.75%から22.60%のコスト削減を実現している。
- 参考スコア(独自算出の注目度): 2.256533893252747
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Firms making inventory decisions have access to operational data, optimization tools, and large language models (LLMs). Typically, data characterize the operating environment, optimization selects parameters within a prespecified inventory policy class, and LLMs support coding and decision analysis. We develop an integrated framework that combines these resources to automate inventory policy design. Given demand data, the framework iteratively uses an LLM to generate parameterized policy classes and an external solver to optimize its parameters within each class. Across 30 lost-sales inventory instances, the mean cost reduction relative to optimized base-stock benchmarks increases from 17.5% after one generation to 30.0% after ten generations. Parameter optimization is central to this performance: an LLM-only variant performs substantially worse, whereas optimization-guided feedback improves policy quality, accelerates search, and directs the LLM toward better policy classes rather than merely better parameter values within a fixed class. The strongest discovered policies are also interpretable: they combine recognizable inventory-control motifs, including capped orders, discounted or weighted pipeline inventory, and threshold-based replenishment logic. The search thereby produces new policy-class functional forms that, to our knowledge, have not previously been studied in the lost-sales inventory literature. These functional forms are not specified ex ante but emerge from the search process. Moreover, after their parameters are re-optimized, three discovered policy classes achieve average cost reductions of 21.75% to 22.60% across 10,064 new inventory instances. Overall, the results show that data-driven parameter optimization can guide LLM-based search over a broad space of inventory policy classes and identify high-performing, interpretable, and transferable decision rules.
- Abstract(参考訳): 在庫決定を行う企業は、運用データ、最適化ツール、および大規模言語モデル(LLM)にアクセスすることができる。
通常、データは運用環境を特徴付け、最適化は事前に指定された在庫ポリシークラス内のパラメータを選択し、LLMはコーディングと決定分析をサポートする。
我々はこれらの資源を組み合わせて在庫政策設計を自動化する統合フレームワークを開発する。
需要データが与えられた場合、フレームワークはLLMを使用してパラメータ化されたポリシークラスを生成し、外部ソルバを使用して各クラス内のパラメータを最適化する。
損失品在庫30件中、最適化されたベースストックベンチマークに対する平均コスト削減率は、1世代後17.5%から10世代後30.0%に増加した。
パラメータ最適化は、LCMのみの変種が大幅に悪化するのに対して、最適化誘導フィードバックはポリシーの質を改善し、探索を加速し、固定クラス内でのパラメータ値の改善よりも、LCMをより良いポリシークラスに誘導する。
それらは、キャップ付き注文、ディスカウントまたは重み付けされたパイプライン在庫、しきい値に基づく補充ロジックを含む、認識可能な在庫管理モチーフを組み合わせたものである。
そこで本研究では, 失った商品在庫の文献において, これまでに研究されていない, 新たな政策クラス機能形式を提示する。
これらの関数形式はex anteではなく、検索プロセスから現れる。
さらに、パラメーターが再最適化された後、発見された3つのポリシークラスは10,064の新しい在庫インスタンスに対して21.75%から22.60%のコスト削減を達成する。
以上の結果から,データ駆動型パラメータ最適化は,在庫政策の幅広い領域をLLMで探索し,高い性能,解釈可能,かつ伝達可能な決定ルールを特定できることがわかった。
関連論文リスト
- Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces [63.82675722580452]
OPT*は、LLMのステップバイステップ最適化のような推論を訓練し評価するための最適化スタイルのタスクのファミリーである。
各タスクは実現可能性チェッカーと評価器を提供し、一方、複雑性パラメータは新しい人間ラベルを必要とせずに検索スペースを拡大する。
OPT*のトレーニングは、ステップバイステップの最適化のような推論を改善する。
論文 参考訳(メタデータ) (2026-06-03T21:43:38Z) - Rethinking On-policy Optimization for Query Augmentation [49.87723664806526]
本稿では,様々なベンチマークにおいて,プロンプトベースとRLベースのクエリ拡張の最初の体系的比較を示す。
そこで我々は,検索性能を最大化する擬似文書の生成を学習する,新しいハイブリッド手法 On-policy Pseudo-document Query Expansion (OPQE) を提案する。
論文 参考訳(メタデータ) (2025-10-20T04:16:28Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - A Survey on the Optimization of Large Language Model-based Agents [16.733092886211097]
大規模言語モデル(LLM)は様々な分野で広く採用されており、自律的な意思決定や対話的なタスクに欠かせないものとなっている。
しかしながら、現在の作業は通常、バニラLLMに適用された迅速な設計や微調整戦略に依存している。
LLMに基づくエージェント最適化手法の総合的なレビューを行い、パラメータ駆動型およびパラメータフリーな手法に分類する。
論文 参考訳(メタデータ) (2025-03-16T10:09:10Z) - OptiSeq: Ordering Examples On-The-Fly for In-Context Learning [8.603219414567084]
OptiSeqは、最適なサンプル順序を効率的に決定する、純粋に推論時間、データセットなしの最適化手法である。
OptiSeqは複数のタスクで5.5~10.5ポイントの精度向上を実現している。
論文 参考訳(メタデータ) (2025-01-25T02:24:00Z) - Adaptive Augmentation Policy Optimization with LLM Feedback [3.038642416291856]
データ拡張はディープラーニングパイプラインの重要なコンポーネントであり、データセットの多様性を高めてモデルの一般化を強化する。
従来の拡張戦略は手動で設計した変換、分類サンプリング、あるいは自動検索ベースのアプローチに依存している。
本稿では,モデル性能フィードバックに基づいて拡張ポリシーを改良するLarge Language Model (LLM)誘導拡張最適化戦略を提案する。
論文 参考訳(メタデータ) (2024-10-17T11:26:10Z) - OptiBench Meets ReSocratic: Measure and Improve LLMs for Optimization Modeling [62.19438812624467]
大規模言語モデル (LLM) は数学的推論における問題解決能力を示した。
本稿では,人間可読入力と出力を用いたエンドツーエンド最適化問題のベンチマークであるOptiBenchを提案する。
論文 参考訳(メタデータ) (2024-07-13T13:27:57Z) - Value Augmented Sampling for Language Model Alignment and Personalization [39.070662999014836]
報酬最適化のための新しいフレームワーク、価値拡張サンプリング(VAS)を提案する。
VASは、ポリシーと値関数を併用することなく、最適報酬最大化ポリシーを解く。
我々のアルゴリズムは、いくつかの報酬を作曲し、展開期間中に各報酬の幅を制御できる新しい能力を解き放ちます。
論文 参考訳(メタデータ) (2024-05-10T17:59:04Z) - How Can LLM Guide RL? A Value-Based Approach [68.55316627400683]
強化学習(Reinforcement Learning, RL)は、将来の行動方針をフィードバックで改善することにより、シーケンシャルな意思決定問題の事実上の標準的実践となった。
大規模言語モデル(LLM)の最近の発展は、言語理解と生成において印象的な能力を示したが、探索と自己改善能力に欠けていた。
我々はLINVITというアルゴリズムを開発し、LLMガイダンスを値ベースRLの正規化因子として組み込んで学習に必要なデータ量を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-25T20:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。