論文の概要: Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems
- arxiv url: http://arxiv.org/abs/2609.00859v1
- Date: Tue, 01 Sep 2026 07:56:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.442838
- Title: Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems
- Title(参考訳): 複合車両ルーティング問題に対する強化LDMエージェントの強化学習
- Authors: Yi Chen, Zikang Yu, Jiahai Wang, Jinbiao Chen, Jianpeng Zhou, Zizhen Zhang,
- Abstract要約: 車両ルーティング問題(VRPs)は、様々なシナリオで広く応用されている基本的な最適化問題である。
複雑なVRPのモデリングを自動化するためのマルチエージェントフレームワークであるReinforcement Learning Enhanced LLMAgents(RLEA)を提案する。
- 参考スコア(独自算出の注目度): 22.538946344456857
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vehicle Routing Problems (VRPs) are fundamental combinatorial optimization problems with widespread applications in various scenarios. The advanced optimization solvers can effectively solve such problems. However, modeling complex VRP variants for solvers often requires substantial domain expertise, which limits the accessibility of advanced optimization technologies. In this paper, we propose Reinforcement Learning Enhanced LLMAgents(RLEA), a multi-agent framework designed to automate the modeling of complex VRPs. RLEA introduces a lightweight neural Planner trained with Soft Q-learning to efficiently orchestrate the actions of LLM-based agents. In addition, we equip the system with an evolutionary memory module and retrieval-augmented generation, enabling the agent to leverage both accumulated experience and external solver knowledge during program generation and refinement for solving VRPs. We evaluated 48 distinct VRP variants across various solvers. The experimental results demonstrate that RLEA outperforms the previous state-of-the-ar method, achieving a 16.67% higher success rate while significantly reducing runtime errors. These results validate that integrating reinforcement learning with LLM-based reasoning is highly effective for automated optimization modeling. The appendix is available at: https://doi.org/10.5281/zenodo.19134435.
- Abstract(参考訳): 車両ルーティング問題(VRP)は、様々なシナリオで広く応用される基本的な組合せ最適化問題である。
高度な最適化解法はそのような問題を効果的に解くことができる。
しかし、複雑なVRPの変種をモデリングするには、高度な最適化技術のアクセシビリティを制限する領域の専門知識が必要となることが多い。
本稿では,複雑なVRPのモデリングを自動化するためのマルチエージェントフレームワークであるReinforcement Learning Enhanced LLMAgents(RLEA)を提案する。
RLEAは、LLMベースのエージェントのアクションを効率的にオーケストレーションするために、Soft Q-learningでトレーニングされた軽量なニューラルプランナーを導入している。
さらに,本システムには進化記憶モジュールと検索拡張生成機能を備えており,プログラム生成時に蓄積した経験と外部解法知識の両方を活用することができる。
様々な解法を用いて48種類のVRP変異体を評価した。
実験の結果、RLEAは以前のステート・オブ・ザ・アー法よりも優れ、16.67%高い成功率を達成し、実行時のエラーを著しく低減した。
これらの結果は,LLMに基づく推論と強化学習の統合が,自動最適化モデルに極めて有効であることを示す。
付録は以下の通り:https://doi.org/10.5281/zenodo.19134435。
関連論文リスト
- PyVRP$^+$: LLM-Driven Metacognitive Heuristic Evolution for Hybrid Genetic Search in Vehicle Routing Problems [30.443372626623887]
メタ認知プログラミング(MEP)は,大規模言語モデルを戦略的発見エージェントに高めるフレームワークである。
以上の結果から,MEPはオリジナルのHGSベースラインよりも大幅な性能向上を実現し,ソリューション品質を最大2.70%向上し,VRPの課題に対してランタイムを45%以上削減した。
論文 参考訳(メタデータ) (2026-04-09T06:36:15Z) - Enhancing CVRP Solver through LLM-driven Automatic Heuristic Design [16.7839584177637]
本研究では,Large Language Models (LLMs) を利用したCVRP問題解決に革命をもたらす新しいアプローチであるAILS-AHDを提案する。
提案手法は,進化的検索フレームワークをLLMと統合し,AILS法内の遺跡を動的に生成・最適化する。
当社のアプローチでは,CVRPLibの大規模ベンチマークにおいて,10インスタンス中8インスタンスに対して,新たに最もよく知られたソリューションを確立している。
論文 参考訳(メタデータ) (2026-02-26T15:12:23Z) - An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems [66.60904891478687]
複雑な車両ルーティング問題を解決するために,LLM (AFL) を用いたエージェントフレームワークを提案する。
AFLは生の入力から知識を直接抽出し、自己完結型コード生成を可能にする。
AFLは、コード信頼性とソリューション実現性の両方において、既存のLCMベースのベースラインを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2025-10-19T03:59:25Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - Improving Retrospective Language Agents via Joint Policy Gradient Optimization [57.35348425288859]
RetroActは、言語エージェントのタスク計画と自己反射進化機能を共同で最適化するフレームワークである。
模倣学習と強化学習を統合した2段階共同最適化プロセスを開発した。
RetroActはタスクのパフォーマンスと意思決定プロセスを大幅に改善しています。
論文 参考訳(メタデータ) (2025-03-03T12:54:54Z) - Scaling Autonomous Agents via Automatic Reward Modeling And Planning [52.39395405893965]
大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な機能を示している。
しかし、彼らは多段階の意思決定と環境フィードバックを必要とする問題に苦戦している。
人間のアノテーションを使わずに環境から報酬モデルを自動的に学習できるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T18:49:25Z) - A Multi-AI Agent System for Autonomous Optimization of Agentic AI Solutions via Iterative Refinement and LLM-Driven Feedback Loops [3.729242965449096]
本稿では,産業間におけるエージェントAIソリューションを自律的に最適化するフレームワークを提案する。
このフレームワークは、仮説を自律的に生成し、テストすることで、人間の入力なしに最適な性能を達成する。
ケーススタディでは、アウトプットの品質、妥当性、動作性が大幅に改善された。
論文 参考訳(メタデータ) (2024-12-22T20:08:04Z) - Machine Learning Insides OptVerse AI Solver: Design Principles and
Applications [74.67495900436728]
本稿では,Huawei CloudのOpsVerse AIソルバに機械学習(ML)技術を統合するための総合的研究について述べる。
本稿では,実世界の多面構造を反映した生成モデルを用いて,複雑なSATインスタンスとMILPインスタンスを生成する手法を紹介する。
本稿では,解解器性能を著しく向上させる,最先端パラメータチューニングアルゴリズムの導入について詳述する。
論文 参考訳(メタデータ) (2024-01-11T15:02:15Z) - Reinforcement Learning for Solving Stochastic Vehicle Routing Problem [0.09831489366502298]
本研究では、車両ルーティング問題(SVRP)解決における強化学習(RL)と機械学習(ML)技術の利用のギャップを解消する。
本稿では,SVRPのキーソースを包括的に扱う新しいエンドツーエンドフレームワークを提案する。
提案モデルでは,広く採用されている最先端のメユーリスティックよりも優れた性能を示し,旅行コストの3.43%削減を実現している。
論文 参考訳(メタデータ) (2023-11-13T19:46:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。