論文の概要: LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling
- arxiv url: http://arxiv.org/abs/2608.09343v1
- Date: Mon, 10 Aug 2026 09:20:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.181036
- Title: LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling
- Title(参考訳): シミュレーショントレースによるLLM誘導ヒューリスティック設計:動的生産とAGVスケジューリングを事例として
- Authors: Jinbo Li, Chuanhao Li,
- Abstract要約: シミュレーションベースの最適化(SBO)は、動的に実行可能なポリシーを評価する。
ほとんどのメソッドは、シミュレータをブラックボックスとして扱う。なぜ失敗したのか、どのポリシーロジックを変更するべきかを明らかにすることなく、ランキング候補を集計する。
LLM誘導設計フレームワークについて,繰り返しシミュレーションによる選択と事象レベルのトレースを用いて診断を行う。
- 参考スコア(独自算出の注目度): 10.289256706393084
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Simulation-based optimization (SBO) evaluates executable policies under stochastic dynamics, but most methods treat the simulator as a black box: aggregate scores rank candidates without revealing why they fail or which policy logic should change. We present an LLM-guided heuristic design framework that uses repeated simulation for selection and event-level traces for diagnosis. Each incumbent is assessed through multiple replications, while replaying its lowest-scoring one produces a queryable trace. A manager agent formulates bottleneck hypotheses from this evidence, and editing agents implement parallel code-level revisions. After execution checks and repeated evaluation, best-so-far selection retains only improvements. LLM revision occurs between evaluation batches, while a fixed policy controls each simulation run. We evaluate the framework in a discrete-event simulation of dynamic production and automated guided vehicle (AGV) scheduling. Across five independent optimization runs with Gemini-3.1-Pro, final mean scores averaged 77.51 on the simulator's 0-100 scale. In the highest-scoring run, trace-based diagnoses motivated proactive charging, distance-aware AGV assignment, and rebalanced dispatch priorities, raising the best-so-far mean score from 62.49 to 78.61. On 100 matched seeds, the best final policy outscored representative rolling-MILP, rule-based, and metaheuristic policies on every seed and retained its advantage under random faults without re-optimization. After separate re-optimization for a longer horizon and variable order interarrival times, the resulting policies again outscored all baselines. Ablations with two LLM backbones showed that removing either parallel candidate generation or trace-database access reduced final mean scores. These results show that simulation traces can guide targeted code-level policy improvement in complex simulation-based scheduling.
- Abstract(参考訳): シミュレーションベースの最適化(SBO)は確率力学の下で実行可能なポリシーを評価するが、ほとんどの手法はシミュレータをブラックボックスとして扱う。
LLM誘導型ヒューリスティック・デザイン・フレームワークを提案する。
各既存のオブジェクトは複数のレプリケーションを通じて評価され、最も低いスコアを再生するとクエリ可能なトレースが生成される。
管理者エージェントは、この証拠からボトルネック仮説を定式化し、編集エージェントは並列コードレベルのリビジョンを実装する。
実行チェックと繰り返しの評価の後、最良の選択は改善のみを保持する。
LLMのリビジョンは評価バッチ間で行われ、固定ポリシーは各シミュレーションの実行を制御する。
動的生産と自動誘導車両(AGV)スケジューリングの離散環境シミュレーションにおいて,本フレームワークの評価を行った。
Gemini-3.1-Proで5つの独立した最適化が実行され、最終的な平均スコアはシミュレータの0-100スケールで77.51である。
最高成績では、トレースベースの診断は積極的に充電し、距離対応のAGVを割り当て、ディスパッチの優先順位を再バランスさせ、最高スコアは62.49から78.61に引き上げた。
一致した種子100種について, 最終方針は各種子に対する代表的転がりMILP, 規則に基づく, メタヒューリスティックな政策を誇示し, 再最適化することなく, ランダムな欠陥の下でその優位性を維持した。
より長い地平線と可変順序の交叉時間に対する別の再最適化の後、その結果のポリシーは再びすべての基準線を上回りました。
2つのLDMバックボーンとのアブレーションにより、並列候補生成またはトレースデータベースアクセスが最終平均スコアを減らした。
これらの結果から,シミュレーショントレースは,複雑なシミュレーションに基づくスケジューリングにおいて,目標となるコードレベルのポリシー改善を導くことができることがわかった。
関連論文リスト
- Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - POLCA: Stochastic Generative Optimization with LLM [26.342554900977003]
局所文脈を用いた優先順位付け最適化(POLCA)を導入する。
POLCAは、最適化におけるパラメータ性を扱うために設計されたスケーラブルなフレームワークである。
我々は,POLCAが頑健,サンプル,時間効率の両立を実証した。
論文 参考訳(メタデータ) (2026-03-16T03:07:44Z) - What If We Allocate Test-Time Compute Adaptively? [2.1713977971908944]
テストタイムスケーリングは、推論計算を均一に割り当て、固定されたサンプリング戦略を使用し、再ランク付けにのみ検証を適用する。
本稿では,推論を反復的軌跡生成と選択として扱う検証器誘導適応フレームワークを提案する。
データセット全体にわたって、当社の動的PRMガイダンスアプローチは、テスト時間の直接スケーリングよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-01T07:30:22Z) - AIME: AI System Optimization via Multiple LLM Evaluators [79.03422337674664]
AIME は複数の LLM を利用した評価プロトコルであり、それぞれが独立した基準で評価を生成し、結合を通してそれらを結合する。
コード生成タスクにおける AIME のベースラインメソッドのパフォーマンスは,LeetCodeHard と HumanEval データセットの単一 LLM 評価プロトコルよりも最大 62% 高いエラー検出率,最大 16% 高い成功率で向上している。
論文 参考訳(メタデータ) (2024-10-04T04:03:24Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。