論文の概要: Two-Timescale Hierarchical Reinforcement Learning for Resilient Operations
- arxiv url: http://arxiv.org/abs/2607.23434v1
- Date: Sun, 26 Jul 2026 03:08:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.099451
- Title: Two-Timescale Hierarchical Reinforcement Learning for Resilient Operations
- Title(参考訳): 弾力性操作のための2時間階層型階層強化学習
- Authors: Young Hyun Cho, Franz Stoll, Will Wei Sun, Guang Lin, Stephan Biller,
- Abstract要約: 本研究では,階層型強化学習が相互依存型ルールを併用してレジリエンスを強化する方法について検討する。
本研究では,2段階の階層的強化学習フレームワークを開発し,長期的および短期的な政策をそれぞれの時間的規模で適用する。
- 参考スコア(独自算出の注目度): 8.269287339788223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unexpected shocks recur in global operations, requiring decision rules that adapt as market and operating conditions change. Many operational systems also have hierarchical structures in which long-term and short-term decisions pursue a shared objective. We study how hierarchical reinforcement learning can strengthen resilience by adapting these interdependent rules jointly. We develop a two-timescale hierarchical reinforcement learning framework that adapts long-term and short-term policies at their respective time scales. Because the policies are interdependent, we synchronize their updates and prove, to our knowledge, the first convergence guarantees for coupled two-timescale learning. Over $T$ periods, our policies' average gap from an optimal policy pair is $O(T^{-1/2})$, improving to $O(\log T/T)$ when poor decisions produce clearer profit losses. In a used-car case study, inventory replenishment is the long-term decision and customer-arrival pricing the short-term decision. Relative to the strongest partially adaptive benchmark, the framework increases mean profit by $9.2\%$ under joint demand-supply shocks and by $11.8\%$ under a prolonged shock scenario, while maintaining a more stable profit trajectory over time. Short-term adaptation addresses routine seasonality and one-sided disruptions by responding immediately to changing conditions. Under joint demand-supply shocks, however, it is insufficient alone; long-term adaptation is also needed to create favorable conditions for short-term decisions. Joint adaptation thus yields higher and more stable profits through disruption and recovery. Because many organizations already use hierarchical planning, the framework strengthens operational resilience without altering existing decision structures.
- Abstract(参考訳): 予期せぬショックは、市場や運用条件の変化に応じて適応する決定ルールを必要とする、世界的な事業で繰り返される。
多くの運用システムは階層構造を持ち、長期的および短期的な決定は共通の目的を追求する。
本研究では,これらの相互依存型ルールを併用することで,階層的強化学習がレジリエンスを強化する方法について検討する。
本研究では,2段階の階層的強化学習フレームワークを開発し,長期的および短期的な政策をそれぞれの時間的規模で適用する。
ポリシーは相互依存しているため、更新を同期させ、私たちの知識に則って、最初の収束保証は2段階の学習を結合することである。
最適な政策ペアからの平均的なギャップは$O(T^{-1/2})$であり、悪い判断がより明確な利益損失をもたらす場合、$O(\log T/T)$に改善される。
中古車のケーススタディでは、在庫の補充は長期的な決定であり、短期的な決定は顧客による価格設定である。
最も強い部分適応型ベンチマークとは対照的に、このフレームワークは、ジョイント・デマンド・サプライ・ショックの下で平均利益を9.2 %、長期的なショックシナリオ下では11.8 %、時間とともにより安定した利益軌道を維持しながら、平均利益を9.2 %引き上げる。
短期適応は、変化した条件に即座に応答することで、日常的な季節性や一方的な破壊に対処する。
しかし、共同需要供給ショックの下では、単独では不十分であり、短期的な意思決定に有利な条件を作るためには、長期適応も必要である。
これにより、共同適応は破壊と回復を通じてより安定的な利益をもたらす。
多くの組織がすでに階層的な計画を使用しているため、このフレームワークは既存の決定構造を変更することなく、運用上のレジリエンスを強化する。
関連論文リスト
- Agentic AI for Bilevel Long-Term Optimization of Policy-Driven Physical Layer Systems [56.931625543734306]
Agentic-Oは、適応的な物理層問題設定に適用可能なネストされた双方向最適化フレームワークである。
Agentic-Oは動的演算子ポリシーに強い適応性を示し、従来の手法と比較してシステムの長期性能を57.2%向上させる。
論文 参考訳(メタデータ) (2026-06-23T10:53:12Z) - Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning [74.5532558466687]
群 Relative Reward Rescaling (GR$3$) は、一般的な、連続かつ報酬に依存したゲーティング機構である。
GR$3$は、標準のGRPOに匹敵するトレーニングダイナミクスとダウンストリームのパフォーマンスを維持する。
それは長さのインフレーションを著しく軽減し、最先端の長周期正規化ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-03-11T08:41:34Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Soft Adaptive Policy Optimization [67.61886077470528]
強化学習は、大規模言語モデルの推論能力を高める上で、ますます重要な役割を担っている。
GSPOやGRPOのような既存のグループベースのポリシー最適化手法は、ハードクリッピングによってこの問題を軽減する。
ハードクリッピングをスムーズな温度制御ゲートに置き換えるソフト適応ポリシー最適化(SAPO)を提案する。
論文 参考訳(メタデータ) (2025-11-25T14:25:19Z) - Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy [5.913458789333235]
本稿では,そのような専門家政策の集合を組織化する強化学習(RL)手法を提案する。
我々は、期待と高確率の後悔の保証を確立し、時間差学習のための新しい有限時間バイアスを導出する。
その結果、構造化された適応型学習が複雑な資源配分と意思決定プロセスのモデリングと管理をいかに改善するかを強調した。
論文 参考訳(メタデータ) (2025-10-07T23:26:16Z) - Incentive-Aware Dynamic Resource Allocation under Long-Term Cost Constraints [24.842944692980495]
本研究では,再利用可能な資源の戦略的エージェントへの動的割り当てについて検討する。
戦略行動に頑健な原始二重手法を実現するインセンティブ対応フレームワークを開発した。
論文 参考訳(メタデータ) (2025-07-13T03:18:02Z) - Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning [14.852334980733369]
共用型マルチエージェント強化学習において、各エージェントの共用報酬への貢献を阻害する信用割り当ては重要な課題である。
本稿では、この制約から信用モデリングを分離するアプローチであるTAR(Temporal-Agent Reward Redistribution)を導入する。
本手法は,モデル精度によらず最適ポリシーが維持されることを保証するPBRSと等価であることを示す。
論文 参考訳(メタデータ) (2025-02-07T12:07:57Z) - Adapting Static Fairness to Sequential Decision-Making: Bias Mitigation Strategies towards Equal Long-term Benefit Rate [41.51680686036846]
逐次意思決定におけるバイアスに対処するため,Equal Long-term Benefit Rate (ELBERT) という長期公正性の概念を導入する。
ELBERTは、以前の長期公正の概念に見られる時間的差別問題に効果的に対処する。
ELBERT-POは高い有効性を維持しながらバイアスを著しく減少させることを示した。
論文 参考訳(メタデータ) (2023-09-07T01:10:01Z) - Optimizing Credit Limit Adjustments Under Adversarial Goals Using
Reinforcement Learning [42.303733194571905]
我々は、強化学習技術を用いて最適なクレジットカード制限調整ポリシーを発見し、自動化することを模索する。
本研究は、信用限度調整に強化学習フレームワークを適用するための概念構造を確立する。
論文 参考訳(メタデータ) (2023-06-27T16:10:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。