論文の概要: Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization
- arxiv url: http://arxiv.org/abs/2606.28764v1
- Date: Sat, 27 Jun 2026 06:46:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.681025
- Title: Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization
- Title(参考訳): 構造的ポリシによる階層的決定:逆最適化による原理的設計
- Abstract要約: 本稿では,上層目標の抽象化と下層決定の構造化を統合したフレームワークを提案する。
提案手法は, エンド・ツー・エンドのRL, 学習拡張最適制御, 既存の階層的RLアプローチに基づいて, 効率と意思決定品質の両面で, 高いベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 5.406955022340469
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hierarchical decision-making frameworks are pivotal for addressing complex control tasks, enabling agents to decompose intricate problems into manageable subgoals. Despite their promise, existing hierarchical policies face critical limitations: (i) reinforcement learning (RL)-based methods struggle to guarantee strict constraint satisfaction, and (ii) optimal control (OC)-based approaches often rely on myopic and computationally prohibitive formulations. To reconcile these trade-offs, hierarchical RL-OC architectures have emerged as a promising paradigm. However, the formulation of the lower-level optimization within these frameworks remains underexplored, often relying on heuristic or myopic objectives. In this work, we propose a principled framework that systematically integrates upper-level goal abstraction with structured lower-level decision making. We adopt an inverse optimization approach to inform the structure of the lower-level problem from expert demonstrations, ensuring that the objective of the lower-level policy remains aligned with the overall long-term task goal. To validate the approach, our framework is evaluated on distinct decision making tasks: network-based resource allocation and continuous collision avoidance. Empirical results demonstrate that our method consistently outperforms strong baselines based on end-to-end RL, learning-augmented optimal control, and existing hierarchical RL approaches in both efficiency and decision quality.
- Abstract(参考訳): 階層的な意思決定フレームワークは複雑な制御タスクに対処するために重要であり、エージェントは複雑な問題を管理可能なサブゴールに分解できる。
彼らの約束にもかかわらず、既存の階層的な政策は重要な制限に直面している。
一 強化学習(RL)に基づく手法は、厳格な制約満足度を保証するのに苦労し、
(II)最適制御(OC)に基づくアプローチは、しばしばミオピックおよび計算的に禁止された定式化に依存する。
これらのトレードオフを解決すべく、階層的なRL-OCアーキテクチャが有望なパラダイムとして登場した。
しかしながら、これらのフレームワークにおける下層最適化の定式化は、しばしばヒューリスティックな目的やミオピックな目的に頼って、未熟なままである。
本研究では,上層目標の抽象化と下層意思決定を体系的に統合する枠組みを提案する。
我々は、専門家による実証から下層問題の構造を知らせるために、逆最適化アプローチを採用し、下層政策の目的が全体的な長期的な課題目標と一致し続けることを保証する。
提案手法を検証するため,ネットワークベースの資源割り当てと連続衝突回避という,異なる意思決定タスクに基づいて,本フレームワークの評価を行った。
実験により,本手法は, エンドツーエンドのRL, 学習拡張最適制御, 既存の階層的RLアプローチに基づいて, 効率と意思決定品質の両面において, 高いベースラインを一貫して上回ることを示した。
関連論文リスト
- Segment-Aligned Policy Optimization for Multi-Modal Reasoning [55.29606572822562]
本稿では、トークンや全シーケンスではなく、一貫性のある推論ステップをポリシー更新の基本単位として扱う新しい強化学習パラダイムを提案する。
代表的な推論ベンチマークの実験は、SAPOがトークンレベルおよびシーケンスレベルポリシー最適化手法を一貫して上回っていることを示している。
我々の研究は、強化学習の更新を推論の構造と整合させることの重要性を強調し、複雑な推論タスクにおけるより効率的でセマンティックに根ざした政策最適化の道を開く。
論文 参考訳(メタデータ) (2026-05-02T08:47:45Z) - SMaRT: Select, Mix, and ReinvenT - A Strategy Fusion Framework for LLM-Driven Reasoning and Planning [14.78684546475325]
大規模言語モデル(LLM)は、例外的な一般化機能を備えた複雑なタスク自動化を再定義した。
パフォーマンスを最大化し、堅牢性を保証するために戦略を融合するフレームワークの必要性を強調している。
我々は、この制約を克服するために設計された革新的な戦略融合アプローチであるSelect, Mix, ReinvenT (SMaRT) フレームワークを紹介します。
論文 参考訳(メタデータ) (2025-10-20T20:42:24Z) - Step-Aware Policy Optimization for Reasoning in Diffusion Large Language Models [57.42778606399764]
拡散言語モデル(dLLM)は、テキスト生成に有望で非自己回帰的なパラダイムを提供する。
現在の強化学習アプローチは、しばしばスパースで結果に基づく報酬に頼っている。
これは推論の自然な構造との根本的なミスマッチに由来すると我々は主張する。
論文 参考訳(メタデータ) (2025-10-02T00:34:15Z) - Hierarchical Reinforcement Learning with Low-Level MPC for Multi-Agent Control [1.5856188608650232]
強化学習(RL)による戦術的意思決定とモデル予測制御(MPC)による低レベル実行を組み合わせた階層的枠組みを提案する。
プレデター・プリーベンチマークでテストしたところ、我々のアプローチは報酬、安全性、一貫性の点でエンドツーエンドとシールドベースのRLベースラインよりも優れています。
論文 参考訳(メタデータ) (2025-09-19T09:27:15Z) - Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks [3.79187263097166]
長期の目標条件付きタスクの解決は、強化学習において重要な課題である。
Reinforcement Learning with Precipation(RLA)は、これらの制限に対処するために設計された、原則付き、潜在的にスケーラブルなフレームワークです。
RLAの主な特徴は予測モデルのトレーニングであり、これは値の幾何的一貫性の原則によって導かれる。
論文 参考訳(メタデータ) (2025-09-06T00:10:15Z) - Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time [52.230936493691985]
本稿では,2次基準のしきい値に基づく制約を満たしつつ,主目的を最大化し,アライメントの多面性に対処する推論フレームワークSITAlignを提案する。
我々は、満足度に基づく推論アライメントアプローチの準最適境界を導出することで理論的洞察を提供する。
論文 参考訳(メタデータ) (2025-05-29T17:56:05Z) - Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning [62.81324245896717]
我々はC-PGと呼ばれる探索非依存のアルゴリズムを導入し、このアルゴリズムは(弱)勾配支配仮定の下でのグローバルな最終点収束を保証する。
制約付き制御問題に対して,我々のアルゴリズムを数値的に検証し,それらを最先端のベースラインと比較する。
論文 参考訳(メタデータ) (2024-07-15T14:54:57Z) - Hierarchical Decision Making Based on Structural Information Principles [19.82391136775341]
本稿では,階層的意思決定のための構造情報原則に基づく新しいフレームワーク,すなわちSIDMを提案する。
本稿では,過去の状態-行動軌跡を処理し,状態と行動の抽象表現を構築する抽象化機構を提案する。
単エージェントシナリオのためのスキルベース学習手法と,多エージェントシナリオのためのロールベースの協調手法を開発し,そのどちらも,パフォーマンス向上のために様々な基礎アルゴリズムを柔軟に統合することができる。
論文 参考訳(メタデータ) (2024-04-15T13:02:00Z) - Rethinking Decision Transformer via Hierarchical Reinforcement Learning [54.3596066989024]
決定変換器(Decision Transformer, DT)は、強化学習(RL)における変換器アーキテクチャの最近の進歩を活用する革新的なアルゴリズムである。
本稿では,階層RLのレンズを用いたシーケンシャル意思決定のための汎用シーケンスモデリングフレームワークを提案する。
DTは、高レベルかつ低レベルなポリシーを選択することで、このフレームワークの特別なケースとして現れ、これらの選択の潜在的な失敗について議論する。
論文 参考訳(メタデータ) (2023-11-01T03:32:13Z) - PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback [106.63518036538163]
我々は、強化学習におけるポリシーアライメントの最近強調された重要な問題に対処するために、新しい統合された二段階最適化ベースのフレームワーク、textsfPARLを提案する。
本フレームワークは, 上向きの目標(逆設計)の分布を, 下向きの最適変数で明示的にパラメータ化することにより, これらの問題に対処する。
その結果,提案したtextsfPARL が RL のアライメントの懸念に対処できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-08-03T18:03:44Z) - Optimal Inspection and Maintenance Planning for Deteriorating Structural
Components through Dynamic Bayesian Networks and Markov Decision Processes [0.0]
部分的に観測可能なマルコフ決定過程(POMDPs)は、不確実な行動結果と観測下での最適制御のための数学的方法論を提供する。
本稿では, 有限地平線POMDPを構造的信頼性の文脈で開発するための定式化について述べる。
その結果,従来の問題設定においても,POMDPのコストは従来に比べて大幅に低減した。
論文 参考訳(メタデータ) (2020-09-09T20:03:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。