論文の概要: Hierarchical Reinforcement Learning with Stable Temporal Abstraction for Language Model Agents
- arxiv url: http://arxiv.org/abs/2610.05473v1
- Date: Sun, 04 Oct 2026 19:25:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:35:14.855672
- Title: Hierarchical Reinforcement Learning with Stable Temporal Abstraction for Language Model Agents
- Title(参考訳): 言語モデルエージェントのための安定な時間的抽象化を用いた階層的強化学習
- Abstract要約: 階層的強化学習は、永続的なサブゴールを取り巻く原始的な行動を整理することによって、長期の水平制御を改善する。
最近の階層型言語エージェントは、アクション実行からサブゴール計画を明確に分離することで、これらの利点を対話的なタスクにもたらす。
しかしながら、明示的な階層は、結果として生じる時間的抽象がどれほど安定であるかをそれ自体が決定しない。
- 参考スコア(独自算出の注目度): 11.62792424787974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hierarchical reinforcement learning improves long-horizon control by organizing primitive actions around persistent subgoals and assigning credit at multiple temporal scales. Recent hierarchical language agents bring these benefits to interactive tasks by explicitly separating subgoal planning from action execution. We observe, however, that an explicit hierarchy does not by itself determine how stable the resulting temporal abstraction is: the learned boundary policy may replace the subgoal almost every turn, making it effectively transient, or retain a subgoal after it has stopped being appropriate. We call this temporal abstraction instability. We propose Stable Temporal Abstraction via Constrained Optimization (STAC), a constrained boundary-policy optimization method that represents premature replanning and stale persistence as constraint costs. STAC applies the resulting Lagrangian costs only to the sampled boundary decision, leaving the underlying algorithm's rewards, critic targets, subgoal advantages, and primitive-action advantages unchanged. Across two backbones and two benchmarks, STAC improves success over a strong hierarchical baseline by $8.1$ and $7.9$ points on ALFWorld and WebShop with Qwen3-0.6B, and by $23.5$ and $15.8$ points with Llama-3.2-1B-Instruct.
- Abstract(参考訳): 階層的強化学習は、永続的なサブゴールに関する原始的な行動を整理し、複数の時間的スケールでクレジットを割り当てることで、長期制御を改善する。
最近の階層型言語エージェントは、アクション実行からサブゴール計画を明確に分離することで、これらの利点を対話的なタスクにもたらす。
しかしながら、明示的な階層は、結果として生じる時間的抽象がどれほど安定であるかをそれ自体が決定しない。学習された境界ポリシーは、ほぼすべてのターンでサブゴールを置き換えることができ、効果的に過渡的であるか、適切でなくなった後にサブゴールを保持することができる。
これを時間的抽象的不安定(temporal abstract instaability)と呼ぶ。
本稿では,制約付き最適化による安定な時間的抽象化(STAC)を提案する。
STACはサンプリングされた境界決定にのみラグランジアンコストを適用し、基礎となるアルゴリズムの報酬、批評家の目標、サブゴールの利点、プリミティブ・アクションの利点は変わらない。
2つのバックボーンと2つのベンチマークで、STACは強力な階層的ベースラインよりも、Qwen3-0.6BのALFWorldとWebShopで8.1ドルと7.9ドル、Llama-3.2-1Bの23.5ドルと15.8ドルで成功している。
関連論文リスト
- Diffusion Subgoal Planning for Long-Horizon Offline Goal-Conditioned Reinforcement Learning [61.648564263928485]
textbfDSPは、ゴール条件付きサブゴールに対する誘導的生成推論として高レベルの計画を行う。
textbfDSPは、様々なナビゲーションや操作タスクにおいて、以前のメソッドよりも優れています。
論文 参考訳(メタデータ) (2026-09-28T08:22:49Z) - PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning [49.24483784910263]
我々は、強化学習における階層的制御を可能にする後継尺度である切替後継尺度を導入する。
後継策の切り替えは,その構造を保ちながら,古典的後継措置から自然に生じることを示す。
FB$-Switchは非階層的ベースラインよりも改善されている。
論文 参考訳(メタデータ) (2026-05-13T08:58:33Z) - Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents [26.613956143957548]
textitValuePlannerは階層的な認知アーキテクチャで、低レベルのアクション実行から高レベルの値スケジューリングを分離する。
我々の研究は、内在的価値をブリッジする構造的なアプローチと、自律的エージェントに対する接地行動を提供する。
論文 参考訳(メタデータ) (2026-04-30T10:43:55Z) - SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning [21.113678610046453]
我々は、堅牢で物理的に具体化された計画のための3段階統合フレームワークであるSVLL(Staged Vision-Language Learning)を提案する。
最初の2段階では、SVLLは時間的推論から空間的グラウンドを分離し、シーケンシャルなアクション履歴を導入する前に、堅牢な視覚的依存を確立する。
最終段階では、標準の直接選好最適化(DPO)の重要な制限、すなわち純粋に相対的な性質を識別し、勝利と敗戦の選好ギャップのみを最適化する。
論文 参考訳(メタデータ) (2026-03-12T05:35:29Z) - HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents [36.77027704958893]
HiPERは階層的計画実行(Hierarchical Plan-Execute RL)フレームワークで、高レベルの計画と低レベルの実行を分離する。
HiPER は ALFWorld で97.4%、Qwen2.5-7B-Instruct で WebShop で83.3% を達成している。
論文 参考訳(メタデータ) (2026-02-18T03:31:34Z) - Enhancing Hierarchical Reinforcement Learning through Change Point Detection in Time Series [2.5895291094206825]
本稿では、自己教師型トランスフォーマーベースの変更点検出(CPD)モジュールをOption-Criticフレームワークに統合する新しいアーキテクチャを提案する。
CPDモジュールは、内在的な信号から派生した擬似ラベルを用いて、外部監視なしで環境ダイナミクスの潜伏シフトを推測する訓練を行う。
フォー・ルームとピンボール・タスクの実験では、PD誘導剤は加速収束、累積リターンの向上、オプション特殊化の大幅な改善を示す。
論文 参考訳(メタデータ) (2025-10-28T21:34:23Z) - Temporal Context Aggregation Network for Temporal Action Proposal
Refinement [93.03730692520999]
時間的行動提案生成はビデオ理解分野において難しいが重要な課題である。
現在の方法はまだ不正確な時間境界と検索に使用される劣った自信に苦しんでいます。
TCANet は、「ローカルおよびグローバル」な時間的コンテキストアグリゲーションを通じて、高品質のアクション提案を生成するために提案します。
論文 参考訳(メタデータ) (2021-03-24T12:34:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。