論文の概要: Offline RL with Hierarchical Action Chunking
- arxiv url: http://arxiv.org/abs/2607.20834v1
- Date: Thu, 23 Jul 2026 01:48:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.259177
- Title: Offline RL with Hierarchical Action Chunking
- Title(参考訳): 階層型アクションチャンクを用いたオフラインRL
- Authors: Ahad Jawaid,
- Abstract要約: HiQC(Hierarchical Implicit Q-Chunking)は、高レベル遅延計画と低レベルアクションチャンキングを組み合わせたオフラインゴール条件RLアルゴリズムである。
HiQCは、OGBenchスイートで比較したメソッドの中で、最も高い集計性能を達成している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline goal-conditioned reinforcement learning (RL) holds the promise of learning general-purpose policies from static datasets. However, scaling these methods to long-horizon tasks remains a challenge due to the curse of horizon, where value estimation errors can compound through long chains of bootstrapped Bellman backups. Existing hierarchical approaches mitigate this by decomposing tasks into subgoals, yet they often rely on low-level controllers that suffer from myopic execution and biased value estimates. In this work, we propose Hierarchical Implicit Q-Chunking (HiQC), an offline goal-conditioned RL algorithm that combines high-level latent planning with low-level action chunking. By conditioning the low-level critic on temporally extended action sequences, HiQC enables unbiased k-step value backups, compressing the horizon at both the planning and execution levels. We theoretically demonstrate that this dual decomposition results in a tighter bound on value error under a bounded per-backup error model compared to standard hierarchy or flat chunking alone. Empirically, HiQC achieves the highest aggregate performance among the compared methods on the OGBench suite, with its largest gains on long-horizon navigation tasks such as humanoid-giant.
- Abstract(参考訳): オフライン目標条件強化学習(RL)は、静的データセットから汎用ポリシーを学ぶという約束を果たす。
しかし、これらのメソッドを長い水平タスクにスケールすることは水平方向の呪いのために依然として課題であり、そこでは、値推定エラーがブートストラップされたベルマンバックアップの長い連鎖を通して複雑になる。
既存の階層的なアプローチは、タスクをサブゴールに分解することで、これを緩和します。
本研究では,高レベル遅延計画と低レベルアクションチャンキングを組み合わせたオフライン目標条件付きRLアルゴリズムHiQCを提案する。
低レベルの批判者が時間的に拡張されたアクションシーケンスを条件にすることで、HiQCは非バイアスのkステップ値バックアップを可能にし、計画レベルと実行レベルの両方で水平線を圧縮する。
理論的には、この双対分解は、標準階層や平坦なチャンキングのみと比較して、境界付き/バックアップ誤差モデルの下での値誤差の厳密化をもたらす。
経験的に、HiQCはOGBenchスイートで比較した手法の中で最も高い総合的な性能を達成し、ヒューマノイド・ジャイアントのような長距離ナビゲーションタスクで最大の利益を上げている。
関連論文リスト
- Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning [16.15046948057208]
我々は,実行前に遠隔目標を適応的に洗練する完全オフライン目標条件強化学習フレームワークを提案する。
OGBenchの実験は、提案された改善と停止機構を検証し、いくつかの長期的タスクに対してかなりの効果を示した。
論文 参考訳(メタデータ) (2026-05-27T08:17:01Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents [36.77027704958893]
HiPERは階層的計画実行(Hierarchical Plan-Execute RL)フレームワークで、高レベルの計画と低レベルの実行を分離する。
HiPER は ALFWorld で97.4%、Qwen2.5-7B-Instruct で WebShop で83.3% を達成している。
論文 参考訳(メタデータ) (2026-02-18T03:31:34Z) - Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL [25.40364932514488]
本稿では,自己回帰シーケンスモデルとして階層的意思決定を再構築する新しい枠組みを提案する。
CoGHPは、強いオフラインベースラインを一貫して上回り、長期タスクのパフォーマンスを改善している。
論文 参考訳(メタデータ) (2026-02-03T11:11:03Z) - ReCAP: Recursive Context-Aware Reasoning and Planning for Large Language Model Agents [61.51091799997476]
ReCAP(Recursive Context-Aware Reasoning and Planning)は,大規模言語モデル(LLM)における推論と計画のためのコンテキストを共有する階層型フレームワークである。
ReCAPは、プラン-アヘッド分解、親プランの構造化された再注入、メモリ効率の高い実行という3つの重要なメカニズムを組み合わせる。
実験により、ReCAPは様々なロングホライゾン推論ベンチマークにおけるサブゴールアライメントと成功率を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-10-27T20:03:55Z) - Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning [5.274804664403783]
SSE(Strict Subgoal Execution)は、グラフベースの階層的RLフレームワークで、単一ステップのサブゴアル到達性を強制する。
SSE は既存の目標条件付き RL および階層型 RL アプローチを効率と成功率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-26T06:35:42Z) - PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-Performer [47.924941959320996]
我々はPlanDQと呼ばれるオフラインRL用に設計された階層型プランナを提案する。
PlanDQはD-Conductorという名前の拡散型プランナーを高レベルに組み込んでおり、サブゴールを通じて低レベル政策を導く。
低レベルでは、これらのサブゴールを達成するためにQ-Performerと呼ばれるQ-ラーニングベースのアプローチを使用しました。
論文 参考訳(メタデータ) (2024-06-10T20:59:53Z) - HIQL: Offline Goal-Conditioned RL with Latent States as Actions [81.67963770528753]
オフラインデータからゴール条件付きRLの階層的アルゴリズムを提案する。
この階層的な分解によって、推定値関数のノイズに頑健になることを示す。
提案手法は,従来の手法を巧みに操り,高次元画像観察にスケールできるとともに,アクションフリーなデータを容易に利用することができる。
論文 参考訳(メタデータ) (2023-07-22T00:17:36Z) - Conservative Q-Learning for Offline Reinforcement Learning [106.05582605650932]
CQLは既存のオフラインRLメソッドよりも大幅に優れており、多くの場合、ファイナルリターンの2~5倍高いポリシを学習しています。
理論的には、CQLは現在のポリシーの価値の低いバウンダリを生成し、理論的改善保証を伴う政策学習手順に組み込むことができることを示す。
論文 参考訳(メタデータ) (2020-06-08T17:53:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。