論文の概要: HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents
- arxiv url: http://arxiv.org/abs/2608.16447v2
- Date: Mon, 24 Aug 2026 06:44:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.880977
- Title: HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents
- Title(参考訳): HaReCAP: 再帰的大言語モデルエージェントのためのヘイビアアクショングラウンドディング
- Abstract要約: HaReCAPは、ReCAPの低侵襲リーフ接地延長である。
頻繁な葉の判断を監査可能な一段階の葉の反射規則にオフラインでコンパイルする。
ルールが現在の有効なアクションセットの法的アクションを一意に決定できる場合にのみ、LLMコールをスキップする。
- 参考スコア(独自算出の注目度): 1.848752416419065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon embodied tasks require LLM agents to iteratively decompose high-level goals, revise plans in response to environmental feedback, and ground leaf-level subgoals into valid executable actions. Recursive context-management methods such as ReCAP improve planning stability through multi-level task decomposition and parent-node refinement, but still repeatedly invoke the LLM at leaf nodes to ground atomic subtasks into exact valid actions. We refer to this final grounding step as last-mile grounding redundancy, which accumulates into substantial LLM-call and token overhead during long-horizon execution. To mitigate this issue, we propose HaReCAP (Habitual-action Grounded ReCAP), a low-intrusion leaf grounding extension for ReCAP. HaReCAP extracts frequent leaf decisions from successful trajectories and compiles them offline into auditable and abstainable one-step leaf-reflex rules. At runtime, it skips the leaf LLM call only when a rule can uniquely determine a legal action in the current valid-action set; otherwise, it falls back to the original ReCAP. This design avoids repeatedly carrying the full recursive context into the LLM for routine leaf action grounding, while preserving the original recursive control flow. We evaluate HaReCAP on Robotouille and ALFWorld with Qwen3.5-27B as the main model. On tasks solved by both ReCAP and HaReCAP, HaReCAP reduces token consumption by 14.67%, 17.93%, and 20.08% on Robotouille synchronous, Robotouille asynchronous, and ALFWorld, respectively. The results show that HaReCAP can serve as a low-intrusion extension to ReCAP-style recursive context-management frameworks, reducing last-mile grounding redundancy across environments and models on commonly successful trajectories.
- Abstract(参考訳): ロングホライゾン実施タスクでは、LLMエージェントが高水準の目標を反復的に分解し、環境フィードバックに応じて計画を修正し、地上の葉レベルサブゴールを有効な行動に組み込む必要がある。
ReCAPのような再帰的なコンテキスト管理手法は、多段階のタスク分解と親ノードの洗練を通じて計画安定性を改善するが、それでも葉のノードでLLMを繰り返し呼び出して原子サブタスクを正確な動作に導く。
我々は、この最後の接地ステップを、LLMコールとトークンオーバーヘッドに蓄積するラストマイル接地冗長( last-mile groundingundancy)と呼ぶ。
この問題を軽減するために,低侵入性リーフ接地拡張であるHaReCAP(Habitual-action Grounded ReCAP)を提案する。
HaReCAPは、成功した軌道から頻繁な葉の判断を抽出し、それらを監査可能な一段階の葉の反射規則にオフラインにコンパイルする。
実行時にLLMコールをスキップするのは、ルールが現在の有効なアクションセットの法的アクションをユニークに決定できる場合に限られる。
この設計は、元の再帰制御フローを保ちながら、常緑葉行動接地のためのLLMに再帰的コンテキストを繰り返すことを避ける。
ロボットウイルとALFWorldのHaReCAPをQwen3.5-27Bを主モデルとして評価した。
ReCAPとHaReCAPによって解決されたタスクにおいて、HaReCAPはトークンの消費量を14.67%、17.93%、Robotouille synchronous、Robotouille asynchronous、ALFWorldで20.08%削減する。
その結果、HaReCAPはReCAPスタイルの再帰的コンテキスト管理フレームワークの低侵襲拡張として機能し、一般的に成功した軌道上での環境やモデル間の最後の1マイルグラウンドの冗長性を低減できることがわかった。
関連論文リスト
- Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents [50.85250898062218]
大規模言語モデル(LLM)エージェントは、通常、ReActスタイルのプロトコルに従う。
自然な方法は、エージェントが可変長のアクションチャンクを出力することです。
しかし、こうした政策を標準的な強化学習で素直に訓練することは失敗する。
論文 参考訳(メタデータ) (2026-09-02T03:17:11Z) - Offline RL with Hierarchical Action Chunking [0.0]
HiQC(Hierarchical Implicit Q-Chunking)は、高レベル遅延計画と低レベルアクションチャンキングを組み合わせたオフラインゴール条件RLアルゴリズムである。
HiQCは、OGBenchスイートで比較したメソッドの中で、最も高い集計性能を達成している。
論文 参考訳(メタデータ) (2026-07-23T01:48:46Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - When Alignment Isn't Enough: Response-Path Attacks on LLM Agents [18.694498595936718]
悪意のあるリレーは、エージェントの実行前ではなく、生成後に一致したLCM応答を変更することができる。
我々は、この調整後の改ざん脅威を形式化し、エンドツーエンドの整合性なしでは、リレーが下流のメッセージを観察し、抑制し、置き換えることができることを示す。
我々は、この脅威を、複数ラウンドの戦略的書き換え、最小限のセキュリティクリティカルな編集、ステルス復元を行うリレー・タンパリング・アタック(RTA)としてインスタンス化する。
論文 参考訳(メタデータ) (2026-05-04T03:35:17Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning [6.600538353483611]
本稿では,複雑な目標を動的に構築されたエージェントツリー内のより管理可能なサブゴールに分解する階層的タスクプランニング手法を提案する。
ReAcTreeは、さまざまな大きな言語モデルでReActのような強力なタスク計画ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-11-04T09:55:40Z) - ReCAP: Recursive Context-Aware Reasoning and Planning for Large Language Model Agents [61.51091799997476]
ReCAP(Recursive Context-Aware Reasoning and Planning)は,大規模言語モデル(LLM)における推論と計画のためのコンテキストを共有する階層型フレームワークである。
ReCAPは、プラン-アヘッド分解、親プランの構造化された再注入、メモリ効率の高い実行という3つの重要なメカニズムを組み合わせる。
実験により、ReCAPは様々なロングホライゾン推論ベンチマークにおけるサブゴールアライメントと成功率を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-10-27T20:03:55Z) - Tree-Planner: Efficient Close-loop Task Planning with Large Language Models [63.06270302774049]
Tree-Plannerは、大きな言語モデルでタスクプランニングを3つの異なるフェーズに再構成する。
Tree-Plannerは高い効率を維持しながら最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-10-12T17:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。