論文の概要: Fast Plans, Faithful Actions: Closing the Planning-Execution Gap in Hierarchical Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.30833v1
- Date: Fri, 25 Sep 2026 05:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.235392
- Title: Fast Plans, Faithful Actions: Closing the Planning-Execution Gap in Hierarchical Vision-Language-Action Models
- Title(参考訳): ファストプランと忠実な行動--階層的視覚-言語-行動モデルにおける計画-実行ギャップの閉鎖
- Abstract要約: 階層型視覚言語アクション(VLA)システムは、高レベルな視覚言語プランナーと、継続的なアクションを生成する低レベルなアクションエキスパートで構成される。
このようなシステムのひとつとして,$_0.5$から適応したウェイポイント階層パイプラインについて検討し,いずれの要件も満たされていないことを確認した。
- 参考スコア(独自算出の注目度): 23.784860376632242
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hierarchical vision-language-action (VLA) systems consist of a high-level vision-language planner and a low-level action expert that generates continuous actions. This hierarchical design has practical value only if the planner can generate plans fast enough to meet real-time control requirements, and the resulting plans actually contribute to the generation of action. We study one such system, a waypoint hierarchy pipeline adapted from $π_{0.5}$, and find that neither requirement is satisfied. This baseline relies on token-level autoregressive decoding (Token-AR) to generate a waypoint plan, requiring 57 very expensive vision-language model (VLM) forward passes. However, we find that erasing the waypoint endpoints has little effect on task success. Two findings reveal the misalignment of planner-executor: the planner generates outputs at an excessively fine granularity, and the executor underuses plans as a control condition. We address the latency issue with waypoint-aligned block-autoregressive decoding (Block-AR), and plan underuse issue with normalized goal modulation (NGM), a layer-wise goal path constrained by phase gating and anti-shortcut training so that the waypoint influences action generation maintaining other signals. Our method reduces the maximum number of VLM forward passes from 57 to 8 on LIBERO, including one prefix prefill, and achieves an $8.7\times$ reduction in planning latency on a Rokae dual-arm robot. With normalized goal modulation and anti-shortcut training, Block-AR's success rate on LIBERO-Long increases from 91.0% to 96.2%, while its average success rate across the four suites increases from 95.85% to 98.45%. On three bimanual tasks with this robot, success rates remain comparable across methods.
- Abstract(参考訳): 階層型視覚言語アクション(VLA)システムは、高レベルな視覚言語プランナーと、継続的なアクションを生成する低レベルなアクションエキスパートで構成される。
この階層的な設計は、プランナーがリアルタイムの制御要件を満たす十分な速度で計画を作成することができ、その結果の計画が実際に行動の発生に寄与する場合に限り、実用的な価値を持つ。
π_{0.5}$から適応した経路点階層パイプラインであるそのようなシステムについて検討し、いずれの要件も満たされていないことを確認する。
このベースラインはトークンレベルの自己回帰デコーディング(Token-AR)に依存しており、57の非常に高価な視覚言語モデル(VLM)前方パスを必要とする。
しかし、ウェイポイントエンドポイントの消去はタスクの成功にはほとんど影響しないことがわかった。
プランナーは過度に細かい粒度で出力を生成し、実行者は制御条件としてプランをアンダーユースする。
位相ゲーティングと反ショートカットトレーニングによって制約されたレイヤワイドな目標パスである正規化目標変調(NGM)によるプランのアンダーユース問題を、ウェイポイントが他の信号を保持する動作生成に影響を与えるように、ウェイポイント整列ブロック自己回帰復号(Block-AR)を用いて、遅延問題に対処する。
本手法は,1つのプレフィルを含むLIBERO上でのVLM前方通過の最大回数を57から8に削減し,Rokaeデュアルアームロボットの計画遅延を8.7\times$で削減する。
目標の正規化と反ショートカットトレーニングにより、LIBERO-LongでのBlock-ARの成功率は91.0%から96.2%に上昇し、4つのスイートの平均成功率は95.85%から98.45%に増加した。
このロボットによる3つのバイマニュアルタスクでは、成功率はメソッド間で比較できる。
関連論文リスト
- LePlanner: An Iterative Amortized Controller For World Models [0.0]
本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
論文 参考訳(メタデータ) (2026-09-12T10:01:21Z) - Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents [50.85250898062218]
大規模言語モデル(LLM)エージェントは、通常、ReActスタイルのプロトコルに従う。
自然な方法は、エージェントが可変長のアクションチャンクを出力することです。
しかし、こうした政策を標準的な強化学習で素直に訓練することは失敗する。
論文 参考訳(メタデータ) (2026-09-02T03:17:11Z) - EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents [56.25120535601186]
視覚言語アクション(VLA)モデルは、視覚観察と言語指示を直接ロボットアクションにマッピングする。
本稿では,各スキル決定を実行提案として扱うフレームワークであるEmbodiedSkillsを提案する。
共有可能スキルインタフェースは、ハイレベルスキル選択、バウンドローレベルVLA実行、ポストアクション検証を接続する。
論文 参考訳(メタデータ) (2026-09-01T14:14:47Z) - Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model [10.925063608741844]
生成計画立案者が軌道に復号する単一計画トークンにより、計画全体を担っているVLAの代表者について検討する。
ナビゲーションコマンドの線形復調性と,凍結したネイティブプランナとの軌道互換性の2つの信号を測定する。
論文 参考訳(メタデータ) (2026-08-07T16:02:34Z) - Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning [8.807543162466557]
身体的なタスクプランニングは、エージェントに自然言語の命令を物理的なシーンで実行可能なアクションのシーケンスに変換するように要求する。
近年のプロンプトベースおよび強化学習プランナーは、流動的なアクションテキストを生成するが、ターゲットの世界において、生成したプランが有効であるという安価な決定論的チェックは欠落している。
データ構築、検証、報酬設計のための共有インターフェースとして、1つのBDDLが機能することを示します。
論文 参考訳(メタデータ) (2026-06-30T07:37:21Z) - PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models [101.44987067974999]
Coarse-to-Controlは計画実行VLAで、アクション・ツー・ケンの領域で計画を導入する。
アクション・ツー・ケイン・プランニングは直接アクション・ジェネレーションよりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-05T10:01:37Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation [1.2832858109291982]
大型言語モデル(LLM)は、古典的なシンボリックな手法と共に実行可能なプランナーとして機能する。
本稿では,オープンソースの計画ドメイン定義言語(PDDL)シミュレーションエンジンであるPyPDDLEngineを紹介する。
102国際計画コンペティション(IPC)Blocksworldインスタンスに対して,一様180秒の予算で4つのアプローチを評価する。
論文 参考訳(メタデータ) (2026-03-06T09:16:49Z) - HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents [36.77027704958893]
HiPERは階層的計画実行(Hierarchical Plan-Execute RL)フレームワークで、高レベルの計画と低レベルの実行を分離する。
HiPER は ALFWorld で97.4%、Qwen2.5-7B-Instruct で WebShop で83.3% を達成している。
論文 参考訳(メタデータ) (2026-02-18T03:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。