論文の概要: Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
- arxiv url: http://arxiv.org/abs/2608.03483v1
- Date: Tue, 04 Aug 2026 11:21:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.155184
- Title: Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
- Title(参考訳): 継続・再検討 : 適応的水平実行のためのベルヌーイ継続政策学習
- Authors: Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo,
- Abstract要約: Bernoulli-Continuation Policy (BCP)は、適応的な水平線実行のための軽量なプラグアンドプレイフレームワークである。
LingBot-VLAを基本方針とするRoboTwin 2.0では、BCPは13の低いタスクにおいて平均成功率を+11.08%向上させる。
本物のロボットでは、BCPは成功を74%から92%、そして2つの操作タスクで44%から84%に引き上げる。
- 参考スコア(独自算出の注目度): 38.8233224696416
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing chunk-based Vision-Language-Action (VLA) models execute a fixed number of actions (i.e., execution horizon) before replanning, turning replanning into a task-agnostic periodic schedule that is independent of task progress. As a result, when no replanning boundary falls before a critical manipulation stage, it is executed from a stale chunk rather than a freshly replanned one. To address this limitation, we propose Bernoulli-Continuation Policy (BCP), a lightweight, plug-and-play framework for adaptive horizon execution that keeps the base VLA frozen. Given a fixed-length action chunk, its continuation head decomposes execution-horizon selection into a sequence of continue-or-replan decisions, which imposes an ordinal, prefix-sharing inductive bias over candidate horizons rather than treating them as independent classes. Since the optimal horizon for each chunk is not observable, we train this head with reinforcement learning from trajectory-level outcomes and introduce a Replanning-Efficiency Reward that jointly rewards task success and efficient VLA usage, discouraging the policy from collapsing to unnecessarily short horizons. On RoboTwin 2.0 with LingBot-VLA as the base policy, BCP improves the average success rate by +11.08% on 13 low-success tasks and from 89.88% to 93.94% (+4.06%) across all 50 tasks. Although trained only under the Clean setting, BCP generalizes to the Randomized setting, raising the average success rate by +4.06%. It also transfers to a different base policy $π_{0.5}$, achieving a better result on LIBERO (+1.7%) and, notably, on the harder LIBERO-PRO (+6.8%). On a real robot, BCP lifts success from 74% to 92% and from 44% to 84% on two manipulation tasks. Meanwhile, its negligible overhead, combined with higher success, makes BCP's overall runtime even lower than the fixed-horizon baselines.
- Abstract(参考訳): 既存のチャンクベースのVision-Language-Action(VLA)モデルは、再計画する前に一定の数のアクション(すなわち実行地平線)を実行する。
その結果、再計画境界が臨界操作ステージの前に落下しない場合には、再計画境界ではなく、古いチャンクから実行される。
この制限に対処するため,Bernulli-Continuation Policy (BCP) を提案する。
一定の長さのアクションチャンクが与えられた場合、その継続ヘッドは実行-水平選択を一連の継続-または再計画決定に分解する。
各チャンクの最適地平線は観測不可能であるため、このヘッドを軌道レベルの結果から強化学習して訓練し、タスクの成功と効率的なVLA利用を共同で報奨するReplanning-Efficiency Rewardを導入し、ポリシーの崩壊から不要な短地平線への回避を図る。
LingBot-VLA を基本方針とする RoboTwin 2.0 では、BCP は 13 の低いタスクにおいて平均成功率 +11.08% を 89.88% から 93.94% (+4.06%) に改善している。
クリーンな設定でしか訓練されないが、BCPはランダム化された設定に一般化し、平均成功率は+4.06%上昇する。
また、異なる基本方針である$π_{0.5}$に移行し、LIBERO(+1.7%)、特により硬いLIBERO-PRO(+6.8%)でより良い結果を得る。
本物のロボットでは、BCPは成功を74%から92%、そして2つの操作タスクで44%から84%に引き上げる。
一方、その無視可能なオーバーヘッドと高い成功が組み合わさって、BCP全体のランタイムは固定水平ベースラインよりも低くなる。
関連論文リスト
- Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models [32.14222486099161]
VLA(Vision-Language-Action)ポリシーは、強力な汎用的な操作先を提供するが、厳密で接触に富んだアセンブリでは失敗することが多い。
凍結VLA基本方針に対する残留強化学習において,この障害モードを示す。
本稿では,各サブタスクのスパース成功報酬をオフライン推定フォレスト値で加算することにより,ハンドオフ品質を最適化するResidual RLを提案する。
論文 参考訳(メタデータ) (2026-07-17T21:00:28Z) - Dynamic Execution Horizon Prediction for Chunk-based Robot Policies [29.482987292744568]
アクションチャンキングは、ポリシーが一連のアクションを予測し、一度にひとつのステップを実行するのではなく、一定数のアクションを実行する、現代のロボットポリシーの標準設計となっている。
実際には、実行の地平線は通常経験的なチューニングによって選ばれ、タスク依存度が高い。
オンライン強化学習を用いて,軽量な実行-水平予測分岐を訓練する有効な手法である動的実行-水平予測(DEHP)を提案する。
論文 参考訳(メタデータ) (2026-06-09T19:58:31Z) - PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking [37.9894332388921]
PACEは、予測チャンク自身からオンラインで実行地平線を選択する、トレーニング不要なテスト時間実行方法である。
PACEは予測されたアクションチャンクのみを使用するため、プラグアンドプレイであり、ポリシー内部への再トレーニングやアクセスは不要である。
我々はシミュレーションと実ロボット設定の両方で大規模な評価によってPACEを検証する。
論文 参考訳(メタデータ) (2026-05-30T05:11:06Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies [36.91260665881213]
ビジョン・ランゲージ・アクション(VLA)ポリシーは、アクションを模倣するように訓練されている。
凍結特性の軽量線形プローブを用いてモンテカルロの結果目標を復元する。
ゲインは普遍的ではなく、追加の推論計算を必要とするが、基礎となる発見はクリーンである。
論文 参考訳(メタデータ) (2026-05-27T14:23:29Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents [36.77027704958893]
HiPERは階層的計画実行(Hierarchical Plan-Execute RL)フレームワークで、高レベルの計画と低レベルの実行を分離する。
HiPER は ALFWorld で97.4%、Qwen2.5-7B-Instruct で WebShop で83.3% を達成している。
論文 参考訳(メタデータ) (2026-02-18T03:31:34Z) - Acting in Delayed Environments with Non-Stationary Markov Policies [57.52103323209643]
本稿では,MDPにおける学習と計画のためのフレームワークについて紹介する。
実行が遅れると、元の状態空間における決定論的マルコフポリシーは最大報酬を得るのに十分であるが、非定常である必要があることを証明します。
我々は、状態拡張に頼らずに遅延実行タスクを解く非定常Q学習スタイルのモデルベースアルゴリズムを考案した。
論文 参考訳(メタデータ) (2021-01-28T13:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。