論文の概要: Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies
- arxiv url: http://arxiv.org/abs/2608.15938v1
- Date: Sun, 16 Aug 2026 21:49:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.475562
- Title: Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies
- Title(参考訳): ロボットのオープンループ実行を再考する: リアクティブでハイパフォーマンスなポリシーを目指して
- Abstract要約: アクションチャンキングは、ロボット操作のための模倣学習の最近の進歩の鍵となった。
長いオープンループプレフィックスを実行すると、反応性が低下し、エラーを修正するポリシーの能力が制限される。
我々は、長いオープンループの実行は、主に「非マルコフ的な実演」を模倣する短文ポリシーに役立つと論じている。
- 参考スコア(独自算出の注目度): 21.50347781480984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action chunking --- the practice of predicting a sequence of actions and executing a prefix open-loop --- has emerged as a key enabler of recent progress in imitation learning for robotic manipulation. However, executing long open-loop prefixes reduces reactivity, limiting policies' ability to correct for errors. Further, the mechanisms underlying these performance benefits remain poorly understood: prior works cite mitigating compounding errors, absorbing inference latency, or smoothing motions, but provide limited controlled evidence or guidance for preserving reactivity. In this work, we argue that long open-loop execution primarily helps short-context policies imitate "non-Markovian demonstrations". Across four simulation and two real-world tasks, we show that expert non-Markovianity strongly shapes the relationship between task success and open-loop execution horizon. Further, we investigate the impact of compounding errors --- the prevailing explanation for long open-loop execution in prior work --- and find that while they matter, expert non-Markovianity has a much stronger impact in our experimental setting. Finally, we show that when policies are provided with a sufficiently long context, open-loop execution is no longer beneficial and the most reactive, closed-loop policies perform best. While imitation learning has seen great success using long open-loop execution, our findings motivate long-context, reactive policies as a more principled and performant paradigm.
- Abstract(参考訳): アクションチャンキング -- 一連のアクションを予測し、プレフィックスをオープンループで実行するプラクティス -- が、ロボット操作のための模倣学習の最近の進歩の重要な実現要因として登場した。
しかし、長いオープンループプレフィックスを実行すると、反応性が低下し、エラーを修正するポリシーの能力が制限される。
先行研究は、複合的なエラーの軽減、推論遅延の吸収、あるいは動きの平滑化を引用しているが、制限された制御されたエビデンスや反応の保存のためのガイダンスを提供する。
この研究において、長いオープンループの実行は、主に「非マルコフ的な実演」を模倣する短文ポリシーに役立つと論じる。
4つのシミュレーションと2つの実世界のタスクにおいて、専門家非マルコビアン性はタスクの成功とオープンループ実行の地平線との関係を強く形作っていることを示す。
さらに,従来の作業における長時間のオープンループ実行の一般的な説明である複合的エラーの影響について検討し,専門家非マルコビアン性は実験環境においてより強い影響を与えることを発見した。
最後に、ポリシーが十分に長いコンテキストで提供されると、オープンループの実行はもはや利益がなく、最もリアクティブでクローズドループのポリシーが最善であることを示す。
模倣学習は、長いオープンループの実行で大きな成功を収めていますが、私たちの発見は、より原則的でパフォーマンスの高いパラダイムとして、長いコンテキスト、リアクティブポリシーを動機付けています。
関連論文リスト
- Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration [29.089100270702613]
長期的な行動予測は、部分的に観察されたビデオから、将来の動詞の行動の順序を予測することを目的としている。
本稿では,FactCheckを提案する。FactCheckは,クローズドループ "Observe-Plan-Verify" 機構によって実現可能性を向上させる新しいマルチエージェント協調フレームワークである。
本研究は,行動認識,行動予測,行動検証のループを効果的に閉鎖する,実現可能性を考慮した長期的行動予測のための新たなパラダイムを確立する。
論文 参考訳(メタデータ) (2026-06-10T06:25:09Z) - Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation [121.31598641762251]
訓練デモンストレーションの長期分布は、政策学習を妨げる。
Approaching-Phase Augmentation (APA)は、デモを必要とせずに、データリッチなヘッドタスクからデータシャースなテールタスクに知識を転送する。
論文 参考訳(メタデータ) (2026-02-06T09:10:02Z) - Decoupled Q-Chunking [63.864222078287575]
チャンクされた批評家は、個々のアクションではなく、短いアクションシーケンス("チャンク")の価値を見積もって、価値のバックアップをスピードアップします。
私たちの重要な洞察は、批判者のチャンクの長さをポリシーのチャンクの長さから切り離すことで、ポリシーがより短いアクションチャンクを乗り越えることを可能にすることです。
この設計は、オープンループのサブ最適化と長いアクションチャンクに対するアクションチャンクポリシーの学習の難しさを両立させながら、マルチステップ値伝搬の利点を保っている。
論文 参考訳(メタデータ) (2025-12-11T18:52:51Z) - Exploiting Policy Idling for Dexterous Manipulation [19.909895138745345]
本研究では, アイドリング行動の検出可能性を活用して, 探索と政策改善を通知する方法について検討する。
PIP(Pause-induced Perturbations)は,検出したアイドリング状態に摂動を適用したアプローチである。
シミュレーションされた2つのアームタスクにおいて、この単純なアプローチはテスト時間性能を著しく向上させることができる。
論文 参考訳(メタデータ) (2025-08-21T15:52:45Z) - Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent [9.370683025542686]
本稿では,サブタスク境界における障害の検出と修正を行う,アクティブなリプランニングフレームワークを提案する。
AI2-THORシミュレータの実験では,実行障害発生前の意味的および空間的ミスマッチを検出する。
論文 参考訳(メタデータ) (2025-08-15T07:48:51Z) - Action Chunking and Exploratory Data Collection Yield Exponential Improvements in Behavior Cloning for Continuous Control [24.901172157291096]
オープンループにおける行動列の予測と,専門家による実証実験の探索的拡張について検討した。
本研究は,制御理論的安定性をこれらの介入の利点の根底にある重要なメカニズムとして同定した。
理論面では、制御理論レンズが複合誤差の発生に関する詳細な知見を提供することを示した。
論文 参考訳(メタデータ) (2025-07-11T22:36:39Z) - Learning Long-Context Diffusion Policies via Past-Token Prediction [48.86967836229684]
本稿では,過去の情報の保持を明示的に規則化する代替手法を提案する。
本稿では,過去の行動トークンの予測方法を学ぶための補助的タスクである過去トークン予測について紹介する。
4つの実世界と6つのシミュレートされたタスクを対象とした実験により,提案手法は長文拡散政策の性能を3倍に向上し,政策訓練を10倍以上高速化することを示した。
論文 参考訳(メタデータ) (2025-05-14T17:00:47Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。