論文の概要: Measuring the Stability Assumption Behind Action Chunking
- arxiv url: http://arxiv.org/abs/2610.01626v1
- Date: Thu, 01 Oct 2026 12:57:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.139978
- Title: Measuring the Stability Assumption Behind Action Chunking
- Title(参考訳): アクションチャンキングによる安定性推定の測定
- Abstract要約: システムに入ると、アクションエラーに何が起こるかを調べる。
2つの実行体制の下で、どれだけの速さで成長するか、縮小するかを測定します。
安定な状態は稀であるが, 伝播率の低い状態では誤差増幅が一般的である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Action chunking improves the performance of policies learned by behavioural cloning, and several mechanisms have been proposed to explain why, including temporal consistency, horizon reduction, representation learning, and reduced error compounding. We instead study what happens to an action error once it enters the system. At each state, we inject a small action error and measure how fast it grows or shrinks under two execution regimes: open-loop, where the rest of the chunk is replayed without replanning, and closed-loop, where the policy replans after the perturbation. The fitted rate labels each state as contracting, expanding, or unresolved. Across twelve manipulation tasks from three benchmark suites, we find that confidently stable states are rare, while error amplification is common among states whose propagation rate can be resolved. We further find that the measured propagation rate depends strongly on the fitting horizon: amplification is typically front-loaded, so short windows can overestimate longer-horizon propagation. Finally, we train predictors on these labels and find that a state's open-loop regime can be recovered from camera frames and proprioception alone, while its closed-loop propagation is only partially recoverable because it also depends on how the policy acts after the perturbation. These results suggest that error-compounding arguments alone do not provide a complete account of action chunking: neither passive open-loop dynamics nor policy replanning consistently contracts an injected error, and replanning rarely turns open-loop amplification into confident contraction. This suggests that closed-loop reactivity should be trained explicitly, using perturbation- and tree-coverage-oriented training to expose policies to deviations they must recover from, rather than expected to emerge reliably from standard imitation learning.
- Abstract(参考訳): アクションチャンキングは行動的クローニングによって学習されたポリシーの性能を改善し、時間的一貫性、地平線減少、表現学習、誤り合成の低減など、いくつかのメカニズムが提案されている。
その代わりに、システムに入るとアクションエラーに何が起こるかを研究する。
それぞれの状態において、小さなアクションエラーを注入し、オープンループ、残りのチャンクをリプランせずに再生するオープンループ、そしてクローズループ、そして摂動後にポリシーがリプランされる。
適合レートは、各州を契約、拡大、未解決とラベル付けする。
3つのベンチマークスイートからの12の操作タスクのうち、確実に安定な状態は稀であるのに対し、エラー増幅は伝播速度を解消できる状態の間で一般的である。
さらに, 測定された伝搬速度は配向水平線に強く依存しており, 増幅は通常前装荷であり, 短い窓は長軸伝搬を過大評価することができる。
最後に、これらのラベル上で予測器を訓練し、その状態のオープンループ状態がカメラフレームやプロプレセプションのみから回復可能であるのに対して、クローズドループの伝播は、摂動後の政策の動作にも依存するため、部分的に回復可能であることを発見した。
パッシブなオープンループダイナミックスもポリシーの再計画も一貫して注入されたエラーを契約しておらず、オープンループの増幅を確実な収縮に変換することは滅多にない。
このことは、クローズドループの反応性は、標準的な模倣学習から確実に現れることを期待するのではなく、摂動とツリーカバレッジ指向のトレーニングを使用して、彼らが回復しなければならない逸脱に対するポリシーを公開することで、明示的にトレーニングされるべきであることを示している。
関連論文リスト
- Is Online Interaction Necessary for Recovery? A Minimalist Approach to Robust Planning via Perturbation [7.589048964013273]
本稿では,ロボット実行の基準軌跡として,アクションの有限水平列を予測するアクションシーケンス計画に焦点をあてる。
本稿では,既存の実演のみを用いて回復を改善するための簡単なトレーニング手法であるPerturbation-Augmented Recovery Supervision (PARS)を提案する。
論文 参考訳(メタデータ) (2026-09-27T00:25:35Z) - Self-Confirming Superposition Traps in Reinforcement Learning [62.71685993550818]
強化学習はエージェントのポリシーによって選択されたデータに基づいて表現し、その結果のリターンを使って次の選択を導く。
これらのデータに対して表現フィッティングがグローバルに最適である場合でも,このループは低リターンポリシーを維持可能であることを示す。
論文 参考訳(メタデータ) (2026-09-26T21:56:26Z) - Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies [21.50347781480984]
アクションチャンキングは、ロボット操作のための模倣学習の最近の進歩の鍵となった。
長いオープンループプレフィックスを実行すると、反応性が低下し、エラーを修正するポリシーの能力が制限される。
我々は、長いオープンループの実行は、主に「非マルコフ的な実演」を模倣する短文ポリシーに役立つと論じている。
論文 参考訳(メタデータ) (2026-08-16T21:49:07Z) - CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation [15.532709298240215]
視覚言語アクション(VLA)ポリシーは、オープンループアクションチャンクを通じて長距離移動操作を実行する。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
RoboCasa365では、一般的なトレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプランでは27.6%である。
論文 参考訳(メタデータ) (2026-07-29T11:31:33Z) - ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning [5.727608625370017]
ChunkFlowは、チャンクポリシーのためのSeam対応のトレーニング・アンド・エグゼクティブフレームワークである。
各チャンクを凍結し、編集可能で、将来のゾーンに分割し、実行時に決定論的重複を適用し、シームと第1、第2の連続性損失で生の予測を訓練する。
CALVIN、LIBERO、および実際のロボットの実験では、低レイテンシ推論による成功-安定トレードオフが改善されている。
論文 参考訳(メタデータ) (2026-07-14T17:43:25Z) - ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control [54.267632784131415]
ReactiveBFMは、ヒューマノイドのためのリアルタイムループ計画制御フレームワークである。
定期的なプレフィックスサンプリングカリキュラムを通じて、致命的な累積露光バイアスを軽減する。
これは、テキスト条件付きクローズドループ運動の膨大なレパートリーにおいて、前例のない物理的機敏さを示す。
論文 参考訳(メタデータ) (2026-06-29T14:27:27Z) - Adaptive state-action abstractions via rate-distortion [52.25810164390199]
強化学習は、複雑なタスクの単純なバージョンを構築するための複数のテクニックを提供する。
本稿では,抽象化自体によって引き起こされる誤りに匹敵する学習エラーが生じたら,抽象化を洗練させるという原理を提案する。
論文 参考訳(メタデータ) (2026-06-04T13:10:18Z) - Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising [52.237486207964245]
HiARは階層的なデノベーションフレームワークで、従来の世代順を逆転させる。
発声ステップ毎に全てのブロックを因果生成し、各ブロックが常に同じノイズレベルでコンテキストで条件付けされるようにする。
VBench(20世代)では、HiARは比較したすべての方法の中で最高の総合スコアと最低時間ドリフトを達成する。
論文 参考訳(メタデータ) (2026-03-09T17:58:16Z) - On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation [51.56484100374058]
このような情報条件の相互作用パターンを振る舞い依存として定式化する。
これにより、$$-behavioural equivalenceというプローブ相対的な概念と、政治内行動距離が導かれる。
その結果、共通政策変換の下でプローブ条件の挙動分離が保存されない構造条件が明らかになった。
論文 参考訳(メタデータ) (2026-02-24T22:55:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。