論文の概要: Commit While Futures Agree: Consequence-Aware Adaptive Action Chunking for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2610.07949v1
- Date: Tue, 06 Oct 2026 08:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.89612
- Title: Commit While Futures Agree: Consequence-Aware Adaptive Action Chunking for Robot Manipulation
- Title(参考訳): ロボットマニピュレーションのためのコンシークエンス・アウェア・アダプティブ・アクション・チャンク
- Abstract要約: アクションチャンキングポリシは、マルチステップ制御シーケンスを予測しますが、再計画する前に、予測されるアクションチャンクのどのくらいをコミットすべきなのでしょうか?
本稿では、予測時フレームワークであるConsequence-Aware Adaptive Action Chunking (CA$3$C)を提案する。
- 参考スコア(独自算出の注目度): 25.084703288229203
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action-chunking policies predict multi-step control sequences, but a fundamental question remains: how much of a predicted action chunk should be committed before replanning? Existing systems typically execute a fixed-length prefix, implicitly assuming that the same execution horizon remains trustworthy across states. Some adaptive methods estimate this horizon from the similarity or stability of predicted actions. However, different actions may lead to the same successful outcome, whereas similar actions can produce different futures, suggesting that commitment should be determined by agreement among imagined futures rather than by similarity in action space. To this end, we propose Consequence-Aware Adaptive Action Chunking (CA$^3$C), an inference-time framework built on a simple principle: commit while imagined futures agree, and replan when they diverge. Without modifying or retraining the base policy, CA$^3$C uses an action-conditioned world model to imagine the future consequences of multiple candidate action chunks under the same sampling noise. Using these imagined consequences, we formulate execution-horizon estimation as a Bayesian change-point inference problem and select the execution candidate through future consensus. Across multiple simulation benchmarks and real-world robot manipulation tasks, CA$^3$C consistently improves diverse action-chunking policies, achieving up to a 71.8% relative reduction in failure rate over the corresponding base policies.
- Abstract(参考訳): アクションチャンキングポリシーは、マルチステップ制御シーケンスを予測するが、基本的な疑問が残る。
既存のシステムは一般に固定長のプレフィックスを実行し、同じ実行地平線が状態間で信頼できると暗黙的に仮定する。
いくつかの適応的手法は、予測された行動の類似性や安定性からこの地平線を推定する。
しかし、異なる行動が同じ結果をもたらす可能性があるのに対して、類似した行動は異なる未来を生み出す可能性があり、コミットメントはアクション空間における類似性ではなく、想像された未来間の合意によって決定されるべきであることを示唆している。
この目的のために,提案するConsequence-Aware Adaptive Action Chunking (CA$^3$C) は単純な原理に基づく推論時フレームワークである。
CA$3$Cは基本方針を変更したり再訓練することなく、同じサンプリングノイズの下で複数の候補アクションチャンクの将来の結果を想像するためにアクション条件付き世界モデルを使用する。
これらの予測結果を用いて,ベイズ変点推定問題として実行-水平推定を定式化し,将来のコンセンサスを通じて実行候補を選択する。
複数のシミュレーションベンチマークと実世界のロボット操作タスクを通して、CA$3$Cは多様なアクションチャンキングポリシーを一貫して改善し、対応する基本ポリシーよりも71.8%の失敗率を達成している。
関連論文リスト
- Don't Throw Away the Tail: Action Upcycling for Policy Acceleration [43.910503270915825]
Action Upcyclingはトレーニング不要のアルゴリズムで、ポリシーが破棄されるアクションを再利用する。
政策コールを1.2-1.7倍に減らし、成功率を損なわない。
それは無視できるコストで、どんな政策にも当てはまる。
論文 参考訳(メタデータ) (2026-09-28T11:13:18Z) - Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Dynamic Execution Commitment of Vision-Language-Action Models [21.647844049489535]
本稿では,動的実行コミットメントを自己特定的プレフィックス検証問題として再編成する適応アクションアクセプタンス機構であるA3を紹介する。
A3はまず、グループサンプリングを介して行動の軌跡的なコンセンサススコアを計算し、次に代表ドラフトを選択し、下流検証を優先する。
さまざまなVLAモデルとベンチマークの実験では、A3は手動の水平調整の必要性を排除し、実行と推論のスループットのトレードオフを優れたものにしている。
論文 参考訳(メタデータ) (2026-05-12T05:52:58Z) - Decoupled Q-Chunking [63.864222078287575]
チャンクされた批評家は、個々のアクションではなく、短いアクションシーケンス("チャンク")の価値を見積もって、価値のバックアップをスピードアップします。
私たちの重要な洞察は、批判者のチャンクの長さをポリシーのチャンクの長さから切り離すことで、ポリシーがより短いアクションチャンクを乗り越えることを可能にすることです。
この設計は、オープンループのサブ最適化と長いアクションチャンクに対するアクションチャンクポリシーの学習の難しさを両立させながら、マルチステップ値伝搬の利点を保っている。
論文 参考訳(メタデータ) (2025-12-11T18:52:51Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。