論文の概要: Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs
- arxiv url: http://arxiv.org/abs/2609.00908v2
- Date: Fri, 04 Sep 2026 08:35:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.485955
- Title: Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs
- Title(参考訳): 停止するタイミングを知る:VLAの内部交叉運動による適応的行動チャンキング
- Authors: Runze Xu, Xiaolong Shan, Shuang Dai, Yu Wang, Jincheng Yu,
- Abstract要約: アクションチャンキングは、現代のVision-Language-Action(VLA)フレームワークにおける標準的な実行戦略である。
短いチャンクは頻繁な推論を必要とするが、長いチャンクは新しく観測された状態と不一致となることがある。
我々は,この制限を,アクションエキスパートの内部的クロスアテンションダイナミクスに基づく適応的アクションチャンキングアプローチで解決する。
- 参考スコア(独自算出の注目度): 4.792917095787488
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action chunking is a standard execution strategy in modern Vision-Language-Action (VLA) frameworks, but fixed execution horizons impose a trade-off between efficiency and accuracy. Short chunks require frequent inference and may cause oscillatory behavior, whereas long chunks can become misaligned with newly observed states. We address this limitation with an adaptive action chunking approach based on internal cross-attention dynamics in the action expert. We observe that, as the prediction horizon extends, action-to-observation cross-attention becomes increasingly dispersed and its entropy rises toward a plateau. This pattern is associated with higher action prediction error and provides an online signal that the current observation offers limited grounding for further open-loop execution. Based on this observation, we introduce a training-free truncation mechanism that detects sustained high-entropy plateaus and dynamically selects the execution horizon during inference. The method uses attention weights already computed by the policy and introduces negligible additional overhead. Evaluations on $π_{0.5}$ and X-VLA across RoboTwin 2.0, LIBERO, and three real-world manipulation tasks show improved average task success over fixed-horizon and adaptive chunking baselines, while preserving efficient closed-loop control. These results show that cross-attention dynamics can provide a practical internal signal for adaptive action execution in VLAs.
- Abstract(参考訳): アクションチャンキングは、現代のVision-Language-Action(VLA)フレームワークにおける標準的な実行戦略であるが、固定された実行の地平線は、効率と精度のトレードオフを課している。
短いチャンクは頻繁な推論を必要とし、振動行動を引き起こすが、長いチャンクは新しく観測された状態と不一致となる。
我々は,この制限を,アクションエキスパートの内部的クロスアテンションダイナミクスに基づく適応的アクションチャンキングアプローチで解決する。
予測の地平線が広がるにつれて, 行動と観測の相互注意がますます分散し, エントロピーが台地に向かって上昇するのが観察される。
このパターンはより高い動作予測誤差と関連付けられており、現在の観測結果がさらなるオープンループ実行に限定的な基盤を提供するというオンライン信号を提供する。
この観測に基づいて,持続する高エントロピー高原を検知し,推論中の実行地平線を動的に選択する,トレーニング不要のトランケーション機構を導入する。
この方法は、すでにポリシーによって計算されている注意重みを使用し、無視できる追加オーバーヘッドを導入する。
RoboTwin 2.0、LIBERO、および3つの実世界の操作タスクに対する$π_{0.5}$およびX-VLAの評価は、効率的なクローズドループ制御を保ちながら、固定水平および適応チャンキングベースラインに対する平均タスク成功率の向上を示している。
これらの結果から, クロスアテンションダイナミクスは, VLAにおける適応動作実行のための実用的な内部信号を与えることができることがわかった。
関連論文リスト
- FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity [26.591374083905336]
サンプル化された動作チャンクの実行地平線を適応的に調整し、応答性と計算効率のバランスをとる。
チャンクサンプリングの固定予算の下では,乱れによる累積可能性低下を最小化する実行地平線が空間的注意の増大とともに減少することを示す。
論文 参考訳(メタデータ) (2026-07-06T07:22:04Z) - VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon [40.99993238069073]
VLA-Correctorは、アクションチャンクされたビジョン・ランゲージ・アクションポリシーのための軽量な修正推論フレームワークである。
VLAのバックボーンを再訓練することなく、異なるVLAモデルに統合することができる。
これは、実行とポリシー呼び出し頻度の間の静的な地平線によって課されるトレードオフを緩和する。
論文 参考訳(メタデータ) (2026-07-02T07:18:53Z) - Dynamic Execution Horizon Prediction for Chunk-based Robot Policies [29.482987292744568]
アクションチャンキングは、ポリシーが一連のアクションを予測し、一度にひとつのステップを実行するのではなく、一定数のアクションを実行する、現代のロボットポリシーの標準設計となっている。
実際には、実行の地平線は通常経験的なチューニングによって選ばれ、タスク依存度が高い。
オンライン強化学習を用いて,軽量な実行-水平予測分岐を訓練する有効な手法である動的実行-水平予測(DEHP)を提案する。
論文 参考訳(メタデータ) (2026-06-09T19:58:31Z) - FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy [75.32174422881958]
FocalPolicyは、周波数局所的なチャンキングとAnchoredフローマッチングを組み合わせたビジュモータポリシーである。
本稿では,近位行動における時間領域のアライメントを監督する,近位複合目標を提案する。
フローマッチング学習において,信号の伝搬一貫性を目標とした局所的アンカーサンプリングを設計する。
論文 参考訳(メタデータ) (2026-05-15T13:27:55Z) - MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation [4.439585594082787]
実世界の微視的操作、特に双方向操作では、低レイテンシ制御と安定した視覚的位置決めが必要となる。
ACTのようなアクションチャンキングポリシーは、低レイテンシの実行とデータ効率を可能にするが、空間的一貫性を明示することなく、密集した視覚的特徴に依存している。
安定な2次元アテンションポイントを抽出し,時間的アライメントロスを伴う将来のアテンションシーケンスを共同で予測する多段階空間アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2026-05-01T07:35:15Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - VLA Knows Its Limits [27.43938890325202]
実行地平線の変化は、大幅なパフォーマンスの逸脱につながることを示す。
本稿では,予測された各アクションチャンクの実行地平線を動的に推定する最初のテスト時間手法であるAutoHorizonを提案する。
論文 参考訳(メタデータ) (2026-02-24T23:48:48Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。