論文の概要: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- arxiv url: http://arxiv.org/abs/2607.01804v1
- Date: Thu, 02 Jul 2026 07:18:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.719178
- Title: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- Title(参考訳): VLA-Corrector:適応行動水平の軽量検出と補正推論
- Abstract要約: VLA-Correctorは、アクションチャンクされたビジョン・ランゲージ・アクションポリシーのための軽量な修正推論フレームワークである。
VLAのバックボーンを再訓練することなく、異なるVLAモデルに統合することができる。
これは、実行とポリシー呼び出し頻度の間の静的な地平線によって課されるトレードオフを緩和する。
- 参考スコア(独自算出の注目度): 40.99993238069073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) foundation models have recently achieved strong progress in embodied intelligence. To reduce policy-call frequency while preserving temporal coherence, most generative policies adopt an action chunk mechanism, executing multiple future actions in an open-loop manner under a fixed action horizon. However, this "predict-then-blindly-execute" paradigm sacrifices closed-loop reactivity: in contact-rich physical interactions, even small local perturbations can rapidly amplify within the open-loop blind spot, leading to compounding errors and ultimately task failure. To address this limitation, we propose VLA-Corrector, a lightweight corrective inference framework for action-chunked VLA policies. Without modifying the backbone policy weights, VLA-Corrector introduces a lightweight Latent-space Vision Monitor (LVM) that continuously compares predicted and actual visual feature evolution, enabling online detection of visual dynamics deviations. Once persistent deviation is detected, the system triggers a truncation event, discards the remaining stale actions, and invokes corrective replanning via Online Gradient Guidance (OGG). The detect-and-correct mechanism of VLA-Corrector naturally induces an event-triggered adaptive action horizon: it preserves long-horizon execution when the current chunk remains reliable, and invokes short-horizon corrective replanning when execution begins to drift. In doing so, VLA-Corrector mitigates the trade-off imposed by static horizons between execution robustness and policy-call frequency. It can be integrated into different VLA models without further retraining the VLA backbone, interrupting compounding errors while preserving much of the efficiency benefit of action chunking and substantially improving robustness in long-horizon, contact-rich robotic manipulation tasks.
- Abstract(参考訳): VLA(Vision-Language-Action)基盤モデルは近年,インボディードインテリジェンスにおいて大きな進歩を遂げている。
時間的コヒーレンスを保ちつつポリシー呼出頻度を低減するため、ほとんどの生成ポリシーはアクションチャンク機構を採用し、固定されたアクション水平の下で複数の将来のアクションをオープンループ方式で実行する。
接触に富んだ物理的相互作用では、小さな局所摂動でさえ、オープンループの盲点内で急速に増幅され、エラーが複雑化し、最終的にタスクが失敗する。
この制限に対処するために、アクションチャンクされたVLAポリシーのための軽量な修正型推論フレームワークであるVLA-Correctorを提案する。
バックボーンポリシーの重みを変更することなく、VLA-Correctorは、予測と実際の視覚的特徴の進化を継続的に比較し、視覚力学の偏差のオンライン検出を可能にする軽量のラテントスペースビジョンモニター(LVM)を導入している。
永続的な偏差が検出されると、システムはトランケーションイベントをトリガーし、残りの古いアクションを破棄し、オンライングラディエントガイダンス(OGG)を介して修正リプランングを起動する。
VLA-Correctorの検知と補正機構は、イベントトリガーによる適応的な動作水平線を自然に誘導する。
VLA-Correctorは、実行の堅牢性とポリシー呼び出し頻度の間の静的な地平線によって課されるトレードオフを緩和する。
VLAのバックボーンをさらに再トレーニングすることなく、異なるVLAモデルに統合することができ、複雑なエラーを中断し、アクションチャンキングの効率性の多くを保ち、長時間水平でコンタクトに富んだロボット操作タスクの堅牢性を大幅に向上させることができる。
関連論文リスト
- VLA-Corrector: Stage-Aware Observable State Understanding for Prompt-Based Closed-Loop Recovery of Vision-Language-Action Policies [12.698552476812855]
VLA(Vision-Language-Action)ポリシーによる長距離ロボット操作は、実行時の逸脱に対して脆弱である。
本稿では,固定VLAポリシのクローズループ修正を可能にする,ステージアウェアの故障検証とPromptリカバリフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-06T09:50:30Z) - Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs [4.792917095787488]
アクションチャンキングは、現代のVision-Language-Action(VLA)フレームワークにおける標準的な実行戦略である。
短いチャンクは頻繁な推論を必要とするが、長いチャンクは新しく観測された状態と不一致となることがある。
我々は,この制限を,アクションエキスパートの内部的クロスアテンションダイナミクスに基づく適応的アクションチャンキングアプローチで解決する。
論文 参考訳(メタデータ) (2026-09-01T08:38:16Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation [13.705916129860071]
拡散に基づくビジュモータポリシーは、しばしばチャンク間不連続を示し、障害物認識実行の明確なメカニズムを欠いている。
本稿では,軌道最適化と拡散ポリシを統合した非同期動作生成フレームワークであるLAGO Policyを提案する。
論文 参考訳(メタデータ) (2026-06-16T14:33:51Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Jump-Start Reinforcement Learning with Vision-Language-Action Regularization [1.2599533416395767]
強化学習(RL)は、ロボット操作のための高周波閉ループ制御を可能にする。
現在の制限は、高速かつ正確な操作において直接の使用を妨げる。
探索と学習効率を向上させるために,VLAJS(Vision-Language-Action Jump-Starting)を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:17:54Z) - Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA [27.06233662271175]
提案するSV-VLA(Speculative Verification for VLA Control)は,効率的なオープンループ長期計画と軽量なクローズドループオンライン検証を組み合わせたフレームワークである。
実験の結果、SV-VLAはチャンク予測の効率と閉ループ制御の堅牢性を組み合わせることで、動的環境における効率よく信頼性の高いVLAベースの制御を可能にする。
論文 参考訳(メタデータ) (2026-04-03T10:55:51Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - Learning Native Continuation for Action Chunking Flow Policies [40.56048312294812]
アクションチャンキングにより、VLA(Vision Language Action)モデルがリアルタイムで実行されるが、単純なチャンク実行はしばしばチャンク境界で不連続を示す。
本稿では,アクションチャンクフローに基づくVLAポリシーのトレーニング時間継続手法であるLegotoを提案する。
レガートはよりスムーズな軌道を発生し、実行中にスムーズなマルチモーダルスイッチングを減少させる。
論文 参考訳(メタデータ) (2026-02-13T14:56:06Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Leave No Observation Behind: Real-time Correction for VLA Action Chunks [36.13271200613596]
非同期アクションチャンク補正(A2C2)は、制御ステップ毎に実行される軽量なリアルタイムチャンク補正ヘッドである。
A2C2は,高容量チャンキングポリシーをリアルタイム制御に展開するための効果的なプラグイン機構であることを示す。
論文 参考訳(メタデータ) (2025-09-27T10:07:49Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。