論文の概要: VLA-Corrector: Stage-Aware Observable State Understanding for Prompt-Based Closed-Loop Recovery of Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2609.06508v1
- Date: Sun, 06 Sep 2026 09:50:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:26:31.938111
- Title: VLA-Corrector: Stage-Aware Observable State Understanding for Prompt-Based Closed-Loop Recovery of Vision-Language-Action Policies
- Title(参考訳): VLA-Corrector: プロンプトに基づく視覚・言語・アクションポリシーのクローズドループ回復のためのステージアウェア・オブザーバブル状態理解
- Abstract要約: VLA(Vision-Language-Action)ポリシーによる長距離ロボット操作は、実行時の逸脱に対して脆弱である。
本稿では,固定VLAポリシのクローズループ修正を可能にする,ステージアウェアの故障検証とPromptリカバリフレームワークを提案する。
- 参考スコア(独自算出の注目度): 12.698552476812855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon robot manipulation with Vision-Language-Action (VLA) policies remains vulnerable to execution-time deviations, as final task success provides little information for diagnosing and correcting failures caused by action noise, object displacement, or goal misalignment. We introduce a stage-aware failure verification and Prompt Recovery framework that enables closed-loop correction of a fixed VLA policy without parameter updates or privileged simulator states. The framework introduces an observable-history-based Learned Verifier that jointly estimates manipulation progress and execution risk by temporally modeling multi-view visual observations, proprioceptive states, and executed actions. To provide interpretable task understanding, we represent manipulation execution through semantic progress stages, including approach, alignment, grasp, transport, and placement, and identify stage-specific failure patterns. Upon detecting abnormal execution, the framework preserves the original instruction and generates a stage-conditioned recovery prompt, allowing the same frozen VLA policy to produce corrective actions. Extensive multi-round evaluations on LIBERO and LIBERO Plus demonstrate that the proposed approach substantially improves closed-loop reliability under diverse perturbations. Without access to privileged object or goal coordinates, the Learned Verifier achieves recovery performance close to that of the privileged rule-based verifier in the evaluated settings. These results show that observable visual-proprioceptive-action history is sufficient to infer latent task states and enable practical failure recovery for existing VLA policies.
- Abstract(参考訳): VLA (Long-Horizon Robot Operation with Vision-Language-Action) Policy (VLA) は、動作ノイズ、物体の変位、目標のずれによる障害の診断と修正のための情報が少ないため、実行時の逸脱に対して脆弱なままである。
本稿では,パラメータ更新や特権的シミュレータ状態のない固定VLAポリシーのクローズループ修正を可能にする,ステージアウェアの故障検証とPromptリカバリフレームワークを提案する。
このフレームワークは観測可能な歴史ベースのLearninged Verifierを導入し、多視点の視覚観察、受容状態、実行された動作を時間的にモデル化することで、操作の進捗と実行リスクを共同で推定する。
解釈可能なタスク理解を実現するために、アプローチ、アライメント、グリップ、トランスポート、配置を含むセマンティック・プログレス・ステージによる操作の実行を表現し、ステージ固有の障害パターンを識別する。
異常な実行を検出すると、フレームワークは元の命令を保存し、ステージ条件の回復プロンプトを生成し、同じ凍結したVLAポリシーが修正アクションを生成する。
LIBERO と LIBERO Plus の多層的評価により,提案手法は多様な摂動下での閉ループ信頼性を大幅に向上することを示した。
Learned Verifierは、特権オブジェクトやゴール座標にアクセスせずに、評価された設定において特権ルールベースの検証器のそれに近いリカバリ性能を達成する。
これらの結果から,既存のVLAポリシに対して,潜在タスク状態を推測し,事実上の障害回復を可能にするには,可観測的視覚受容行動履歴が十分であることが示唆された。
関連論文リスト
- ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency [23.6841289206823]
視覚言語アクション(VLA)ポリシーは、ロボット操作において強力なパフォーマンスを達成する。
それらは、視覚的な観察、ロボットの状態、実行中の動作の時間的アライメントを損なうランタイム障害に対して脆弱である。
本稿では,ActFoveaについて紹介する。ActFoveaは,VLAポリシーの再トレーニングや修正を行うことなく,そのような障害を検出し緩和する,プラグアンドプレイのセーフガードフレームワークである。
論文 参考訳(メタデータ) (2026-07-31T08:47:57Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies [29.471598488144277]
ロングホライゾンのロボット操作は、物理的に実現不可能な遷移、接触による障害、実行中の効果的な自己補正の欠如に非常に敏感である。
本稿では,PhysReflect-VLAを提案する。PhysReflect-VLAは,クローズドループ制御パイプラインにおいて,VLAポリシーを物理的実現可能性評価と構造化自己回帰により拡張する,プラグアンドプレイ実行時信頼性フレームワークである。
論文 参考訳(メタデータ) (2026-06-25T15:18:10Z) - Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring [35.34120853605602]
textbf-and-Seekは、粗い教師付き学習問題としてVLA障害検出を定式化するフレームワークである。
我々は、LIBERO、VLABench、および3つの代表的なVLAポリシーをまたいだ現実世界のロボットプラットフォームについて、Hie-and-Seekの評価を行った。
論文 参考訳(メタデータ) (2026-05-29T04:40:12Z) - ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control [7.018221049093963]
視覚-言語-アクション(VLA)モデルは、視覚観察と自然言語命令を連続的なアクションシーケンスにマッピングできる汎用ロボットコントローラとして登場した。
ReconVLAは、不確実性誘導および故障認識制御信号を生成する信頼性の高いコンフォメーションモデルである。
以上の結果から, 共形行動予測は失敗予測を継続的に改善し, 破滅的エラーを低減し, 基礎となるVLAを調整・修正することなく信頼度を調整できることが示唆された。
論文 参考訳(メタデータ) (2026-04-17T20:20:43Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - Learning Affordances at Inference-Time for Vision-Language-Action Models [50.93181349331096]
ロボット工学において、VLA(Vision-Language-Action Model)は複雑な制御タスクを解くための有望な道を提供する。
本稿では,VLAの低レベルポリシーを過去の経験を条件とした高レベルVLMに接続するLITEN(Learning from Inference-Time Execution)を紹介する。
提案手法は,低レベルVLAの計画の生成と実行を行う推論フェーズと,その結果を反映した評価フェーズとを反復する。
論文 参考訳(メタデータ) (2025-10-22T16:43:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。