論文の概要: ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency
- arxiv url: http://arxiv.org/abs/2607.29169v1
- Date: Fri, 31 Jul 2026 08:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.655749
- Title: ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency
- Title(参考訳): ActFovea: 時空間視覚アクション一貫性によるVLAポリシのランタイム保護
- Abstract要約: 視覚言語アクション(VLA)ポリシーは、ロボット操作において強力なパフォーマンスを達成する。
それらは、視覚的な観察、ロボットの状態、実行中の動作の時間的アライメントを損なうランタイム障害に対して脆弱である。
本稿では,ActFoveaについて紹介する。ActFoveaは,VLAポリシーの再トレーニングや修正を行うことなく,そのような障害を検出し緩和する,プラグアンドプレイのセーフガードフレームワークである。
- 参考スコア(独自算出の注目度): 23.6841289206823
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) policies achieve strong performance in robotic manipulation but remain vulnerable to runtime disturbances that break the temporal alignment among visual observations, robot states, and executed actions. We introduce ActFovea, a plug-and-play safeguarding framework that detects and mitigates such failures without retraining or modifying the underlying VLA policy. ActFovea uses robot kinematics, proprioceptive states, and recent actions to construct action-conditioned foveated regions that retain contact-relevant areas and predicted motion corridors while suppressing task-irrelevant visual content. It detects runtime risks by evaluating whether visual motion and observation freshness remain consistent with geometric, proprioceptive, and action transitions. For recoverable disturbances, ActFovea constructs disturbance-specific candidate observations and accepts a recovery only after verifying the resulting action chunk. When stale or replayed observations make reliable recovery impossible, it invokes a bounded safe-failure procedure. In closed-loop evaluations of $π_0$ across multiple LIBERO suites, ActFovea increases success under localized visual overlays from 49.3\% to 90.3\%, closing 93.7\% of the gap to clean performance. It further improves success under action drift and visual delay by 7.0 and 9.8 percentage points, respectively, while preserving clean-task performance. Under frozen-observation replay, ActFovea triggers timely safe failure in all trials, with no unprotected failures. These results demonstrate that spatiotemporal visual-action consistency provides an effective basis for runtime safeguarding of VLA policies.
- Abstract(参考訳): 視覚言語アクション(VLA)ポリシーは、ロボット操作において強力なパフォーマンスを達成するが、視覚観察、ロボット状態、実行中の動作の時間的アライメントを損なうランタイム障害に弱いままである。
本稿では,ActFoveaについて紹介する。ActFoveaは,VLAポリシーの再トレーニングや修正を行うことなく,そのような障害を検出し緩和する,プラグアンドプレイのセーフガードフレームワークである。
ActFoveaは、ロボットキネマティクス、プロプリセプティブステート、および最近のアクションを使用して、接触関連領域を保持し、タスク非関連視覚内容を抑制しながら、動き回廊を予測するアクション条件付きファーベイド領域を構築する。
視覚的な動きと観察の鮮度が、幾何学的、受容的、行動遷移と一致しているかどうかを評価することによって、実行時のリスクを検出する。
回復可能な障害のために、ActFoveaは障害特異的な候補観測を構築し、結果のアクションチャンクを検証する後にのみリカバリを受け入れる。
安定化または再生された観察が信頼性の高い回復を不可能にすると、境界付き安全障害手順を起動する。
複数のLIBEROスイートにわたるπ_0$のクローズドループ評価では、ActFoveaは局所的な視覚オーバーレイで49.3\%から90.3\%に増加し、ギャップの93.7\%をクリアパフォーマンスに閉じる。
さらに、アクションドリフトと視覚遅延をそれぞれ7.0と9.8のパーセンテージで改善し、クリーンタスクのパフォーマンスを保っている。
凍結保存リプレイでは、ActFoveaはすべてのトライアルでタイムリーに安全な障害を引き起こし、未保護の障害は発生しない。
これらの結果から,時空間的視覚行動整合性は,VLAポリシーの実行時保護に有効な基盤となることが示された。
関連論文リスト
- VLA-Corrector: Stage-Aware Observable State Understanding for Prompt-Based Closed-Loop Recovery of Vision-Language-Action Policies [12.698552476812855]
VLA(Vision-Language-Action)ポリシーによる長距離ロボット操作は、実行時の逸脱に対して脆弱である。
本稿では,固定VLAポリシのクローズループ修正を可能にする,ステージアウェアの故障検証とPromptリカバリフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-06T09:50:30Z) - ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation [9.820724216368543]
ChainVLAは、連続したクエリを共同実行状態にチェーンするポリシーである。
Progress Contextは、リカレントなWorking Stateとスパースなイベントメモリを組み合わせることで、観察から派生したタスクの進捗を実行する。
Motion Tailは、前回の予測が実行されない継続を状態構築と行動生成に供給する。
論文 参考訳(メタデータ) (2026-08-03T14:48:20Z) - CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation [15.532709298240215]
視覚言語アクション(VLA)ポリシーは、オープンループアクションチャンクを通じて長距離移動操作を実行する。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
RoboCasa365では、一般的なトレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプランでは27.6%である。
論文 参考訳(メタデータ) (2026-07-29T11:31:33Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking [6.465600276213322]
VLA(Vision-Language-Action)ポリシーは、視覚的標的を効果的に追跡することができるが、建物、植生、道路沿いの物体が視線を塞ぐと、その性能は劣化することが多い。
本稿では,空間認識型VLAモデルCosFly-VLAについて述べる。
OpenVLAとは対照的に、CosFly-VLA-0.8Bはオープンループ平均変位誤差(ADE)を外見テストで34.1%、目に見えないテストで35.3%削減する。
論文 参考訳(メタデータ) (2026-07-16T13:52:08Z) - TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation [2.9231828959903474]
VLA(Vision-Language-Action)モデルは、短軸性能が強いにもかかわらず、長軸操作タスクにおいて体系的に失敗する。
この失敗は、現在のリアクティブ実行設定でコンテキスト長だけを拡張することで解決されないことを示す。
HELMは3つのコンポーネントでこれらの欠陥に対処するモデルに依存しないフレームワークである。
論文 参考訳(メタデータ) (2026-04-20T19:57:35Z) - Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning [7.445072780282545]
提案するRewind-ILは,生成アクションチャンク模倣ポリシーのためのトレーニングフリーオンラインセーフガードフレームワークである。
Rewind-ILは、TIDE(Temporal Inter-chunk Discrepancy Estimate)に基づくゼロショット故障検知器と、状態再起動機構を結合する。
オンラインのRewind-ILは、重複するアクションチャンクの自己整合性を監視し、チェックポイントライブラリと類似性を追跡し、失敗すると、実行を最新の検証された安全な状態に戻す。
論文 参考訳(メタデータ) (2026-04-17T20:41:14Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。